Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
En este artículo, obtendrá información sobre las ventajas y funcionalidades de la traducción con Azure Voz en Foundry Tools. El servicio Voz admite la conversión de voz a voz en varios idiomas en tiempo real y la traducción de voz a texto de secuencias de audio.
Mediante el SDK de Voz o la CLI de Voz, puede dar a las aplicaciones, herramientas y dispositivos acceso a las transcripciones originales y a los resultados de las traducciones para el audio proporcionado. A medida que se detecta la voz, se van devolviendo resultados provisionales de transcripción y traducción. Asimismo, los resultados finales pueden convertirse en voz sintetizada.
Para obtener una lista de los idiomas admitidos para la traducción de voz, consulte Compatibilidad con idiomas y voces.
Sugerencia
Vaya a Speech Studio para probar y traducir rápidamente la voz en otros idiomas de su elección con baja latencia.
Características principales
Entre las características principales de la traducción de voz se incluyen las siguientes:
Traducción de voz en tiempo real (estándar)
La traducción de voz usa una API estándar para la traducción en tiempo real con salida de texto, salida de audio o ambas.
Use la API de traducción de voz estándar cuando desee enviar una secuencia de audio de entrada en un idioma de origen especificado y devolver texto traducido, voz sintetizada o ambos en el idioma de destino especificado.
Intérprete en directo
Live Interpreter forma parte de la traducción de voz en tiempo real y proporciona una experiencia más completa que la API estándar para escenarios conversacionales. Identifica continuamente el idioma que se habla sin necesidad de establecer un idioma de entrada y ofrece una traducción de voz a voz de baja latencia en una voz natural que conserva el estilo y el tono del hablante.
Live Interpreter incluye funcionalidades avanzadas como:
- Idioma de entrada no especificado. Reciba audio en una amplia gama de idiomas sin establecer el idioma de entrada esperado.
- Conmutación de idioma. Controle varios idiomas hablados en la misma sesión sin reiniciar.
- Trae tu propia voz (BYO voice). Use voz personal con Live Interpreter para la traducción de voz a voz en tiempo real.
- Transcripción en el idioma de destino. La transcripción del idioma de origen aún no está disponible.
Algunos casos de uso de Live Interpreter incluyen:
- Intérprete de viajes. Cree soluciones que permitan a los clientes traducir audio de entrada hacia y desde idiomas locales mientras viajan.
- Reuniones empresariales. Ayude a los participantes que hablan diferentes idiomas a comunicarse de forma natural en una sesión.
Para obtener una lista de los idiomas de entrada (origen) admitidos, consulte Conversión de voz en idiomas de texto. Para ver los idiomas de salida (destino) admitidos, consulte la tabla Traducir a idioma de texto en los idiomas de traducción de voz.
Para obtener más información, consulte la guía paso a paso de traducción de voz, el código de ejemplo de Live Interpreter y los ejemplos de traducción de voz en GitHub.
Traducción de varios idiomas de destino
En escenarios en los que desea resultados en varios idiomas, el servicio Voz le ofrece directamente la posibilidad de traducir el idioma de entrada en dos idiomas de destino. Esto le permite recibir dos salidas y compartir estas traducciones a una audiencia más amplia en una sola llamada API. Si se requieren más idiomas de salida, puede crear un recurso de varios servicios o usar servicios de traducción independientes.
Si necesita traducción en más de dos idiomas de destino, debe crear un recurso Foundry o usar servicios de traducción independientes para otros idiomas aparte del segundo. Si decide llamar al servicio de traducción de voz con un recurso multiservicio, tenga en cuenta que las tarifas de traducción se aplican a cada idioma adicional al segundo, basado en el número de caracteres traducidos.
Para calcular la tarifa de traducción aplicada, consulte Azure Translator en Precios de Foundry Tools.
Precios de traducción de varios idiomas de destino
Es importante tener en cuenta que el servicio de traducción de voz funciona en tiempo real y los resultados de voz intermedios se traducen para generar resultados de traducción intermedios. Por lo tanto, el volumen de traducción real es mayor que los tokens del audio de entrada. Se le cobra por la transcripción de voz a texto y la traducción de texto para cada idioma de destino.
Por ejemplo, supongamos que desea traducciones de texto de un archivo de audio de una hora a tres idiomas de destino. Si la transcripción inicial de voz a texto contiene 10 000 caracteres, es posible que se le cobren 2,80 USD.
Advertencia
Los precios de este ejemplo solo tienen fines ilustrativos. Consulte los precios de Azure Speech y los precios de Translator para obtener la información de precios más actualizada.
El precio del ejemplo anterior de 2,80 USD se ha calculado mediante la combinación de los costos de traducción de texto y transcripción de voz a texto. Aquí se muestra cómo se ha realizado el cálculo:
- El precio de lista de traducción de voz es de 2,50 USD por hora y cubre hasta 2 idiomas de destino. El precio se usa como ejemplo de cómo calcular los costos. Consulte Standard>Speech translation>Standard en la tabla de precios de Azure Speech para obtener la información de precios más up-to-date.
- El costo de la traducción al tercer idioma es de 30 céntimos en este ejemplo. El precio de lista de traducción es de 10 USD por millón de caracteres. Dado que el archivo de audio contiene 10 000 caracteres, el costo de traducción es de 10 USD * 10 000 / 1 000 000 * 3 = 0,3 USD. El número "3" de esta ecuación representa un coeficiente de ponderación del tráfico intermedio, que podría variar en función de los idiomas implicados. El precio se usa como ejemplo de cómo calcular los costos. Consulte Standard>Standard translation>Text translation en la tabla de precios del Traductor para obtener la información de precios más actualizada.
Comienza
Como primer paso, pruebe con el artículo de Inicio rápido de traducción de voz. El servicio de traducción de voz está disponible con el SDK de Voz y la CLI de Voz.
Encontrará ejemplos de conversión de voz a texto y traducción de Speech SDK en GitHub. En estos ejemplos se tratan escenarios comunes como la lectura de audio de un archivo o flujo, el reconocimiento y traducción únicos y continuos, y el trabajo con modelos personalizados.
Pasos siguientes
- Pruebe con el artículo de Inicio rápido de traducción de voz.
- Instale el SDK de Voz.
- Instale la CLI de Voz.