Qu’est-ce qu’Azure Speech ?

Azure Speech dans Foundry Tools fournit la reconnaissance vocale, la synthèse vocale et d’autres fonctionnalités via une ressource Microsoft Foundry. Vous pouvez transcrire la parole en texte avec une précision élevée, produire des voix de synthèse vocale naturelle, traduire l’audio parlé et mener des conversations vocales en direct avec IA.

Capture d’écran des vignettes mettant en évidence certaines fonctionnalités d’Azure Speech.

Vous pouvez créer des voix personnalisées, ajouter des mots spécifiques à votre vocabulaire de base ou créer vos propres modèles. Exécutez Azure Speech n’importe où, dans le cloud ou en périphérie dans les conteneurs. Activez vos applications, outils et appareils pour la reconnaissance vocale à l’aide de l’interface CLI Speech, du SDK Speech et des API REST.

Azure Speech est disponible pour de nombreuses langues, régions et points de prix.

Scénarios

Voici quelques scénarios courants de Custom Speech :

  • Sous-titrage : découvrez comment synchroniser les sous-titres avec le contenu audio en entrée, appliquer des filtres de vulgarité, obtenir des résultats partiels, appliquer des personnalisations et identifier les langues parlées pour les scénarios multilingues.
  • Création de contenu audio : utilisez des voix neuronales pour rendre les interactions avec les chatbots et les agents vocaux plus naturels et attrayants, convertissez des textes numériques tels que des livres électroniques en livres audio et améliorez les systèmes de navigation en voiture.
  • Centre d’appels : transcrire des appels en temps réel ou traiter un lot d’appels, réactez des informations personnelles et extrayez des insights tels que des sentiments pour vous aider à utiliser votre cas d’usage du centre d’appels.
  • Apprentissage de la langue : fournir des commentaires d’évaluation de la prononciation aux apprenants de langue, prendre en charge la transcription en temps réel pour les conversations d’apprentissage à distance, et lire à voix haute des supports d’enseignement avec des voix neuronales.
  • Voice Live : créez des interfaces conversationnelles naturelles et humaines pour les applications et les expériences. La fonctionnalité Voice Live fournit une interaction rapide et fiable entre un humain et une implémentation d’agent.
  • Traduction vocale : générez une traduction vocale de haute qualité en temps réel ou générez automatiquement des vidéos traduites dans un large éventail de langues.
  • Création d'avatars vidéo : créez des vidéos d'avatars parlants synthétiques et de haute qualité pour diverses applications en temps réel et par lots, tout en respectant les pratiques d'IA responsables.

Microsoft utilise Azure Speech pour de nombreux scénarios, tels que le sous-titrage dans Microsoft Teams, la dictée dans Microsoft Office 365 et la lecture à haute voix dans le navigateur Microsoft Edge.

Capture d’écran montrant les logos des produits Microsoft qui utilisent Azure Speech.

Capacités

Les sections suivantes résument les fonctionnalités Azure Speech et fournissent des liens pour plus d’informations.

Reconnaissance vocale

Utilisez la reconnaissance vocale pour convertir l’audio en texte. Choisissez parmi :

Le modèle de base peut ne pas suffire si l’audio contient du bruit ambiant ou inclut le jargon spécifique au secteur et au domaine. Dans ce cas, vous pouvez créer et entraîner des modèles vocaux personnalisés avec des données acoustiques, linguistiques et de prononciation. Les modèles vocaux personnalisés sont privés et peuvent offrir un avantage concurrentiel.

Synthèse vocale

Avec le texte en synthèse vocale, vous pouvez convertir du texte d’entrée en synthèse vocale humaine. Utilisez des voix neuronales, qui sont des voix humaines alimentées par des réseaux neuronaux profonds. Utilisez le langage SSML (Speech Synthesis Markup Language) pour affiner la hauteur, la prononciation, la fréquence de parole, le volume, etc.

Les options vocales sont les suivantes :

  • Voix standard : vous pouvez choisir parmi des voix prédéfinies très naturelles. Vérifiez les exemples vocaux standard dans la galerie de voix et déterminez la voix appropriée pour vos besoins professionnels.
  • Voix personnalisée : vous pouvez créer une voix personnalisée reconnaissable et unique à votre marque ou produit. Les voix personnalisées sont privées et peuvent offrir un avantage concurrentiel. Vérifiez les exemples vocaux personnalisés.

Avatar de synthèse vocale

L’avatar de synthèse vocale convertit le texte en vidéo numérique d’un humain photoréaliste parlant avec une voix naturelle. La vidéo peut être synthétisée de manière asynchrone ou en temps réel. Vous pouvez créer des applications intégrées à un avatar de synthèse vocale via une API ou utiliser un avatar de synthèse vocale dans Foundry pour créer du contenu vidéo sans coder. La fonctionnalité vous permet de fournir des vidéos d’avatar parlant synthétique de haute qualité pour différentes applications tout en respectant les pratiques d’IA responsables.

Vous pouvez choisir parmi une gamme de voix standard pour l’avatar. La prise en charge linguistique pour l'avatar de synthèse vocale est la même que la prise en charge linguistique de la synthèse vocale.

Traduction vocale

La traduction vocale permet à vos applications, outils et appareils d’effectuer de la traduction multilingue en temps réel de la parole. Utilisez cette fonctionnalité pour la traduction de discours à discours et de discours à texte.

Synthèse vocale LLM (préversion)

Profitez d'un modèle de langage étendu (LLM) amélioré dans LLM speech. Cette fonctionnalité prend actuellement en charge les tâches suivantes :

  • transcribe: convertir l’audio préenregistré en texte.
  • translate: convertissez l’audio préenregistré en texte dans une langue cible spécifiée.

Le modèle de reconnaissance vocale amélioré LLM offre une meilleure qualité, une compréhension contextuelle approfondie, une prise en charge multilingue et des fonctionnalités d’optimisation des invites. La reconnaissance vocale LLM partage les mêmes performances d’inférence ultra-rapide que la transcription rapide. Les cas d’usage incluent la génération de sous-titres et de sous-titres à partir de fichiers audio, la synthèse des notes de réunion, l’assistance aux agents du centre d’appels, la transcription des messages vocaux, etc.

Identification de la langue

L’identification linguistique vous aide à identifier les langues parlées dans l’audio en les comparant à une liste de langues prises en charge. Utilisez l’identification linguistique par elle-même, avec la reconnaissance vocale ou la traduction vocale.

Évaluation de la prononciation

L’évaluation de la prononciation évalue la prononciation de la parole et fournit des indications aux orateurs sur la précision et la maîtrise du discours. En utilisant l’évaluation de la prononciation, les apprenants de langue peuvent pratiquer, obtenir des commentaires instantanés et améliorer leur prononciation afin qu’ils puissent parler et présenter avec confiance.

Livraison et présence

Vous pouvez déployer des fonctionnalités Azure Speech dans le cloud ou localement.

En utilisant des conteneurs, vous pouvez rapprocher le service de vos données pour des raisons de conformité, de sécurité ou d’autres raisons opérationnelles.

Le déploiement Azure Speech dans des clouds souverains est disponible pour certaines entités gouvernementales et leurs partenaires. Par exemple, le cloud Azure Government est disponible pour les organismes publics américains et leurs partenaires. Le cloud Azure géré par 21Vianet est disponible pour les organisations qui ont une présence commerciale en Chine. Pour plus d’informations, consultez le service Speech dans les clouds souverains.

Diagramme montrant où Azure Speech peut être déployé et accessible.

Intégration d’Azure Speech dans votre application

Speech Studio est un ensemble d’outils basés sur l’interface utilisateur pour créer et intégrer des fonctionnalités à partir d’Azure Speech dans vos applications. Vous créez des projets dans Speech Studio à l’aide d’une approche sans code. Vous pouvez ensuite référencer ces ressources dans vos applications à l’aide des éléments suivants :

  • SDK Speech Ce Kit de développement logiciel (SDK) expose de nombreuses fonctionnalités Azure Speech que vous pouvez utiliser pour développer des applications avec reconnaissance vocale. Le kit de développement logiciel (SDK) Speech est disponible dans de nombreux langages de programmation et sur toutes les plateformes.

  • CLI vocale. Avec cet outil en ligne de commande, vous pouvez utiliser Azure Speech sans avoir à écrire de code. La plupart des fonctionnalités fournies dans le SDK Speech sont disponibles dans l’interface CLI Speech, et certaines fonctionnalités avancées et personnalisations sont simplifiées dans l’interface CLI Speech.

  • API REST. Dans certains cas, vous ne pouvez pas ou ne devez pas utiliser le Kit de développement logiciel (SDK) Speech. Dans ce cas, vous pouvez utiliser des API REST pour accéder à Azure Speech. Par exemple, utilisez des API REST pour la transcription par lots.

Exemples de code

L’exemple de code pour Azure Speech est disponible sur GitHub. Ces exemples couvrent des scénarios courants tels que la lecture du signal audio d’un fichier ou d’un flux, la reconnaissance continue et ponctuelle, et l’utilisation de modèles personnalisés. Pour voir les exemples SDK et REST, suivez ces liens :

IA responsable

Un système d’INTELLIGENCE artificielle inclut non seulement la technologie, mais aussi les personnes qui l’utilisent, les personnes qui y sont affectées et l’environnement où elle est déployée. Utilisez les ressources suivantes pour en savoir plus sur l’utilisation et le déploiement de l’IA responsable dans vos systèmes.

Reconnaissance vocale

Évaluation de la prononciation

Voix personnalisée

Les guides de démarrage rapide suivants sont disponibles pour les fonctionnalités d’Azure Speech. Chaque démarrage rapide vous apprend les modèles de conception de base dans de nombreux langages de programmation populaires et vous permet d’exécuter du code en moins de 10 minutes.