Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Les traductions non anglaises sont fournies uniquement pour des raisons pratiques. Consultez la EN-US version de ce document pour obtenir la version définitive.
Un système d’IA inclut non seulement la technologie, mais aussi les personnes qui l’utiliseront, les personnes qui seront affectées par elle et l’environnement dans lequel il est déployé. La création d’un système adapté à son objectif prévu nécessite une compréhension du fonctionnement de la technologie, de ses capacités et de ses limitations et de la façon d’atteindre les meilleures performances.
Microsoft fournit Transparency Notes pour vous aider à comprendre le fonctionnement de notre technologie IA. Cela inclut les choix que les propriétaires du système peuvent faire qui influencent les performances et le comportement du système, ainsi que l’importance de réfléchir à l’ensemble du système, y compris la technologie, les personnes et l’environnement. Vous pouvez utiliser des notes de transparence lors du développement ou du déploiement de votre propre système, ou les partager avec les personnes qui utiliseront ou seront affectées par votre système.
Les notes de transparence font partie d’un effort plus large de Microsoft pour mettre en pratique nos principes d’IA. Pour en savoir plus, consultez les principes d'IA de Microsoft.
Présentation de l’évaluation de la prononciation
L’API d’évaluation de la prononciation prend des entrées audio pour évaluer la prononciation vocale et donne des commentaires sur la précision, la fluidité et l’exhaustivité de l’audio parlé. La fonctionnalité Évaluation de la prononciation inclut également des commentaires plus complets sur différents aspects de la prosodie vocale, de l’utilisation du vocabulaire, de la correction grammaticale et de la compréhension des rubriques, ce qui vous offre une évaluation détaillée de vos compétences linguistiques. Les évaluations scriptées et nonscriptées sont prises en charge, ce qui vous permet d’évaluer plus facilement votre prononciation et votre maîtrise de la langue. L’évaluation de la prononciation prend en charge un large éventail de langues.
Avec l’évaluation de la prononciation, les apprenants de langue peuvent pratiquer, obtenir des commentaires instantanés et améliorer leur prononciation afin qu’ils puissent parler et présenter avec confiance. Les professeurs peuvent utiliser l'outil d'évaluation de la prononciation pour évaluer la prononciation de plusieurs interlocuteurs en temps réel.
Principes de base de l’évaluation de la prononciation
L’API d’évaluation de prononciation offre des résultats d’évaluation vocale à l’aide d’une approche basée sur le Machine Learning qui s’aligne étroitement sur les évaluations vocales effectuées par des experts natifs. Il fournit des commentaires précieux sur la prononciation, la fluidité, la prosodie, l’utilisation du vocabulaire, la correction grammaticale et la compréhension des sujets, ce qui vous aide à améliorer leurs compétences linguistiques et à communiquer en toute confiance dans une nouvelle langue. Le modèle d’évaluation de la prononciation a été formé avec 100 000 heures de données vocales provenant de haut-parleurs natifs. Il peut fournir des résultats précis lorsque les personnes manquent, répètent ou ajoutent des expressions par rapport au texte de référence. Il permet également aux paramètres de configuration enrichis de prendre en charge la flexibilité d’utilisation de l’API, telles que la définition de granularité pour modifier la granularité des informations lors de l’évaluation. (Pour plus d’informations, consultez l’exemple de code.)
L’évaluation de la prononciation évalue plusieurs aspects de la prononciation et du contenu : précision, fluidité, complétion, prosodie, utilisation du vocabulaire, correction grammaticale et compréhension des rubriques. Il fournit également des évaluations à plusieurs niveaux de granularité et retourne des scores d’exactitude pour des phonèmes, syllabes, mots, phrases ou même articles entiers. Pour plus d’informations, consultez comment utiliser le SDK Speech pour les fonctionnalités d’évaluation de la prononciation.
Le tableau suivant décrit les résultats clés. Pour plus d’informations, consultez les paramètres de réponse complets. En utilisant des techniques de traitement en langage naturel (NLP) et des paramètres EnableMiscue , l’évaluation de la prononciation peut détecter des erreurs telles que des mots supplémentaires, manquants ou répétés par rapport au texte de référence. Ces informations permettent d’obtenir un scoring plus précis à utiliser comme informations de diagnostic. Cette fonctionnalité est utile pour les paragraphes de texte plus longs.
| Paramètre | Description |
|---|---|
AccuracyScore |
Précision de la prononciation du discours. La précision indique la précision selon laquelle les phonèmes correspondent à la prononciation d’un orateur natif. Les scores d’exactitude de syllabe, de mot et de texte intégral sont agrégés à partir du score de précision au niveau du phonème et affinés avec des objectifs d’évaluation. |
FluencyScore |
La fluidité du discours donné. La fluidité indique dans quelle mesure le discours se rapproche de l'utilisation par un locuteur natif des pauses silencieuses entre les mots. |
CompletenessScore |
Complétivité de la parole, calculée par le rapport de mots prononcés au texte de référence d’entrée. |
ProsodyScore |
Prosodie du discours donné. La prosodie indique à quel point le discours donné est naturel, y compris l'accentuation, l’intonation, la vitesse de parole et le rythme. |
PronScore |
Score global indiquant la qualité de prononciation de la parole donnée. Ceci est agrégé à partir des scores de précision, de fluidité et de complétude, avec pondération. |
ErrorType |
Cette valeur indique si un mot est omis, inséré, mal prononcé, inséré de manière incorrecte avec une pause, sans pause à la ponctuation, ou se levant, tombant ou restant plat de manière monotone sur l'énoncé, comparé à ReferenceText. Les valeurs possibles sont None (ce qui signifie qu’aucune erreur sur ce mot), Omission, Insertion, Mispronunciation, UnexpectedBreak, , MissingBreaket Monotone. |
Un autre ensemble de paramètres retournés par l’évaluation de la prononciation est Offset et Duration (appelé ensemble « timestamp ») L’horodatage de la parole est retourné au format JSON structuré. L’évaluation de la prononciation peut calculer les erreurs de prononciation sur chaque phonème. L’évaluation de la prononciation peut également associer les erreurs à des horodatages spécifiques dans l’audio d’entrée. Les clients qui développent des applications peuvent utiliser le signal pour offrir un parcours d’apprentissage pour aider les étudiants à se concentrer sur l’erreur de plusieurs façons. Par exemple, l’application peut mettre en surbrillance la parole d’origine, répondre à l’audio pour la comparer à la prononciation standard ou recommander des mots similaires à pratiquer.
| Paramètre | Description |
|---|---|
| Décalage | Heure (en unités de 100 nanosecondes) à laquelle la parole reconnue commence dans le flux audio. |
| Durée | Durée (en unités de 100 nanosecondes) de la parole reconnue dans le flux audio. |
Exemples de cas d’usage
L’évaluation de la prononciation peut être utilisée pour l’apprentissage à distance, la pratique de l’examen ou d’autres scénarios qui demandent des commentaires de prononciation. Les exemples suivants sont des cas d’usage déployés ou que nous avons conçus pour les clients à l’aide de l’évaluation de la prononciation :
- Fournisseur de services éducatifs : les fournisseurs peuvent créer des applications avec l’utilisation de l’évaluation de la prononciation pour aider les étudiants à pratiquer l’apprentissage linguistique à distance avec des commentaires en temps réel. Ce cas d’usage est typique lorsqu’une application doit prendre en charge les commentaires en temps réel. Nous prenons en charge le chargement en continu sur les fichiers audio pour des commentaires immédiats.
- Éducation dans un jeu : les développeurs d’applications, par exemple, peuvent créer une application d’apprentissage linguistique en combinant des leçons complètes dans les jeux avec la technologie vocale de pointe pour aider les enfants à apprendre l’anglais. Le programme peut couvrir un large éventail de compétences en anglais, telles que l’expression, la lecture et l’écoute, et également former des enfants sur la grammaire et le vocabulaire, avec l’évaluation de la prononciation utilisée pour soutenir les enfants lorsqu’ils apprennent à parler l’anglais. Ces formats d’apprentissage multiples garantissent que les enfants apprennent l’anglais avec facilité en fonction d’un style d’apprentissage amusant.
- Éducation dans une application de communication : Microsoft Teams Progression de la lecture aide l'enseignant à évaluer l'exercice oral d'un étudiant avec l'aide de la détection automatique pour l'omission, l'insertion et la mauvaise prononciation. Il permet également aux étudiants de pratiquer la prononciation plus facilement avant de soumettre leurs devoirs. Microsoft Teams Progression du conférencier en tant qu'accélérateur d'apprentissage peut également aider les étudiants à développer des compétences de présentation et d'expression orale en public.
Considérations relatives au choix d’autres cas d’usage
L’apprentissage en ligne s’est rapidement développé à mesure que les écoles et les organisations s’adaptent à de nouvelles façons de connecter et de mettre en place des méthodes d’éducation. La technologie vocale peut jouer un rôle important pour rendre l’apprentissage à distance plus attrayant et accessible aux étudiants de tous les milieux. Avec les outils Foundry, les développeurs peuvent rapidement ajouter des capacités vocales aux applications, rendant l'apprentissage en ligne plus vivant.
L’un des éléments clés de l’apprentissage linguistique améliore les compétences de prononciation. Pour les nouveaux apprenants de langue, la pratique de la prononciation et l’obtention de commentaires opportuns sont essentielles pour devenir un orateur plus fluent. Pour le fournisseur de solutions qui cherche à soutenir les apprenants ou les étudiants dans l’apprentissage linguistique, la possibilité de pratiquer à tout moment, n’importe où en utilisant l’évaluation de la prononciation serait un bon ajustement pour ce scénario. Il peut également être intégré en tant qu’assistant virtuel pour les enseignants et aider à améliorer leur efficacité.
Les recommandations suivantes concernent les cas d’usage où l’évaluation de la prononciation doit être utilisée soigneusement :
- Incluez une intégration d'un humain dans la boucle pour tous les scénarios d’examen formel : le système d'évaluation de la prononciation est alimenté par des systèmes d'IA, et des facteurs externes tels que la qualité de la voix et le bruit d’arrière-plan peuvent avoir un impact sur la précision. Une intervention humaine dans les examens formels garantit que les résultats de l’évaluation sont conformes aux attentes.
- Envisagez d’utiliser différents seuils par scénario : Actuellement, le score d’évaluation de la prononciation représente uniquement la distance de similarité avec les haut-parleurs natifs utilisés pour entraîner le modèle. Une telle distance de similarité peut être cartographiée dans différents scénarios avec des conditions basées sur des règles ou un comptage pondéré, afin de fournir des retours sur la prononciation. Par exemple, la méthode de notation pour l’apprentissage des enfants peut ne pas être aussi stricte que celle de l’apprentissage pour adultes. Envisagez de définir un seuil de détection de la mauvaiseprononciation plus élevé pour l’apprentissage pour adultes.
- Considérez la possibilité de tenir compte des erreurs : lorsque le scénario implique la lecture de paragraphes longs, les utilisateurs sont susceptibles de trouver difficile de suivre le texte de référence sans faire d’erreurs. Ces erreurs, y compris l’omission, l’insertion et la répétition, sont comptabilisées comme des erreurs. Lorsque EnableMiscue est activé, les mots prononcés sont comparés au texte de référence et sont marqués par Omission, Insertion, Répétition en fonction de la comparaison.
Considérations juridiques et réglementaires : les organisations doivent évaluer des obligations légales et réglementaires spécifiques potentielles lors de l’utilisation d’outils et de solutions Foundry, ce qui peut ne pas convenir à une utilisation dans chaque secteur ou scénario. En outre, les outils ou solutions Foundry ne sont pas conçus pour et ne peuvent pas être utilisés de manière interdite en termes de service applicables et les codes de conduite pertinents.