Caractéristiques et limitations de l’évaluation de la prononciation

Important

Les traductions non anglaises sont fournies uniquement pour des raisons pratiques. Consultez la EN-US version de ce document pour obtenir la version définitive.

Dans le cadre du service Azure Speech proposé par Foundry Tools, l'évaluation de la prononciation appuie les solutions éducatives intégrales pour l'apprentissage des langues assisté par ordinateur. L’évaluation de la prononciation implique plusieurs critères pour évaluer les performances des apprenants à plusieurs niveaux de détail, avec des perceptions similaires aux juges humains.

Quelle est la précision de l’évaluation de la prononciation ?

La fonctionnalité Évaluation de la prononciation fournit des scores objectifs, tels que la précision de la prononciation et le degré de fluidité, pour les apprenants de langue dans l’apprentissage linguistique assisté par ordinateur. Les performances de l'évaluation de la prononciation dépendent de la précision de la transcription Azure Speech-to-Text utilisant une transcription soumise comme référence, et de l'accord entre évaluateurs entre le système et les juges humains. Pour obtenir une définition de la précision de la reconnaissance de la parole en texte, consultez Caractéristiques et limitations relatives à l’utilisation de la reconnaissance vocale.

Les sections suivantes sont conçues pour vous aider à comprendre les concepts clés relatifs à la précision à mesure qu’elles s’appliquent à l’utilisation de l’évaluation de la prononciation.

Langue de précision

La précision de Speech-To-Text affecte l’évaluation de la prononciation. Taux d'erreur de mots (WER) est utilisé pour mesurer la précision de la reconnaissance vocale comme norme de l'industrie. WER compte le nombre de mots incorrects identifiés lors de la reconnaissance, puis divise par le nombre total de mots fournis dans la transcription correcte, qui est souvent créé par l’étiquetage humain.

Comparaison de l’évaluation de la prononciation avec des juges humains

Le coefficient de corrélation Pearson est utilisé pour mesurer la corrélation entre les scores générés par l’API d’évaluation de la prononciation et les scores générés par les juges humains. Le coefficient de corrélation Pearson est une mesure de corrélation linéaire pour deux séquences données. Il est largement utilisé pour mesurer la différence entre les résultats de machine générés automatiquement et les étiquettes annotées par l’homme. Ce coefficient affecte une valeur comprise entre –1 et 1, où 0 n’est pas de corrélation, la valeur négative signifie que la prédiction est opposée à la cible, et la valeur positive signifie que la prédiction est alignée avec la cible.

Les lignes directrices proposées pour une interprétation du coefficient de corrélation Pearson sont présentées dans le tableau suivant. La force signifie la corrélation entre deux variables et indique dans quelle mesure le résultat de la machine est cohérent avec les étiquettes humaines. Les valeurs proches de 1 indiquent une corrélation plus forte.

Force de l’association Valeur du coefficient Détail
Faible 0.1 à 0.3 Les scores générés automatiquement à partir d’un système automatique ne sont pas considérablement alignés sur la perception des humains.
Moyen 0.3 à 0.5 Les scores générés automatiquement à partir d’un système automatique sont alignés sur la perception des humains, mais les différences existent toujours, et les gens peuvent ne pas accepter le résultat.
Haute 0.5 à 1.0 Les scores générés automatiquement à partir d’un système automatique sont alignés sur la perception des humains, et les gens sont prêts à accepter les résultats du système.

Dans nos évaluations, l'Évaluation de la Prononciation de Microsoft a effectué une corrélation de Pearson de >0.5 avec les résultats des juges humains, ce qui démontre que les résultats générés automatiquement correspondent étroitement au jugement des experts humains.

Limitations système et meilleures pratiques pour améliorer la précision du système

  • L’évaluation de la prononciation fonctionne mieux avec une entrée audio de qualité supérieure. Nous recommandons une qualité d’entrée de 16 kHz ou supérieure.
  • La qualité de l’évaluation de la prononciation est également affectée par la distance du haut-parleur du microphone. Les enregistrements doivent être effectués avec le haut-parleur proche du microphone, et non sur une connexion à distance.
  • L’évaluation de la prononciation ne prend pas en charge un scénario d’évaluation lingual mixte.
  • L’évaluation de la prononciation prend en charge un large éventail de langues.
  • L’évaluation de la prononciation ne prend pas en charge un scénario d’évaluation multi-orateur. L’audio ne doit inclure qu’un seul haut-parleur pour chaque évaluation.
  • L’évaluation de la prononciation compare l’audio soumis aux locuteurs natifs dans des conditions générales. L’orateur doit maintenir une vitesse et un volume de parole normaux, et éviter de crier ou d’élever sa voix.
  • L’évaluation de la prononciation s’effectue mieux dans un environnement avec peu de bruit d’arrière-plan. Les modèles de reconnaissance vocale actuels gèrent le bruit dans des conditions générales. Des environnements bruyants ou plusieurs personnes parlant en même temps peuvent entraîner une confiance moindre de l’évaluation. Pour mieux gérer les cas difficiles, vous pouvez suggérer que l'orateur devrait répéter la prononciation s'il obtient un score en dessous d'un certain seuil.

Évaluation de l’évaluation de la prononciation dans vos applications

Les performances de l’évaluation de la prononciation varient en fonction des utilisations réelles que les clients implémentent. Pour garantir des performances optimales dans leurs scénarios, les clients doivent effectuer leurs propres évaluations des solutions qu’ils implémentent à l’aide de l’évaluation de la prononciation.

  • Avant d’utiliser l’évaluation de la prononciation dans vos applications, déterminez si ce produit fonctionne correctement dans votre scénario. Collectez des données réelles à partir du scénario cible, testez l’efficacité de l’évaluation de la prononciation et assurez-vous que Speech-to-Text et l’évaluation de la prononciation peuvent fournir la précision dont vous avez besoin, voir Évaluer et améliorer la précision du Discours personnalisé des outils Foundry.
  • Sélectionnez les seuils appropriés selon le scénario cible. L’évaluation de la prononciation fournit des scores de précision à différents niveaux et vous devrez peut-être prendre en compte le seuil utilisé en cas d’utilisation réelle. Par exemple, la méthode de notation pour l’apprentissage des enfants peut ne pas être aussi stricte que celle de l’apprentissage pour adultes. Envisagez de définir un seuil de détection de la mauvaiseprononciation plus élevé pour l’apprentissage pour adultes.