Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Wichtig
Nicht englische Übersetzungen werden nur zur Bequemlichkeit bereitgestellt. Bitte konsultieren Sie die EN-US Version dieses Dokuments für die endgültige Version.
Als Teil des Azure Speech-Dienstes in Foundry Tools ermöglicht die Aussprachebewertung End-to-End-Bildungslösungen für computergestütztes Sprachlernen. Die Aussprachebewertung umfasst mehrere Kriterien, um die Leistung der Lernenden auf mehreren Detailebenen zu bewerten, wobei die Wahrnehmungen ähnlich wie die menschlichen Richter sind.
Wie genau ist die Aussprachebewertung?
Die Aussprachebewertungsfunktion bietet objektive Bewertungen, z. B. die Genauigkeit der Aussprache und den Grad der Spracherkennung, für Sprachlerner im computergestützten Sprachlernen. Die Leistung der Aussprachebewertung hängt auf Azure Speech-To-Text von der Genauigkeit der Transkription ab, wobei eine gesendete Transkription als Referenz verwendet wird, sowie von der Zwischen-Rater-Übereinstimmung zwischen dem System und menschlichen Richtern. Eine Definition der Genauigkeit der Sprach-zu-Text-Technologie finden Sie unter "Merkmale und Einschränkungen für die Verwendung von Sprache-zu-Text".
Die folgenden Abschnitte sollen Ihnen helfen, wichtige Konzepte zur Genauigkeit zu verstehen, während sie für die Verwendung der Aussprachebewertung gelten.
Die Sprache der Genauigkeit
Die Genauigkeit der Sprache-zu-Text-Technologie wirkt sich auf die Bewertung der Aussprache aus. Wortfehlerrate (WER) wird verwendet, um die Genauigkeit der Spracherkennung-zu-Text als Industriestandard zu messen. WER zählt die Anzahl falscher Wörter, die während der Erkennung identifiziert wurden, und dividiert dann durch die Gesamtanzahl der Wörter, die im richtigen Transkript angegeben sind, was häufig durch menschliche Bezeichnungen erstellt wird.
Der Vergleich der Bewertung der Aussprache mit menschlichen Beurteilern
Der Pearson-Korrelationskoeffizient wird verwendet, um die Korrelation zwischen den von der Aussprachebewertungs-API generierten Bewertungen und den von menschlichen Richtern erstellten Bewertungen zu messen. Der Pearson-Korrelationskoeffizient ist ein Maß für eine lineare Korrelation für zwei bestimmte Sequenzen. Es wird häufig verwendet, um den Unterschied zwischen automatisch generierten Maschinenergebnissen und menschlich annotierten Labels zu messen. Dieser Koeffizienten weist einen Wert zwischen -1 und 1 zu, wobei 0 keine Korrelation ist, ein negativer Wert bedeutet, dass die Vorhersage dem Ziel entgegengesetzt ist, und ein positiver Wert bedeutet, wie die Vorhersage am Ziel ausgerichtet wird.
Die vorgeschlagenen Leitlinien für eine Pearson-Korrelationskoeffizientinterpretation sind in der folgenden Tabelle dargestellt. Die Stärke bedeutet die Beziehungskorrelation zwischen zwei Variablen und gibt an, wie konsistent das Maschinenergebnis mit menschlichen Bezeichnungen übereinstimmt. Werte, die nahe 1 liegen, deuten auf eine stärkere Korrelation hin.
| Stärke der Assoziation | Koeffizientenwert | Einzelheit |
|---|---|---|
| Niedrig | 0.1 bis 0.3 | Die automatisch generierten Bewertungen aus einem automatischen System sind nicht wesentlich an der Wahrnehmung des Menschen ausgerichtet. |
| Mittel | 0,3 bis 0,5 | Die automatisch generierten Bewertungen aus einem automatischen System sind an der Wahrnehmung des Menschen ausgerichtet, aber es gibt immer noch Unterschiede, und die Menschen stimmen möglicherweise nicht mit dem Ergebnis überein. |
| Hoch | 0.5 bis 1.0 | Die automatisch generierten Bewertungen aus einem automatischen System sind an der Wahrnehmung des Menschen ausgerichtet, und die Menschen sind bereit, den Systemergebnissen zuzustimmen. |
In unseren Bewertungen zeigte die Microsoft Aussprachebewertung eine Pearson-Korrelation von >0,5 mit den Ergebnissen der menschlichen Richter, was zeigt, dass die automatisch generierten Ergebnisse mit dem Urteil von menschlichen Experten sehr konsistent sind.
Systembeschränkungen und bewährte Methoden zur Verbesserung der Systemgenauigkeit
- Die Aussprachebewertung funktioniert besser mit einer qualitativ hochwertigen Audioeingabe. Wir empfehlen eine Eingabequalität von 16 kHz oder höher.
- Die Qualität der Aussprachebewertung wird auch durch den Abstand des Lautsprechers vom Mikrofon beeinflusst. Aufzeichnungen sollten mit dem Lautsprecher in der Nähe des Mikrofons und nicht über eine Remoteverbindung erfolgen.
- Die Aussprachebewertung unterstützt kein Szenario für gemischte mehrsprachige Bewertungen.
- Die Aussprachebewertung unterstützt eine breitere Palette von Sprachen.
- Die Aussprachebewertung unterstützt kein Szenario für die Bewertung mit mehreren Sprechern. Das Audio sollte nur einen Lautsprecher für jede Bewertung enthalten.
- Die Aussprachebewertung vergleicht die übermittelten Audiodaten unter allgemeinen Bedingungen mit Muttersprachlern. Der Redner sollte eine normale Sprachgeschwindigkeit und Lautstärke beibehalten und vermeiden, zu schreien oder die Stimme anderweitig zu erheben.
- Die Aussprachebewertung liefert in einer Umgebung mit wenig Hintergrundgeräuschen bessere Ergebnisse. Aktuelle Spracherkennungsmodelle berücksichtigen Rauschen unter normalen Bedingungen. Laute Umgebungen oder mehrere Personen, die gleichzeitig sprechen, können zu einer niedrigeren Konfidenz der Auswertung führen. Um schwierige Fälle besser zu handhaben, können Sie vorschlagen, dass der Sprecher eine Aussprache wiederholen sollte, wenn er unter einem bestimmten Schwellenwert liegt.
Bewertung der Aussprache in Ihren Anwendungen
Die Leistung des Aussprachebewertungs-Tools variiert je nach den Echtweltanwendungen, die Kunden einsetzen. Um eine optimale Leistung in ihren Szenarien sicherzustellen, sollten Kunden ihre eigenen Bewertungen der Lösungen durchführen, die sie mithilfe der Aussprachebewertung implementieren.
- Bevor Sie die Aussprachebewertung in Ihren Anwendungen verwenden, überlegen Sie, ob dieses Produkt in Ihrem Szenario gut funktioniert. Sammeln Sie reale Daten aus dem Zielszenario und testen Sie, wie die Aussprachebewertung durchgeführt wird. Stellen Sie sicher, dass die Spracherkennung zu Text und die Aussprachebewertung die benötigte Genauigkeit liefern können, siehe Auswerten und Verbessern der Genauigkeit von Foundry Tools Custom Speech.
- Wählen Sie geeignete Schwellenwerte pro Zielszenario aus. Die Aussprachebewertung stellt Genauigkeitsbewertungen auf verschiedenen Ebenen bereit, und möglicherweise müssen Sie den Schwellenwert berücksichtigen, der in der Praxis verwendet wird. Die Benotungsmethode für das Lernen von Kindern ist z. B. möglicherweise nicht so streng wie für erwachsenes Lernen. Erwägen Sie, einen höheren Fehlerkennungsschwellenwert für das Erlernen von Erwachsenen festzulegen.