重要
提供非英文翻譯僅為方便。 請參閱 EN-US 本文件的最終版本 以獲得最終版本。
作為 Azure Foundry Tools 語音服務的一部分,發音評估能提供端到端的電腦輔助語言學習教育解決方案。 發音評估涉及多項標準,以在不同細節層次對學習者的表現進行評估,並產生類似於人類評審的效果。
發音評估有多準確?
發音評估功能為電腦 輔助語言學習者的學習者提供客觀分數,如發音準確度與流暢度。 發音評定的效能取決於 Azure 語音轉換文字謄寫正確性 (以提交的謄寫作為參考),以及系統與人類評審員之間的評分者間的一致性。 關於語音轉文字準確性的定義,請參見 語音轉文字的特性與限制。
以下章節設計旨在幫助您理解適用於發音評估的準確性相關關鍵概念。
準確性的語言
語音轉文字的準確性會影響發音評估。 字詞錯誤率(WER)被用來衡量語音轉文字的準確度,是業界的標準。 WER 計算識別時識別出的錯誤詞彙數,然後除以正確轉錄本中提供的總字數,該轉錄通常由人工標註產生。
將發音評估與人類評審進行比較
Pearson 相關係數用於衡量發音評估 API 產生的分數與人類評審產生的分數之間的相關性。 皮爾森相關係數是衡量兩個給定序列線性相關係數的指標。 它被廣泛用來衡量自動產生的機器結果與人工註解標籤之間的差異。 此係數賦予 –1 到 1 之間的值,0 表示無相關性,負值表示預測與目標相反,正值表示預測與目標值的對齊程度。
皮爾森相關係數解讀的建議指引如下表所示。 強度代表兩個變數之間的相關性,反映機器結果與人類標籤的一致性。 接近1的數值表示相關性較強。
| 關聯強度 | 係數值 | 細節 |
|---|---|---|
| 低 | 0.1 到 0.3 | 自動系統自動產生的分數與人類的感知並不明顯一致。 |
| 中 | 0.3 到 0.5 | 自動系統自動產生的分數與人類感知相符,但差異仍然存在,人們可能不同意結果。 |
| 高 | 0.5 到 1.0 | 自動系統自動產生的分數與人類的感知相符,人們也願意同意系統的結果。 |
在我們的評估中,Microsoft Pronunciation Assessment 與人類評審結果進行了 >0.5 Pearson 相關係數,顯示自動產生的結果與人類專家的判斷高度一致。
系統限制與提升系統準確度的最佳實務
- 發音評估在高品質音訊輸入下效果更好。 我們建議輸入品質為16 kHz或以上。
- 發音評估品質也會受到說話者與麥克風距離的影響。 錄音時應該讓喇叭靠近麥克風,而不是透過遠端連線。
- 發音評估不支援混合語言評估情境。
- 發音評估支援更廣泛的 語言。
- 發音評估不支援多講者評量情境。 每次評量的音頻應僅包含一位講者。
- 發音評估會將提交的音訊與一般情況下的母語者進行比較。 說話者應保持正常的語速與音量,避免大聲喊叫或提高音量。
- 發音評估在背景噪音較少的環境中表現較佳。 目前語音轉文字模型能在一般條件下抵禦噪音。 嘈雜的環境或多人同時說話,可能導致評估信心降低。 為了更好地處理困難案例,你可以建議如果說話者得分低於某個門檻,應該重複發音。
在您的應用程式中評估發音
Pronunciation Assessment 的效能會依客戶實際應用而有所不同。 為了確保在情境中達到最佳效能,客戶應自行評估所實施的解決方案,並使用發音評估(Pronunciation Assessment)。
- 在申請中使用發音評估前,請考慮此產品在你的情境中表現是否良好。 從目標情境收集真實資料,測試發音評估的效果,並確保語音轉文字與發音評估能達到你所需的準確度,詳情請參閱「評估並提升 Foundry 工具的自訂語音準確度」。
- 根據目標情境選擇合適的門檻。 發音評估提供不同層級的準確度分數,你可能需要考慮實際使用的標準。 例如,兒童學習的評分方法可能不如成人學習嚴格。 考慮為成人學習設定更高的發音錯誤偵測門檻。