註
此功能目前正處於公開預覽階段。 此預覽版未簽訂服務等級協議,且不建議用於生產工作負載。 某些功能可能不被支援或功能受限。 欲了解更多資訊,請參閱Microsoft Azure預覽補充使用條款。
MAI-Transcribe 是由 Microsoft AI 團隊內部打造的次世代語音轉文字模型。 它能在 60 種語言及真實音訊條件下提供快速且準確的轉錄。 MAI-Transcribe-2 支援多種工作負載,包括影片字幕、會議、臨床筆記、客服中心文件、無障礙工具、內容創作及語音代理。 該模型提供說話者日記、在嘈雜環境中的優異表現、字詞層級時間戳記、自動語言識別、關鍵字偏向、語碼切換,以及可配置的轉錄風格(無填充的乾淨轉錄或逐字稿)。
支援下列模型:
MAI-Transcribe-2MAI-Transcribe-1.5-
MAI-Transcribe-1: 於2026年8月20日被棄用。
先決條件
- 一個 Azure 訂閱。 你可以 免費創建一個。
- 在 Azure 入口網站中可用的 Microsoft Foundry 語音資源。
- 語音資源的鍵與區域。 在你的語音資源部署完成後,選擇 「前往資源 」以查看和管理金鑰。 有關目前支援區域的清單,請參見 語音服務區域。
- 以下格式之一的音訊檔案:WAV、MP3 或 FLAC。 關於最大檔案大小與音訊長度,請參閱
audio「轉錄 - 轉錄 REST 參考」中的參數。 如果您啟用說話者分離功能,請參閱下一節中有關錄音長度的注意事項。
使用 MAI-Transcribe 模型
使用 MAI-Transcribe-2 從音訊輸入產生文字稿。 透過相應的 API 參數配置以下功能:
| Feature | 參數 | 價值 | 預設值 | Description |
|---|---|---|---|---|
| 模型選擇(必需) | enhancedMode.model |
"MAI-Transcribe-2" |
— | 設定為呼叫 MAI‑Transcribe 模型。 |
| 強化模式(必備) | enhancedMode.enabled |
true | false |
false |
設定為 true 以呼叫 MAI-Transcribe。 |
| 說話者日記 | diarization.enabled |
true | false |
false |
依講者分段錄音,並將每個片段歸屬於正確的人。 回傳帶有 speaker、 、 offsetMilliseconds及 durationMilliseconds 元資料的喇叭標籤段。 支援比未啟用說話者分離的語音轉錄更短的錄音;請參閱本表後方的註解。 |
| 詞級時間戳記 | modelOptions.timestamps |
"word" | "segment" | "none" |
none |
控制時序細節。
"word" 會為每個詞傳回 offsetMilliseconds 和 durationMilliseconds,以實現精確的對齊、搜尋、導覽和編輯。
"segment" 回傳每個片段的時間資訊:輸出逐字稿依語言和講者劃分成多個段落。 所以當 diarization 啟用時,會為每個說話者和語言建立一個片段;關閉時則為每種語言建立一個片段。
"none" 省略了時間資料。 |
| 關鍵字偏誤 | phraseList.phrases |
字串陣列 | [] |
使辨識偏向於提供的關鍵字。 用於領域專屬術語、縮寫、產品名稱及難以僅從語境中辨識的專有名詞。 術語是提示,不是強迫輸出。 |
| 轉錄風格 | modelOptions.transcribeStyle |
"verbatim" | "clean" |
"verbatim" |
控制輸出風格。
"verbatim" 會如實捕捉語音內容,包括贅詞和話說到一半重新開始的情況,以滿足合規、品質保證及分析需求。
clean 刪除填充內容,製作可讀的說明文字、筆記及已發表的逐字稿。 |
| 語言選取 | locales |
["language_code"] |
未指定(自動偵測) | 允許強制轉錄成特定語言。 這會對模型形成非常明確的提示,除非你完全確定錄音內容是使用該語言,且預設的自動偵測無法運作,否則不要特別指定它。 這裡只能提供一種語言。 MAI-Transcribe-2 支援 60 種語言。 |
| 代碼切換 | 自動 | — | — | 對於常見的混合語言組合,例如 Hinglish 和 Spanglish,能處理在話語尚未說完時就在不同語言間切換的對話。 |
| 抗噪能力 | 固有 | — | — | 維持在非受控環境中錄製的音訊轉錄品質,包括背景噪音、重疊語音及可變的麥克風品質。 |
註
增強模式中的說話者分離目前支援的錄音長度比語音轉錄短。 在預覽版中,當請求的 diarization.enabled 設為 true 時,約 15 分鐘或更長的錄音會失敗,並傳回帶有 Timeout 錯誤的 HTTP 408、HTTP 500,或帶有 diarization_unavailable 錯誤的 HTTP 503;但在停用 diarization 時,相同的錄音可成功轉錄。 對於較長的錄音,請在停用說話者分離的情況下進行轉錄,並使用回傳的逐字時間戳記搭配獨立的說話者分離步驟。
要開始使用增強模式的轉錄,請先跟著 LLM 語音快速入門。 接著,指定Model。
若要使用 MAI-Transcribe 模型:
- 在請求中設定屬性
enhancedMode.enabled為true。 - 在請求中設定屬性
enhancedMode.model為"MAI-Transcribe-2"。 - 請使用 MAI-Transcribe 可用的 語音服務區域之一。
curl --location 'https://YourResourceName.cognitiveservices.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15' \
--header 'Content-Type: multipart/form-data' \
--header 'Ocp-Apim-Subscription-Key: <YourSpeechResourceKey>' \
--form 'audio=@"YourAudioFile.wav"' \
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2"
}
}'
您也可以針對 MAI-Transcribe-2 啟用說話者diarization,以區分不同的說話者,並將錄音中的內容歸屬於正確的人。
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2"
},
"diarization": {"enabled": true}
}
您也可以針對 MAI-Transcribe-2 使用 transcribeStyle 來控制轉錄樣式。 預設輸出是 verbatim 如果你需要保留原始語音內容,包括填充詞(「嗯」、「呃」)、假開頭和自我修正。 如果你需要一個可讀性最佳的逐字稿,能去除填充詞並自動格式化常見語音模式,請設定 transcribeStyle 為 clean 。
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2",
"modelOptions": {
"transcribeStyle": "clean"
}
}
}
可選擇性地,對 MAI-Transcribe-2啟用 word-level timestamps ,以提供每個字的精確時間,支援精確的對齊、搜尋、導航與編輯。
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2",
"modelOptions": {
"timestamps": "word"
}
}
}
可選擇性地加入短語清單,以提升專業領域的準確度,使用 phraseList.phrases。 此功能實現關鍵字偏向。
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2"
},
"phraseList": {
"phrases": ["phrase 1", "phrase 2"]
},
}'
可選擇指定一個語言代碼, locales 以強制在單一語言中進行識別。 如果你沒指定,模型會自動偵測到該語言。 例如:
--form 'definition={
"locales": ["en"],
"enhancedMode": {
"enabled": true,
"model":"MAI-Transcribe-2"
}
}'
若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 請參閱 MAI-Transcribe 支援的所有參數的完整指南,目前僅在 REST API 標籤下取得。
若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 請參閱 MAI-Transcribe 支援的所有參數的完整指南,目前僅在 REST API 標籤下取得。
若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 請參閱 MAI-Transcribe 支援的所有參數的完整指南,目前僅在 REST API 標籤下取得。
若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 欲了解 MAI-Transcribe 支援的所有參數的完整指南,請參閱 REST API 標籤。
語言支援
預設情況下,模型以多語言模式運作。 目前支援的語言如下:
| 語言代碼 | 語言 | MAI-Transcribe-1.5 支援 | MAI-Transcribe-2 支援功能 |
|---|---|---|---|
af |
南非語 | ✅ | |
ar |
阿拉伯語 | ✅ | ✅ |
as |
阿薩姆語 | ✅ | ✅ |
az |
亞塞拜然語 | ✅ | |
bg |
保加利亞 | ✅ | ✅ |
bn |
孟加拉語 | ✅ | ✅ |
bs |
Bosnian | ✅ | |
ca |
加泰蘭文 | ✅ | ✅ |
cs |
捷克語 | ✅ | ✅ |
da |
丹麥語 | ✅ | ✅ |
de |
德語 | ✅ | ✅ |
el |
Greek | ✅ | ✅ |
en |
英文 | ✅ | ✅ |
es |
西班牙語 | ✅ | ✅ |
et |
Estonian | ✅ | ✅ |
fa |
Persian | ✅ | |
fi |
芬蘭語 | ✅ | ✅ |
fil |
菲律賓人 | ✅ | |
fr |
法語 | ✅ | ✅ |
gl |
加利西亞語 | ✅ | |
gu |
Gujarati | ✅ | ✅ |
he |
希伯來文 | ✅ | |
hi |
印地語 | ✅ | ✅ |
hu |
匈牙利語 | ✅ | ✅ |
hy |
亞美尼亞人 | ✅ | |
id |
印尼 | ✅ | ✅ |
is |
Icelandic | ✅ | |
it |
義大利語 | ✅ | ✅ |
ja |
日本 | ✅ | ✅ |
kk |
Kazakh | ✅ | |
kn |
Kannada | ✅ | ✅ |
ko |
韓語 | ✅ | ✅ |
lt |
立陶宛語 | ✅ | ✅ |
lv |
Latvian | ✅ | |
mk |
Macedonian | ✅ | |
ml |
馬拉雅拉姆語 | ✅ | ✅ |
mr |
Marathi | ✅ | ✅ |
ms |
Malay | ✅ | |
nb |
挪威博克mål | ✅ | ✅ |
ne |
尼泊爾語 | ✅ | |
nl |
荷蘭語 | ✅ | ✅ |
or |
歐迪亞文 | ✅ | ✅ |
pa |
旁遮普文(古魯穆奇文字) | ✅ | ✅ |
pl |
波蘭語 | ✅ | ✅ |
pt |
葡萄牙語 | ✅ | ✅ |
ro |
羅馬尼亞語 | ✅ | ✅ |
ru |
俄語 | ✅ | ✅ |
sk |
斯洛伐克語 | ✅ | ✅ |
sl |
斯洛維尼亞語 | ✅ | ✅ |
sv |
瑞典語 | ✅ | ✅ |
sw |
斯瓦希里語 | ✅ | |
ta |
泰米爾語 | ✅ | ✅ |
te |
Telugu | ✅ | ✅ |
th |
泰語 | ✅ | ✅ |
tr |
土耳其語 | ✅ | ✅ |
uk |
烏克蘭語 | ✅ | ✅ |
ur |
Urdu | ✅ | |
vi |
越南語 | ✅ | ✅ |
yue |
粵語 | ✅ | |
zh |
簡體中文 | ✅ | ✅ |
使用 MAI-Transcribe 搭配 Voice Live
你也可以在 Voice Live API 中使用 MAI-Transcribe 模型來進行輸入音訊轉錄。 在 model 工作階段設定中設定 input_audio_transcription 欄位。 詳情請參閱 如何自訂 Voice Live 輸入與輸出。
相關內容
- 欲了解更多使用 LLM 語音 API 的資訊,請參閱 LLM 語音 API
- Azure 語音中的 MAI-Voice
- 如何自訂 Voice Live 的輸入與輸出