Azure 語音中的 MAI-Transcribe(預覽)

此功能目前正處於公開預覽階段。 此預覽版未簽訂服務等級協議,且不建議用於生產工作負載。 某些功能可能不被支援或功能受限。 欲了解更多資訊,請參閱Microsoft Azure預覽補充使用條款

MAI-Transcribe 是由 Microsoft AI 團隊內部打造的次世代語音轉文字模型。 它能在 60 種語言及真實音訊條件下提供快速且準確的轉錄。 MAI-Transcribe-2 支援多種工作負載,包括影片字幕、會議、臨床筆記、客服中心文件、無障礙工具、內容創作及語音代理。 該模型提供說話者日記、在嘈雜環境中的優異表現、字詞層級時間戳記、自動語言識別、關鍵字偏向、語碼切換,以及可配置的轉錄風格(無填充的乾淨轉錄或逐字稿)。

支援下列模型:

  • MAI-Transcribe-2
  • MAI-Transcribe-1.5
  • MAI-Transcribe-1於2026年8月20日被棄用。

先決條件

使用 MAI-Transcribe 模型

使用 MAI-Transcribe-2 從音訊輸入產生文字稿。 透過相應的 API 參數配置以下功能:

Feature 參數 價值 預設值 Description
模型選擇(必需) enhancedMode.
model
"MAI-Transcribe-2"  設定為呼叫 MAI‑Transcribe 模型。
強化模式(必備) enhancedMode.
enabled
true | false false 設定為 true 以呼叫 MAI-Transcribe。
說話者日記 diarization.
enabled
true | false false 依講者分段錄音,並將每個片段歸屬於正確的人。 回傳帶有 speaker、 、 offsetMillisecondsdurationMilliseconds 元資料的喇叭標籤段。 支援比未啟用說話者分離的語音轉錄更短的錄音;請參閱本表後方的註解。
詞級時間戳記 modelOptions.
timestamps
"word" | "segment" | "none" none 控制時序細節。 "word" 會為每個詞傳回 offsetMillisecondsdurationMilliseconds,以實現精確的對齊、搜尋、導覽和編輯。 "segment" 回傳每個片段的時間資訊:輸出逐字稿依語言和講者劃分成多個段落。 所以當 diarization 啟用時,會為每個說話者和語言建立一個片段;關閉時則為每種語言建立一個片段。 "none" 省略了時間資料。
關鍵字偏誤 phraseList.phrases 字串陣列 [] 使辨識偏向於提供的關鍵字。 用於領域專屬術語、縮寫、產品名稱及難以僅從語境中辨識的專有名詞。 術語是提示,不是強迫輸出。
轉錄風格 modelOptions.
transcribeStyle
"verbatim" | "clean" "verbatim" 控制輸出風格。 "verbatim" 會如實捕捉語音內容,包括贅詞和話說到一半重新開始的情況,以滿足合規、品質保證及分析需求。 clean 刪除填充內容,製作可讀的說明文字、筆記及已發表的逐字稿。
語言選取 locales ["language_code"] 未指定(自動偵測) 允許強制轉錄成特定語言。 這會對模型形成非常明確的提示,除非你完全確定錄音內容是使用該語言,且預設的自動偵測無法運作,否則不要特別指定它。 這裡只能提供一種語言。 MAI-Transcribe-2 支援 60 種語言。
代碼切換 自動 對於常見的混合語言組合,例如 Hinglish 和 Spanglish,能處理在話語尚未說完時就在不同語言間切換的對話。
抗噪能力 固有 維持在非受控環境中錄製的音訊轉錄品質,包括背景噪音、重疊語音及可變的麥克風品質。

增強模式中的說話者分離目前支援的錄音長度比語音轉錄短。 在預覽版中,當請求的 diarization.enabled 設為 true 時,約 15 分鐘或更長的錄音會失敗,並傳回帶有 Timeout 錯誤的 HTTP 408、HTTP 500,或帶有 diarization_unavailable 錯誤的 HTTP 503;但在停用 diarization 時,相同的錄音可成功轉錄。 對於較長的錄音,請在停用說話者分離的情況下進行轉錄,並使用回傳的逐字時間戳記搭配獨立的說話者分離步驟。

要開始使用增強模式的轉錄,請先跟著 LLM 語音快速入門。 接著,指定Model

若要使用 MAI-Transcribe 模型:

  • 在請求中設定屬性 enhancedMode.enabledtrue
  • 在請求中設定屬性 enhancedMode.model"MAI-Transcribe-2"
  • 請使用 MAI-Transcribe 可用的 語音服務區域之一。
curl --location 'https://YourResourceName.cognitiveservices.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15' \
--header 'Content-Type: multipart/form-data' \
--header 'Ocp-Apim-Subscription-Key: <YourSpeechResourceKey>' \
--form 'audio=@"YourAudioFile.wav"' \
--form 'definition={ 
  "enhancedMode": {
    "enabled": true,
    "model": "MAI-Transcribe-2"
  }
}'

您也可以針對 MAI-Transcribe-2 啟用說話者diarization,以區分不同的說話者,並將錄音中的內容歸屬於正確的人。

 --form 'definition={ 
  "enhancedMode": {
    "enabled": true,
    "model": "MAI-Transcribe-2"
  },
  "diarization": {"enabled": true}
}

您也可以針對 MAI-Transcribe-2 使用 transcribeStyle 來控制轉錄樣式。 預設輸出是 verbatim 如果你需要保留原始語音內容,包括填充詞(「嗯」、「呃」)、假開頭和自我修正。 如果你需要一個可讀性最佳的逐字稿,能去除填充詞並自動格式化常見語音模式,請設定 transcribeStyleclean

 --form 'definition={ 
  "enhancedMode": {
    "enabled": true,
    "model": "MAI-Transcribe-2",
    "modelOptions": {
      "transcribeStyle": "clean"
    }
  }
}

可選擇性地,對 MAI-Transcribe-2啟用 word-level timestamps ,以提供每個字的精確時間,支援精確的對齊、搜尋、導航與編輯。

 --form 'definition={ 
  "enhancedMode": {
    "enabled": true,
    "model": "MAI-Transcribe-2",
    "modelOptions": {
      "timestamps": "word"
    }
  }
}

可選擇性地加入短語清單,以提升專業領域的準確度,使用 phraseList.phrases。 此功能實現關鍵字偏向。

 --form 'definition={ 
  "enhancedMode": {
    "enabled": true,
    "model": "MAI-Transcribe-2"
  }, 
  "phraseList": {
     "phrases": ["phrase 1", "phrase 2"]
   },
 }'

可選擇指定一個語言代碼, locales 以強制在單一語言中進行識別。 如果你沒指定,模型會自動偵測到該語言。 例如:

--form 'definition={
  "locales": ["en"],
  "enhancedMode": {
    "enabled": true,
    "model":"MAI-Transcribe-2"
  }
}'

若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 請參閱 MAI-Transcribe 支援的所有參數的完整指南,目前僅在 REST API 標籤下取得。

若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 請參閱 MAI-Transcribe 支援的所有參數的完整指南,目前僅在 REST API 標籤下取得。

若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 請參閱 MAI-Transcribe 支援的所有參數的完整指南,目前僅在 REST API 標籤下取得。

若要開始使用 MAI-Transcribe 模型,請先依照 Azure Speech API 的快速入門指南 使用 Fast Transcription API 的 enhancedMode。 然後,在 MAI-Transcribe-2 屬性中指定 enhancedMode.model。 欲了解 MAI-Transcribe 支援的所有參數的完整指南,請參閱 REST API 標籤。

語言支援

預設情況下,模型以多語言模式運作。 目前支援的語言如下:

語言代碼 語言 MAI-Transcribe-1.5 支援 MAI-Transcribe-2 支援功能
af 南非語
ar 阿拉伯語
as 阿薩姆語
az 亞塞拜然語
bg 保加利亞
bn 孟加拉語
bs Bosnian
ca 加泰蘭文
cs 捷克語
da 丹麥語
de 德語
el Greek
en 英文
es 西班牙語
et Estonian
fa Persian
fi 芬蘭語
fil 菲律賓人
fr 法語
gl 加利西亞語
gu Gujarati
he 希伯來文
hi 印地語
hu 匈牙利語
hy 亞美尼亞人
id 印尼
is Icelandic
it 義大利語
ja 日本
kk Kazakh
kn Kannada
ko 韓語
lt 立陶宛語
lv Latvian
mk Macedonian
ml 馬拉雅拉姆語
mr Marathi
ms Malay
nb 挪威博克mål
ne 尼泊爾語
nl 荷蘭語
or 歐迪亞文
pa 旁遮普文(古魯穆奇文字)
pl 波蘭語
pt 葡萄牙語
ro 羅馬尼亞語
ru 俄語
sk 斯洛伐克語
sl 斯洛維尼亞語
sv 瑞典語
sw 斯瓦希里語
ta 泰米爾語
te Telugu
th 泰語
tr 土耳其語
uk 烏克蘭語
ur Urdu
vi 越南語
yue 粵語
zh 簡體中文

使用 MAI-Transcribe 搭配 Voice Live

你也可以在 Voice Live API 中使用 MAI-Transcribe 模型來進行輸入音訊轉錄。 在 model 工作階段設定中設定 input_audio_transcription 欄位。 詳情請參閱 如何自訂 Voice Live 輸入與輸出