Voice Live 提供多種選項,透過自訂模型優化效能與品質。 目前提供以下自訂選項:
- 語音輸入自訂:
- 短語清單:基於工作階段設定中提供的單字或片語清單進行輕量級即時自訂,以提升辨識品質。 欲了解更多,請參閱 「透過短語清單提升識別準確度」。
- 客製化語音:透過客製化語音,您可以評估並提升應用程式與產品的語音辨識準確度,並根據企業需求微調辨識品質。 請參閱 什麼是客製化語音? 以了解更多。
- 語音輸出自訂:
- 自訂詞彙:自訂詞彙表讓您輕鬆自訂標準 Azure 文字轉語音和自訂語音的發音,以提升語音合成的準確度。 欲了解更多,請參閱 自訂詞彙表的文字轉語音 。
- 自訂語音:客製化語音有兩種類型。 專業客製化聲音能讓你打造出高度自然的品牌或角色聲音,透過提供人類語音樣本作為微調數據。 個人版語音可讓使用者透過簡短語音樣本,取得其自身聲音的 AI 生成複寫。 請參閱 什麼是自訂聲音? 以及 什麼是個人聲音? 以了解更多資訊。
- 自訂化身:自訂文字轉語音化身讓你能為你的應用程式創造一個客製化、獨一無二的合成語音化身。 自訂文字轉語音虛擬化身,您可以提供所選演員的影片錄製資料,打造一個獨特且自然外觀的虛擬化身,用於您的產品或品牌。 請參閱 什麼是自訂文字轉語音頭像? 以了解更多。
語音輸入自訂
短語列表
使用詞彙清單,方便即時自訂音訊輸入。 要設定詞組清單,可以在 session.update 訊息中設定phrase_list。
{
"session": {
"input_audio_transcription": {
"model": "azure-speech",
"phrase_list": ["Neo QLED TV", "TUF Gaming", "AutoQuote Explorer"]
}
}
}
註
片語清單目前不支援 whisper-1、gpt-4o-transcribe、gpt-4o-mini-transcribe 和 gpt-4o-transcribe-diarize。 想了解更多關於短語清單的資訊,請參閱 語音轉文字的短語清單。
自訂語音配置
你可以用custom_speech欄位來指定自訂語音模型。 此欄位定義為字典,每個鍵代表一個區域代碼,每個值對應自訂語音模型的 。Model ID 欲了解更多自訂語音資訊,請參閱 「什麼是自訂語音?」。
Voice Live 支援使用基礎模型與自訂模型的組合,只要每種類型在特定地點都是獨一無二的,且最多指定 10 種語言即可。
範例會話配置與自訂語音模型。 在此範例中,當偵測到的語言是英語時,會使用基礎模型;當偵測到的語言是中文時,則使用自訂語音模型。
{
"session": {
"input_audio_transcription": {
"model": "azure-speech",
"language": "en",
"custom_speech": {
"zh-CN": "847cb03d-7f22-4b11-444-e1be1d77bf17"
}
}
}
}
註
若要在 Voice Live API 中使用自訂語音模型,該模型必須在你用來呼叫 Voice Live API 的同一 Microsoft Foundry 資源中提供。 如果你在不同的 Microsoft Foundry 或 Azure Speech 資源下使用 Foundry Tools 訓練了模型,那麼你必須將該模型複製到你用來呼叫 Voice Live API 的資源中。
自訂語音訓練和模型託管則需另外付費。
自訂語音僅支援 azure-speech 模型。
語音輸出自訂
自訂詞彙表
使用 custom_lexicon_url 字串屬性來自訂標準Azure文字轉語音和自訂語音的發音。 欲了解更多如何格式化自訂詞彙表(與語音合成標記語言(SSML)同),請參閱 文字轉語音的自訂詞彙表。
{
"voice": {
"name": "en-US-Ava:DragonHDLatestNeural",
"type": "azure-standard",
"temperature": 0.8, // optional
"custom_lexicon_url": "<custom lexicon url>"
}
}
Azure 自訂語音
你可以用自訂語音來輸出音訊。 客製化語音有兩種類型:專業客製化語音,透過品牌或角色的錄音室錄音訓練,以及個人語音,透過短語音樣本複製使用者的聲音。
註
若要使用自訂語音模型搭配 Voice Live API,該模型必須在你用來呼叫 Voice Live API 的 Microsoft Foundry 資源中提供。 如果你是在其他 Microsoft Foundry 或 Azure Speech 資源上訓練模型,你必須將模型複製到你使用的資源中,才能呼叫 Voice Live API。 你要分開支付客製化語音訓練和模型託管費用。 欲了解更多支援區域資訊,請參閱 語音服務支援區域。
專業訂製聲音
專業客製化語音能讓你為應用打造獨一無二、客製化的合成語音,提供人類語音樣本作為微調資料。 關於如何建立自訂語音的資訊,請參閱 「什麼是自訂語音」。
{
"voice": {
"type": "azure-custom",
"name": "en-US-CustomNeural",
"endpoint_id": "your-endpoint-id", // a guid string
"temperature": 0.8 // optional, value range 0.0-1.0, only take effect when using HD voices
}
}
個人聲音
個人版語音可讓使用者透過簡短語音樣本,取得其自身聲音的 AI 生成複寫。 關於如何創造個人聲音的資訊,請參閱 「什麼是個人聲音」。
{
"voice": {
"type": "azure-personal",
"model": "DragonLatestNeural", // required, specify the base model for personal voice
"name": "your-personal-voice-name", // the name of the personal voice
"temperature": 0.8 // optional, value range 0.0-1.0
}
}
該 model 屬性指定了基礎型號的語音名稱。 支援的基本型號名稱包括 DragonLatestNeural、以及 DragonHDOmniLatestNeuralMAI-Voice-1。 欲了解更多基礎模型差異,請參閱「 在申請中使用個人語音」。 完整架構請參見 RealtimeAzurePersonalVoice。
Azure 自訂虛擬形象
文字轉語音化身 將文字轉換成包含寫真人類形象的數位影片(無論是標準化身還是自訂文字轉語音化身),以自然的語音進行說話。
自訂頭像的配置與標準頭像的配置並無差異。 詳細範例請參考如何使用 Voice Live API - Azure文字轉語音化身 avatar。
註
若要使用自訂語音模型搭配 Voice Live API,該模型必須在你用來呼叫 Voice Live API 的 Microsoft Foundry 資源中提供。 如果你是在其他 Microsoft Foundry 或 Azure Speech 資源上訓練模型,你必須將模型複製到你使用的資源中,才能呼叫 Voice Live API。 自訂頭像訓練和模型主機費用是另外付費的。 欲了解更多支援區域資訊,請參閱 語音服務支援區域。
自訂虛擬化身的語音同步
如果你已訓練自訂影片頭像,並同時搭配 頭像語音同步,即可將該語音用作合成語音。 設定 voice.type to avatar-voice-sync 和 voice.model 為基礎模型來同步語音。 支援的基礎型號名稱包括 DragonLatestNeural、 DragonHDOmniLatestNeural、 MAI-Voice-1和 。 欲了解更多基礎模型差異,請參閱「 在申請中使用個人語音」。 想了解更多關於透過語音同步訓練的自訂化身,請參考「 什麼是自訂文字轉語音化身?」。
{
"voice": {
"type": "avatar-voice-sync",
"model": "DragonHDOmniLatestNeural",
"temperature": 0.8 // optional, value range 0.0-1.0
}
}
使用時 avatar-voice-sync ,聲音會綁定到自訂頭像; name 這個屬性並非必需。 請使用avatar參數分別設定自訂頭像,如Azure文字轉語音avatar所示。
相關內容
- 試試 Voice Live API 快速入門功能
- 了解更多如何使用 Voice Live API