備註
這項功能目前處於公開預覽狀態。 此預覽版是在沒有服務等級協定的情況下提供,不建議用於生產工作負載。 可能不支援特定功能,或可能已經限制功能。 如需詳細資訊,請參閱 Microsoft Azure 預覽版增補使用條款。
語音轉換是將給定語音的語音特性轉換成目標講者聲音的過程。 語音轉換後,產生的音訊保留了原始音訊的語言內容與韻律,而語音音色則聽起來像是目標說話者。
使用者需要語音轉換功能有三個原因:
- 語音轉換可以使用不同的語音身分識別來復寫您的內容,同時維持原始的音調和情感。 例如,在教育領域,老師可以錄製自己朗讀故事的過程,而語音轉換則可以用預先設計好的卡通角色聲音來傳達這些故事。 這種方法保留了老師閱讀的表達性,同時結合卡通人物聲音的獨特音調。
- 另一個應用程式是多語系的配音。 當不同語音讀取當地語系化內容時,語音轉換可以將它們轉換成統一的語音,確保所有語言的一致體驗,同時保留最本地化的語音字元。
- 語音轉換能增強對聲音表現力的控制。 藉由轉換各種說話風格,例如採用獨特的語氣或傳達誇張的情緒,語音在表達中獲得更大的多功能性,而且在不同的案例中可能更具動態性。
主要功能
語音轉換(或語音轉換器或語音轉換轉換)是以最先進的生成模型為基礎,並提供高品質的語音轉換。 它提供下列核心功能:
| 能力 | 說明 |
|---|---|
| 高語音相似度 | 擷取目標說話者的音調和聲樂識別。 產生正確符合目標語音的音訊。 |
| 韻律保留 | 維護來源音訊的節奏、重音和音調。 保持表達和情感品質。 |
| 高音訊逼真度 | 產生逼真的自然音訊。 將成品最小化。 |
| 多語系支援 | 啟用多語系語音轉換。 支援 91 個地區設定(與標準文字到語音地區設定支援相同)。 如需完整清單,請參閱 語音轉換的支援語音。 |
使用語音轉換
您可以使用 Azure Speech in Foundry Tools 語音轉換搭配語音 SDK 或文字轉換語音 REST API。
使用透過語音合成標記語言 (SSML) 的 <mstts:voiceconversion> 標記來指定來源音訊 URL 和轉換的目標語音。 如需完整的支援目標語音清單,請參閱 語音轉換所支援的語音清單。
範例 SSML
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice xml:lang="en-US" xml:gender="Female" name="en-US-AvaMultilingualNeural">
<mstts:voiceconversion url="https://your.blob.core.windows.net/sourceaudio.wav"/>
</voice>
</speak>
如需 SSML 結構和使用方式的詳細資訊,請參閱 語音合成標記語言 (SSML) 參考 檔。