什麼是語音轉換? (預覽)

備註

這項功能目前處於公開預覽狀態。 此預覽版是在沒有服務等級協定的情況下提供,不建議用於生產工作負載。 可能不支援特定功能,或可能已經限制功能。 如需詳細資訊,請參閱 Microsoft Azure 預覽版增補使用條款

語音轉換是將給定語音的語音特性轉換成目標講者聲音的過程。 語音轉換後,產生的音訊保留了原始音訊的語言內容與韻律,而語音音色則聽起來像是目標說話者。

使用者需要語音轉換功能有三個原因:

  • 語音轉換可以使用不同的語音身分識別來復寫您的內容,同時維持原始的音調和情感。 例如,在教育領域,老師可以錄製自己朗讀故事的過程,而語音轉換則可以用預先設計好的卡通角色聲音來傳達這些故事。 這種方法保留了老師閱讀的表達性,同時結合卡通人物聲音的獨特音調。
  • 另一個應用程式是多語系的配音。 當不同語音讀取當地語系化內容時,語音轉換可以將它們轉換成統一的語音,確保所有語言的一致體驗,同時保留最本地化的語音字元。
  • 語音轉換能增強對聲音表現力的控制。 藉由轉換各種說話風格,例如採用獨特的語氣或傳達誇張的情緒,語音在表達中獲得更大的多功能性,而且在不同的案例中可能更具動態性。

主要功能

語音轉換(或語音轉換器或語音轉換轉換)是以最先進的生成模型為基礎,並提供高品質的語音轉換。 它提供下列核心功能:

能力 說明
高語音相似度 擷取目標說話者的音調和聲樂識別。
產生正確符合目標語音的音訊。
韻律保留 維護來源音訊的節奏、重音和音調。
保持表達和情感品質。
高音訊逼真度 產生逼真的自然音訊。
將成品最小化。
多語系支援 啟用多語系語音轉換。
支援 91 個地區設定(與標準文字到語音地區設定支援相同)。
如需完整清單,請參閱 語音轉換的支援語音

使用語音轉換

您可以使用 Azure Speech in Foundry Tools 語音轉換搭配語音 SDK 或文字轉換語音 REST API。

使用透過語音合成標記語言 (SSML) 的 <mstts:voiceconversion> 標記來指定來源音訊 URL 和轉換的目標語音。 如需完整的支援目標語音清單,請參閱 語音轉換所支援的語音清單

範例 SSML

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
    <voice xml:lang="en-US" xml:gender="Female" name="en-US-AvaMultilingualNeural">
        <mstts:voiceconversion url="https://your.blob.core.windows.net/sourceaudio.wav"/>
    </voice>
</speak>

如需 SSML 結構和使用方式的詳細資訊,請參閱 語音合成標記語言 (SSML) 參考 檔。