MAI-Voice (プレビュー) とは

メモ

この機能は現在、パブリック プレビュー段階です。 このプレビュー版はサービス レベル アグリーメントなしで提供されています。運用環境のワークロードに使用することはお勧めできません。 特定の機能がサポートされていないか、機能が制限されている可能性があります。 詳細については、「Microsoft Azure プレビューの使用条件を参照してください。

MAI-Voice は、パブリック プレビューの Foundry Tools の Azure Speech で使用できるテキスト読み上げモデルのファミリです。 Microsoftの社内音声基盤モデルに基づいて構築された MAI-Voice モデルは、一貫した音声ペルソナ品質で表現力豊かな自然な音声出力を生成します。

Speech には、次の MAI-Voice モデルが用意されています。

モデル 音声カウント 主な特性 最適な用途
MAI-Voice-2-Flash 15 以上の言語にわたる事前構築済みの音声 超高速の低遅延、感情豊かで表現力の高い多言語、15 言語と 18 ロケール、インスタント音声複製 (ゲート)、SSML によるきめ細かい感情制御をサポート リアルタイム音声エージェントとアシスタント、低遅延のコール センター/IVR フロー、多言語対話型エクスペリエンス
MAI-Voice-2 15 以上の言語にわたる事前構築済みの音声 感情豊かで表現力が高く、高忠実度の多言語音声。15言語・18ロケール対応、即時音声クローニング(制限付き)、話者の一貫性を保った長文生成、SSMLによるきめ細かな感情制御に対応。 表現力豊かな長い形式のコンテンツ、教育コンテンツ、オーディオブック/ポッドキャスト、ボイスオーバー

モデルの詳細

MAI-Voice-2-Flash は、高速で待機時間の短い生成用に構築されたテキスト読み上げモデルです。 15 の言語で高忠実性、自然性、表現力に優れた音声を生成し、リアルタイムの応答性を実現するために最適化されている一方で、ゲート付きのインスタント音声複製をサポートします。 人間のようなイントネーション、リズム、感情の微妙な差異により、音声エージェント、アシスタント、待機時間とコストが重要なその他の対話型シナリオに最適です。

SSML 経由で、また Voice Live 経由で Azure Speech SDK を使用して MAI-Voice-2-Flash と統合できます。

主な機能

主な機能 説明
超高速低遅延合成 非常に短い待機時間でリアルタイムのテキスト読み上げ用に構築され、対話型の音声シナリオに適しています。
忠実度の高い自然合成 人間のようなリズムとイントネーションを備えた、自然で表現力豊かで感情豊かで明瞭な音声出力を生成します。
多言語サポート 15 言語と 18 ロケールの合成をサポートします。
感情とスタイルコントロール 開発者は、 mstts:express-asstyleで SSML を使用して話し方に影響を与え、 joyexcitementempathyなどの感情を制御できます。
即時クローニングによる音声プロンプティング(制限付き) 追加の学習を行うことなく、短い音声クリップ(5~60秒)から、使用許諾を得た参照音声に一致する音声を生成します。
音声ライブラリ 迅速な展開のためにすぐに動作する 15 以上の言語用のライセンスされた精選された音声が含まれています。
リアルタイム エージェントの最適化 応答性が重要な音声エージェント、アシスタント、IVR、コール センターの対話に最適化されています。

前提 条件

MAI 関連モデルを使用するには、次の手順を実行します。


SSML の例

例では、次の音声を使用します。

音声ID 性別
en-us-Harper:MAI-Voice-2-Flash 女性
en-us-Ethan:MAI-Voice-2-Flash 男性

基本的な SSML の例 (ハーパー):

<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
  <voice xml:lang='en-US' name='en-US-Harper:MAI-Voice-2-Flash'>
    hello world, it's very great
  </voice>
</speak>

基本的な SSML の例 (イーサン):

<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
  <voice xml:lang='en-US' name='en-US-Ethan:MAI-Voice-2-Flash'>
    hello world, it's very great, hello world, it's very great?
  </voice>
</speak>

SSML を使用した表現制御 mstts:express-as

<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
  <voice xml:lang='en-US' name='en-US-Ethan:MAI-Voice-2-Flash'>
    <mstts:express-as style="excited">
       hello world, it's very great, hello world, it's very great?
    </mstts:express-as>
  </voice>
</speak>

事前構築済みの音声

音声名 (ShortName) ロケール Language 性別 サポートされているスタイル
de-DE-Klaus:MAI-Voice-2-Flash de-DE ドイツ語 (ドイツ) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
de-DE-Mia:MAI-Voice-2-Flash de-DE ドイツ語 (ドイツ) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
en-AU-Isla:MAI-Voice-2-Flash 英語(オーストラリア) 英語 (オーストラリア) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
en-US-Ethan:MAI-Voice-2-Flash en-US 英語 (米国) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
en-US-ハーパー:MAI-Voice-2-Flash en-US 英語 (米国) 女性 怒っている、混乱している、決意した、恥ずかしい、興奮している、幸せ、希望に満ちた、喜びにあふれた、後悔している、安心した、悲しい、叫んでいる、柔らかい声、ささやいている
en-US-Olivia:MAI-Voice-2-Flash en-US 英語 (米国) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
es-ES-マルタ:MAI-Voice-2-Flash es-ES スペイン語 (スペイン) 女性 冒険的、思いやりのある、共感的、好奇心旺盛、励ますような、わくわくした、フレンドリーな、陽気な、ノスタルジックな、内省的な、悲しい、失望した、真剣な
es-MX-Alejo:MAI-Voice-2-Flash es-MX スペイン語 (メキシコ) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
es-MX-Valeria:MAI-Voice-2-Flash es-MX スペイン語 (メキシコ) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
fr-FR-Marc:MAI-Voice-2-Flash fr-FR フランス語 (フランス) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
fr-FR-Soleil:MAI-Voice-2-Flash fr-FR フランス語 (フランス) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
hi-IN-Arjun:MAI-Voice-2-Flash hi-IN ヒンディー語 (インド) 男性 怒った、困惑した、うんざりした、恥ずかしい、興奮した、恐れた、幸せな、希望に満ちた、嫉妬した、喜びに満ちた、後悔した、悲しい、驚いた
hi-IN-Dhruv:MAI-Voice-2-Flash hi-IN ヒンディー語 (インド) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
hi-IN-Kavya:MAI-Voice-2-Flash hi-IN ヒンディー語 (インド) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
hi-IN-Priya:MAI-Voice-2-Flash hi-IN ヒンディー語 (インド) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
hu-HU-Bence:MAI-Voice-2-Flash hu-HU ハンガリー語 (ハンガリー) 男性
hu-HU-Levente:MAI-Voice-2-Flash hu-HU ハンガリー語 (ハンガリー) 男性
hu-HU-Lilla:MAI-Voice-2-Flash hu-HU ハンガリー語 (ハンガリー) 女性
hu-HU-Réka:MAI-Voice-2-Flash hu-HU ハンガリー語 (ハンガリー) 女性
it-IT-Luca:MAI-Voice-2-Flash it-IT イタリア語 (イタリア) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
it-IT-Rosa:MAI-Voice-2-Flash it-IT イタリア語 (イタリア) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
ko-KR-Haena:MAI-Voice-2-Flash ko-KR 韓国語 (韓国) 女性 怒った, 混乱した, 決意した, 恥ずかしい, 興奮した, 幸せ, 希望に満ちた, 喜びに満ちた, 後悔した, 安心した, 悲しい, やわらかい声, 驚いた
ko-KR-Junho:MAI-Voice-2-Flash ko-KR 韓国語 (韓国) 男性 怒り、戸惑い、決意、恥ずかしさ、興奮、喜び、希望、嬉しさ、安堵、悲しみ、優しい声
nl-NL-Sander:MAI-Voice-2-Flash nl-NL オランダ語 (オランダ) 男性 冒険的, 思いやりのある, 共感的, 好奇心旺盛, 励みになる, 興奮した, フレンドリーな, 陽気な, ノスタルジック, 内省的, 悲しい, 失望した, 深刻
pt-BR-Caio:MAI-Voice-2-Flash pt-BR ポルトガル語 (ブラジル) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
pt-BR-Luana:MAI-Voice-2-Flash pt-BR ポルトガル語 (ブラジル) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
pt-BR-Pedro:MAI-Voice-2-Flash pt-BR ポルトガル語 (ブラジル) 男性 戸惑い、決意、恥ずかしさ、興奮、喜び、希望、嬉しさ、後悔、安堵、悲しみ、優しい声、驚き
pt-BR-Rafael:MAI-Voice-2-Flash pt-BR ポルトガル語 (ブラジル) 男性 怒った, 混乱した, 決意した, 恥ずかしい, 興奮した, 幸せ, 希望に満ちた, 喜びに満ちた, 後悔した, 安心した, 悲しい, やわらかい声, 驚いた
pt-PT-Rui:MAI-Voice-2-Flash pt-PT ポルトガル語 (ポルトガル) 男性 怒った, 混乱した, 決意した, 恥ずかしい, 興奮した, 幸せ, 希望に満ちた, 喜びに満ちた, 後悔した, 安心した, 悲しい, やわらかい声, 驚いた
ro-RO-Andrei:MAI-Voice-2-Flash ro-RO ルーマニア語 (ルーマニア) 男性
ro-RO-Elena:MAI-Voice-2-Flash ro-RO ルーマニア語 (ルーマニア) 女性
ro-RO-Ioana:MAI-Voice-2-Flash ro-RO ルーマニア語 (ルーマニア) 女性
ro-RO-Radu:MAI-Voice-2-Flash ro-RO ルーマニア語 (ルーマニア) 男性
ru-RU-Lev:MAI-Voice-2-Flash ru-RU ロシア語 (ロシア) 男性 冒険的, 思いやりがある, 共感力がある, 好奇心旺盛, 励みになる, わくわくした, 親しみやすい, 明るい, ノスタルジック, 内省的, 悲しい, 失望した, 真面目
ru-RU-Masha:MAI-Voice-2-Flash ru-RU ロシア語 (ロシア) 女性 冒険的な, 思いやりのある, 共感力のある, 好奇心旺盛な, 励ましてくれる, 興奮した, 親しみやすい, 明るい, ノスタルジックな, 内省的な, 悲しい, 失望した, 真剣な
th-TH-Krit:MAI-Voice-2-Flash th-TH タイ語 (タイ) 男性 冒険的, 思いやり, 共感, 好奇心旺盛, 励ましに満ちた, 興奮した, フレンドリー, 陽気, ノスタルジック, 内省的, 悲しい, 失望した, 深刻
th-TH-Nattapong:MAI-Voice-2-Flash th-TH タイ語 (タイ) 男性 冒険的、思いやりがある、共感的、好奇心旺盛、励みになる、興奮した、フレンドリー、陽気な、ノスタルジック、内省的、悲しい、がっかりした、真面目な
tr-TR-Aydın:MAI-Voice-2-Flash tr-TR トルコ語 (Türkiye) 男性 冒険的な, 思いやりのある, 共感, 好奇心旺盛な, 励ましになる, 興奮した, フレンドリーな, 陽気な, ノスタルジックな, 内省的な, 悲しい, がっかりした, シリアスな
tr-TR-Elif:MAI-Voice-2-Flash tr-TR トルコ語 (Türkiye) 女性 冒険的な, 思いやりのある, 共感的な, 好奇心旺盛な, 励みになる, わくわくした, フレンドリーな, 陽気な, ノスタルジックな, 内省的な, 悲しい, 失望した, 真剣な
zh-CN-Bo:MAI-Voice-2-Flash zh-CN 中国語 (標準、簡体字) 男性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
zh-CN-Lan:MAI-Voice-2-Flash zh-CN 中国語 (標準、簡体字) 女性 怒り、混乱、嫌悪感、恥ずかしい、興奮した、恐ろしい、幸せ、喜び、悲しい、驚いた
zh-CN-Mei:MAI-Voice-2-Flash zh-CN 中国語 (標準、簡体字) 女性 怒り、困惑、決意、嫌悪、恥ずかしさ、興奮、恐怖、喜び、希望、嫉妬、歓喜、後悔、安堵、悲しみ、叫び、優しい声、驚き、ささやき
zh-CN-Wei:MAI-Voice-2-Flash zh-CN 中国語 (標準、簡体字) 男性 怒った、困惑した、うんざりした、恥ずかしい、興奮した、恐れた、幸せな、希望に満ちた、嫉妬した、喜びに満ちた、後悔した、悲しい、驚いた

使用法: サード パーティの開発者が利用できます。 Microsoftは、商用使用のための完全なライセンス権を保持します。

MAI-Voice モデルを使用する

MAI-Voice モデルでは、他のAzureニューラル音声や HD 音声と同じAzure Speech API と SDK が使用されます。 SSML name 要素の<voice>属性で音声名を使用します。 使用可能な名前については、前のセクションの事前構築済みの音声テーブルを参照してください。

Foundry ポータルで MAI-Voice 音声を試します。

  1. テキスト読み上げ機能ページにアクセスし、プレイグラウンドで開く を選択します。
  2. [音声] ドロップダウンから MAI-Voice 音声を選択します。
  3. テキスト ボックスにサンプル テキストを入力します。
  4. 合成された音声を読み上げるには、[ 再生 ] を選択します。

SSML POST 要求を Speech リソースの cognitiveservices/v1 エンドポイントに送信します。 YourRegionを Speech リソース リージョンに置き換え、<YourSpeechResourceKey>をリソース キーに置き換えます。

curl -X POST \
  "https://YourRegion.tts.speech.microsoft.com/cognitiveservices/v1" \
  --header "Content-Type: application/ssml+xml" \
  --header "X-Microsoft-OutputFormat: audio-24khz-160kbitrate-mono-mp3" \
  --header "Ocp-Apim-Subscription-Key: <YourSpeechResourceKey>" \
  --data '<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
  <voice name="en-US-Harper:MAI-Voice-2">
    Hello, this is a sample from MAI Voice.
  </voice>
</speak>' \
  --output output.mp3

音声名を、上記の事前構築済みの音声テーブルの MAI-Voice 音声に置き換えます。

次のコードでは、Azure Speech SDK を使用して音声を合成し、オーディオをoutput.mp3に保存します。 <key>を Speech リソース キーに置き換えます。

import azure.cognitiveservices.speech as speechsdk

speech_config = speechsdk.SpeechConfig(
    subscription="<key>", region="eastus"
)
audio_config = speechsdk.audio.AudioOutputConfig(filename="output.mp3")
speech_config.set_speech_synthesis_output_format(
    speechsdk.SpeechSynthesisOutputFormat.Audio24Khz160KBitRateMonoMp3
)
synthesizer = speechsdk.SpeechSynthesizer(
    speech_config=speech_config, audio_config=audio_config
)

ssml = """
<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
  <voice name='en-US-Harper:MAI-Voice-2-Flash'>
    <mstts:express-as style="excitement">Hello world.</mstts:express-as>
  </voice>
</speak>
"""

synthesizer.speak_ssml_async(ssml).get()

成功すると、 output.mp3 ファイルが現在のディレクトリに保存されます。 音声名を、上記の事前構築済みの音声テーブルの MAI-Voice 音声に置き換えます。

テキスト読み上げのクイックスタートに従ってください。 SSML では、name要素の<voice>属性で MAI-Voice 音声名を使用します。 使用可能な名前については、上記の事前構築済みの音声テーブルを参照してください。

テキスト読み上げのクイックスタートに従ってください。 SSML では、name要素の<voice>属性で MAI-Voice 音声名を使用します。 使用可能な名前については、上記の事前構築済みの音声テーブルを参照してください。

テキスト読み上げのクイックスタートに従ってください。 SSML では、name要素の<voice>属性で MAI-Voice 音声名を使用します。 使用可能な名前については、上記の事前構築済みの音声テーブルを参照してください。

次の手順