OpenAIのテキスト読み上げ音声とは何ですか?

Foundry Tools の音声である Azure Speech と同様に、OpenAI のテキスト音声変換では、高品質の音声合成により、書かれたテキストを自然な音声に変換します。 これにより、イマーシブでインタラクティブなユーザー エクスペリエンスの可能性が広がっています。

OpenAI テキスト読み上げ音声は、 NeuralNeuralHDの 2 つのモデル バリアントを介して使用できます。

  • Neural: 待機時間が最も短いが、 NeuralHDよりも品質が低いリアルタイムユース ケース向けに最適化されています。
  • NeuralHD:品質に最適化されています。

Foundry Tools で使用可能なテキスト読み上げ音声

「OpenAI テキスト読み上げ音声を使用する場合は、Microsoft Foundry Models の Azure OpenAI または Azure Speech を使用する必要がありますか? どちらを使用するべきかをガイドしてくれるシナリオにはどのようなものがありますか?

各音声モデルには個別の機能が用意されており、特定のニーズに最も適したものを選択できます。 Foundry Tools で使用可能なテキスト読み上げ音声のオプションと違いを理解する必要があります。

Foundry Tools では、テキスト読み上げ用の音声を次から選択できます。

  • Azure OpenAI における OpenAI のテキスト読み上げ音声。 サポートされているリージョンの現在の一覧については、 Speech Service リージョンの表を参照してください。
  • Azure Speech で利用可能な OpenAI のテキスト音声合成。 サポートされているリージョンの現在の一覧については、 Speech Service リージョンの表を参照してください。
  • Azure Speech サービスのテキスト読み上げ音声。 数十のリージョンで利用できます。 リージョンの 一覧を参照してください。

OpenAI テキスト読み上げ音声の使用 (Azure OpenAI 経由または Azure Speech 経由)

OpenAI テキスト読み上げ音声を使用する場合は、Azure OpenAI または Azure Speech を使用して使用するかを選択できます。 Voice Gallery にアクセスして、Azure OpenAI 音声のサンプルを聞いたり、Audio コンテンツ作成を使用して独自のテキストで音声を合成したりできます。 オーディオ出力はどちらの場合も同じですが、2 つのサービス間の機能の違いはわずかです。 詳細については、次の表を参照してください。

OpenAI での OpenAI テキスト読み上げ音声と、Azure Azure Speech での OpenAI テキスト読み上げ音声の機能の比較を次に示します。

機能 Azure OpenAI (OpenAI ボイス) Azure Speech (OpenAI ボイス) Azure スピーチボイス
地域 Foundry Models リージョンの表を参照してください Foundry Models リージョンの表を参照してください 数十のリージョンで利用できます。 リージョンの 一覧を参照してください。
音声の種類 6 12 500 を超える
多言語音声番号 6 12 49
多言語の最大カバレッジ 57 57 77
音声合成マークアップ言語 (SSML) のサポート サポートされていません SSML 要素のサブセットのサポート。 Azure Speech での フル セットの SSML のサポート。
開発オプション REST API Speech SDK、Speech CLI、REST API Speech SDK、Speech CLI、REST API
デプロイ オプション クラウドのみ クラウドのみ クラウド、埋め込み、ハイブリッド、コンテナー。
リアルタイムまたはバッチ合成 リアルタイム リアルタイム リアルタイムおよびバッチ合成
遅延 500 ミリ秒を超える 500 ミリ秒を超える 300 ミリ秒未満
合成オーディオのサンプル レート 24 kHz 8、16、24、48 kHz 8、16、24、48 kHz
音声出力オーディオ形式 opus、mp3、aac、flac opus、mp3、pcm、truesilk opus、mp3、pcm、truesilk

Azure Speech には、OpenAI 音声では使用できない追加の機能があります。 例えば:

使用可能な OpenAI テキスト読み上げ音声

Azure OpenAI で使用可能な OpenAI 音声は次のとおりです。

  • alloy
  • echo
  • fable
  • onyx
  • nova
  • shimmer

Azure Speech で使用できる OpenAI 音声は次のとおりです。

  • en-US-AlloyMultilingualNeural
  • en-US-EchoMultilingualNeural
  • en-US-FableMultilingualNeural
  • en-US-OnyxMultilingualNeural
  • en-US-NovaMultilingualNeural
  • en-US-ShimmerMultilingualNeural
  • en-US-AlloyMultilingualNeuralHD
  • en-US-EchoMultilingualNeuralHD
  • en-US-FableMultilingualNeuralHD
  • en-US-OnyxMultilingualNeuralHD
  • en-US-NovaMultilingualNeuralHD
  • en-US-ShimmerMultilingualNeuralHD

Azure Speech の OpenAI テキスト読み上げ音声でサポートされる SSML 要素

入力テキストを含む 音声合成マークアップ言語 (SSML) によって、テキスト読み上げ出力の構造、コンテンツ、およびその他の特性が決まります。 たとえば、SSML を使用して、段落、文、中断または一時停止、または無音を定義できます。 テキストをブックマークや口形素などのイベント タグで囲んで、後でアプリケーションで処理できます。

次の表は、Azure Speech の OpenAI テキスト読み上げ音声でサポートされる音声合成マークアップ言語 (SSML) 要素の概要を示しています。 OpenAI 音声では、次の SSML タグのサブセットのみがサポートされます。 詳細については、 SSML ドキュメントの構造とイベント を参照してください。

SSML 要素名 説明
<speak> 読み上げるコンテンツ全体を囲みます。 これは SSML ドキュメントのルート要素です。
<voice> テキスト読み上げ出力に使用する音声を指定します。
<sub> 要素で囲まれたテキストではなく、エイリアス属性のテキスト値を発音する必要があることを示します。
<say-as> 要素のテキストのコンテンツ タイプ (数値や日付など) を示します。

この要素では、interpret-asを除くすべてのinterpret-as="name"プロパティ値がサポートされます。 たとえば、 <say-as interpret-as="date" format="dmy">10-12-2016</say-as> はサポートされていますが、 <say-as interpret-as="name">ED</say-as> はサポートされていません。 詳細については、 SSML の発音を参照してください。
<s> 文を表します。
<lang> ニューラル音声を読み上げる言語の既定のロケールを示します。
<break> 単語間の区切りや一時停止の既定の動作をオーバーライドするために使用します。
  • Azure Speech でテキスト音声変換のクイックスタートを試してみてください。
  • Azure OpenAI