VoiceAgentInputTranscription interface
非同期入力-音声書き起こし構成。 OpenAIのリアルタイム文字起こしオプションを拡張し、AzureおよびMAIの文字起こしモデル、カスタム音声モデル、フレーズヒントを活用します。
プロパティ
| custom_speech | オプションで顧客向けのカスタム音声展開構成(ロケーションごとにキー化)。 |
| delay | モデルが文字起こしテキストを出すまでの待ち時間を制御します。
高い値は遅延を伴って転写精度を向上させることができます。
GAのリアルタイムセッションでは |
| keywords | 入力音声の文字起こしを導く言葉やフレーズ。
|
| language | 入力音声の言語。
ISO-639-1 (例: |
| languages | 入力音声の可能な言語( ISO-639-1 形式)。
|
| model | 転写モデル識別子。 顧客のカスタム音声展開を |
| phrase_list | オプションフレーズは、ドメイン用語へのバイアス認識を示唆しています。 |
| prompt | モデルのスタイルをガイドしたり、前の音声セグメントを続けるためのオプションテキスト。
|
プロパティの詳細
custom_speech
オプションで顧客向けのカスタム音声展開構成(ロケーションごとにキー化)。
custom_speech?: Record<string, string>
プロパティ値
Record<string, string>
delay
モデルが文字起こしテキストを出すまでの待ち時間を制御します。
高い値は遅延を伴って転写精度を向上させることができます。
GAのリアルタイムセッションでは gpt-realtime-whisper のみサポートされています。
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
プロパティ値
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
入力音声の文字起こしを導く言葉やフレーズ。
gpt-transcribeとgpt-live-transcribeの支援を受けています。
keywords?: string[]
プロパティ値
string[]
language
languages
入力音声の可能な言語( ISO-639-1 形式)。
gpt-transcribeとgpt-live-transcribeの支援を受けています。
languages?: string[]
プロパティ値
string[]
model
転写モデル識別子。 顧客のカスタム音声展開を custom_speechで設定してください。
model: VoiceAgentInputTranscriptionModel
プロパティ値
phrase_list
オプションフレーズは、ドメイン用語へのバイアス認識を示唆しています。
phrase_list?: string[]
プロパティ値
string[]
prompt
モデルのスタイルをガイドしたり、前の音声セグメントを続けるためのオプションテキスト。
whisper-1の場合、プロンプトはキーワードの一覧です。
gpt-4o-transcribe モデル (gpt-4o-transcribe-diarize を除く) の場合、プロンプトはフリー テキスト文字列です (たとえば、"テクノロジに関連する単語を想定する" など)。
プロンプトはGAのリアルタイムセッションで gpt-realtime-whisper には対応していません。
prompt?: string
プロパティ値
string