VoiceAgentInputTranscription interface

Asynchrone Eingangs-Audio-Transkriptionskonfiguration. Erweitert die OpenAI Echtzeit-Transkriptionsoptionen um die Azure- und MAI-Transkriptionsmodelle, benutzerdefinierte Sprachmodelle und Phrasenhinweise.

Eigenschaften

custom_speech

Optionale kundenspezifische Sprachbereitstellungskonfiguration, die nach Standort gesteuert wird.

delay

Kontrolliert, wie lange das Modell wartet, bevor es Transkriptionstext ausgibt. Höhere Werte können die Transkriptionsgenauigkeit verbessern, allerdings auf Kosten der Latenz. Nur mit Echtzeitsitzungen in GA unterstützt gpt-realtime-whisper .

keywords

Wörter oder Phrasen zur Anleitung der Transkription des Eingabeaudios. Unterstützt von gpt-transcribe und gpt-live-transcribe.

language

Die Sprache des Eingabeaudios. Durch die Bereitstellung der Eingabesprache in ISO-639-1 (z. B. en) wird die Genauigkeit und Latenz verbessert.

languages

Mögliche Sprachen des Eingabeaudios im ISO-639-1-Format . Unterstützt von gpt-transcribe und gpt-live-transcribe.

model

Die Identifikatorin des Transkriptionsmodells. Konfigurieren Sie kundenspezifische Sprachbereitstellungen in custom_speech.

phrase_list

Optionale Phrase deutet darauf hin, dass die Erkennung zugunsten von Domänenbegriffen verzerrt wird.

prompt

Ein optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Audiosegment fortzusetzen. Für whisper-1, ist der Prompt eine Liste von Schlüsselwörtern. Bei gpt-4o-transcribe Modellen (mit Ausnahme gpt-4o-transcribe-diarize) ist die Eingabeaufforderung eine freie Textzeichenfolge, z. B. "Wörter im Zusammenhang mit Technologie erwarten". Prompt wird in GA Realtime-Sitzungen nicht unterstützt gpt-realtime-whisper .

Details zur Eigenschaft

custom_speech

Optionale kundenspezifische Sprachbereitstellungskonfiguration, die nach Standort gesteuert wird.

custom_speech?: Record<string, string>

Eigenschaftswert

Record<string, string>

delay

Kontrolliert, wie lange das Modell wartet, bevor es Transkriptionstext ausgibt. Höhere Werte können die Transkriptionsgenauigkeit verbessern, allerdings auf Kosten der Latenz. Nur mit Echtzeitsitzungen in GA unterstützt gpt-realtime-whisper .

delay?: "low" | "medium" | "high" | "minimal" | "xhigh"

Eigenschaftswert

"low" | "medium" | "high" | "minimal" | "xhigh"

keywords

Wörter oder Phrasen zur Anleitung der Transkription des Eingabeaudios. Unterstützt von gpt-transcribe und gpt-live-transcribe.

keywords?: string[]

Eigenschaftswert

string[]

language

Die Sprache des Eingabeaudios. Durch die Bereitstellung der Eingabesprache in ISO-639-1 (z. B. en) wird die Genauigkeit und Latenz verbessert.

language?: string

Eigenschaftswert

string

languages

Mögliche Sprachen des Eingabeaudios im ISO-639-1-Format . Unterstützt von gpt-transcribe und gpt-live-transcribe.

languages?: string[]

Eigenschaftswert

string[]

model

Die Identifikatorin des Transkriptionsmodells. Konfigurieren Sie kundenspezifische Sprachbereitstellungen in custom_speech.

model: VoiceAgentInputTranscriptionModel

Eigenschaftswert

phrase_list

Optionale Phrase deutet darauf hin, dass die Erkennung zugunsten von Domänenbegriffen verzerrt wird.

phrase_list?: string[]

Eigenschaftswert

string[]

prompt

Ein optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Audiosegment fortzusetzen. Für whisper-1, ist der Prompt eine Liste von Schlüsselwörtern. Bei gpt-4o-transcribe Modellen (mit Ausnahme gpt-4o-transcribe-diarize) ist die Eingabeaufforderung eine freie Textzeichenfolge, z. B. "Wörter im Zusammenhang mit Technologie erwarten". Prompt wird in GA Realtime-Sitzungen nicht unterstützt gpt-realtime-whisper .

prompt?: string

Eigenschaftswert

string