VoiceAgentInputTranscription interface
Asynchrone Eingangs-Audio-Transkriptionskonfiguration. Erweitert die OpenAI Echtzeit-Transkriptionsoptionen um die Azure- und MAI-Transkriptionsmodelle, benutzerdefinierte Sprachmodelle und Phrasenhinweise.
Eigenschaften
| custom_speech | Optionale kundenspezifische Sprachbereitstellungskonfiguration, die nach Standort gesteuert wird. |
| delay | Kontrolliert, wie lange das Modell wartet, bevor es Transkriptionstext ausgibt.
Höhere Werte können die Transkriptionsgenauigkeit verbessern, allerdings auf Kosten der Latenz.
Nur mit Echtzeitsitzungen in GA unterstützt |
| keywords | Wörter oder Phrasen zur Anleitung der Transkription des Eingabeaudios. Unterstützt von |
| language | Die Sprache des Eingabeaudios. Durch die Bereitstellung der Eingabesprache in ISO-639-1 (z. B. |
| languages | Mögliche Sprachen des Eingabeaudios im ISO-639-1-Format . Unterstützt von |
| model | Die Identifikatorin des Transkriptionsmodells. Konfigurieren Sie kundenspezifische Sprachbereitstellungen in |
| phrase_list | Optionale Phrase deutet darauf hin, dass die Erkennung zugunsten von Domänenbegriffen verzerrt wird. |
| prompt | Ein optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Audiosegment fortzusetzen.
Für |
Details zur Eigenschaft
custom_speech
Optionale kundenspezifische Sprachbereitstellungskonfiguration, die nach Standort gesteuert wird.
custom_speech?: Record<string, string>
Eigenschaftswert
Record<string, string>
delay
Kontrolliert, wie lange das Modell wartet, bevor es Transkriptionstext ausgibt.
Höhere Werte können die Transkriptionsgenauigkeit verbessern, allerdings auf Kosten der Latenz.
Nur mit Echtzeitsitzungen in GA unterstützt gpt-realtime-whisper .
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
Eigenschaftswert
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
Wörter oder Phrasen zur Anleitung der Transkription des Eingabeaudios. Unterstützt von gpt-transcribe und gpt-live-transcribe.
keywords?: string[]
Eigenschaftswert
string[]
language
Die Sprache des Eingabeaudios. Durch die Bereitstellung der Eingabesprache in ISO-639-1 (z. B. en) wird die Genauigkeit und Latenz verbessert.
language?: string
Eigenschaftswert
string
languages
Mögliche Sprachen des Eingabeaudios im ISO-639-1-Format . Unterstützt von gpt-transcribe und gpt-live-transcribe.
languages?: string[]
Eigenschaftswert
string[]
model
Die Identifikatorin des Transkriptionsmodells. Konfigurieren Sie kundenspezifische Sprachbereitstellungen in custom_speech.
model: VoiceAgentInputTranscriptionModel
Eigenschaftswert
phrase_list
Optionale Phrase deutet darauf hin, dass die Erkennung zugunsten von Domänenbegriffen verzerrt wird.
phrase_list?: string[]
Eigenschaftswert
string[]
prompt
Ein optionaler Text, um den Stil des Modells zu steuern oder ein vorheriges Audiosegment fortzusetzen.
Für whisper-1, ist der Prompt eine Liste von Schlüsselwörtern.
Bei gpt-4o-transcribe Modellen (mit Ausnahme gpt-4o-transcribe-diarize) ist die Eingabeaufforderung eine freie Textzeichenfolge, z. B. "Wörter im Zusammenhang mit Technologie erwarten".
Prompt wird in GA Realtime-Sitzungen nicht unterstützt gpt-realtime-whisper .
prompt?: string
Eigenschaftswert
string