VoiceAgentInputTranscription interface

Configuration asynchrone entrée-transcription audio. Étend les options de transcription en temps réel OpenAI avec les modèles de transcription Azure et MAI, des modèles de parole personnalisés et des indices de phrases.

Propriétés

custom_speech

Configuration optionnelle de déploiement vocal personnalisé par le client, déterminée par localisation.

delay

Contrôle combien de temps le modèle attend avant d’émettre du texte de transcription. Des valeurs plus élevées peuvent améliorer la précision de la transcription au détriment de la latence. Uniquement pris en charge gpt-realtime-whisper dans les sessions en temps réel de GA.

keywords

Des mots ou expressions pour guider la transcription de l’audio d’entrée. Soutenu par gpt-transcribe et gpt-live-transcribe.

language

Langue de l’audio d’entrée. L’approvisionnement du langage d’entrée au format ISO-639-1 (par exemple en) améliore la précision et la latence.

languages

Langues possibles de l’audio d’entrée, au format ISO-639-1 . Soutenu par gpt-transcribe et gpt-live-transcribe.

model

L’identifiant du modèle de transcription. Configurez les déploiements vocaux personnalisés des clients dans custom_speech.

phrase_list

Une phrase optionnelle suggère que cela favorise la reconnaissance en faveur des termes de domaine.

prompt

Un texte optionnel pour guider le style du modèle ou poursuivre un segment audio précédent. Pour whisper-1, l’invite est une liste de mots clés. Pour gpt-4o-transcribe les modèles (à l’exclusion gpt-4o-transcribe-diarize), l’invite est une chaîne de texte libre, par exemple « attendre des mots liés à la technologie ». Prompt n’est pas pris en charge gpt-realtime-whisper dans les sessions en temps réel de GA.

Détails de la propriété

custom_speech

Configuration optionnelle de déploiement vocal personnalisé par le client, déterminée par localisation.

custom_speech?: Record<string, string>

Valeur de propriété

Record<string, string>

delay

Contrôle combien de temps le modèle attend avant d’émettre du texte de transcription. Des valeurs plus élevées peuvent améliorer la précision de la transcription au détriment de la latence. Uniquement pris en charge gpt-realtime-whisper dans les sessions en temps réel de GA.

delay?: "low" | "medium" | "high" | "minimal" | "xhigh"

Valeur de propriété

"low" | "medium" | "high" | "minimal" | "xhigh"

keywords

Des mots ou expressions pour guider la transcription de l’audio d’entrée. Soutenu par gpt-transcribe et gpt-live-transcribe.

keywords?: string[]

Valeur de propriété

string[]

language

Langue de l’audio d’entrée. L’approvisionnement du langage d’entrée au format ISO-639-1 (par exemple en) améliore la précision et la latence.

language?: string

Valeur de propriété

string

languages

Langues possibles de l’audio d’entrée, au format ISO-639-1 . Soutenu par gpt-transcribe et gpt-live-transcribe.

languages?: string[]

Valeur de propriété

string[]

model

L’identifiant du modèle de transcription. Configurez les déploiements vocaux personnalisés des clients dans custom_speech.

model: VoiceAgentInputTranscriptionModel

Valeur de propriété

phrase_list

Une phrase optionnelle suggère que cela favorise la reconnaissance en faveur des termes de domaine.

phrase_list?: string[]

Valeur de propriété

string[]

prompt

Un texte optionnel pour guider le style du modèle ou poursuivre un segment audio précédent. Pour whisper-1, l’invite est une liste de mots clés. Pour gpt-4o-transcribe les modèles (à l’exclusion gpt-4o-transcribe-diarize), l’invite est une chaîne de texte libre, par exemple « attendre des mots liés à la technologie ». Prompt n’est pas pris en charge gpt-realtime-whisper dans les sessions en temps réel de GA.

prompt?: string

Valeur de propriété

string