VoiceAgentInputTranscription interface
Configuration asynchrone entrée-transcription audio. Étend les options de transcription en temps réel OpenAI avec les modèles de transcription Azure et MAI, des modèles de parole personnalisés et des indices de phrases.
Propriétés
| custom_speech | Configuration optionnelle de déploiement vocal personnalisé par le client, déterminée par localisation. |
| delay | Contrôle combien de temps le modèle attend avant d’émettre du texte de transcription.
Des valeurs plus élevées peuvent améliorer la précision de la transcription au détriment de la latence.
Uniquement pris en charge |
| keywords | Des mots ou expressions pour guider la transcription de l’audio d’entrée. Soutenu par |
| language | Langue de l’audio d’entrée. L’approvisionnement du langage d’entrée au format ISO-639-1 (par exemple |
| languages | Langues possibles de l’audio d’entrée, au format ISO-639-1 . Soutenu par |
| model | L’identifiant du modèle de transcription. Configurez les déploiements vocaux personnalisés des clients dans |
| phrase_list | Une phrase optionnelle suggère que cela favorise la reconnaissance en faveur des termes de domaine. |
| prompt | Un texte optionnel pour guider le style du modèle ou poursuivre un segment audio précédent.
Pour |
Détails de la propriété
custom_speech
Configuration optionnelle de déploiement vocal personnalisé par le client, déterminée par localisation.
custom_speech?: Record<string, string>
Valeur de propriété
Record<string, string>
delay
Contrôle combien de temps le modèle attend avant d’émettre du texte de transcription.
Des valeurs plus élevées peuvent améliorer la précision de la transcription au détriment de la latence.
Uniquement pris en charge gpt-realtime-whisper dans les sessions en temps réel de GA.
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
Valeur de propriété
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
Des mots ou expressions pour guider la transcription de l’audio d’entrée. Soutenu par gpt-transcribe et gpt-live-transcribe.
keywords?: string[]
Valeur de propriété
string[]
language
Langue de l’audio d’entrée. L’approvisionnement du langage d’entrée au format ISO-639-1 (par exemple en) améliore la précision et la latence.
language?: string
Valeur de propriété
string
languages
Langues possibles de l’audio d’entrée, au format ISO-639-1 . Soutenu par gpt-transcribe et gpt-live-transcribe.
languages?: string[]
Valeur de propriété
string[]
model
L’identifiant du modèle de transcription. Configurez les déploiements vocaux personnalisés des clients dans custom_speech.
model: VoiceAgentInputTranscriptionModel
Valeur de propriété
phrase_list
Une phrase optionnelle suggère que cela favorise la reconnaissance en faveur des termes de domaine.
phrase_list?: string[]
Valeur de propriété
string[]
prompt
Un texte optionnel pour guider le style du modèle ou poursuivre un segment audio précédent.
Pour whisper-1, l’invite est une liste de mots clés.
Pour gpt-4o-transcribe les modèles (à l’exclusion gpt-4o-transcribe-diarize), l’invite est une chaîne de texte libre, par exemple « attendre des mots liés à la technologie ».
Prompt n’est pas pris en charge gpt-realtime-whisper dans les sessions en temps réel de GA.
prompt?: string
Valeur de propriété
string