VoiceAgentInputTranscription interface
Configuração assíncrona de entrada e transcrição áudio. Amplia as opções de transcrição em tempo real do OpenAI com os modelos de transcrição Azure e MAI, modelos personalizados de fala e dicas de frase.
Propriedades
| custom_speech | Configuração opcional de implantação de voz personalizada pelo cliente, codificada por localidade. |
| delay | Ele controla quanto tempo o modelo espera antes de emitir texto de transcrição.
Valores mais altos podem melhorar a precisão da transcrição ao custo da latência.
Só suportado em |
| keywords | Palavras ou frases para guiar a transcrição do áudio de entrada. Apoiado por |
| language | O idioma do áudio de entrada. Fornecer o idioma de entrada no formato ISO-639-1 (por exemplo |
| languages | Possíveis linguagens do áudio de entrada, no formato ISO-639-1 . Apoiado por |
| model | O identificador do modelo de transcrição. Configure implantações de fala personalizadas do cliente em |
| phrase_list | Frase opcional sugere que esse viés é o reconhecimento em favor dos termos de domínio. |
| prompt | Um texto opcional para guiar o estilo do modelo ou continuar um segmento de áudio anterior.
Para |
Detalhes da propriedade
custom_speech
Configuração opcional de implantação de voz personalizada pelo cliente, codificada por localidade.
custom_speech?: Record<string, string>
Valor da propriedade
Record<string, string>
delay
Ele controla quanto tempo o modelo espera antes de emitir texto de transcrição.
Valores mais altos podem melhorar a precisão da transcrição ao custo da latência.
Só suportado em gpt-realtime-whisper sessões em tempo real do GA.
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
Valor da propriedade
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
Palavras ou frases para guiar a transcrição do áudio de entrada. Apoiado por gpt-transcribe e gpt-live-transcribe.
keywords?: string[]
Valor da propriedade
string[]
language
O idioma do áudio de entrada. Fornecer o idioma de entrada no formato ISO-639-1 (por exemplo en) melhorará a precisão e a latência.
language?: string
Valor da propriedade
string
languages
Possíveis linguagens do áudio de entrada, no formato ISO-639-1 . Apoiado por gpt-transcribe e gpt-live-transcribe.
languages?: string[]
Valor da propriedade
string[]
model
O identificador do modelo de transcrição. Configure implantações de fala personalizadas do cliente em custom_speech.
model: VoiceAgentInputTranscriptionModel
Valor da propriedade
phrase_list
Frase opcional sugere que esse viés é o reconhecimento em favor dos termos de domínio.
phrase_list?: string[]
Valor da propriedade
string[]
prompt
Um texto opcional para guiar o estilo do modelo ou continuar um segmento de áudio anterior.
Para whisper-1, o prompt é uma lista de palavras-chave.
Para gpt-4o-transcribe modelos (excluindo gpt-4o-transcribe-diarize), o prompt é uma cadeia de caracteres de texto livre, por exemplo, "esperar palavras relacionadas à tecnologia".
Prompt não é suportado em gpt-realtime-whisper sessões em tempo real do GA.
prompt?: string
Valor da propriedade
string