VoiceAgentInputTranscription interface

Configuração assíncrona de entrada e transcrição áudio. Amplia as opções de transcrição em tempo real do OpenAI com os modelos de transcrição Azure e MAI, modelos personalizados de fala e dicas de frase.

Propriedades

custom_speech

Configuração opcional de implantação de voz personalizada pelo cliente, codificada por localidade.

delay

Ele controla quanto tempo o modelo espera antes de emitir texto de transcrição. Valores mais altos podem melhorar a precisão da transcrição ao custo da latência. Só suportado em gpt-realtime-whisper sessões em tempo real do GA.

keywords

Palavras ou frases para guiar a transcrição do áudio de entrada. Apoiado por gpt-transcribe e gpt-live-transcribe.

language

O idioma do áudio de entrada. Fornecer o idioma de entrada no formato ISO-639-1 (por exemplo en) melhorará a precisão e a latência.

languages

Possíveis linguagens do áudio de entrada, no formato ISO-639-1 . Apoiado por gpt-transcribe e gpt-live-transcribe.

model

O identificador do modelo de transcrição. Configure implantações de fala personalizadas do cliente em custom_speech.

phrase_list

Frase opcional sugere que esse viés é o reconhecimento em favor dos termos de domínio.

prompt

Um texto opcional para guiar o estilo do modelo ou continuar um segmento de áudio anterior. Para whisper-1, o prompt é uma lista de palavras-chave. Para gpt-4o-transcribe modelos (excluindo gpt-4o-transcribe-diarize), o prompt é uma cadeia de caracteres de texto livre, por exemplo, "esperar palavras relacionadas à tecnologia". Prompt não é suportado em gpt-realtime-whisper sessões em tempo real do GA.

Detalhes da propriedade

custom_speech

Configuração opcional de implantação de voz personalizada pelo cliente, codificada por localidade.

custom_speech?: Record<string, string>

Valor da propriedade

Record<string, string>

delay

Ele controla quanto tempo o modelo espera antes de emitir texto de transcrição. Valores mais altos podem melhorar a precisão da transcrição ao custo da latência. Só suportado em gpt-realtime-whisper sessões em tempo real do GA.

delay?: "low" | "medium" | "high" | "minimal" | "xhigh"

Valor da propriedade

"low" | "medium" | "high" | "minimal" | "xhigh"

keywords

Palavras ou frases para guiar a transcrição do áudio de entrada. Apoiado por gpt-transcribe e gpt-live-transcribe.

keywords?: string[]

Valor da propriedade

string[]

language

O idioma do áudio de entrada. Fornecer o idioma de entrada no formato ISO-639-1 (por exemplo en) melhorará a precisão e a latência.

language?: string

Valor da propriedade

string

languages

Possíveis linguagens do áudio de entrada, no formato ISO-639-1 . Apoiado por gpt-transcribe e gpt-live-transcribe.

languages?: string[]

Valor da propriedade

string[]

model

O identificador do modelo de transcrição. Configure implantações de fala personalizadas do cliente em custom_speech.

model: VoiceAgentInputTranscriptionModel

Valor da propriedade

phrase_list

Frase opcional sugere que esse viés é o reconhecimento em favor dos termos de domínio.

phrase_list?: string[]

Valor da propriedade

string[]

prompt

Um texto opcional para guiar o estilo do modelo ou continuar um segmento de áudio anterior. Para whisper-1, o prompt é uma lista de palavras-chave. Para gpt-4o-transcribe modelos (excluindo gpt-4o-transcribe-diarize), o prompt é uma cadeia de caracteres de texto livre, por exemplo, "esperar palavras relacionadas à tecnologia". Prompt não é suportado em gpt-realtime-whisper sessões em tempo real do GA.

prompt?: string

Valor da propriedade

string