VoiceAgentRealtimeResponse interface

Eine Live-Echtzeit-Antwort wurde vom Sprachagentendienst in beiden response.created Events response.done zurückgegeben.

Extends

Eigenschaften

audio

Die von der Live-Antwort verwendete Audiokonfiguration, einschließlich der Felder Flatvoice-Provider, Standort und Format unter output.

output

Die Gegenstände, die durch die Live-Antwort erzeugt wurden.

Geerbte Eigenschaften

conversation_id

Zu welchem Gespräch die Antwort hinzugefügt wird, wird durch das conversation Feld des jeweiligen response.create Ereignisses bestimmt. Wenn auto, wird die Antwort zur Standardkonversation hinzugefügt und der Wert von conversation_id ist ein id wie conv_1234. Wenn none, wird die Antwort zu keinem Gespräch hinzugefügt und der Wert von conversation_id beträgt null. Wenn Antworten automatisch durch VAD ausgelöst werden, wird die Antwort zur Standardkonversation hinzugefügt

id

Die eindeutige ID der Antwort sieht so aus resp_1234.

max_output_tokens

Maximale Anzahl von Ausgabetoken für eine einzelne Assistentenantwort, einschließlich der Tool-Aufrufe, die in dieser Antwort verwendet wurde.

metadata

Benutzerdefinierte Schlüssel-Wert-Paare, die mit der Antwort assoziiert sind.

object

Der Objekttyp muss sein realtime.response.

output_modalities

Die Menge der Modalitäten, die das Modell zur Antwort verwendet hat, sind [\"audio\"]derzeit die einzigen möglichen Werte , [\"text\"]. Die Audioausgabe enthält immer ein Texttranskript. Wenn man den Ausgang auf Modus text stellt, wird der Audioausgang des Modells deaktiviert.

status

Der Endstatus der Antwort (completed, cancelled, failed, oder incomplete, in_progress).

status_details

Weitere Details zum Status.

usage

Nutzungsstatistiken für die Antwort, das entspricht der Abrechnung. Eine Echtzeit-API-Sitzung verwaltet einen Gesprächskontext und fügt neue Items an die Konversation hinzu, sodass Ausgaben aus vorherigen Runden (Text- und Audio-Tokens) die Eingabe für spätere Runden werden.

Details zur Eigenschaft

audio

Die von der Live-Antwort verwendete Audiokonfiguration, einschließlich der Felder Flatvoice-Provider, Standort und Format unter output.

audio?: VoiceResponseAudio

Eigenschaftswert

output

Die Gegenstände, die durch die Live-Antwort erzeugt wurden.

output?: RealtimeConversationItemUnion[]

Eigenschaftswert

Geerbte Eigenschaftsdetails

conversation_id

Zu welchem Gespräch die Antwort hinzugefügt wird, wird durch das conversation Feld des jeweiligen response.create Ereignisses bestimmt. Wenn auto, wird die Antwort zur Standardkonversation hinzugefügt und der Wert von conversation_id ist ein id wie conv_1234. Wenn none, wird die Antwort zu keinem Gespräch hinzugefügt und der Wert von conversation_id beträgt null. Wenn Antworten automatisch durch VAD ausgelöst werden, wird die Antwort zur Standardkonversation hinzugefügt

conversation_id?: string

Eigenschaftswert

string

Geerbt vonVoiceAgentRealtimeResponseBase.conversation_id

id

Die eindeutige ID der Antwort sieht so aus resp_1234.

id?: string

Eigenschaftswert

string

Geerbt vonVoiceAgentRealtimeResponseBase.id

max_output_tokens

Maximale Anzahl von Ausgabetoken für eine einzelne Assistentenantwort, einschließlich der Tool-Aufrufe, die in dieser Antwort verwendet wurde.

max_output_tokens?: number | "inf"

Eigenschaftswert

number | "inf"

Geerbt vonVoiceAgentRealtimeResponseBase.max_output_tokens

metadata

Benutzerdefinierte Schlüssel-Wert-Paare, die mit der Antwort assoziiert sind.

metadata?: Metadata

Eigenschaftswert

Geerbt vonVoiceAgentRealtimeResponseBase.metadata

object

Der Objekttyp muss sein realtime.response.

object?: "realtime.response"

Eigenschaftswert

"realtime.response"

Geerbt vonVoiceAgentRealtimeResponseBase.object

output_modalities

Die Menge der Modalitäten, die das Modell zur Antwort verwendet hat, sind [\"audio\"]derzeit die einzigen möglichen Werte , [\"text\"]. Die Audioausgabe enthält immer ein Texttranskript. Wenn man den Ausgang auf Modus text stellt, wird der Audioausgang des Modells deaktiviert.

output_modalities?: ("text" | "audio")[]

Eigenschaftswert

("text" | "audio")[]

Geerbt vonVoiceAgentRealtimeResponseBase.output_modalities

status

Der Endstatus der Antwort (completed, cancelled, failed, oder incomplete, in_progress).

status?: "failed" | "in_progress" | "cancelled" | "completed" | "incomplete"

Eigenschaftswert

"failed" | "in_progress" | "cancelled" | "completed" | "incomplete"

Geerbt vonVoiceAgentRealtimeResponseBase.status

status_details

Weitere Details zum Status.

status_details?: RealtimeResponseStatusDetails

Eigenschaftswert

Geerbt vonVoiceAgentRealtimeResponseBase.status_details

usage

Nutzungsstatistiken für die Antwort, das entspricht der Abrechnung. Eine Echtzeit-API-Sitzung verwaltet einen Gesprächskontext und fügt neue Items an die Konversation hinzu, sodass Ausgaben aus vorherigen Runden (Text- und Audio-Tokens) die Eingabe für spätere Runden werden.

usage?: RealtimeResponseUsage

Eigenschaftswert

Geerbt vonVoiceAgentRealtimeResponseBase.usage