VoiceAgentDefinition interface

Die Definition des Sprachagenten. Seine Konfiguration (Modell, Befehle, Audio, Werkzeuge und optionaler Avatar) sorgt für ein verwaltetes Sprach-zu-Sprach-Erlebnis. Richte Echtzeit-Sprachsitzungen durch GET /agents/{agent_name}/endpoint/protocols/voice. Jede Erstellung oder Aktualisierung erzeugt eine neue, unveränderliche Version.

Extends

Eigenschaften

audio

Die Audiokonfiguration, einschließlich Ein- und Ausgabeformaten, Sprache, Dreherkennung, Rauschunterdrückung und Transkription. Diese Werte sind Sitzungsstandardwerte; ein Client kann unterstützte Felder beim Verbinden überschreiben.

avatar

Optionale Avatar-Konfiguration. Diese Werte sind Sitzungsstandardwerte und können beim Verbinden überschrieben werden.

conversation_engine

Die Engine, die die Gesprächssteuerung für diesen Sprachagenten übernimmt. Genau eine dieser Eigenschaften und die modellgestützte Konfiguration (model_type mit model) müssen bereitgestellt werden. Wenn diese Eigenschaft angegeben ist, model_type, model, instructions, tools, , und tool_choice muss weggelassen werden, und greeting.tool_choice kann nicht , requiredda die Engine die Konversationslogik besitzt. Die Anfangsimplementierung unterstützt eine gehostete Agenten-Engine.

greeting

Optionale Begrüßung mit Sitzungsstart. Der Template-Modus spricht exakten gerenderten Text; Der LLM-generierte Modus bittet das Session-Modell, die Eröffnungsantwort zu erstellen, und kann konfigurierte Werkzeuge verwenden.

include

Zusätzliche Felder, die in die Serviceausgaben aufgenommen werden.

instructions

Eine Systemnachricht (oder Entwicklernachricht), die in den Kontext des Modells eingefügt wurde. Unterstützt Vorlagenaustausch über structured_inputs, gerendert pro Sitzung, bevor die Live-Sitzung beginnt.

interim_response

Interim-Response-Einstellungen für Latenz und Werkzeugausführung.

kind

Der Art von Diskriminator für die Definition eines Sprachagenten. Immer voice.

max_output_tokens

Die maximale Ausgabe-Token-Anzahl für eine Antwort.

model

Das Modell für diesen Agenten. Erforderlich für model_type einen modellunterstützten Sprachagent und weggelassen, wenn conversation_engine er bereitgestellt wird. Das Modell muss sowohl Echtzeit- als auch kaskadierende Sprache unterstützen.

model_type

Wie das Modell hinter diesem Voice Agent bedient wird. Erforderlich für model einen modellunterstützten Sprachagent und weggelassen, wenn conversation_engine er bereitgestellt wird. Dies ist unabhängig von der Architektur (Echtzeit oder kaskadierend), die der Service aus dem gewählten Modell ableitet.

output_modalities

Die Ausgabemodalitäten, die der Agent erzeugt. Wird standardmäßig auf ["audio"] festgelegt. animation und avatar sind verfügbar, wenn ein Avatar konfiguriert ist.

parallel_tool_calls

Ob das Modell mehrere Werkzeuge parallel aufrufen kann.

store

Ob die Gespräche mit diesem Agenten fortgeführt werden. Ein einziger, alles-oder-nichts-Persistenzschalter, der standardmäßig auf false (Datenschutzsicher: standardmäßig ausgeschaltet) steht. Wenn true, führt Foundry das gesamte Gespräch fort – die Transkript-/Ereignis-Zeitleiste und den rohen Audio. Wenn false, bleibt nichts bestehen und es entsteht kein Gespräch. Es gibt keine separate Audio-Loging-Steuerung; Audio wird nur als Teil dieses Schalters gespeichert. Latenz-/Performance-Telemetrie (z. B. Time-to-First-Audio, Inter-Token-Latenz, Unterbrechung) ist ausschließlich Observabilitäts-basiert (Customer Trace / App Insights) und ist nicht Teil des persistenten Gesprächsinhalts.

structured_inputs

Set strukturierte Eingaben, die an der Substitution von Prompt-Vorlagen teilnehmen und pro Sitzung vor Beginn der Live-Sitzung gerendert werden.

subagent_config

Optionale Konfiguration für Foundry-Textagenten, die dieser Sprachagent als Hintergrundspezialisten konsultieren kann.

tools

Die Werkzeuge, die der Voice Agent nutzen kann. Unterstützte Werkzeugarten sind function (vom Client ausgeführt), mcp, system (dienstverwaltete Sitzungskontrollen) und toolbox. Serverseitige Werkzeuge wie web_search, azure_ai_search, und openapi werden über einen Werkzeugkasten bereitgestellt und nicht direkt deklariert.

tool_choice

Wie das Modell Werkzeuge für generierte Antworten auswählt. none verhindert Werkzeugaufrufe, auto lässt das Modell entscheiden, required benötigt mindestens einen Werkzeugaufruf, und eine bestimmte Funktion oder ein MCP-Werkzeug kann mit einem Objekt ausgewählt werden. Wird standardmäßig auf auto festgelegt.

Geerbte Eigenschaften

rai_config

Konfiguration für die Inhaltsfilterung und Sicherheitsfunktionen von Responsible AI (RAI).

Details zur Eigenschaft

audio

Die Audiokonfiguration, einschließlich Ein- und Ausgabeformaten, Sprache, Dreherkennung, Rauschunterdrückung und Transkription. Diese Werte sind Sitzungsstandardwerte; ein Client kann unterstützte Felder beim Verbinden überschreiben.

audio?: VoiceAgentAudioConfig

Eigenschaftswert

avatar

Optionale Avatar-Konfiguration. Diese Werte sind Sitzungsstandardwerte und können beim Verbinden überschrieben werden.

avatar?: VoiceAgentAvatarConfig

Eigenschaftswert

conversation_engine

Die Engine, die die Gesprächssteuerung für diesen Sprachagenten übernimmt. Genau eine dieser Eigenschaften und die modellgestützte Konfiguration (model_type mit model) müssen bereitgestellt werden. Wenn diese Eigenschaft angegeben ist, model_type, model, instructions, tools, , und tool_choice muss weggelassen werden, und greeting.tool_choice kann nicht , requiredda die Engine die Konversationslogik besitzt. Die Anfangsimplementierung unterstützt eine gehostete Agenten-Engine.

conversation_engine?: VoiceConversationEngineUnion

Eigenschaftswert

greeting

Optionale Begrüßung mit Sitzungsstart. Der Template-Modus spricht exakten gerenderten Text; Der LLM-generierte Modus bittet das Session-Modell, die Eröffnungsantwort zu erstellen, und kann konfigurierte Werkzeuge verwenden.

greeting?: VoiceAgentGreetingConfigUnion

Eigenschaftswert

include

Zusätzliche Felder, die in die Serviceausgaben aufgenommen werden.

include?: VoiceAgentSessionIncludeOption[]

Eigenschaftswert

instructions

Eine Systemnachricht (oder Entwicklernachricht), die in den Kontext des Modells eingefügt wurde. Unterstützt Vorlagenaustausch über structured_inputs, gerendert pro Sitzung, bevor die Live-Sitzung beginnt.

instructions?: string

Eigenschaftswert

string

interim_response

Interim-Response-Einstellungen für Latenz und Werkzeugausführung.

interim_response?: VoiceAgentInterimResponseConfigUnion

Eigenschaftswert

kind

Der Art von Diskriminator für die Definition eines Sprachagenten. Immer voice.

kind: "voice"

Eigenschaftswert

"voice"

max_output_tokens

Die maximale Ausgabe-Token-Anzahl für eine Antwort.

max_output_tokens?: VoiceAgentMaxOutputTokens

Eigenschaftswert

model

Das Modell für diesen Agenten. Erforderlich für model_type einen modellunterstützten Sprachagent und weggelassen, wenn conversation_engine er bereitgestellt wird. Das Modell muss sowohl Echtzeit- als auch kaskadierende Sprache unterstützen.

model?: string

Eigenschaftswert

string

model_type

Wie das Modell hinter diesem Voice Agent bedient wird. Erforderlich für model einen modellunterstützten Sprachagent und weggelassen, wenn conversation_engine er bereitgestellt wird. Dies ist unabhängig von der Architektur (Echtzeit oder kaskadierend), die der Service aus dem gewählten Modell ableitet.

model_type?: VoiceModelType

Eigenschaftswert

output_modalities

Die Ausgabemodalitäten, die der Agent erzeugt. Wird standardmäßig auf ["audio"] festgelegt. animation und avatar sind verfügbar, wenn ein Avatar konfiguriert ist.

output_modalities?: VoiceOutputModality[]

Eigenschaftswert

parallel_tool_calls

Ob das Modell mehrere Werkzeuge parallel aufrufen kann.

parallel_tool_calls?: boolean

Eigenschaftswert

boolean

store

Ob die Gespräche mit diesem Agenten fortgeführt werden. Ein einziger, alles-oder-nichts-Persistenzschalter, der standardmäßig auf false (Datenschutzsicher: standardmäßig ausgeschaltet) steht. Wenn true, führt Foundry das gesamte Gespräch fort – die Transkript-/Ereignis-Zeitleiste und den rohen Audio. Wenn false, bleibt nichts bestehen und es entsteht kein Gespräch. Es gibt keine separate Audio-Loging-Steuerung; Audio wird nur als Teil dieses Schalters gespeichert. Latenz-/Performance-Telemetrie (z. B. Time-to-First-Audio, Inter-Token-Latenz, Unterbrechung) ist ausschließlich Observabilitäts-basiert (Customer Trace / App Insights) und ist nicht Teil des persistenten Gesprächsinhalts.

store?: boolean

Eigenschaftswert

boolean

structured_inputs

Set strukturierte Eingaben, die an der Substitution von Prompt-Vorlagen teilnehmen und pro Sitzung vor Beginn der Live-Sitzung gerendert werden.

structured_inputs?: Record<string, StructuredInputDefinition>

Eigenschaftswert

Record<string, StructuredInputDefinition>

subagent_config

Optionale Konfiguration für Foundry-Textagenten, die dieser Sprachagent als Hintergrundspezialisten konsultieren kann.

subagent_config?: VoiceAgentSubagentConfig

Eigenschaftswert

tools

Die Werkzeuge, die der Voice Agent nutzen kann. Unterstützte Werkzeugarten sind function (vom Client ausgeführt), mcp, system (dienstverwaltete Sitzungskontrollen) und toolbox. Serverseitige Werkzeuge wie web_search, azure_ai_search, und openapi werden über einen Werkzeugkasten bereitgestellt und nicht direkt deklariert.

tools?: VoiceAgentToolUnion[]

Eigenschaftswert

tool_choice

Wie das Modell Werkzeuge für generierte Antworten auswählt. none verhindert Werkzeugaufrufe, auto lässt das Modell entscheiden, required benötigt mindestens einen Werkzeugaufruf, und eine bestimmte Funktion oder ein MCP-Werkzeug kann mit einem Objekt ausgewählt werden. Wird standardmäßig auf auto festgelegt.

tool_choice?: VoiceAgentToolChoice

Eigenschaftswert

Geerbte Eigenschaftsdetails

rai_config

Konfiguration für die Inhaltsfilterung und Sicherheitsfunktionen von Responsible AI (RAI).

rai_config?: RaiConfig

Eigenschaftswert

Von AgentDefinition.rai_configgeerbt