VoiceAgentDefinition interface
Die Definition des Sprachagenten. Seine Konfiguration (Modell, Befehle, Audio, Werkzeuge und optionaler Avatar) sorgt für ein verwaltetes Sprach-zu-Sprach-Erlebnis. Richte Echtzeit-Sprachsitzungen durch GET /agents/{agent_name}/endpoint/protocols/voice. Jede Erstellung oder Aktualisierung erzeugt eine neue, unveränderliche Version.
- Extends
Eigenschaften
| audio | Die Audiokonfiguration, einschließlich Ein- und Ausgabeformaten, Sprache, Dreherkennung, Rauschunterdrückung und Transkription. Diese Werte sind Sitzungsstandardwerte; ein Client kann unterstützte Felder beim Verbinden überschreiben. |
| avatar | Optionale Avatar-Konfiguration. Diese Werte sind Sitzungsstandardwerte und können beim Verbinden überschrieben werden. |
| conversation_engine | Die Engine, die die Gesprächssteuerung für diesen Sprachagenten übernimmt. Genau eine dieser Eigenschaften und die modellgestützte Konfiguration ( |
| greeting | Optionale Begrüßung mit Sitzungsstart. Der Template-Modus spricht exakten gerenderten Text; Der LLM-generierte Modus bittet das Session-Modell, die Eröffnungsantwort zu erstellen, und kann konfigurierte Werkzeuge verwenden. |
| include | Zusätzliche Felder, die in die Serviceausgaben aufgenommen werden. |
| instructions | Eine Systemnachricht (oder Entwicklernachricht), die in den Kontext des Modells eingefügt wurde. Unterstützt Vorlagenaustausch über |
| interim_response | Interim-Response-Einstellungen für Latenz und Werkzeugausführung. |
| kind | Der Art von Diskriminator für die Definition eines Sprachagenten. Immer |
| max_output_tokens | Die maximale Ausgabe-Token-Anzahl für eine Antwort. |
| model | Das Modell für diesen Agenten. Erforderlich für |
| model_type | Wie das Modell hinter diesem Voice Agent bedient wird. Erforderlich für |
| output_modalities | Die Ausgabemodalitäten, die der Agent erzeugt. Wird standardmäßig auf |
| parallel_tool_calls | Ob das Modell mehrere Werkzeuge parallel aufrufen kann. |
| store | Ob die Gespräche mit diesem Agenten fortgeführt werden. Ein einziger, alles-oder-nichts-Persistenzschalter, der standardmäßig auf |
| structured_inputs | Set strukturierte Eingaben, die an der Substitution von Prompt-Vorlagen teilnehmen und pro Sitzung vor Beginn der Live-Sitzung gerendert werden. |
| subagent_config | Optionale Konfiguration für Foundry-Textagenten, die dieser Sprachagent als Hintergrundspezialisten konsultieren kann. |
| tools | Die Werkzeuge, die der Voice Agent nutzen kann. Unterstützte Werkzeugarten sind |
| tool_choice | Wie das Modell Werkzeuge für generierte Antworten auswählt.
|
Geerbte Eigenschaften
| rai_config | Konfiguration für die Inhaltsfilterung und Sicherheitsfunktionen von Responsible AI (RAI). |
Details zur Eigenschaft
audio
Die Audiokonfiguration, einschließlich Ein- und Ausgabeformaten, Sprache, Dreherkennung, Rauschunterdrückung und Transkription. Diese Werte sind Sitzungsstandardwerte; ein Client kann unterstützte Felder beim Verbinden überschreiben.
audio?: VoiceAgentAudioConfig
Eigenschaftswert
avatar
Optionale Avatar-Konfiguration. Diese Werte sind Sitzungsstandardwerte und können beim Verbinden überschrieben werden.
avatar?: VoiceAgentAvatarConfig
Eigenschaftswert
conversation_engine
Die Engine, die die Gesprächssteuerung für diesen Sprachagenten übernimmt. Genau eine dieser Eigenschaften und die modellgestützte Konfiguration (model_type mit model) müssen bereitgestellt werden. Wenn diese Eigenschaft angegeben ist, model_type, model, instructions, tools, , und tool_choice muss weggelassen werden, und greeting.tool_choice kann nicht , requiredda die Engine die Konversationslogik besitzt. Die Anfangsimplementierung unterstützt eine gehostete Agenten-Engine.
conversation_engine?: VoiceConversationEngineUnion
Eigenschaftswert
greeting
Optionale Begrüßung mit Sitzungsstart. Der Template-Modus spricht exakten gerenderten Text; Der LLM-generierte Modus bittet das Session-Modell, die Eröffnungsantwort zu erstellen, und kann konfigurierte Werkzeuge verwenden.
greeting?: VoiceAgentGreetingConfigUnion
Eigenschaftswert
include
Zusätzliche Felder, die in die Serviceausgaben aufgenommen werden.
include?: VoiceAgentSessionIncludeOption[]
Eigenschaftswert
instructions
Eine Systemnachricht (oder Entwicklernachricht), die in den Kontext des Modells eingefügt wurde. Unterstützt Vorlagenaustausch über structured_inputs, gerendert pro Sitzung, bevor die Live-Sitzung beginnt.
instructions?: string
Eigenschaftswert
string
interim_response
Interim-Response-Einstellungen für Latenz und Werkzeugausführung.
interim_response?: VoiceAgentInterimResponseConfigUnion
Eigenschaftswert
kind
Der Art von Diskriminator für die Definition eines Sprachagenten. Immer voice.
kind: "voice"
Eigenschaftswert
"voice"
max_output_tokens
Die maximale Ausgabe-Token-Anzahl für eine Antwort.
max_output_tokens?: VoiceAgentMaxOutputTokens
Eigenschaftswert
model
Das Modell für diesen Agenten. Erforderlich für model_type einen modellunterstützten Sprachagent und weggelassen, wenn conversation_engine er bereitgestellt wird. Das Modell muss sowohl Echtzeit- als auch kaskadierende Sprache unterstützen.
model?: string
Eigenschaftswert
string
model_type
Wie das Modell hinter diesem Voice Agent bedient wird. Erforderlich für model einen modellunterstützten Sprachagent und weggelassen, wenn conversation_engine er bereitgestellt wird. Dies ist unabhängig von der Architektur (Echtzeit oder kaskadierend), die der Service aus dem gewählten Modell ableitet.
model_type?: VoiceModelType
Eigenschaftswert
output_modalities
Die Ausgabemodalitäten, die der Agent erzeugt. Wird standardmäßig auf ["audio"] festgelegt.
animation und avatar sind verfügbar, wenn ein Avatar konfiguriert ist.
output_modalities?: VoiceOutputModality[]
Eigenschaftswert
parallel_tool_calls
Ob das Modell mehrere Werkzeuge parallel aufrufen kann.
parallel_tool_calls?: boolean
Eigenschaftswert
boolean
store
Ob die Gespräche mit diesem Agenten fortgeführt werden. Ein einziger, alles-oder-nichts-Persistenzschalter, der standardmäßig auf false (Datenschutzsicher: standardmäßig ausgeschaltet) steht. Wenn true, führt Foundry das gesamte Gespräch fort – die Transkript-/Ereignis-Zeitleiste und den rohen Audio. Wenn false, bleibt nichts bestehen und es entsteht kein Gespräch. Es gibt keine separate Audio-Loging-Steuerung; Audio wird nur als Teil dieses Schalters gespeichert. Latenz-/Performance-Telemetrie (z. B. Time-to-First-Audio, Inter-Token-Latenz, Unterbrechung) ist ausschließlich Observabilitäts-basiert (Customer Trace / App Insights) und ist nicht Teil des persistenten Gesprächsinhalts.
store?: boolean
Eigenschaftswert
boolean
structured_inputs
Set strukturierte Eingaben, die an der Substitution von Prompt-Vorlagen teilnehmen und pro Sitzung vor Beginn der Live-Sitzung gerendert werden.
structured_inputs?: Record<string, StructuredInputDefinition>
Eigenschaftswert
Record<string, StructuredInputDefinition>
subagent_config
Optionale Konfiguration für Foundry-Textagenten, die dieser Sprachagent als Hintergrundspezialisten konsultieren kann.
subagent_config?: VoiceAgentSubagentConfig
Eigenschaftswert
tools
Die Werkzeuge, die der Voice Agent nutzen kann. Unterstützte Werkzeugarten sind function (vom Client ausgeführt), mcp, system (dienstverwaltete Sitzungskontrollen) und toolbox. Serverseitige Werkzeuge wie web_search, azure_ai_search, und openapi werden über einen Werkzeugkasten bereitgestellt und nicht direkt deklariert.
tools?: VoiceAgentToolUnion[]
Eigenschaftswert
tool_choice
Wie das Modell Werkzeuge für generierte Antworten auswählt.
none verhindert Werkzeugaufrufe, auto lässt das Modell entscheiden, required benötigt mindestens einen Werkzeugaufruf, und eine bestimmte Funktion oder ein MCP-Werkzeug kann mit einem Objekt ausgewählt werden.
Wird standardmäßig auf auto festgelegt.
tool_choice?: VoiceAgentToolChoice