Innledning
Azure Speech i Foundry Tools tilbyr tale-til-tekst og tekst-til-tale-funksjonalitet som du kan integrere i AI-applikasjoner. Disse funksjonene lar deg transkribere lyd til tekst og syntetisere naturlig klingende tale fra tekst.
Selv om du kan kalle disse funksjonene direkte gjennom Speech SDK eller REST API-er, kan du også gjøre dem tilgjengelige for en AI-agent via Azure Speech Model Context Protocol (MCP)-serveren. Denne tilnærmingen lar agenten håndtere taleoppgaver basert på brukerens naturlige språkforespørsel, uten at du trenger å skrive spesifikk kode for hver taleoperasjon.
For eksempel, la oss si at du jobber for et selskap som må behandle kundeservicesamtaler. Teamet ditt må transkribere innspilte samtaler til tekst for analyse, og generere lydsvar som kan spilles av for kundene. I stedet for å bygge separate integrasjoner for transkripsjon og syntese, kan du lage en AI-agent som bruker Azure Speech MCP-serveren til å utføre begge oppgavene via ett enkelt verktøy.
I denne modulen lærer du hvordan Azure Speech MCP-serveren fungerer, hvordan du kobler den til en AI-agent i Microsoft Foundry, og hvordan du bygger en klientapplikasjon som samhandler programmatisk med agenten.
Bemerkning
Vi erkjenner at forskjellige mennesker liker å lære på forskjellige måter. Du kan velge å fullføre denne modulen i videobasert format, eller du kan lese innholdet som tekst og bilder. Teksten inneholder flere detaljer enn videoene, så i noen tilfeller kan det være lurt å referere til den som tilleggsmateriale til videopresentasjonen.
Bemerkning
Azure Speech MCP-serveren er for øyeblikket i offentlig forhåndsvisning. Detaljer som er beskrevet i denne modulen, kan endres.