Opsamling
Tip
Se fanen Tekst og billeder for flere detaljer!
Dette modul introducerer talegenkendelse (tale-til-tekst) som fundamentet for stemmebaserede applikationer og agenter. Eleverne undersøger, hvordan talt lyd optages fra en mikrofon eller en lydfil og konverteres til skriftlig tekst ved hjælp af Azure Speech. Modulet forklarer, hvor tale-til-tekst passer ind i en applikation – enten i en klientapp eller en backend-tjeneste – og fremhæver almindelige scenarier som live transskription, billedtekster, telefonsvarerbehandling og levering af tekstinput til AI-agenter.
Modulet dækker derefter talesyntese (tekst-til-tale), hvilket gør det muligt for applikationer at generere naturligt lydende talt lyd ud fra tekst. Lærende ser, hvordan Azure Speech bruger neurale stemmer til at styre udtale, tone, hastighed og tonehøjde, og hvordan syntetisk lyd kan afspilles med det samme eller gemmes til senere brug. Dette afsnit understreger, hvordan tekst-til-tale gør det muligt for applikationer og agenter at svare lydmæssigt, hvilket forbedrer tilgængelighed, handsfree-interaktion og den overordnede brugeroplevelse.
Endelig samler modulet disse funktioner med tale-til-tale ved brug af Voice Live. Lærende opdager, hvordan Voice Live kombinerer tale-til-tekst, AI-ræsonnering og tekst-til-tale i en enkelt, fuldt administreret tjeneste til samtaler i realtid. I stedet for at samle flere komponenter kan udviklere bruge Voice Live til at bygge responsive, naturlige stemmeagenter, der kan lytte, tænke og tale – hvilket gør det lettere at skabe produktionsklare samtaleoplevelser med Azure Speech og Microsoft Foundry.
Brug linkene nedenfor for at lære mere.
- Azure Speech i servicedokumentationen
- Lær mere om Azure Speech's Software Development Kits (SDK'er)
- Lær mere om Azure Speech - Voice Live i dokumentationen