Wat is er nieuw in Azure AI Speech?

2025-05-02

Azure AI Speech wordt doorlopend bijgewerkt. Om op de hoogte te blijven van recente ontwikkelingen, vindt u in dit artikel informatie over nieuwe releases en functies.

Recente hoogtepunten

Als u de meertalige inhoud continu en nauwkeurig in een audiobestand wilt transcriberen, kunt u nu het nieuwste meertalige model gebruiken zonder de landinstellingencodes op te geven via een snelle transcriptie-API. Voor meer informatie, zie meertalige transcriptie in snelle transcriptie.
Snelle transcriptie is nu algemeen beschikbaar. Het kan audio veel sneller transcriberen dan de werkelijke audioduur. Zie de handleiding voor de snelle transcriptie-API voor meer informatie.
De Azure AI Speech Toolkit-extensie is nu beschikbaar voor Visual Studio Code-gebruikers. Het bevat een lijst met snelstartgidsen voor spraak en scenariovoorbeelden die eenvoudig kunnen worden gebouwd en uitgevoerd met eenvoudige klikken. Zie Azure AI Speech Toolkit in Visual Studio Code Marketplace voor meer informatie.
Hd-stemmen (Speech High Definition) van Azure AI zijn beschikbaar in openbare preview. De HD-stemmen kunnen de inhoud begrijpen, emoties automatisch detecteren in de invoertekst en de spreektoon in realtime aanpassen aan het gevoel. Zie Wat zijn HD-stemmen (Azure AI Speech high definition) voor meer informatie.
Videoomzetting is nu beschikbaar in de Azure AI Speech-service. Zie Wat is videovertaling? voor meer informatie.

Release-opmerkingen

Kies een dienst of hulpmiddel

Belangrijk

Inhoudsevaluatie (preview) via de Speech SDK wordt in juli 2025 buiten gebruik gesteld. In plaats daarvan kunt u Azure OpenAI-modellen gebruiken om resultaten van inhoudsevaluatie op te halen, zoals beschreven in de documentatie voor inhoudsevaluatie.

Speech SDK 1.44.1: Patchrelease

SDK-versie 1.44.1 wordt alleen uitgebracht voor JavaScript met 4 bugfixes:

Bugreparaties

Er is een buiten bereik exceptie verholpen wanneer slechts één segmentatiecontroleparameter werd opgegeven.
enableDictation is niet correct doorgegeven aan de Speech Service.
ConversationTranscriber heeft niet het juiste URL-pad gebruikt bij het maken met behulp van de methode fromEndpoint.
Er is een fout opgelost bij het pushen van gegevens naar een invoerstroom nadat deze is losgekoppeld.

Speech SDK 1.44: mei 2025-release

Belangrijk

Ondersteuning voor doelplatforms verandert:

De minimaal ondersteunde Android-versie is nu Android 8.0 (API-niveau 26).
De publicatie van Speech SDK Unity-pakketten wordt onderbroken na deze release.

Nieuwe functies:

Ondersteuning toegevoegd voor Android-paginaformaten van 16 KB geheugen.
De latentie van SpeechStartDetected-gebeurtenissen in ingesloten spraakherkenning is verminderd.
[C++, Python] Er is een methode toegevoegd om de beschikbare grootte van AudioDataStream op te halen.
[C++, Python] Er is ondersteuning toegevoegd voor aangepaste lexicon-URL's en voorkeurslandinstellingen in spraaksyntheseaanvragen.
[Java, Python] Er is ondersteuning toegevoegd voor verificatie op basis van Microsoft Entra-tokens met automatisch vernieuwen van tokens.
[Go] Ondersteuning toegevoegd voor gesprektranscriptie.

Bugreparaties

Opgeloste spraaksynthese werkt niet wanneer brontaaldetectie werd gebruikt.
Vaste bestandspaden met niet-ASCII-tekens die niet werken voor ingesloten spraakmodellen, KWS-modellen of logboekbestanden (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2288).
Een NoMatch-lus opgelost in ingesloten spraakherkenning in bepaalde omstandigheden.
De destructor van systeemeigen objecten is geblokkeerd omdat de herkenning niet is gemarkeerd als gestopt wanneer de verbinding met gebeurtenissen wordt verbroken.
Probleem opgelost dat het patroon IntentRecognizer niet correct werkt met meerdere bytetekens in bepaalde omstandigheden.
Het aanroepen van Close() een verbindingsobject was niet synchroon.
Er is een racevoorwaarde opgelost in de deallocatie van de verbinding die kan leiden tot een crash.
[macOS] Er zijn 'Info:'-berichten opgelost die op de console (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2610) worden weergegeven.

Voorbeelden

[Python] Voorbeeldcode toegevoegd voor recognizer met behulp van Microsoft Entra-tokenverificatiegegevens.

Speech SDK voor JavaScript

Nieuwe functies:

Bijgewerkte ontwikkelingsafhankelijkheid: TypeScript 3.5.3 → 4.5
TranslationRecognizer is bijgewerkt om standaard V2-eindpunten te gebruiken.
SpeechRecongizer bijgewerkt voor het gebruik van V2-eindpunten.
- Dit resulteert in het niet meer ontvangen van NoMatch-resultaten.
Er is ondersteuning toegevoegd voor verificatie op basis van Microsoft Entra-tokens voor spraakherkenning en -vertaling.
De FromEndpoint-API is bijgewerkt als de aanbevolen methode voor het maken van een SpeechConfig voor de meeste scenario's.
- Van toepassing op het gebruik van:
  - Spraakherkenner
  - TranslationRecognizer (via SpeechTranslationConfig)
  - Gesprekstranscribent
  - spraaksynthetiseur
- U kunt nu het eindpunt gebruiken vanuit Azure Portal voor Spraak- en Azure AI Foundry-resources om een SpeechConfig-object te maken.
- Alle andere methoden voor het maken van een SpeechConfig blijven functioneren en worden ondersteund.

Bugreparaties

Er is een oneindige herhalingslus bij verbindingen opgelost voor niet-ondersteunde afsluitcodes van verbindingen (https://github.com/microsoft/cognitive-services-speech-sdk-js/issues/896).

Speech CLI (SPX)

Nieuwe functies

Er is ondersteuning toegevoegd voor verificatie met Microsoft Entra-tokenreferenties.
Er is ondersteuning toegevoegd voor de Snelle transcriptie-API.

Bugreparaties

Vaste niet-werkende, door puntkomma's gescheiden invoer-URL's en invoerbestands-/URL-lijsten uit een bestand.

Speech SDK 1.43: release maart 2025

Notitie

Ubuntu 20.04 'standaard beveiligingsonderhoud' verloopt in april 2025 en is niet langer beschikbaar als ADO Build-agents. Toekomstige Speech SDK-releases vereisen Ubuntu 22.04 LTS (in plaats van Ubuntu 20.04) als de minimaal ondersteunde versie.

Nieuwe functies:

De FromEndpoint-API is bijgewerkt als de aanbevolen methode voor het maken van een SpeechConfig voor de meeste scenario's.
- Van toepassing op het gebruik van:
  - Spraakherkenner
  - TranslationRecognizer (via SpeechTranslationConfig)
  - Gesprekstranscribent
  - SpeechSynthesizer In alle programmeertalen behalve JavaScript.
- U kunt nu het eindpunt uit de Azure-portal voor Spraak- en Cognitive Services-resources gebruiken om een SpeechConfig-object te maken.
- Alle andere methoden voor het maken van een SpeechConfig blijven functioneren en worden ondersteund.
TranslationRecognizer is bijgewerkt om standaard V2-eindpunten te gebruiken.
- Hiermee verplaatst u besturingsparameters van de URL naar in-kanaalberichten wanneer u een V2-eindpunt gebruikt.
- Gedragswijziging: de standaardtaal die wordt geretourneerd voor 'zh' is nu 'zh-CN' in plaats van 'zh-hans'
Eigenschaps-id's toegevoegd voor SpeechSynthesis_FrameTimeoutInterval en SpeechSynthesis_RtfTimeoutThreshold.
Geoptimaliseerd het aantal keren dat de SDK opnieuw verbinding maakt voor langdurige herkenning.
[C++, Python] Er is ondersteuning toegevoegd voor het opgeven van de stijl en temperatuur in tekststreamingaanvragen.
[C#] Er is ondersteuning toegevoegd voor het automatisch vernieuwen van AAD-token bij het gebruik van FromEndpoint om een configuratieobject te maken.
- Hiermee wordt een afhankelijkheid van de Speech SDK toegevoegd aan het Azure.Core nuget-pakket.
- De Speech SDK kan nu TokenCredential-afgeleide objecten accepteren voor verificatie bij gebruik van:
  - Spraakherkenner
  - Vertaalherkenner
  - Gesprekstranscribent
[Objective-C] SPXTranslationRecognizer bijgewerkt ter ondersteuning van automatische detectie van brontaal vanuit open bereik.
[Objective-C , Python] Diagnostische API's EventLogger, FileLogger en MemoryLogger toegevoegd.
[Go]: Ondersteuning voor TranslationRecognizer toegevoegd

Bugreparaties

Ondersteuning voor OpenSSL 3 opgelost in Linux arm32 (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2736).
Het ontbrekende statusveld in de spraaksynthesestemlijst (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2771) is opgelost.
Opgelost probleem waarbij het patroon van IntentRecognizer de parser van de Japanse taal niet correct gehele getallen liet herkennen.
Er is een mogelijk probleem opgelost met dubbele resultaten van ingesloten spraakherkenning.
[Java] Lege deelnemers in ConversationParticipantsChangedEventArgs opgelost op Android 12 en hoger (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2687).

Voorbeelden

[C++] Er is een voorbeeld toegevoegd voor zelfstandige intentieherkenning met behulp van patroonkoppeling.
- Met de buitengebruikstelling van de LUIS-service in oktober 2025 wordt de Speech SDK ook buiten gebruik gesteld van de intentRecognizer-objectfamilie.
- Daarvoor wilden we de implementatie voor patroonkoppeling delen.
[C++, C#, Java, Python] De meeste voorbeelden zijn bijgewerkt voor het gebruik van de FromEndpoint-API in plaats van FromSubscription.
[C#] Er is een voorbeeld van een scenario toegevoegd voor een spraakherkenningstoepassing met meerdere lagen.
- Demonstreert een methodologie voor audioherhaling en opnieuw verbinding maken vanaf een edge-apparaat naar een service in de middelste laag die vervolgens audio doorstuurt naar de Speech Service via de Speech SDK
[C#] Bijgewerkte voorbeelden voor het automatisch vernieuwen van AAD-tokens.
[Python] Voorbeelden toegevoegd voor nieuwe diagnostische API's.
[Unity] Er zijn instructies toegevoegd voor het installeren van de nieuwe Azure.Core-afhankelijkheid.

Speech SDK 1.42.0: release van december 2024

Nieuwe functies

Java: Diagnostische logboekregistratie-API's toegevoegd met behulp van klassen FileLogger, MemoryLogger, EventLogger en SpxTrace.
Ondersteun het verzenden van de JSON-eigenschap "details" van een vergaderdeelnemer naar de service.
Go: Openbare eigenschaps-id toegevoegd SpeechServiceConnection_ProxyHostBypass om hosts op te geven waarvoor de proxy niet wordt gebruikt.
JavaScript, Go: Publieke eigenschap id Speech_SegmentationStrategy toegevoegd om te bepalen wanneer een gesproken zin is beëindigd en een definitief herkend resultaat moet worden gegenereerd (inclusief semantische segmentatie).
JavaScript, Go: Openbare eigenschap id toegevoegd Speech_SegmentationMaximumTimeMs om het einde van een gesproken zin te bepalen op basis van tijd in Java, Python, C#, C++

Bugreparaties

Een vaste ingesloten TTS-stem wordt (opnieuw) geladen voor elke synthese als de stemnaam niet is ingesteld.
Er zijn offsetberekeningsproblemen opgelost bij het gebruik van MeetingTranscriber in sommige scenario's.
Een mogelijke impasse is opgelost bij het parallel registreren van meerdere diagnostische gebeurtenisluisteraars.
(JavaScript) Mogelijk verlies van NoMatch-resultaten opgelost aan het einde van audio. Deze oplossing brengt het gedrag aan het einde van de spraakverwerking in lijn met de andere SDK-talen en kan ertoe leiden dat er geen lege gebeurtenissen meer worden gegenereerd.
(JavaScript) Pas verschuivingen in resultaat-JSON aan om uitgelijnd te worden met de offset op resultaatobjecten. Voorheen werd alleen de offset-eigenschap van het resultaatobject aangepast om rekening te houden met de herverbinding van de service.
Go-taal: er is een compilatiefout opgelost https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2639
Verholpen resultaatverschuivingen in de vergadertranscriptie wanneer er een herverbinding met de service plaatsvindt.
Verholpen een deadlock in logging.

Voorbeelden

C#-voorbeelden bijgewerkt voor gebruik van .NET 8.0.
Java-voorbeeld maakt gebruik van de API voor diagnostische logboekregistratie die het gebruik van de nieuwe klassen voor diagnostische logboekregistratie toont.

2024-november uitgave

Azure AI Speech Toolkit-extensie voor Visual Studio Code

De Azure AI Speech Toolkit-extensie is nu beschikbaar voor Visual Studio Code-gebruikers. Het bevat een lijst met snelstartgidsen voor spraak en scenariovoorbeelden die eenvoudig kunnen worden gebouwd en uitgevoerd met eenvoudige klikken. Zie Azure AI Speech Toolkit in Visual Studio Code Marketplace voor meer informatie.

Codevoorbeelden voor tekst-naar-spraak-avatar

We hebben tekst toegevoegd aan voorbeelden van avatarcode voor spraak voor Android en iOS. Deze voorbeelden laten zien hoe u realtime tekst gebruikt voor spraak avatars in uw mobiele toepassingen.

Speech SDK 1.41.1: 2024-oktober release

Nieuwe functies

Ondersteuning toegevoegd voor Amazon Linux 2023 en Azure Linux 3.0.
Openbare eigenschaps-id SpeechServiceConnection_ProxyHostBypass toegevoegd om hosts op te geven waarvoor de proxy niet wordt gebruikt.
Eigenschappen toegevoegd om nieuwe woordgroepensegmentatiestrategieën te beheren.

Oplossingen voor bugs

Er is een probleem opgelost met onvolledige ondersteuning voor geavanceerde modellen voor trefwoordherkenning die na augustus 2024 zijn geproduceerd.
- https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2564
- https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2571
- https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2590
- Houd er rekening mee dat uw project met Swift op iOS MicrosoftCognitiveServicesSpeech-EmbeddedXCFramework-1.41.1.zip (van https://aka.ms/csspeech/iosbinaryembedded) of de MicrosoftCognitiveServicesSpeechEmbedded-iOS-pod moet gebruiken die de ondersteuning van het geavanceerde model bevat.
Er is een geheugenlek in C# opgelost met betrekking tot het gebruik van tekenreeksen.
Probleem opgelost waarbij SPXAutoDetectSourceLanguageResult niet kon worden opgehaald van SPXConversationTranscriptionResult in Objective-C en Swift.
Er is een af en toe voorkomende crash opgelost bij het gebruik van de Microsoft Audio Stack tijdens herkenning.
Hints voor vaste typen in Python. https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2539
Opgelost dat de lijst met TTS-stemmen niet kon worden opgehaald bij het gebruik van een aangepast eindpunt.
Probleem opgelost waarbij embedded TTS zich opnieuw initialiseert bij elke spraakaanvraag wanneer de stem wordt gespecificeerd met een korte naam.
De API-referentiedocumentatie is gecorrigeerd met betrekking tot de maximale duur van RecognizeOnce-audio.
Foutafhandeling van willekeurige steekproeven in JavaScript opgelost
- Dankzij rseanhall voor deze bijdrage.
Er is een fout opgelost bij het berekenen van de audio-offset in JavaScript
- Dankzij motamed voor deze bijdrage.

Ingrijpende Wijzigingen

Ondersteuning voor trefwoordherkenning in Windows ARM 32-bits is verwijderd omdat de vereiste ONNX-runtime niet beschikbaar is voor dit platform.

Speech SDK 1.40: 2024-augustus uitgave

Notitie

Speech SDK versie 1.39.0 was een interne release en ontbreekt niet.

Nieuwe functies

Ondersteuning toegevoegd voor streaming van G.722 gecomprimeerde audio in spraakherkenning.
Ondersteuning toegevoegd voor pitch, rate en volume-instelling in invoertekststreaming in spraaksynthese.
Ondersteuning toegevoegd voor het streamen van persoonlijke spraakinvoertekst door introductie PersonalVoiceSynthesisRequest in spraaksynthese. Deze API is in preview en kan worden gewijzigd in toekomstige versies.
Er is ondersteuning toegevoegd voor het diariseren van tussenliggende resultaten wanneer ConversationTranscriber wordt gebruikt.
CentOS/RHEL 7-ondersteuning is verwijderd vanwege CentOS 7 EOL en het einde van RHEL 7 Onderhoudsondersteuning 2.
Voor het gebruik van ingesloten spraakmodellen is nu een modellicentie vereist in plaats van een modelsleutel. Als u een bestaande ingesloten spraakklant bent en een upgrade wilt uitvoeren, neemt u contact op met uw ondersteuningsmedewerker bij Microsoft voor meer informatie over modelupdates.

Bugreparaties

Ingebouwde binaire Speech SDK-bestanden voor Windows met de vlag _DISABLE_CONSTEXPR_MUTEX_CONSTRUCTOR als mitigatie voor het Visual C++-runtimeprobleem Toegangsconflict met std::mutex::lock na een upgrade naar VS 2022 versie 17.10.0 - Developer Community (visualstudio.com). Windows C++-toepassingen die de Speech SDK gebruiken, moeten mogelijk dezelfde buildconfiguratievlag toepassen als de code std::mutex gebruikt (zie de details in het gekoppelde probleem).
Probleem met detectie van OpenSSL 3.x op Linux arm64 opgelost (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2420).
Er is een probleem opgelost waarbij bij het implementeren van een UWP-app, -bibliotheken en -model uit het MAS NuGet-pakket niet naar de implementatielocatie werd gekopieerd.
Er is een conflict opgelost met een inhoudsprovider in Android-pakketten (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2463).
Opgelost: postprocessing-opties werden niet toegepast op tussenliggende spraakherkenningsresultaten.
Er is een .NET 8-waarschuwing over distributiespecifieke runtime-id's (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2244) opgelost.

Voorbeelden

Ingesloten spraakvoorbeelden bijgewerkt om een modellicentie te gebruiken in plaats van een sleutel.

Speech SDK 1.38.0: juni 2024-release

Nieuwe functies

Vereisten voor het Linux-platform voor Speech SDK upgraden:
- De nieuwe minimumbasislijn is Ubuntu 20.04 LTS of compatibel met glibc 2.31 of hoger.
- Binaire bestanden voor Linux x86 worden verwijderd overeenkomstig de ondersteuning van het Ubuntu 20.04-platform.
- Houd er rekening mee dat RHEL/CentOS 7 tot 30 juni wordt ondersteund (het einde van CentOS 7 en het einde van de ondersteuning voor ONDERHOUD van RHEL 7 2). Binaire bestanden voor deze bestanden worden verwijderd in de Speech SDK 1.39.0-release.
Voeg ondersteuning toe voor OpenSSL 3 op Linux.
Voeg ondersteuning toe voor g722-16khz-64kbps audio-uitvoerindeling met spraaksynthese.
Voeg ondersteuning toe voor het verzenden van berichten via een verbindingsobject met spraaksynthese.
Voeg Start/StopKeywordRecognition API's toe in Objective-C en Swift.
Voeg API toe voor het selecteren van een categorie voor een aangepast vertaalmodel.
Werk GStreamer-gebruik bij met spraaksynthese.

Bugreparaties

Los de fout "Websocket-berichtgrootte mag niet groter zijn dan 65.536 bytes" op tijdens het starten of stoppen van trefwoordherkenning.
Los een Python-segmentatiefout op tijdens spraaksynthese.

Voorbeelden

Werk C#-voorbeelden bij om standaard .NET 6.0 te gebruiken.

Speech SDK 1.37.0: 2024-apriluitgave

Nieuwe functies

Voeg ondersteuning toe voor invoertekststreaming in spraaksynthese.
Wijzig de standaard stem voor spraaksynthese in en-US-AvaMultilingualNeural.
Android-builds bijwerken voor gebruik van OpenSSL 3.x.

Bugreparaties

Corrigeer incidentele JVM-crashes tijdens het dispose van SpeechRecognizer wanneer MAS wordt gebruikt. (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2125)
Verbeter de detectie van standaardaudioapparaten in Linux. (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2292)

Voorbeelden

Bijgewerkt voor nieuwe functies.

Speech SDK 1.36.0: release maart 2024

Nieuwe functies

Voeg ondersteuning toe voor taalidentificatie in meertalige vertaling op v2-eindpunten met behulp van AutoDetectSourceLanguageConfig::FromOpenRange().

Bugreparaties

Repareer SynthesisCanceled-gebeurtenis die niet wordt geactiveerd als stop wordt opgeroepen tijdens de SynthesisStarted-gebeurtenis.
Los een ruisprobleem op in de ingesloten spraaksynthese.
Herstel een crash in ingesloten spraakherkenning bij het parallel uitvoeren van meerdere recognizers.
Herstel de instelling voor de woordgroepsdetectiemodus op v1/v2-eindpunten.
Oplossingen voor verschillende problemen met Microsoft Audio Stack.

Voorbeelden

Updates voor nieuwe functies.

Speech SDK 1.35.0: uitgave februari 2024

Nieuwe functies

Wijzig de standaard tekst-naar-spraakstem van en-US-JennyMultilingualNeural naar en-US-AvaNeural.
Ondersteuning voor gedetailleerdheid op woordniveau in ingesloten spraakvertalingsresultaten met behulp van het gedetailleerde uitvoerformaat.

Bugreparaties

Herstel de getter-API voor de positie van de audiodatastream in Python.
Herstel spraakomzetting met v2-eindpunten zonder taaldetectie.
Corrigeer een willekeurige crash en dubbele woordgrensgebeurtenissen in ingebouwde tekst-naar-spraakfunctionaliteit.
Retourneert een juiste annuleringsfoutcode voor een interne serverfout in WebSocket-verbindingen.
Los de fout op bij het laden van FPIEProcessor.dll bibliotheek wanneer MAS wordt gebruikt met C#.

Voorbeelden

Kleine opmaakupdates voor voorbeelden van ingesloten herkenning.

Speech SDK 1.34.1: Release van Januari 2024

Ingrijpende wijzigingen

Alleen oplossingen voor fouten

Nieuwe functies

Alleen oplossingen voor fouten

Bugreparaties

Regressie opgelost die is geïntroduceerd in 1.34.0, waarbij de URL van het service-eindpunt incorrect werd samengesteld vanwege onjuiste landinstellingen voor gebruikers in verschillende regio's van China.

Speech SDK 1.34.0: november 2023 uitgave

Ingrijpende wijzigingen

SpeechRecognizer wordt bijgewerkt om standaard een nieuw eindpunt te gebruiken (dat wil gezegd, wanneer u niet expliciet een URL opgeeft) die geen queryreeksparameters meer ondersteunt voor de meeste eigenschappen. Gebruik de bijbehorende API-functies in plaats van queryreeksparameters rechtstreeks in te stellen met ServicePropertyChannel.UriQueryParameter.

Nieuwe functies

Compatibiliteit met .NET 8 (Oplossing voor https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2170 behalve waarschuwing over centos7-x64)
Ondersteuning voor metrische gegevens over ingesloten spraakprestaties die kunnen worden gebruikt om de mogelijkheid van een apparaat voor het uitvoeren van ingesloten spraak te evalueren.
Ondersteuning voor brontaalidentificatie in ingesloten meertalige vertaling.
Ondersteuning voor ingesloten spraak-naar-tekst, tekst-naar-spraak en vertaling voor iOS en Swift/Objective-C, uitgebracht in preview.
Embedded-ondersteuning wordt geboden in MicrosoftCognitiveServicesSpeechEmbedded-iOS Cocoapod.

Bugreparaties

Oplossing voor tweevoudige groei van de binaire grootte van iOS SDK · Probleem #2113 · Azure-Samples/cognitive-services-speech-sdk (github.com)
Oplossing voor het niet ophalen van tijdstempels op woordniveau van Azure-spraak-naar-tekst-API · Probleem 2156 · Azure-Samples/cognitive-services-speech-sdk (github.com)
Oplossing voor het vernietigingsproces van de DialogServiceConnector om gebeurtenissen correct los te koppelen. Dit veroorzaakte af en toe crashes.
Oplossing voor uitzondering tijdens het maken van een recognizer wanneer MAS wordt gebruikt.
FPIEProcessor.dll van Microsoft.CognitiveServices.Speech.Extension.MAS NuGet-pakket voor Windows UWP x64 en Arm64 was afhankelijk van VC-runtimebibliotheken voor systeemeigen C++. Het probleem is opgelost door de afhankelijkheid bij te werken om VC-runtimebibliotheken (voor UWP) te corrigeren.
Oplossing voor [MAS] Terugkerende aanroepen naar recognizeOnceAsync resulteren in SPXERR_ALREADY_INITIALIZED bij het gebruik van MAS · Probleem #2124 · Azure-Samples/cognitive-services-speech-sdk (github.com)
Oplossing voor crash in ingesloten spraakherkenning wanneer zinnenlijsten worden gebruikt.

Voorbeelden

Geïntegreerde iOS-voorbeelden voor spraak naar tekst, tekst naar spraak en vertaling.

Speech CLI 1.34.0: release van november 2023

Nieuwe functies

Ondersteuning voor woordgrensgebeurtenissen die worden uitgevoerd bij het synthetiseren van spraak.

Bugreparaties

JMESPath-afhankelijkheid bijgewerkt naar de nieuwste versie, verbetert tekenreeksevaluaties

Release van Speech SDK 1.33.0: oktober 2023

** Melding van ingrijpende wijziging

Het nieuwe NuGet-pakket dat is toegevoegd voor Microsoft Audio Stack (MAS) moet nu worden opgenomen door toepassingen die MAS gebruiken in hun pakketconfiguratiebestanden.

Nieuwe functies

Het nieuwe NuGet-pakket Microsoft.CognitiveServices.Speech.Extension.MAS.nupkg toegevoegd, dat verbeterde echoannuleringsprestaties biedt bij het gebruik van Microsoft Audio Stack
Uitspraakbeoordeling: ondersteuning toegevoegd voor prosody en inhoudsevaluatie, waarmee de gesproken spraak kan worden beoordeeld in termen van prosody, vocabulaire, grammatica en onderwerp.

Bugreparaties

De verschuivingen in het resultaat van trefwoordherkenning zijn gecorrigeerd, zodat ze vanaf het begin correct overeenkomen met de invoeraudiostream. De oplossing is van toepassing op zowel zelfstandige trefwoordherkenning als door trefwoorden geactiveerde spraakherkenning.
Opgeloste Synthesizer stopSpeaking retourneert niet onmiddellijk SPXSpeechSynthesizer stopSpeaking() methode kan niet direct retourneren op iOS 17 - Probleem #2081
Er is een probleem opgelost met het importeren van Mac-katalysatoren op Swift-moduleOndersteuning voor mac-katalysator met apple silicon. Probleem 1948
JS: AudioWorkletNode-module laadt en gebruikt nu een vertrouwde URL, met een terugvaloptie voor CDN-browserinclusies.
JS: Verpakte lib-bestanden richten zich nu op ES6 JS, met ondersteuning voor ES5 JS verwijderd.
JS: tussenliggende gebeurtenissen voor vertaalscenario's die gericht zijn op het v2-eindpunt, worden correct verwerkt
JS: De taaleigenschap voor TranslationRecognitionEventArgs is nu ingesteld voor translation.hypothese-gebeurtenissen.
Spraaksynthese: De SynthesisCompleted-gebeurtenis wordt gegarandeerd verzonden na alle metagegevensgebeurtenissen, zodat deze kan worden gebruikt om aan te geven dat er een einde is gekomen aan de reeks gebeurtenissen. Hoe kun je detecteren wanneer visemes volledig zijn ontvangen? Probleem #2093 Azure-Samples/cognitive-services-speech-sdk

Voorbeelden

Voorbeeld toegevoegd om MULAW-streaming te demonstreren met behulp van Python)
Correctie voor spraak-naar-tekst NAudio-voorbeeld

Speech CLI 1.33.0: oktober 2023 uitgave

Nieuwe functies

Ondersteuning voor woordgrensgebeurtenissen die worden uitgevoerd bij het synthetiseren van spraak.

Bugreparaties

Geen

Speech SDK 1.32.1: september 2023 uitgave

Bugreparaties

Updates voor Android-pakketten met de nieuwste beveiligingsoplossingen van OpenSSL1.1.1v
JS – Beschikbaarheid eigenschap WebWorkerLoadType toegevoegd om het laden van data-URL's voor time-out-werkers te omzeilen
JS – Los het probleem van gespreksvertaling die na 10 minuten wordt verbroken op
JS: Authenticatietoken voor Gesprek Vertaling wordt nu doorgegeven van Gesprek naar de verbinding van de Vertaaldienst.

Voorbeelden

Gesprektranscriptie met Swift-API's

Speech SDK 1.31.0: release van augustus 2023

Nieuwe functies

Ondersteuning voor realtime-diarisatie is beschikbaar in openbare bètaversie met de Speech SDK 1.31.0. Deze functie is beschikbaar in de volgende SDK's: C#, C++, Java, JavaScript, Python en Objective-C/Swift.
Gesynchroniseerde spraaksynthese met woord-, grens- en viseme-gebeurtenissen bij audio-weergave

Ingrijpende wijzigingen

De naam van het voormalige scenario voor gesprektranscriptie wordt gewijzigd in 'transcriptie van vergadering'. Gebruik bijvoorbeeld MeetingTranscriber in plaats van ConversationTranscriber, en gebruik CreateMeetingAsync in plaats van CreateConversationAsync. Hoewel de namen van SDK-objecten en -methoden zijn gewijzigd, verandert de naam van de functie zelf niet. Gebruik transcriptieobjecten voor vergaderingen voor transcriptie van vergaderingen met gebruikersprofielen en spraakhandtekeningen. De 'gespreksomzetting'-objecten en -methoden worden niet beïnvloed door deze wijzigingen. U kunt nog steeds het ConversationTranslator object en de bijbehorende methoden gebruiken voor vertaalscenario's.
Voor realtime-diarisatie wordt een nieuw ConversationTranscriber object geïntroduceerd. Het nieuwe objectenmodel voor gesprekstranscriptie en gesprekspatronen zijn vergelijkbaar met continue herkenning met het SpeechRecognizer object. Een belangrijk verschil is dat het ConversationTranscriber object is ontworpen om te worden gebruikt in een gespreksscenario waarin u meerdere sprekers wilt onderscheiden (diarisatie). Gebruikersprofielen en spraakhandtekeningen zijn niet van toepassing. Zie de snelle startgids voor realtime-diarisatie voor meer informatie.

In deze tabel ziet u de vorige en nieuwe objectnamen voor realtime diarisatie en transcriptie van vergaderingen. De scenarionaam bevindt zich in de eerste kolom, de vorige objectnamen bevinden zich in de tweede kolom en de nieuwe objectnamen bevinden zich in de derde kolom.

Scenarionaam	Vorige objectnamen	Nieuwe objectnamen
Real-time diarisatie	Niet van toepassing.	`ConversationTranscriber`
Transcriptie van vergadering	`ConversationTranscriber` `ConversationTranscriptionEventArgs` `ConversationTranscriptionCanceledEventArgs` `ConversationTranscriptionResult` `RemoteConversationTranscriptionResult` `RemoteConversationTranscriptionClient` `RemoteConversationTranscriptionResult` `Participant` ¹ `ParticipantChangedReason` ¹ `User` ¹	`MeetingTranscriber` `MeetingTranscriptionEventArgs` `MeetingTranscriptionCanceledEventArgs` `MeetingTranscriptionResult` `RemoteMeetingTranscriptionResult` `RemoteMeetingTranscriptionClient` `RemoteMeetingTranscriptionResult` `Participant` `ParticipantChangedReason` `User` `Meeting` ²

¹ De Participant, ParticipantChangedReasonen User objecten zijn van toepassing op zowel transcriptie van vergaderingen als scenario's voor het vertalen van vergaderingen.

² Het Meeting object is nieuw en wordt gebruikt met het MeetingTranscriber object.

Bugreparaties

Minimaal ondersteunde macOS-versie opgelost https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2017
Een bug in de uitspraakbeoordeling opgelost.
- Er is een probleem opgelost met de nauwkeurigheidsscores van het foneem, zodat deze nu alleen het specifieke verkeerde uitgesproken foneem weerspiegelen. https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/1917
- Er is een probleem opgelost waarbij de functie Uitspraakbeoordeling onnauwkeurig de juiste uitspraak identificeerde als onjuist, met name in situaties waarin woorden meerdere geldige uitspraken konden hebben. https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/1530

Voorbeelden

Speech SDK 1.30.0: release van juli 2023

Nieuwe functies

C++, C#, Java - Ondersteuning toegevoegd voor DisplayWords het gedetailleerde resultaat van Embedded Speech Recognition.
Objective-C/Swift - Ondersteuning toegevoegd voor ConnectionMessageReceived gebeurtenissen in Objective-C/Swift.
Objective-C/Swift - Verbeterde modellen voor trefwoordspotting voor iOS. Deze wijziging heeft de grootte van bepaalde pakketten vergroot, die binaire iOS-bestanden bevatten (zoals NuGet, XCFramework). We werken eraan om de grootte voor toekomstige releases te verkleinen.

Bugreparaties

Er is een geheugenlek opgelost bij het gebruik van spraakherkenning met PhraseListGrammar, zoals gerapporteerd door een klant (GitHub-probleem).
Er is een deadlock opgelost in de tekst-naar-spraak open verbindings-API.

Meer notities

Java : sommige intern gebruikte public Java-API-methoden zijn gewijzigd in het pakket internalof protectedprivate. Deze wijziging mag geen effect hebben op ontwikkelaars, omdat we niet verwachten dat toepassingen deze gebruiken. Hier genoteerd voor transparantie.

Voorbeelden

Nieuwe voorbeelden van uitspraakbeoordeling over het opgeven van een leertaal in uw eigen toepassing
- C#: Zie voorbeeldcode.
- C++: Zie voorbeeldcode.
- JavaScript: Zie voorbeeldcode.
- Objective-C: Zie voorbeeldcode.
- Python: Zie voorbeeldcode.
- Swift: Zie voorbeeldcode.

Speech SDK 1.29.0: Juni 2023 release

Nieuwe functies

C++, C#, Java - Preview van ingesloten spraakomzettings-API's. U kunt nu spraakomzetting uitvoeren zonder cloudverbinding.
JavaScript - Continuous Language Identification (LID) is nu ingeschakeld voor spraakomzetting.
JavaScript : communitybijdrage voor het toevoegen van LocaleName eigenschap aan VoiceInfo klasse. Bedankt gitHub-gebruiker shivsarthak voor de pull-aanvraag.
C++, C#, Java - Ondersteuning toegevoegd voor het opnieuwamplen van ingesloten tekst naar spraakuitvoer van 16 kHz tot 48 kHz sample rate.
Er is ondersteuning toegevoegd voor hi-IN locale in de Intent Recognizer met eenvoudige patroonherkenning.

Bugreparaties

Verholpen een crash veroorzaakt door een wedloopconditie in de spraakherkenner tijdens het vernietigen van objecten, zoals gezien in enkele van onze Android-tests.
Mogelijke impasses in Intent Recognizer opgelost met Simple Pattern Matcher

Voorbeelden

Nieuwe voorbeelden van ingesloten spraakomzetting

Speech SDK 1.28.0: mei 2023-uitgave

Ingrijpende wijziging

JavaScript SDK: OcSP (Online Certificate Status Protocol) is verwijderd. Hierdoor kunnen clients beter voldoen aan browser- en Node-standaarden voor certificaatafhandeling. Versie 1.28 en hoger bevatten niet langer onze aangepaste OCSP-module.

Nieuwe functies

Ingesloten spraakherkenning keert nu NoMatchReason::EndSilenceTimeout terug wanneer er aan het einde van een uiting een stilte-time-out optreedt. Dit komt overeen met het gedrag bij het uitvoeren van herkenning met behulp van de realtime spraakservice.
JavaScript SDK: Eigenschappen instellen op SpeechTranslationConfig met PropertyId enum-waarden.

Bugreparaties

C# op Windows - Mogelijke race condition/deadlock oplossen in de Windows-audio-extensie. In scenario’s die zowel de audio-renderer snel verwijderen als de Synthesizer-methode gebruiken om het spreekproces te stoppen, werd de onderliggende gebeurtenis niet opnieuw ingesteld door het stopproces. Dit kon ervoor zorgen dat het rendererobject nooit wordt verwijderd, terwijl het een wereldwijde vergrendeling voor verwijdering vasthoudt, wat de dotnet GC-thread kan blokkeren.

Voorbeelden

Er is een ingevoegd spraakvoorbeeld toegevoegd voor MAUI.
Het ingesloten spraakvoorbeeld voor Android Java bijgewerkt met tekst-naar-spraak.

Speech SDK 1.27.0: April 2023-versie

Melding over aanstaande wijzigingen

We zijn van plan om OCSP (Online Certificate Status Protocol) te verwijderen in de volgende JavaScript SDK-release. Hierdoor kunnen clients beter voldoen aan browser- en Node-standaarden voor certificaatafhandeling. Versie 1.27 is de laatste release die onze aangepaste OCSP-module bevat.

Nieuwe functies

JavaScript : ondersteuning toegevoegd voor microfooninvoer vanuit de browser met sprekeridentificatie en verificatie.
Embedded Speech Recognition - Update-ondersteuning voor PropertyId::Speech_SegmentationSilenceTimeoutMs instelling.

Bugreparaties

Algemeen - Betrouwbaarheidsupdates in logica voor het opnieuw verbinden van de service (alle programmeertalen behalve JavaScript).
Algemeen : corrigeer tekenreeksconversies die geheugen in Windows lekken (alle relevante programmeertalen behalve JavaScript).
Ingesloten spraakherkenning - Verhelp crash van de Franse spraakherkenning bij het gebruik van bepaalde vermeldingen in de grammaticalijst.
Broncodedocumentatie : correcties voor SDK-referentiedocumentatieopmerkingen met betrekking tot audiologboekregistratie in de service.
Intentieherkenning : corrigeer prioriteiten van Pattern Matcher met betrekking tot lijstentiteiten.

Voorbeelden

De verificatiefout in het C#-voorbeeld van gesprekstranscriptie (CTS) correct afhandelen.
Voorbeeld van streaming-uitspraakbeoordeling toegevoegd voor Python, JavaScript, Objective-C en Swift.

Speech SDK 1.26.0: release van maart 2023

Ingrijpende wijzigingen

Bitcode is uitgeschakeld in alle iOS-doelen in de volgende pakketten: Cocoapod met xcframework, NuGet (voor Xamarin en MAUI) en Unity. De wijziging wordt veroorzaakt door de afschaffing van bitcodeondersteuning van Apple vanaf Xcode 14 en hoger. Deze wijziging betekent ook dat als u Xcode 13-versie gebruikt of als u de bitcode expliciet hebt ingeschakeld voor uw toepassing met behulp van de Speech SDK, er mogelijk een fout optreedt met de tekst 'framework bevat geen bitcode en u moet deze opnieuw opbouwen'. U kunt dit probleem oplossen door ervoor te zorgen dat de doelen bitcode hebben uitgeschakeld.
Het minimale iOS-implementatiedoel wordt bijgewerkt naar 11.0 in deze release, wat betekent dat armv7 HW niet meer wordt ondersteund.

Nieuwe functies

Embedded (apparaatgebaseerde) spraakherkenning ondersteunt nu zowel 8- als 16-kHz samplingrate-ingangsaudio (16 bit per sample, mono PCM).
Spraaksynthese rapporteert nu verbindings-, netwerk- en servicelatenties in het resultaat om end-to-end latentieoptimalisatie te helpen.
Nieuwe regels voor het verbreken van bindingen voor intentieherkenning met eenvoudige patroonkoppelingen. Hoe meer tekenbytes overeenkomen, des te groter de kans dat deze de voorkeur krijgen boven patronen met een lager aantal tekenbytes. Voorbeeld: Het patroon 'Select {something} in de rechterbovenhoek' wint over 'Select {something}'

Bugreparaties

Spraaksynthese: los een fout op waarbij de emoji niet juist is in woordgrensgebeurtenissen.
Intentieherkenning met Conversational Language Understanding (CLU):
- Intenties uit de CLU Orchestrator-werkstroom worden nu correct weergegeven.
- Het JSON-resultaat is nu beschikbaar via de eigenschaps-id LanguageUnderstandingServiceResponse_JsonResult.
Spraakherkenning met trefwoordactivering: Oplossing voor ontbrekende ~150 ms audio na een trefwoordherkenning.
Oplossing voor Speech SDK NuGet iOS MAUI release build, gemeld door de klant (GitHub-issue)

Voorbeelden

Oplossing voor Swift iOS-voorbeeld, gerapporteerd door klant (GitHub-probleem)

Speech SDK 1.25.0: januari 2023-release

Ingrijpende wijzigingen

Taalidentificatie-API's (preview) zijn vereenvoudigd. Als u bijwerkt naar Speech SDK 1.25 en een buildfout ziet, ga dan naar de pagina Taalidentificatie om meer te weten te komen over de nieuwe eigenschap SpeechServiceConnection_LanguageIdMode. Deze enkele eigenschap vervangt de twee vorige eigenschappen SpeechServiceConnection_SingleLanguageIdPriority en SpeechServiceConnection_ContinuousLanguageIdPriority. Prioriteit geven tussen lage latentie en hoge nauwkeurigheid is niet meer nodig na recente modelverbeteringen. Nu hoeft u alleen te selecteren of u aan het begin of continue taalidentificatie wilt uitvoeren bij het uitvoeren van continue spraakherkenning of vertaling.

Nieuwe functies

C#/C++/Java: Embedded Speech SDK wordt nu uitgebracht onder beperkte openbare preview. Zie de documentatie van Embedded Speech (preview). U kunt nu spraak op het apparaat naar tekst en tekst naar spraak uitvoeren wanneer de cloudverbinding onregelmatig of niet beschikbaar is. Ondersteund op Android-, Linux-, macOS- en Windows-platforms
C# MAUI: Ondersteuning toegevoegd voor iOS- en Mac Catalyst-doelen in Speech SDK NuGet (probleem van de klant)
Unity: Android x86_64-architectuur toegevoegd aan Unity-pakket (probleem met klant)
Ga naar:
- Directe streamingondersteuning voor ALAW/MULAW toegevoegd voor spraakherkenning (probleem van de klant)
- Ondersteuning toegevoegd voor PhraseListGrammar. Bedankt GitHub-gebruiker czkoko voor je bijdrage aan de community!
C#/C++: Intent Recognizer biedt nu ondersteuning voor Conversational Language Understanding-modellen in C++ en C# met indeling in de Microsoft-service

Bugreparaties

Los een occasionele vastloper op in KeywordRecognizer wanneer je probeert het te stoppen
Python:
- Oplossing voor het ophalen van de resultaten van de uitspraakbeoordeling wanneer PronunciationAssessmentGranularity.FullText is ingesteld (Klantprobleem)
- Oplossing voor het probleem waarbij de geslachtseigenschap voor mannelijke stemmen niet wordt opgehaald bij het verkrijgen van spraaksynthesestemmen.
JavaScript
- Oplossing voor het parseren van sommige WAV-bestanden die zijn vastgelegd op iOS-apparaten (probleem van de klant)
- JS SDK bouwt nu zonder npm-force-oplossingen te gebruiken (probleem van de klant)
- Conversation Translator stelt nu het service-eindpunt correct in wanneer u een speechConfig-exemplaar gebruikt dat is gemaakt met SpeechConfig.fromEndpoint()

Voorbeelden

Voorbeelden toegevoegd die laten zien hoe u Ingesloten spraak gebruikt
Spraak toegevoegd aan tekstvoorbeeld voor MAUI

Zie de opslagplaats met voorbeelden van speech-SDK.

Speech SDK 1.24.2: November 2022-uitgave

Nieuwe functies

Geen nieuwe functies, alleen een ingesloten engineoplossing ter ondersteuning van nieuwe modelbestanden.

Bugreparaties

Alle programmeertalen
- Er is een probleem opgelost met versleuteling van ingesloten spraakherkenningsmodellen.

Speech SDK 1.24.1: Release van november 2022

Nieuwe functies

Gepubliceerde pakketten voor de preview-versie van Embedded Speech. Zie https://aka.ms/embedded-speech voor meer informatie.

Bugreparaties

Alle programmeertalen
- Geïntegreerde TTS-crash herstellen wanneer het stemlettertype niet wordt ondersteund
- Fix stopSpeaking() kan het afspelen niet stoppen in Linux (#1686)
JavaScript SDK
- Regressie opgelost in de manier waarop de gesprekstranscriber audio afhandelde.
Java
- Tijdelijk bijgewerkte POM- en Javadocs-bestanden gepubliceerd naar Maven Central om de documentatiepijplijn in staat te stellen online referentiedocumentatie bij te werken.
Python
- Herstel regressie waarbij Python speak_text(ssml) geen waarde retourneert.

Speech SDK 1.24.0: Oktober 2022 release

Nieuwe functies

Alle programmeertalen: AMR-WB (16khz) toegevoegd aan de ondersteunde lijst met tekst-naar-spraak audio-uitvoerindelingen
Python: Pakket toegevoegd voor Linux Arm64 voor ondersteunde Linux-distributies.
C#/C++/Java/Python: ondersteuning toegevoegd voor directe streaming van ALAW & MULAW naar de spraakservice (naast de bestaande PCM-stream) met behulp van AudioStreamWaveFormat.
C# MAUI: NuGet-pakket bijgewerkt ter ondersteuning van Android-doelen voor .NET MAUI-ontwikkelaars (probleem van de klant)
Mac: Afzonderlijke XCframework voor Mac toegevoegd, die geen binaire iOS-bestanden bevat. Dit biedt een optie voor ontwikkelaars die alleen binaire Mac-bestanden nodig hebben met behulp van een kleiner XCframework-pakket.
Microsoft Audio Stack (MAS):
- Wanneer straalvormende hoeken worden opgegeven, wordt het geluid dat buiten het opgegeven bereik afkomstig is effectiever onderdrukt.
- Ongeveer 70% vermindering van de grootte van libMicrosoft.CognitiveServices.Speech.extension.mas.so Linux ARM32 en Linux Arm64.
Intentieherkenning met behulp van patroonkoppeling:
- Ondersteuning voor orthografie toevoegen voor de talen fr, , deesjp
- Ondersteuning voor vooraf samengestelde gehele getallen voor taal es toegevoegd.

Bugreparaties

iOS: oplossing voor spraaksynthesefout in iOS 16 veroorzaakt door gecomprimeerde audiodecoderingsfout (probleem van de klant).
JavaScript:
- Fout in verificatietoken opgelost, werkt niet bij het verkrijgen van de spraaklijst voor spraaksynthese (klantprobleem).
- Gegevens-URL gebruiken voor het laden van werknemers (klantprobleem).
- Maak alleen een worklet voor de audio-processor wanneer AudioWorklet wordt ondersteund in de browser (klantprobleem). Dit was een bijdrage van william Wong. Bedankt William!
- Los herkende callback op wanneer het LUIS-antwoord connectionMessage leeg is (probleem van de klant).
- Time-out voor spraaksegmentatie juist instellen.
Intentieherkenning met behulp van patroonkoppeling:
- Niet-json-tekens in modellen worden nu correct geladen.
- Los het probleem met vastlopen op wanneer recognizeOnceAsync(text) werd aangeroepen tijdens continue herkenning.

Speech SDK 1.23.0: Juli 2022 release

Nieuwe functies

C#, C++, Java: ondersteuning toegevoegd voor talen zh-cn en zh-hk in intentieherkenning met patroonkoppeling.
C#: ondersteuning toegevoegd voor AnyCPU .NET Framework-builds

Bugreparaties

Android: Opgeloste OpenSSL-beveiligingsprobleem CVE-2022-2068 door OpenSSL bij te werken naar 1.1.1q
Python: Crash oplossen bij gebruik van PushAudioInputStream
iOS: Fix "EXC_BAD_ACCESS: Poging om een null-aanwijzer te dereferenceren" zoals gerapporteerd in de GitHub-kwestie

Speech SDK 1.22.0: release van juni 2022

Nieuwe functies

Java: IntentRecognitionResult-API voor getEntities(), applyLanguageModels() en recognizeOnceAsync(text) toegevoegd ter ondersteuning van de engine voor eenvoudige patroonkoppeling.
Unity: Ondersteuning toegevoegd voor Mac M1 (Apple Silicon) voor Unity-pakket (GitHub-probleem)
C#: ondersteuning toegevoegd voor x86_64 voor Xamarin Android (GitHub-probleem)
C#: minimaal bijgewerkte versie van .NET Framework naar v4.6.2 voor SDK C#-pakket omdat v4.6.1 buiten gebruik is gesteld (zie levenscyclusbeleid voor Microsoft .NET Framework-onderdelen)
Linux: Ondersteuning toegevoegd voor Debian 11 en Ubuntu 22.04 LTS. Ubuntu 22.04 LTS vereist handmatige installatie van libssl1.1 als een binair pakket van hier (bijvoorbeeld libssl1.1_1.1.1l-1ubuntu1.3_amd64.deb of nieuwer voor x64), of door uit de bron te compileren.

Bugreparaties

UWP: OpenSSL-afhankelijkheid verwijderd uit UWP-bibliotheken en vervangen door WinRT-websocket en HTTP-API's om te voldoen aan de beveiligingsnaleving en een kleinere binaire footprint.
Mac: Probleem 'MicrosoftCognitiveServicesSpeech Module Niet gevonden' opgelost bij het gebruik van Swift-projecten die gericht zijn op macOS-platform
Windows, Mac: Er is een platformspecifiek probleem opgelost waarbij audiobronnen die via eigenschappen waren geconfigureerd om in realtime te streamen, soms achterliepen en uiteindelijk hun capaciteit overschreden.

Voorbeelden (GitHub)

C#: .NET Framework-voorbeelden bijgewerkt voor gebruik van v4.6.2
Unity: Voorbeeld van virtuele-assistentapplicatie gecorrigeerd voor Android en UWP
Unity: Unity-voorbeelden bijgewerkt voor unity 2020 LTS-versie

Speech SDK 1.21.0: release van april 2022

Nieuwe functies

Java & JavaScript: ondersteuning toegevoegd voor continue taalidentificatie bij gebruik van het SpeechRecognizer-object
JavaScript: Diagnostische API's toegevoegd om logboekregistratie van consolelogboeken en (alleen Node)-bestanden in te schakelen, om Microsoft te helpen bij het oplossen van door de klant gerapporteerde problemen
Python: ondersteuning toegevoegd voor gesprektranscriptie
Go: Ondersteuning toegevoegd voor Speaker Recognition
C++ & C#: ondersteuning toegevoegd voor een vereiste groep woorden in intent recognizer (eenvoudige patroonkoppeling). Bijvoorbeeld: '(set|start|begin) een timer' waarbij 'set', 'start' of 'begin' aanwezig moeten zijn om de intentie te kunnen herkennen.
Alle programmeertalen, Spraaksynthese: eigenschap duur toegevoegd aan gebeurtenissen bij woordgrenzen. Ondersteuning toegevoegd voor interpunctiegrens en zinsgrens
Objective-C/Swift/Java: Resultaten op woordniveau toegevoegd aan het resultaatobject Uitspraakbeoordeling (vergelijkbaar met C#). De toepassing hoeft geen JSON-resultaattekenreeks meer te parseren om informatie op woordniveau op te halen (GitHub-probleem)
iOS-platform: experimentele ondersteuning toegevoegd voor ARMv7-architectuur

Bugreparaties

iOS-platform: Oplossing voor het bouwen van het doel 'Elk iOS-apparaat' bij gebruik van CocoaPod (GitHub-probleem)
Android-platform: OpenSSL-versie is bijgewerkt naar 1.1.1n om beveiligingsprobleem CVE-2022-0778 op te lossen
JavaScript: Probleem opgelost waarbij wav-header niet is bijgewerkt met de bestandsgrootte (GitHub-probleem)
JavaScript: Probleem met de synchronisatie van aanvraag-id's die vertaalscenario's verbreken oplossen (GitHub-probleem)
JavaScript: Probleem oplossen bij het instantiëren van SpeakerAudioDestination zonder stream (GitHub-probleem]
C++: C++-headers herstellen om een waarschuwing te verwijderen bij het compileren van C++17 of hoger

Voorbeelden van GitHub

Nieuwe Java-voorbeelden voor spraakherkenning met taalidentificatie
Nieuwe Python- en Java-voorbeelden voor gesprektranscriptie
Nieuw Go-voorbeeld voor spraakherkenning
Nieuw C++ en C# -hulpprogramma voor Windows waarmee alle audio-opname- en renderapparaten worden opgesomd om hun apparaat-id te vinden. Deze id is nodig voor de Speech SDK als u van plan bent audio van een niet-standaardapparaat vast te leggen of audio weer te geven op een niet-standaardapparaat.

Speech SDK 1.20.0: januari 2022-release

Nieuwe functies

Objective-C, Swift en Python: ondersteuning toegevoegd voor DialogServiceConnector, gebruikt voor spraakassistentscenario's.
Python: ondersteuning voor Python 3.10 is toegevoegd. Ondersteuning voor Python 3.6 is verwijderd, vanwege het einde van de levenscyclus van Python 3.6.
Unity: Speech SDK wordt nu ondersteund voor Unity-toepassingen in Linux.
C++, C#: IntentRecognizer met behulp van patroonkoppeling wordt nu ondersteund in C#. Daarnaast worden scenario's met aangepaste entiteiten, optionele groepen en entiteitsrollen nu ondersteund in C++ en C#.
C++, C#: Verbeterde logboekregistratie van diagnostische gegevens met behulp van nieuwe klassen FileLogger, MemoryLogger en EventLogger. SDK-logboeken zijn een belangrijk hulpprogramma voor Microsoft om door de klant gerapporteerde problemen vast te stellen. Deze nieuwe klassen maken het eenvoudiger voor klanten om Speech SDK-logboeken te integreren in hun eigen logboekregistratiesysteem.
Alle programmeertalen: PronunciationAssessmentConfig heeft nu eigenschappen voor het instellen van het gewenste phoneme-alfabet (IPA of SAPI) en N-Best Phoneme Count (om te voorkomen dat een configuratie-JSON moet worden gemaakt volgens GitHub-probleem 1284). Uitvoer op lettergreepniveau wordt nu ook ondersteund.
Android, iOS en macOS (alle programmeertalen): GStreamer is niet meer nodig om netwerken met beperkte bandbreedte te ondersteunen. SpeechSynthesizer maakt nu gebruik van de audiocoderingsmogelijkheden van het besturingssysteem om gecomprimeerde audio te decoderen die wordt gestreamd van de tekst naar de spraakservice.
Alle programmeertalen: SpeechSynthesizer ondersteunt nu drie nieuwe opus-indelingen voor onbewerkte uitvoer (zonder container), die veel worden gebruikt in scenario's voor live streamen.
JavaScript: GetVoicesAsync() API toegevoegd aan SpeechSynthesizer om de lijst met ondersteunde synthesestemmen op te halen (GitHub-probleem 1350)
JavaScript: GetWaveFormat() API toegevoegd aan AudioStreamFormat ter ondersteuning van niet-PCM-golfindelingen (GitHub-probleem 452)
JavaScript: volume getter/setter en mute()/unmute() API's toegevoegd aan SpeakerAudioDestination (GitHub-probleem 463)

Bugreparaties

C++, C#, Java, JavaScript, Objective-C en Swift: Oplossing voor het verwijderen van een vertraging van 10 seconden tijdens het stoppen van een spraakherkenningsfunctie die gebruikmaakt van een PushAudioInputStream. Dit is voor het geval dat er geen nieuwe audio wordt gepusht nadat StopContinuousRecognition is aangeroepen (GitHub-problemen 1318, 331)
Unity op Android en UWP: Unity-metabestanden zijn opgelost voor UWP, Android Arm64 en Windows-subsysteem voor Android (WSA) Arm64 (GitHub-probleem 1360)
iOS: het compileren van uw Speech SDK-toepassing op elk iOS-apparaat wanneer u CocoaPods gebruikt, is nu opgelost (GitHub-probleem 1320)
iOS: Wanneer SpeechSynthesizer is geconfigureerd voor het rechtstreeks uitvoeren van audio naar een luidspreker, wordt afspelen gestopt aan het begin in zeldzame omstandigheden. Dit is opgelost.
JavaScript: Gebruik scriptprocessor-terugval voor microfooninvoer als er geen audiowerklet-functie is gevonden (GitHub-probleem 455)
JavaScript: Protocol toevoegen aan agent om de fout te beperken die is gevonden met Sentry-integratie (GitHub-probleem 465)

Voorbeelden van GitHub

C++-, C#-, Python- en Java-voorbeelden die laten zien hoe u gedetailleerde herkenningsresultaten krijgt. De details omvatten alternatieve herkenningsresultaten, betrouwbaarheidsscore, lexicale vorm, genormaliseerd formulier, gemaskeerde genormaliseerde vorm, met tijdsinstellingen op woordniveau voor elk formulier.
iOS-voorbeeld toegevoegd met AVFoundation als externe audiobron.
Java-voorbeeld toegevoegd om te laten zien hoe u de SRT-indeling (SubRip Text) kunt ophalen met behulp van de wordBoundary-gebeurtenis.
Android-voorbeelden voor uitspraakbeoordeling.
C++, C# met het gebruik van de nieuwe diagnostische logging klassen.

Speech SDK 1.19.0: November 2021 uitgave

Hoogtepunten

De spraakherkenningsdienst is nu algemeen beschikbaar. Speech SDK-API's zijn beschikbaar op C++, C#, Java en JavaScript. Met Speaker Recognition kunt u sprekers nauwkeurig verifiëren en identificeren op basis van hun unieke stemkenmerken. Zie de documentatie voor meer informatie over dit onderwerp.
We hebben ondersteuning voor Ubuntu 16.04 verwijderd in combinatie met Azure DevOps en GitHub. Ubuntu 16.04 bereikte het einde van de levensduur in april 2021. Migreer uw Ubuntu 16.04-werkstromen naar Ubuntu 18.04 of hoger.
Bij het koppelen van OpenSSL in binaire Linux-bestanden is overgestapt naar dynamische koppeling. De binaire grootte van Linux is met ongeveer 50% verminderd.
Mac M1 ARM-gebaseerde siliciumondersteuning toegevoegd.

Nieuwe functies

C++/C#/Java: nieuwe API's toegevoegd om ondersteuning voor audioverwerking in te schakelen voor spraakinvoer met Microsoft Audio Stack. Documentatie hier.
C++: Nieuwe API's voor intentieherkenning om geavanceerdere patroonkoppeling mogelijk te maken. Dit omvat lijsten en vooraf gedefinieerde gehele getallen en ondersteuning voor groeperingsintenties en entiteiten als modellen (documentatie, updates en voorbeelden zijn in ontwikkeling en worden in de nabije toekomst gepubliceerd).
Mac: Ondersteuning voor op Arm64 (M1) gebaseerde silicium voor CocoaPod-, Python-, Java- en NuGet-pakketten met betrekking tot GitHub-probleem 1244.
iOS/Mac: binaire iOS- en macOS-bestanden worden nu verpakt in xcframework met betrekking tot GitHub-probleem 919.
iOS/Mac: Ondersteuning voor Mac-katalysator met betrekking tot GitHub-probleem 1171.
Linux: Nieuw tar-pakket toegevoegd voor CentOS7 Over de Speech SDK. Het Linux-.tar-pakket bevat nu specifieke bibliotheken voor RHEL/CentOS 7 in lib/centos7-x64. Speech SDK-bibliotheken in lib/x64 zijn nog steeds van toepassing op alle andere ondersteunde Linux x64-distributies (inclusief RHEL/CentOS 8) en werken niet op RHEL/CentOS 7.
JavaScript: VoiceProfile & SpeakerRecognizer-API's zijn asynchroon/wachtbaar gemaakt.
JavaScript: ondersteuning toegevoegd voor Azure-regio's voor de Amerikaanse overheid.
Windows: Ondersteuning toegevoegd voor afspelen op Universeel Windows-platform (UWP).

Bugreparaties

Android: OpenSSL-beveiligingsupdate (bijgewerkt naar versie 1.1.1l) voor Android-pakketten.
Python: Opgeloste fout waarbij het selecteren van een luidsprekerapparaat in Python mislukt.
Kern: automatisch opnieuw verbinding maken wanneer een verbindingspoging mislukt.
iOS: Audiocompressie uitgeschakeld op iOS-pakketten vanwege instabiliteit en bitcode-buildproblemen bij het gebruik van GStreamer. Details zijn beschikbaar via GitHub-probleem 1209.

Voorbeelden van GitHub

Mac/iOS: Voorbeelden en quickstarts bijgewerkt om het xcframework-pakket te gebruiken.
.NET: voorbeelden die zijn bijgewerkt voor gebruik van .NET Core 3.1-versie.
JavaScript: Voorbeeld toegevoegd voor Spraakassistenten.

Speech SDK 1.18.0: juli 2021-release

Opmerking: Ga hier aan de slag met de Speech SDK.

Overzicht van hoogtepunten

Ubuntu 16.04 bereikte het einde van de levensduur in april 2021. Met Azure DevOps en GitHub wordt in september 2021 ondersteuning voor 16.04 weggeslagen. Migreer ubuntu-16.04-werkstromen naar ubuntu-18.04 of hoger voor die tijd.

Nieuwe functies

C++: Eenvoudig taalpatroon dat overeenkomt met intent Recognizer maakt het nu eenvoudiger om eenvoudige scenario's voor intentieherkenning te implementeren.
C++/C#/Java: er is een nieuwe API GetActivationPhrasesAsync() toegevoegd aan de klasse voor het VoiceProfileClient ontvangen van een lijst met geldige activeringstermen in de registratiefase van Speaker Recognition voor onafhankelijke herkenningsscenario's.
- Belangrijk: de functie Speaker Recognition is beschikbaar als preview-versie. Alle stemprofielen die in Preview zijn gemaakt, worden stopgezet 90 dagen nadat de functie voor spraakherkenning van Preview naar Algemene Beschikbaarheid is verplaatst. Op dat moment werken de preview-spraakprofielen niet meer.
Python: Ondersteuning toegevoegd voor continue taalidentificatie (LID) op de bestaande SpeechRecognizer en TranslationRecognizer objecten.
Python: Er is een nieuw Python-object toegevoegd, genaamd SourceLanguageRecognizer, om eenmalige of continue LID uit te voeren (zonder herkenning of vertaling).
JavaScript: getActivationPhrasesAsync API toegevoegd aan VoiceProfileClient klasse voor het ontvangen van een lijst met geldige activeringstermen in de registratiefase van Speaker Recognition voor onafhankelijke herkenningsscenario's.
JavaScriptVoiceProfileClient's enrollProfileAsync API is nu asynchroon afhandelbaar. Zie deze onafhankelijke identificatiecode, bijvoorbeeld het gebruik.

Verbeteringen

Java: AutoCloseable-ondersteuning toegevoegd aan veel Java-objecten. Nu wordt het try-with-resources-model ondersteund om bronnen vrij te geven. Bekijk dit voorbeeld waarin gebruik wordt gemaakt van try-with-resources. Zie ook de Oracle Java documentatiehandleiding voor The try-with-resources Statement om meer over dit patroon te leren.
De schijfvoetafdruk is aanzienlijk verminderd voor veel platforms en architecturen. Voorbeelden voor het Microsoft.CognitiveServices.Speech.core binaire bestand: x64 Linux is kleiner dan 475 kB (8,0% reductie); Arm64 Windows UWP is 464 kB kleiner (11,5% reductie); x86 Windows is kleiner dan 343 kB (17,5% reductie); en x64 Windows is kleiner dan 451 kB (19,4% reductie).

Bugreparaties

Java: Er is een synthesefout opgelost wanneer de synthesetekst surrogaattekens bevat. Details hier.
JavaScript: Audioverwerking van browsermicrofoon wordt nu gebruikt AudioWorkletNode in plaats van afgeschaft ScriptProcessorNode. Details hier.
JavaScript: houd gesprekken correct levendig tijdens scenario's van langdurige vertalingen van gesprekken. Details hier.
JavaScript: Er is een probleem opgelost waarbij recognizer opnieuw verbinding maakt met een mediastream in continue herkenning. Details hier.
JavaScript: Er is een probleem opgelost waarbij recognizer opnieuw verbinding maakt met een pushStream in continue herkenning. Details hier.
JavaScript: Gecorrigeerde offsetberekening op woordniveau in gedetailleerde herkenningsresultaten. Details hier.

Voorbeelden

Java-snelstartvoorbeelden zijn hier bijgewerkt.
Voorbeelden van JavaScript Speaker Recognition zijn bijgewerkt voor nieuw gebruik van enrollProfileAsync(). Bekijk hier voorbeelden.

Speech SDK 1.17.0: mei 2021-release

Notitie

Ga hier aan de slag met de Speech SDK.

Overzicht van hoogtepunten

Kleinere footprint: we blijven de geheugen- en schijfvoetafdruk van de Speech SDK en de bijbehorende onderdelen verminderen.
Met een nieuwe zelfstandige Taalidentificatie-API kunt u herkennen welke taal wordt gesproken.
Ontwikkel mixed reality- en gamingtoepassingen met behulp van Unity op macOS.
U kunt nu Tekst naar spraak gebruiken naast spraakherkenning vanuit de programmeertaal Go.
Verschillende oplossingen voor problemen die U, onze gewaardeerde klanten, op GitHub hebben gemarkeerd. BEDANKT! Blijf de feedback ontvangen.

Nieuwe functies

C++/C#: Nieuwe zelfstandige functie voor detectie van opstart en continue taal via de SourceLanguageRecognizer API. Als u alleen de taal(en) wilt detecteren die in audio-inhoud worden gesproken, is dit de API om dat te doen. Zie de details voor C++ en C#.
C++/C#: Spraakherkenning en vertaalherkenning ondersteunen nu zowel at-start als continue taalidentificatie, zodat u programmatisch kunt bepalen welke taal(en) worden gesproken voordat ze worden getranscribeerd of vertaald. Zie de documentatie hier voor Spraakherkenning en hier voor Spraakomzetting.
C#: Ondersteuning voor Unity toegevoegd aan macOS (x64). Dit ontgrendelt gebruiksvoorbeelden voor spraakherkenning en spraaksynthese in mixed reality en gaming.
Go: We hebben ondersteuning toegevoegd voor spraaksynthesetekst naar spraak naar de programmeertaal Go om spraaksynthese beschikbaar te maken in nog meer gebruiksvoorbeelden. Raadpleeg onze quickstart of onze referentiedocumentatie.
C++/C#/Java/Python/Objective-C/Go: de spraaksynthese ondersteunt nu het connection object. Dit helpt u bij het beheren en bewaken van de verbinding met de Speech-service en is vooral handig om vooraf verbinding te maken om de latentie te verminderen. Zie de documentatie hier.
C++/C#/Java/Python/Objective-C/Go: we maken nu de latentie en onderlooptijd SpeechSynthesisResult beschikbaar om u te helpen bij het bewaken en diagnosticeren van latentieproblemen met spraaksynthese. Zie de details voor C++, C#, Java, Python, Objective-C en Go.
C++/C#/Java/Python/Objective-C: voor tekst naar spraak worden nu standaard neurale stemmen gebruikt wanneer u geen stem opgeeft die moet worden gebruikt. Dit biedt standaard een hogere betrouwbaarheidsuitvoer, maar verhoogt ook de standaardprijs.
C++/C#/Java/Python/Objective-C/Go: We hebben een eigenschap Gender toegevoegd aan de synthesestemgegevens om het gemakkelijker te maken stemmen te selecteren op basis van geslacht. Hiermee wordt het GitHub-probleem #1055 opgelost.
C++, C#, Java, JavaScript: we bieden nu ondersteuning retrieveEnrollmentResultAsyncvoor getAuthorizationPhrasesAsync en getAllProfilesAsync()in Speaker Recognition om het beheer van alle spraakprofielen voor een bepaald account te vereenvoudigen. Raadpleeg de documentatie voor C++, C#, Java, JavaScript. Hiermee wordt het GitHub-probleem #338 opgelost.
JavaScript: Er is een nieuwe poging toegevoegd voor verbindingsfouten waardoor uw op JavaScript gebaseerde spraaktoepassingen robuuster worden.

Verbeteringen

Binaire linux- en Android Speech SDK-bestanden zijn bijgewerkt om de nieuwste versie van OpenSSL (1.1.1.1k) te gebruiken
Verbeteringen in codegrootte:
- Language Understanding is nu gesplitst in een afzonderlijke lu-bibliotheek.
- Binaire grootte van Windows x64-kern is met 14,4% afgenomen.
- Binaire grootte van Android Arm64-kern is met 13,7% gedaald.
- andere onderdelen zijn ook kleiner geworden.

Bugreparaties

Alles: Probleem met GitHub opgelost #842 voor ServiceTimeout. U kunt nu lange audiobestanden transcriberen met behulp van de Speech SDK zonder dat de verbinding met de service wordt beëindigd met deze fout. We raden u echter nog steeds aan batchtranscriptie te gebruiken voor lange bestanden.
C#: GitHub-probleem #947 opgelost waarbij geen spraakinvoer uw app in een slechte status kon laten.
Java: GitHub-probleem #997 opgelost waarbij de Speech SDK voor Java 1.16 vastloopt bij het gebruik van DialogServiceConnector zonder een netwerkverbinding of een ongeldige abonnementssleutel.
Er is een crash opgelost bij het plotseling stoppen van spraakherkenning (bijvoorbeeld met Ctrl+C in de console-app).
Java: Er is een oplossing toegevoegd voor het verwijderen van tijdelijke bestanden in Windows bij het gebruik van de Speech SDK voor Java.
Java: Er is een probleem opgelost met GitHub #994 waarbij aanroepen DialogServiceConnector.stopListeningAsync een fout kon veroorzaken.
Java: Een probleem met de klant binnen de virtuele assistent-snelstart is opgelost.
JavaScript: GitHub-probleem #366 opgelost waarbij ConversationTranslator een foutmelding gaf: 'this.cancelSpeech is geen geldige functie'.
JavaScript: GitHub-probleem #298 opgelost waarbij het voorbeeld 'Resultaat ophalen als een in-memory stream' hardop werd afgespeeld.
JavaScript: Opgelost: GitHub-issue #350 waarbij een aanroep van AudioConfig kon resulteren in een 'ReferenceError: MediaStream is niet gedefinieerd'.
JavaScript: Er is een waarschuwing voor unhandledPromiseRejection opgelost in Node.js voor langdurige sessies.

Voorbeelden

Hier is de documentatie voor Unity-voorbeelden voor macOS bijgewerkt.
Een React Native-voorbeeld voor de Azure AI Speech Recognition-service is nu hier beschikbaar.

Speech SDK 1.16.0: release van maart 2021

Notitie

De Speech SDK in Windows is afhankelijk van het gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.

Nieuwe functies

C++/C#/Java/Python: verplaatst naar de nieuwste versie van GStreamer (1.18.3) om ondersteuning toe te voegen voor het transcriberen van media-indelingen in Windows, Linux en Android. Zie de documentatie hier.
C++/C#/Java/Objective-C/Python: ondersteuning toegevoegd voor het decoderen van gecomprimeerde TTS/gesynthetiseerde audio aan de SDK. Als u de uitvoeraudioindeling instelt op PCM en GStreamer beschikbaar is op uw systeem, vraagt de SDK automatisch gecomprimeerde audio aan van de service om bandbreedte te besparen en de audio op de client te decoderen. U kunt SpeechServiceConnection_SynthEnableCompressedAudioTransmission instellen op false om deze functie uit te schakelen. Details voor C++, C#, Java, Objective-C, Python.
JavaScript: Node.js gebruikers nu de AudioConfig.fromWavFileInput API kunnen gebruiken. Hiermee wordt het GitHub-probleem #252 opgelost.
C++/C#/Java/Objective-C/Python: methode GetVoicesAsync() toegevoegd voor TTS om alle beschikbare synthesestemmen te retourneren. Details voor C++, C#, Java, Objective-C en Python.
C++/C#/Java/JavaScript/Objective-C/Python: toegevoegd gebeurtenis VisemeReceived voor TTS/spraaksynthese om synchrone viseme-animatie terug te geven. Zie de documentatie hier.
C++/C#/Java/JavaScript/Objective-C/Python: gebeurtenis toegevoegd BookmarkReached voor TTS. U kunt bladwijzers instellen in de invoer-SSML en de audio-offsets voor elke bladwijzer verkrijgen. Zie de documentatie hier.
Java: Ondersteuning toegevoegd voor Speaker Recognition-API's. Details hier.
C++/C#/Java/JavaScript/Objective-C/Python: er zijn twee nieuwe audio-indelingen toegevoegd met WebM-container voor TTS (Webm16Khz16BitMonoOpus en Webm24Khz16BitMonoOpus). Dit zijn betere indelingen voor het streamen van audio met de Opus-codec. Details voor C++, C#, Java, JavaScript, Objective-C, Python.
C++/C#/Java: ondersteuning toegevoegd voor het ophalen van spraakprofiel voor sprekerherkenningsscenario's. Details voor C++, C# en Java.
C++/C#/Java/Objective-C/Python: ondersteuning toegevoegd voor afzonderlijke gedeelde bibliotheek voor audiomicrofoon en luidsprekerbesturing. Hierdoor kan de ontwikkelaar de SDK gebruiken in omgevingen waarvoor geen vereiste audiobibliotheekafhankelijkheden zijn vereist.
Objective-C/Swift: ondersteuning toegevoegd voor moduleframework met parapluheader. Hierdoor kan de ontwikkelaar Speech SDK importeren als een module in iOS-/Mac Objective-C/Swift-apps. Hiermee wordt het GitHub-probleem #452 opgelost.
Python: Ondersteuning toegevoegd voor Python 3.9 en verwijderde ondersteuning voor Python 3.5 per einde van python voor 3.5.

Bekende problemen

C++/C#/Java: DialogServiceConnector kan geen CustomCommandsConfig gebruiken om toegang te krijgen tot een toepassing voor aangepaste opdrachten en zal in plaats daarvan een verbindingsfout tegenkomen. Dit kan worden omzeild door handmatig uw toepassings-id toe te voegen aan de aanvraag met config.SetServiceProperty("X-CommandsAppId", "your-application-id", ServicePropertyChannel.UriQueryParameter). Het verwachte gedrag van CustomCommandsConfig wordt hersteld in de volgende release.

Verbeteringen

Als onderdeel van onze multirelease-inspanning om het geheugengebruik en de schijfvoetafdruk van de Speech SDK te verminderen, zijn binaire Android-bestanden nu 3% tot 5% kleiner.
Verbeterde nauwkeurigheid, leesbaarheid en zie-ook-secties van onze C#-referentiedocumentatie hier.

Bugreparaties

JavaScript: Grote WAV-bestandsheaders worden nu correct geparseerd (vergroot het koptekstsegment tot 512 bytes). Hiermee wordt het GitHub-probleem #962 opgelost.
JavaScript: Probleem met timing van microfoon gecorrigeerd als de microfoonstream eindigt voordat de herkenning wordt gestopt, waarbij een probleem wordt opgelost waarbij spraakherkenning niet werkt in Firefox.
JavaScript: We verwerken nu de initialisatiebelofte correct wanneer de browser de microfoon uitschakelt voordat TurnOn is voltooid.
JavaScript: We hebben URL-afhankelijkheid vervangen door URL-parse. Hiermee wordt het GitHub-probleem #264 opgelost.
Android: Gecorrigeerde callbacks werkten niet wanneer minifyEnabled op true is ingesteld.
C++/C#/Java/Objective-C/Python: TCP_NODELAY wordt correct ingesteld op onderliggende socket-IO voor TTS om de latentie te verminderen.
C++/C#/Java/Python/Objective-C/Go: er is een incidentele crash opgelost toen de recognizer net na het starten van een herkenning werd vernietigd.
C++/C#/Java: Een incidentele crash bij de vernietiging van de sprekerherkenner is opgelost.

Voorbeelden

JavaScript: voor browservoorbeelden is het downloaden van afzonderlijke JavaScript-bibliotheekbestanden niet meer vereist.

Speech SDK 1.15.0: release van januari 2021

Notitie

De Speech SDK in Windows is afhankelijk van het gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.

Overzicht van hoogtepunten

Kleinere geheugen- en schijfvoetafdruk waardoor de SDK efficiënter wordt.
Uitvoerformaten met een hogere kwaliteit zijn beschikbaar voor private preview van aangepaste neurale spraak.
Intent Recognizer kan nu meer dan alleen de topintentie retourneren, waardoor u in staat bent om een afzonderlijke beoordeling van de intentie van uw klant te maken.
Spraakassistenten en bots zijn nu eenvoudiger in te stellen en u kunt ervoor zorgen dat deze niet meer luistert en meer controle uitoefenen over hoe het reageert op fouten.
Verbeterde prestaties van het apparaat door het optioneel maken van compressie.
Gebruik de Speech SDK in Windows ARM/Arm64.
Verbeterde foutopsporing op laag niveau.
De functie Uitspraakbeoordeling is nu breder beschikbaar.
Verschillende oplossingen voor problemen die U, onze gewaardeerde klanten, op GitHub hebben gemarkeerd. BEDANKT! Blijf de feedback ontvangen.

Verbeteringen

De Speech SDK is nu efficiënter en lichtgewicht. We hebben een multirelease-inspanning gestart om het geheugengebruik en de schijfvoetafdruk van de Speech SDK te verminderen. Als eerste stap hebben we aanzienlijke verminderingen van de bestandsgrootte in gedeelde bibliotheken op de meeste platforms gemaakt. Vergeleken met de release 1.14:
- 64-bits UWP-compatibele Windows-bibliotheken zijn ongeveer 30% kleiner.
- 32-bits Windows-bibliotheken zien nog geen verbetering van de grootte.
- Linux-bibliotheken zijn 20-25% kleiner.
- Android-bibliotheken zijn 3-5% kleiner.

Nieuwe functies

All: Nieuwe 48 KHz-uitvoerformaten beschikbaar gesteld voor de persoonlijke proefversie van aangepaste neurale spraak via de TTS-spraaksynthese-API: Audio48Khz192KBitRateMonoMp3, audio-48khz-192kbitrate-mono-mp3, Audio48Khz96KBitRateMonoMp3, audio-48khz-96kbitrate-mono-mp3, Raw48Khz16BitMonoPcm, raw-48khz-16bit-mono-pcm, Riff48Khz16BitMonoPcm, riff-48khz-16bit-mono-pcm.
Alles: Aangepaste spraak is ook gemakkelijker te gebruiken. Ondersteuning toegevoegd voor het instellen van aangepaste spraak via EndpointId (C++, C#, Java, JavaScript, Objective-C, Python). Vóór deze wijziging moesten aangepaste spraakgebruikers de eindpunt-URL instellen via de FromEndpoint methode. Klanten kunnen nu de FromSubscription methode net als standaardstemmen gebruiken en vervolgens de implementatie-id opgeven door de instelling in te stellen EndpointId. Dit vereenvoudigt het instellen van aangepaste stemmen.
C++/C#/Java/Objective-C/Python: Verkrijg meer dan de belangrijkste intent uitIntentRecognizer. Het biedt nu ondersteuning voor het configureren van het JSON-resultaat met alle intents en niet alleen de meest scorende intent via de LanguageUnderstandingModel FromEndpoint-methode met behulp van de verbose=true URI-parameter. Hiermee wordt het GitHub-probleem #880 opgelost. Raadpleeg de bijgewerkte documentatie hier.
C++/C#/Java: zorg ervoor dat uw spraakassistent of bot niet meer luistert. DialogServiceConnector (C++, C#, Java) heeft nu een StopListeningAsync() methode die ListenOnceAsync() aanvult. Hierdoor wordt het vastleggen van audio onmiddellijk gestopt en wordt er op een juiste manier gewacht op een resultaat, waardoor het perfect is voor gebruik met 'nu stoppen'-knoppersscenario's.
C++/C#/Java/JavaScript: zorg ervoor dat uw spraakassistent of bot beter reageert op onderliggende systeemfouten. DialogServiceConnector (C++, C#, Java, JavaScript) heeft nu een nieuwe TurnStatusReceived gebeurtenis-handler. Deze optionele gebeurtenissen komen overeen met elke ITurnContext oplossing van de bot en rapporteren uitvoeringsfouten wanneer ze optreden, bijvoorbeeld als gevolg van een niet-verwerkte uitzondering, time-out of netwerkuitval tussen Direct Line Speech en de bot. TurnStatusReceived maakt het gemakkelijker om te reageren op foutvoorwaarden. Als een bot bijvoorbeeld te lang duurt voor een back-enddatabasequery (bijvoorbeeld om een product op te zoeken), TurnStatusReceived kan de client reageren met 'sorry, dat heb ik niet helemaal begrepen, kunt u het alstublieft nog eens proberen' of iets dergelijks.
C++/C#: gebruik de Speech SDK op meer platforms. Het Speech SDK NuGet-pakket ondersteunt nu Windows ARM/Arm64 systeemeigen desktop binaries (UWP werd al ondersteund) om de Speech SDK nuttiger te maken op meer machine types.
Java: DialogServiceConnector heeft nu een setSpeechActivityTemplate() methode die eerder onbedoeld is uitgesloten van de taal. Dit komt overeen met het instellen van de Conversation_Speech_Activity_Template eigenschap en zal vragen dat alle toekomstige Bot Framework-activiteiten afkomstig van de Direct Line Speech-service de opgegeven inhoud samenvoegen in hun JSON-inhoud.
Java: Verbeterde foutopsporing op laag niveau. De Connection klasse heeft nu een MessageReceived gebeurtenis, vergelijkbaar met andere programmeertalen (C++, C#). Deze gebeurtenis biedt toegang op laag niveau tot binnenkomende gegevens van de service en kan nuttig zijn voor diagnostische gegevens en foutopsporing.
JavaScript: Eenvoudigere setup voor spraakassistenten en bots dankzij , dat nu de BotFrameworkConfig en fromHost() factorymethoden heeft die het gebruik van aangepaste servicelocaties vereenvoudigen in tegenstelling tot het handmatig instellen van eigenschappen. We hebben ook de optionele specificatie gestandaardiseerd voor het gebruik van botId een niet-standaardbot in de configuratiefabrieken.
JavaScript: Verbeterde prestaties van apparaten via toegevoegde eigenschap voor tekenreeksbeheer voor websocket-compressie. Om prestatieredenen hebben we websocket-compressie standaard uitgeschakeld. Dit kan opnieuw worden uitgevoerd voor scenario's met lage bandbreedte. Hier vindt u meer informatie. Hiermee wordt het GitHub-probleem #242 opgelost.
JavaScript: ondersteuning toegevoegd voor lPronunciation Assessment om de uitspraak van spraak te evalueren. Zie de snelle start hier.

Bugreparaties

Alle (behalve JavaScript): Er is een regressie opgelost in versie 1.14, waarin te veel geheugen werd toegewezen door de recognizer.
C++: Er is een probleem met de garbagecollection opgelost, DialogServiceConnectorwaarbij gitHub-probleem #794 wordt opgelost.
C#: Er is een probleem opgelost met het afsluiten van threads waardoor objecten ongeveer een seconde worden geblokkeerd wanneer ze worden verwijderd.
C++/C#/Java: Er is een uitzondering opgelost die verhinderde dat een toepassing meer dan één keer een spraakautorisatietoken of een activiteitssjabloon kon instellen DialogServiceConnector.
C++/C#/Java: Een crash van de recognizer opgelost door een raceconditie bij het afbreken.
JavaScript: DialogServiceConnector hield eerder geen rekening met de optionele botId-parameter die is opgegeven in de fabrieken van BotFrameworkConfig. Hierdoor is het nodig om de botId querytekenreeksparameter handmatig in te stellen voor het gebruik van een niet-standaardbot. De bug is gecorrigeerd en de waarden die aan de fabrieken botId worden verstrekt, zullen worden gehonoreerd en gebruikt, inclusief de nieuwe toevoegingen BotFrameworkConfig en fromHost(). Dit geldt ook voor de applicationId parameter voor CustomCommandsConfig.
JavaScript: GitHub-probleem #881 opgelost, waardoor het herkennen van objecten opnieuw kan worden gebruikt.
JavaScript: Er is een probleem opgelost waarbij de SDK meerdere keren werd uitgevoerd in één TTS-sessie, wat bandbreedte verspilde.
JavaScript: Vereenvoudigde foutafhandeling bij microfoonautorisatie, waardoor er een meer beschrijvende melding kan worden weergegeven wanneer de gebruiker geen microfooninvoer heeft toegestaan in de browser.
JavaScript: Het probleem met GitHub-issue #249 opgelost waarbij typefouten in en een compilatiefout veroorzaakten voor TypeScript-gebruikers.
Objective-C: Er is een probleem opgelost waarbij GStreamer-build is mislukt voor iOS op Xcode 11.4, waardoor gitHub-probleem #911 wordt opgelost.
Python: GitHub-probleem #870 opgelost, waarbij 'DeprecationWarning: the imp module is afgeschaft in het voordeel van importlib' wordt verwijderd.

Voorbeelden

Voorbeeld van bestand voor JavaScript-browser maakt nu gebruik van bestanden voor spraakherkenning. Hiermee wordt het GitHub-probleem #884 opgelost.

Speech SDK 1.14.0: oktober 2020 release

Notitie

De Speech SDK in Windows is afhankelijk van het gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.

Nieuwe functies

Linux: Ondersteuning toegevoegd voor Debian 10 en Ubuntu 20.04 LTS.
Python/Objective-C: ondersteuning toegevoegd voor de KeywordRecognizer API. De documentatie is hier.
C++/Java/C#: ondersteuning toegevoegd voor het instellen van een HttpHeader sleutel/waarde via ServicePropertyChannel::HttpHeader.
JavaScript: ondersteuning toegevoegd voor de ConversationTranscriber API. Lees hier documentatie.
C++/C#: nieuwe AudioDataStream FromWavFileInput methode toegevoegd (om te lezen. WAV-bestanden) hier (C++) en hier (C#).
C++/C#/Java/Python/Objective-C/Swift: er is een stopSpeakingAsync() methode toegevoegd om tekst te stoppen met spraaksynthese. Lees hier de referentiedocumentatie (C++), hier (C#), hier (Java), hier (Python) en hier (Objective-C/Swift).
C#, C++, Java: Er is een FromDialogServiceConnector() functie toegevoegd aan de klasse die kan worden gebruikt voor het Connection bewaken van verbindings- en verbroken gebeurtenissen voor DialogServiceConnector. Lees hier de referentiedocumentatie (C#), hier (C++) en hier (Java).
C++/C#/Java/Python/Objective-C/Swift: ondersteuning toegevoegd voor uitspraakbeoordeling, waarmee gesproken uitspraak wordt geëvalueerd en sprekers feedback geven over de nauwkeurigheid en de vloeiendheid van gesproken audio. Lees hier de documentatie.

Ingrijpende wijziging

JavaScript: PullAudioOutputStream.read() heeft een wijziging in het retourtype van een interne Promise naar een Native JavaScript Promise.

Bugreparaties

Alle: Regressie van 1,13 opgelost waarbij SetServiceProperty waarden met bepaalde speciale tekens werden genegeerd.
C#: Opgeloste Windows-consolevoorbeelden in Visual Studio 2019 kunnen geen systeemeigen DLL's vinden.
C#: Crash verholpen bij geheugenbeheer wanneer de stream als KeywordRecognizer invoer wordt gebruikt.
ObjectiveC/Swift: Crash met geheugenbeheer opgelost als de stream wordt gebruikt als recognizer-invoer.
Windows: Er is een probleem opgelost met co-existentie met BT HFP/A2DP op UWP.
JavaScript: Verbeterde mapping van sessie-id's om de logboekregistratie te verbeteren en te helpen bij interne foutopsporing en servicecorrelaties.
JavaScript: Er is een oplossing toegevoegd voor DialogServiceConnector het uitschakelen van ListenOnce aanroepen nadat de eerste aanroep is uitgevoerd.
JavaScript: Er is een probleem opgelost waarbij resultaatuitvoer slechts 'eenvoudig' zou zijn.
JavaScript: Er is een probleem opgelost met continue herkenning in Safari in macOS.
JavaScript: CPU-belastingbeperking voor scenario met hoge aanvraagdoorvoer.
JavaScript: Toegang toestaan tot details van het resultaat van Voiceprofielregistratie.
JavaScript: Oplossing toegevoegd voor continue herkenning in IntentRecognizer.
C++/C#/Java/Python/Swift/ObjectiveC: onjuiste URL opgelost voor australiaeast en brazilsouth in IntentRecognizer.
C++/C#: Toegevoegd VoiceProfileType als argument bij het maken van een VoiceProfile object.
C++/C#/Java/Python/Swift/ObjectiveC: Een potentieel SPX_INVALID_ARG probleem is opgelost bij het lezen AudioDataStream vanaf een bepaalde positie.
IOS: Crash opgelost met spraakherkenning op Unity

Voorbeelden

ObjectiveC: Voorbeeld toegevoegd voor trefwoordherkenning hier.
C#/JavaScript: Quickstart toegevoegd voor gesprektranscriptie hier (C#) en hier (JavaScript).
C++/C#/Java/Python/Swift/ObjectiveC: Voorbeeld toegevoegd voor uitspraakbeoordeling hier

Bekend probleem

DigiCert Global Root G2-certificaat wordt niet standaard ondersteund in HoloLens 2 en Android 4.4 (KitKat) en moet worden toegevoegd aan het systeem om de Speech SDK functioneel te maken. Het certificaat wordt in de nabije toekomst toegevoegd aan installatiekopieën van het HoloLens 2-besturingssysteem. Android 4.4-klanten moeten het bijgewerkte certificaat toevoegen aan het systeem.

COVID-19 verkorte tests

Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht waarvan we denken dat ze iets zouden hebben kunnen breken, en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons dan weten op GitHub.
Blijf gezond!

Speech SDK 1.13.0: juli 2020-uitgave

Notitie

De Speech SDK in Windows is afhankelijk van het gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.

Nieuwe functies

C#: ondersteuning toegevoegd voor asynchrone gesprektranscriptie. Zie de documentatie hier.
JavaScript: Ondersteuning voor sprekerherkenning toegevoegd voor zowel browser als Node.js.
JavaScript: ondersteuning toegevoegd voor taalidentificatie/taal-id. Zie de documentatie hier.
Objective-C: ondersteuning toegevoegd voor gespreks- en gesprektranscriptie met meerdere apparaten.
Python: gecomprimeerde audioondersteuning toegevoegd voor Python in Windows en Linux. Zie de documentatie hier.

Bugreparaties

Alles: Er is een probleem opgelost waardoor de KeywordRecognizer de streams niet vooruit zou verplaatsen na een herkenning.
All: Er is een probleem opgelost waardoor de stroom die is verkregen uit een KeywordRecognitionResult, het trefwoord niet bevatte.
Alles: Er is een probleem opgelost waarbij sendMessageAsync het bericht niet echt via de kabel verzendt nadat de gebruikers klaar zijn met wachten.
All: Er is een crash in Speaker Recognition-API's opgelost wanneer gebruikers VoiceProfileClient aanroepen::SpeakerRecEnrollProfileAsync-methode meerdere keren en niet hebben gewacht totdat de aanroepen zijn voltooid.
Alles: Het probleem met het inschakelen van logboekregistratie van bestanden in VoiceProfileClient en SpeakerRecognizer-klassen is verholpen.
JavaScript: Er is een probleem opgelost met het vertragen wanneer de browser minimaal is.
JavaScript: Er is een probleem opgelost met een geheugenlek op streams.
JavaScript: caching toegevoegd voor OCSP-antwoorden van NodeJS.
Java: Er is een probleem opgelost waardoor BigInteger-velden altijd 0 retourneren.
iOS: Er is een probleem opgelost met het publiceren van op Speech SDK gebaseerde apps in de iOS App Store.

Voorbeelden

C++: Hier is voorbeeldcode toegevoegd voor Speaker Recognition.

COVID-19 verkorte tests

Speech SDK 1.12.1: release van juni 2020

Nieuwe functies

C#, C++: Sprekerherkenningsvoorbeeld: met deze functie kunt u sprekeridentificatie (wie spreekt?) en sprekercontrole (is de spreker die ze beweren te zijn?). Zie de overzichtsdocumentatie.

Bugreparaties

C#, C++: Vaste microfoonopname werkte niet in 1.12 in Speaker Recognition.
JavaScript: Fixes voor tekst-naar-spraak in Firefox en Safari in macOS en iOS.
Oplossing voor crash door toegangsschending van Windows-toepassingsverificatie bij gesprekstranscriptie bij gebruik van een achtkanaalsstream.
Oplossing voor crash door toegangsschending in Windows-toepassingsverificatie bij het vertalen van gesprekken tussen meerdere apparaten.

Voorbeelden

C#: Codevoorbeeld voor Sprekerherkenning.
C++: Codevoorbeeld voor Sprekerherkenning.
Java: Codevoorbeeld voor intentieherkenning op Android.

COVID-19 verkorte tests

Speech SDK 1.12.0: release van mei 2020

Nieuwe functies

Go: Nieuwe Go-taalondersteuning voor spraakherkenning en aangepaste spraakassistent. Stel hier uw ontwikkelomgeving in. Zie de sectie Voorbeelden hieronder voor voorbeeldcode.
JavaScript: browserondersteuning toegevoegd voor tekst naar spraak. Zie de documentatie hier.
C++, C#, Java: Nieuw KeywordRecognizer object en API's die worden ondersteund op Windows-, Android-, Linux- en iOS-platforms. Lees hier de documentatie. Zie de sectie Voorbeelden hieronder voor voorbeeldcode.
Java: Gesprek met meerdere apparaten toegevoegd met vertaalondersteuning. Zie het referentiedocument hier.

Verbeteringen en optimalisaties

JavaScript: De implementatie van de geoptimaliseerde browsermicrofoon verbetert de nauwkeurigheid van spraakherkenning.
Java: Gerestructureerde bindingen met behulp van directe JNI-implementatie zonder SWIG. Deze wijziging vermindert met 10x de bindingengrootte voor alle Java-pakketten die worden gebruikt voor Windows, Android, Linux en Mac en vereenvoudigt de verdere ontwikkeling van de Java-implementatie van de Speech SDK.
Linux: ondersteuningsdocumentatie bijgewerkt met de nieuwste specifieke RHEL 7-notities.
Verbeterde verbindingslogica om meerdere keren verbinding te maken wanneer service- en netwerkfouten optreden.
De pagina portal.azure.com Speech-quickstart bijgewerkt om ontwikkelaars te helpen de volgende stap in het Azure AI Speech-traject uit te voeren.

Bugreparaties

C#, Java: Er is een probleem opgelost met het laden van SDK-bibliotheken in Linux ARM (zowel 32-bits als 64-bits).
C#: Het expliciet verwijderen van systeemeigen handvatten voor TranslationRecognizer, IntentRecognizer en verbindingsobjecten is gerepareerd.
C#: Vast levensduurbeheer voor audio-invoer voor ConversationTranscriber-object.
Er is een probleem opgelost waarbij IntentRecognizer de resultaatreden niet goed werd ingesteld bij het herkennen van intenties uit eenvoudige woordgroepen.
Er is een probleem opgelost waarbij SpeechRecognitionEventArgs resultaatverschil niet correct werd ingesteld.
Er is een racevoorwaarde opgelost waarbij SDK een netwerkbericht probeerde te verzenden voordat de websocket-verbinding werd geopend. Was reproduceerbaar bij TranslationRecognizer het toevoegen van deelnemers.
Er zijn geheugenlekken opgelost in de engine voor trefwoordherkenning.

Voorbeelden

Go: Quickstarts toegevoegd voor spraakherkenning en aangepaste spraakassistent. Hier vindt u voorbeeldcode.
JavaScript: quickstarts toegevoegd voor tekst-naar-spraak-, vertaling- en intentieherkenning.
Voorbeelden van trefwoordherkenning voor C# en Java (Android).

COVID-19 verkorte tests

Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht waarvan we denken dat ze iets zouden hebben kunnen breken, en onze geautomatiseerde tests zijn allemaal geslaagd. Als we iets hebben gemist, laat het ons dan weten op GitHub.
Blijf gezond!

Speech SDK 1.11.0: release van maart 2020

Nieuwe functies

Linux: ondersteuning toegevoegd voor Red Hat Enterprise Linux (RHEL)/CentOS 7 x64.
Linux: ondersteuning toegevoegd voor .NET Core C# in Linux ARM32 en Arm64. Meer informatie is hier beschikbaar.
C#, C++: Toegevoegd UtteranceId aan ConversationTranscriptionResult, een consistente id voor alle tussenliggende en uiteindelijke spraakherkenningsresultaten. Details voor C#, C++.
Python: ondersteuning toegevoegd voor Language ID. Zie speech_sample.py in de GitHub-opslagplaats.
Windows: ondersteuning voor gecomprimeerde audio-invoerindeling toegevoegd op het Windows-platform voor alle win32-consoletoepassingen. Details hier.
JavaScript: ondersteuning voor spraaksynthese (tekst-naar-spraak) in NodeJS. U vindt hier meer informatie.
JavaScript: voeg nieuwe API's toe om inspectie van alle verzonden en ontvangen berichten mogelijk te maken. U vindt hier meer informatie.

Bugreparaties

C#, C++: Een probleem opgelost zodat SendMessageAsync nu een binaire boodschap als binair type verzendt. Details voor C#, C++.
C#, C++: Er is een probleem opgelost waarbij het gebruik van de Connection MessageReceived-gebeurtenis tot een crash kan leiden als Recognizer wordt verwijderd voordat Connection wordt verwijderd. Details voor C#, C++.
Android: De grootte van de audiobuffer van de microfoon is afgenomen van 800 ms tot 100 ms om de latentie te verbeteren.
Android: Er is een probleem opgelost met x86 Android Emulator in Android Studio.
JavaScript: ondersteuning toegevoegd voor regio's in China met de fromSubscription API. Details hier.
JavaScript: Voeg meer foutinformatie toe voor verbindingsfouten vanuit NodeJS.

Voorbeelden

Unity: De openbare sample voor intentieherkenning is gerepareerd, waarbij het importeren van de LUIS JSON eerder faalde. Details hier.
Python: Voorbeeld toegevoegd voor Language ID. Details hier.

Covid19 verkorte tests: omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige tests voor apparaatverificatie uitvoeren als normaal. We kunnen bijvoorbeeld geen microfooninvoer en luidsprekeruitvoer testen in Linux, iOS en macOS. We hebben geen wijzigingen aangebracht die volgens ons iets kapot zouden kunnen hebben gemaakt op deze platforms, en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons dan weten op GitHub.
Bedankt voor uw voortdurende ondersteuning. Zoals altijd kunt u vragen of feedback posten op GitHub of Stack Overflow.
Blijf gezond!

Speech SDK 1.10.0: uitgave van februari 2020

Nieuwe functies

Python-pakketten toegevoegd ter ondersteuning van de nieuwe 3.8-versie van Python.
Red Hat Enterprise Linux (RHEL)/CentOS 8 x64-ondersteuning (C++, C#, Java, Python).

Notitie

Klanten moeten OpenSSL configureren volgens deze instructies.
Linux ARM32-ondersteuning voor Debian en Ubuntu.
DialogServiceConnector ondersteunt nu een optionele parameter 'bot-id' in BotFrameworkConfig. Met deze parameter kunt u meerdere Direct Line Speech-bots gebruiken met één Spraak-resource. Zonder de opgegeven parameter wordt de standaardbot (zoals bepaald door de configuratiepagina van het Direct Line Speech-kanaal) gebruikt.
DialogServiceConnector heeft nu een eigenschap SpeechActivityTemplate. De inhoud van deze JSON-tekenreeks wordt gebruikt door Direct Line Speech om een groot aantal ondersteunde velden vooraf in te vullen in alle activiteiten die een Direct Line Speech-bot bereiken, inclusief activiteiten die automatisch worden gegenereerd als reactie op gebeurtenissen zoals spraakherkenning.
TTS maakt nu gebruik van abonnementssleutel voor verificatie, waardoor de eerste bytelatentie van het eerste syntheseresultaat na het maken van een synthesizer wordt verminderd.
Bijgewerkte spraakherkenningsmodellen voor 19 lokale versies met een gemiddelde woordfoutpercentagevermindering van 18,6% (es-ES, es-MX, fr-CA, fr-FR, it-IT, ja-JP, ko-KR, pt-BR, zh-CN, zh-HK, nb-NO, fi-FL, ru-RU, pl-PL, ca-ES, zh-TW, th-TH, pt-PT, tr-TR). De nieuwe modellen brengen aanzienlijke verbeteringen in meerdere domeinen met zich mee, waaronder dicteren, callcentertranscriptie en video-indexeringsscenario's.

Bugreparaties

Er is een fout opgelost waarbij gesprekstranscriber niet goed in JAVA-API's wachtte.
Voeg ontbrekende (Get|Set)Property-methoden toe aan AudioConfig.
Corrigeer een TTS-fout waarbij de audioDataStream niet kon worden gestopt wanneer de verbinding mislukt.
Als u een eindpunt zonder een regio gebruikt, worden USP-fouten voor gespreksvertalers veroorzaakt.
Id-generatie in Universele Windows Applicaties maakt nu gebruik van een gepast uniek GUID-algoritme; voorheen en onbedoeld standaard op een niet-volledige implementatie die vaak conflicten veroorzaakte bij grote sets van interacties.

Voorbeelden

Unity-voorbeeld voor het gebruik van Speech SDK met Unity-microfoon en pushmodusstreaming

Andere wijzigingen

OpenSSL-configuratiedocumentatie bijgewerkt voor Linux

Speech SDK 1.9.0: release van januari 2020

Nieuwe functies

Gesprek met meerdere apparaten: verbind meerdere apparaten met hetzelfde spraak- of tekstgesprek en vertaal eventueel berichten die ertussen worden verzonden. Meer informatie vindt u in dit artikel.
Ondersteuning voor trefwoordherkenning toegevoegd voor Android-pakket .aar en ondersteuning toegevoegd voor x86- en x64-smaken.
Objective-C: SendMessage en SetMessageProperty methoden toegevoegd aan Connection object. Zie de documentatie hier.
TTS C++ api ondersteunt std::wstring nu als synthesetekstinvoer, waardoor het niet meer nodig is om een wstring te converteren naar tekenreeks voordat deze wordt doorgegeven aan de SDK. Hier vindt u meer informatie.
C#: Taal-id en brontaalconfiguratie zijn nu beschikbaar.
JavaScript: Er is een functie toegevoegd aan Connection het object om aangepaste berichten van de Speech-service door te geven als callback receivedServiceMessage.
JavaScript: Ondersteuning toegevoegd voor FromHost API om het gebruik te vergemakkelijken met on-premises containers en soevereine clouds. Zie de documentatie hier.
JavaScript: We honoreren NODE_TLS_REJECT_UNAUTHORIZED nu dankzij een bijdrage van orgads. Hier vindt u meer informatie.

Belangrijke wijzigingen

OpenSSL is bijgewerkt naar versie 1.1.1b en is statisch gekoppeld aan de Speech SDK-kernbibliotheek voor Linux. Dit kan leiden tot een onderbreking als uw inbox OpenSSL niet is geïnstalleerd in de /usr/lib/ssl directory in het systeem. Raadpleeg onze documentatie onder Speech SDK-documenten om het probleem te omzeilen.
We hebben het gegevenstype dat we voor C# WordLevelTimingResult.Offset retourneren, gewijzigd van int naar long om toegang te verlenen tot WordLevelTimingResults wanneer spraakgegevens langer dan 2 minuten zijn.
PushAudioInputStream en PullAudioInputStream verzenden nu wav-headergegevens naar de Speech-service op basis van AudioStreamFormat, eventueel opgegeven toen ze waren gemaakt. Klanten moeten nu de ondersteunde audio-invoerindeling gebruiken. Andere indelingen krijgen suboptimale herkenningsresultaten of kunnen andere problemen veroorzaken.

Bugreparaties

Zie de OpenSSL update hierboven onder 'Breaking changes'. We hebben zowel een intermitterende crash als een prestatieprobleem (vergrendelingsconflict bij hoge belasting) in Linux en Java opgelost.
Java: Verbeterde objectsluiting in scenario's met hoge gelijktijdigheid.
Het NuGet-pakket is geherstructureerd. We hebben de drie kopieën van Microsoft.CognitiveServices.Speech.core.dll en Microsoft.CognitiveServices.Speech.extension.kws.dll onder lib-mappen verwijderd, waardoor het NuGet-pakket kleiner en sneller te downloaden is en we hebben headers toegevoegd die nodig zijn om enkele systeemeigen C++-apps te compileren.
Gecorrigeerde quickstart-voorbeelden hier. Deze werden beëindigd zonder de uitzondering 'microfoon niet gevonden' weer te geven op Linux, macOS, Windows.
Er is een oplossing gevonden voor het vastlopen van SDK met lange spraakherkenningsresultaten op bepaalde codepaden zoals dit voorbeeld.
Er is een sdk-implementatiefout opgelost in de Azure Web App-omgeving om dit probleem van de klant op te lossen.
Er is een TTS-fout opgelost tijdens het gebruik van meerdere <voice> tags of <audio> tags om dit probleem van de klant op te lossen.
Er is een TTS 401-fout opgelost wanneer de SDK is hersteld na onderbreking.
JavaScript: Er is een circulaire import van audiogegevens opgelost dankzij een bijdrage van euirim.
JavaScript: ondersteuning toegevoegd voor het instellen van service-eigenschappen, zoals toegevoegd in 1.7.
JavaScript: er is een probleem opgelost waarbij een verbindingsfout kon leiden tot continue, mislukte pogingen om opnieuw verbinding te maken met websocket.

Voorbeelden

Voorbeeld van trefwoordherkenning toegevoegd voor Android hier.
TTS-voorbeeld toegevoegd voor het serverscenario hier.
Hier zijn quickstarts voor gesprekken met meerdere apparaten toegevoegd voor C# en C++.

Andere wijzigingen

Geoptimaliseerde SDK-kernbibliotheekgrootte op Android.
SDK in versie 1.9.0 en hoger ondersteunt zowel int- als string-typen in het veld voor voice signature-versie bij de gesprekstranscriber.

Speech SDK 1.8.0: Release van november 2019

Nieuwe functies

Er is een FromHost() API toegevoegd voor gebruiksgemak met on-premises containers en onafhankelijke clouds.
Brontaalidentificatie toegevoegd voor spraakherkenning (in Java en C++)
Object SourceLanguageConfig toegevoegd voor Spraakherkenning, gebruikt om verwachte brontalen op te geven (in Java en C++)
Ondersteuning toegevoegd KeywordRecognizer voor Windows (UWP), Android en iOS via de NuGet- en Unity-pakketten
Java-API voor externe gesprekken toegevoegd om gesprektranscriptie uit te voeren in asynchrone batches.

Belangrijke wijzigingen

Functies voor gesprekstranscriber zijn verplaatst onder naamruimte Microsoft.CognitiveServices.Speech.Transcription.
Onderdelen van de gesprekstranscriber-methoden worden verplaatst naar een nieuwe Conversation klasse.
Verwijderde ondersteuning voor 32-bits iOS (ARMv7 en x86)

Bugreparaties

Oplossing voor crash als lokaal KeywordRecognizer wordt gebruikt zonder geldige abonnementsleutel voor de spraakservice.

Voorbeelden

Xamarin-voorbeeld voor KeywordRecognizer
Unity-voorbeeld voor KeywordRecognizer
C++ en Java-voorbeelden voor automatische brontaalidentificatie.

Speech SDK 1.7.0: release van 2019-september

Nieuwe functies

Bèta-ondersteuning toegevoegd voor Xamarin op Universeel Windows-platform (UWP), Android en iOS
iOS-ondersteuning toegevoegd voor Unity
Invoerondersteuning toegevoegd Compressed voor ALaw, Mulaw, FLAC, op Android, iOS en Linux
Toegevoegd SendMessageAsync in Connection klasse voor het verzenden van een bericht naar service
Toegevoegd SetMessageProperty in Connection klasse voor het instellen van de eigenschap van een bericht
TTS heeft bindingen toegevoegd voor Java (JRE en Android), Python, Swift en Objective-C
TTS heeft ondersteuning toegevoegd voor afspelen voor macOS, iOS en Android.
Informatie over 'woordgrens' toegevoegd voor TTS.

Bugreparaties

Probleem met IL2CPP-build opgelost in Unity 2019 voor Android
Probleem opgelost waarbij misvormde headers in de invoer van wav-bestanden niet correct werden verwerkt.
Probleem opgelost waarbij UUID's niet uniek waren in sommige verbindingseigenschappen
Er zijn enkele waarschuwingen over null-abilityaanduidingen in de Swift-bindingen opgelost (mogelijk zijn kleine codewijzigingen vereist)
Een fout opgelost waardoor websocket-verbindingen niet netjes onder netwerkbelasting werden gesloten.
Een probleem opgelost op Android dat soms resulteert in dubbele impressie-ID's die door DialogServiceConnector worden gebruikt.
Verbeteringen in de stabiliteit van verbindingen bij interacties over meerdere beurten en het rapporteren van storingen (via Canceled gebeurtenissen) wanneer deze optreden met DialogServiceConnector.
DialogServiceConnector sessiestarts worden nu op de juiste manier voorzien van gebeurtenissen, ook wanneer ListenOnceAsync() wordt aangeroepen tijdens een actieve StartKeywordRecognitionAsync()
Een crash gefixt gekoppeld aan DialogServiceConnector activiteiten die binnenkomen.

Voorbeelden

Quickstart voor Xamarin
CPP-quickstart bijgewerkt met Linux Arm64-informatie
Bijgewerkte Unity-quickstart met iOS-informatie

Speech SDK 1.6.0: juni 2019 release

Voorbeelden

Quickstartvoorbeelden voor Text To Speech op UWP en Unity
Snelstartvoorbeeld voor Swift in iOS
Unity-voorbeelden voor spraak- en intentieherkenning en -vertaling
Bijgewerkte quickstartvoorbeelden voor DialogServiceConnector

Verbeteringen/wijzigingen

Dialoognaamruimte:
- De naam van SpeechBotConnector is gewijzigd in DialogServiceConnector
- De naam van BotConfig is gewijzigd in DialogServiceConfig
- BotConfig::FromChannelSecret() is opnieuw toegewezen aan DialogServiceConfig::FromBotSecret()
- Alle bestaande Direct Line Speech-clients worden nog steeds ondersteund na de naamswijziging
TTS REST-adapter bijwerken ter ondersteuning van proxy, permanente verbinding
Foutbericht verbeteren wanneer een ongeldige regio wordt doorgegeven
Swift/Objective-C:
- Verbeterde foutrapportage: methoden die kunnen resulteren in een fout zijn nu aanwezig in twee versies: een die een NSError object beschikbaar maakt voor foutafhandeling en een methode die een uitzondering genereert. De voormalige zijn blootgesteld aan Swift. Deze wijziging vereist aanpassingen aan bestaande Swift-code.
- Verbeterde verwerking van gebeurtenissen

Bugreparaties

Oplossing voor TTS: waarbij SpeakTextAsync de toekomst werd teruggegeven zonder te wachten tot het geluid volledig was verwerkt.
Oplossing voor marshaling van strings in C# om volledige taalondersteuning mogelijk te maken.
Oplossing voor .NET core-app probleem om de kernbibliotheek te laden met het net461-doelframework in voorbeelden.
Oplossing voor incidentele problemen bij het implementeren van systeemeigen bibliotheken in de uitvoermap in voorbeelden
Oplossing voor het sluiten van websockets op betrouwbare wijze
Oplossing voor mogelijk vastlopen tijdens het openen van een verbinding onder zware belasting in Linux
Oplossing voor ontbrekende metagegevens in de frameworkbundel voor macOS
Oplossing voor problemen met pip install --user op Windows

Speech SDK 1.5.1

Dit is een foutoplossing die alleen van invloed is op de systeemeigen/beheerde SDK. Dit heeft geen invloed op de JavaScript-versie van de SDK.

Bugreparaties

Los FromSubscription op wanneer deze wordt gebruikt met gesprektranscriptie.
Er is een fout opgelost bij trefwoordspotting voor spraakassistenten.

Speech SDK 1.5.0: release van mei 2019

Nieuwe functies

KwS (Trefwoordspotting) is nu beschikbaar voor Windows en Linux. KWS-functionaliteit kan werken met elk microfoontype, officiële KWS-ondersteuning, maar is momenteel beperkt tot de microfoonmatrices die zijn gevonden in de Azure Kinect DK-hardware of de Speech Devices SDK.
De zinshintfunctionaliteit is beschikbaar via de SDK. Zie voor meer informatie hier.
De functionaliteit voor gesprektranscriptie is beschikbaar via de SDK.
Voeg ondersteuning toe voor Spraakassistenten met behulp van het Direct Line Speech-kanaal.

Voorbeelden

Voorbeelden toegevoegd voor nieuwe functies of nieuwe services die worden ondersteund door de SDK.

Verbeteringen/wijzigingen

Verschillende recognizer-eigenschappen toegevoegd om servicegedrag of serviceresultaten aan te passen (zoals maskering van grof taalgebruik en andere).
U kunt de recognizer nu configureren via de standaardconfiguratie-eigenschappen, zelfs als u de recognizer FromEndpointhebt gemaakt.
Objective-C: OutputFormat eigenschap is toegevoegd aan SPXSpeechConfiguration.
De SDK ondersteunt nu Debian 9 als Linux-distributie.

Bugreparaties

Een probleem opgelost waarbij de sprekerbron te vroeg werd vernietigd in tekst-naar-spraak.

Speech SDK 1.4.2

Dit is een foutoplossing die alleen van invloed is op de systeemeigen/beheerde SDK. Dit heeft geen invloed op de JavaScript-versie van de SDK.

Speech SDK 1.4.1

Dit is een alleen-JavaScript-versie. Er zijn geen functies toegevoegd. De volgende correcties zijn aangebracht:

Voorkomen dat webpack https-proxy-agent laadt.

Speech SDK 1.4.0: release van 2019-april

Nieuwe functies

De SDK biedt nu ondersteuning voor de Text to Speech-service als bètaversie. Het wordt ondersteund in Windows en Linux Desktop vanuit C++ en C#. Raadpleeg het overzicht van tekst naar spraak voor meer informatie.
De SDK biedt nu ondersteuning voor MP3- en Opus/OGG-audiobestanden als stream-invoerbestanden. Deze functie is alleen beschikbaar in Linux vanuit C++ en C# en is momenteel beschikbaar in de bètaversie (hier vindt u meer informatie).
De Speech SDK voor Java, .NET Core, C++ en Objective-C heeft macOS-ondersteuning gekregen. De Objective-C-ondersteuning voor macOS is momenteel in bètaversie.
iOS: De Speech SDK voor iOS (Objective-C) is nu ook gepubliceerd als een CocoaPod.
JavaScript: ondersteuning voor niet-standaardmicrofoon als invoerapparaat.
JavaScript: proxyondersteuning voor Node.js.

Voorbeelden

Voorbeelden voor het gebruik van de Speech SDK met C++ en objective-C in macOS zijn toegevoegd.
Voorbeelden waarin het gebruik van de tekst-naar-spraakservice wordt gedemonstreerd, zijn toegevoegd.

Verbeteringen/wijzigingen

Python: Aanvullende eigenschappen van herkenningsresultaten worden nu weergegeven via de properties eigenschap.
Voor aanvullende ondersteuning voor ontwikkeling en foutopsporing kunt u SDK-logboekregistratie en diagnostische gegevens omleiden naar een logboekbestand (hier vindt u meer informatie).
JavaScript: de prestaties van audioverwerking verbeteren.

Bugreparaties

Mac/iOS: Een fout die heeft geleid tot een lange wachttijd wanneer er geen verbinding met de Speech-service tot stand kon worden gebracht, is opgelost.
Python: foutafhandeling verbeteren voor argumenten in Python-callbacks.
JavaScript: Foutieve statusrapportage voor beëindiging van spraak op RequestSession verholpen.

Speech SDK 1.3.1: vernieuwing van 2019-februari

Dit is een foutoplossing die alleen van invloed is op de systeemeigen/beheerde SDK. Dit heeft geen invloed op de JavaScript-versie van de SDK.

Opgeloste fout

Er is een geheugenlek opgelost bij het gebruik van microfooninvoer. Op streams gebaseerde of bestandsinvoer wordt niet beïnvloed.

Speech SDK 1.3.0: release februari 2019

Nieuwe functies

De Speech SDK ondersteunt het selecteren van de invoermicrofoon via de AudioConfig klasse. Hiermee kunt u audiogegevens streamen naar de Speech-service vanaf een niet-standaardmicrofoon. Zie de documentatie waarin de selectie van audio-invoerapparaten wordt beschreven voor meer informatie. Deze functie is nog niet beschikbaar via JavaScript.
De Speech SDK biedt nu ondersteuning voor Unity in een bètaversie. Geef feedback via de sectie probleem in de GitHub-voorbeeldopslagplaats. Deze release ondersteunt Unity op Windows x86 en x64 (desktop- of Universeel Windows-platform-toepassingen) en Android (ARM32/64, x86). Meer informatie is beschikbaar in onze Unity-quickstart.
Het bestand Microsoft.CognitiveServices.Speech.csharp.bindings.dll (verzonden in eerdere releases) is niet meer nodig. De functionaliteit is nu geïntegreerd in de kern-SDK.

Voorbeelden

De volgende nieuwe inhoud is beschikbaar in onze voorbeeldopslagplaats:

Aanvullende voorbeelden voor AudioConfig.FromMicrophoneInput.
Aanvullende Python-voorbeelden voor intentieherkenning en vertaling.
Aanvullende voorbeelden voor het gebruik van het Connection object in iOS.
Aanvullende Java-voorbeelden voor vertaling met audio-uitvoer.
Nieuwe voorbeeld voor het gebruik van de Batch Transcription REST API.

Verbeteringen/wijzigingen

Python
- Verbeterde parameterverificatie en foutberichten in SpeechConfig.
- Voeg ondersteuning toe voor het Connection object.
- Ondersteuning voor 32-bits Python (x86) in Windows.
- De Speech SDK voor Python is niet beschikbaar in de bètaversie.
Ios
- De SDK is nu gebouwd op basis van de iOS SDK versie 12.1.
- De SDK ondersteunt nu iOS-versies 9.2 en hoger.
- Verbeter de referentiedocumentatie en corrik verschillende eigenschapsnamen.
JavaScript
- Voeg ondersteuning toe voor het Connection object.
- Typedefinitiebestanden toevoegen voor gebundelde JavaScript
- Initiële ondersteuning en implementatie voor woordgroepenhints.
- Retourneer eigenschappenverzameling met service-JSON voor herkenning
Windows-DLL's bevatten nu een versieresource.
Als u een recognizer FromEndpointmaakt, kunt u parameters rechtstreeks toevoegen aan de eindpunt-URL. Met FromEndpoint kunt u de recognizer niet configureren via de standaard-configuratie-eigenschappen.

Bugreparaties

Lege proxygebruikersnaam en proxywachtwoord zijn niet correct verwerkt. Als u in deze release een proxy-gebruikersnaam en proxywachtwoord instelt op een lege tekenreeks, worden deze niet verzonden wanneer u verbinding maakt met de proxy.
SessionId's die door de SDK zijn gemaakt, waren niet altijd echt willekeurig voor sommige talen/omgevingen. Een initialisatie van een willekeurige getallengenerator is toegevoegd om dit probleem op te lossen.
De verwerking van autorisatietoken verbeteren. Als u een autorisatietoken wilt gebruiken, specificeert u dit in SpeechConfig en laat u de API-sleutel leeg. Maak vervolgens de recognizer zoals gebruikelijk.
In sommige gevallen is het Connection object niet correct vrijgegeven. Dit probleem is opgelost.
Het JavaScript-voorbeeld is aangepast ter ondersteuning voor audio-uitvoer voor omzettingssynthese, ook in Safari.

Speech SDK 1.2.1

Dit is een alleen-JavaScript-versie. Er zijn geen functies toegevoegd. De volgende correcties zijn aangebracht:

Implementeer het einde van de stroom bij turn.end, niet bij speech.end.
Probleem opgelost in de audiopomp waarbij de volgende verzending niet werd gepland als de huidige verzending mislukte.
Herstel continue herkenning met verificatietoken.
Opgeloste fout voor verschillende recognizer/eindpunten.
Documentatieverbeteringen.

Speech SDK 1.2.0: release van december 2018

Nieuwe functies

Python
- De bètaversie van Python-ondersteuning (3.5 en hoger) is beschikbaar in deze release. Voor meer informatie, zie hier](.. /.. /quickstart-python.md).
JavaScript
- De Speech SDK voor JavaScript is opensourced. De broncode is beschikbaar op GitHub.
- We ondersteunen nu Node.js. Meer informatie vindt u hier.
- De lengtebeperking voor audiosessies is verwijderd, automatisch wordt er onder de motorkap opnieuw verbinding gemaakt.
Connection object
- Vanuit de Recognizer kun je toegang krijgen tot een Connection object. Met dit object kunt u de serviceverbinding expliciet initiëren en zich abonneren op gebeurtenissen voor het maken en verbreken van verbindingen. (Deze functie is nog niet beschikbaar via JavaScript en Python.)
Ondersteuning voor Ubuntu 18.04.
Android
- Ingeschakelde ProGuard-ondersteuning tijdens het genereren van apk's.

Verbeteringen

Verbeteringen in het interne threadgebruik, waardoor het aantal threads, locks en mutexen wordt verminderd.
Verbeterde foutrapportage/informatie. In verschillende gevallen zijn foutberichten niet helemaal doorgegeven.
Bijgewerkte ontwikkelingsafhankelijkheden in JavaScript om gebruik te maken van actuele modules.

Bugreparaties

Geheugenlekken verholpen als gevolg van een typefout in RecognizeAsync.
In sommige gevallen werden uitzonderingen gelekt.
Geheugenlek herstellen in gebeurtenisargumenten voor vertaling.
Een vergrendelingsprobleem opgelost bij het opnieuw verbinden in langdurige sessies.
Er is een probleem opgelost waardoor het uiteindelijke resultaat voor mislukte vertalingen kon ontbreken.
C#: Als een async bewerking niet in de hoofdthread werd verwacht, was het mogelijk dat de recognizer kan worden verwijderd voordat de asynchrone taak werd voltooid.
Java: Er is een probleem opgelost waardoor de Java-VM vastloopt.
Objective-C: Vaste enum-mapping; RecognizedIntent werd teruggestuurd in plaats van RecognizingIntent.
JavaScript: standaarduitvoerindeling instellen op 'eenvoudig' in SpeechConfig.
JavaScript: inconsistentie tussen eigenschappen in het configuratieobject in JavaScript en andere talen verwijderen.

Voorbeelden

Verschillende voorbeelden bijgewerkt en opgelost (bijvoorbeeld uitvoerstemmen voor vertaling, enzovoort).
Er zijn Node.js voorbeelden toegevoegd in de voorbeeldopslagplaats.

Speech SDK 1.1.0

Nieuwe functies

Ondersteuning voor Android x86/x64.
Proxyondersteuning: In het SpeechConfig object kunt u nu een functie aanroepen om de proxygegevens (hostnaam, poort, gebruikersnaam en wachtwoord) in te stellen. Deze functie is nog niet beschikbaar in iOS.
Verbeterde foutcode en berichten. Als een herkenning een fout heeft geretourneerd, heeft dit al Reason (in geannuleerd evenement) of CancellationDetails (in herkenningsresultaat) ingesteld op Error. De geannuleerde gebeurtenis bevat nu twee extra leden, ErrorCode en ErrorDetails. Als de server aanvullende foutinformatie heeft geretourneerd bij de gemelde fout, is deze nu beschikbaar in de nieuwe componenten.

Verbeteringen

Extra verificatie toegevoegd in de configuratie van de recognizer en extra foutbericht toegevoegd.
Verbeterde verwerking van langdurige stilte in het midden van een audiobestand.
NuGet-pakket: voor .NET Framework-projecten voorkomt het bouwen met AnyCPU-configuratie.

Bugreparaties

Er zijn verschillende uitzonderingen opgelost die zijn gevonden in recognizers. Bovendien worden uitzonderingen opgevangen en omgezet in een Canceled gebeurtenis.
Los een geheugenlek op in het vastgoedbeheer.
Er is een fout opgelost waarbij een audio-invoerbestand de herkenningssoftware kon laten vastlopen.
Er is een fout opgelost waarbij gebeurtenissen konden worden ontvangen na een sessiestopgebeurtenis.
Opgelost racecondities bij het gebruik van threads.
Er is een iOS-compatibiliteitsprobleem opgelost dat kan leiden tot een crash.
Stabiliteitsverbeteringen voor android-microfoonondersteuning.
Er is een fout opgelost waarbij een recognizer in JavaScript de herkenningstaal negeerde.
Er is een fout opgelost waardoor de EndpointId (in sommige gevallen) niet in JavaScript werd ingesteld.
Parametervolgorde gewijzigd in AddIntent in JavaScript en ontbrekende AddIntent JavaScript-handtekening toegevoegd.

Voorbeelden

C++- en C#-voorbeelden toegevoegd voor het gebruik van pull- en pushstreams in de voorbeeldopslagplaats.

Speech SDK 1.0.1

Betrouwbaarheidsverbeteringen en oplossingen voor fouten:

Mogelijke fatale fout opgelost door raceconditie bij het vrijgeven van de herkenner.
Er is een mogelijke fatale fout opgelost wanneer niet-ingestelde eigenschappen voorkomen.
Extra fout- en parametercontrole toegevoegd.
Objective-C: Er is een mogelijke fatale fout opgelost die is veroorzaakt door het overschrijven van de naam in NSString.
Objective-C: Aangepaste zichtbaarheid van API
JavaScript: Opgelost met betrekking tot gebeurtenissen en hun payloads.
Documentatieverbeteringen.

In onze voorbeeldopslagplaats is een nieuw voorbeeld voor JavaScript toegevoegd.

Azure AI Speech SDK 1.0.0: 2018-septemberuitgave

Nieuwe functies

Ondersteuning voor Objective-C in iOS. Bekijk onze Objective-C-quickstart voor iOS.
Ondersteuning voor JavaScript in de browser. Bekijk onze JavaScript-quickstart.

Belangrijke wijzigingen

In deze release worden een aantal belangrijke wijzigingen geïntroduceerd. Controleer deze pagina voor meer informatie.

Azure AI Speech SDK 0.6.0: release van augustus 2018

Nieuwe functies

UWP-apps die zijn gebouwd met de Speech SDK kunnen nu slagen voor de Windows App Certification Kit (WACK). Bekijk de UWP-startgids.
Ondersteuning voor .NET Standard 2.0 op Linux (Ubuntu 16.04 x64).
Experimenteel: Ondersteuning voor Java 8 op Windows (64-bits) en Linux (Ubuntu 16.04 x64). Bekijk de Java Runtime Environment quickstart.

Functionele wijziging

Toon extra foutdetails bij verbindingsfouten.

Belangrijke wijzigingen

Voor Java (Android) is voor de SpeechFactory.configureNativePlatformBindingWithDefaultCertificate functie geen padparameter meer vereist. Het pad wordt nu automatisch gedetecteerd op alle ondersteunde platforms.
De get-accessor van de eigenschap EndpointUrl in Java en C# is verwijderd.

Bugreparaties

In Java wordt het audiosyntheseresultaat op de vertaalherkenning nu geïmplementeerd.
Er is een fout opgelost die inactieve threads en een verhoogd aantal geopende en ongebruikte sockets kon veroorzaken.
Er is een probleem opgelost waarbij een langlopende herkenning in het midden van de transmissie kon worden beëindigd.
Opgelost een raceconditie bij het afsluiten van de herkenner.

Azure AI Speech SDK 0.5.0: Juli 2018-release

Nieuwe functies

Ondersteuning voor Android-platform (API 23: Android 6.0 Marshmallow of hoger). Bekijk de Snelstartgids voor Android.
Ondersteuning voor .NET Standard 2.0 in Windows. Bekijk de quickstart voor .NET Core.
Experimenteel: Ondersteuning voor UWP in Windows (versie 1709 of hoger).
- Bekijk de UWP-startgids.
- Houd er rekening mee dat UWP-apps die zijn gebouwd met de Speech SDK nog niet voldoen aan de Windows App Certification Kit (WACK).
Ondersteuning voor langdurige herkenning met automatische herverbinding.

Functionele wijzigingen

StartContinuousRecognitionAsync() ondersteunt langdurige herkenning.
Het herkenningsresultaat bevat meer velden. Ze hebben een offset ten opzichte van het begin en de duur van het geluid (beide in tikken) van de herkende tekst, evenals extra waarden die de herkenningsstatus vertegenwoordigen, zoals bijvoorbeeld InitialSilenceTimeout en InitialBabbleTimeout.
Ondersteun AuthorizationToken voor het aanmaken van fabriekinstanties.

Belangrijke wijzigingen

Herkenningsgebeurtenissen: NoMatch gebeurtenistype is samengevoegd in de Error gebeurtenis.
SpeechOutputFormat in C# is hernoemd naar OutputFormat om afgestemd te blijven op C++.
Het retourtype van sommige methoden van de AudioInputStream interface is enigszins gewijzigd:
- In Java geeft de methode read nu long terug in plaats van int.
- In C# retourneert de Read methode nu uint in plaats van int.
- In C++worden de Read en GetFormat methoden nu geretourneerd size_t in plaats van int.
C++: Exemplaren van audio-invoerstromen kunnen nu alleen worden doorgegeven als een shared_ptr.

Bugreparaties

Verkeerde retourwaarden in het resultaat zijn gecorrigeerd wanneer RecognizeAsync() een time-out heeft.
De afhankelijkheid van mediabasisbibliotheken in Windows is verwijderd. De SDK maakt nu gebruik van Core Audio-API's.
Oplossing voor documentatie: Er is een regiopagina toegevoegd om de ondersteunde regio's te beschrijven.

Bekend probleem

De Speech SDK voor Android rapporteert geen resultaten van spraaksynthese voor vertaling. Dit probleem wordt opgelost in de volgende release.

Azure AI Speech SDK 0.4.0: release van 2018-juni

Functionele wijzigingen

AudioInputStream

Een recognizer kan nu een stream gebruiken als de audiobron. Zie de bijbehorende handleiding voor meer informatie.
Gedetailleerde uitvoerindeling

Wanneer u een SpeechRecognizer aanmaakt, kunt u Detailed of Simple als outputformaat aanvragen. De DetailedSpeechRecognitionResult bevat een betrouwbaarheidsscore, herkende tekst, ruwe lexicale vorm, genormaliseerde vorm en genormaliseerde vorm met gemaskeerd grof taalgebruik.

Ingrijpende wijziging

Gewijzigd van SpeechRecognitionResult.Text naar SpeechRecognitionResult.RecognizedText in C#.

Bugreparaties

Een mogelijk callback-probleem in de USP-laag tijdens het afsluiten opgelost.
Als een recognizer een audio-invoerbestand gebruikte, hield het langer dan nodig vast aan de bestandsgreep.
Er zijn verschillende deadlocks tussen de berichtpomp en de herkenner opgelost.
Verzend een NoMatch-resultaat wanneer er een time-out optreedt voor het antwoord van de service.
De mediabasisbibliotheken in Windows worden vertraagd geladen. Deze bibliotheek is alleen vereist voor microfooninvoer.
De uploadsnelheid voor audiogegevens is beperkt tot ongeveer twee keer de oorspronkelijke audiosnelheid.
In Windows zijn C# .NET-assemblages nu sterk benoemd.
Documentatiecorrectie: Region is verplichte informatie voor het maken van een herkenningstool.

Er zijn meer voorbeelden toegevoegd en worden voortdurend bijgewerkt. Zie de GitHub-opslagplaats met Speech SDK-voorbeelden voor de nieuwste set voorbeelden.

Azure AI Speech SDK 0.2.12733: release van 2018-mei

Deze release is de eerste openbare preview-versie van de Azure AI Speech SDK.

Speech CLI 1.43: release van maart 2025

Nieuwe functies

SPX bijgewerkt voor gebruik van .NET 8.

Bugreparaties

Probleem opgelost waarbij de SPX Docker-container niet werkt in batchscenario's op locatie.

Speech CLI 1.40.0: augustus 2024 release

Bijgewerkt voor gebruik van Speech SDK 1.40.0

Nieuwe functies

Geen

Bugreparaties

Geen

Speech CLI 1.38.0: juni 2024 uitgave

Bijgewerkt voor gebruik van Speech SDK 1.38.0

Nieuwe functies

Geen

Bugreparaties

Geen

Speech CLI 1.37.0: April 2024 versie

Bijgewerkt voor gebruik van Speech SDK 1.37.0

Nieuwe functies

Geen

Bugreparaties

Geen

Speech CLI 1.36.0: uitgave van maart 2024

Bijgewerkt voor gebruik van Speech SDK 1.36.0

Nieuwe functies

Geen

Bugreparaties

Geen

Release van februari 2024 van Speech CLI 1.35.0

Bijgewerkt voor gebruik van Speech SDK 1.35.0

Nieuwe functies

Geen

Bugreparaties

JMESPath-afhankelijkheid bijwerken naar de nieuwste versie

Speech CLI 1.34.0: release van november 2023

Bijgewerkt voor gebruik van Speech SDK 1.34.0

Speech CLI 1.33.0: oktober 2023 uitgave

Bijgewerkt voor gebruik van Speech SDK 1.33.0

Speech CLI 1.31.0: augustus 2023 uitgave

Bijgewerkt voor gebruik van Speech SDK 1.31.0

Speech CLI 1.30.0: Juli 2023 uitgave

Bijgewerkt voor gebruik van Speech SDK 1.30.0

Speech CLI 1.29.0: Juni 2023 versie

Bijgewerkt voor gebruik van Speech SDK 1.29.0

Speech CLI 1.28.0: mei 2023 uitgave

Bijgewerkt voor gebruik van Speech SDK 1.28.0

Speech CLI 1.27.0: April 2023 uitgave

Actualisaties

Bijgewerkt voor gebruik van Speech SDK 1.27.0
Werk het standaardeindpunt bij voor het gebruik van v3.1 REST API's voor aangepaste spraakherkenning en Batch-spraakherkenning.

Bugreparaties

Oplossingen met betrekking tot de wijze waarop queryparameters worden geparseerd/geconfigureerd.

Speech CLI 1.26.0: uitgave maart 2023

Bijgewerkt voor gebruik van Speech SDK 1.26.0.

Speech CLI 1.25.0: Januari 2023-release

Bijgewerkt voor gebruik van Speech SDK 1.25.0.

Speech CLI 1.24.0: oktober 2022 uitgave

Gebruikt Speech SDK 1.24.0.

Nieuwe functies

Uitgebreide 'spx-controle' ter ondersteuning van JMESPath-query's voor alle SPX-gebeurtenissen

Bugreparaties

Verschillende verbeteringen in robuustheid ten opzichte van JMESPath-queryevaluaties
Oplossing voor inkortingen bij het schrijven naar bestanden die kunnen optreden op machines met beperkte middelen

Speech CLI 1.23.0: Juli 2022 uitgave

Gebruikt Speech SDK 1.23.0.

Nieuwe functies

Betere ondertiteling (--output vtt en --output srt) grote resultaatsplitsing (maximaal 37 tekens, 3 regels)
Gedocumenteerde spx synthesize--format opties (zie spx help synthesize format)
De meeste spx csr opdrachten/opties gedocumenteerd (zie spx help csr)
Opdracht toegevoegd spx csr model copy (zie spx help csr model copy)
Optie toegevoegd --check result met behulp van JMES-query's (zie spx help check result)
Verbeterde foutberichten bij het opgeven van ongeldige opdrachtopties
Verplaatst van .NET Core 3.1 naar .NET 6.0. Als u Speech CLI wilt uitvoeren, moet u de .NET 6.0 Runtime (of hoger) installeren.

Bugreparaties

Alle URL's bijgewerkt om taal te verwijderen (bijvoorbeeld 'en-US')
De versie-informatie is bijgewerkt zodat deze in alle gevallen correct wordt weergegeven (voorheen werd er soms een lege weergave getoond)

Speech CLI 1.22.0: uitgave juni 2022

Gebruikt Speech SDK 1.22.0.

Nieuwe functies

Een spx init-opdracht toegevoegd om gebruikers te begeleiden bij het aanmaken van de Speech-resource sleutel zonder naar het Azure Web Portal te hoeven gaan.
Speech Docker-containers hebben nu Azure CLI opgenomen, dus de spx init opdracht werkt standaard.
Tijdstempel toegevoegd als uitvoeroptie voor gebeurtenissen, om SPX nuttiger te maken bij het berekenen van latenties.

Speech CLI versie 1.21.0: uitgave april 2022

Gebruikt Speech SDK 1.21.0.

Nieuwe functies

WEBVTT-bijschrift genereren
- Ondersteuning voor --output vtt toegevoegd aan spx translate
- Ondersteunt --output vtt file FILENAME om de standaard VTT-bestandsnaam te vervangen
- Ondersteunt --output vtt file - bij het schrijven naar de standaarduitvoer
- Afzonderlijke VTT-bestanden worden gemaakt voor elke doeltaal (bijvoorbeeld --target en;de;fr)
SRT-bijschrift genereren
- Ondersteuning toegevoegd --output srt aan spx recognize, spx intenten spx translate
- Ondersteunt --output srt file FILENAME om de standaard SRT-bestandsnaam te overschrijven
- Ondersteunt --output srt file - bij het schrijven naar de standaarduitvoer
- Voor spx translateelke doeltaal worden afzonderlijke SRT-bestanden gemaakt (bijvoorbeeld --target en;de;fr)

Bugreparaties

Gecorrigeerde uitvoer van WEBVTT-tijdspanne om het hh:mm:ss.fff-formaat correct te gebruiken.

Speech CLI 1.20.0: Januari 2022 uitgave

Nieuwe functies

Sprekerherkenning
- spx profile enroll en spx speaker [identify/verify] nu microfooninvoer ondersteunen
Intentieherkenning (spx intent)
- --keyword FILE.table
- --pattern en --patterns
- --output all/each intentid
- --output all/each entity json
- --output all/each ENTITY entity
- --once, , --once+--continuous (doorlopend nu standaard)
- --output all/each connection EVENT
- --output all/each connection message(bijvoorbeeld , textpath)
Controle en opmaak van de verwachte uitvoer van de CLI-console.
- --expect PATTERN en --not expect PATTERN ondersteuning op alle commando's
- --auto expect om te helpen bij het opstellen van verwachte patronen
Controle/creatie van verwachte uitvoer van SDK-logboekregistratie
- --log expect PATTERN en --not log expect PATTERN ondersteuning op alle commando's
- --log auto expect [FILTER] ondersteuning voor alle opdrachten
- --log FILE ondersteuning voor spx profile en spx speaker
Invoer van audiobestanden
- --format ANY ondersteuning voor alle opdrachten
- --file - ondersteuning (lezen van standaardinvoer, het inschakelen van pijplijnscenario's)
Uitvoer van audiobestand
- --audio output - Schrijven naar standaarduitvoer, waardoor pijpscenario's mogelijk worden
Uitvoerbestanden
- --output all/each file - Naar standaarduitvoer schrijven
- --output batch file - Naar standaarduitvoer schrijven
- --output vtt file - Naar standaarduitvoer schrijven
- --output json file - schrijven naar standaarduitvoer, voor spx csr en spx batch commando's
Uitvoereigenschappen
- --output […] result XXX property (PropertyId of tekenreeks)
- --output […] connection message received XXX property (PropertyId of tekenreeks)
- --output […] recognizer XXX property (PropertyId of tekenreeks)
Integratie van Azure WebJob
- spx webjob volgt nu het subopdrachtpatroon
- WebJob-ondersteuning bijgewerkt om het sub-opdrachtpatroon te weerspiegelen (zie spx help webjob)

Bugreparaties

Er is een fout opgelost wanneer beide --output vtt FILE en --output batch FILE tegelijkertijd worden gebruikt
spx [...] --zip ZIPFILENAME bevat nu alle binaire bestanden die vereist zijn voor alle scenario's (indien aanwezig)
spx profile en spx speaker-commando's geven nu gedetailleerde foutinformatie bij annulering

Release van mei 2021

Nieuwe functies

Er is ondersteuning toegevoegd voor profiel-, spreker-id- en sprekercontrole: probeer spx profile en spx speaker vanaf de opdrachtregel.
We hebben ook ondersteuning voor dialoogvensters toegevoegd: probeer spx dialog vanuit de opdrachtregel.
Verbeterde spx hulp. Geef ons feedback over hoe dit voor u werkt door een GitHub-probleem te openen.
We hebben de grootte van de installatie van het .NET-hulpprogramma verlaagd.

COVID-19 verkorte tests

Naarmate de doorlopende pandemie onze technici blijft verplichten om thuis te werken, worden handmatige verificatiescripts voor de pre-pandemie beperkt tot testen op minder apparaten met minder configuraties en kan de kans op omgevingsspecifieke bugs die doorsluipen, worden verhoogd. We valideren nog steeds grondig met een groot aantal geautomatiseerde processen. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons weten op GitHub.
Blijf gezond!

Release van maart 2021

Nieuwe functies

Opdracht spx intent toegevoegd voor intentieherkenning, vervangen spx recognize intent.
Herkennen en intenties kunnen nu Azure-functies gebruiken om het foutpercentage van woorden te berekenen met behulp van spx recognize --wer url <URL>.
Recognize kan nu resultaten uitvoeren als VTT-bestanden met behulp van spx recognize --output vtt file <FILENAME>.
Gevoelige sleutelgegevens worden nu verborgen in debugging/uitgebreide uitvoer.
URL-controle en foutbericht toegevoegd voor het inhoudsveld bij het aanmaken van batchtranscripties.

COVID-19 verkorte tests

Uitgave januari 2021

Nieuwe functies

Speech CLI is nu beschikbaar als een NuGet-pakket en kan worden geïnstalleerd via .NET CLI als een algemeen .NET-hulpprogramma dat u kunt aanroepen vanuit de shell/opdrachtregel.
De devOps-sjabloonopslagplaats voor aangepaste spraak is bijgewerkt om Speech CLI te gebruiken voor de aangepaste spraakwerkstromen.

COVID-19 verkorte tests

Release van oktober 2020

SPX is de opdrachtregelinterface voor het gebruik van de Speech-service zonder code te schrijven. Download hier de nieuwste versie.

Nieuwe functies

spx csr dataset upload --kind audio|language|acoustic – gegevenssets maken op basis van lokale gegevens, niet alleen van URL's.
spx csr evaluation create|status|list|update|delete – vergelijk nieuwe modellen met baseline waarheden/andere modellen.
spx * list – ondersteunt een niet-gepagineerde ervaring (vereist geen --top X --skip X).
spx * --http header A=B – ondersteuning voor aangepaste headers (toegevoegd voor Office voor aangepaste verificatie).
spx help – verbeterde tekst en back-tick tekst kleur gecodeerd (blauw).

2020-juni uitgave

In-CLI help-zoekfuncties toegevoegd:
- spx help find --text TEXT
- spx help find --topic NAME
Bijgewerkt voor gebruik met nieuw geïmplementeerde v3.0 Batch- en aangepaste spraak-API's:
- spx help batch examples
- spx help csr examples

COVID-19 verkorte tests

Speech CLI (Ook wel bekend als SPX): Mei 2020 release

SPX is een nieuw opdrachtregelprogramma waarmee u vanaf de opdrachtregel herkenning, synthese, vertaling, batchtranscriptie en aangepast spraakbeheer kunt uitvoeren. Gebruik deze om de Speech-service te testen of om de Speech-servicetaken te scripten die u moet uitvoeren. Download het hulpprogramma en lees de documentatie hier.

Release van april 2025

Openbare preview van nieuwe HD-stemmen

De volgende HD-stemmen zijn nu beschikbaar voor preview:

Landinstellingen (BCP-47)	Spraaknaam
`en-US`	`en-US-MultiTalker-Ava-Steffan:DragonHDLatestNeural` (Neutraal)
`en-US`	`en-US-Bree:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-AshTurboMultilingualNeural` (Mannelijk)

Uitgave van maart 2025

Algemene beschikbaarheid van sommige HD-stemmen

De volgende HD-stemmen zijn nu algemeen beschikbaar:

Landinstellingen (BCP-47)	Spraaknaam
`de-DE`	`de-DE-Florian:DragonHDLatestNeural` (Mannelijk)
`de-DE`	`de-DE-Seraphina:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Adam:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Andrew:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Andrew2:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Ava:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Brian:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Davis:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Emma:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Emma2:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Steffan:DragonHDLatestNeural` (Mannelijk)
`es-ES`	`es-ES-Tristan:DragonHDLatestNeural` (Mannelijk)
`es-ES`	`es-ES-Ximena:DragonHDLatestNeural` (Vrouwelijk)
`fr-FR`	`fr-FR-Remy:DragonHDLatestNeural` (Mannelijk)
`fr-FR`	`fr-FR-Vivienne:DragonHDLatestNeural` (Vrouwelijk)
`ja-JP`	`ja-JP-Masaru:DragonHDLatestNeural` (Mannelijk)
`ja-JP`	`ja-JP-Nanami:DragonHDLatestNeural` (Vrouwelijk)
`zh-CN`	`zh-CN-Xiaochen:DragonHDLatestNeural` (Vrouwelijk)
`zh-CN`	`zh-CN-Yunfan:DragonHDLatestNeural` (Mannelijk)

Meerderestemmen voor podcastscenario's (voorvertoning)

Landinstellingen (BCP-47)	Spraaknaam
`en-US`	`en-US-MultiTalker-Ava-Andrew:DragonHDLatestNeural` (Neutraal)

Nieuwe HD-stemmen (preview)

Landinstellingen (BCP-47)	Spraaknaam
`en-US`	`en-US-Ava3:DragonHDLatestNeural` (Vrouwelijk) - geoptimaliseerd voor Podcast
`en-US`	`en-US-Andrew3:DragonHDLatestNeural` (Male) - geoptimaliseerd voor Podcast

Dragon HD Flash-modellen (voorbeeld)

Landinstellingen (BCP-47)	Spraaknaam
`zh-CN`	`zh-CN-Xiaochen:DragonHDFlashLatestNeural` (Vrouwelijk)
`zh-CN`	`zh-CN-Xiaoxiao:DragonHDFlashLatestNeural` (Vrouwelijk)
`zh-CN`	`zh-CN-Xiaoxiao2:DragonHDFlashLatestNeural` (Vrouwelijk, Geoptimaliseerd voor vrije gesprekken)
`zh-CN`	`zh-CN-Yunxiao:DragonHDFlashLatestNeural` (Mannelijk)
`zh-CN`	`zh-CN-Yunyi:DragonHDFlashLatestNeural` (Mannelijk)

Release van februari 2025

Bijgewerkte HD-stemmen (preview)

Er zijn 13 huidige HD-stemmen bijgewerkt om meertalige stemmen te ondersteunen.

Landinstellingen (BCP-47)	Spraaknaam
`de-DE`	`de-DE-Seraphina:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Brian:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Davis:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Ava:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Andrew:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Andrew2:DragonHDLatestNeural` (Mannelijk) - geoptimaliseerd voor gratis praten
`en-US`	`en-US-Emma:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Emma2:DragonHDLatestNeural` (Vrouwelijk) - geoptimaliseerd voor vrije gesprekken
`en-US`	`en-US-Steffan:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Aria:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Jenny:DragonHDLatestNeural` (Vrouwelijk)
`ja-JP`	`ja-JP-Masaru:DragonHDLatestNeural` (Mannelijk)
`zh-CN`	`zh-CN-Xiaochen:DragonHDLatestNeural` (Vrouwelijk)

Nieuwe HD-stemmen (preview)

Nog 14 HD-stemmen toegevoegd

Landinstellingen (BCP-47)	Spraaknaam
`de-DE`	`de-DE-Florian:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Adam:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Brian:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Davis:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Phoebe:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Serena:DragonHDLatestNeural` (Vrouwelijk)
`en-US`	`en-US-Alloy:DragonHDLatestNeural` (Mannelijk)
`en-US`	`en-US-Nova:DragonHDLatestNeural` (Vrouwelijk)
`es-ES`	`es-ES-Ximena:DragonHDLatestNeural` (Vrouwelijk)
`es-ES`	`es-ES-Tristan:DragonHDLatestNeural` (Mannelijk)
`fr-FR`	`fr-FR-Vivienne:DragonHDLatestNeural` (Vrouwelijk)
`fr-FR`	`fr-FR-Remy:DragonHDLatestNeural` (Mannelijk)
`ja-JP`	`ja-JP-Nanami:DragonHDLatestNeural` (Vrouwelijk)
`zh-CN`	`zh-CN-Yunfan:DragonHDLatestNeural` (Mannelijk)

Introductie van nieuwe meertalige stemmen (preview)

Er zijn nog 4 meertalige stemmen toegevoegd in en-US met ondersteuning voor emoties.

Landinstellingen (BCP-47)	Spraaknaam	Stijlen
`en-US`	`DerekMultilingualNeural` (Mannelijk)	`empathetic`,`excited`,`relieved`,`shy`
`en-US`	`PhoebeMultilingualNeural` (Vrouwelijk)	`empathetic` `sad` `serious`
`en-US`	`DavisMultilingualNeural` (Mannelijk)	`empathetic` `funny` `relieved`
`en-US`	`NancyMultilingualNeural` (Vrouwelijk)	`excited` `friendly`, `funny`, `relievedshy`

Azure OpenAI binnen Azure AI Foundry-modellen Turbo Voices (algemeen beschikbaar)

Deze 6 turbostemmen zijn nu algemeen beschikbaar:

Landinstellingen (BCP-47)	Spraaknaam
`en-US`	`en-US-AlloyTurboMultilingualNeural` (Mannelijk)
`en-US`	`en-US-EchoTurboMultilingualNeural` (Mannelijk)
`en-US`	`en-US-FableTurboMultilingualNeural` (Neutraal)
`en-US`	`en-US-NovaTurboMultilingualNeural` (Vrouwelijk)
`en-US`	`en-US-OnyxTurboMultilingualNeural` (Mannelijk)
`en-US`	`en-US-ShimmerTurboMultilingualNeural` (Vrouwelijk)

Verbeteringen in spraakkwaliteit (algemeen beschikbaar)

Verbeterde kwaliteit van 16 stemmen.

Landinstellingen (BCP-47)	Spraaknaam
`ar-EG`	`ar-EG-ShakirNeural` (Mannelijk)
`ca-ES`	`ca-ES-EnricNeural` (Mannelijk)
`en-IE`	`en-IE-EmilyNeural` (Vrouwelijk)
`fi-FI`	`fi-FI-HarriNeural` (Mannelijk)
`fi-FI`	`fi-FI-SelmaNeural` (Vrouwelijk)
`fr-CH`	`fr-CH-FabriceNeural` (Vrouwelijk)
`hr-HR`	`hr-HR-GabrijelaNeural` (Vrouwelijk)
`nl-NL`	`nl-NL-MaartenNeural` (Mannelijk)
`pt-PT`	`pt-PT-RaquelNeural` (Vrouwelijk)
`ro-RO`	`ro-RO-AlinaNeural` (Vrouwelijk)
`sv-SE`	`sv-SE-MattiasNeural` (Mannelijk)
`sv-SE`	`sv-SE-SofieNeural` (Vrouwelijk)
`vi-VN`	`vi-VN-HoaiMyNeural` (Vrouwelijk)
`vi-VN`	`vi-VN-NamMinhNeural` (Mannelijk)
`zh-HK`	`zh-HK-HiuMaanNeural` (Vrouwelijk)
`zh-HK`	`zh-HK-WanLungNeural` (Mannelijk)

Multi-style ingebedde Jenny (Algemeen Beschikbaar)

Er is stijlondersteuning toegevoegd voor en-US-JennyNeural in ingebedde spraak. Dezelfde stijlen worden ondersteund als in de cloud. De volgende stijlen worden ondersteund: angry, assistant, chat, cheerful, customerservice, excited, friendly, hopeful, newscast, sad, shouting, terrified, unfriendly, en whispering.

Januari 2025 release

Aangepaste avatartraining

U kunt nu aangepaste avatars trainen in Speech Studio. Voorheen moest u wachten tot Microsoft uw aangepaste avatar trainde.

Zie maak een aangepaste tekst-naar-spraak-avatar voor meer informatie over het maken van een aangepaste avatar.

Release van oktober 2024

Standaardstem

Geïntroduceerd in openbare preview: 4 turboversies van Azure OpenAI-stemmen: en-US-EchoTurboMultilingualNeural, en-US-FableTurboMultilingualNeural, en-US-OnyxTurboMultilingualNeural, en en-US-ShimmerTurboMultilingualNeural. Turboversie van Azure OpenAI-stemmen heeft dezelfde stempersoon als Azure OpenAI-stemmen, maar biedt ondersteuning voor extra functies. Turbo-stemmen ondersteunen de volledige set SSML-elementen en meer functies, zoals woordgrens, net als andere Azure AI Speech-stemmen. Zie de volledige taal- en spraaklijst voor meer informatie.

Deze stemmen zijn nu algemeen beschikbaar:

Landinstellingen (BCP-47)	Spraaknaam
`de-DE`	`SeraphinaMultilingualNeural`
`de-DE`	`FlorianMultilingualNeural`
`en-GB`	`AdaMultilingualNeural`
`en-GB`	`OllieMultilingualNeural`
`en-US`	`LunaNeural`
`en-US`	`KaiNeural`
`en-US`	`CoraMultilingualNeural`
`en-US`	`ChristopherMultilingualNeural`
`en-US`	`BrandonMultilingualNeural`
`es-ES`	`IsidoraMultilingualNeural`
`es-ES`	`ArabellaMultilingualNeural`
`es-ES`	`TristanMultilingualNeural`
`es-ES`	`XimenaMultilingualNeural`
`fr-FR`	`LucienMultilingualNeural`
`fr-FR`	`VivienneMultilingualNeural`
`fr-FR`	`RemyMultilingualNeural`
`it-IT`	`IsabellaMultilingualNeural`
`it-IT`	`MarcelloMultilingualNeural`
`it-IT`	`AlessioMultilingualNeural`
`it-IT`	`GiuseppeMultilingualNeural`
`ko-KR`	`HyunsuMultilingualNeural`
`pt-BR`	`ThalitaMultilingualNeural`
`pt-BR`	`MacerioMultilingualNeural`

Hd-spraak (Standard High Definition)

Hd-stemmen (Speech High Definition) van Azure AI zijn beschikbaar in openbare preview. De HD-stemmen kunnen de inhoud begrijpen, emoties automatisch detecteren in de invoertekst en de spreektoon in realtime aanpassen aan het gevoel. HD-stemmen behouden een consistente spraakpersoonlijkheid van hun neurale (en niet-HD) tegenhangers en leveren nog meer waarde door verbeterde functies. Zie Wat zijn HD-stemmen (Azure AI Speech high definition) voor meer informatie.

Aangepaste neurale stem

Voorheen werden sommige lokalisaties alleen ondersteund door V3 voor het trainingsrecept. Deze landinstellingen ondersteunen nu ook V9, waardoor verbeterde trainingskwaliteit en uitgebreide functies mogelijk zijn. Raadpleeg de volgende tabel voor deze locaties:

Landinstellingen (BCP-47)	Taal
`ar-EG`	Arabisch (Egypte)
`ar-SA`	Arabisch (Saoedi-Arabië)
`ca-ES`	Catalaans
`cs-CZ`	Tsjechisch (Tsjechië)
`da-DK`	Deens (Denemarken)
`de-AT`	Duits (Oostenrijk)
`de-CH`	Duits (Zwitserland)
`el-GR`	Grieks (Griekenland)
`en-IN`	Engels (India)
`fi-FI`	Fins (Finland)
`fr-CH`	Frans (Zwitserland)
`he-IL`	Hebreeuws (Israël)
`hi-IN`	Hindi (India)
`hu-HU`	Hongaars (Hongarije)
`ms-MY`	Maleis (Maleisië)
`nb-NO`	Noors Bokmål (Noorwegen)
`nl-NL`	Nederlands (Nederland)
`pl-PL`	Pools (Polen)
`pt-PT`	Portugees (Portugal)
`ro-RO`	Roemeens (Roemenië)
`ru-RU`	Russisch (Rusland)
`sk-SK`	Slowaaks (Slowakije)
`sv-SE`	Zweeds (Zweden)
`th-TH`	Thai (Thailand)
`r-TR`	Turks (Turkije)
`vi-VN`	Vietnamees (Vietnam)
`zh-HK`	Chinees (Kantonees, traditioneel)
`zh-TW`	Chinees (Taiwanese Mandarijn, Traditioneel)

Custom Neural Voice Pro ondersteunt nu de volgende nieuwe landinstellingen:
- en-NZ: Engels (Nieuw-Zeeland)
- es-CL: Spaans (Chili)
- es-US: Spaans (Verenigde Staten)
- ta-MY: Tamil (Maleisië)
Zie de taallijst voor aangepaste neurale spraak voor de volledige lijst met ondersteunde landinstellingen.

De functie voor meerdere talen ondersteunt nu de volgende nieuwe landinstellingen als bronlandinstellingen:

Landinstellingen (BCP-47)	Taal
`da-DK`	Deens (Denemarken)
`de-AT`	Duits (Oostenrijk)
`de-CH`	Duits (Zwitserland)
`de-DE`	Duits (Duitsland)
`en-CA`	Engels (Canada)
`fi-FI`	Fins (Finland)
`fr-CH`	Frans (Zwitserland)
`hu-HU`	Hongaars (Hongarije)
`ms-MY`	Maleis (Maleisië)
`nb-NO`	Noors Bokmål (Noorwegen)
`pt-PT`	Portugees (Portugal)
`sv-SE`	Zweeds (Zweden)
`tr-TR`	Turks (Turkije)
`ta-IN`	Tamil (India)
`zh-HK`	Chinees (Kantonees, traditioneel)

Zie de taallijst voor aangepaste neurale spraak voor de volledige lijst met ondersteunde landinstellingen.

De spraakfunctie met meerdere stijlen ondersteunt nu de volgende nieuwe landinstellingen:

Landinstellingen (BCP-47)	Taal
`ar-EG`	Arabisch (Egypte)
`ar-SA`	Arabisch (Saoedi-Arabië)
`ca-ES`	Catalaans
`cs-CZ`	Tsjechisch (Tsjechië)
`da-DK`	Deens (Denemarken)
`de-AT`	Duits (Oostenrijk)
`de-CH`	Duits (Zwitserland)
`de-DE`	Duits (Duitsland)
`el-GR`	Grieks (Griekenland)
`en-AU`	Engels (Australië)
`en-CA`	Engels (Canada)
`en-GB`	Engels (Verenigd Koninkrijk)
`en-IN`	Engels (India)
`es-ES`	Spaans (Spanje)
`es-MX`	Spaans (Mexico)
`fi-FI`	Fins (Finland)
`fr-CA`	Frans (Canada)
`fr-CH`	Frans (Zwitserland)
`fr-FR`	Frans (Frankrijk)
`he-IL`	Hebreeuws (Israël)
`hi-IN`	Hindi (India)
`hu-HU`	Hongaars (Hongarije)
`it-IT`	Italiaans (Italië)
`ko-KR`	Koreaans (Korea)
`ms-MY`	Maleis (Maleisië)
`nb-NO`	Noors Bokmål (Noorwegen)
`nl-BE`	Nederlands (België)
`nl-NL`	Nederlands (Nederland)
`pl-PL`	Pools (Polen)
`pt-BR`	Portugees (Brazilië)
`pt-PT`	Portugees (Portugal)
`ro-RO`	Roemeens (Roemenië)
`ru-RU`	Russisch (Rusland)
`sk-SK`	Slowaaks (Slowakije)
`sv-SE`	Zweeds (Zweden)
`th-TH`	Thai (Thailand)
`tr-TR`	Turks (Turkije)
`vi-VN`	Vietnamees (Vietnam)
`zh-HK`	Chinees (Kantonees, traditioneel)
`zh-TW`	Chinees (Taiwanese Mandarijn, Traditioneel)

Zie de taallijst voor aangepaste neurale spraak voor de volledige lijst met ondersteunde landinstellingen.

September 2024-uitgave

Standaardstem

Ondersteuning en algemene beschikbaarheid voor nieuwe stemmen toegevoegd in de volgende regio's:

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`as-IN`	Assamees (India)	`as-IN-YashicaNeural` (Vrouwelijk) `as-IN-PriyomNeural` (Mannelijk)
`or-IN`	Odia (India)	`or-IN-SubhasiniNeural` (Vrouwelijk) `or-IN-SukantNeural` (Mannelijk)
`pa-IN`	Punjabi (India)	`pa-IN-OjasNeural` (Mannelijk) `pa-IN-VaaniNeural` (Vrouwelijk)

De enige stem in deze tabel is in het algemeen beschikbaar en ondersteunt alleen de taalinstelling 'en-IN'.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-IN`	Engels (India)	`en-IN-AashiNeural` (Vrouwelijk)

De vijf stemmen in deze tabel zijn algemeen beschikbaar en ondersteunen zowel de 'en-IN' als de 'hi-IN' locales.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-IN`	Engels (India)	`en-IN-AaravNeural` (Mannelijk) `en-IN-AnanyaNeural` (Vrouwelijk) `en-IN-KavyaNeural` (Vrouwelijk) `en-IN-KunalNeural` (Mannelijk) `en-IN-RehaanNeural` (Mannelijk)
`hi-IN`	Hindi (India)	`hi-IN-AaravNeural` (Mannelijk) `hi-IN-AnanyaNeural` (Vrouwelijk) `hi-IN-KavyaNeural` (Vrouwelijk) `hi-IN-KunalNeural` (Mannelijk) `hi-IN-RehaanNeural` (Mannelijk)

Spraakstijlen en -rollen

Toevoegde ondersteuning voor newscast, cheerful, empathetic stijlen voor de en-IN-NeerjaNeural en hi-IN-SwaraNeural stemmen.

Nieuwe stijlen toegevoegd voor de volgende stemmen:

es-MX-DaliaNeural: whispering, sadcheerful
fr-FR-DeniseNeural: whispering, sadexcited
it-IT-IsabellaNeural: whispering, sad, excited, cheerful
pt-PT-RaquelNeural: , whispering, sad
de-DE-ConradNeural: , sad, cheerful
en-GB-RyanNeural: , whispering, sad
es-MX-JorgeNeural: whispering, sad, excited, cheerful
fr-FR-HenriNeural: whispering, sadexcited
it-IT-DiegoNeural: sad, excitedcheerful
es-ES-AlvaroNeural: , cheerful, sad
ko-KR-InjoonNeural: sad

Zie de stemstijlen en -rollen voor meer informatie.

Release augustus 2024

Standaardstem

Introduceer nieuwe meertalige stemmen in openbare previewversie. Zie de volledige taal- en spraaklijst voor meer informatie.

Gloednieuwe meertalige stemmen

Lokatie	Taal	Geslacht	Spraaknaam
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-AdamMeertaligNeuraal
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-AmandaMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-DerekMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-LewisMultilingualNeural
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-LolaMultilingualNeural
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-PhoebeMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-SamuelMultilingualNeural
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-SerenaMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-DustinMultilingualNeural
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-EvelynMeertaligNeuraal
es-ES	Spaans (Spanje)	Mannelijk	es-ES-TristanMultilingualNeural
fr-FR	Frans (Frankrijk)	Mannelijk	fr-FR-LucienMeertaligeNeural
pt-BR	Portugees (Brazilië)	Mannelijk	pt-BR-MacerioMultilingualNeural
zh-CN	Chinees (Mandarijn, Vereenvoudigd)	Mannelijk	zh-CN-YunfanMeertaligeNeural
zh-CN	Chinees (Mandarijn, Vereenvoudigd)	Mannelijk	zh-CN-YunxiaoMultilingualNeural
zh-CN	Chinees (Mandarijn, Vereenvoudigd)	Mannelijk	zh-CN-YunyiMultilingualNeural

Monoculturele modellen bijgewerkt naar meertalige stemmen met verbeteringen in de natuurlijkheid

Lokatie	Taal	Geslacht	Spraaknaam
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-NancyMeertaligNeuraal
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-BrandonMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-ChristopherMeertaligNeuraal
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-CoraMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-DavisMultilingualNeural
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-SteffanMeertaligNeural
es-ES	Spaans (Spanje)	Vrouwelijk	es-ES-XimenaMultilingualNeural
it-IT	Italiaans (Italië)	Mannelijk	IT-GiuseppeMultilingualNeural
ko-KR	Koreaans (Korea)	Mannelijk	ko-KR-HyunsuMultilingualNeural

Verbeter de volgende meertalige stemmen tot een hogere kwaliteit.

Lokatie Taal Geslacht Spraaknaam

en-US Engels (Verenigde Staten) Mannelijk en-US-AndrewMultilingualNeural

en-US Engels (Verenigde Staten) Vrouwelijk en-US-AvaMultilingualNeural
Drie meertalige stemmen ondersteunen nu stijlen. Zie de stemstijlen en -rollen voor meer informatie.
- en-US-SerenaMultilingualNeural: empathetic, excited, friendly, shy, serious, relieved en sad.
- en-US-AndrewMultilingualNeural: empathetic en relieved.
- zh-CN-XiaoxiaoMultilingualNeural: affectionate, cheerful, empathetic, excited, poetry-reading, sorry, en story.

Lokatie	Taal	Geslacht	Spraaknaam
en-US	Engels (Verenigde Staten)	Mannelijk	en-US-AndrewMultilingualNeural
en-US	Engels (Verenigde Staten)	Vrouwelijk	en-US-AvaMultilingualNeural

juli 2024 uitgave

Avatar voor tekst-naar-spraak (GA)

Avatar voor tekst-naar-spraak is nu algemeen beschikbaar. Zie tekst-naar-spraak-avatar voor meer informatie.

Standaardstem

Introduceer 2 turboversies van de Azure OpenAI-stemmen in de openbare preview: en-US-AlloyTurboMultilingualNeural en en-US-NovaTurboMultilingualNeural. Turboversie van Azure OpenAI-stemmen heeft dezelfde stempersoon als Azure OpenAI-stemmen, maar biedt ondersteuning voor extra functies. Turbo-stemmen ondersteunen de volledige set SSML-elementen en meer functies, zoals woordgrens, net als andere Azure AI Speech-stemmen. Zie de volledige taal- en spraaklijst voor meer informatie.
Introduceer 2 nieuwe meertalige stemmen in openbare preview: zh-CN-YunfanMultilingualNeural en zh-CN-YunxiaoMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.

Ingesloten neurale stem

en-US-JennyMultilingual spraak wordt uitgebracht in productie en ondersteunt maximaal 24 lokale instellingen voor gebruikservaring op het apparaat. Zie de onderstaande tabel voor de ondersteunde landinstellingen.

Lokatie	Taal
`da-DK`	Deens (Denemarken)
`de-DE`	Duits (Duitsland)
`en-AU`	Engels (Australië)
`en-GB`	Engels (Verenigd Koninkrijk)
`en-IN`	Engels (India)
`en-US`	Engels (Verenigde Staten)
`es-ES`	Spaans (Spanje)
`es-MX`	Spaans (Mexico)
`fr-CA`	Frans (Canada)
`fr-FR`	Frans (Frankrijk)
`he-IL`	Hebreeuws (Israël)
`it-IT`	Italiaans (Italië)
`ja-JP`	Japanse taal (Japan)
`ko-KR`	Koreaans (Korea)
`nb-NO`	Noors Bokmål (Noorwegen)
`nl-NL`	Nederlands (Nederland)
`pl-PL`	Pools (Polen)
`pt-PT`	Portugees (Portugal)
`sv-SE`	Zweeds (Zweden)
`th-TH`	Thai (Thailand)
`tr-TR`	Turks (Turkije)
`zh-CN`	Chinees (Mandarijn, Vereenvoudigd)
`zh-HK`	Chinees (Kantonees, traditioneel)
`zh-TW`	Chinees (Taiwanese Mandarijn, Traditioneel)

Release van juni 2024

Standaardstem

Introductie van 6 nieuwe stemmen in openbare preview beschikbaar in specifieke regio's: Azië - oost, Azië - zuidoost, VS - oost, VS - west en India - centraal.

Lokatie	Taal	Tekst-naar-spraak-stemmen
`or-IN`	Odia (India)	`or-IN-SubhasiniNeural` (Vrouwelijk)
`or-IN`	Odia (India)	`or-IN-SukantNeural` (Mannelijk)
`pa-IN`	Punjabi (India)	`pa-IN-VaaniNeural` (Vrouwelijk)
`pa-IN`	Punjabi (India)	`pa-IN-OjasNeural` (Mannelijk)
`as-IN`	Assamees (India)	`as-IN-YashicaNeural` (Vrouwelijk)
`as-IN`	Assamees (India)	`as-IN-PriyomNeural` (Mannelijk)

Zie de volledige taal- en spraaklijst voor meer informatie.

Tekst-naar-spraak-avatar

Avatar voor tekst-naar-spraak ondersteunt nu de volgende regio's: Azië - zuidoost, Europa - noord, Europa - west, Zweden - centraal, VS - zuid-centraal en VS - west 2. Zie Regio's voor Speech-service voor meer informatie.

Uitgave van mei 2024

Persoonlijke stem (GA)

Persoonlijke stem is nu algemeen beschikbaar. Met persoonlijke stem kunt u binnen enkele seconden ai-gegenereerde replicatie van uw stem (of gebruikers van uw toepassing) krijgen. U geeft een spraakvoorbeeld van één minuut op als de audioprompt en gebruikt deze om spraak te genereren in een van de meer dan 90 talen die worden ondersteund in meer dan 100 landinstellingen. Zie het persoonlijke spraakoverzicht voor meer informatie.

Standaardstem

Introduceer 8 nieuwe meertalige stemmen in openbare preview: en-GB-AdaMultilingualNeural, en-GB-OllieMultilingualNeural, es-ES-ArabellaMultilingualNeural, es-ES-IsidoraMultilingualNeural, it-IT-AlessioMultilingualNeural, it-IT-IsabellaMultilingualNeural, it-IT-MarcelloMultilingualNeural, en pt-BR-ThalitaMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Introduceer 2 nieuwe en-US stemmen die zijn geoptimaliseerd voor een callcenter-scenario in openbare preview: en-US-LunaNeural en en-US-KaiNeural. Zie de volledige taal- en spraaklijst voor meer informatie.

Uitgave van april 2024

Tekst-naar-spraak-avatar

U kunt nu een statische achtergrondafbeelding instellen voor uw avatars. Als u deze functie wilt gebruiken, gebruikt u de avatarConfig.backgroundImage eigenschap en geeft u een URL op die verwijst naar de gewenste afbeelding. Zie De achtergrond bewerken voor meer informatie.

Uitgave maart 2024

Standaardstem

9 meertalige stemmen zijn algemeen beschikbaar in alle regio's: en-US-AvaMultilingualNeural, , en-US-AndrewMultilingualNeural, en-US-EmmaMultilingualNeural, en-US-BrianMultilingualNeuralde-DE-FlorianMultilingualNeural, de-DE-SeraphinaMultilingualNeural, , fr-FR-RemyMultilingualNeural, , , fr-FR-VivienneMultilingualNeuralen zh-CN-XiaoxiaoMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Introductie van een nieuwe meertalige stem in een openbare preview: ja-JP-MasaruMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Aanvullende updates:
- en-US-RyanMultilingualNeural is algemeen beschikbaar in alle regio's.
- en-US-JennyMultilingualV2Neural is algemeen beschikbaar in alle regio's, samengevoegd met en-US-JennyMultilingualNeural.
- Preview beschikbaar voor de bijgewerkte en-IN-NeerjaNeural en hi-IN-SwaraNeural met drie nieuwe stijlen in VS - oost, Europa - west en Azië - zuidoost.
- Preview beschikbaar voor nieuwe vrouwelijke stemmen in Centraal-India: en-IN-KavyaNeural, en-IN-AnanyaNeural, en-IN-AashiNeural, hi-IN-KavyaNeuralen hi-IN-AnanyaNeural.

Tekst-naar-spraak-avatar

Afhankelijkheid van ACS (Azure Communication Services) TURN verwijderd voor realtime avatar. De voorbeeldcode is dienovereenkomstig bijgewerkt om deze wijziging weer te geven.
Prijzen voor gepubliceerde tekst-naar-spraak-avatars. Zie de pagina met prijzen voor meer informatie. De prijzen van avatars zijn alleen zichtbaar voor serviceregio's waar de functie beschikbaar is.

Februari 2024 uitgave

OpenAI-stemmen

De Azure AI Speech-service ondersteunt OpenAI-tekst naar spraakstemmen in de volgende regio's: VS - noord-centraal en Zweden - centraal. Net zoals bij Azure AI Speech-stemmen zorgen OpenAI stem-syntheses voor hoogwaardige spraaksynthese die geschreven tekst omzet in natuurlijk klinkende gesproken audio. Dit biedt een breed scala aan mogelijkheden voor insluitende en interactieve gebruikerservaringen. Voor meer informatie, zie Wat zijn OpenAI-tekst-naar-spraakstemmen?.

Notitie

OpenAI-tekst naar spraakstemmen zijn ook beschikbaar in Azure OpenAI.
Met deze update hebben we de prijzen van standaardstemmen aangepast met Azure AI Speech. Bekijk hier de bijgewerkte prijzen.

Persoonlijke stem

De functie voor persoonlijke stem ondersteunt nu DragonLatestNeural en PhoenixLatestNeural modellen. Deze nieuwe modellen verbeteren de natuurlijkheid van gesynthetiseerde stemmen en lijken beter op de spraakkenmerken van de stem in de prompt. Raadpleeg Persoonlijke stem integreren in uw toepassing voor meer informatie.

December 2023 uitgave

Aangepaste spraak-API

De aangepaste spraak-API is beschikbaar voor het maken en beheren van professionele en persoonlijke aangepaste neurale spraakmodellen.

Aangepaste neurale stem

De nieuw getrainde spraakmodellen ondersteunen nu de samplefrequentie van 48 kHz, ongeacht de modelversie. Voor eerder getrainde spraakmodellen is het noodzakelijk om de engineversie te upgraden naar ten minste 2023.11.13.0 om de steekproefsnelheid te verbeteren tot 48 kHz.

Standaardstem

Introductie van nieuwe meertalige stemmen voor openbare preview:

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`de-DE`	Duits (Duitsland)	`de-DE-FlorianMultilingualNeural` (Mannelijk)
`de-DE`	Duits (Duitsland)	`de-DE-SeraphinaMultilingualNeural` (Vrouwelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-AvaMultilingualNeural` (Vrouwelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-EmmaMultilingualNeural` (Vrouwelijk)
`fr-FR`	Frans (Frankrijk)	`fr-FR-RemyMultilingualNeural` (Mannelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-BrianMultilingualNeural` (Mannelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-AndrewMultilingualNeural` (Mannelijk)
`fr-FR`	Frans (Frankrijk)	`fr-FR-VivienneMultilingualNeural` (Vrouwelijk)
`zh-CN`	Chinees (Mandarijn, Vereenvoudigd)	`zh-CN-XiaoxiaoMultilingualNeural` (Vrouwelijk)
`zh-CN`	Chinees (Mandarijn, Vereenvoudigd)	`zh-CN-XiaochenMultilingualNeural` (Vrouwelijk)
`zh-CN`	Chinees (Mandarijn, Vereenvoudigd)	`zh-CN-YunyiMultilingualNeural` (Mannelijk)

Introductie van nieuwe zh-CN-XiaoxiaoDialectsNeural stemmen voor openbare preview die ondersteuning bieden voor verschillende Chinese dialecten en accenten:

Stemnaam	Secundaire taal	Dialect/accent
`zh-CN-XiaoxiaoDialectsNeural`	`zh-CN-shaanxi`	Chinees (Zhongyuan Mandarijn Shaanxi, Vereenvoudigd)
	`zh-CN-sichuan`	Chinees (Zuidwestelijk Mandarijn, Vereenvoudigd)
	`zh-CN-shanxi`	Chinees (Mandarijn met Shanxi-accent, Vereenvoudigd)
	`nan-CN`	Chinees (Zuid-Min, Vereenvoudigd)
	`zh-CN-anhui`	Chinees (Jianghuai Mandarijn Anhui, Vereenvoudigd)
	`zh-CN-hunan`	Chinees (Hunan Accent Mandarin, Simplified)
	`zh-CN-gansu`	Chinees (Gansu, Lanyin Mandarijn, Vereenvoudigd)
	`zh-CN-shandong`	Chinees (Jilu Mandarijn, Vereenvoudigd)
	`zh-CN-henan`	Chinees (Zhongyuan Mandarijn Henan, Vereenvoudigd)
	`zh-CN-liaoning`	Chinees (Noordoostelijk Mandarijn, Vereenvoudigd)
	`zh-TW`	Chinees (Taiwanese Mandarijn, Traditioneel)

Release van november 2023

Persoonlijke stem

Persoonlijke stem is beschikbaar in preview in de volgende regio's: Europa - west, VS - oost en Azië - zuidoost. Met persoonlijke stem (preview) kunt u binnen een paar seconden ai-gegenereerde replicatie van uw stem (of gebruikers van uw toepassing) krijgen. U geeft een spraakvoorbeeld van één minuut op als de audioprompt en gebruikt deze om spraak te genereren in een van de meer dan 90 talen die worden ondersteund in meer dan 100 landinstellingen.

Zie persoonlijke stem voor meer informatie.

Tekst-naar-spraak-avatar

Avatar voor tekst-naar-spraak is beschikbaar in de preview-versie in de volgende regio's: VS - west 2, Europa - west en Azië - zuidoost.

Tekst-naar-spraak-avatar converteert tekst naar een digitale video van een fotorealistisch mens (een standaard avatar of een aangepaste tekst naar spraak avatar) die spreekt met een natuurlijke stem. De video van de tekst naar spraak-avatar kan asynchroon of in realtime worden gesynthetiseerd. Ontwikkelaars kunnen toepassingen bouwen die zijn geïntegreerd met tekst-naar-spraak-avatar via een API of een hulpprogramma voor het maken van inhoud in Speech Studio gebruiken om video-inhoud te maken zonder code te coderen.

Zie tekst-naar-spraak-avatar, transparantienotities en openbaarmaking voor stem- en avatartalent voor meer informatie.

Aangepaste neurale stem

Ondersteuning toegevoegd voor de 24 nieuwe lokale instellingen voor cross-linguale stem. Zie de volledige taallijst voor meer informatie.

Standaardstem

Introductie van nieuwe stemmen voor openbare preview:

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`de-DE`	Duits (Duitsland)	`SeraphinaNeural` (Vrouwelijk)
`es-ES`	Spaans (Spanje)	`XimenaNeural` (Vrouwelijk)
`fr-CA`	Frans (Canada)	`ThierryNeural` (Mannelijk)
`fr-FR`	Frans (Frankrijk)	`VivienneNeural` (Vrouwelijk)
`it-IT`	Italiaans (Italië)	`GiuseppeNeural` (Mannelijk)
`ko-KR`	Koreaans (Korea)	`HyunsuNeural` (Mannelijk)
`pt-BR`	Portugees (Brazilië)	`ThalitaNeural` (Vrouwelijk)

Modellen bijgewerkt met fouten die zijn opgelost en kwaliteitsverbetering:

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`es-ES`	Spaans (Spanje)	`AlvaroNeural` (Mannelijk)
`en-GB`	Engels (Verenigd Koninkrijk)	`RyanNeural` (Mannelijk)
`ko-KR`	Koreaans (Korea)	`InjoonNeural` (Mannelijk)

Zie de volledige taal- en spraaklijst voor meer informatie.

Versie van oktober 2023

Aangepaste neurale stem

Toegevoegde ondersteuning voor de 12 nieuwe lokalisaties met aangepaste neurale stem Pro. Zie de volledige taallijst voor meer informatie.

September 2023-uitgave

Standaardstem

Introductie van nieuwe stemmen voor openbare preview:

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-US`	Engels (Verenigde Staten)	`en-US-EmmaNeural` (Vrouwelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-AndrewNeural` (Mannelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-BrianNeural` (Mannelijk)

Zie de volledige taal- en spraaklijst voor meer informatie.

Ingesloten neurale stem

Alle 147 landinstellingen (behalve voor de taalcode fa-IR, Perzisch (Iran)) zijn standaard beschikbaar met ofwel 1 geselecteerde vrouwelijke stem en/of 1 geselecteerde mannelijke stem.

Release augustus 2023

Aangepaste neurale stem

De nieuwste CNV Lite trainingsreceptversie is nu uitgebracht. Deze release biedt verschillende verbeteringen aan de kwaliteit van uw taalmodellen. Probeer Speech Studio uit.

Juli 2023 uitgave

Aangepaste neurale stem

Spraak in meerdere stijlen is algemeen beschikbaar.
Er zijn twee nieuwe lokalisaties toegevoegd in openbare preview voor spraak in meerdere stijlen: ja-JP en zh-CN. Zie de volledige taal- en spraaklijst voor meer informatie. Raadpleeg de vooraf ingestelde stijllijst voor verschillende talen.
Cross-lingual voice is algemeen beschikbaar.
Er zijn twee nieuwe locale-instellingen toegevoegd voor taaloverschrijdende spraak: id-ID en nl-NL. Zie de volledige taal- en spraaklijst voor meer informatie.

Standaardstemmen

Introductie van nieuwe en-US genderneutrale stem voor openbare preview.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-US`	Engels (Verenigde Staten)	`en-US-BlueNeural` (Neutraal)

Introductie van nieuwe meertalige stemmen voor openbare preview:

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-US`	Engels (Verenigde Staten)	`en-US-JennyMultilingualV2Neural` (Vrouwelijk)
`en-US`	Engels (Verenigde Staten)	`en-US-RyanMultilingualNeural` (Mannelijk)

De meertalige stemmen en-US-JennyMultilingualV2Neural en en-US-RyanMultilingualNeural automatisch de taal van de invoertekst detecteren. U kunt het <lang> element echter nog steeds gebruiken om de spreektaal voor deze stemmen aan te passen.

Deze nieuwe meertalige stemmen kunnen spreken in 41 talen en accenten: Arabic (Egypt), Arabic (Saudi Arabia), Catalan, Czech (Czechia), Danish (Denmark), German (Austria), German (Switzerland), German (Germany), English (Australia), English (Canada), English (United Kingdom), English (Hong Kong SAR), English (Ireland), English (India), English (United States), Spanish (Spain), Spanish (Mexico), Finnish (Finland), French (Belgium), French (Canada), French (Switzerland), French (France), Hindi (India), Hungarian (Hungary), Indonesian (Indonesia), Italian (Italy), Japanese (Japan), Korean (Korea), Norwegian Bokmål (Norway), Dutch (Belgium), Dutch (Netherlands), Polish (Poland), Portuguese (Brazil), Portuguese (Portugal), Russian (Russia), Swedish (Sweden), Thai (Thailand), Turkish (Türkiye), Chinese (Mandarin, Simplified), Chinese (Cantonese, Traditional), Chinese (Taiwanese Mandarin, Traditional).

Deze meertalige stemmen ondersteunen bepaalde SSML-elementen niet volledig, zoals onderbreking, nadruk, stilte en sub.

Belangrijk

De en-US-JennyMultilingualV2Neural stem wordt tijdelijk in openbare preview aangeboden voor evaluatiedoeleinden. Deze wordt in de toekomst verwijderd.

Als u in een andere taal dan Engels wilt spreken, moet u voor de huidige implementatie van de en-US-JennyMultilingualNeural stem het <lang xml:lang> element instellen. We verwachten dat in Q4 van het kalenderjaar 2023 de en-US-JennyMultilingualNeural stem zal worden bijgewerkt om te spreken in de taal van de invoertekst zonder het <lang xml:lang> element. Dit zal in overeenstemming zijn met de en-US-JennyMultilingualV2Neural stem.

Maak kennis met nieuwe functies in openbare preview voor onderstaande stemmen:

Latijnse invoer toegevoegd voor Servische stemmen sr-RS (Servië): sr-latn-RS-SophieNeural en sr-latn-RS-NicholasNeural.
Engelse uitspraakondersteuning toegevoegd voor Albanese stemmen sq-AL (Albanië): sq-AL-AnilaNeural en sq-AL-IlirNeural.

Versie van mei 2023

Audio-inhoud maken

Alle standaardstemmen met spreekstijlen en aangepaste stemmen met meerdere stijlen ondersteunen aanpassing van stijlgraden.
U kunt nu de uitspraak van een woord oplossen door het woord te spreken en op te nemen. De fonemen kunnen automatisch worden herkend vanuit uw opname. De functie Recognize by speaking is nu beschikbaar als openbare preview.

Uitgave van april 2023

Standaardstemmen

De volgende functies van deze stemmen zijn verplaatst van openbare preview naar algemene beschikbaarheid:

Stijl	Tekst-naar-spraak-stemmen
style="chat"	`en-GB-RyanNeural`, `es-MX-JorgeNeural` en `it-IT-IsabellaNeural`
style="vrolijk"	`en-GB-RyanNeural`, , `en-GB-SoniaNeurales-MX-JorgeNeural`, `fr-FR-DeniseNeural`, , , en `fr-FR-HenriNeuralit-IT-IsabellaNeural`
stijl="verdrietig"	`en-GB-SoniaNeural`, `fr-FR-DeniseNeural` en `fr-FR-HenriNeural`

Verbeter de Engelse uitspraak voor hi-IN, ta-IN en te-IN stemmen, nu beschikbaar in openbare previewregio's.

Zie de taal- en spraaklijst voor meer informatie.

Maart 2023 release

Nieuwe functies

Speech Synthesis Markup Language (SSML) wordt bijgewerkt ter ondersteuning van audio-effectprocessorelementen die de kwaliteit van de gesynthetiseerde spraakuitvoer optimaliseren voor specifieke scenario's op apparaten. Meer informatie over spraaksynthesemarkeringen.

Aangepaste neurale stem

Ondersteuning toegevoegd voor de nl-BE landinstelling met Custom Neural Voice Pro. Zie de volledige taal- en spraaklijst voor meer informatie.

Standaardstemmen

De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-AU`	Engels (Australië)	`en-AU-AnnetteNeural` (Vrouwelijk) `en-AU-CarlyNeural` (Vrouwelijk) `en-AU-DarrenNeural` (Mannelijk) `en-AU-DuncanNeural` (Mannelijk) `en-AU-ElsieNeural` (Vrouwelijk) `en-AU-FreyaNeural` (Vrouwelijk) `en-AU-JoanneNeural` (Vrouwelijk) `en-AU-KenNeural` (Mannelijk) `en-AU-KimNeural` (Vrouwelijk) `en-AU-NeilNeural` (Mannelijk) `en-AU-TimNeural` (Mannelijk) `en-AU-TinaNeural` (Vrouwelijk) `en-AU-WilliamNeural` (Mannelijk)
`en-GB`	Engels (Verenigd Koninkrijk)	`en-GB-RyanNeural` (Mannelijk) `en-GB-SoniaNeural` (Vrouwelijk)
`es-ES`	Spaans (Spanje)	`es-ES-AbrilNeural` (Vrouwelijk) `es-ES-ArnauNeural` (Mannelijk) `es-ES-DarioNeural` (Mannelijk) `es-ES-EliasNeural` (Mannelijk) `es-ES-EstrellaNeural` (Vrouwelijk) `es-ES-IreneNeural` (Vrouwelijk) `es-ES-LaiaNeural` (Vrouwelijk) `es-ES-LiaNeural` (Vrouwelijk) `es-ES-NilNeural` (Mannelijk) `es-ES-SaulNeural` (Mannelijk) `es-ES-TeoNeural` (Mannelijk) `es-ES-TrianaNeural` (Vrouwelijk) `es-ES-VeraNeural` (Vrouwelijk)
`es-MX`	Spaans (Mexico)	`es-MX-JorgeNeural` (Mannelijk)
`fr-FR`	Frans (Frankrijk)	`fr-FR-HenriNeural` (Mannelijk)
`it-IT`	Italiaans (Italië)	`it-IT-IsabellaNeural` (Vrouwelijk)
`ja-JP`	Japanse taal (Japan)	`ja-JP-AoiNeural` (Vrouwelijk) `ja-JP-DaichiNeural` (Mannelijk) `ja-JP-MayuNeural` (Vrouwelijk) `ja-JP-NaokiNeural` (Mannelijk) `ja-JP-ShioriNeural` (Vrouwelijk)

Ondersteuning toegevoegd voor de cheerful stijl met de de-DE-ConradNeural stem.

Februari 2023 uitgave

Standaardstemmen

De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`zh-CN`	Chinees (Mandarijn, Vereenvoudigd)	`zh-CN-XiaomengNeural` (Vrouwelijk) `zh-CN-XiaoyiNeural` (Vrouwelijk) `zh-CN-XiaozhenNeural` (Vrouwelijk) `zh-CN-YunfengNeural` (Mannelijk) `zh-CN-YunhaoNeural` (Mannelijk) `zh-CN-YunjianNeural` (Mannelijk) `zh-CN-YunxiaNeural` (Mannelijk) `zh-CN-YunzeNeural` (Mannelijk)
`zh-CN-henan`	Chinees (Zhongyuan Mandarijn Henan, Vereenvoudigd)	`zh-CN-henan-YundengNeural` (Mannelijk)

Uitgave van december 2022

REST API voor batchsynthese (Preview)

De Batch-synthese-API is momenteel beschikbaar als openbare preview. Zodra deze algemeen beschikbaar is, wordt de Long Audio-API afgeschaft. Zie Migreren naar batchsynthese-API voor meer informatie.

November 2022 uitgave

Standaardstemmen (GA)

De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`es-MX`	Spaans (Mexico)	`es-MX-BeatrizNeural` (Vrouwelijk) `es-MX-CandelaNeural` (Vrouwelijk) `es-MX-CarlotaNeural` (Vrouwelijk) `es-MX-CecilioNeural` (Mannelijk) `es-MX-GerardoNeural` (Mannelijk) `es-MX-LarissaNeural` (Vrouwelijk) `es-MX-LibertoNeural` (Mannelijk) `es-MX-LucianoNeural` (Mannelijk) `es-MX-MarinaNeural` (Vrouwelijk) `es-MX-NuriaNeural` (Vrouwelijk) `es-MX-PelayoNeural` (Mannelijk) `es-MX-RenataNeural` (Vrouwelijk) `es-MX-YagoNeural` (Mannelijk)
`it-IT`	Italiaans (Italië)	`it-IT-BenignoNeural` (Mannelijk) `it-IT-CalimeroNeural` (Mannelijk) `it-IT-CataldoNeural` (Mannelijk) `it-IT-FabiolaNeural` (Vrouwelijk) `it-IT-FiammaNeural` (Vrouwelijk) `it-IT-GianniNeural` (Mannelijk) `it-IT-ImeldaNeural` (Vrouwelijk) `it-IT-IrmaNeural` (Vrouwelijk) `it-IT-LisandroNeural` (Mannelijk) `it-IT-PalmiraNeural` (Vrouwelijk) `it-IT-PierinaNeural` (Vrouwelijk) `it-IT-RinaldoNeural` (Mannelijk)
`pt-BR`	Portugees (Brazilië)	`pt-BR-BrendaNeural` (Vrouwelijk) `pt-BR-DonatoNeural` (Mannelijk) `pt-BR-ElzaNeural` (Vrouwelijk) `pt-BR-FabioNeural` (Mannelijk) `pt-BR-GiovannaNeural` (Vrouwelijk) `pt-BR-HumbertoNeural` (Mannelijk) `pt-BR-JulioNeural` (Mannelijk) `pt-BR-LeilaNeural` (Vrouwelijk) `pt-BR-LeticiaNeural` (Vrouwelijk) `pt-BR-ManuelaNeural` (Vrouwelijk) `pt-BR-NicolauNeural` (Mannelijk) `pt-BR-ValerioNeural` (Mannelijk) `pt-BR-YaraNeural` (Vrouwelijk)

Aangepaste neurale stem

De volgende landinstellingsondersteuning wordt toegevoegd voor aangepaste neurale spraak. Zie de volledige taal- en spraaklijst voor meer informatie.

Ondersteuning toegevoegd voor de fr-BE taalinstelling met op maat gemaakte neurale stem Pro.
Ondersteuning toegevoegd voor de es-ES taalinstelling met aangepaste lichte neurale spraak.

Release van oktober 2022

Standaardstemmen (GA)

De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`eu-ES`	Baskisch	`eu-ES-AinhoaNeural` (Vrouwelijk) `eu-ES-AnderNeural` (Mannelijk)
`hy-AM`	Armeens (Armenië)	`hy-AM-AnahitNeural` (Vrouwelijk) `hy-AM-HaykNeural` (Mannelijk)

Standaardstemmen (voorbeeldweergave)

De volgende stemmen zijn nu beschikbaar in openbare preview. Zie de volledige taal- en spraaklijst voor meer informatie.

Taalinstelling (BCP-47)	Taal	Tekst-naar-spraak-stemmen
`en-AU`	Engels (Australië)	`en-AU-AnnetteNeural`(Vrouwelijk) `en-AU-CarlyNeural`(Vrouwelijk) `en-AU-DarrenNeural`(Mannelijk) `en-AU-DuncanNeural`(Mannelijk) `en-AU-ElsieNeural`(Vrouwelijk) `en-AU-FreyaNeural`(Vrouwelijk) `en-AU-JoanneNeural`(Vrouwelijk) `en-AU-KenNeural`(Mannelijk) `en-AU-KimNeural`(Vrouwelijk) `en-AU-NeilNeural`(Mannelijk) `en-AU-TimNeural`(Mannelijk) `en-AU-TinaNeural`(Vrouwelijk)
`es-ES`	Spaans (Spanje)	`es-ES-AbrilNeural`(Vrouwelijk) `es-ES-AlvaroNeural`(Mannelijk) `es-ES-ArnauNeural`(Mannelijk) `es-ES-DarioNeural`(Mannelijk) `es-ES-EliasNeural`(Mannelijk) `es-ES-EstrellaNeural`(Vrouwelijk) `es-ES-IreneNeural`(Vrouwelijk) `es-ES-LaiaNeural`(Vrouwelijk) `es-ES-LiaNeural`(Vrouwelijk) `es-ES-NilNeural`(Mannelijk) `es-ES-SaulNeural`(Mannelijk) `es-ES-TeoNeural`(Mannelijk) `es-ES-TrianaNeural`(Vrouwelijk) `es-ES-VeraNeural`(Vrouwelijk)
`ja-JP`	Japanse taal (Japan)	`ja-JP-AoiNeural`(Vrouwelijk) `ja-JP-DaichiNeural`(Mannelijk) `ja-JP-MayuNeural`(Vrouwelijk) `ja-JP-NaokiNeural`(Mannelijk) `ja-JP-ShioriNeural`(Vrouwelijk)
`ko-KR`	Koreaans (Korea)	`ko-KR-BongJinNeural`(Mannelijk) `ko-KR-GookMinNeural`(Mannelijk) `ko-KR-JiMinNeural`(Vrouwelijk) `ko-KR-SeoHyeonNeural`(Vrouwelijk) `ko-KR-SoonBokNeural`(Vrouwelijk) `ko-KR-YuJinNeural`(Vrouwelijk)
`wuu-CN`	Chinees (Wu, Vereenvoudigd)	`wuu-CN-XiaotongNeural` (Vrouwelijk) `wuu-CN-YunzheNeural` (Mannelijk)
`yue-CN`	Chinees (Kantonees, Vereenvoudigd)	`yue-CN-XiaoMinNeural` (Vrouwelijk) `yue-CN-YunSongNeural` (Mannelijk)

Algemene TTS-spraakupdates

Verbeterde kwaliteit voor de fil-PH-AngeloNeural en fil-PH-BlessicaNeural stemmen.
Tekstnormalisatieregels worden bijgewerkt voor stemmen met de es-CL Spaanse (Chili) en uz-UZ Oezbeekse taalinstellingen.
Engelse letteruitspraak toegevoegd voor stemmen met de sq-AL Albanese en az-AZ Azerbeidzjaanse locaties.
Verbeterde Engelse uitspraak voor de zh-HK-WanLungNeural stem.
Verbeterde vraagtoon voor de nl-NL-MaartenNeural en pt-BR-AntonioNeural stemmen.
Ondersteuning toegevoegd voor de <lang ="en-US"> tag voor betere Engelse uitspraak met de volgende stemmen: de-DE-ConradNeural, , de-DE-KatjaNeural, es-ES-AlvaroNeurales-MX-DaliaNeural, es-MX-JorgeNeural, fr-CA-SylvieNeural, , fr-FR-DeniseNeural, , fr-FR-HenriNeural, en it-IT-DiegoNeuralit-IT-IsabellaNeural.
Er is ondersteuning toegevoegd voor de style="chat" tag met de volgende stemmen: en-GB-RyanNeural, es-MX-JorgeNeuralen it-IT-IsabellaNeural.
Er is ondersteuning toegevoegd voor de style="cheerful" tag met de volgende stemmen: en-GB-RyanNeural, en-GB-SoniaNeural, es-MX-JorgeNeural, fr-FR-DeniseNeural, en fr-FR-HenriNeuralit-IT-IsabellaNeural.
Er is ondersteuning toegevoegd voor de style="sad" tag met de volgende stemmen: en-GB-SoniaNeuralen fr-FR-DeniseNeuralfr-FR-HenriNeural.

Release van september 2022

Standaardstem

Alle standaardstemmen zijn geüpgraded naar hoogwaardige stemmen met een samplefrequentie van 48 kHz.

Release augustus 2022

Standaardstem

Nieuwe stemmen vrijgegeven in publieke preview.

Stemmen voor Engels (Verenigde Staten): en-US-AIGenerate1Neural en en-US-AIGenerate2Neural.
Stemmen voor Chinese regionale talen: zh-CN-henan-YundengNeural, zh-CN-shaanxi-XiaoniNeuralen zh-CN-shandong-YunxiangNeural.

Zie de taal- en spraaklijst voor meer informatie.

Uitgave juli 2022

Standaardstem

5 nieuwe stemmen van zh-CN Chinees (Mandarijn, Vereenvoudigd) en 1 nieuwe stem van en-US Engels (Verenigde Staten) toegevoegd in openbare preview. Bekijk de volledige taal en spraaklijst.

Taal	Lokatie	Geslacht	Spraaknaam	Stijlondersteuning
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN`	Vrouwelijk	`zh-CN-XiaomengNeural` ^Nieuw	Algemeen, meerdere stijlen beschikbaar met SSML
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN`	Vrouwelijk	`zh-CN-XiaoyiNeural` ^Nieuw	Algemeen, meerdere stijlen beschikbaar met SSML
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN`	Vrouwelijk	`zh-CN-XiaozhenNeural` ^Nieuw	Algemeen, meerdere stijlen beschikbaar met SSML
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN`	Mannelijk	`zh-CN-YunxiaNeural` ^Nieuw	Algemeen, meerdere stijlen beschikbaar met SSML
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN`	Mannelijk	`zh-CN-YunzeNeural` ^Nieuw	Algemeen, meerdere stijlen beschikbaar met SSML
Engels (Verenigde Staten)	`en-US`	Mannelijk	`en-US-RogerNeural` ^Nieuw	Algemeen

Ondersteunde stijlen en rollen voor de toegevoegde neurale stemmen.

Spraak	Stijlen	Stijlniveau	Rollen
zh-CN-XiaomengNeural ^{Openbare preview}	`chat`	Ondersteund
zh-CN-XiaoyiNeural ^{Openbare preview}	`affectionate`, `angry`, `cheerful`, `disgruntled`, `embarrassed`, `fearful`, `gentle`, `sad`, `serious`	Ondersteund
zh-CN-XiaozhenNeural ^{Openbare preview}	`angry`, `cheerful`, `disgruntled`, `fearful`, `sad`, `serious`	Ondersteund
zh-CN-YunxiaNeural ^{Openbare preview}	`angry` `calm`, `cheerful`, `fearfulsad`	Ondersteund
zh-CN-YunzeNeural ^{Openbare preview}	`angry`, `calm`, `cheerful`, `depressed`, `disgruntled`, `documentary-narration`, `fearful`, `sad`, `serious`	Ondersteund	Ondersteund

Gezichtspositie verkrijgen met viseme

Ondersteuning toegevoegd voor blendshapes om de gezichtsbewegingen van een 3D-personage dat u hebt ontworpen aan te sturen. Meer informatie over hoe u gezichtspositie krijgt met viseme.
SSML is bijgewerkt ter ondersteuning van het viseme-element. Zie markeringen voor spraaksynthese.

Release van juni 2022

Standaardstem

Er zijn 9 nieuwe talen en varianten toegevoegd voor neurale tekst naar spraak:

Taal	Lokatie	Geslacht	Spraaknaam	Stijlondersteuning
Arabisch (Libanon)	`ar-LB`	Vrouwelijk	`ar-LB-LaylaNeural` ^Nieuw	Algemeen
Arabisch (Libanon)	`ar-LB`	Mannelijk	`ar-LB-RamiNeural` ^Nieuw	Algemeen
Arabisch (Oman)	`ar-OM`	Vrouwelijk	`ar-OM-AyshaNeural` ^Nieuw	Algemeen
Arabisch (Oman)	`ar-OM`	Mannelijk	`ar-OM-AbdullahNeural` ^Nieuw	Algemeen
Azerbeidzjaans (Azerbeidzjan)	`az-AZ`	Vrouwelijk	`az-AZ-BabekNeural` ^Nieuw	Algemeen
Azerbeidzjaans (Azerbeidzjan)	`az-AZ`	Mannelijk	`az-AZ-BanuNeural` ^Nieuw	Algemeen
Bosnisch (Bosnië en Herzegovina)	`bs-BA`	Vrouwelijk	`bs-BA-VesnaNeural` ^Nieuw	Algemeen
Bosnisch (Bosnië en Herzegovina)	`bs-BA`	Mannelijk	`bs-BA-GoranNeural` ^Nieuw	Algemeen
Georgisch (Georgië)	`ka-GE`	Vrouwelijk	`ka-GE-EkaNeural` ^Nieuw	Algemeen
Georgisch (Georgië)	`ka-GE`	Mannelijk	`ka-GE-GiorgiNeural` ^Nieuw	Algemeen
Mongools (Mongolië)	`mn-MN`	Vrouwelijk	`mn-MN-YesuiNeural` ^Nieuw	Algemeen
Mongools (Mongolië)	`mn-MN`	Mannelijk	`mn-MN-BataaNeural` ^Nieuw	Algemeen
Nepalee (Nepalee)	`ne-NP`	Vrouwelijk	`ne-NP-HemkalaNeural` ^Nieuw	Algemeen
Nepalee (Nepalee)	`ne-NP`	Mannelijk	`ne-NP-SagarNeural` ^Nieuw	Algemeen
Albanees (Albanië)	`sq-AL`	Vrouwelijk	`sq-AL-AnilaNeural` ^Nieuw	Algemeen
Albanees (Albanië)	`sq-AL`	Mannelijk	`sq-AL-IlirNeural` ^Nieuw	Algemeen
Tamil (Maleisië)	`ta-MY`	Vrouwelijk	`ta-MY-KaniNeural` ^Nieuw	Algemeen
Tamil (Maleisië)	`ta-MY`	Mannelijk	`ta-MY-SuryaNeural` ^Nieuw	Algemeen

GA 36 stemmen in publieke preview voor en-GB Engels (Verenigd Koninkrijk), fr-FR Frans (Frankrijk) en de-DE Duits (Duitsland):

Taal	Lokatie	Geslacht	Spraaknaam	Stijlondersteuning
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-AbbiNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-BellaNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-HollieNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-MaisieNeural`	Algemene, kinderstem
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-OliviaNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-SoniaNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-AlfieNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-ElliotNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-EthanNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-NoahNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-OliverNeural`	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-ThomasNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-BrigitteNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-CelesteNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-CoralieNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-EloiseNeural`	Algemene, kinderstem
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-JacquelineNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-JosephineNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-YvetteNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-AlainNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-ClaudeNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-JeromeNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-MauriceNeural`	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-YvesNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-AmalaNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-ElkeNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-GiselaNeural`	Algemene, kinderstem
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-KlarissaNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-LouisaNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-MajaNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-TanjaNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-BerndNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-ChristophNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-KasperNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-KillianNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-KlausNeural`	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-RalfNeural`	Algemeen

Er zijn 40 nieuwe stemmen toegevoegd voor es-MX Spaans (Mexico), it-IT Italiaans (Italië), pt-BR Portugees (Brazilië) en 2 accenten voor zh-CN Chinees (Mandarijn, Vereenvoudigd) in openbare preview:

Taal	Lokatie	Geslacht	Spraaknaam	Stijlondersteuning
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-BeatrizNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-CarlotaNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-NuriaNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-RenataNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-LarissaNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-CandelaNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Vrouwelijk	`es-MX-MarinaNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Vrouwelijk	`it-IT-FiammaNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Vrouwelijk	`it-IT-IrmaNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Vrouwelijk	`it-IT-FabiolaNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Vrouwelijk	`it-IT-PalmiraNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Vrouwelijk	`it-IT-ImeldaNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Vrouwelijk	`it-IT-PierinaNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-ElzaNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-ManuelaNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-BrendaNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-LeilaNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-YaraNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-GiovannaNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Vrouwelijk	`pt-BR-LeticiaNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Mannelijk	`es-MX-CecilioNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Mannelijk	`es-MX-LibertoNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Mannelijk	`es-MX-LucianoNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Mannelijk	`es-MX-PelayoNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Mannelijk	`es-MX-YagoNeural` ^Nieuw	Algemeen
Spaans (Mexico)	`es-MX`	Mannelijk	`es-MX-GerardoNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Mannelijk	`it-IT-BenignoNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Mannelijk	`it-IT-CataldoNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Mannelijk	`it-IT-LisandroNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Mannelijk	`it-IT-CalimeroNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Mannelijk	`it-IT-RinaldoNeural` ^Nieuw	Algemeen
Italiaans (Italië)	`it-IT`	Mannelijk	`it-IT-GianniNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Mannelijk	`pt-BR-DonatoNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Mannelijk	`pt-BR-HumbertoNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Mannelijk	`pt-BR-FabioNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Mannelijk	`pt-BR-JulioNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Mannelijk	`pt-BR-ValerioNeural` ^Nieuw	Algemeen
Portugees (Brazilië)	`pt-BR`	Mannelijk	`pt-BR-NicolauNeural` ^Nieuw	Algemeen
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN-sichuan`	Mannelijk	`zh-CN-sichuan-YunxiSichuanNeural` ^Nieuw	Algemeen, Sichuan-accent
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN-liaoning`	Vrouwelijk	`zh-CN-liaoning-XiaobeiNeural` ^Nieuw	Algemeen, accent uit Liaoning-regio

Verbeterde kwaliteit voor en-SG-LunaNeural en en-SG-WayneNeural
48kHz-uitvoerondersteuning voor publieke preview met en-US-JennyNeural, en-US-AriaNeural en zh-CN-XiaoxiaoNeural

Aangepaste neurale stem

Ingeschakeld om gegevensproblemen online op te lossen. Meer informatie over het oplossen van gegevensproblemen in Speech Studio.
Toegevoegde versie van het trainingsrecept. Meer informatie over het selecteren van de versie van het trainingsrecept voor uw spraakmodel.

Hulpprogramma voor het maken van audio-inhoud

Ondersteunde paginering.
Ingeschakeld om globaal te sorteren op naam, bestandstype en updatetijd op werkbestandspagina.

mei 2022 uitgave

Standaardstem

Vijf nieuwe stemmen uitgebracht in openbare proefversie met meerdere stijlen om de variëteit in Amerikaans Engels te verrijken. Bekijk de volledige taal en spraaklijst.
Ondersteun deze nieuwe stijlen Angry, Excited, Friendly, Hopeful, Sad, Shouting, Unfriendly, Terrified en Whispering in openbare preview voor en-US-AriaNeural.
Ondersteuning voor deze nieuwe stijlen Angry, Cheerful, Excited, Friendly, Hopeful, Sad, Shouting, Unfriendly, Terrified en Whispering in openbare preview voor en-US-GuyNeural, en-US-JennyNeural.
Ondersteun deze nieuwe stijlen Excited, Friendly, Hopeful, Shouting, Unfriendly, Terrified en Whispering in openbare preview voor en-US-SaraNeural. Toonstijlen en -rollen bekijken.
Nieuwe stemmen zh-CN-YunjianNeural, zh-CN-YunhaoNeural en zh-CN-YunfengNeural uitgebracht in openbare preview. Bekijk de volledige taal en spraaklijst.
Ondersteuning voor twee nieuwe stijlen sports-commentary, sports-commentary-excited in de openbare preview voor zh-CN-YunjianNeural. Toonstijlen en -rollen bekijken.
Ondersteun 1 nieuwe stijl advertisement-upbeat in openbare preview voor zh-CN-YunhaoNeural. Toonstijlen en -rollen bekijken.
De stijlen cheerful en sad voor fr-FR-DeniseNeural zijn algemeen beschikbaar in alle regio's.
SSML is bijgewerkt ter ondersteuning van MathML-elementen voor en-US- en en-AU-stemmen. Meer informatie over spraaksynthesemarkeringen.

Aangepaste neurale stem

Ingeschakeld om de training te annuleren tijdens het trainen van het spraakmodel. Meer informatie over het annuleren van training.
Ingeschakeld om het model te klonen (naam van spraakmodel wijzigen). Meer informatie over het wijzigen van de naam van uw spraakmodel.
Ingeschakeld om uw spraakmodel te testen door uw eigen testscript toe te voegen. Meer informatie over het uploaden van uw testscript.
Ingeschakeld om de engineversie voor uw stemmodel bij te werken. Meer informatie over het bijwerken van de versie van de model-engine.
Ondersteunde meer trainingsregio's. Zie regioondersteuning.
Ondersteunde 10 locale-instellingen voor aangepaste neurale stem lite (preview). Zie taalondersteuning.

Hulpprogramma voor het maken van audio-inhoud

Ingeschakeld om het hulpprogramma Audio-inhoud maken uit te proberen zonder u aan te melden.
Verbeterde indeling voor het aanpassen van fonemen.
Verbeterde prestaties: geef het maximum aantal (200) bestanden op dat tegelijk moet worden geüpload.
Verbeterde prestaties: geef het maximale niveau van de directorydiepte (5 niveaus) op.

Maart 2022 release

Standaardstem

Ondersteuning toegevoegd in openbare preview voor de Cheerful en Sad stijlen met fr-FR-DeniseNeural. Toonstijlen en -rollen bekijken.
De standaardstemmen voor losgekoppelde containers zijn beschikbaar gesteld in openbare preview. Zie Docker-containers gebruiken in niet-verbonden omgevingen.

Aangepaste neurale stem

Ondersteund op rollen gebaseerd toegangsbeheer. Meer informatie over op rollen gebaseerd toegangsbeheer van Azure in Speech Studio
Ondersteunde privé-eindpunten en service-eindpunten voor virtuele netwerken. Meer informatie over het gebruik van privé-eindpunten met spraakservice.

Hulpprogramma voor het maken van audio-inhoud

De bestandsgrootte en gelijktijdigheidslimiet bijgewerkt voor F0-resources (free-tier) om de ervaring consistent te maken met de Speech SDK en API's. Bekijk quota en limieten voor spraakservices.

Februari 2022 uitgave

Aangepaste neurale stem

Aanpasbare neurale stem lite uitgebracht in openbare preview. Leer meer over wat custom neural voice lite is.
Uitgebreide taalondersteuning voor 49 landinstellingen. Zie taalondersteuning.
Meer regio's/datacenters worden ondersteund. Zie regioondersteuning.

Hulpprogramma voor het maken van audio-inhoud

De uitvoerlengtelimiet voor het downloaden van audio's is verwijderd.

Uitgave januari 2022

Nieuwe talen en stemmen

Er zijn 10 nieuwe talen en varianten toegevoegd voor neurale tekst naar spraak:

Taal	Lokatie	Geslacht	Spraaknaam	Stijlondersteuning
Bengaals (India)	`bn-IN`	Vrouwelijk	`bn-IN-TanishaaNeural` ^Nieuw	Algemeen
Bengaals (India)	`bn-IN`	Mannelijk	`bn-IN-BashkarNeural` ^Nieuw	Algemeen
IJslands (IJsland)	`is-IS`	Vrouwelijk	`is-IS-GudrunNeural` ^Nieuw	Algemeen
IJslands (IJsland)	`is-IS`	Mannelijk	`is-IS-GunnarNeural` ^Nieuw	Algemeen
Kannada (India)	`kn-IN`	Vrouwelijk	`kn-IN-SapnaNeural` ^Nieuw	Algemeen
Kannada (India)	`kn-IN`	Mannelijk	`kn-IN-GaganNeural` ^Nieuw	Algemeen
Kazachs (Kazakhstan)	`kk-KZ`	Vrouwelijk	`kk-KZ-AigulNeural` ^Nieuw	Algemeen
Kazachs (Kazakhstan)	`kk-KZ`	Mannelijk	`kk-KZ-DauletNeural` ^Nieuw	Algemeen
Lao (Laos)	`lo-LA`	Vrouwelijk	`lo-LA-KeomanyNeural` ^Nieuw	Algemeen
Lao (Laos)	`lo-LA`	Mannelijk	`lo-LA-ChanthavongNeural` ^Nieuw	Algemeen
Macedonisch (Republiek Noord-Macedonië)	`mk-MK`	Vrouwelijk	`mk-MK-MarijaNeural` ^Nieuw	Algemeen
Macedonisch (Republiek Noord-Macedonië)	`mk-MK`	Mannelijk	`mk-MK-AleksandarNeural` ^Nieuw	Algemeen
Malayalam (India)	`ml-IN`	Vrouwelijk	`ml-IN-SobhanaNeural` ^Nieuw	Algemeen
Malayalam (India)	`ml-IN`	Mannelijk	`ml-IN-MidhunNeural` ^Nieuw	Algemeen
Pashto (Afghanistan)	`ps-AF`	Vrouwelijk	`ps-AF-LatifaNeural` ^Nieuw	Algemeen
Pashto (Afghanistan)	`ps-AF`	Mannelijk	`ps-AF-GulNawazNeural` ^Nieuw	Algemeen
Servisch (Servië, Cyrillisch)	`sr-RS`	Vrouwelijk	`sr-RS-SophieNeural` ^Nieuw	Algemeen
Servisch (Servië, Cyrillisch)	`sr-RS`	Mannelijk	`sr-RS-NicholasNeural` ^Nieuw	Algemeen
Sinhala (Sri Lanka)	`si-LK`	Vrouwelijk	`si-LK-ThiliniNeural` ^Nieuw	Algemeen
Sinhala (Sri Lanka)	`si-LK`	Mannelijk	`si-LK-SameeraNeural` ^Nieuw	Algemeen

Zie Taalondersteuning voor de volledige lijst met beschikbare stemmen.

Nieuwe stemmen in voorvertoning

Nieuwe stemmen toegevoegd voor en-GB, fr-FR en de-DE in preview:

Taal	Lokatie	Geslacht	Spraaknaam	Stijlondersteuning
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-AbbiNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-BellaNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-HollieNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Vrouwelijk	`en-GB-OliviaNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Meisje	`en-GB-MaisieNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-AlfieNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-ElliotNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-EthanNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-NoahNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-OliverNeural` ^Nieuw	Algemeen
Engels (Verenigd Koninkrijk)	`en-GB`	Mannelijk	`en-GB-ThomasNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-BrigitteNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-CelesteNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-CoralieNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-JacquelineNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-JosephineNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Vrouwelijk	`fr-FR-YvetteNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Meisje	`fr-FR-EloiseNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-AlainNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-ClaudeNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-JeromeNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-MauriceNeural` ^Nieuw	Algemeen
Frans (Frankrijk)	`fr-FR`	Mannelijk	`fr-FR-YvesNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-AmalaNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-ElkeNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-KlarissaNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-LouisaNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-MajaNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Vrouwelijk	`de-DE-TanjaNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Meisje	`de-DE-GiselaNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-BerndNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-ChristophNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-KasperNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-KillianNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-KlausNeural` ^Nieuw	Algemeen
Duits (Duitsland)	`de-DE`	Mannelijk	`de-DE-RalfNeural` ^Nieuw	Algemeen

Zie Taalondersteuning voor de volledige lijst met beschikbare stemmen.

Nauwkeurigheid van uitspraak

Verbeterde Engelse woorduitspraak voor alle he-IL stemmen.
Verbeterde uitspraaknauwkeurigheid op woordniveau voor cs-CZ en da-DK.
Verbeterde Arabische diakritische tekens en Hebreeuwse Nikud-verwerking.
Verbeterde entiteitsleesing voor ja-JP

Spraakstudio

Aangepaste neurale spraak: aanvullende modeltests ingeschakeld met behulp van de batch-API (lange audio-API)
Audio-inhoud maken: meer uitvoerindelingen inschakelen

Release van oktober 2021

Nieuwe talen en stemmen

Er zijn 49 nieuwe talen en 98 stemmen toegevoegd voor neurale tekst naar spraak:

Adri in af-ZA Afrikaans (Zuid-Afrika), Willem in af-ZA Afrikaans (Zuid-Afrika), Mekdes in am-ET Amharisch (Ethiopië), Ameha in am-ET Amharisch (Ethiopië), Fatima in ar-AE Arabisch (Verenigde Arabische Emiraten), Hamdan in ar-AE Arabisch (Verenigde Arabische Emiraten), Laila in ar-BH Arabisch (Bahrein), Ali in ar-BH Arabisch (Bahrein), Amina in ar-DZ Arabisch (Algerije), Ismael in ar-DZ Arabisch (Algerije), Rana in ar-IQ Arabisch (Irak), Bassel in ar-IQ Arabisch (Irak), Sana in ar-JO Arabisch (Jordanië), Taim in ar-JO Arabisch (Jordanië), Noura in ar-KW Arabisch (Koeweit), Fahed in ar-KW Arabisch (Koeweit), Iman in ar-LY Arabisch (Libië), Omar in ar-LY Arabisch (Libië), Mouna in ar-MA Arabisch (Marokko), Jamal in ar-MA Arabisch (Marokko), Amal in ar-QA Arabisch (Qatar), Moaz in ar-QA Arabisch (Qatar), Amany in ar-SY Arabisch (Syrië), Laith in ar-SY Arabisch (Syrië), Reem in ar-TN Arabisch (Tunesië), Hedi in ar-TN Arabisch (Tunesië), Maryam in ar-YE Arabisch (Jemen), Saleh in ar-YE Arabisch (Jemen), Nabanita in bn-BD Bangla (Bangladesh), Pradeep in bn-BD Bangla (Bangladesh), Asilia in en-KE Engels (Kenia), Chilemba in en-KE Engels (Kenia), Ezinne in en-NG Engels (Nigeria), Abeo in en-NG Engels (Nigeria), Imani in en-TZ Engels (Tanzania), Elimu in en-TZ Engels (Tanzania), Sofia in es-BO Spaans (Bolivia), Marcelo in es-BO Spaans (Bolivia), Catalina in es-CL Spaans (Chili), Lorenzo in es-CL Spaans (Chili), Maria in es-CR Spaans (Costa Rica), Juan in es-CR Spaans (Costa Rica), Belkys in es-CU Spaans (Cuba), Manuel in es-CU Spaans (Cuba), Ramona in es-DO Spaans (Dominicaanse Republiek), Emilio in es-DO Spaans (Dominicaanse Republiek), Andrea in es-EC Spaans (Ecuador), Luis in es-EC Spaans (Ecuador), Teresa in es-GQ Spaans (Equatoriaal-Guinea), Javier in es-GQ Spaans (Equatoriaal-Guinea), Marta in es-GT Spaans (Guatemala), Andres in es-GT Spaans (Guatemala), Karla in es-HN Spaans (Honduras), Carlos in es-HN Spaans (Honduras), Yolanda in es-NI Spaans (Nicaragua), Federico in es-NI Spaans (Nicaragua), Margarita in es-PA Spaans (Panama), Roberto in es-PA Spaans (Panama), Camila in es-PE Spaans (Peru), Alex in es-PE Spaans (Peru), Karina in es-PR Spaans (Puerto Rico), Victor in es-PR Spaans (Puerto Rico), Tania in es-PY Spaans (Paraguay), Mario in es-PY Spaans (Paraguay), Lorena in es-SV Spaans (El Salvador), Rodrigo in es-SV Spaans (El Salvador), Valentina in es-UY Spaans (Uruguay), Mateo in es-UY Spaans (Uruguay), Paola in es-VE Spaans (Venezuela), Sebastian in es-VE Spaans (Venezuela), Dilara in fa-IR Perzisch (Iran), Farid in fa-IR Perzisch (Iran), Blessica in fil-PH Filipijns (Filipijnen), Angelo in fil-PH Filipijns (Filipijnen), Sabela in gl-ES Galicisch, Roi in gl-ES Galicisch, Siti in jv-ID Javaans (Indonesië), Dimas in jv-ID Javaans (Indonesië), Sreymom in km-KH Khmer (Cambodja), Piseth in km-KH Khmer (Cambodja), Nilar in my-MM Birmees (Myanmar), Thiha in my-MM Birmees (Myanmar), Ubax in so-SO Somalisch (Somalië), Muuse in so-SO Somalisch (Somalië), Tuti in su-ID Soendanees (Indonesië), Jajang in su-ID Soendanees (Indonesië), Rehema in sw-TZ Swahili (Tanzania), Daudi in sw-TZ Swahili (Tanzania), Saranya in ta-LK Tamil (Sri Lanka), Kumar in ta-LK Tamil (Sri Lanka), Venba in ta-SG Tamil (Singapore), Anbu in ta-SG Tamil (Singapore), Gul in ur-IN Urdu (India), Salman in ur-IN Urdu (India), Madina in uz-UZ Oezbeeks (Oezbekistan), Sardor in uz-UZ Oezbeeks (Oezbekistan), Thando in zu-ZA Zulu (Zuid-Afrika), Themba in zu-ZA Zulu (Zuid-Afrika).

September 2021 uitgave

Nieuwe chatbotstem in en-US het Engels (VS): Sara vertegenwoordigt een jonge vrouwelijke volwassene die informeler praat en het beste past bij de chatbotscenario's.
Nieuwe stijlen toegevoegd voor ja-JP Japanse stem Nanami: Er zijn nu drie nieuwe stijlen beschikbaar met Nanami: chat, klantenservice en vrolijk.
Algehele uitspraakverbetering: Ardi in id-ID, Premwadee in th-TH, Christel in da-DK, HoaiMy en NamMinh in vi-VN.
Twee nieuwe stemmen in zh-CN het Chinees (Mandarijn, China) in preview: Xiaochen en Xiaoyan, geoptimaliseerd voor spontane spraak en klantenservicescenario's.

Juli 2021 uitgave

Updates voor neurale tekst-naar-spraak

Verminderde uitspraakfouten in het Hebreeuws met 20%.

Speech Studio-updates

Aangepaste neurale spraak: de trainingspijplijn bijgewerkt naar UniTTSv3 waarmee de modelkwaliteit wordt verbeterd terwijl de trainingstijd met 50% voor akoestische modellen wordt verminderd.
Audio-inhoud maken: het prestatieprobleem 'Exporteren' en de bug in aangepaste neurale spraakselectie opgelost.

Release van juni 2021

Updates voor Speech Studio

Aangepaste neurale spraak: Aangepaste neurale spraaktraining uitgebreid ter ondersteuning van Zuidoost-Azië. Nieuwe functies die zijn uitgebracht ter ondersteuning van de statuscontrole voor het uploaden van gegevens.
Audio-inhoud maken: een nieuwe functie uitgebracht ter ondersteuning van aangepaste lexicon. Met deze functie kunnen gebruikers eenvoudig hun lexiconbestanden maken en de aangepaste uitspraak voor hun audio-uitvoer definiëren.

Release mei 2021

Nieuwe talen en stemmen toegevoegd voor neurale TTS

Tien nieuwe talen geïntroduceerd - 20 nieuwe stemmen in 10 nieuwe landinstellingen worden toegevoegd aan de neurale TTS-taallijst: Yan in en-HK het Engels (Hongkong), Sam in en-HK het Engels (Hongkong), Molly in en-NZ het Engels (Nieuw-Zeeland), Mitchell in en-NZ het Engels (Nieuw-Zeeland), Luna in en-SG het Engels (Singapore), Wayne in en-SG het Engels (Singapore), Leah in en-ZA het Engels (Zuid-Afrika), Luke in en-ZA het Engels (Zuid-Afrika), Dhwani in gu-IN Gujarati (India), Niranjan in gu-IN Gujarati (India), Aarohi in mr-IN Marathi (India), Manohar in mr-IN Marathi (India), Elena in es-AR het Spaans (Argentinië), Tomas in es-AR het Spaans (Argentinië), Salome in es-CO het Spaans (Colombia), Gonzalo in es-CO het Spaans (Colombia), Paloma in es-US het Spaans (VS), Alonso in es-US het Spaans (VS), Zuri in sw-KE Swahili (Kenia), Rafiki in sw-KE Swahili (Kenia).
Elf nieuwe en-US stemmen in preview - 11 nieuwe en-US stemmen in preview worden toegevoegd aan Amerikaans Engels, ze zijn Ashley, Amber, Ana, Brandon, Christopher, Cora, Elizabeth, Eric, Michelle, Monica, Jacob.
Vijf zh-CN Chinese stemmen (Mandarijn, Vereenvoudigd) zijn algemeen beschikbaar - 5 Chinese stemmen (Mandarijn, Vereenvoudigd) worden gewijzigd van preview naar algemeen beschikbaar. Het zijn Yunxi, Xiaomo, Xiaoman, Xiaoxuan, Xiaorui. Deze stemmen zijn nu beschikbaar in alle regio's. Yunxi wordt toegevoegd met een nieuwe 'assistent'-stijl, die geschikt is voor chatbot en spraakagent. De stemstijlen van Xiaomo zijn verfijnd om natuurlijker en opvallender te zijn.

April 2021-uitgave

Neurale tekst naar spraak is beschikbaar in 21 regio's

Twaalf nieuwe regio's toegevoegd - neurale tekst naar spraak is nu beschikbaar in deze nieuwe 12 regio's: Japan East, Japan West, Korea Central, North Central US, North Europe, South Central US, Southeast Asia, UK South, west Central US, West Europe, West US, West US 2. Kijk hier voor een volledige lijst met 21 ondersteunde regio's.

Maart 2021 uitgave

Nieuwe talen en stemmen toegevoegd voor neurale TTS

Zes nieuwe talen geïntroduceerd - 12 nieuwe stemmen in 6 nieuwe locales worden toegevoegd aan de neurale TTS-taallijst: Nia in cy-GB Welsh (Verenigd Koninkrijk), Aled in cy-GB Welsh (Verenigd Koninkrijk), Rosa in en-PH het Engels (Filippijnen), James in en-PH het Engels (Filippijnen), Charline in fr-BE het Frans (België), Gerard in fr-BE het Frans (België), Dena in nl-BE het Nederlands (België), Arnaud in nl-BE het Nederlands (België), Polina in uk-UA Oekraïens (Oekraïne), Ostap in uk-UA Oekraïens (Oekraïne), Uzma in ur-PK Urdu (Pakistan), Asad in ur-PK Urdu (Pakistan).
Vijf talen van previewversie naar algemene beschikbaarheid - 10 stemmen, in 5 lokalen die in november zijn geïntroduceerd, zijn nu algemeen beschikbaar: Kert in et-EE Estisch (Estland), Colm in ga-IE Iers (Ierland), Nils in lv-LV Lets (Letland), Leonas in lt-LT Litouws (Litouwen), Joseph in mt-MT Maltees (Malta).
Nieuwe mannelijke stem toegevoegd voor Frans (Canada) - Een nieuwe stem, Antoine, is beschikbaar voor fr-CA Frans (Canada).
Kwaliteitsverbetering - Uitspraakfoutvermindering op hu-HU Hongaars - 48,17%, nb-NO Noors - 52,76%, nl-NL Nederlands (Nederland) - 22,11%.

Met deze release ondersteunen we nu in totaal 142 neurale stemmen in 60 talen/landinstellingen. Daarnaast zijn meer dan 70 standaardstemmen beschikbaar in 49 talen/landinstellingen. Ga naar Taalondersteuning voor de volledige lijst.

Verkrijg gezichtsposerevenementen om karakters te animeren

Neural Text naar spraak omvat nu de viseme gebeurtenis. Met Viseme-gebeurtenissen kunnen gebruikers een reeks gezichtsuitdrukkingen krijgen in combinatie met gesynthetiseerde spraak. Visemen kunnen worden gebruikt om de beweging van 2D- en 3D-avatarmodellen te beheersen, waarbij de mondbewegingen overeenkomen met gesynthetiseerde spraak. Viseme-evenementen zijn op dit moment alleen beschikbaar voor en-US-AriaNeural stem.

Het bladwijzerelement toevoegen in Speech Synthesis Markup Language (SSML)

Met het bladwijzerelement kunt u aangepaste markeringen invoegen in SSML om de positie van elke markering in de audiostream te bepalen. Deze kan worden gebruikt om te verwijzen naar een specifieke locatie in de tekst- of tagvolgorde.

Februari 2021 uitgave

Aangepaste neurale spraak GA

Aangepaste neurale stem is algemeen beschikbaar in februari in 13 talen: Chinees (Mandarijn, Vereenvoudigd), Engels (Australië), Engels (India), Engels (Verenigd Koninkrijk), Engels (Verenigde Staten), Frans (Canada), Frans (Frankrijk), Duits (Duitsland), Italiaans (Italië), Japans (Japan), Koreaans (Korea), Portugees (Brazilië), Spaans (Mexico) en Spaans (Spanje). Meer informatie over wat aangepaste neurale stem is en hoe u deze op verantwoorde wijze kunt gebruiken. Aangepaste neurale spraakfunctie vereist registratie en Microsoft kan de toegang beperken op basis van de geschiktheidscriteria van Microsoft. Meer informatie over de beperkte toegang.

Release van december 2020

Nieuwe neurale stemmen in algemene beschikbaarheid en preview

51 nieuwe stemmen uitgebracht voor in totaal 129 neurale stemmen in 54 talen en regio's.

46 nieuwe stemmen in GA-locaties: Shakir in ar-EG Arabisch (Egypte), Hamed in ar-SA Arabisch (Saoedi-Arabië), Borislav in bg-BG Bulgaars (Bulgarije), Joana in ca-ES Catalaans, Antonin in cs-CZ Tsjechisch (Tsjechië), Jeppe in da-DK Deens (Denemarken), Jonas in de-AT Duits (Oostenrijk), Jan in de-CH Duits (Zwitserland), Nestoras in el-GR Grieks (Griekenland), Liam in en-CA Engels (Canada), Connor in en-IE Engels (Ierland), Madhur in en-IN Hindi (India), Mohan in en-IN Telugu (India), Prabhat in en-IN Engels (India), Valluvar in en-IN Tamil (India), Enric in es-ES Catalaans, Kert in et-EE Estisch (Estland), Harri in fi-FI Fins (Finland), Selma in fi-FI Fins (Finland), Fabrice in fr-CH Frans (Zwitserland), Colm in ga-IE Iers (Ierland), Avri in he-IL Hebreeuws (Israël), Srecko in hr-HR Kroatisch (Kroatië), Tamas in hu-HU Hongaars (Hongarije), Gadis in id-ID Indonesisch (Indonesië), Leonas in lt-LT Litouws (Litouwen), Nils in lv-LV Lets (Letland), Osman in ms-MY Maleis (Maleisië), Joseph in mt-MT Maltees (Malta), Finn in nb-NO Noors, Bokmål (Noorwegen), Pernille in nb-NO Noors, Bokmål (Noorwegen), Fenna in nl-NL Nederlands (Nederland), Maarten in nl-NL Nederlands (Nederland), Agnieszka in pl-PL Pools (Polen), Marek in pl-PL Pools (Polen), Duarte in pt-BR Portugees (Brazilië), Raquel in pt-PT Portugees (Portugal), Emil in ro-RO Roemeens (Roemenië), Dmitry in ru-RU Russisch (Rusland), Svetlana in ru-RU Russisch (Rusland), Loekas in sk-SK Slowaaks (Slowakije), Rok in sl-SI Sloveens (Slovenië), Mattias in sv-SE Zweeds (Zweden), Sofie in sv-SE Zweeds (Zweden), Niwat in th-TH Thai (Thailand), Ahmet in tr-TR Turks (Turkije), NamMinh in vi-VN Vietnamees (Vietnam), HsiaoChen in zh-TW Taiwanese Mandarijn (Taiwan), YunJhe in zh-TW Taiwanese Mandarijn (Taiwan), HiuMaan in zh-HK Chinees Kantonees (Hongkong Speciale Administratieve Regio), WanLung in zh-HK Chinees Kantonees (Hongkong SAR).
5 nieuwe stemmen in preview-landinstellingen: Kert in et-EE Estland (Estland), Colm in ga-IE Iers (Ierland), Nils in lv-LV Letland (Letland), Leonas in lt-LT Litouwen (Litouwen), Joseph in mt-MT Maltees (Malta).

Met deze release ondersteunen we nu in totaal 129 neurale stemmen in 54 talen/landinstellingen. Daarnaast zijn meer dan 70 standaardstemmen beschikbaar in 49 talen/landinstellingen. Ga naar Taalondersteuning voor de volledige lijst.

Updates voor het maken van audio-inhoud

Verbeterde gebruikersinterface voor spraakselectie met spraakcategorieën en gedetailleerde spraakbeschrijvingen.
Intonatie-aanpassing ingeschakeld voor alle neurale stemmen in verschillende talen.
Geautomatiseerde lokalisatie van de gebruikersinterface op basis van de taal van de browser.
Besturingen StyleDegree voor alle zh-CN neurale stemmen ingeschakeld. Ga naar het hulpprogramma Voor het maken van audio-inhoud om de nieuwe functies te bekijken.

Bijwerkingen voor zh-CN stemmen

Alle zh-CN neurale stemmen bijgewerkt om Engels spreekvaardigheid te ondersteunen.
Schakel alle zh-CN neurale stemmen in om intonatieaanpassing te ondersteunen. Het hulpprogramma voor het maken van SSML- of audio-inhoud kan worden gebruikt om de beste intonatie aan te passen.
Alle multi-stijl neurale stemmen zijn bijgewerkt om zh-CN controle te ondersteunen. Emotie-intensiteit (zacht of sterk) is aanpasbaar.
Bijgewerkt zh-CN-YunyeNeural ter ondersteuning van meerdere stijlen die verschillende emoties kunnen uitvoeren.

Release van november 2020

Nieuwe locaties en stemmen in de preview

Vijf nieuwe stemmen en talen worden geïntroduceerd in het Neural text-to-speech portfolio. Ze zijn: Grace in Maltees (Malta), Ona in Litouws (Litouwen), Anu in Ests (Estland), Orla in Iers (Ierland) en Everita in Lets (Letland).
Vijf nieuwe zh-CN stemmen met ondersteuning voor meerdere stijlen en rollen: Xiaohan, Xiaomo, Xiaorui, Xiaoxuan en Yunxi.

Deze stemmen zijn beschikbaar in openbare preview in drie Azure-regio's: EastUS, SouthEastAsia en WestEurope.

Neurale tekst-naar-spraakcontainer GA

Met Neurale tekst naar spraakcontainer kunnen ontwikkelaars spraaksynthese uitvoeren met de meest natuurlijke digitale stemmen in hun eigen omgeving voor specifieke vereisten voor beveiliging en gegevensbeheer. Controleer hoe u Speech Containers installeert.

Nieuwe functies

Custom voice: stelde gebruikers in staat om een stemmodel van de ene regio naar de andere te kopiëren; ondersteunde onderbreking en hervatting van eindpunt. Ga hier naar Azure Portal .
Ondersteuning voor SSML-stiltetags .
Algemene verbeteringen in de spraakkwaliteit van TTS: Verbeterde nauwkeurigheid van uitspraak op woordniveau in nb-NO. Verminderde uitspraakfout van 53%.

Lees meer op deze tech blog.

Release van oktober 2020

Nieuwe functies

Jenny ondersteunt een nieuwe newscast stijl. Lees hoe u de spreekstijlen in SSML gebruikt.
Neurale stemmen zijn bijgewerkt naar HiFiNet vocoder, met hogere geluidskwaliteit en snellere synthesesnelheid. Dit profiteert klanten van wie het scenario afhankelijk is van hifi-audio of lange interacties, waaronder videoomzetting, audioboeken of online onderwijsmateriaal. Lees meer over het verhaal en hoor de stemvoorbeelden op onze tech community-blog
Aangepaste stem & Studio voor het creëren van audiocontent gelokaliseerd naar 17 locaties. Gebruikers kunnen de gebruikersinterface eenvoudig overschakelen naar een lokale taal voor een meer vriendelijke ervaring.
Audio Content Creatie: Stijlgraderegeling toegevoegd voor XiaoxiaoNeural; De functie voor aangepaste pauzes verfijnd om incrementele pauzes van 50 ms op te nemen.

Algemene verbeteringen in de spraakkwaliteit van TTS

Verbeterde uitspraaknauwkeurigheid op woordniveau in pl-PL (foutpercentagevermindering: 51%) en fi-FI (foutpercentagevermindering: 58%)
Verbeterde ja-JP woordherkenning voor de woordenboekscenario. Verminderde uitspraakfout met 80%.
zh-CN-XiaoxiaoNeural: Verbeterde stemkwaliteit voor sentiment/klantenservice/nieuwsuitzending/vrolijke/boze stijl.
zh-CN: Verbeterde uitspraak van Erhua en lichte toon en verfijnde intonatie, wat de begrijpelijkheid aanzienlijk verbetert.

Release van september 2020

Nieuwe functies

Neurale tekst-naar-spraak
- Uitgebreid om 18 nieuwe talen/regio's te ondersteunen. Ze zijn Bulgaars, Tsjechisch, Duits (Oostenrijk), Duits (Zwitserland), Grieks, Engels (Ierland), Frans (Zwitserland), Hebreeuws, Kroatisch, Hongaars, Indonesisch, Maleis, Roemeens, Slowaaks, Slovenië, Tamil, Telugu en Vietnamees.
- 14 nieuwe stemmen uitgebracht om de verscheidenheid in de bestaande talen te verrijken. Bekijk de volledige taal en spraaklijst.
- Nieuwe spreekstijlen voor en-US en zh-CN stemmen. Jenny, de nieuwe stem in het Engels (VS), ondersteunt chatbot-, klantenservice- en assistentstijlen. Er zijn 10 nieuwe spreekstijlen beschikbaar voor onze zh-CN-stem, XiaoXiao. Daarnaast ondersteunt de XiaoXiao-neurale stem het afstemmen. Lees hoe u de spreekstijlen in SSML gebruikt.
Containers: Neurale tekst-naar-spraak-container uitgebracht in publieke preview, met 16 stemmen beschikbaar in 14 talen. Meer informatie over het implementeren van Spraakcontainers voor neurale tekst naar spraak

Lees de volledige aankondiging van de TTS-updates voor Ignite 2020

Uitgave augustus 2020

Nieuwe functies

Neurale tekst naar spraak: nieuwe spreekstijl voor en-US Aria-stem. AriaNeural kan klinken als een nieuwscaster bij het lezen van nieuws. De stijl 'newscast-formal' klinkt serieuzer, terwijl de stijl 'newscast-casual' meer ontspannen en informeel is. Lees hoe u de spreekstijlen in SSML gebruikt.
Aangepaste spraak: er wordt een nieuwe functie uitgebracht om de kwaliteit van trainingsgegevens automatisch te controleren. Wanneer u uw gegevens uploadt, onderzoekt het systeem verschillende aspecten van uw audio- en transcriptgegevens en lost het problemen automatisch op of filtert om de kwaliteit van het spraakmodel te verbeteren. Dit omvat het volume van uw audio, het ruisniveau, de uitspraaknauwkeurigheid van spraak, de uitlijning van spraak met de genormaliseerde tekst, stilte in de audio, naast de audio- en scriptindeling.
Audio-inhoud maken: een set nieuwe functies om krachtigere mogelijkheden voor spraakafstemming en audiobeheer mogelijk te maken.
- Uitspraak: de functie voor het afstemmen van de uitspraak wordt bijgewerkt naar de nieuwste foneemset. U kunt het juiste phoneme-element uit de bibliotheek kiezen en de uitspraak van de geselecteerde woorden verfijnen.
- Download: de functie 'Downloaden'/'Exporteren' is verbeterd om het genereren van audio per alinea te ondersteunen. U kunt inhoud in hetzelfde bestand/SSML bewerken terwijl u meerdere audio-uitvoer genereert. De bestandsstructuur van 'Downloaden' is ook verfijnd. U kunt nu eenvoudig alle audiobestanden in één map ophalen.
- Taakstatus: De exportervaring voor meerdere bestanden is verbeterd. Wanneer u in het verleden meerdere bestanden exporteert en een van de bestanden is mislukt, mislukt de hele taak. Maar nu worden alle andere bestanden succesvol geëxporteerd. Het taakrapport is verrijkt met gedetailleerdere en gestructureerde informatie. U kunt nu de logboeken controleren op alle mislukte bestanden en zinnen met het rapport.
- SSML-documentatie: gekoppeld naar een SSML-document om u te helpen de regels te controleren voor het gebruik van alle afstemfunctionaliteiten.
De Voice List-API wordt bijgewerkt met een gebruiksvriendelijke weergavenaam en de spreekstijlen die worden ondersteund voor neurale stemmen.

Algemene verbeteringen in de spraakkwaliteit van TTS

Gereduceerde uitspraakfoutpercentage op woordniveau voor ru-RU (fouten verminderd met 56%) en sv-SE (fouten met 49%)
Verbeterd lezen van polyfonische woorden op en-US neurale stemmen met 40%. Voorbeelden van polyfoniewoorden zijn 'read', 'live', 'content', 'record', 'object', enzovoort.
Verbeterde natuurlijkheid van de vraagtoon in fr-FR. MOS (Gemiddelde Beoordelingsscore) toename: +0,28
De vocoders bijgewerkt voor de volgende stemmen, met kwaliteitsverbeteringen en een algehele prestatiesnelheid van 40%.

Lokatie Spraak

en-GB Mia

es-MX Dalia

fr-CA Sylvie

fr-FR Denise

ja-JP Nanami

ko-KR Sun-Hi

Lokatie	Spraak
`en-GB`	Mia
`es-MX`	Dalia
`fr-CA`	Sylvie
`fr-FR`	Denise
`ja-JP`	Nanami
`ko-KR`	Sun-Hi

Bugreparaties

Er zijn een aantal fouten opgelost met het hulpprogramma Voor het maken van audio-inhoud
- Het probleem met automatisch vernieuwen is opgelost.
- Problemen met spraakstijlen in zh-CN in de regio Zuidoost-Azië opgelost.
- Er is een stabiliteitsprobleem opgelost, waaronder een exportfout met de 'break'-tag en interpunctiefouten.

Release van juni 2025

Verbeterd beoordelingsmodel voor uitspraak

We hebben belangrijke upgrades geïmplementeerd voor de uitspraakbeoordelingsmodellen voor ta-IN en ms-MY. U ziet een merkbare sprong in Pearson Correlation Coefficients (PCC), wat nauwkeurigere en betrouwbare evaluaties betekent.

Deze bijgewerkte modellen zijn klaar voor gebruik via de API en de Azure AI Foundry-speeltuin, net als voorheen.

Verbeterde spraak-naar-tekstmodellen

De nauwkeurigheid van spraak-naar-tekstmodellen in snelle transcriptie voor de-DE, en-US, en-GB, es-ES, es-MX, fr-FR, it-IT, ja-JP, ko-KR, pt-BR, en zh-CN lokale instellingen is respectievelijk met 10%- 25% procent verbeterd, vooral door verbeterde leesbaarheid en herkenning van entiteiten.

Release van mei 2025

Verbeterde spraak-naar-tekstmodellen

De nauwkeurigheid van spraak-naar-tekstmodellen voor ta-IN, te-IN, en-IN en hu-HU landinstellingen wordt respectievelijk met 5-10 procent verbeterd. We hebben ook ongeveer 20x minder spookwoorden voor de ta-IN en te-IN modellen.

Snelle transcriptie-API - meertalige spraaktranscriptie

Als u de meertalige inhoud continu en nauwkeurig in een audiobestand wilt transcriberen, kunt u nu het nieuwste meertalige model gebruiken zonder de landinstellingencodes op te geven via een snelle transcriptie-API. Voor meer informatie, zie meertalige transcriptie in snelle transcriptie.

Nieuwe locale-instellingen die worden ondersteund in Fast Transcription

Snelle transcriptie ondersteunt nu aanvullende landinstellingen, waaronder fi-FI, he-IL, id-ID, pl-PL, pt-PT, sv-SE, enzovoort. Zie spraak-naar-tekst ondersteunde talen voor meer informatie.

Release van april 2025

Uitspraak evaluatie

We zijn verheugd om aanzienlijke verbeteringen aan te kondigen in onze beoordelingsmodellen voor de uitspraak van deze talen of gebieden: de-DE, es-MX, it-IT, ja-JP, ko-KR, en pt-BR. Deze verbeteringen zorgen voor aanzienlijke vooruitgang in Pearson Correlation Coefficients (PCC), waardoor nauwkeurigere en betrouwbare evaluaties mogelijk zijn.

Net als voorheen zijn de modellen beschikbaar via de API en Azure AI Foundry-speeltuin.

Uitgave van maart 2025

Gesprekstranscriptie met meerdere kanalen diarisatie (uitgefaseerd)

Gesprekstranscriptie met multikanaaldiarisatie wordt op 28 maart 2025 uit service genomen.

Als u spraak-naar-tekst wilt blijven gebruiken met diarisatie, gebruikt u in plaats daarvan de volgende functies:

Deze spraak-naar-tekstfuncties bieden alleen ondersteuning voor diarisatie voor audio met één kanaal. Audio met meerdere kanalen dat u hebt gebruikt voor gesprekstranscriptie met multichannel diarization wordt niet ondersteund.

Januari 2025 release

Nieuwe functie - Semantische segmentatie

Aankondiging van de release van een nieuwe functie: Semantische segmentatie. Deze functie integreert een interpunctiemodule binnen decoder die audio segmenteert op basis van semantische informatie, wat resulteert in meer logische en nauwkeurige segmentatiegrenzen. Belangrijkste voordelen:

Verbeterde nauwkeurigheid van segmentatie: Door semantische informatie te gebruiken, vermindert deze functie aanzienlijk exemplaren van lange segmenten die worden veroorzaakt door het ontbreken van pauzes in de invoeraudio.
Minder latentie veroorzaakt door ondersegmentatie: de totale latentie voor spraakherkenning wordt verminderd, met een vermindering van 40%-60% in de lengte van de langste 5% van de segmenten.
Beperking van oversegmentatie: met deze functie voorkomt u ook oversegmentatie door segmentatie uit te stellen wanneer een betere zin kan worden gevormd.

Ondersteunde lokalisaties:

Engels (en-US, en-GB)
Chinees (zh-CN, zh-HK)
Japans (ja-JP)
Koreaans (ko-KR)
Duits (de-DE)
Frans (taalcode: fr-FR)
Italiaans (it-IT)
Spaans (es-ES, es-MX)
Hindoestaans (hi-IN)
Portugees (pt-BR, pt-PT)
Turks (tr-TR)
Russisch (ru-RU)
Thai (th-TH)
Indonesisch (id-id)

Raadpleeg de documentatie voor implementatiedetails: Spraak herkennen in de sectie Semantische segmentatie.

Spraak naar tekst in realtime - Nieuwe release van het Engelse model

Aankondiging van de release van het nieuwste Engelse spraakmodel (en-US, en-CA), wat aanzienlijke verbeteringen brengt in verschillende prestatiemetrieken. Hieronder ziet u de belangrijkste hoogtepunten van deze release:

Toegankelijkheidsverbeteringen: 36% minder word-foutpercentage (WER) in interne toegankelijkheidstestsets van Microsoft, waardoor spraakherkenning nauwkeuriger en betrouwbaarder wordt voor het herkennen van spraak van personen met een spraakbeperking.
Ghost Word Reduction: Een opmerkelijke vermindering van 90% in spookwoorden op de ontwikkelingsset voor spookwoorden en reducties variëren van 63% tot 100% over andere datasets voor spookwoorden, waardoor de duidelijkheid en nauwkeurigheid van transcripties aanzienlijk worden verbeterd.

Het nieuwe model heeft ook de algehele prestaties verbeterd, waaronder entiteitsherkenning en betere herkenning van gespelde letters.

Deze ontwikkelingen zullen naar verwachting een nauwkeurigere, efficiënte en bevredigende ervaring bieden voor alle gebruikers. Het nieuwe model is beschikbaar via de API en Azure AI Foundry-speeltuin. Feedback wordt aangemoedigd om de mogelijkheden verder te verfijnen.

Uitgave in november 2024

Spraak naar tekst REST API versie 2024-11-15

De spraak-naar-tekst-REST API-versie 2024-11-15 wordt uitgebracht voor algemene beschikbaarheid. Zie voor meer informatie de naslagdocumentatie voor de spraak-naar-tekst REST API en de handleiding voor de spraak-naar-tekst REST API.

Notitie

De spraak-naar-tekst-REST API-versie 2024-05-15-preview is afgeschaft.

Snelle transcriptie (GA)

Snelle transcriptie is nu algemeen beschikbaar via spraak naar tekst REST API versie 2024-11-15. Met snelle transcriptie kunt u audiobestanden nauwkeurig en synchroon transcriberen naar tekst, met een hoge snelheidsfactor. Het kan audio sneller transcriberen dan de werkelijke audioduur. Zie de handleiding voor de snelle transcriptie-API voor meer informatie.

Release van oktober 2024

Real-time spraak-naar-tekst (tweetalig)

Er zijn aanzienlijke verbeteringen aangebracht in de erkenningskwaliteit van korte Spaanse termen via de es-US tweetalige modellen. Het model is tweetalig en ondersteunt ook Engels. De kwaliteit van Engelse erkenning wordt ook verbeterd.

Videovertaling (Preview)

De API voor videoomzetting is nu beschikbaar in openbare preview. Zie voor meer informatie de hoe je videovertaling gebruikt.

September 2024-uitgave

Realtime spraak naar tekst

Realtime spraak naar tekst heeft nieuwe modellen uitgebracht, met een betere kwaliteit, voor de volgende talen.

fi-FI/id-ID/zh-TW/pl-PL/pt-PT es-SV/es-EC/es-BO/es-PY/es-AR/es-DO/es-UY/es-CR/es-VE/es-NI/es-HN/es-PR/es-COes-CL/es-CU/es-PE/es-PA/es-GT/es-GQ

Snelle transcriptie (voorbeeld)

Snelle transcriptie ondersteunt nu diarisatie voor het herkennen en scheiden van meerdere luidsprekers op een monokanaals audiobestand. Zie de handleiding voor snelle transcriptie-API voor meer informatie.

Release augustus 2024

Taal leren (preview)

Taal leren is nu beschikbaar in openbare preview. Interactieve taal leren kan uw leerervaring aantrekkelijker en effectiever maken. Zie Interactieve taal leren met uitspraakbeoordeling voor meer informatie.

Uitspraak evaluatie

Uitspraaksevaluatie ondersteunt nu 33 talen die algemeen beschikbaar zijn en elke taal is beschikbaar in alle spraak-naar-tekstregio's. Zie de volledige lijst met talen voor uitspraakbeoordeling voor meer informatie.

Taal	Taalinstelling (BCP-47)
Arabisch (Egypte)	`ar-EG`
Arabisch (Saoedi-Arabië)	`ar-SA`
Catalaans	`ca-ES`
Chinees (Kantonees, traditioneel)	`zh-HK`
Chinees (Mandarijn, Vereenvoudigd)	`zh-CN`
Chinees (Taiwanese Mandarijn, Traditioneel)	`zh-TW`
Deens (Denemarken)	`da-DK`
Nederlands (Nederland)	`nl-NL`
Engels (Australië)	`en-AU`
Engels (Canada)	`en-CA`
Engels (India)	`en-IN`
Engels (Verenigd Koninkrijk)	`en-GB`
Engels (Verenigde Staten)	`en-US`
Fins (Finland)	`fi-FI`
Frans (Canada)	`fr-CA`
Frans (Frankrijk)	`fr-FR`
Duits (Duitsland)	`de-DE`
Hindi (India)	`hi-IN`
Italiaans (Italië)	`it-IT`
Japanse taal (Japan)	`ja-JP`
Koreaans (Korea)	`ko-KR`
Maleis (Maleisië)	`ms-MY`
Noors Bokmål (Noorwegen)	`nb-NO`
Pools (Polen)	`pl-PL`
Portugees (Brazilië)	`pt-BR`
Portugees (Portugal)	`pt-PT`
Russisch (Rusland)	`ru-RU`
Spaans (Mexico)	`es-MX`
Spaans (Spanje)	`es-ES`
Zweeds (Zweden)	`sv-SE`
Tamil (India)	`ta-IN`
Thai (Thailand)	`th-TH`
Vietnamees (Vietnam)	`vi-VN`

juli 2024 uitgave

Snelle transcriptie-API (voorbeeld)

Snelle transcriptie is nu beschikbaar in openbare voorlopige versie. Met snelle transcriptie kunt u audiobestanden nauwkeurig en synchroon transcriberen naar tekst, met een hoge snelheidsfactor. Het kan audio sneller transcriberen dan de werkelijke audioduur. Zie de handleiding voor de snelle transcriptie-API voor meer informatie.

Aanbeveling

Probeer snelle transcriptie uit in de Azure AI Foundry-portal.

Release van juni 2024

Algemene beschikbaarheid voor spraak-naar-tekst-REST API v3.2

REST API-versie 3.2 van Speech-to-Text is nu algemeen beschikbaar. Zie de naslagdocumentatie voor de spraak-naar-tekst REST API v3.2 en de handleiding voor de spraak-naar-tekst REST API.

Notitie

Preview-versies 3.2-preview.1 en 3.2-preview.2 zijn vanaf september 2024 buiten gebruik gesteld.

Spraak-naar-tekst REST API v3.1 wordt buiten gebruik gesteld op een datum die moet worden aangekondigd. Spraak-naar-tekst-REST API v3.0 wordt op 31 maart 2026 buiten gebruik gesteld. Zie de migratiehandleidingen voor spraak-naar-tekst-REST API v3.0 naar v3.1 en v3.1 naar v3.2 voor meer informatie over het upgraden.

Uitgave van mei 2024

Videovertaling (Preview)

Videotranslatie is nu beschikbaar in openbare preview. Videoomzetting is een functie in Azure AI Speech waarmee u video's in meerdere talen naadloos kunt vertalen en genereren. Deze functie is ontworpen om u te helpen uw video-inhoud te lokaliseren voor diverse doelgroepen over de hele wereld. U kunt efficiënt meeslepende, gelokaliseerde video's maken in verschillende gebruiksvoorbeelden, zoals vlogs, onderwijs, nieuws, bedrijfstraining, reclame, film, tv-programma's en meer. Zie het videovertalingsoverzicht voor meer informatie.

Uitspraakbeoordeling

Spreekuitspraakbeoordeling ondersteunt nu 24 algemeen beschikbare talen (met één nieuwe taal toegevoegd), met nog 7 talen beschikbaar in openbare voorvertoning. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.

Uitgave van april 2024

Automatische meertalige spraakvertaling (Preview)

Automatische meertalige spraakomzetting is beschikbaar in openbare preview. Deze innovatieve functie verandert de manier waarop taalbarrières worden overwinnen en biedt ongeëvenaarde mogelijkheden voor naadloze communicatie in diverse taalkundige landschappen.

Belangrijkste hoogtepunten

Niet-opgegeven invoertaal: spraakomzetting in meerdere talen kan audio ontvangen in een breed scala aan talen en u hoeft niet op te geven wat de verwachte invoertaal is. Het maakt het een waardevolle functie om inzicht te hebben in en samen te werken in wereldwijde contexten zonder dat er vooraf moet worden ingesteld.
Taalwisseling: spraakomzetting in meerdere talen zorgt ervoor dat meerdere talen tijdens dezelfde sessie kunnen worden gesproken en dat ze allemaal in dezelfde doeltaal worden vertaald. U hoeft een sessie niet opnieuw te starten wanneer de invoertaal of andere acties door u worden gewijzigd.

Hoe het werkt

Reisinterpreter: meertalige spraakomzetting kan de ervaring van toeristen die buitenlandse bestemmingen bezoeken verbeteren door hen informatie en hulp te geven in hun voorkeurstaal. Hotel concierge diensten, rondleidingen en bezoekerscentra kunnen gebruikmaken van deze technologie om tegemoet te komen aan diverse taalkundige behoeften.
Internationale conferenties: meertalige spraakomzetting kan communicatie mogelijk maken tussen deelnemers uit verschillende regio's die verschillende talen kunnen spreken met live vertaald bijschrift. Deelnemers kunnen in hun eigen talen spreken zonder ze op te geven, zodat ze naadloos begrip en samenwerking kunnen garanderen.
Educatieve vergaderingen: In multi-culturele klaslokalen of onlineleeromgevingen kan meertalige spraakomzetting taaldiversiteit tussen studenten en docenten ondersteunen. Het maakt naadloze communicatie en deelname mogelijk zonder dat u de taal van elke leerling of docent hoeft op te geven.

Toegang krijgen

Ga naar het overzicht van spraakomzetting voor een gedetailleerde inleiding. Daarnaast kunt u verwijzen naar de codevoorbeelden bij het vertalen van spraak. Deze nieuwe functie wordt volledig ondersteund door alle SDK-versies vanaf 1.37.0.

Real-time spraak naar tekst met diarisatie (GA)

Real-time spraak-naar-tekst met diarizatie is nu algemeen beschikbaar.

U kunt spraak-naar-teksttoepassingen maken die gebruikmaken van diarisatie om onderscheid te maken tussen de verschillende sprekers die deelnemen aan het gesprek. Raadpleeg voor meer informatie over realtime-diarisatie de snelle startgids voor realtime-diarisatie.

Spraak-naar-tekstmodel bijwerken

Realtime spraak naar tekst heeft nieuwe modellen uitgebracht met tweetalige mogelijkheden. Het en-IN model ondersteunt nu zowel Engelstalige als Hindi tweetalige scenario's en biedt verbeterde nauwkeurigheid. Arabische locaties (ar-AE, ar-BH, ar-DZ, ar-IL, ar-IQ, ar-KW, ar-LB, ar-LY, ar-MA, ar-OM, ar-PS, ar-QA, ar-SA, ar-SY, ar-TN, ar-YE) zijn nu uitgerust met tweetalige ondersteuning voor Engels, verbeterde nauwkeurigheid en callcentertoegang.

Batchtranscriptie biedt modellen met nieuwe architectuur voor de volgende talen: es-ES, es-MX, fr-FR, it-IT, ja-JP, ko-KR, pt-BR, en zh-CN. Deze modellen verbeteren de leesbaarheid en entiteitsherkenning aanzienlijk.

Uitgave maart 2024

Algemene beschikbaarheid van Whisper (GA)

Het Fluisterse spraak-naar-tekstmodel met Azure AI Speech is nu algemeen beschikbaar.

Bekijk wat is het fluistermodel? voor meer informatie over het gebruik van Azure AI Speech versus Azure OpenAI in Azure AI Foundry-modellen.

Februari 2024 uitgave

Uitspraakbeoordeling

Speech Uitspraakbeoordeling ondersteunt nu 23 talen die in het algemeen beschikbaar zijn (waarvan 5 nieuwe talen zijn toegevoegd), met drie extra talen beschikbaar in de openbare previewversie. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.

Fraselijst

Ondersteuning voor frasenlijst is toegevoegd voor de volgende landinstellingen: ar-SA, de-CH, en-IE, en-ZA, es-US, id-ID, nl-NL, pl-PL, pt-PT, ru-RU, sv-SE, th-TH, vi-VN, zh-HK, zh-TW.

Release van november 2023

Inleiding tot tweetalige spraakmodellering!

We zijn blij om een baanbrekende toevoeging aan onze realtime spraakmodellering te onthullen: tweetalige spraakmodellering. Dankzij deze aanzienlijke verbetering biedt ons spraakmodel naadloos ondersteuning voor tweetalige taalparen, zoals Engels en Spaans, evenals Engels en Frans. Met deze functie kunnen gebruikers moeiteloos schakelen tussen talen tijdens realtime interacties, waarbij ze een centraal moment markeren in onze toezegging om communicatie-ervaringen te verbeteren.

Belangrijke hoogtepunten:

Tweetalige ondersteuning: Met onze nieuwste release kunnen gebruikers naadloos schakelen tussen Engels en Spaans of tussen Engels en Frans tijdens realtime spraakinteracties. Deze functionaliteit is afgestemd op tweetalige sprekers die vaak schakelen tussen deze twee talen.
Verbeterde gebruikerservaring: Tweetalige sprekers, zowel op het werk, thuis als in verschillende community-instellingen, zullen deze functie enorm nuttig vinden. Het vermogen van het model om zowel Engels als Spaans in realtime te begrijpen en erop te reageren, biedt nieuwe mogelijkheden voor effectieve en vloeiende communicatie.

Gebruiksaanwijzing:

Kies es-US (Spaans en Engels) of fr-CA (Frans en Engels) wanneer u de Speech Service-API aanroept of probeer het uit in Speech Studio. Voel u vrij om taal te spreken of ze samen te combineren. Het model is ontworpen om dynamisch aan te passen en nauwkeurige en contextbewuste antwoorden in beide talen te bieden.

Het is tijd om uw communicatiespel te verhogen met onze nieuwste functierelease: naadloze, meertalige communicatie binnen handbereik!

Spraak-naar-tekstmodellen worden bijgewerkt

We zijn verheugd om een belangrijke update te introduceren voor onze spraakmodellen, veelbelovende verbeterde nauwkeurigheid, verbeterde leesbaarheid en verfijnde entiteitsherkenning. Deze upgrade wordt geleverd met een robuuste nieuwe structuur, ondersteund door een uitgebreide trainingsgegevensset, waardoor een gemarkeerde vooruitgang in de algehele prestaties wordt gegarandeerd. Het bevat onlangs uitgebrachte modellen voor en-US, zh-CN, ja-JP, it-IT, pt-BR, es-MX, es-ES, fr-FR, de-DE, ko-KR, tr-TR, sv-SE en he-IL.

Hoogtepunten:

Betere nauwkeurigheid met nieuwe modelstructuur: de opnieuw gedefinieerde modelstructuur, in combinatie met een uitgebreidere trainingsgegevensset, verhoogt de nauwkeurigheidsniveaus en belooft nauwkeurigere spraakuitvoer.
Verbetering van de leesbaarheid: Ons nieuwste model zorgt voor een aanzienlijke verbetering van de leesbaarheid, waardoor de samenhang en duidelijkheid van gesproken inhoud wordt verbeterd.
Geavanceerde entiteitsherkenning: Entiteitsherkenning ontvangt een aanzienlijke upgrade, wat resulteert in nauwkeurigere en genuanceerde resultaten.

Mogelijke gevolgen: Ondanks deze ontwikkelingen is het van cruciaal belang om rekening te houden met mogelijke gevolgen:

Aangepaste time-outfunctie voor stiltes: gebruikers die een time-out voor aangepaste stilte gebruiken, met name met lage instellingen, kunnen te maken krijgen met oversegmentatie en mogelijke weglatingen van woordgroepen met één woord.
Het nieuwe model kan compatibiliteitsproblemen vertonen met de functie Trefwoordvoorvoegsel en gebruikers worden geadviseerd om de prestaties in hun specifieke toepassingen te beoordelen.
Verminderde haperende woorden of zinsdelen: Gebruikers merken mogelijk een vermindering van haperende woorden of zinsdelen zoals 'um' of 'uh' in de spraakweergave.
Onnauwkeurigheden in de duur van woordtijdstempels: sommige stotterwoorden kunnen onnauwkeurigheden vertonen in de duur van de tijdstempel, waarbij aandacht nodig is in toepassingen die afhankelijk zijn van een precieze timing.
Afwijking van betrouwbaarheidsscoreverdeling: gebruikers die afhankelijk zijn van betrouwbaarheidsscores en bijbehorende drempelwaarden, moeten rekening houden met mogelijke variaties in de distributie, waarbij aanpassingen nodig zijn voor optimale prestaties.
De nauwkeurigheidsverbetering van de woordgroepenlijstfunctie kan worden beïnvloed door de onjuiste cognitieve weergave van bepaalde zinnen.

We raden u aan om deze verbeteringen te verkennen en potentiële problemen voor een naadloze overgang te overwegen, en zoals altijd is uw feedback van cruciaal belang bij het verfijnen en bevorderen van onze services.

Uitspraakbeoordeling

Uitspraakbeoordeling van spraak ondersteunt nu 18 talen algemeen beschikbaar, met zes extra talen beschikbaar in de publieke preview. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.
We zijn verheugd om aan te kondigen dat uitspraakbeoordeling nieuwe functies introduceert vanaf 1 november 2023: Prosody, Grammatica, Vocabulaire en Onderwerp. Deze verbeteringen zijn gericht op een nog uitgebreidere taalleerervaring voor zowel lees- als spreekbeoordelingen. Voer een upgrade uit naar SDK-versie 1.35.0 of hoger om verdere details te verkennen in de uitspraakbeoordeling en uitspraakbeoordeling in Speech Studio.

September 2023-uitgave

Fluister openbare preview

Azure AI Speech ondersteunt nu het Whisper-model van OpenAI via de batchtranscriptie-API. Raadpleeg de handleiding Een batchtranscriptie maken voor meer informatie.

Notitie

Azure OpenAI biedt ook ondersteuning voor het Fluistermodel van OpenAI voor spraak-naar-tekst met een synchrone REST API. Bekijk de quickstart voor meer informatie.

Bekijk wat is het Fluistermodel? voor meer informatie over het gebruik van Azure AI Speech versus Azure OpenAI.

Openbare preview voor spraak-naar-tekst-REST API v3.2

De spraak-naar-tekst-REST-API v3.2 is beschikbaar in voorbeeldweergave. Spraak-naar-tekst REST API v3.1 is algemeen beschikbaar. Spraak-naar-tekst-REST API v3.0 wordt op 31 maart 2026 buiten gebruik gesteld. Zie de migratiehandleidingen spraak-naar-tekst-REST API v3.0 naar v3.1 en v3.1 naar v3.2 voor meer informatie.

Release augustus 2023

Nieuwe spraak-naar-tekst-taalopties:

Spraak-naar-tekst ondersteunt twee nieuwe taalinstellingen, zoals wordt weergegeven in de volgende tabel. Raadpleeg hier de volledige taallijst.

Lokatie	Taal
`pa-IN`	Punjabi (India)
`ur-IN`	Urdu (India)

Uitspraakbeoordeling

Ondersteuning voor Uitspraakbeoordeling van spraak omvat nu 3 extra talen die algemeen beschikbaar zijn, namelijk Engels (Canada), Engels (India) en Frans (Canada), met 3 extra talen die beschikbaar zijn als preview. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.

Versie van mei 2023

Uitspraakbeoordeling

Beoordeling van spraakuitspraak ondersteunt nu 3 extra talen die algemeen beschikbaar zijn in het Duits (Duitsland), Japans (Japan) en Spaans (Mexico), met 4 extra talen die beschikbaar zijn in preview. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.
Je kunt nu de standaard Speech to Text-toewijdingsniveau gebruiken voor uitspraakbeoordeling in alle openbare regio's. Als u een toezeggingsniveau koopt voor standaard spraak-naar-tekst, telt de uitgave voor uitspraakbeoordeling mee voor het voldoen aan de toezegging. Zie prijsstelling op basis van verbintenisniveau.

Februari 2023 uitgave

Uitspraakbeoordeling

De uitspraakbeoordeling van spraak ondersteunt nu 5 extra talen die algemeen beschikbaar zijn in het Engels (Verenigd Koninkrijk), Engels (Australië), Frans (Frankrijk), Spaans (Spanje) en Chinees (Mandarijn, Vereenvoudigd), met andere talen die beschikbaar zijn in preview.
Voorbeeldcodes toegevoegd die laten zien hoe u uitspraakbeoordeling gebruikt in de streamingmodus in uw eigen toepassing.
- C#: Zie voorbeeldcode.
- C++: Zie voorbeeldcode.
- java: Zie voorbeeldcode.
- javascript: Zie voorbeeldcode.
- Objective-C: Zie voorbeeldcode.
- Python: Zie voorbeeldcode.
- Swift: Zie voorbeeldcode.

Gepersonaliseerde spraak

Ondersteuning voor audio en door mensen gelabelde transcriptie wordt toegevoegd voor de de-AT lokalisaties.

De release van januari 2023

Gepersonaliseerde spraak

Ondersteuning voor audio + menselijk gelabelde transcriptie wordt toegevoegd voor extra landinstellingen: ar-BH, ar-DZ, ar-EG, ar-MA, ar-SA, ar-TN, ar-YE, en ja-JP.

Ondersteuning voor aanpassing van gestructureerde tekst wordt toegevoegd voor taalinstelling de-AT.

Uitgave van december 2022

REST API voor spraak-naar-tekst

Versie 3.1 van de spraakherkennings-REST-API is algemeen beschikbaar. Versie 3.0 van de REST API voor spraak-naar-tekst wordt buiten gebruik gesteld. Zie de handleiding voor meer informatie over het migreren.

Release van oktober 2022

Nieuwe taalinstelling voor spraak naar tekst

Ondersteuning toegevoegd voor Malayalam (India) met de ml-IN landinstelling. Bekijk hier de volledige taallijst.

Uitgave juli 2022

Nieuwe spraak-naar-tekst-taalopties:

Er zijn 7 nieuwe lokalisaties toegevoegd, zoals wordt weergegeven in de volgende tabel. Bekijk hier de volledige taallijst.

Lokatie	Taal
`bs-BA`	Bosnisch (Bosnië en Herzegovina)
`yue-CN`	Chinees (Kantonees, Vereenvoudigd)
`zh-CN-sichuan`	Chinees (Zuidwestelijk Mandarijn, Vereenvoudigd)
`wuu-CN`	Chinees (Wu, Vereenvoudigd)
`ps-AF`	Pashto (Afghanistan)
`so-SO`	Somalië (Somalië)
`cy-GB`	Welsh (Verenigd Koninkrijk)

Release van juni 2022

Nieuwe spraak-naar-tekst-taalopties:

Er zijn 10 nieuwe lokalisaties toegevoegd, zoals weergegeven in de volgende tabel. Bekijk hier de volledige taallijst.

Lokatie	Taal
`sq-AL`	Albanees (Albanië)
`hy-AM`	Armeens (Armenië)
`az-AZ`	Azerbeidzjaans (Azerbeidzjan)
`eu-ES`	Baskisch
`gl-ES`	Galicisch
`ka-GE`	Georgisch (Georgië)
`it-CH`	Italiaans (Zwitserland)
`kk-KZ`	Kazachs (Kazakhstan)
`mn-MN`	Mongools (Mongolië)
`ne-NP`	Nepalee (Nepalee)

april 2022 uitgave

Nieuwe spraak-naar-tekst-taalopties:

Hieronder ziet u een lijst met de nieuwe taal- en regio-instellingen. Bekijk hier de volledige taallijst.

Lokatie	Taal
`bn-IN`	Bengaals (India)

Uitgave januari 2022

Nieuwe spraak-naar-tekst-taalopties:

Hieronder ziet u een lijst met de nieuwe taal- en regio-instellingen. Bekijk hier de volledige taallijst.

Lokatie	Taal
`af-ZA`	Afrikaans (Zuid-Afrika)
`am-ET`	Amharisch (Ethiopië)
`de-CH`	Duits (Zwitserland)
`fr-BE`	Frans (België)
`is-IS`	IJslands (IJsland)
`jv-ID`	Javaans (Indonesië)
`km-KH`	Khmer (Cambodja)
`kn-IN`	Kannada (India)
`lo-LA`	Lao (Laos)
`mk-MK`	Macedonisch (Noord-Macedonië)
`my-MM`	Birmees (Myanmar)
`nl-BE`	Nederlands (België)
`si-LK`	Sinhala (Sri Lanka)
`sr-RS`	Servisch (Servië)
`sw-TZ`	Swahili (Tanzania)
`uk-UA`	Oekraïens (Oekraïne)
`uz-UZ`	Oezbeeks (Oezbekistan)
`zu-ZA`	Zulu (Zuid-Afrika)

Juli 2021 uitgave

Nieuwe spraak-naar-tekst-taalopties:

Hieronder ziet u een lijst met de nieuwe taal- en regio-instellingen. Bekijk hier de volledige taallijst.

Lokatie	Taal
`ar-DZ`	Arabisch (Algerije)
`ar-LY`	Arabisch (Libië)
`ar-MA`	Arabisch (Marokko)
`ar-TN`	Arabisch (Tunesië)
`ar-YE`	Arabisch (Jemen)
`bg-BG`	Bulgaars (Bulgarije)
`el-GR`	Grieks (Griekenland)
`et-EE`	Estisch (Estland)
`fa-IR`	Perzisch (Iran)
`ga-IE`	Iers (Ierland)
`hr-HR`	Kroatisch (Kroatië)
`lt-LT`	Litouws (Litouwen)
`lv-LV`	Lets (Letland)
`mt-MT`	Maltees (Malta)
`ro-RO`	Roemeens (Roemenië)
`sk-SK`	Slowaaks (Slowakije)
`sl-SI`	Sloveens (Slovenië)
`sw-KE`	Swahili (Kenia)

Januari 2021 release

Nieuwe spraak-naar-tekst-taalopties:

Hieronder ziet u een lijst met de nieuwe taal- en regio-instellingen. Bekijk hier de volledige taallijst.

Lokatie	Taal
`ar-AE`	Arabisch (Verenigde Arabische Emiraten)
`ar-IL`	Arabisch (Israël)
`ar-IQ`	Arabisch (Irak)
`ar-OM`	Arabisch (Oman)
`ar-PS`	Arabisch (Palestijnse Autoriteit)
`de-AT`	Duits (Oostenrijk)
`en-GH`	Engels (Ghana)
`en-KE`	Engels (Kenia)
`en-NG`	Engels (Nigeria)
`en-TZ`	Engels (Tanzania)
`es-GQ`	Spaans (Equatoriaal Guinea)
`fil-PH`	Filipino (Filipijnen)
`fr-CH`	Frans (Zwitserland)
`he-IL`	Hebreeuws (Israël)
`id-ID`	Indonesisch (Indonesië)
`ms-MY`	Maleis (Maleisië)
`vi-VN`	Vietnamees (Vietnam)

Uitgave augustus 2020

Nieuwe lokalisaties voor spraak naar tekst:

Spraak-naar-tekst heeft in augustus 26 nieuwe taalversies uitgebracht: 2 Europese talen cs-CZ en hu-HU, 5 Engelse varianten en 19 Spaanse varianten die de meeste Zuid-Amerikaanse landen/regio's beslaan. Hieronder ziet u een lijst met de nieuwe taal- en regio-instellingen. Bekijk hier de volledige taallijst.

Lokatie	Taal
`cs-CZ`	Tsjechisch (Tsjechische Republiek)
`en-HK`	Engels (Hongkong Speciale Administratieve Regio)
`en-IE`	Engels (Ierland)
`en-PH`	Engels (Filipijnen)
`en-SG`	Engels (Singapore)
`en-ZA`	Engels (Zuid-Afrika)
`es-AR`	Spaans (Argentinië)
`es-BO`	Spaans (Bolivia)
`es-CL`	Spaans (Chili)
`es-CO`	Spaans (Colombia)
`es-CR`	Spaans (Costa Rica)
`es-CU`	Spaans (Cuba)
`es-DO`	Spaans (Dominicaanse Republiek)
`es-EC`	Spaans (Ecuador)
`es-GT`	Spaans (Guatemala)
`es-HN`	Spaans (Honduras)
`es-NI`	Spaans (Nicaragua)
`es-PA`	Spaans (Panama)
`es-PE`	Spaans (Peru)
`es-PR`	Spaans (Puerto Rico)
`es-PY`	Spaans (Paraguay)
`es-SV`	Spaans (El Salvador)
`es-US`	Spaans (VS)
`es-UY`	Spaans (Uruguay)
`es-VE`	Spaans (Venezuela)
`hu-HU`	Hongaars (Hongarije)

Release in juni 2025

Neurale tekst naar spraak 3.11.0

Vrijgegeven neurale tekst-naar-spraakversie 3.11.0.

Ondersteuning toegevoegd voor nieuwe neurale stemmen: de-DE-SeraphinaMultilingualNeural, es-ES-XimenaMultilingualNeural, fi-FI-SelmaNeural. nb-NO-FinnNeural
Ondersteuning toegevoegd voor meertalige aangepaste lexicons.

De release van mei 2025

Voeg ondersteuning toe voor de nieuwste modelversies:

Neurale tekst naar spraak 3.10.0

Voor tekst-naar-spraak:

De tekst-naar-spraak-backend- en frontend-engine zijn bijgewerkt naar de nieuwste versies.
Ondersteuning toegevoegd voor meertalige aangepaste lexicons.
De gezondheidscontrolefunctionaliteit is verbeterd. Het eindpunt van de statuscontrole is nu /synthesize/health. Wanneer de service in orde is, retourneert dit eindpunt DE HTTP-status 200; als de service niet in orde is, wordt de HTTP-status 503 geretourneerd.
De basisinstallatiekopieën zijn bijgewerkt naar AspNet 8.0.16 om beveiligingsproblemen van maart/april 2025 van Microsoft ASP.NET Core Security Update te verhelpen.

Release van maart 2025

Voeg ondersteuning toe voor de nieuwste modelversies:

Neurale tekst naar spraak 3.9.0
Spraak naar tekst 5.0.1 (preview)
Aangepaste spraak naar tekst 5.0.1 (Preview)

Voor spraak-naar-tekst en aangepaste spraak-naar-tekst zijn de volgende functies opgenomen:

Ondersteuning voor nieuwe spraak-naar-tekstmodellen
Besturingssysteemwijziging in Azure Linux 3.0
Ondersteuning voor nieuwe lokalisaties: ar-dz, as-in, es-gq, or-in, pa-in en ur-in
Decoderupdate
Mogelijkheid om nieuwere aangepaste modellen te gebruiken (2023+) in container

Voor tekst-naar-spraak is ondersteuning toegevoegd voor nieuwe neurale stemmen: en-GB-OliviaNeuralen en-US-ChristopherNeuralnl-NL-FennaNeural.

Februari-uitgave 2025

Voeg ondersteuning toe voor de nieuwste modelversies:

Spraaktaalidentificatie 1.18.0
Neurale tekst naar spraak 3.7.0
Spraak naar tekst 4.12.0
Custom spraak naar tekst 4.12.0

Hier volgen de hoogtepunten van de releases:

Functie-update	Spraak naar tekst	Op maat gemaakte spraak-naar-tekst	Neurale tekst naar spraak	Spraaktaalidentificatie
Oplossingen voor beveiligingsproblemen	✅	✅	✅	✅
Gemigreerd besturingssysteem van Ubuntu 20.04 naar Ubuntu 22.04	✅	✅	✅	✅
Nieuwe lokalisaties: ar-ly, fr-be, nl-be en uz-uz	✅	✅
Bijgewerkte nuget-pakketten, Go-versie	✅	✅
Parallelle uitvoering voor het downloaden van modellen toegevoegd om de downloadtijd van modellen te verminderen	✅	✅	✅

2024-oktober release

Voeg ondersteuning toe voor de nieuwste modelversies:

Spraaktaalidentificatie 1.16.0
Neurale tekst naar spraak 3.5.0
- Maak en-us-ariacpuneural een alias naar en-us-jessacpuneural
- De versie van de back-end-engine voor spraak bijwerken
Spraak naar tekst 4.10.0
- Herstel ondersteuning voor locale uk-UA
- Instellingen voor stilte herstellen om te werken met lange perioden van stilte in de audio
- Afgeschafte modellen vervangen: cs-CZ, , da-DKen-GB, fr-CA, , hu-HUit-CHtr-TRzh-CN-sichuan
Custom spraak naar tekst 4.10.0

2024 september-release

Voeg ondersteuning toe voor de nieuwste modelversies:

Spraaktaalidentificatie 1.15.0
- Beveiligingsproblemen beperken
Neurale tekst naar spraak 3.4.0
- Nieuwe stemmen: en-us-andrewmultilingualneural, en-us-jessaneural, es-us-alonsoneural, , es-us-palomaneuralit-it-isabellamultilingualneural
- Beveiligingsproblemen beperken
Spraak naar tekst 4.9.0
- Nieuwe landinstellingen: ar-YE, af-ZA, am-ET, ar-MA, ar-TN, sw-KE, sw-TZ, zu-ZA
- Beveiligingsproblemen beperken
- Afgeschafte modellen bijwerken
Aangepaste spraak-naar-tekst 4.9.0
- Beveiligingsproblemen beperken

Release in augustus 2024

Voeg ondersteuning toe voor de nieuwste modelversies:

Spraaktaalidentificatie 1.14.0
- Voer een upgrade uit naar .NET 8.0
- Beveiligingsproblemen beperken
Neurale tekst naar spraak 3.3.0
- Voer een upgrade uit naar .NET 8.0
- Beveiligingsproblemen beperken
Spraak naar tekst 4.8.0
- Voer een upgrade uit naar .NET 8.0
- Beveiligingsproblemen beperken
- Herkenningsengine upgraden
- Los het probleem op waarbij PropertyId.Speech_SegmentationSilenceTimeoutMs werd genegeerd.
- Afgeschafte modellen bijwerken
- Verwijder de uk-UA landinstelling

Release februari 2024

Voeg ondersteuning toe voor de nieuwste modelversies:

Aangepaste spraak naar tekst 4.6.0
Spraak naar tekst 4.6.0
Neurale tekst naar spraak 3.1.0

Voer een upgrade uit van de spraak-naar-tekstonderdelen naar de nieuwste versie. Upgrade alle es lokale modellen naar de nieuwste versie. Vergroot de mediatransformatiebuffer voor toepassingen van spraak naar tekst.

Uitgave van november 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Aangepaste spraak naar tekst 4.5.0
Spraak naar tekst 4.5.0
Neurale tekst naar spraak 2.19.0

Release van oktober 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Aangepaste spraak naar tekst 4.4.0
Spraak naar tekst 4.4.0
Neural text naar spraak 2.18.0

Los een aantal hoge risico's kwetsbaarheden op.

Verwijder overbodige logs in containers.

Upgrade het interne media-component naar de nieuwste versie.

Voeg ondersteuning toe voor spraak en-IN-NeerjaNeural.

Release van september 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Spraaktaalidentificatie 1.12.0
Aangepaste spraak naar tekst 4.3.0
Spraak naar tekst 4.3.0
Neurale tekst naar spraak 2.17.0

Upgrade aangepaste spraak-naar-tekst en spraak-naar-tekst naar het nieuwste framework.

Los beveiligingsproblemen op.

Voeg ondersteuning toe voor spraak ar-AE-FatimaNeural.

Release van juli 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Aangepaste spraak naar tekst 4.1.0
Spraak naar tekst 4.1.0
Neurale tekst naar spraak 2.15.0

Los het probleem op van het uitvoeren van spraak-naar-tekstcontainer via docker koppelopties met lokale aangepaste modelbestanden.

Los het probleem op dat in sommige gevallen het RECOGNIZING-evenement niet wordt weergegeven als reactie via de Speech SDK.

Los beveiligingsproblemen op.

Release juni 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Aangepaste spraak naar tekst 4.0.0
Spraak naar tekst 4.0.0
Neurale tekst naar spraak 2.14.0

On-premises spraak-naar-tekst afbeeldingen zijn geüpgraded naar .NET 6.0

Voer een upgrade uit voor weergavemodellen voor lokalisaties, waaronder en-us, ar-eg, ar-bh, ja-jp en ko-kr, en meer.

Werk het spraak-naar-tekst containeronderdeel bij om beveiligingsproblemen op te lossen.

Voeg ondersteuning toe voor lokale stemmen de-DE-AmalaNeural, de-AT-IngridNeural, de-AT-JonasNeural, en en-US-JennyMultilingualNeural

Release van mei 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Custom spraak naar tekst 3.14.0
Spraak naar tekst 3.14.0
Neurale tekst naar spraak 2.13.0

Los het probleem met de interpunctie op he-IL

Kwetsbaarheden oplossen

Nieuwe stem voor taalinstelling en-US-MichelleNeuraltoevoegen en es-MX-CandelaNeural

2023-apriluitgave

Beveiligingsupdates

Kwetsbaarheden oplossen

Release van maart 2023

Voeg ondersteuning toe voor de nieuwste modelversies:

Aangepaste spraak naar tekst 3.12.0
Spraak naar tekst 3.12.0
Spraaktaalidentificatie 1.11.0
Neurale tekst naar spraak 2.11.0

Kwetsbaarheden oplossen

Het probleem met tr-TR hoofdlettergebruik oplossen

De spraak-naar-tekstweergavemodellen en-US upgraden

Voeg ondersteuning toe voor de ar-AE-HamdanNeural standaardstem.

Release februari 2023

Nieuwe containerversies

Ondersteuning toevoegen voor de nieuwste modelversies:

Aangepaste spraak naar tekst 3.11.0
Spraak naar tekst 3.11.0
Neurale tekst naar spraak 2.10.0

Kwetsbaarheden oplossen

Reguliere upgrade voor spraakmodellen

Nieuwe Abraic-landinstellingen toevoegen:

ar-IL
ar-PS

Hebreeuwse en Turkse weergavemodellen upgraden

Release januari 2023

Nieuwe containerversies

Ondersteuning toevoegen voor de nieuwste modelversies:

Aangepaste spraak naar tekst 3.10.0
Spraak naar tekst 3.10.0
Neurale tekst naar spraak 2.9.0

Probleem met hypothesemodus oplossen

Probleem met HTTP-proxy oplossen

Aangepaste spraak-naar-tekstcontainer niet-verbonden modus

CNV-ondersteuning voor niet-verbonden containers toevoegen aan TTS-front-end

Voeg ondersteuning toe voor deze taalstemmen:

da-DK-ChristelNeural
da-DK-JeppeNeural
en-IN-PrabhatNeural

2022-december uitgave

Nieuwe containerversies

Ondersteuning toevoegen voor de nieuwste modelversies:

Aangepast spraak-naar-tekst 3.9.0
Spraak naar tekst 3.9.0
Neurale tekst-naar-spraak 2.8.0

Probleem met ipv4/ipv6 oplossen

Probleem met beveiligingsproblemen oplossen

2022-november uitgave

Nieuwe containerversies

Ondersteuning toevoegen voor de nieuwste modelversies:

Aangepaste spraak-naar-tekst 3.8.0
Spraak naar tekst 3.8.0
Neurale tekst naar spraak 2.7.0

Release van oktober 2022

Nieuwe containerversies

Ondersteuning toevoegen voor de nieuwste modelversies:

Custom spraak naar tekst 3.7.0
Spraak naar tekst 3.7.0
Neural tekst naar spraak 2.6.0

Release van september 2022

Spraak naar tekst 3.6.0-amd64

Voeg ondersteuning toe voor de nieuwste modelversies.

Voeg ondersteuning toe voor deze landinstellingen:

az-az
bn-in
bs-ba
cy-gb
eu-es
fa-IR
gl-es
he-il
hy-am
it-ch
ka-ge
kk-kz
mk-mk
mn-mn
ne-np
ps-af
matig
sq-al
wuu-cn
yue-cn
zh-cn-Sichuan

Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.

Aangepaste spraakherkenning 3.6.0-amd64

Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.

Neurale tekst naar spraak v2.5.0

Voeg ondersteuning toe voor deze standaardstemmen:

az-az-babekneural
az-az-banuneural
fa-ir-dilaraneural
fa-ir-faridneural
fil-ph-angeloneural
fil-ph-blessicaneural
he-il-avrineural
he-il-hilaneural
id-id-ardineural
id-id-gadisneural
ka-ge-ekaneural
ka-ge-giorgineural

Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.

2022-release mei

Spraak-taal-detectie Container v1.9.0-amd64-preview

Bugfixes voor spraaktaaldetectie.

Release van maart 2022

Custom spraak naar tekst Container v3.1.0

Voeg ondersteuning toe om weergavemodellen op te halen.

Release van januari 2022

Spraak naar tekst Container v3.0.0

Voeg ondersteuning toe voor het gebruik van containers in niet-verbonden omgevingen.

Container voor spraak naar tekst v2.18.0

Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.

Neurale-neurale tekst naar spraakcontainer v1.12.0

Voeg ondersteuning toe voor deze standaardstemmen: am-et-amehaneural, am-et-mekdesneural, so-so-muuseneuralen so-so-ubaxneural.

Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.

Delen via

Wat is er nieuw in Azure AI Speech?

Recente hoogtepunten

Release-opmerkingen

Speech SDK 1.44.1: Patchrelease

Bugreparaties

Speech SDK 1.44: mei 2025-release

Nieuwe functies:

Bugreparaties

Voorbeelden

Speech SDK voor JavaScript

Nieuwe functies:

Bugreparaties

Speech CLI (SPX)

Nieuwe functies

Bugreparaties

Speech SDK 1.43: release maart 2025

Nieuwe functies:

Bugreparaties

Voorbeelden

Speech SDK 1.42.0: release van december 2024

Nieuwe functies

Bugreparaties

Voorbeelden

2024-november uitgave

Azure AI Speech Toolkit-extensie voor Visual Studio Code

Codevoorbeelden voor tekst-naar-spraak-avatar

Speech SDK 1.41.1: 2024-oktober release

Nieuwe functies

Oplossingen voor bugs

Ingrijpende Wijzigingen

Speech SDK 1.40: 2024-augustus uitgave

Nieuwe functies

Bugreparaties

Voorbeelden

Speech SDK 1.38.0: juni 2024-release

Nieuwe functies

Bugreparaties

Voorbeelden

Speech SDK 1.37.0: 2024-apriluitgave

Nieuwe functies

Bugreparaties

Voorbeelden

Speech SDK 1.36.0: release maart 2024

Nieuwe functies

Bugreparaties

Voorbeelden

Speech SDK 1.35.0: uitgave februari 2024

Nieuwe functies

Bugreparaties

Voorbeelden

Speech SDK 1.34.1: Release van Januari 2024

Ingrijpende wijzigingen

Nieuwe functies

Bugreparaties

Speech SDK 1.34.0: november 2023 uitgave

Ingrijpende wijzigingen

Nieuwe functies

Bugreparaties

Voorbeelden

Speech CLI 1.34.0: release van november 2023

Nieuwe functies

Bugreparaties

Release van Speech SDK 1.33.0: oktober 2023

** Melding van ingrijpende wijziging

Nieuwe functies

Bugreparaties

Voorbeelden

Speech CLI 1.33.0: oktober 2023 uitgave

Nieuwe functies

Bugreparaties

Speech SDK 1.32.1: september 2023 uitgave

Bugreparaties

Voorbeelden

Speech SDK 1.31.0: release van augustus 2023

Nieuwe functies

Ingrijpende wijzigingen

Bugreparaties

Voorbeelden

Speech SDK 1.30.0: release van juli 2023