Azure Speech wordt doorlopend bijgewerkt. Om up-to-date te blijven met recente ontwikkelingen, biedt dit artikel informatie over nieuwe releases en functies.
Belangrijk
Speech SDK 1.48.2 en nieuwere releases bevatten een kritieke oplossing voor CRL-partitionering (Certificate Revocation List) in Linux en Android. Als u een platform gebruikt waarvoor CRL-controle is ingeschakeld, voert u vóór 1 juli 2026 een upgrade uit naar 1.48.2 of hoger. Zie CRL-compatibiliteitsupdate voor meer informatie.
Belangrijk
Inhoudsevaluatie (preview) via de Speech SDK is in juli 2025 buiten gebruik gesteld. In plaats daarvan kunt u Azure OpenAI-modellen gebruiken om resultaten van inhoudsevaluatie op te halen, zoals beschreven in de documentatie voor de evaluatie van content.
Speech SDK 1.50: release van 2026-mei
Nieuwe functies:
- Er is ondersteuning toegevoegd voor dynamische spraakconfiguratie per doeltaal tijdens vertaalupdates.
- Er is ondersteuning toegevoegd voor automatische uitzetting van de brontaal in spraakherkenning.
- Android OpenSSL bijgewerkt naar 3.0.20.
- Er is ondersteuning toegevoegd voor het configureren van gedrag na verwerking via PostProcessingOption om de uiteindelijke nauwkeurigheid van transcripties te verbeteren.
Insectenmoeilijke:
- Er is een TTS-verbindingsracevoorwaarde opgelost.
- Er is een Android-crash opgelost wanneer EventLoggerCallback wordt gebruikt.
- Er is een probleem opgelost met URL-queryparameters die worden verlaagd na omleiding.
- Er zijn beveiligingsproblemen in de JSON-parser opgelost.
Monsters:
Speech SDK voor JavaScript
Nieuwe functies:
- Er is ondersteuning toegevoegd voor het configureren van gedrag na verwerking via PostProcessingOption om de uiteindelijke nauwkeurigheid van transcripties te verbeteren.
Insectenmoeilijke:
- Er is een ineffectieve proxyconfiguratie opgelost wanneer SpeechConfig.setProxy(...) wordt gebruikt in recente Node.js versies.
Speech SDK 1.49.1: release van 2026-april
Insectenmoeilijke:
- Er is een crash opgelost in de verwerking van ingesloten spraaktelemetrie.
Speech SDK 1.49: release van 2026-april
Opmerkingen over ondersteuning voor het doelplatform:
- Android x86-ondersteuning wordt verwijderd in deze release.
Nieuwe functies:
- Android OpenSSL bijgewerkt naar 3.0.19.
-
Python: Geoptimaliseerd voor de grootte van het Linux-wiel.
Insectenmoeilijke:
- Geheugenlekken in ingesloten spraak opgelost.
- Vaste symbolen zijn niet correct getranscribeerd in ingesloten spraakherkenning.
-
Python: Opgeloste spraaksynthese gebeurtenis verwerkt lekken.
Speech SDK voor JavaScript
Nieuwe functies:
- Verwerking toegevoegd voor
PropertyId.SpeechServiceResponse_PostProcessingOption.
- Latentiemetingen voor spraaksynthese toegevoegd.
- Ondersteuning voor tekststreaming voor spraaksynthese toegevoegd.
- Er is ondersteuning toegevoegd voor het bijwerken van vertaalsynthese wanneer talen worden gewijzigd.
Insectenmoeilijke:
- Gedetailleerde herkenningsresultaten zijn niet correct aangevraagd.
- Oneindige recursie opgelost bij gebruik
DialogServiceConnector met een ongeldig token.
- Url-omleiding van spraaksynthese werkt niet met een door de gebruiker opgegeven pad.
Speech SDK 1.48.2: release van 2026-februari
Belangrijk
Deze release bevat een kritieke oplossing voor CRL-partitionering (Certificate Revocation List) in Linux en Android. Als u een van beide platforms gebruikt waarvoor CRL-controle is ingeschakeld, voert u vóór 1 juli 2026 een upgrade uit naar 1.48.2. Zie CRL-compatibiliteitsupdate voor meer informatie.
Insectenmoeilijke:
- Opgeloste CRL-cachesleutellogica in Linux en Android om gepartitioneerde CRL's correct te verwerken. De SDK gebruikt nu zowel de naam van de verlener als het CRL-distributiepunt als de cachesleutel, waardoor
X509_V_ERR_DIFFERENT_CRL_SCOPE (fout 44) fouten worden voorkomen bij het maken van verbinding tussen Azure regio's of na het rouleren van certificaten.
- Mogelijke verbindingsfouten na certificaatrotatie op Linux en Android opgelost wanneer CRL-controle is ingeschakeld.
Speech SDK 1.48.1: release van 2026-februari
Opmerkingen over ondersteuning voor het doelplatform:
- Ondersteuning voor Android x86 wordt na deze release verwijderd.
Nieuwe functies:
- CRL-controles zijn standaard uitgeschakeld in Linux en Android.
- Verbeterde verwerking en logboekregistratie van netwerkfouten.
- Geoptimaliseerd voor de bouwtijd van grote woordgroepenlijsten.
-
Java: Ondersteuning toegevoegd voor spraaksyntheseinvoertekststreaming.
-
Java: Verbeterd JNI-geheugenbeheer.
-
Javascript: Metrische gegevens voor herkenningslatentie: herkenningsresultaten bevatten nu SpeechServiceResponse_RecognitionLatencyMs eigenschap die end-to-end latentie meet van audio-invoer tot resultaat.
-
Javascript: Time-out voor Recognizers stoppen : de eigenschap New Recognizer_StopTimeoutMs schakelt time-outbeveiliging in voor stopContinuousRecognitionAsync(). Als de service niet binnen de opgegeven tijd wordt voltooid, wordt de bewerking onmiddellijk geannuleerd in plaats van voor onbepaalde tijd te wachten.
-
Javascript: Avatar Scene Configuration - Nieuwe AvatarSceneConfig-klasse maakt het configureren van avatarzoom, positie (X/Y), rotatie (X/Y/Z) en amplitude mogelijk. Scènes kunnen tijdens runtime worden bijgewerkt via AvatarSynthesizer.updateSceneAsync().
Insectenmoeilijke:
- Er is een crash opgelost in de dicteermodus wanneer logboekregistratie is ingeschakeld.
- Opgeloste CRL-gerelateerde geheugenlekken in de netwerkstack.
- Er zijn prestatiemeteritems opgelost die soms ontbreken in ingesloten spraakherkenning.
- Vaste stiltelengtetoewijzing voor interpunctie in ingesloten spraaksynthese.
- Het opslaan van woordgrenzen in cache in hybride spraaksynthese is opgelost.
-
Javascript: Automatische brontaaldetectie accepteert nu de taalparameter leeg/leeg 'van'.
-
JavaScript: toegevoegd @azure/core-auth als SDK-afhankelijkheid voor verbeterde Azure identiteitsintegratie.
Monsters:
Java, Python: Bijgewerkte versies van meerdere afhankelijkheden om beveiligingsproblemen op te lossen.
Speech SDK 1.47: release van 2025-november
Nieuwe functies:
- Het standaardbeleid is gewijzigd om fouten te negeren vanwege netwerkvoorwaarden die toegang tot online certificaatintrekkingsgegevens op Linux-clients verhinderen.
- [JavaScript] Er is ondersteuning toegevoegd voor het opgeven van de naam van het basismodel voor foto-avatars.
Insectenmoeilijke:
Voorbeeldupdates:
- Voorbeelden van intentieherkenning verwijderd (behalve de zelfstandige implementatie van intentieherkenning in C++) vanwege de buitengebruikstelling van de service.
- Voorbeelden van sprekerherkenning zijn verwijderd vanwege de buitengebruikstelling van de service.
- Verwijderde Unity-voorbeelden omdat de laatste Speech SDK Unity-pakketten zijn gepubliceerd voor de 1.44-release en er is geen directe ondersteuning meer.
Belangrijke wijzigingen:
- Ondersteuning voor intentieherkenning is verwijderd vanwege de buitengebruikstelling van de service.
- Ondersteuning voor sprekerherkenning is verwijderd vanwege de buitengebruikstelling van de service.
Speech SDK 1.46: release van 2025-september
Nieuwe functies:
- Er is ondersteuning toegevoegd voor vertrouwelijkheid van spraakstartgebeurtenissen met
Speech_StartEventSensitivity eigenschap.
- Afgeschafte
SpeechServiceConnection_EndSilenceTimeoutMs eigenschap.
- De functionaliteit voor inhoudsevaluatie in uitspraakbeoordeling is buiten gebruik gesteld.
- Android OpenSSL bijgewerkt naar 3.0.17.
- Er is een groottelimiet toegevoegd aan de telemetriewachtrij om groei in geheugengebruik te voorkomen.
- Er is een time-outbeveiliging toegevoegd voor het lezen van caches in TTS om potentiële IO-vastlopers te voorkomen.
- Configureerbare eigenschappen toegevoegd om het gedrag van de URL-omleidingscache te beheren.
- [C#] Er is ondersteuning toegevoegd voor logboekregistratie op basis van EventSource .
- [Python] Er is ondersteuning toegevoegd voor AzureKeyCredential-verificatie.
Insectenmoeilijke
- Er is een ja-JP uitspraakprobleem opgelost in ingesloten tekst-naar-spraak.
- Er is een aanzienlijke toename van het geheugengebruik gedurende een lange periode opgelost in ingesloten spraak-naar-tekst.
- Vastgelopen crash veroorzaakt door racevoorwaarde tijdens time-out stoppen van herkenning.
- [JavaScript] Er is een probleem opgelost waarbij
fromHost de Docker-containerservice niet werkte.
Monsters
- Voorbeelden bijgewerkt om het gebruik van
AzureKeyCredential en Microsoft Entra ID token credential-verificaties te demonstreren.
- [JavaScript, Python] Voorbeelden bijgewerkt voor gebruik van
fromEndpoint.
Speech SDK 1.45: release van 2025-juli
Nieuwe functies:
- Er is ondersteuning toegevoegd voor het instellen van het grammaticagewicht van de frasenlijst.
- Er zijn specifiekere foutcodes toegevoegd voor het openen van bestanden.
- Ondersteuning voor Unicode-paden bijgewerkt, zodat SDK-Windows DLL's zich onder niet-ASCII-paden kunnen bevinden.
- Beschrijvingen van segmentatiestrategieeigenschappen bijgewerkt om te worden afgestemd op de servicelogica.
- [C#, Java] Ondersteuning toegevoegd voor verificatie met behulp van ApiKeyCredential.
Insectenmoeilijke
- De initialisatiefout Microsoft Audio Stack (MAS) over microfoongeometrie in bepaalde regio's is opgelost.
- Vaste instellingen voor grof taalgebruik werken niet in spraakomzetting (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2856).
- Er is een crash opgelost in het patroon voor intentieherkenning dat overeenkomt met de Japanse taal.
- Oplossing voor aangepaste domeinen werkt niet met Node.js v22 of hoger.
Monsters
- [Java] Voorbeeldcode toegevoegd om Microsoft Entra ID verificatie van tokenreferenties te demonstreren.
Speech SDK 1.44.1: Patchrelease
SDK-versie 1.44.1 wordt alleen uitgebracht voor JavaScript met 4 bugfixes:
Insectenmoeilijke
- Er is een uitzondering opgelost waarbij slechts één segmentatiebeheerparameter werd opgegeven.
- enableDictation is niet correct doorgegeven aan de Speech Service.
- ConversationTranscriber heeft niet het juiste URL-pad gebruikt bij het maken met behulp van de methode fromEndpoint.
- Er is een fout opgelost bij het pushen van gegevens naar een invoerstroom nadat deze is losgekoppeld.
Speech SDK 1.44: release van 2025-mei
Belangrijk
Ondersteuning voor doelplatforms verandert:
- De minimaal ondersteunde Android-versie is nu Android 8.0 (API-niveau 26).
- De publicatie van Speech SDK Unity-pakketten wordt onderbroken na deze release.
Nieuwe functies:
- Ondersteuning toegevoegd voor paginaformaten met Android 16 kB geheugen.
- De latentie van SpeechStartDetected-gebeurtenissen in ingesloten spraakherkenning is verminderd.
- [C++, Python] Er is een methode toegevoegd om de beschikbare grootte van AudioDataStream op te halen.
- [C++, Python] Er is ondersteuning toegevoegd voor aangepaste lexicon-URL's en voorkeurslandinstellingen in spraaksyntheseaanvragen.
- [Java, Python] Er is ondersteuning toegevoegd voor verificatie op basis van Microsoft Entra tokens met automatisch vernieuwen van tokens.
- [Go] Ondersteuning toegevoegd voor gesprektranscriptie.
Insectenmoeilijke
- Opgeloste spraaksynthese werkt niet wanneer brontaaldetectie werd gebruikt.
- Vaste bestandspaden met niet-ASCII-tekens die niet werken voor ingesloten spraakmodellen, KWS-modellen of logboekbestanden (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2288).
- Een NoMatch-lus opgelost in ingesloten spraakherkenning in bepaalde omstandigheden.
- De destructor van systeemeigen objecten is geblokkeerd omdat de herkenning niet is gemarkeerd als gestopt wanneer de verbinding met gebeurtenissen wordt verbroken.
- Probleem opgelost dat het patroon IntentRecognizer niet correct werkt met meerdere bytetekens in bepaalde omstandigheden.
- Het aanroepen van
Close() een verbindingsobject was niet synchroon.
- Er is een racevoorwaarde opgelost in de deallocatie van de verbinding die kan leiden tot een crash.
- [macOS] Er zijn 'Info:'-berichten opgelost die worden weergegeven op de console (https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2610).
Monsters
- [Python] Voorbeeldcode toegevoegd voor
recognizer met behulp van Microsoft Entra tokenreferenties.
Speech SDK voor JavaScript
Nieuwe functies:
- Bijgewerkte ontwikkelingsafhankelijkheid: TypeScript 3.5.3 → 4.5
- TranslationRecognizer is bijgewerkt om standaard V2-eindpunten te gebruiken.
- SpeechRecognizer bijgewerkt om V2-eindpunten te gebruiken.
- Dit resulteert in het niet meer ontvangen van NoMatch-resultaten.
- Er is ondersteuning toegevoegd voor verificatie op basis van Microsoft Entra tokens voor spraakherkenning en vertaling.
- De FromEndpoint-API is bijgewerkt als de aanbevolen methode voor het maken van een SpeechConfig voor de meeste scenario's.
- Van toepassing op het gebruik van:
- SpeechRecognizer
- TranslationRecognizer (via SpeechTranslationConfig)
- ConversationTranscriber
- SpeechSynthesizer
- U kunt nu het eindpunt gebruiken vanuit de Azure-portal voor Spraak- en Microsoft Foundry-resources om een SpeechConfig-object te maken.
- Alle andere methoden voor het maken van een SpeechConfig blijven functioneren en worden ondersteund.
Insectenmoeilijke
Speech SDK 1.43: release van 2025-maart
Nieuwe functies:
- De FromEndpoint-API is bijgewerkt als de aanbevolen methode voor het maken van een SpeechConfig voor de meeste scenario's.
- Van toepassing op het gebruik van:
- SpeechRecognizer
- TranslationRecognizer (via SpeechTranslationConfig)
- ConversationTranscriber
- SpeechSynthesizer In alle programmeertalen behalve JavaScript.
- U kunt nu het eindpunt uit de Azure-portal voor Spraak- en Cognitive Services-resources gebruiken om een SpeechConfig-object te maken.
- Alle andere methoden voor het maken van een SpeechConfig blijven functioneren en worden ondersteund.
- TranslationRecognizer is bijgewerkt om standaard V2-eindpunten te gebruiken.
- Hiermee verplaatst u besturingsparameters van de URL naar in-kanaalberichten wanneer u een V2-eindpunt gebruikt.
- Gedragswijziging: de standaardtaal die wordt geretourneerd voor 'zh' is nu 'zh-CN' in plaats van 'zh-hans'
- Eigenschap-id's toegevoegd voor SpeechSynthesis_FrameTimeoutInterval en SpeechSynthesis_RtfTimeoutThreshold.
- Geoptimaliseerd het aantal keren dat de SDK opnieuw verbinding maakt voor langdurige herkenning.
- [C++, Python] Ondersteuning toegevoegd voor het opgeven van de stijl en temperatuur in tekststreamingaanvragen.
- [C#] Er is ondersteuning toegevoegd voor het automatisch vernieuwen van Microsoft Entra ID token bij het gebruik van FromEndpoint om een configuratieobject te maken.
- Hiermee wordt een afhankelijkheid van de Speech SDK toegevoegd aan de Azure. Core NuGet-pakket.
- De Speech SDK kan nu TokenCredential-afgeleide objecten accepteren voor verificatie bij gebruik van:
- SpeechRecognizer
- TranslationRecognizer
- ConversationTranscriber
- [Objective-C] SPXTranslationRecognizer bijgewerkt ter ondersteuning van automatische detectie van brontaal vanuit open bereik.
- [Objective-C, Python] Diagnostische API's EventLogger, FileLogger en MemoryLogger toegevoegd.
- [Go]: Ondersteuning voor TranslationRecognizer toegevoegd
Insectenmoeilijke
Monsters
- [C++] Er is een voorbeeld toegevoegd voor zelfstandige intentieherkenning met behulp van patroonkoppeling.
- Met de buitengebruikstelling van de LUIS-service in oktober 2025 wordt de Speech SDK ook buiten gebruik gesteld van de intentRecognizer-objectfamilie.
- Daarvoor wilden we de implementatie voor patroonkoppeling delen.
- [C++, C#, Java, Python] De meeste voorbeelden bijgewerkt voor het gebruik van De FromEndpoint-API in plaats van FromSubscription.
- [C#] Er is een voorbeeld van een scenario toegevoegd voor een spraakherkenningstoepassing met meerdere lagen.
- Demonstreert een methodologie voor audioherhaling en opnieuw verbinding maken vanaf een edge-apparaat naar een service in de middelste laag die vervolgens audio doorstuurt naar de Speech Service via de Speech SDK
- [C#] Bijgewerkte voorbeelden voor het automatisch vernieuwen van Microsoft Entra ID token.
- [Python] Er zijn voorbeelden toegevoegd voor nieuwe diagnostische API's.
- [Unity] Er zijn instructies toegevoegd voor het installeren van de nieuwe Azure. Kernafhankelijkheid.
Speech SDK 1.42.0: release van 2024-december
Nieuwe functies
- Java: Diagnostische logboekregistratie-API's toegevoegd met behulp van klassen FileLogger, MemoryLogger, EventLogger en SpxTrace.
- Ondersteuning voor het verzenden van JSON-eigenschap 'details' van de deelnemer aan de vergadering naar de service
- Go: Openbare eigenschaps-id toegevoegd SpeechServiceConnection_ProxyHostBypass om hosts op te geven waarvoor de proxy niet wordt gebruikt.
- JavaScript, Go: Openbare eigenschaps-id toegevoegd Speech_SegmentationStrategy om te bepalen wanneer een gesproken woordgroep is beëindigd en er een definitief herkend resultaat moet worden gegenereerd (inclusief semantische segmentatie)
- JavaScript, Go: Id van openbare eigenschap toegevoegd Speech_SegmentationMaximumTimeMs het einde van een gesproken woordgroep bepalen op basis van tijd in Java, Python, C#, C++
Insectenmoeilijke
- Er is een vaste ingesloten TTS-spraak (opnieuw) geladen voor elke synthese als de naam van de stem niet is ingesteld.
- Er zijn offsetberekeningsproblemen opgelost bij het gebruik van MeetingTranscriber in sommige scenario's.
- Er is een mogelijke impasse opgelost bij het gelijktijdig registreren van meerdere listeners voor diagnostische gebeurtenissen.
- (JavaScript) Mogelijke verloren NoMatch-resultaten opgelost aan het einde van de audio. Deze oplossing is ook afgestemd op het gedrag aan het einde van de spraak met de andere SDK-talen en kan ertoe leiden dat sommige lege gebeurtenissen niet meer worden gegenereerd.
- (JavaScript) Fixup-verschuivingen in resultaat-JSON om te worden uitgelijnd met de offset op resultaatobjecten. Voorheen werd alleen de offset-eigenschap van het resultaatobject opgelost om rekening te houden met opnieuw verbinding maken van de service.
- Go-taal: Er is een compilatiefout opgelost https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2639
- Vaste resultaatverschuivingen in transcriptie van vergaderingen wanneer er opnieuw verbinding wordt gemaakt met de service.
- Er is een impasse opgelost in logboekregistratie.
Monsters
- Bijgewerkte C#-voorbeelden om .NET 8.0 te gebruiken.
- Java voorbeeld gebruikt u de API voor diagnostische logboekregistratie met het gebruik van de nieuwe klassen Diagnostische logboekregistratie.
Release van 2024-november
Azure Speech Toolkit-extensie is nu beschikbaar voor Visual Studio Code gebruikers. Het bevat een lijst met snelstartgidsen voor spraak en scenariovoorbeelden die eenvoudig kunnen worden gebouwd en uitgevoerd met eenvoudige klikken. Zie Azure Speech Toolkit in Visual Studio Code Marketplace voor meer informatie.
Codevoorbeelden voor tekst-naar-spraak-avatar
We hebben tekst toegevoegd aan voorbeelden van avatarcode voor spraak voor Android en iOS. Deze voorbeelden laten zien hoe u realtime tekst gebruikt voor spraak avatars in uw mobiele toepassingen.
Speech SDK 1.41.1: release van 2024-oktober
Nieuwe functies
- Ondersteuning toegevoegd voor Amazon Linux 2023 en Azure Linux 3.0.
- Openbare eigenschaps-id SpeechServiceConnection_ProxyHostBypass toegevoegd om hosts op te geven waarvoor de proxy niet wordt gebruikt.
- Eigenschappen toegevoegd om nieuwe woordgroepensegmentatiestrategieën te beheren.
Insectenmoeilijke
- Er is een probleem opgelost met onvolledige ondersteuning voor geavanceerde modellen voor trefwoordherkenning die na augustus 2024 zijn geproduceerd.
- Er is een geheugenlek in C# opgelost met betrekking tot het gebruik van tekenreeksen.
- Kan SPXAutoDetectSourceLanguageResult niet ophalen van SPXConversationTranscriptionResult in Objective-C en Swift.
- Er is een incidentele crash opgelost bij het gebruik van de Microsoft audiostack in herkenning.
- Hints voor het type opgelost in Python.
https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2539
- De lijst met TTS-stemmen kan niet worden opgehaald bij het gebruik van een aangepast eindpunt.
- Er is een probleem opgelost met het opnieuw initialiseren van ingesloten TTS voor elke spreekaanvraag wanneer de stem wordt opgegeven met een korte naam.
- De API-referentiedocumentatie is opgelost voor de maximale duur van RecognizeOnce-audio.
- Foutafhandeling van willekeurige steekproeven in JavaScript opgelost
- Er is een fout opgelost bij het berekenen van de audio-offset in JavaScript
- Dankzij motamed voor deze bijdrage.
Belangrijke wijzigingen
- Ondersteuning voor trefwoordherkenning op Windows ARM 32-bits is verwijderd omdat de vereiste ONNX-runtime niet beschikbaar is voor dit platform.
Speech SDK 1.40: release van 2024 augustus
Opmerking
Speech SDK versie 1.39.0 was een interne release en ontbreekt niet.
Nieuwe functies
- Ondersteuning toegevoegd voor streaming van
G.722 gecomprimeerde audio in spraakherkenning.
- Ondersteuning toegevoegd voor pitch, rate en volume-instelling in invoertekststreaming in spraaksynthese.
- Ondersteuning toegevoegd voor het streamen van persoonlijke spraakinvoertekst door introductie
PersonalVoiceSynthesisRequest in spraaksynthese. Deze API is in preview en kan worden gewijzigd in toekomstige versies.
- Er is ondersteuning toegevoegd voor het diariseren van tussenliggende resultaten wanneer
ConversationTranscriber deze wordt gebruikt.
- CentOS/RHEL 7-ondersteuning is verwijderd vanwege het einde van de ondersteuning voor CentOS 7 en het einde van de ONDERSTEUNING voor RHEL 7 2.
- Voor het gebruik van ingesloten spraakmodellen is nu een modellicentie vereist in plaats van een modelsleutel. Als u een bestaande ingesloten spraakklant bent en een upgrade wilt uitvoeren, neemt u contact op met uw ondersteuningsmedewerker op Microsoft voor meer informatie over modelupdates.
Insectenmoeilijke
Monsters
- Ingesloten spraakvoorbeelden bijgewerkt om een modellicentie te gebruiken in plaats van een sleutel.
Speech SDK 1.38.0: release van 2024-juni
Nieuwe functies
- Vereisten voor het Linux-platform voor Speech SDK upgraden:
- De nieuwe minimumbasislijn is Ubuntu 20.04 LTS of compatibel met
glibc 2.31 of hoger.
- Binaire bestanden voor Linux x86 worden verwijderd overeenkomstig de ondersteuning van het Ubuntu 20.04-platform.
-
Houd er rekening mee dat RHEL/CentOS 7 tot 30 juni wordt ondersteund (het einde van CentOS 7 en het einde van de ondersteuning voor ONDERHOUD van RHEL 7 2). Binaire bestanden voor deze bestanden worden verwijderd in de Speech SDK 1.39.0-release.
- Voeg ondersteuning toe voor OpenSSL 3 op Linux.
- Voeg ondersteuning toe voor g722-16khz-64kbps audio-uitvoerindeling met spraaksynthese.
- Voeg ondersteuning toe voor het verzenden van berichten via een verbindingsobject met spraaksynthese.
- Voeg Start/StopKeywordRecognition-API's toe in Objective-C en Swift.
- Voeg API toe voor het selecteren van een categorie voor een aangepast vertaalmodel.
- Werk GStreamer-gebruik bij met spraaksynthese.
Insectenmoeilijke
- De fout 'Websocket-berichtgrootte mag niet groter zijn dan 65.536 bytes' tijdens de start-/StopKeywordRecognition.
- Los een Python segmentatiefout op tijdens spraaksynthese.
Monsters
- C#-voorbeelden bijwerken om standaard .NET 6.0 te gebruiken.
Speech SDK 1.37.0: release van 2024-april
Nieuwe functies
- Voeg ondersteuning toe voor invoertekststreaming in spraaksynthese.
- Wijzig de standaard spraaksynthesestem in en-US-AvaMultiplicalNeural.
- Android-builds bijwerken voor gebruik van OpenSSL 3.x.
Insectenmoeilijke
Monsters
- Bijgewerkt voor nieuwe functies.
Speech SDK 1.36.0: release van 2024-maart
Nieuwe functies
- Voeg ondersteuning toe voor taalidentificatie in meertalige vertaling op v2-eindpunten met behulp van AutoDetectSourceLanguageConfig::FromOpenRange().
Insectenmoeilijke
Fix SynthesisCanceled-gebeurtenis niet geactiveerd als stop wordt aangeroepen tijdens de SynthesisStarted-gebeurtenis.
Los een ruisprobleem op ingesloten spraaksynthese.
Herstel een crash in ingesloten spraakherkenning bij het parallel uitvoeren van meerdere recognizers.
Herstel de instelling voor de woordgroepsdetectiemodus op v1/v2-eindpunten.
Oplossingen voor verschillende problemen met Microsoft Audio Stack.
Monsters
- Updates voor nieuwe functies.
Speech SDK 1.35.0: release van februari 2024
Nieuwe functies
- Wijzig de standaardtekst in spraakstem van en-US-JennyMultilingualNeural in en-US-AvaNeural.
- Ondersteuning voor detail op woordniveau in ingesloten spraakomzettingsresultaten met behulp van de gedetailleerde uitvoerindeling.
Insectenmoeilijke
- Corrik de getter-API voor audiodatastreampositie in Python.
- Herstel spraakomzetting met v2-eindpunten zonder taaldetectie.
- Corrigeer een willekeurige crash en dubbele woordgrensgebeurtenissen in ingesloten tekst naar spraak.
- Retourneert een juiste annuleringsfoutcode voor een interne serverfout in WebSocket-verbindingen.
- Los de fout op bij het laden van FPIEProcessor.dll bibliotheek wanneer MAS wordt gebruikt met C#.
Monsters
- Kleine opmaakupdates voor voorbeelden van ingesloten herkenning.
Speech SDK 1.34.1: release van januari 2024
Belangrijke wijzigingen
- Alleen oplossingen voor fouten
Nieuwe functies
- Alleen oplossingen voor fouten
Insectenmoeilijke
- Regressie opgelost die is geïntroduceerd in 1.34.0, waarbij de URL van het service-eindpunt is samengesteld met slechte landinstellingen voor gebruikers in verschillende Regio's in China.
Speech SDK 1.34.0: release van november 2023
Belangrijke wijzigingen
-
SpeechRecognizer wordt bijgewerkt om standaard een nieuw eindpunt te gebruiken (dat wil gezegd, wanneer u niet expliciet een URL opgeeft) die geen queryreeksparameters meer ondersteunt voor de meeste eigenschappen. Gebruik de bijbehorende API-functies in plaats van queryreeksparameters rechtstreeks in te stellen met ServicePropertyChannel.UriQueryParameter.
Nieuwe functies
- Compatibiliteit met .NET 8 (Oplossing voor https://github.com/Azure-Samples/cognitive-services-speech-sdk/issues/2170, met uitzondering van waarschuwing over centos7-x64)
- Ondersteuning voor metrische gegevens over ingesloten spraakprestaties die kunnen worden gebruikt om de mogelijkheid van een apparaat voor het uitvoeren van ingesloten spraak te evalueren.
- Ondersteuning voor brontaalidentificatie in ingesloten meertalige vertaling.
- Ondersteuning voor ingesloten spraak-naar-tekst, tekst naar spraak en vertaling voor iOS en Swift/Objective-C uitgebracht in preview.
- Embedded-ondersteuning wordt geboden in MicrosoftCognitiveServicesSpeechEmbedded-iOS Cocoapod.
Insectenmoeilijke
- Oplossing voor groei van binaire grootte voor iOS SDK x2 keer · Probleem #2113 · Azure-Samples/cognitive-services-speech-sdk (github.com)
- Oplossing voor het niet ophalen van tijdstempels op woordniveau van Azure spraak naar tekst-API · Probleem #2156 · Azure-Samples/cognitive-services-speech-sdk (github.com)
- Oplossing voor de vernietigingsfase van DialogServiceConnector om gebeurtenissen correct te verbreken. Dit veroorzaakte af en toe crashes.
- Oplossing voor uitzondering tijdens het maken van een recognizer wanneer MAS wordt gebruikt.
- FPIEProcessor.dll uit Microsoft. CognitiveServices.Speech.Extension.MAS NuGet-pakket voor Windows UWP x64 en Arm64 waren afhankelijk van VC-runtimebibliotheken voor systeemeigen C++. Het probleem is opgelost door de afhankelijkheid bij te werken om VC-runtimebibliotheken (voor UWP) te corrigeren.
- Oplossing voor [MAS] Terugkerende aanroepen voor recognizeOnceAsync leiden tot SPXERR_ALREADY_INITIALIZED bij het gebruik van MAS · Probleem #2124 · Azure-Samples/cognitive-services-speech-sdk (github.com)
- Oplossing voor ingesloten spraakherkenning loopt vast wanneer woordgroepenlijsten worden gebruikt.
Monsters
- Ingesloten iOS-voorbeelden voor spraak-naar-tekst, tekst naar spraak en vertaling.
Speech CLI 1.34.0: release van november 2023
Nieuwe functies
- Ondersteuning voor woordgrensgebeurtenissen die worden uitgevoerd bij het synthetiseren van spraak.
Insectenmoeilijke
- JMESPath-afhankelijkheid bijgewerkt naar de nieuwste versie, verbetert tekenreeksevaluaties
Speech SDK 1.33.0: release van oktober 2023
Wijzigingsmelding die fouten veroorzaken
- Het nieuwe NuGet-pakket dat is toegevoegd voor Microsoft Audio Stack (MAS) moet nu worden opgenomen in toepassingen die MAS gebruiken in hun pakketconfiguratiebestanden.
Nieuwe functies
- Het nieuwe NuGet-pakket Microsoft toegevoegd. CognitiveServices.Speech.Extension.MAS.nupkg, wat verbeterde echoannuleringsprestaties biedt bij gebruik van Microsoft Audio Stack
- Uitspraakbeoordeling: ondersteuning toegevoegd voor prosody en inhoudsevaluatie, waarmee de gesproken spraak kan worden beoordeeld in termen van prosody, vocabulaire, grammatica en onderwerp.
Insectenmoeilijke
Monsters
Speech CLI 1.33.0: release van oktober 2023
Nieuwe functies
- Ondersteuning voor woordgrensgebeurtenissen die worden uitgevoerd bij het synthetiseren van spraak.
Insectenmoeilijke
Speech SDK 1.32.1: release van september 2023
Insectenmoeilijke
- Updates voor Android-pakketten met de nieuwste beveiligingsoplossingen van OpenSSL1.1.1v
- JS : eigenschap WebWorkerLoadType toegevoegd om het laden van gegevens-URL's voor time-outwerkrol toe te staan
- JS: verbinding met gespreksomzetting na 10 minuten oplossen
- JS: verificatietoken voor gespreksomzetting van gesprek wordt nu doorgegeven aan de verbinding van de vertaalservice
Monsters
Speech SDK 1.31.0: release van augustus 2023
Nieuwe functies
Ondersteuning voor realtime-diarisatie is beschikbaar in openbare preview met de Speech SDK 1.31.0. Deze functie is beschikbaar in de volgende SDK's: C#, C++, Java, JavaScript, Python en Objective-C/Swift.
Gesynchroniseerde spraaksynthese woordgrens en visemegebeurtenissen met audio afspelen
Belangrijke wijzigingen
De naam van het voormalige scenario voor gesprektranscriptie wordt gewijzigd in 'transcriptie van vergadering'. Gebruik bijvoorbeeld MeetingTranscriber in plaats van ConversationTranscriber, en gebruik CreateMeetingAsync in plaats van CreateConversationAsync. Hoewel de namen van SDK-objecten en -methoden zijn gewijzigd, verandert de naam van de functie zelf niet. Gebruik transcriptieobjecten voor vergaderingen voor transcriptie van vergaderingen met gebruikersprofielen en spraakhandtekeningen. De 'gespreksomzetting'-objecten en -methoden worden niet beïnvloed door deze wijzigingen. U kunt het object en de ConversationTranslator bijbehorende methoden nog steeds gebruiken voor het vergaderen van vertaalscenario's.
Voor realtime-diarisatie wordt een nieuw ConversationTranscriber object geïntroduceerd. Het nieuwe objectmodel voor gesprektranscriptie en gesprekspatronen zijn vergelijkbaar met continue herkenning met het SpeechRecognizer object. Een belangrijk verschil is dat het ConversationTranscriber object is ontworpen om te worden gebruikt in een gespreksscenario waarin u meerdere sprekers wilt onderscheiden (diarisatie). Gebruikersprofielen en spraakhandtekeningen zijn niet van toepassing. Zie de quickstart voor realtime diarization voor meer informatie.
In deze tabel ziet u de vorige en nieuwe objectnamen voor realtime diarisatie en transcriptie van vergaderingen. De scenarionaam bevindt zich in de eerste kolom, de vorige objectnamen bevinden zich in de tweede kolom en de nieuwe objectnamen bevinden zich in de derde kolom.
| Scenarionaam |
Vorige objectnamen |
Nieuwe objectnamen |
| Realtime diarisatie |
N/A |
ConversationTranscriber |
| Transcriptie van vergadering |
ConversationTranscriber
ConversationTranscriptionEventArgs
ConversationTranscriptionCanceledEventArgs
ConversationTranscriptionResult
RemoteConversationTranscriptionResult
RemoteConversationTranscriptionClient
RemoteConversationTranscriptionResult
Participant
1
ParticipantChangedReason
1
User
1 |
MeetingTranscriber
MeetingTranscriptionEventArgs
MeetingTranscriptionCanceledEventArgs
MeetingTranscriptionResult
RemoteMeetingTranscriptionResult
RemoteMeetingTranscriptionClient
RemoteMeetingTranscriptionResult
Participant
ParticipantChangedReason
User
Meeting
2 |
1 De Participant, ParticipantChangedReasonen User objecten zijn van toepassing op zowel transcriptie van vergaderingen als scenario's voor het vertalen van vergaderingen.
2 Het Meeting object is nieuw en wordt gebruikt met het MeetingTranscriber object.
Insectenmoeilijke
Monsters
Speech SDK 1.30.0: release van juli 2023
Nieuwe functies
-
C++, C#, Java - Ondersteuning toegevoegd voor
DisplayWords in het gedetailleerde resultaat van Embedded Speech Recognition.
-
Objective-C/Swift - Ondersteuning toegevoegd voor
ConnectionMessageReceived gebeurtenissen in Objective-C/Swift.
-
Objective-C/Swift - Verbeterde modellen voor trefwoordspotting voor iOS. Deze wijziging heeft de grootte van bepaalde pakketten vergroot, die binaire iOS-bestanden bevatten (zoals NuGet, XCFramework). We werken eraan om de grootte voor toekomstige releases te verkleinen.
Insectenmoeilijke
- Er is een geheugenlek opgelost bij het gebruik van spraakherkenning met PhraseListGrammar, zoals gerapporteerd door een klant (GitHub probleem).
- Er is een impasse opgelost in tekst naar de open verbindings-API voor spraak.
Meer notities
-
Java - Sommige intern gebruikte,
public Java API-methoden zijn gewijzigd in pakket internal, protected of private. Deze wijziging mag geen effect hebben op ontwikkelaars, omdat we niet verwachten dat toepassingen deze gebruiken. Hier vermeld voor transparantie.
Monsters
- Nieuwe voorbeelden van uitspraakbeoordeling over het opgeven van een leertaal in uw eigen toepassing
Speech SDK 1.29.0: release van juni 2023
Nieuwe functies
-
C++, C#, Java - Preview van API's voor ingesloten spraakomzetting. U kunt nu spraakomzetting uitvoeren zonder cloudverbinding.
-
JavaScript - Continuous Language Identification (LID) is nu ingeschakeld voor spraakomzetting.
-
JavaScript : communitybijdrage voor het toevoegen van
LocaleName eigenschap aan VoiceInfo klasse. Bedankt GitHub gebruiker shivsarthak voor de pull-aanvraag.
-
C++, C#, Java - Ondersteuning toegevoegd voor het opnieuwamplen van ingesloten tekst naar spraakuitvoer van 16 kHz tot 48 kHz.
- Er is ondersteuning toegevoegd voor
hi-IN landinstellingen in Intent Recognizer met Simple Pattern Matching.
Insectenmoeilijke
- Een crash opgelost die wordt veroorzaakt door een racevoorwaarde in Speech Recognizer tijdens objectvernietiging, zoals te zien is in sommige van onze Android-tests
- Mogelijke impasses in Intent Recognizer opgelost met Simple Pattern Matcher
Monsters
- Nieuwe voorbeelden van ingesloten spraakomzetting
Speech SDK 1.28.0: release van mei 2023
Wijziging die fouten veroorzaken
-
JavaScript SDK: OcSP (Online Certificate Status Protocol) is verwijderd. Hierdoor kunnen clients beter voldoen aan browser- en Node-standaarden voor certificaatafhandeling. Versie 1.28 en hoger bevatten niet langer onze aangepaste OCSP-module.
Nieuwe functies
-
Ingesloten spraakherkenning wordt nu geretourneerd
NoMatchReason::EndSilenceTimeout wanneer er een time-out voor stilte optreedt aan het einde van een utterance. Dit komt overeen met het gedrag bij het uitvoeren van herkenning met behulp van de realtime spraakservice.
-
JavaScript SDK: eigenschappen instellen voor
SpeechTranslationConfig het gebruik van PropertyId enum-waarden.
Insectenmoeilijke
-
C# op Windows - Mogelijke racevoorwaarde/impasse oplossen in Windows audio-extensie. In scenario's die zowel de audio-renderer snel verwijderen als ook de Synthesizer-methode gebruiken om te stoppen met spreken, werd de onderliggende gebeurtenis niet opnieuw ingesteld door stop, en kon ervoor zorgen dat het rendererobject nooit wordt verwijderd, allemaal terwijl het een globale vergrendeling voor verwijdering zou kunnen bevatten, de dotnet GC-thread blokkeert.
Monsters
- Er is een ingesloten spraakvoorbeeld toegevoegd voor MAUI.
- Het ingesloten spraakvoorbeeld voor Android-Java bijgewerkt om tekst naar spraak op te nemen.
Speech SDK 1.27.0: release van april 2023
Melding over aanstaande wijzigingen
- We zijn van plan om OCSP (Online Certificate Status Protocol) te verwijderen in de volgende JavaScript SDK-release. Hierdoor kunnen clients beter voldoen aan browser- en Node-standaarden voor certificaatafhandeling. Versie 1.27 is de laatste release die onze aangepaste OCSP-module bevat.
Nieuwe functies
-
JavaScript : ondersteuning toegevoegd voor microfooninvoer vanuit de browser met sprekeridentificatie en verificatie.
-
Embedded Speech Recognition - Update-ondersteuning voor
PropertyId::Speech_SegmentationSilenceTimeoutMs instelling.
Insectenmoeilijke
-
Algemeen : betrouwbaarheidsupdates in serviceherconnectielogica (alle programmeertalen behalve JavaScript).
-
General - Corrigeer tekenreeksconversies die geheugen op Windows lekken (alle relevante programmeertalen behalve JavaScript).
-
Ingesloten spraakherkenning : herstel crash in Franse spraakherkenning bij het gebruik van bepaalde vermeldingen in de grammaticalijst.
-
Broncodedocumentatie : correcties voor SDK-referentiedocumentatieopmerkingen met betrekking tot audiologboekregistratie in de service.
-
Intentieherkenning : corrigeer prioriteiten van Pattern Matcher met betrekking tot lijstentiteiten.
Monsters
- De verificatiefout in het C#-voorbeeld van gesprektranscriptie (CTS) correct afhandelen.
- Voorbeeld van beoordeling van streaming-uitspraak toegevoegd voor Python, JavaScript, Objective-C en Swift.
Speech SDK 1.26.0: release van maart 2023
Belangrijke wijzigingen
- Bitcode is uitgeschakeld in alle iOS-doelen in de volgende pakketten: Cocoapod met xcframework, NuGet (voor Xamarin en MAUI) en Unity. De wijziging wordt veroorzaakt door de afschaffing van bitcodeondersteuning van Apple vanaf Xcode 14 en hoger. Deze wijziging betekent ook dat als u Xcode 13-versie gebruikt of als u de bitcode expliciet hebt ingeschakeld voor uw toepassing met behulp van de Speech SDK, er mogelijk een fout optreedt met de tekst 'framework bevat geen bitcode en u moet deze opnieuw opbouwen'. U kunt dit probleem oplossen door ervoor te zorgen dat de doelen bitcode hebben uitgeschakeld.
- Het minimale iOS-implementatiedoel wordt bijgewerkt naar 11.0 in deze release, wat betekent dat armv7 HW niet meer wordt ondersteund.
Nieuwe functies
- Ingesloten (on-device) Spraakherkenning ondersteunt nu zowel 8 als 16 kHz sampling rate input audio (16-bits per sample, mono PCM).
- Spraaksynthese rapporteert nu verbindings-, netwerk- en servicelatenties in het resultaat om end-to-end latentieoptimalisatie te helpen.
- Nieuwe regels voor het verbreken van bindingen voor intentieherkenning met eenvoudige patroonkoppelingen. Hoe meer tekenbytes die overeenkomen, winnen patroonovereenkomsten met een lager aantal tekens byte. Voorbeeld: Het patroon 'Select {something} in de rechterbovenhoek' wint over 'Select {something}'
Insectenmoeilijke
- Spraaksynthese: los een fout op waarbij de emoji niet juist is in woordgrensgebeurtenissen.
-
Intent Recognition with Conversational Language Understanding (CLU):
- Intenties uit de CLU Orchestrator-werkstroom worden nu correct weergegeven.
- Het JSON-resultaat is nu beschikbaar via de eigenschaps-id
LanguageUnderstandingServiceResponse_JsonResult.
- Spraakherkenning met trefwoordactivering: Oplossing voor ontbrekende ~150 ms audio na een trefwoordherkenning.
- Oplossing voor Speech SDK NuGet iOS SDK RELEASE-build, gerapporteerd door de klant (GitHub probleem)
Monsters
- Oplossing voor swift iOS-voorbeeld, gerapporteerd door de klant (GitHub probleem)
Speech SDK 1.25.0: release van januari 2023
Belangrijke wijzigingen
- Taalidentificatie-API's (preview) zijn vereenvoudigd. Als u bijwerkt naar Speech SDK 1.25 en een build-einde ziet, gaat u naar de pagina Taalidentificatie voor meer informatie over de nieuwe eigenschap
SpeechServiceConnection_LanguageIdMode. Deze enkele eigenschap vervangt de twee vorige en SpeechServiceConnection_SingleLanguageIdPrioritySpeechServiceConnection_ContinuousLanguageIdPriority. Prioriteit geven tussen lage latentie en hoge nauwkeurigheid is niet meer nodig na recente modelverbeteringen. Nu hoeft u alleen te selecteren of u aan het begin of continue taalidentificatie wilt uitvoeren bij het uitvoeren van continue spraakherkenning of vertaling.
Nieuwe functies
-
C#/C++/Java: Embedded Speech SDK wordt nu uitgebracht onder beperkte openbare preview. Zie de documentatie over Embedded Speech (preview). U kunt nu spraak op het apparaat naar tekst en tekst naar spraak uitvoeren wanneer de cloudverbinding onregelmatig of niet beschikbaar is. Ondersteund op Android-, Linux-, macOS- en Windows-platforms
-
C# MAUI: Ondersteuning toegevoegd voor iOS- en Mac Catalyst-doelen in Speech SDK NuGet (probleem met Customer)
-
Unity: Android x86_64-architectuur toegevoegd aan Unity-pakket (probleem met Aanpas)
-
Ga naar:
- Directe streamingondersteuning voor ALAW/MULAW toegevoegd voor spraakherkenning (probleem van de klant)
- Ondersteuning toegevoegd voor PhraseListGrammar. Bedankt GitHub gebruiker oko voor de bijdrage van de community!
-
C#/C++: Intent Recognizer biedt nu ondersteuning voor conversationele Language Understanding-modellen in C++ en C# met indeling op de Microsoft-service
Insectenmoeilijke
- Een incidentele vastloper in KeywordRecognizer oplossen wanneer u deze probeert te stoppen
-
Python:
- Oplossing voor het ophalen van de resultaten van de uitspraakbeoordeling wanneer
PronunciationAssessmentGranularity.FullText is ingesteld (Aanwijzerprobleem)
- Oplossing voor geslachtseigenschap voor mannelijke stemmen die niet worden opgehaald, wanneer spraaksynthesestemmen worden opgehaald
-
Javascript
- Oplossing voor het parseren van sommige WAV-bestanden die zijn vastgelegd op iOS-apparaten (probleem met Customer)
- JS SDK bouwt nu zonder npm-force-oplossingen te gebruiken (probleem van de klant)
- Conversation Translator stelt nu het service-eindpunt correct in wanneer u een speechConfig-exemplaar gebruikt dat is gemaakt met SpeechConfig.fromEndpoint()
Monsters
Speech SDK 1.24.2: release van november 2022
Nieuwe functies
- Geen nieuwe functies, alleen een ingesloten engineoplossing ter ondersteuning van nieuwe modelbestanden.
Insectenmoeilijke
-
Alle programmeertalen
- Er is een probleem opgelost met versleuteling van ingesloten spraakherkenningsmodellen.
Speech SDK 1.24.1: release van november 2022
Nieuwe functies
Insectenmoeilijke
-
Alle programmeertalen
- Ingesloten TTS-crash herstellen wanneer spraaklettertype niet wordt ondersteund
- Het afspelen van stopSpeaking() kan niet worden gestopt in Linux (#1686)
-
JavaScript SDK
- Regressie opgelost in de wijze waarop audio van gesprekstranscriber wordt verholpen.
-
Java
- Tijdelijk bijgewerkte POM- en Javadocs-bestanden gepubliceerd naar Maven Central om de docs-pijplijn in staat te stellen online referentiedocumenten bij te werken.
-
Python
- Regressie herstellen waarbij Python speak_text(ssml) ongeldigheid retourneert.
Speech SDK 1.24.0: release van oktober 2022
Nieuwe functies
-
Alle programmeertalen: AMR-WB (16khz) toegevoegd aan de ondersteunde lijst met tekst-naar-spraak-audio-uitvoerindelingen
-
Python: Pakket toegevoegd voor Linux Arm64 voor ondersteunde Linux-distributies.
- C#/C++/Java/Python: Ondersteuning toegevoegd voor ALAW & MULAW direct streamen naar de spraakservice (naast de bestaande PCM-stream) met behulp van .
-
C# MAUI: NuGet-pakket bijgewerkt ter ondersteuning van Android-doelen voor .NET MAUI-ontwikkelaars (Probleem metCustomer)
-
Mac: Afzonderlijke XCframework voor Mac toegevoegd, die geen binaire iOS-bestanden bevat. Dit biedt een optie voor ontwikkelaars die alleen binaire Mac-bestanden nodig hebben met behulp van een kleiner XCframework-pakket.
-
Microsoft AudioStack (MAS):
- Wanneer straalvormende hoeken worden opgegeven, wordt het geluid dat buiten het opgegeven bereik afkomstig is beter onderdrukt.
- Ongeveer 70% vermindering van de grootte van
libMicrosoft.CognitiveServices.Speech.extension.mas.so Linux ARM32 en Linux Arm64.
-
Intentieherkenning met behulp van patroonkoppeling:
- Ondersteuning voor orthografie toevoegen voor de talen
fr, , deesjp
- Vooraf samengestelde gehele getallen voor taal
estoegevoegd.
Insectenmoeilijke
-
iOS: spraaksynthesefout in iOS 16 oplossen die wordt veroorzaakt door gecomprimeerde audiodecoderingsfout (Probleem met decustomer).
-
JavaScript:
- Verificatietoken werkt niet wanneer spraaksynthese spraaklijst wordt opgehaald (probleem van de klant).
- Gegevens-URL gebruiken voor het laden van werkrollen (probleem met klant).
- Maak alleen een worklet voor audioprocessor wanneer AudioWorklet wordt ondersteund in de browser (probleem van de klant). Dit was een bijdrage van william Wong. Bedankt William!
- Er is een herkende callback opgelost wanneer luis-antwoord
connectionMessage leeg is (Aanwijzerprobleem).
- Time-out voor spraaksegmentatie juist instellen.
-
Intentieherkenning met behulp van patroonkoppeling:
- Niet-json-tekens in modellen worden nu correct geladen.
- Los het probleem met vasthangen op wanneer
recognizeOnceAsync(text) deze werd aangeroepen tijdens continue herkenning.
Speech SDK 1.23.0: release van juli 2022
Nieuwe functies
-
C#, C++, Java: Ondersteuning toegevoegd voor talen
zh-cn en zh-hk in intentieherkenning met patroonkoppeling.
-
C#: ondersteuning toegevoegd voor
AnyCPU .NET Framework-builds
Insectenmoeilijke
-
Android: Opgeloste OpenSSL-beveiligingsprobleem CVE-2022-2068 door OpenSSL bij te werken naar 1.1.1q
-
Python: Crash oplossen bij gebruik van PushAudioInputStream
-
iOS: Oplossing 'EXC_BAD_ACCESS: Null-aanwijzer proberen te deducteren' zoals gerapporteerd op iOS (GitHub probleem)
Speech SDK 1.22.0: release van juni 2022
Nieuwe functies
-
Java: IntentRecognitionResult-API voor getEntities(), applyLanguageModels() en recognizeOnceAsync(text) toegevoegd ter ondersteuning van de engine voor eenvoudige patroonkoppeling.
-
Unity: Ondersteuning toegevoegd voor Mac M1 (Apple Silicon) voor Unity-pakket (probleem GitHub)
-
C#: Ondersteuning toegevoegd voor x86_64 voor Xamarin Android -probleem (probleem met GitHub)
-
C#: .NET framework minimale versie bijgewerkt naar v4.6.2 voor SDK C#-pakket omdat v4.6.1 buiten gebruik is gesteld (zie Microsoft .NET levenscyclusbeleid voor frameworkonderdelen)
-
Linux: Ondersteuning toegevoegd voor Debian 11 en Ubuntu 22.04 LTS. Ubuntu 22.04 LTS vereist handmatige installatie van bibliothekensl1.1 als een binair pakket (bijvoorbeeld libssl1.1_1.1.1l-1ubuntu1.3_amd64.deb of nieuwer voor x64) of door het compileren van bronnen.
Insectenmoeilijke
-
UWP: OpenSSL-afhankelijkheid verwijderd uit UWP-bibliotheken en vervangen door WinRT-websocket en HTTP-API's om te voldoen aan de beveiligingsnaleving en een kleinere binaire footprint.
-
Mac: Probleem 'MicrosoftCognitiveServicesSpeech Module Niet gevonden' opgelost bij het gebruik van Swift-projecten die gericht zijn op macOS-platform
-
Windows, Mac: Er is een platformspecifiek probleem opgelost waarbij audiobronnen die via eigenschappen zijn geconfigureerd om te streamen, soms achterblijven en uiteindelijk de capaciteit overschreden
Voorbeelden (GitHub)
-
C#: .NET frameworkvoorbeelden bijgewerkt voor gebruik van v4.6.2
-
Unity: Voorbeeld van virtuele assistent opgelost voor Android en UWP
-
Unity: Unity-voorbeelden bijgewerkt voor unity 2020 LTS-versie
Speech SDK 1.21.0: release van april 2022
Nieuwe functies
- Java & JavaScript: Ondersteuning toegevoegd voor continue taalidentificatie bij gebruik van het SpeechRecognizer-object
-
JavaScript: Diagnostische API's toegevoegd om logboekregistratie op consolelogboekniveau en (alleen knooppunt) logboekregistratie in te schakelen, om Microsoft problemen op te lossen die door de klant zijn gerapporteerd
-
Python: Ondersteuning toegevoegd voor gesprektranscriptie
-
Go: Ondersteuning toegevoegd voor Speaker Recognition
-
C++ & C#: ondersteuning toegevoegd voor een vereiste groep woorden in intent recognizer (eenvoudige patroonkoppeling). Bijvoorbeeld: '(set|start|begin) een timer' waarbij 'set', 'start' of 'begin' aanwezig moeten zijn om de intentie te kunnen herkennen.
-
Alle programmeertalen, Spraaksynthese: eigenschap Duur toegevoegd in woordgrensgebeurtenissen. Ondersteuning toegevoegd voor interpunctiegrens en zinsgrens
-
Objective-C/Swift/Java: Resultaten op woordniveau toegevoegd aan het resultaatobject Uitspraakbeoordeling (vergelijkbaar met C#). De toepassing hoeft geen JSON-resultaattekenreeks meer te parseren om informatie op word-niveau op te halen (GitHub probleem)
-
iOS-platform: experimentele ondersteuning toegevoegd voor ARMv7-architectuur
Insectenmoeilijke
-
iOS-platform: Oplossing voor het bouwen van het doel 'Elk iOS-apparaat' bij gebruik van CocoaPod (GitHub probleem)
-
Android-platform: OpenSSL-versie is bijgewerkt naar 1.1.1n om beveiligingsprobleem CVE-2022-0778 op te lossen
-
JavaScript: Probleem opgelost waarbij wav-header niet is bijgewerkt met de bestandsgrootte (GitHub probleem)
-
JavaScript: Oplossing van aanvraag-id-desynchrone vertaalscenario's (GitHub probleem)
-
JavaScript: Probleem oplossen bij het instantiëren van SpeakerAudioDestination zonder stream (probleem GitHub]
-
C++: C++-headers herstellen om een waarschuwing te verwijderen bij het compileren van C++17 of hoger
Speech SDK 1.20.0: release van januari 2022
Nieuwe functies
-
Objective-C, Swift en Python: Ondersteuning toegevoegd voor DialogServiceConnector, gebruikt voor spraakassistentscenario's.
-
Python: ondersteuning voor Python 3.10 is toegevoegd. Ondersteuning voor Python 3,6 is verwijderd per Python end-of-life voor 3,6.
-
Unity: Speech SDK wordt nu ondersteund voor Unity-toepassingen in Linux.
-
C++, C#: IntentRecognizer met behulp van patroonkoppeling wordt nu ondersteund in C#. Daarnaast worden scenario's met aangepaste entiteiten, optionele groepen en entiteitsrollen nu ondersteund in C++ en C#.
-
C++, C#: Verbeterde logboekregistratie van diagnostische gegevens met behulp van nieuwe klassen FileLogger, MemoryLogger en EventLogger. SDK-logboeken zijn een belangrijk hulpprogramma voor Microsoft om door de klant gerapporteerde problemen vast te stellen. Deze nieuwe klassen maken het eenvoudiger voor klanten om Speech SDK-logboeken te integreren in hun eigen logboekregistratiesysteem.
-
Alle programmeertalen: UitspraakassessmentConfig heeft nu eigenschappen voor het instellen van het gewenste phoneme-alfabet (IPA of SAPI) en N-Best Phoneme Count (om te voorkomen dat u een configuratie-JSON hoeft te maken volgens GitHub probleem 1284). Uitvoer op lettergreepniveau wordt nu ook ondersteund.
-
Android, iOS en macOS (alle programmeertalen): GStreamer is niet meer nodig om netwerken met beperkte bandbreedte te ondersteunen. SpeechSynthesizer maakt nu gebruik van de audiocoderingsmogelijkheden van het besturingssysteem om gecomprimeerde audio te decoderen die wordt gestreamd van de tekst naar de spraakservice.
-
Alle programmeertalen: SpeechSynthesizer ondersteunt nu drie nieuwe opus-indelingen voor onbewerkte uitvoer (zonder container), die veel worden gebruikt in scenario's voor live streamen.
-
JavaScript: GetVoicesAsync() API toegevoegd aan SpeechSynthesizer om de lijst met ondersteunde synthesestemmen op te halen (GitHub probleem 1350)
-
JavaScript: GetWaveFormat() API toegevoegd aan AudioStreamFormat ter ondersteuning van niet-PCM-golfindelingen (GitHub probleem 452)
-
JavaScript: Volume getter/setter and mute()/unmute() API's toegevoegd aan SpeakerAudioDestination (GitHub probleem 463)
Insectenmoeilijke
-
C++, C#, Java, JavaScript, Objective-C en Swift: Oplossing voor het verwijderen van een vertraging van 10 seconden tijdens het stoppen van een spraakherkenning die gebruikmaakt van een PushAudioInputStream. Dit is voor het geval dat er geen nieuwe audio wordt gepusht nadat StopContinuousRecognition wordt aangeroepen (GitHub problemen 1318, 331)
-
Eenheid op Android en UWP: Unity-metabestanden zijn opgelost voor UWP, Android Arm64 en Windows Subsystem voor Android (WSA) Arm64 (GitHub probleem 1360)
-
iOS: het compileren van uw Speech SDK-toepassing op een iOS-apparaat wanneer u CocoaPods gebruikt, is nu opgelost (GitHub probleem 1320)
-
iOS: Wanneer SpeechSynthesizer is geconfigureerd voor het rechtstreeks uitvoeren van audio naar een luidspreker, wordt afspelen gestopt aan het begin in zeldzame omstandigheden. Dit is opgelost.
-
JavaScript: Gebruik terugval van scriptprocessor voor microfooninvoer als er geen audiowerklet is gevonden (GitHub probleem 455)
-
JavaScript: Protocol toevoegen aan agent om de fout te beperken die is gevonden met Sentry-integratie (GitHub probleem 465)
-
C++, C#, Python en Java met gedetailleerde herkenningsresultaten. De details omvatten alternatieve herkenningsresultaten, betrouwbaarheidsscore, lexicale vorm, genormaliseerd formulier, gemaskeerde genormaliseerde vorm, met tijdsinstellingen op woordniveau voor elk formulier.
-
iOS-voorbeeld toegevoegd met avFoundation als externe audiobron.
-
Java sample toegevoegd om te laten zien hoe u de SRT-indeling (SubRip Text) kunt ophalen met de WordBoundary-gebeurtenis.
-
Android-voorbeelden voor uitspraakbeoordeling.
-
C++, C# met het gebruik van de nieuwe klassen Diagnostische logboekregistratie.
Speech SDK 1.19.0: release van 2021-nov
Hoogtepunten
De Speaker Recognition-service is nu algemeen beschikbaar. Speech SDK-API's zijn beschikbaar op C++, C#, Java en JavaScript. Met Speaker Recognition kunt u sprekers nauwkeurig verifiëren en identificeren op basis van hun unieke stemkenmerken. Zie de documentatie voor meer informatie over dit onderwerp.
We hebben ondersteuning voor Ubuntu 16.04 verwijderd in combinatie met Azure DevOps en GitHub. Ubuntu 16.04 bereikte het einde van de levensduur in april 2021. Migreer uw Ubuntu 16.04-werkstromen naar Ubuntu 18.04 of hoger.
OpenSSL-koppeling in binaire Linux-bestanden is gewijzigd in dynamisch. De binaire Linux-grootte is met ongeveer 50%verminderd.
Mac M1 ARM-gebaseerde siliciumondersteuning toegevoegd.
Nieuwe functies
C++/C#/Java: Nieuwe API's toegevoegd om ondersteuning voor audioverwerking in te schakelen voor spraakinvoer met Microsoft AudioStack. Documentatie hier.
C++: Nieuwe API's voor intentieherkenning om geavanceerdere patroonkoppeling mogelijk te maken. Dit omvat lijsten en vooraf gedefinieerde gehele getallen en ondersteuning voor groeperingsintenties en entiteiten als modellen (documentatie, updates en voorbeelden zijn in ontwikkeling en worden in de nabije toekomst gepubliceerd).
Mac: Ondersteuning voor op Arm64 (M1) gebaseerde silicium voor CocoaPod-, Python-, Java- en NuGet-pakketten met betrekking tot GitHub probleem 1244.
iOS/Mac: binaire iOS- en macOS-bestanden zijn nu verpakt in xcframework met betrekking tot GitHub probleem 919.
iOS/Mac: Ondersteuning voor Mac-katalysator met betrekking tot GitHub probleem 1171.
Linux: Nieuw tar-pakket toegevoegd voor CentOS7 Over de Speech SDK. Het Linux-.tar-pakket bevat nu specifieke bibliotheken voor RHEL/CentOS 7 in lib/centos7-x64. Speech SDK-bibliotheken in lib/x64 zijn nog steeds van toepassing op alle andere ondersteunde Linux x64-distributies (inclusief RHEL/CentOS 8) en werken niet op RHEL/CentOS 7.
JavaScript: VoiceProfile & SpeakerRecognizer-API's zijn asynchroon/wachtbaar gemaakt.
JavaScript: Ondersteuning toegevoegd voor Azure regio's van de Amerikaanse overheid.
Windows: Ondersteuning toegevoegd voor afspelen op Universal Windows Platform (UWP).
Insectenmoeilijke
Android: OpenSSL-beveiligingsupdate (bijgewerkt naar versie 1.1.1l) voor Android-pakketten.
Python: Opgeloste fout waarbij het selecteren van een luidsprekerapparaat op Python mislukt.
Kern: automatisch opnieuw verbinding maken wanneer een verbindingspoging mislukt.
iOS: Audiocompressie uitgeschakeld op iOS-pakketten vanwege instabiliteit en bitcode-buildproblemen bij het gebruik van GStreamer. Details zijn beschikbaar via GitHub probleem 1209.
Mac/iOS: Voorbeelden en quickstarts bijgewerkt voor het gebruik van het xcframework-pakket.
.NET: Voorbeelden zijn bijgewerkt voor gebruik van .NET core 3.1-versie.
JavaScript: Voorbeeld toegevoegd voor Spraakassistenten.
Speech SDK 1.18.0: release van 2021-juli
Opmerking: Ga hier aan de slag met de Speech SDK.
Overzicht van markeringen
- Ubuntu 16.04 bereikte het einde van de levensduur in april 2021. Met Azure DevOps en GitHub gaan we in september 2021 ondersteuning voor 16.04 weg. Migreer ubuntu-16.04-werkstromen naar ubuntu-18.04 of hoger voor die tijd.
Nieuwe functies
-
C++: Eenvoudig taalpatroon dat overeenkomt met intent Recognizer maakt het nu eenvoudiger om eenvoudige scenario's voor intentieherkenning te implementeren.
-
C++/C#/Java: We hebben een nieuwe API,
GetActivationPhrasesAsync() toegevoegd aan de klasse VoiceProfileClient voor het ontvangen van een lijst met geldige activeringstermen in de registratiefase van Speaker Recognition voor onafhankelijke herkenningsscenario's.
-
Belangrijk: de functie Speaker Recognition is beschikbaar als preview-versie. Alle spraakprofielen die zijn gemaakt in preview, worden 90 dagen nadat de functie Speaker Recognition uit preview is verplaatst naar Algemene beschikbaarheid. Op dat moment werken de preview-spraakprofielen niet meer.
-
Python: ondersteuning toegevoegd voor continue taalidentificatie (LID) op de bestaande
SpeechRecognizer en TranslationRecognizer-objecten.
-
Python: Een nieuw Python object toegevoegd met de naam
SourceLanguageRecognizer om eenmalig of doorlopend LID (zonder herkenning of vertaling) uit te voeren.
-
JavaScript:
getActivationPhrasesAsync API toegevoegd aan VoiceProfileClient klasse voor het ontvangen van een lijst met geldige activeringstermen in de registratiefase van Speaker Recognition voor onafhankelijke herkenningsscenario's.
-
JavaScript
VoiceProfileClient' s enrollProfileAsync API is nu asynchroon te wachten. Zie de onafhankelijke identificatiecode bijvoorbeeld het gebruik.
Verbeteringen
-
Java: AutoCloseable ondersteuning toegevoegd aan veel Java-objecten. Nu wordt het model try-with-resources ondersteund om resources vrij te geven. Zie dit voorbeeld dat gebruikmaakt van try-with-resources. Zie ook de zelfstudie documentatie voor Oracle Java voor De instructie try-with-resources voor meer informatie over dit patroon.
-
De schijfvoetafdruk is aanzienlijk verminderd voor veel platforms en architecturen. Voorbeelden voor het binaire bestand
Microsoft.CognitiveServices.Speech.core: x64 Linux is kleiner (8,0% reductie); Arm64 Windows UWP is 464 kB kleiner (11,5% reductie); x86 Windows is 343 kB kleiner (17,5% reductie); en x64 Windows is kleiner (19,4% reductie).
Insectenmoeilijke
-
Java: Er is een synthesefout opgelost wanneer de synthesetekst surrogaattekens bevat. Details hier.
-
JavaScript: Audioverwerking van browsermicrofoon wordt nu gebruikt
AudioWorkletNode in plaats van afgeschaft ScriptProcessorNode. Details hier.
-
JavaScript: houd gesprekken correct actief tijdens langdurige gespreksomzettingsscenario's. Details hier.
-
JavaScript: Er is een probleem opgelost waarbij recognizer opnieuw verbinding maakt met een mediastream in continue herkenning. Details hier.
-
JavaScript: Er is een probleem opgelost waarbij recognizer opnieuw verbinding maakt met een pushStream in continue herkenning. Details hier.
-
JavaScript: Gecorrigeerde offsetberekening op woordniveau in gedetailleerde herkenningsresultaten. Details hier.
Monsters
- Java quickstartvoorbeelden zijn bijgewerkt here.
- Voorbeelden van JavaScript Speaker Recognition zijn bijgewerkt om nieuw gebruik van
enrollProfileAsync(). Zie voorbeelden here.
Speech SDK 1.17.0: release van 2021-mei
Opmerking
Ga hier aan de slag met de Speech SDK.
Overzicht van markeringen
- Kleinere footprint: we blijven de geheugen- en schijfvoetafdruk van de Speech SDK en de bijbehorende onderdelen verminderen.
- Met een nieuwe zelfstandige Taalidentificatie-API kunt u herkennen welke taal wordt gesproken.
- Ontwikkel mixed reality- en gamingtoepassingen met behulp van Unity in macOS.
- U kunt nu Tekst naar spraak gebruiken naast spraakherkenning vanuit de programmeertaal Go.
- Er zijn verschillende oplossingen voor het oplossen van problemen DIE U, onze gewaardeerde klanten, hebben gemarkeerd op GitHub! DANK U! Blijf de feedback ontvangen.
Nieuwe functies
-
C++/C#: Nieuwe zelfstandige At-Start en continue taaldetectie via de
SourceLanguageRecognizer API. Als u alleen de taal(en) wilt detecteren die in audio-inhoud worden gesproken, is dit de API om dat te doen. Zie de details voor C++ en C#.
-
C++/C#: Spraakherkenning en vertaalherkenning ondersteunen nu zowel at-start als continue taalidentificatie, zodat u programmatisch kunt bepalen welke taal(en) worden gesproken voordat ze worden getranscribeerd of vertaald. Zie de documentatie hier voor Spraakherkenning en hier voor Spraakomzetting.
-
C#: Ondersteuning voor Unity toegevoegd aan macOS (x64). Dit ontgrendelt gebruiksvoorbeelden voor spraakherkenning en spraaksynthese in mixed reality en gaming.
-
Go: We hebben ondersteuning toegevoegd voor spraaksynthesetekst naar spraak naar de programmeertaal Go om spraaksynthese beschikbaar te maken in nog meer gebruiksvoorbeelden. Zie onze documentatie quickstart of onze documentatie voor deductie.
-
C++/C#/Java/Python/Objective-C/Go: De spraaksynthese ondersteunt nu het object
connection. Dit helpt u bij het beheren en bewaken van de verbinding met de Speech-service en is vooral handig om vooraf verbinding te maken om de latentie te verminderen. Zie de documentatie hier.
-
C++/C#/Java/Python/Objective-C/Go: we maken nu de latentie en onderlooptijd beschikbaar in
SpeechSynthesisResult om u te helpen bij het bewaken en diagnosticeren van latentieproblemen met spraaksynthese. Zie de details voor C++, C#, Java, Python, Objective-C en Go.
-
C++/C#/Java/Python/Objective-C: Text to speech now maakt standaard gebruik van neurale stemmen wanneer u geen stem opgeeft die moet worden gebruikt. Dit biedt standaard een hogere betrouwbaarheidsuitvoer, maar verhoogt ook de standaardprijs.
-
C++/C#/Java/Python/Objective-C/Go: We hebben een eigenschap Gender toegevoegd aan de synthesestemgegevens om het gemakkelijker te maken stemmen te selecteren op basis van geslacht. Hiermee wordt GitHub probleem #1055 opgelost.
-
C++, C#, Java, JavaScript: We ondersteunen nu
retrieveEnrollmentResultAsync, getAuthorizationPhrasesAsync en getAllProfilesAsync() in Speaker Recognition om het beheer van alle spraakprofielen voor een bepaald account te vereenvoudigen. Zie de documentatie voor C++, C#, Java, JavaScript. Hiermee wordt GitHub probleem #338 opgelost.
-
JavaScript: Er is een nieuwe poging toegevoegd voor verbindingsfouten waardoor uw op JavaScript gebaseerde spraaktoepassingen robuuster worden.
Verbeteringen
- Binaire linux- en Android Speech SDK-bestanden zijn bijgewerkt om de nieuwste versie van OpenSSL (1.1.1.1k) te gebruiken
- Verbeteringen in codegrootte:
- Language Understanding is nu gesplitst in een afzonderlijke lu-bibliotheek.
- Windows binaire x64-kerngrootte is met 14,4%afgenomen.
- Binaire grootte van Android Arm64-kern is met 13,7%afgenomen.
- andere onderdelen zijn ook kleiner geworden.
Insectenmoeilijke
-
All: Probleem met GitHub opgelost #842 voor ServiceTimeout. U kunt nu lange audiobestanden transcriberen met behulp van de Speech SDK zonder dat de verbinding met de service wordt beëindigd met deze fout. We raden u echter nog steeds aan batchtranscriptie te gebruiken voor lange bestanden.
-
C#: Probleem met GitHub opgelost #947 waarbij uw app niet in slechte staat kon blijven.
-
Java: opgelost GitHub probleem #997 waarbij de Speech-SDK voor Java 1.16 vastloopt bij het gebruik van DialogServiceConnector zonder een netwerkverbinding of een ongeldige abonnementssleutel.
- Er is een crash opgelost bij het plotseling stoppen van spraakherkenning (bijvoorbeeld met Ctrl+C in de console-app).
-
Java: Er is een oplossing toegevoegd voor het verwijderen van tijdelijke bestanden op Windows bij het gebruik van de Speech SDK voor Java.
-
Java: Probleem met GitHub opgelost #994 waarbij het aanroepen van
DialogServiceConnector.stopListeningAsync een fout kan veroorzaken.
-
Java: Er is een probleem opgelost met een klant in de quickstart virtual assistant.
-
JavaScript: Probleem met GitHub opgelost #366 waarbij
ConversationTranslator een fout 'this.cancelSpeech is geen functie' heeft veroorzaakt.
-
JavaScript: probleem opgelost GitHub probleem #298 waarbij het voorbeeld 'Resultaat ophalen als een in-memory stream' hard wordt afgespeeld.
-
JavaScript: Opgelost GitHub probleem #350 waarbij het aanroepen van
AudioConfig kan leiden tot een 'ReferenceError: MediaStream is niet gedefinieerd'.
-
JavaScript: Er is een waarschuwing voor unhandledPromiseRejection opgelost in Node.js voor langdurige sessies.
Monsters
- Documentatie voor Unity-voorbeelden bijgewerkt voor macOS here.
- Een React Native-voorbeeld voor de Azure Spraakherkenningsservice is nu beschikbaar here.
Speech SDK 1.16.0: release van 2021-maart
Opmerking
De Speech SDK op Windows is afhankelijk van de gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.
Nieuwe functies
-
C++/C#/Java/Python: verplaatst naar de nieuwste versie van GStreamer (1.18.3) om ondersteuning toe te voegen voor het transscriberen van media-indelingen op Windows, Linux en Android. Zie de documentatie hier.
-
C++/C#/Java/Objective-C/Python: Ondersteuning toegevoegd voor het decoderen van gecomprimeerde TTS/gesynthetiseerde audio naar de SDK. Als u de uitvoeraudioindeling instelt op PCM en GStreamer beschikbaar is op uw systeem, vraagt de SDK automatisch gecomprimeerde audio aan van de service om bandbreedte te besparen en de audio op de client te decoderen. U kunt instellen
SpeechServiceConnection_SynthEnableCompressedAudioTransmission om deze functie uit te false schakelen. Details voor C++, C#, Java, Objective-C, Python.
-
JavaScript: Node.js gebruikers nu de
AudioConfig.fromWavFileInput API kunnen gebruiken. Hiermee wordt GitHub probleem 252 opgelost.
-
C++/C#/Java/Objective-C/Python:
GetVoicesAsync() methode toegevoegd voor TTS om alle beschikbare synthesestemmen te retourneren. Details voor C++, C#, Java, Objective-C en Python.
-
C++/C#/Java/JavaScript/Objective-C/Python:
VisemeReceived gebeurtenis toegevoegd voor TTS/spraaksynthese om synchrone viseme-animatie te retourneren. Zie de documentatie hier.
-
C++/C#/Java/JavaScript/Objective-C/Python:
BookmarkReached gebeurtenis toegevoegd voor TTS. U kunt bladwijzers instellen in de invoer-SSML en de audio-offsets voor elke bladwijzer ophalen. Zie de documentatie hier.
-
Java: Ondersteuning toegevoegd voor Speaker Recognition-API's. Details hier.
-
C++/C#/Java/JavaScript/Objective-C/Python: Twee nieuwe audio-indelingen toegevoegd met WebM-container voor TTS (Webm16Khz16BitMonoOpus en Webm24Khz16BitMonoOpus). Dit zijn betere indelingen voor het streamen van audio met de Opus-codec. Details voor C++, C#, Java, JavaScript, Objective-C, Python.
-
C++/C#/Java: Ondersteuning toegevoegd voor het ophalen van spraakprofiel voor speaker recognition-scenario. Details voor C++, C# en Java.
-
C++/C#/Java/Objective-C/Python: Ondersteuning toegevoegd voor afzonderlijke gedeelde bibliotheek voor audiomicrofoon en luidsprekerbesturing. Hierdoor kan de ontwikkelaar de SDK gebruiken in omgevingen waarvoor geen vereiste audiobibliotheekafhankelijkheden zijn vereist.
-
Objective-C/Swift: ondersteuning toegevoegd voor moduleframework met parapluheader. Hierdoor kan de ontwikkelaar Speech SDK importeren als een module in iOS-/Mac Objective-C/Swift-apps. Hiermee wordt GitHub probleem #452 opgelost.
-
Python: Ondersteuning toegevoegd voor Python 3.9 en verwijderde ondersteuning voor Python 3,5 per Python end-of-life voor 3,5.
Bekende problemen
-
C++/C#/Java:
DialogServiceConnector kan geen CustomCommandsConfig gebruiken voor toegang tot een toepassing voor aangepaste opdrachten en treedt in plaats daarvan een verbindingsfout op. Dit kan worden omzeild door handmatig uw toepassings-id toe te voegen aan de aanvraag met config.SetServiceProperty("X-CommandsAppId", "your-application-id", ServicePropertyChannel.UriQueryParameter). Het verwachte gedrag van CustomCommandsConfig wordt hersteld in de volgende release.
Verbeteringen
- Als onderdeel van onze inspanningen met meerdere versies om het geheugengebruik en de schijfvoetafdruk van de Speech SDK te verminderen, zijn binaire Android-bestanden nu 3% tot 5% kleiner.
- Verbeterde nauwkeurigheid, leesbaarheid en secties van onze C#-referentiedocumentatie hier.
Insectenmoeilijke
-
JavaScript: Grote WAV-bestandsheaders worden nu correct geparseerd (vergroot het koptekstsegment tot 512 bytes). Hiermee wordt GitHub probleem #962 opgelost.
-
JavaScript: Probleem met timing van microfoon gecorrigeerd als de microfoonstream eindigt voordat de herkenning wordt gestopt, waarbij een probleem wordt opgelost waarbij spraakherkenning niet werkt in Firefox.
-
JavaScript: De initialisatiebelofte wordt nu correct verwerkt wanneer de browser microfoon uitschakelt voordat turnOn is voltooid.
-
JavaScript: We hebben URL-afhankelijkheid vervangen door URL-parse. Hiermee wordt GitHub probleem #264 opgelost.
-
Android: Vaste callbacks werken niet wanneer
minifyEnabled deze is ingesteld op waar.
-
C++/C#/Java/Objective-C/Python:
TCP_NODELAY wordt correct ingesteld op onderliggende socket-IO voor TTS om de latentie te verminderen.
-
C++/C#/Java/Python/Objective-C/Go: Er is een incidentele crash opgelost toen de recognizer vlak na het starten van een herkenning werd vernietigd.
-
C++/C#/Java: Er is een incidentele crash opgelost in de vernietiging van speaker recognizer.
Monsters
-
JavaScript: Browser-voorbeelden hoeven geen afzonderlijke JavaScript-bibliotheekbestanden meer te downloaden.
Speech SDK 1.15.0: release van 2021-januari
Opmerking
De Speech SDK op Windows is afhankelijk van de gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.
Overzicht van markeringen
- Kleinere geheugen- en schijfvoetafdruk waardoor de SDK efficiënter wordt.
- Uitvoerindelingen met een hogere kwaliteit die beschikbaar zijn voor aangepaste neurale spraakvoorbeelden.
- Intent Recognizer kan nu meer retourneren dan de belangrijkste intentie, zodat u een afzonderlijke beoordeling kunt maken over de intentie van uw klant.
- Spraakassistenten en bots zijn nu eenvoudiger in te stellen en u kunt ervoor zorgen dat deze niet meer luistert en meer controle uitoefenen over hoe het reageert op fouten.
- Verbeterde prestaties van het apparaat door het optioneel maken van compressie.
- Gebruik de Speech SDK op Windows ARM/Arm64.
- Verbeterde foutopsporing op laag niveau.
- De functie Uitspraakbeoordeling is nu breder beschikbaar.
- Er zijn verschillende oplossingen voor het oplossen van problemen DIE U, onze gewaardeerde klanten, hebben gemarkeerd op GitHub! DANK U! Blijf de feedback ontvangen.
Verbeteringen
- De Speech SDK is nu efficiënter en lichtgewicht. We hebben een multirelease-inspanning gestart om het geheugengebruik en de schijfvoetafdruk van de Speech SDK te verminderen. Als eerste stap hebben we aanzienlijke verminderingen van de bestandsgrootte in gedeelde bibliotheken op de meeste platforms gemaakt. Vergeleken met de release 1.14:
- 64-bits UWP-compatibele Windows bibliotheken zijn ongeveer 30% kleiner.
- 32-bits Windows bibliotheken zien nog geen verbetering van de grootte.
- Linux-bibliotheken zijn 20-25% kleiner.
- Android-bibliotheken zijn 3-5% kleiner.
Nieuwe functies
-
All: Nieuwe 48 KHz-uitvoerindelingen beschikbaar voor de preview van aangepaste neurale spraak via de TTS spraaksynthese-API: Audio48Khz192KBitRateMonoMp3, audio-48khz-192kbitrate-mono-mp3, Audio48Khz96KBitRateMonoMp3, audio-48khz-96kbitrate-mono-mp3, Raw48Khz16BitMonoPcm, raw-48khz-16bit-mono-pcm, Riff48Khz16BitMonoPcm, riff-48khz-16bit-mono-pcm.
-
Alles: Aangepaste spraak is ook gemakkelijker te gebruiken. Ondersteuning toegevoegd voor het instellen van aangepaste spraak via
EndpointId (C++, C#, Java, JavaScript, Objective-C, Python). Vóór deze wijziging moesten aangepaste spraakgebruikers de eindpunt-URL instellen via de FromEndpoint methode. Klanten kunnen nu de FromSubscription methode net als standaardstemmen gebruiken en vervolgens de implementatie-id opgeven door de instelling in te stellen EndpointId. Dit vereenvoudigt het instellen van aangepaste stemmen.
-
C++/C#/Java/Objective-C/Python: Haal meer dan de belangrijkste intentie van
IntentRecognizer. Het biedt nu ondersteuning voor het configureren van het JSON-resultaat met alle intenties en niet alleen de meest scorende intentie via LanguageUnderstandingModel FromEndpoint methode met behulp van verbose=true de URI-parameter. Hiermee wordt GitHub probleem #880 opgelost. Raadpleeg de bijgewerkte documentatie hier.
-
C++/C#/Java: Zorg ervoor dat uw spraakassistent of bot onmiddellijk niet meer luistert.
DialogServiceConnector (C++, C#, Java) heeft nu een methode StopListeningAsync() bij ListenOnceAsync(). Hierdoor wordt het vastleggen van audio onmiddellijk gestopt en wordt er op een juiste manier gewacht op een resultaat, waardoor het perfect is voor gebruik met 'nu stoppen'-knoppersscenario's.
-
C++/C#/Java/JavaScript: zorg ervoor dat uw spraakassistent of bot beter reageert op onderliggende systeemfouten.
DialogServiceConnector (C++, C#, Java, JavaScript) heeft nu een nieuwe TurnStatusReceived gebeurtenishandler. Deze optionele gebeurtenissen komen overeen met elke ITurnContext-oplossing op de bot en rapporteren uitvoeringsfouten wanneer deze optreden, bijvoorbeeld als gevolg van een onverwerkte uitzondering, time-out of netwerkuitval tussen Direct Line Speech en de bot.
TurnStatusReceived maakt het gemakkelijker om te reageren op foutvoorwaarden. Als een bot bijvoorbeeld te lang duurt voor een back-enddatabasequery (bijvoorbeeld om een product op te zoeken), TurnStatusReceived kan de client weten dat hij of zij kan weten dat hij of zij kan reageren met 'sorry, dat heb ik niet helemaal gedaan, kunt u het opnieuw proberen' of iets dergelijks.
-
C++/C#: gebruik de Speech SDK op meer platforms. Het Speech SDK NuGet-pakket biedt nu ondersteuning voor Windows systeemeigen BINAIRE BESTANDEN van ARM/Arm64 (UWP) om de Speech SDK nuttiger te maken voor meer computertypen.
-
Java:
DialogServiceConnector heeft nu een methode setSpeechActivityTemplate() die eerder onbedoeld is uitgesloten van de taal. Dit komt overeen met het instellen van de eigenschap Conversation_Speech_Activity_Template en vraagt om alle toekomstige Bot Framework-activiteiten die afkomstig zijn van de Direct Line Speech-service, de geleverde inhoud samen te voegen in hun JSON-nettoladingen.
-
Java: Verbeterde foutopsporing op laag niveau. De
Connection klasse heeft nu een MessageReceived gebeurtenis, vergelijkbaar met andere programmeertalen (C++, C#). Deze gebeurtenis biedt toegang op laag niveau tot binnenkomende gegevens van de service en kan nuttig zijn voor diagnostische gegevens en foutopsporing.
-
JavaScript: Eenvoudiger instellen voor spraakassistenten en bots,
BotFrameworkConfigdie nu methoden hebben fromHost() en fromEndpoint() factory's waarmee het gebruik van aangepaste servicelocaties wordt vereenvoudigd en eigenschappen handmatig worden ingesteld. We hebben ook gestandaardiseerde optionele specificatie van het gebruik van botId een niet-standaardbot in de configuratie factory's.
-
JavaScript: Verbeterde prestaties van apparaten via toegevoegde eigenschap voor tekenreeksbeheer voor websocket-compressie. Om prestatieredenen hebben we websocket-compressie standaard uitgeschakeld. Dit kan opnieuw worden uitgevoerd voor scenario's met lage bandbreedte. Meer informatie hier. Hiermee wordt GitHub probleem #242 opgelost.
-
JavaScript: ondersteuning toegevoegd voor lPronunciation Assessment om de uitspraak van spraak te evalueren. Zie de quickstart hier.
Insectenmoeilijke
-
Alle (behalve JavaScript): Er is een regressie opgelost in versie 1.14, waarin te veel geheugen werd toegewezen door de recognizer.
-
C++: Er is een probleem met de garbagecollection opgelost met
DialogServiceConnector, waarbij GitHub probleem #794 is opgelost.
-
C#: Er is een probleem opgelost met het afsluiten van threads waardoor objecten ongeveer een seconde worden geblokkeerd wanneer ze worden verwijderd.
-
C++/C#/Java: er is een uitzondering opgelost waardoor een toepassing meer dan één keer een spraakautorisatietoken of activiteitssjabloon kan instellen op een
DialogServiceConnector.
-
C++/C#/Java: Een herkenningscrash opgelost vanwege een racevoorwaarde in te scheuren.
-
JavaScript:
DialogServiceConnector de optionele botId parameter die is opgegeven in BotFrameworkConfig's factory's, werd niet eerder uitgevoerd. Hierdoor is het nodig om de botId querytekenreeksparameter handmatig in te stellen voor het gebruik van een niet-standaardbot. De bug is gecorrigeerd en botId de waarden die aan 's factory's worden verstrekt BotFrameworkConfig, worden gehonoreerd en gebruikt, inclusief de nieuwe fromHost() en fromEndpoint() toevoegingen. Dit geldt ook voor de applicationId parameter voor CustomCommandsConfig.
-
JavaScript: Probleem met GitHub opgelost #881 waardoor het herkennerobject opnieuw kan worden gebruikt.
-
JavaScript: Er is een probleem opgelost waarbij de SKD meerdere keren in één TTS-sessie werd verzonden
speech.config , bandbreedte verspillen.
-
JavaScript: Vereenvoudigde foutafhandeling bij microfoonautorisatie, waardoor er meer beschrijvend bericht kan opbellen wanneer de gebruiker geen microfooninvoer heeft toegestaan in de browser.
-
JavaScript: probleem opgelost GitHub probleem #249 waarbij typefouten in
ConversationTranslator en ConversationTranscriber een compilatiefout veroorzaakt voor TypeScript-gebruikers.
-
Objective-C: Er is een probleem opgelost waarbij GStreamer-build is mislukt voor iOS op Xcode 11.4, waarbij GitHub probleem #911 is opgelost.
-
Python: Probleem met GitHub opgelost #870, waarbij "DeprecationWarning: de imp-module is afgeschaft ten gunste van importlib".
Monsters
Speech SDK 1.14.0: release van 2020-oktober
Opmerking
De Speech SDK op Windows is afhankelijk van de gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.
Nieuwe functies
-
Linux: Ondersteuning toegevoegd voor Debian 10 en Ubuntu 20.04 LTS.
-
Python/Objective-C: Ondersteuning toegevoegd voor de
KeywordRecognizer-API. De documentatie is hier.
-
C++/Java/C#: Ondersteuning toegevoegd voor het instellen van
HttpHeader sleutel/waarde via ServicePropertyChannel::HttpHeader.
-
JavaScript: ondersteuning toegevoegd voor de
ConversationTranscriber API. Lees hier documentatie.
-
C++/C#: nieuwe
AudioDataStream FromWavFileInput methode toegevoegd (om te lezen. WAV-bestanden) hier (C++) en hier (C#).
-
C++/C#/Java/Python/Objective-C/Swift: Een methode
stopSpeakingAsync() toegevoegd om tekst naar spraaksynthese te stoppen. Lees de referentiedocumentatie here (C++), here (C#), here (Java), here (Python) en here (Objective-C/Swift).
-
C#, C++, Java: Een functie
FromDialogServiceConnector() toegevoegd aan de klasse Connection die kan worden gebruikt voor het bewaken van verbindings- en verbroken gebeurtenissen voor DialogServiceConnector. Lees de referentiedocumentatie here (C#), here (C++) en here (Java).
-
C++/C#/Java/Python/Objective-C/Swift: Ondersteuning toegevoegd voor uitspraakbeoordeling, waarmee de uitspraak van spraak wordt geëvalueerd en sprekers feedback geven over de nauwkeurigheid en de snelheid van gesproken audio. Lees de documentatie hier.
Wijziging die fouten veroorzaken
-
JavaScript: PullAudioOutputStream.read() heeft een wijziging van het retourtype van een interne promise in een native JavaScript Promise.
Insectenmoeilijke
-
Alle: Regressie van 1,13 opgelost waarbij
SetServiceProperty waarden met bepaalde speciale tekens werden genegeerd.
-
C#: Er zijn Windows consolevoorbeelden opgelost op Visual Studio 2019 die geen systeemeigen DLL's kunnen vinden.
-
C#: Vastlopen met geheugenbeheer opgelost als de stream wordt gebruikt als
KeywordRecognizer invoer.
-
ObjectiveC/Swift: Vastlopen met geheugenbeheer opgelost als de stream wordt gebruikt als recognizer-invoer.
-
Windows: Probleem met co-existentie opgelost met BT HFP/A2DP op UWP.
-
JavaScript: Er is een vaste toewijzing van sessie-id's opgelost om logboekregistratie en hulp te verbeteren in interne foutopsporings-/servicecorrelaties.
-
JavaScript: Er is een oplossing toegevoegd voor
DialogServiceConnector het uitschakelen van ListenOnce aanroepen nadat de eerste aanroep is uitgevoerd.
-
JavaScript: Er is een probleem opgelost waarbij resultaatuitvoer slechts 'eenvoudig' zou zijn.
-
JavaScript: Er is een probleem opgelost met continue herkenning in Safari in macOS.
-
JavaScript: CPU-belastingbeperking voor scenario met hoge aanvraagdoorvoer.
-
JavaScript: Toegang tot details van het resultaat van voiceprofielinschrijving toestaan.
-
JavaScript: Oplossing toegevoegd voor continue herkenning in
IntentRecognizer.
-
C++/C#/Java/Python/Swift/ObjectiveC: Onjuiste URL opgelost voor australiaeast en brazilsouth in
IntentRecognizer.
-
C++/C#: Toegevoegd
VoiceProfileType als argument bij het maken van een VoiceProfile object.
-
C++/C#/Java/Python/Swift/ObjectiveC: potentiële
SPX_INVALID_ARG opgelost bij het lezen van AudioDataStream vanaf een bepaalde positie.
-
IOS: Crash opgelost met spraakherkenning op Unity
Monsters
-
ObjectiveC: Voorbeeld toegevoegd voor trefwoordherkenning here.
-
C#/JavaScript: Quickstart toegevoegd voor gesprektranscriptie here (C#) en here (JavaScript).
-
C++/C#/Java/Python/Swift/ObjectiveC: Voorbeeld toegevoegd voor uitspraakbeoordeling here
Bekend probleem
- DigiCert Global Root G2-certificaat wordt niet standaard ondersteund in HoloLens 2 en Android 4.4 (KitKat) en moet worden toegevoegd aan het systeem om de Speech SDK functioneel te maken. Het certificaat wordt in de nabije toekomst toegevoegd aan HoloLens 2 installatiekopieën van het besturingssysteem. Android 4.4-klanten moeten het bijgewerkte certificaat toevoegen aan het systeem.
COVID-19 verkorte tests
Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht die we denken te hebben verbroken, en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons dan weten op GitHub.
Blijf gezond!
Speech SDK 1.13.0: release van 2020 juli
Opmerking
De Speech SDK op Windows is afhankelijk van de gedeelde Microsoft Visual C++ Redistributable voor Visual Studio 2015, 2017 en 2019.
Nieuwe functies
-
C#: ondersteuning toegevoegd voor asynchrone gesprektranscriptie. Zie de documentatie hier.
-
JavaScript: Ondersteuning voor speaker recognition toegevoegd voor zowel browser als Node.js.
-
JavaScript: ondersteuning toegevoegd voor taalidentificatie/taal-id. Zie de documentatie hier.
-
Objective-C: Ondersteuning toegevoegd voor gesprekken met meerdere apparaten (deze service is afgeschaft) en gesprektranscriptie.
-
Python: gecomprimeerde audioondersteuning toegevoegd voor Python op Windows en Linux. Zie de documentatie hier.
Insectenmoeilijke
-
Alles: Er is een probleem opgelost waardoor de KeywordRecognizer de streams niet vooruit zou verplaatsen na een herkenning.
-
All: Er is een probleem opgelost waardoor de stroom die is verkregen uit een KeywordRecognitionResult, het trefwoord niet bevatte.
-
Alles: Er is een probleem opgelost waarbij sendMessageAsync het bericht niet echt via de kabel verzendt nadat de gebruikers klaar zijn met wachten.
-
All: Er is een crash in Speaker Recognition-API's opgelost wanneer gebruikers VoiceProfileClient aanroepen::SpeakerRecEnrollProfileAsync-methode meerdere keren en niet hebben gewacht totdat de aanroepen zijn voltooid.
-
Alles: Logboekregistratie van bestanden in VoiceProfileClient en SpeakerRecognizer-klassen is opgelost.
-
JavaScript: Er is een probleem opgelost met beperking wanneer de browser wordt geminimaliseerd.
-
JavaScript: Er is een probleem opgelost met een geheugenlek op streams.
-
JavaScript: caching toegevoegd voor OCSP-antwoorden van NodeJS.
-
Java: Er is een probleem opgelost waardoor BigInteger-velden altijd 0 retourneren.
-
iOS: er is een issue opgelost met het publiceren van op Speech SDK gebaseerde apps in de iOS App Store.
Monsters
-
C++: Voorbeeldcode toegevoegd voor Speaker Recognition here.
COVID-19 verkorte tests
Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht die we denken te hebben verbroken, en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons dan weten op GitHub.
Blijf gezond!
Speech SDK 1.12.1: release van 2020-juni
Nieuwe functies
-
C#, C++: Sprekerherkenningsvoorbeeld: met deze functie kunt u sprekeridentificatie (wie spreekt?) en sprekercontrole (is de spreker die ze beweren te zijn?). Zie de overzichtsdocumentatie.
Insectenmoeilijke
-
C#, C++: Vaste microfoonopname werkte niet in 1.12 in Speaker Recognition.
-
JavaScript: Fixes voor tekst-naar-spraak in Firefox en Safari in macOS en iOS.
- Oplossing voor Windows toegangsfout in toepassingsverificator bij gesprektranscriptie bij gebruik van een stroom met acht kanalen.
- Oplossing voor Windows toegangsfout van toepassingsverificator bij het vertalen van gesprekken met meerdere apparaten.
Monsters
COVID-19 verkorte tests
Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht die we denken te hebben verbroken, en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons dan weten op GitHub.
Blijf gezond!
Speech SDK 1.12.0: release van 2020 mei
Nieuwe functies
-
Go: Nieuwe Go-taalondersteuning voor spraakherkenning en aangepaste spraakassistent. Stel hier uw ontwikkelomgeving in. Zie de sectie Voorbeelden hieronder voor voorbeeldcode.
-
JavaScript: browserondersteuning toegevoegd voor tekst naar spraak. Zie de documentatie hier.
-
C++, C#, Java: Nieuw
KeywordRecognizer-object en API's die worden ondersteund op Windows-, Android-, Linux- en iOS-platformen. Lees de documentatie hier. Zie de sectie Voorbeelden hieronder voor voorbeeldcode.
-
Java: Gesprek met meerdere apparaten toegevoegd met vertaalondersteuning. Zie het referentiedocument hier.
Verbeteringen en optimalisaties
-
JavaScript: De implementatie van de geoptimaliseerde browsermicrofoon verbetert de nauwkeurigheid van spraakherkenning.
-
Java: Geherstructureerde bindingen met behulp van directe JNI-implementatie zonder SWIG. Deze wijziging vermindert met 10x de bindingsgrootte voor alle Java pakketten die worden gebruikt voor Windows, Android, Linux en Mac en vereenvoudigt de verdere ontwikkeling van de Speech SDK Java implementatie.
-
Linux: ondersteuningsdocumentatie bijgewerkt met de nieuwste specifieke RHEL 7-notities.
- Verbeterde verbindingslogica om meerdere keren verbinding te maken wanneer service- en netwerkfouten optreden.
- De portal bijgewerkt. pagina azure.com Speech Quickstart om ontwikkelaars te helpen de volgende stap in het Azure Speech-traject uit te voeren.
Insectenmoeilijke
-
C#, Java: er is een issue opgelost met het laden van SDK-bibliotheken in Linux ARM (zowel 32-bits als 64-bits).
-
C#: Expliciete verwijdering van systeemeigen ingangen voor TranslationRecognizer, IntentRecognizer en Verbindingsobjecten opgelost.
-
C#: Vast levensduurbeheer voor audio-invoer voor ConversationTranscriber-object.
- Er is een probleem opgelost waarbij
IntentRecognizer de resultaatreden niet goed werd ingesteld bij het herkennen van intenties uit eenvoudige woordgroepen.
- Er is een probleem opgelost waarbij
SpeechRecognitionEventArgs resultaatverschil niet correct werd ingesteld.
- Er is een racevoorwaarde opgelost waarbij SDK een netwerkbericht probeerde te verzenden voordat de websocket-verbinding werd geopend. Was reproduceerbaar voor
TranslationRecognizer het toevoegen van deelnemers.
- Er zijn geheugenlekken opgelost in de engine voor trefwoordherkenning.
Monsters
COVID-19 verkorte tests
Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht die we denken te hebben verbroken, en onze geautomatiseerde tests zijn allemaal geslaagd. Als we iets hebben gemist, laat het ons dan weten over GitHub.
Blijf gezond!
Speech SDK 1.11.0: release van 2020-maart
Nieuwe functies
- Linux: ondersteuning toegevoegd voor Red Hat Enterprise Linux (RHEL)/CentOS 7 x64.
- Linux: ondersteuning toegevoegd voor .NET Core C# in Linux ARM32 en Arm64. Lees hier meer.
- C#, C++: Toegevoegd
UtteranceId aan ConversationTranscriptionResult, een consistente id voor alle tussenliggende en uiteindelijke spraakherkenningsresultaten. Details voor C#, C++.
- Python: Ondersteuning toegevoegd voor
Language ID. Zie speech_sample.py in GitHub opslagplaats.
- Windows: ondersteuning voor gecomprimeerde audio-invoerindeling toegevoegd op Windows platform voor alle Win32-consoletoepassingen. Details hier.
- JavaScript: ondersteuning voor spraaksynthese (tekst-naar-spraak) in NodeJS. Meer informatie here.
- JavaScript: voeg nieuwe API's toe om inspectie van alle verzonden en ontvangen berichten mogelijk te maken. Meer informatie here.
Insectenmoeilijke
- C#, C++: er is een probleem opgelost, waardoor
SendMessageAsync nu binair bericht wordt verzonden als binair type. Details voor C#, C++.
- C#, C++: er is een probleem opgelost waarbij het gebruik van
Connection MessageReceived een gebeurtenis crash kan veroorzaken als Recognizer het object wordt verwijderd voordat Connection het object wordt verwijderd. Details voor C#, C++.
- Android: De grootte van de audiobuffer van de microfoon is afgenomen van 800 ms tot 100 ms om de latentie te verbeteren.
- Android: Er is een issue opgelost met x86 Android-emulator in Android Studio.
- JavaScript: ondersteuning toegevoegd voor regio's in China met de
fromSubscription API. Details hier.
- JavaScript: Voeg meer foutinformatie toe voor verbindingsfouten vanuit NodeJS.
Monsters
- Unity: Openbare sample van intentieherkenning is opgelost, waarbij het importeren van LUIS json mislukt. Details hier.
- Python: Voorbeeld toegevoegd voor
Language ID. Details hier.
Covid19 verkorte tests: Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige tests voor apparaatverificatie uitvoeren als normaal. We kunnen bijvoorbeeld geen microfooninvoer en luidsprekeruitvoer testen in Linux, iOS en macOS. We hebben geen wijzigingen aangebracht die we denken te hebben verbroken op deze platforms en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons weten op GitHub.
Bedankt voor uw voortdurende ondersteuning. Zoals altijd kunt u vragen of feedback posten over GitHub of Stack Overflow.
Blijf gezond!
Speech SDK 1.10.0: release van 2020-februari
Nieuwe functies
- Er zijn Python pakketten toegevoegd ter ondersteuning van de nieuwe 3.8-versie van Python.
- Red Hat Enterprise Linux (RHEL)/CentOS 8 x64-ondersteuning (C++, C#, Java, Python).
- Linux ARM32-ondersteuning voor Debian en Ubuntu.
- DialogServiceConnector ondersteunt nu een optionele parameter 'bot-id' in BotFrameworkConfig. Met deze parameter kunt u meerdere Direct Line Speech-bots gebruiken met één Spraak-resource. Zonder de opgegeven parameter wordt de standaardbot (zoals bepaald door de configuratiepagina van het Direct Line Speech-kanaal) gebruikt.
- DialogServiceConnector heeft nu een eigenschap SpeechActivityTemplate. De inhoud van deze JSON-tekenreeks wordt gebruikt door Direct Line Speech om een groot aantal ondersteunde velden vooraf in te vullen in alle activiteiten die een Direct Line Speech-bot bereiken, inclusief activiteiten die automatisch worden gegenereerd als reactie op gebeurtenissen zoals spraakherkenning.
- TTS maakt nu gebruik van abonnementssleutel voor verificatie, waardoor de eerste bytelatentie van het eerste syntheseresultaat na het maken van een synthesizer wordt verminderd.
- Bijgewerkte spraakherkenningsmodellen voor 19 landinstellingen voor een gemiddelde foutpercentage van 18,6% (es-ES, es-MX, fr-CA, fr-FR, it-IT, ja-JP, ko-KR, pt-BR, zh-CN, zh-HK, nb-NO, fi-FL, ru-RU, pl-PL, ca-ES, zh-TW, th-TH, pt-PT, tr-TR). De nieuwe modellen bieden aanzienlijke verbeteringen in meerdere domeinen, waaronder dicteren, Call-Center transcriptie en scenario's voor video-indexering.
Insectenmoeilijke
- Er is een fout opgelost waarbij gesprekstranscriber niet goed in JAVA-API's wachtte.
- Ontbrekend toevoegen (Ophalen|Eigenschapsmethoden instellen op AudioConfig.
- Corrigeer een TTS-fout waarbij de audioDataStream niet kon worden gestopt wanneer de verbinding mislukt.
- Als u een eindpunt zonder een regio gebruikt, worden USP-fouten voor gespreksvertalers veroorzaakt.
- Id-generatie in Universal Windows-toepassingen maakt nu gebruik van een correct uniek GUID-algoritme; het eerder en onbedoeld standaard ingesteld op een stubbed implementatie die vaak conflicten veroorzaakt via grote sets interacties.
Monsters
Andere wijzigingen
Speech SDK 1.9.0: release van 2020-januari
Nieuwe functies
- Gesprek met meerdere apparaten: verbind meerdere apparaten met hetzelfde spraak- of tekstgesprek en vertaal eventueel berichten die ertussen worden verzonden.
- Ondersteuning voor trefwoordherkenning toegevoegd voor Android-pakket
.aar en ondersteuning toegevoegd voor x86- en x64-smaken.
- Objective-C:
SendMessage en SetMessageProperty methoden toegevoegd aan Connection object. Zie de documentatie hier.
- TTS C++ API ondersteunt
std::wstring nu als tekstinvoer voor synthese, waardoor u geen wstring naar tekenreeks hoeft te converteren voordat u deze doorgeeft aan de SDK. Hier vindt u meer informatie.
- C#: Taal-id en brontaalconfiguratie zijn nu beschikbaar.
- JavaScript: Er is een functie toegevoegd aan
Connection het object om aangepaste berichten van de Speech-service door te geven als callback receivedServiceMessage.
- JavaScript: ondersteuning toegevoegd voor
FromHost API gebruiksgemak met on-premises containers en onafhankelijke clouds. Zie de documentatie hier.
- JavaScript: We honoreren
NODE_TLS_REJECT_UNAUTHORIZED nu dankzij een bijdrage van orgads. Hier vindt u meer informatie.
Belangrijke wijzigingen
-
OpenSSL is bijgewerkt naar versie 1.1.1b en is statisch gekoppeld aan de Speech SDK-kernbibliotheek voor Linux. Dit kan leiden tot een onderbreking als uw Postvak OpenSSL IN niet is geïnstalleerd in de /usr/lib/ssl map in het systeem. Raadpleeg onze documentatie onder Speech SDK-documenten om het probleem te omzeilen.
- We hebben het geretourneerde gegevenstype voor C#
WordLevelTimingResult.Offsetint gewijzigd om long toegang te WordLevelTimingResults verlenen tot wanneer spraakgegevens langer zijn dan 2 minuten.
-
PushAudioInputStream en PullAudioInputStream verzend nu wav-headergegevens naar de Speech-service op AudioStreamFormatbasis van , optioneel opgegeven toen ze zijn gemaakt. Klanten moeten nu de ondersteunde audio-invoerindeling gebruiken. Andere indelingen krijgen suboptimale herkenningsresultaten of kunnen andere problemen veroorzaken.
Insectenmoeilijke
- Zie de
OpenSSL update onder Wijzigingen die fouten veroorzaken hierboven. We hebben zowel een onregelmatige crash als een prestatieprobleem (conflicten met vergrendeling onder hoge belasting) in Linux en Java opgelost.
- Java: Verbeterde objectsluiting in scenario's met hoge gelijktijdigheid.
- Het NuGet-pakket is geherstructureerd. We hebben de drie kopieën van
Microsoft.CognitiveServices.Speech.core.dll en Microsoft.CognitiveServices.Speech.extension.kws.dll onder lib-mappen verwijderd, waardoor het NuGet-pakket kleiner en sneller te downloaden is en we hebben headers toegevoegd die nodig zijn om enkele systeemeigen C++-apps te compileren.
- Er zijn snelstartvoorbeelden opgelost here. Deze zijn afgesloten zonder de uitzondering 'microfoon niet gevonden' weer te geven in Linux, macOS, Windows.
- Sdk crash opgelost met lange spraakherkenningsresultaten op bepaalde codepaden, zoals de steekproef.
- Er is een sdk-implementatiefout opgelost in Azure Web App-omgeving om dit probleem met de klant op te lossen.
- Er is een TTS-fout opgelost bij het gebruik van meerdere
<voice> tag of <audio> tag om dit probleem van de klant op te lossen.
- Er is een TTS 401-fout opgelost wanneer de SDK is hersteld van onderbroken.
- JavaScript: Er is een circulaire import van audiogegevens opgelost dankzij een bijdrage van euirim.
- JavaScript: ondersteuning toegevoegd voor het instellen van service-eigenschappen, zoals toegevoegd in 1.7.
- JavaScript: er is een probleem opgelost waarbij een verbindingsfout kon leiden tot continue, mislukte pogingen om opnieuw verbinding te maken met websocket.
Monsters
- Voorbeeld van trefwoordherkenning toegevoegd voor Android here.
- TTS-voorbeeld toegevoegd voor het serverscenario here.
- Quickstarts voor gesprekken met meerdere apparaten toegevoegd voor C# en C++ (deze service is afgeschaft).
Andere wijzigingen
- Geoptimaliseerde SDK-kernbibliotheekgrootte op Android.
- SDK in 1.9.0 en hoger ondersteunt zowel
intstring als typen in het veld voice signature-versie voor gesprekstranscriber.
Speech SDK 1.8.0: release van 2019-november
Nieuwe functies
- Er is een
FromHost() API toegevoegd voor gebruiksgemak met on-premises containers en onafhankelijke clouds.
- Brontaalidentificatie toegevoegd voor spraakherkenning (in Java en C++)
-
SourceLanguageConfig-object toegevoegd voor Spraakherkenning, gebruikt om verwachte brontalen op te geven (in Java en C++)
- Er is
KeywordRecognizer ondersteuning toegevoegd voor Windows (UWP), Android en iOS via de NuGet- en Unity-pakketten
- Remote Conversation Java API toegevoegd om gesprektranscriptie uit te voeren in asynchrone batches.
Belangrijke wijzigingen
- Functies voor gesprekstranscriber zijn verplaatst onder naamruimte
Microsoft.CognitiveServices.Speech.Transcription.
- Onderdelen van de methoden gesprekstranscriber worden verplaatst naar een nieuwe
Conversation klasse.
- Verwijderde ondersteuning voor 32-bits iOS (ARMv7 en x86)
Insectenmoeilijke
- Oplossing voor vastlopen als lokaal
KeywordRecognizer wordt gebruikt zonder een geldige abonnementssleutel voor de Speech-service
Monsters
- Xamarin voorbeeld voor
KeywordRecognizer
- Unity-voorbeeld voor
KeywordRecognizer
- C++ en Java voorbeelden voor automatische brontaalidentificatie.
Speech SDK 1.7.0: release van 2019-september
Nieuwe functies
- Bèta-ondersteuning toegevoegd voor Xamarin op Universal Windows Platform (UWP), Android en iOS
- iOS-ondersteuning toegevoegd voor Unity
- Invoerondersteuning toegevoegd
Compressed voor ALaw, Mulaw, FLAC, op Android, iOS en Linux
- Toegevoegd
SendMessageAsync in Connection klasse voor het verzenden van een bericht naar service
- Toegevoegd
SetMessageProperty in Connection klasse voor het instellen van de eigenschap van een bericht
- TTS heeft bindingen toegevoegd voor Java (JRE en Android), Python, Swift en Objective-C
- TTS heeft ondersteuning toegevoegd voor afspelen voor macOS, iOS en Android.
- Informatie over 'woordgrens' toegevoegd voor TTS.
Insectenmoeilijke
- Probleem met IL2CPP-build opgelost in Unity 2019 voor Android
- Probleem opgelost waarbij ongeldige headers in wav-bestandsinvoer onjuist werden verwerkt
- Probleem opgelost waarbij UUID's niet uniek waren in sommige verbindingseigenschappen
- Er zijn enkele waarschuwingen over null-abilityaanduidingen in de Swift-bindingen opgelost (mogelijk zijn kleine codewijzigingen vereist)
- Er is een fout opgelost waardoor websocket-verbindingen geforceerd onder netwerkbelasting gesloten waren
- Er is een probleem opgelost in Android dat soms resulteert in dubbele indruk-id's die worden gebruikt door
DialogServiceConnector
- Verbeteringen in de stabiliteit van verbindingen tussen interacties met meerdere bochten en het rapporteren van fouten (via
Canceled gebeurtenissen) wanneer ze optreden met DialogServiceConnector
-
DialogServiceConnector sessie wordt nu op de juiste manier geleverd, ook wanneer er wordt gebeld ListenOnceAsync() tijdens een actieve StartKeywordRecognitionAsync()
- Een crash opgelost die
DialogServiceConnector is gekoppeld aan activiteiten die worden ontvangen
Monsters
- Quickstart voor Xamarin
- CPP-quickstart bijgewerkt met Linux Arm64-informatie
- Bijgewerkte Unity-quickstart met iOS-informatie
Speech SDK 1.6.0: release van 2019-juni
Monsters
- Quickstartvoorbeelden voor Text To Speech op UWP en Unity
- Snelstartvoorbeeld voor Swift in iOS
- Unity-voorbeelden voor spraak- en intentieherkenning en -vertaling
- Bijgewerkte quickstartvoorbeelden voor
DialogServiceConnector
Verbeteringen/wijzigingen
- Dialoogvensternaamruimte:
-
SpeechBotConnector is hernoemd in DialogServiceConnector
-
BotConfig is hernoemd in DialogServiceConfig
-
BotConfig::FromChannelSecret() is opnieuw toegewezen aan DialogServiceConfig::FromBotSecret()
- Alle bestaande Direct Line Speech-clients worden nog steeds ondersteund na de naamswijziging
- TTS REST-adapter bijwerken ter ondersteuning van proxy, permanente verbinding
- Foutbericht verbeteren wanneer een ongeldige regio wordt doorgegeven
- Swift/Objective-C:
- Verbeterde foutrapportage: methoden die kunnen resulteren in een fout zijn nu aanwezig in twee versies: een die een
NSError object beschikbaar maakt voor foutafhandeling en een methode die een uitzondering genereert. De voormalige zijn blootgesteld aan Swift. Deze wijziging vereist aanpassingen aan bestaande Swift-code.
- Verbeterde verwerking van gebeurtenissen
Insectenmoeilijke
- Oplossing voor TTS: waarbij
SpeakTextAsync de toekomst wordt geretourneerd zonder te wachten totdat het weergeven van audio is voltooid
- Oplossing voor marshalingtekenreeksen in C# om volledige taalondersteuning in te schakelen
- Oplossing voor .NET kern-appprobleem voor het laden van de kernbibliotheek met net461-doelframework in voorbeelden
- Oplossing voor incidentele problemen bij het implementeren van systeemeigen bibliotheken in de uitvoermap in voorbeelden
- Oplossing voor het sluiten van websockets op betrouwbare wijze
- Oplossing voor mogelijk vastlopen tijdens het openen van een verbinding onder zware belasting in Linux
- Oplossing voor ontbrekende metagegevens in de frameworkbundel voor macOS
- Oplossing voor problemen met
pip install --user op Windows
Speech SDK 1.5.1
Dit is een foutoplossing die alleen van invloed is op de systeemeigen/beheerde SDK. Dit heeft geen invloed op de JavaScript-versie van de SDK.
Insectenmoeilijke
- Los FromSubscription op wanneer deze wordt gebruikt met gesprektranscriptie.
- Er is een fout opgelost bij trefwoordspotting voor spraakassistenten.
Speech SDK 1.5.0: release van 2019-mei
Nieuwe functies
- KwS (Trefwoordspotting) is nu beschikbaar voor Windows en Linux. De KWS-functionaliteit werkt mogelijk met elk microfoontype, officiële KWS-ondersteuning, maar is momenteel beperkt tot de microfoonmatrices in de Azure Kinect DK hardware of de Speech Devices SDK.
- De zinshintfunctionaliteit is beschikbaar via de SDK. Zie hier voor meer informatie.
- De functionaliteit voor gesprektranscriptie is beschikbaar via de SDK.
- Voeg ondersteuning toe voor Spraakassistenten met behulp van het Direct Line Speech-kanaal.
Monsters
- Voorbeelden toegevoegd voor nieuwe functies of nieuwe services die worden ondersteund door de SDK.
Verbeteringen/wijzigingen
- Verschillende recognizer-eigenschappen toegevoegd om servicegedrag of serviceresultaten aan te passen (zoals maskering van grof taalgebruik en andere).
- U kunt de recognizer nu configureren via de standaardconfiguratie-eigenschappen, zelfs als u de recognizer
FromEndpointhebt gemaakt.
- Objective-C:
OutputFormat eigenschap is toegevoegd aan SPXSpeechConfiguration.
- De SDK ondersteunt nu Debian 9 als Linux-distributie.
Insectenmoeilijke
- Er is een probleem opgelost waarbij de sprekerresource te vroeg in tekst naar spraak werd gedestructeerd.
Speech SDK 1.4.2
Dit is een foutoplossing die alleen van invloed is op de systeemeigen/beheerde SDK. Dit heeft geen invloed op de JavaScript-versie van de SDK.
Speech SDK 1.4.1
Dit is een alleen-JavaScript-versie. Er zijn geen functies toegevoegd. De volgende correcties zijn aangebracht:
- Voorkomen dat webpack https-proxy-agent laadt.
Speech SDK 1.4.0: release van 2019-april
Nieuwe functies
- De SDK biedt nu ondersteuning voor de Text to Speech-service als bètaversie. Het wordt ondersteund op Windows en Linux Desktop vanuit C++ en C#. Raadpleeg het overzicht van tekst naar spraak voor meer informatie.
- De SDK biedt nu ondersteuning voor MP3- en Opus-/MSP-audiobestanden als invoerbestanden voor stromen. Deze functie is alleen beschikbaar in Linux vanuit C++ en C# en is momenteel beschikbaar in de bètaversie (hier vindt u meer informatie).
- De Speech SDK voor Java, .NET kern, C++ en Objective-C hebben macOS-ondersteuning gekregen. De Objective-C-ondersteuning voor macOS is momenteel bèta.
- iOS: De Speech SDK voor iOS (Objective-C) is nu ook gepubliceerd als een CocoaPod.
- JavaScript: ondersteuning voor niet-standaardmicrofoon als invoerapparaat.
- JavaScript: proxyondersteuning voor Node.js.
Monsters
- Voorbeelden voor het gebruik van de Speech SDK met C++ en met Objective-C in macOS zijn toegevoegd.
- Voorbeelden waarin het gebruik van de tekst-naar-spraakservice wordt gedemonstreerd, zijn toegevoegd.
Verbeteringen/wijzigingen
- Python: Aanvullende eigenschappen van herkenningsresultaten worden nu weergegeven via de eigenschap
properties.
- Voor aanvullende ondersteuning voor ontwikkeling en foutopsporing kunt u SDK-logboekregistratie en diagnostische gegevens omleiden naar een logboekbestand ( hier vindt u meer informatie).
- JavaScript: de prestaties van audioverwerking verbeteren.
Insectenmoeilijke
- Mac/iOS: Een fout die heeft geleid tot een lange wachttijd wanneer er geen verbinding met de Speech-service tot stand kon worden gebracht, is opgelost.
- Python: foutafhandeling voor argumenten in Python callbacks verbeteren.
- JavaScript: foute statusrapportage voor spraak is beëindigd op RequestSession.
Speech SDK 1.3.1: vernieuwing van 2019-februari
Dit is een foutoplossing die alleen van invloed is op de systeemeigen/beheerde SDK. Dit heeft geen invloed op de JavaScript-versie van de SDK.
Opgeloste fout
- Er is een geheugenlek opgelost bij het gebruik van microfooninvoer. Stroom- of bestandsinvoer wordt niet beïnvloed.
Speech SDK 1.3.0: release van 2019-februari
Nieuwe functies
- De Speech SDK ondersteunt het selecteren van de invoermicrofoon via de
AudioConfig klasse. Hiermee kunt u audiogegevens streamen naar de Speech-service vanaf een niet-standaardmicrofoon. Zie de documentatie waarin de selectie van audio-invoerapparaten wordt beschreven voor meer informatie. Deze functie is nog niet beschikbaar via JavaScript.
- De Speech SDK biedt nu ondersteuning voor Unity in een bètaversie. Geef feedback via de sectie probleem in de voorbeeldopslagplaats GitHub. Deze release ondersteunt Unity op Windows x86 en x64 (desktop- of Universeel Windows-platform-toepassingen) en Android (ARM32/64, x86). Meer informatie is beschikbaar in onze Unity-quickstart.
- Het bestand
Microsoft.CognitiveServices.Speech.csharp.bindings.dll (verzonden in eerdere releases) is niet meer nodig. De functionaliteit is nu geïntegreerd in de kern-SDK.
Monsters
De volgende nieuwe inhoud is beschikbaar in onze voorbeeldopslagplaats:
- Aanvullende voorbeelden voor
AudioConfig.FromMicrophoneInput.
- Aanvullende Python voorbeelden voor intentieherkenning en vertaling.
- Aanvullende voorbeelden voor het gebruik van het
Connection object in iOS.
- Aanvullende Java voorbeelden voor vertaling met audio-uitvoer.
- Nieuw voorbeeld voor gebruik van de REST API voor BatchTranscriptie.
Verbeteringen/wijzigingen
- Python
- Verbeterde parameterverificatie en foutberichten in
SpeechConfig.
- Voeg ondersteuning toe voor het
Connection object.
- Ondersteuning voor 32-bits Python (x86) op Windows.
- De Speech SDK voor Python is niet beschikbaar in de bètaversie.
- Ios
- De SDK is nu gebouwd op basis van de iOS SDK versie 12.1.
- De SDK ondersteunt nu iOS-versies 9.2 en hoger.
- Verbeter de referentiedocumentatie en corrik verschillende eigenschapsnamen.
- Javascript
- Voeg ondersteuning toe voor het
Connection object.
- Typedefinitiebestanden toevoegen voor gebundelde JavaScript
- Initiële ondersteuning en implementatie voor woordgroepenhints.
- Verzameling eigenschappen retourneren met service-JSON voor herkenning
- Windows DLL's bevatten nu een versieresource.
- Als u een recognizer
FromEndpointmaakt, kunt u parameters rechtstreeks toevoegen aan de eindpunt-URL. U FromEndpoint kunt de recognizer niet configureren via de standaardconfiguratie-eigenschappen.
Insectenmoeilijke
- Lege proxygebruikersnaam en proxywachtwoord zijn niet correct verwerkt. Als u in deze release een proxy-gebruikersnaam en proxywachtwoord instelt op een lege tekenreeks, worden deze niet verzonden wanneer u verbinding maakt met de proxy.
- SessionId's die door de SDK zijn gemaakt, waren niet altijd echt willekeurig voor sommige talen/omgevingen. Er is een initialisatie van willekeurige generator toegevoegd om dit probleem op te lossen.
- De verwerking van autorisatietoken verbeteren. Als u een autorisatietoken wilt gebruiken, geeft u in het token op
SpeechConfig en laat u de API-sleutel leeg. Maak vervolgens de recognizer zoals gebruikelijk.
- In sommige gevallen is het
Connection object niet correct vrijgegeven. Dit probleem is opgelost.
- Het JavaScript-voorbeeld is opgelost ter ondersteuning van audio-uitvoer voor omzettingssynthese ook in Safari.
Speech SDK 1.2.1
Dit is een alleen-JavaScript-versie. Er zijn geen functies toegevoegd. De volgende correcties zijn aangebracht:
- Brand het einde van de stroom op turn.end, niet bij speech.end.
- Probleem opgelost in de audiopomp die niet de volgende verzendplanning heeft gepland als de huidige verzendfout is mislukt.
- Herstel continue herkenning met verificatietoken.
- Opgeloste fout voor verschillende recognizer/eindpunten.
- Documentatieverbeteringen.
Speech SDK 1.2.0: release van 2018-december
Nieuwe functies
- Python
- De bètaversie van Python ondersteuning (3.5 en hoger) is beschikbaar in deze release. Voor meer informatie, zie hier](.. /.. /quickstart-python.md).
- Javascript
- De Speech SDK voor JavaScript is opensourced. De broncode is beschikbaar op GitHub.
- We ondersteunen nu Node.js, meer informatie vindt u hier.
- De lengtebeperking voor audiosessies is verwijderd, er wordt automatisch opnieuw verbinding gemaakt.
-
Connection Object
- Vanuit de
Recognizerpagina hebt u toegang tot een Connection object. Met dit object kunt u de serviceverbinding expliciet initiëren en u abonneren op verbinding maken en de verbinding verbreken.
(Deze functie is nog niet beschikbaar via JavaScript en Python.)
- Ondersteuning voor Ubuntu 18.04.
- Android
- Ingeschakelde ProGuard-ondersteuning tijdens het genereren van apk's.
Verbeteringen
- Verbeteringen in het interne threadgebruik, waardoor het aantal threads, vergrendelingen en mutexes wordt verminderd.
- Verbeterde foutrapportage/informatie. In verschillende gevallen zijn foutberichten niet helemaal doorgegeven.
- Ontwikkelingsafhankelijkheden in JavaScript zijn bijgewerkt om up-to-datummodules te gebruiken.
Insectenmoeilijke
- Er zijn geheugenlekken opgelost als gevolg van een type dat niet overeenkomt in
RecognizeAsync.
- In sommige gevallen werden uitzonderingen gelekt.
- Geheugenlek herstellen in gebeurtenisargumenten voor vertaling.
- Er is een vergrendelingsprobleem opgelost bij opnieuw verbinding maken in langdurige sessies.
- Er is een probleem opgelost waardoor het uiteindelijke resultaat voor mislukte vertalingen kon ontbreken.
- C#: Als een
async bewerking niet in de hoofdthread werd verwacht, was het mogelijk dat de recognizer kan worden verwijderd voordat de asynchrone taak werd voltooid.
- Java: Er is een probleem opgelost waardoor de Java VM vastloopt.
- Objective-C: vaste opsommingstoewijzing; RecognizedIntent is geretourneerd in plaats van
RecognizingIntent.
- JavaScript: standaarduitvoerindeling instellen op 'eenvoudig' in
SpeechConfig.
- JavaScript: inconsistentie tussen eigenschappen in het configuratieobject in JavaScript en andere talen verwijderen.
Monsters
- Verschillende voorbeelden bijgewerkt en opgelost (bijvoorbeeld uitvoerstemmen voor vertaling, enzovoort).
- Er zijn Node.js voorbeelden toegevoegd in de voorbeeldopslagplaats.
Speech SDK 1.1.0
Nieuwe functies
- Ondersteuning voor Android x86/x64.
- Proxyondersteuning: In het
SpeechConfig object kunt u nu een functie aanroepen om de proxygegevens (hostnaam, poort, gebruikersnaam en wachtwoord) in te stellen. Deze functie is nog niet beschikbaar in iOS.
- Verbeterde foutcode en berichten. Als een herkenning een fout heeft geretourneerd, is dit al ingesteld
Reason (in geannuleerde gebeurtenis) of CancellationDetails (in herkenningsresultaat) op Error. De geannuleerde gebeurtenis bevat nu twee extra leden en ErrorCodeErrorDetails. Als de server aanvullende foutinformatie heeft geretourneerd met de gemelde fout, is deze nu beschikbaar in de nieuwe leden.
Verbeteringen
- Extra verificatie toegevoegd in de configuratie van de recognizer en extra foutbericht toegevoegd.
- Verbeterde verwerking van langdurige stilte in het midden van een audiobestand.
- NuGet-pakket: voor .NET Framework-projecten voorkomt het bouwen met AnyCPU-configuratie.
Insectenmoeilijke
- Er zijn verschillende uitzonderingen opgelost die zijn gevonden in recognizers. Daarnaast worden uitzonderingen gevangen en geconverteerd naar
Canceled gebeurtenis.
- Herstel een geheugenlek in eigenschapsbeheer.
- Er is een fout opgelost waarbij een audio-invoerbestand de recognizer kon vastlopen.
- Er is een fout opgelost waarbij gebeurtenissen konden worden ontvangen na een sessiestopgebeurtenis.
- Bepaalde raceomstandigheden in threading opgelost.
- Er is een iOS-compatibiliteitsprobleem opgelost dat kan leiden tot een crash.
- Stabiliteitsverbeteringen voor android-microfoonondersteuning.
- Er is een fout opgelost waarbij een recognizer in JavaScript de herkenningstaal negeerde.
- Er is een fout opgelost waardoor de
EndpointId (in sommige gevallen) niet in JavaScript werd ingesteld.
- Parametervolgorde gewijzigd in AddIntent in JavaScript en ontbrekende
AddIntent JavaScript-handtekening toegevoegd.
Monsters
Speech SDK 1.0.1
Betrouwbaarheidsverbeteringen en oplossingen voor fouten:
- Mogelijke fatale fout opgelost vanwege racevoorwaarde in disponeren recognizer
- Er is een mogelijke fatale fout opgelost bij het ongedaan maken van eigenschappen.
- Extra fout- en parametercontrole toegevoegd.
- Objective-C: Er is een mogelijke fatale fout opgelost die is veroorzaakt door het overschrijven van de naam in NSString.
- Objective-C: Aangepaste zichtbaarheid van API
- JavaScript: Opgelost met betrekking tot gebeurtenissen en hun nettoladingen.
- Documentatieverbeteringen.
In onze voorbeeldopslagplaats is een nieuw voorbeeld voor JavaScript toegevoegd.
Azure Speech SDK 1.0.0: release van 2018-september
Nieuwe functies
Belangrijke wijzigingen
- In deze release worden een aantal belangrijke wijzigingen geïntroduceerd.
Controleer deze pagina voor meer informatie.
Azure Speech SDK 0.6.0: release van 2018-augustus
Nieuwe functies
- UWP-apps die zijn gebouwd met de Speech SDK kunnen nu de Windows-app Certification Kit (WACK) doorgeven.
Bekijk de quickstart voor UWP.
- Ondersteuning voor .NET Standard 2.0 op Linux (Ubuntu 16.04 x64).
- Experimenteel: Ondersteuning Java 8 op Windows (64-bits) en Linux (Ubuntu 16.04 x64).
Bekijk de quickstart Java Runtime Environment.
Functionele wijziging
- Aanvullende informatie over foutdetails weergeven over verbindingsfouten.
Belangrijke wijzigingen
- Op Java (Android) is voor de functie
SpeechFactory.configureNativePlatformBindingWithDefaultCertificate geen padparameter meer vereist. Het pad wordt nu automatisch gedetecteerd op alle ondersteunde platforms.
- De get-accessor van de eigenschap
EndpointUrl in Java en C# is verwijderd.
Insectenmoeilijke
- In Java wordt het audiosyntheseresultaat op de vertaalherkenning nu geïmplementeerd.
- Er is een fout opgelost die inactieve threads en een verhoogd aantal geopende en ongebruikte sockets kon veroorzaken.
- Er is een probleem opgelost waarbij een langlopende herkenning in het midden van de transmissie kon worden beëindigd.
- Er is een racevoorwaarde opgelost bij het afsluiten van de recognizer.
Azure Speech SDK 0.5.0: release van 2018-juli
Nieuwe functies
- Ondersteuning voor Android-platform (API 23: Android 6.0 Marshmallow of hoger). Bekijk de Snelstartgids voor Android.
- Ondersteuning .NET Standard 2.0 op Windows. Bekijk de quickstart .NET Core.
- Experimenteel: UWP ondersteunen op Windows (versie 1709 of hoger).
- Bekijk de quickstart voor UWP.
- Houd er rekening mee dat UWP-apps die zijn gebouwd met de Speech SDK nog niet voldoen aan de Windows-app Certification Kit (WACK).
- Ondersteuning voor langdurige herkenning met automatische opnieuw verbinding maken.
Functionele wijzigingen
-
StartContinuousRecognitionAsync() ondersteunt langdurige herkenning.
- Het herkenningsresultaat bevat meer velden. Ze worden verschoven van het begin en de duur van het geluid (zowel in tikken) van de herkende tekst als extra waarden die de herkenningsstatus vertegenwoordigen, bijvoorbeeld
InitialSilenceTimeout en InitialBabbleTimeout.
- Ondersteuning voor AuthorizationToken voor het maken van factory-exemplaren.
Belangrijke wijzigingen
- Herkenningsgebeurtenissen:
NoMatch gebeurtenistype is samengevoegd in de Error gebeurtenis.
- SpeechOutputFormat in C# is hernoemd om
OutputFormat afgestemd te blijven op C++.
- Het retourtype van sommige methoden van de
AudioInputStream interface is enigszins gewijzigd:
- In Java retourneert de methode
read nu long in plaats van int.
- In C# retourneert
Read de uint methode nu in plaats van int.
- In C++worden de
Read en GetFormat methoden nu geretourneerd size_t in plaats van int.
- C++: Exemplaren van audio-invoerstromen kunnen nu alleen worden doorgegeven als een
shared_ptr.
Insectenmoeilijke
- Er zijn onjuiste retourwaarden in het resultaat opgelost wanneer er een time-out
RecognizeAsync() optreedt.
- De afhankelijkheid van mediabasisbibliotheken op Windows is verwijderd. De SDK maakt nu gebruik van Core Audio-API's.
- Oplossing voor documentatie: Er is een regiopagina toegevoegd om de ondersteunde regio's te beschrijven.
Bekend probleem
- De Speech SDK voor Android rapporteert geen resultaten van spraaksynthese voor vertaling. Dit probleem wordt opgelost in de volgende release.
Azure Speech SDK 0.4.0: release van 2018-juni
Functionele wijzigingen
AudioInputStream
Een recognizer kan nu een stream gebruiken als de audiobron. Zie de bijbehorende handleiding voor meer informatie.
Gedetailleerde uitvoerindeling
Wanneer u een SpeechRecognizerindeling maakt, kunt u de indeling aanvragen Detailed of Simple uitvoeren. De DetailedSpeechRecognitionResult bevat een betrouwbaarheidsscore, herkende tekst, onbewerkte lexicale vorm, genormaliseerde vorm en genormaliseerde vorm met gemaskeerde grof taalgebruik.
Wijziging die fouten veroorzaken
-
SpeechRecognitionResult.Text Gewijzigd in van SpeechRecognitionResult.RecognizedText in C#.
Insectenmoeilijke
- Er is een mogelijk callbackprobleem opgelost in de USP-laag tijdens het afsluiten.
- Als een recognizer een audio-invoerbestand gebruikte, hield het langer dan nodig vast aan de bestandsgreep.
- Er zijn verschillende impasses tussen de berichtpomp en de herkenning verwijderd.
- Er wordt een resultaat geactiveerd wanneer er een
NoMatch time-out optreedt voor het antwoord van de service.
- De mediabasisbibliotheken op Windows worden vertraagd geladen. Deze bibliotheek is alleen vereist voor microfooninvoer.
- De uploadsnelheid voor audiogegevens is beperkt tot ongeveer twee keer de oorspronkelijke audiosnelheid.
- Op Windows zijn C# .NET assembly's nu sterk benoemd.
- Oplossing voor documentatie:
Region is vereiste informatie voor het maken van een recognizer.
Er zijn meer voorbeelden toegevoegd en worden voortdurend bijgewerkt. Zie de Speech SDK-voorbeelden GitHub opslagplaats voor de nieuwste set voorbeelden.
Azure Speech SDK 0.2.12733: release van 2018-mei
Deze release is de eerste openbare preview-versie van de Azure Speech SDK.
Speech CLI 1.49.0: release van 2026-april
Bijgewerkt voor gebruik van Speech SDK 1.49.0
Nieuwe functies
- Ondersteuning toegevoegd voor woordgroepenlijstgewichten.
Insectenmoeilijke
Speech CLI 1.48.0: release van 2026-februari
Bijgewerkt voor gebruik van Speech SDK 1.48.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.47.0: release van 2025-september
Bijgewerkt voor gebruik van Speech SDK 1.47.0
Nieuwe functies
Insectenmoeilijke
Belangrijke wijzigingen:
- Ondersteuning voor intentieherkenning is verwijderd vanwege de buitengebruikstelling van de service.
- Ondersteuning voor sprekerherkenning is verwijderd vanwege de buitengebruikstelling van de service.
Speech CLI 1.46.0: release van 2025-september
Bijgewerkt voor gebruik van Speech SDK 1.46.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.45.0: release van 2025-juli
Bijgewerkt voor gebruik van Speech SDK 1.45.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.44: release van 2025-mei
Nieuwe functies
- Er is ondersteuning toegevoegd voor verificatie met Microsoft Entra tokenreferenties.
- Er is ondersteuning toegevoegd voor de Snelle transcriptie-API.
Insectenmoeilijke
- Vaste niet-werkende, door puntkomma's gescheiden invoer-URL's en invoerbestands-/URL-lijsten uit een bestand.
Speech CLI 1.43: release van 2025-maart
Nieuwe functies
- SPX bijgewerkt voor gebruik van .NET 8.
Insectenmoeilijke
- Probleem opgelost dat de SPX Docker-container niet werkt in on-premises batchscenario's.
Speech CLI 1.40.0: release van augustus 2024
Bijgewerkt voor gebruik van Speech SDK 1.40.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.38.0: release van juni 2024
Bijgewerkt voor gebruik van Speech SDK 1.38.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.37.0: release van april 2024
Bijgewerkt voor gebruik van Speech SDK 1.37.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.36.0: release van maart 2024
Bijgewerkt voor gebruik van Speech SDK 1.36.0
Nieuwe functies
Insectenmoeilijke
Speech CLI 1.35.0: release van februari 2024
Bijgewerkt voor gebruik van Speech SDK 1.35.0
Nieuwe functies
Insectenmoeilijke
- JMESPath-afhankelijkheid bijwerken naar de nieuwste versie
Speech CLI 1.34.0: release van november 2023
Bijgewerkt voor gebruik van Speech SDK 1.34.0
Speech CLI 1.33.0: release van oktober 2023
Bijgewerkt voor gebruik van Speech SDK 1.33.0
Speech CLI 1.31.0: release van augustus 2023
Bijgewerkt voor gebruik van Speech SDK 1.31.0
Speech CLI 1.30.0: release van juli 2023
Bijgewerkt voor gebruik van Speech SDK 1.30.0
Speech CLI 1.29.0: release van juni 2023
Bijgewerkt voor gebruik van Speech SDK 1.29.0
Speech CLI 1.28.0: release van mei 2023
Bijgewerkt voor gebruik van Speech SDK 1.28.0
Speech CLI 1.27.0: release van april 2023
Updates
- Bijgewerkt voor gebruik van Speech SDK 1.27.0
- Werk het standaardeindpunt bij voor het gebruik van v3.1 REST API's voor aangepaste spraakherkenning en Batch-spraakherkenning.
Insectenmoeilijke
- Oplossingen met betrekking tot de wijze waarop queryparameters worden geparseerd/geconfigureerd.
Speech CLI 1.26.0: release van maart 2023
Bijgewerkt voor gebruik van Speech SDK 1.26.0.
Speech CLI 1.25.0: release van januari 2023
Bijgewerkt voor gebruik van Speech SDK 1.25.0.
Speech CLI 1.24.0: release van oktober 2022
Gebruikt Speech SDK 1.24.0.
Nieuwe functies
- Uitgebreide 'spx-controle' ter ondersteuning van JMESPath-query's voor alle SPX-gebeurtenissen
Insectenmoeilijke
- Verschillende verbeteringen in robuustheid ten opzichte van JMESPath-queryevaluaties
- Oplossing voor afkappingen naar bestandsschrijfbewerkingen die kunnen optreden op machines met beperkte resources
Speech CLI 1.23.0: release van juli 2022
Gebruikt Speech SDK 1.23.0.
Nieuwe functies
- Betere ondertiteling (
--output vtt en --output srt) grote resultaatsplitsing (maximaal 37 tekens, 3 regels)
- Gedocumenteerde
spx synthesize--format opties (zie spx help synthesize format)
- De meeste
spx csr opdrachten/opties gedocumenteerd (zie spx help csr)
- Opdracht toegevoegd
spx csr model copy (zie spx help csr model copy)
- Optie toegevoegd
--check result met behulp van JMES-query's (zie spx help check result)
- Verbeterde foutberichten bij het opgeven van ongeldige opdrachtopties
- Verplaatst van .NET Core 3.1 naar .NET 6.0. Als u Speech CLI wilt uitvoeren, moet u de .NET 6.0 Runtime (of hoger) installeren.
Insectenmoeilijke
- Alle URL's bijgewerkt om de taal te verwijderen (bijvoorbeeld "en-US")
- Er is een probleem opgelost met versiegegevens om correct te rapporteren in alle gevallen (voorheen werd er soms een lege versie weergegeven)
Speech CLI 1.22.0: release van juni 2022
Gebruikt Speech SDK 1.22.0.
Nieuwe functies
- De opdracht
spx init toegevoegd om gebruikers te begeleiden bij het maken van de spraakresourcesleutel zonder naar Azure webportal te gaan.
- Speech Docker-containers hebben nu Azure CLI opgenomen, dus de opdracht
spx init werkt standaard.
- Tijdstempel toegevoegd als uitvoeroptie voor gebeurtenissen, om SPX nuttiger te maken bij het berekenen van latenties.
Speech CLI 1.21.0: release van april 2022
Gebruikt Speech SDK 1.21.0.
Nieuwe functies
- WEBVTT-bijschrift genereren
- Ondersteuning toegevoegd
--output vtt aan spx translate
- Ondersteunt
--output vtt file FILENAME het overschrijven van standaard-VTT-BESTANDSNAAM
- Ondersteunt
--output vtt file - schrijven naar standaarduitvoer
- Afzonderlijke VTT-bestanden worden gemaakt voor elke doeltaal (bijvoorbeeld
--target en;de;fr)
- SRT-bijschrift genereren
- Ondersteuning toegevoegd
--output srt aan spx recognize, spx intenten spx translate
- Ondersteunt
--output srt file FILENAME het overschrijven van standaard-SRT-BESTANDSNAAM
- Ondersteunt
--output srt file - schrijven naar standaarduitvoer
- Voor
spx translateelke doeltaal worden afzonderlijke SRT-bestanden gemaakt (bijvoorbeeld --target en;de;fr)
Insectenmoeilijke
- Uitvoer van WEBVTT-tijdspanne gecorrigeerd om de indeling goed te gebruiken
hh:mm:ss.fff
Speech CLI 1.20.0: release van januari 2022
Nieuwe functies
- Sprekerherkenning
-
spx profile enroll en spx speaker [identify/verify] nu microfooninvoer ondersteunen
- Intentieherkenning (
spx intent)
--keyword FILE.table
-
--pattern En --patterns
--output all/each intentid
--output all/each entity json
--output all/each ENTITY entity
-
--once, , --once+--continuous (doorlopend nu standaard)
--output all/each connection EVENT
-
--output all/each connection message(bijvoorbeeld , textpath)
- Controle/creatie van de uitvoer van de CLI-console:
-
--expect PATTERN en --not expect PATTERN ondersteuning voor alle opdrachten
-
--auto expect om verwachte patronen te ontwerpen
- Controle/creatie van uitvoer van SDK-logboekregistratie
-
--log expect PATTERN en --not log expect PATTERN ondersteuning voor alle opdrachten
-
--log auto expect [FILTER] ondersteuning voor alle opdrachten
-
--log FILE ondersteuning voor spx profile en spx speaker
- Invoer van audiobestanden
-
--format ANY ondersteuning voor alle opdrachten
-
--file - ondersteuning (lezen van standaardinvoer, het inschakelen van pijpscenario's)
- Uitvoer van audiobestand
-
--audio output - Schrijven naar standaarduitvoer, waardoor pijpscenario's mogelijk zijn
- Uitvoerbestanden
-
--output all/each file - Schrijven naar standaarduitvoer
-
--output batch file - Schrijven naar standaarduitvoer
-
--output vtt file - Schrijven naar standaarduitvoer
-
--output json file - Schrijven naar standaarduitvoer, voor spx csr en spx batch opdrachten
- Uitvoereigenschappen
-
--output […] result XXX property (PropertyId of tekenreeks)
-
--output […] connection message received XXX property (PropertyId of tekenreeks)
-
--output […] recognizer XXX property (PropertyId of tekenreeks)
- Azure WebJob-integratie
-
spx webjob volgt nu het subopdrachtpatroon
- Bijgewerkte WebJob help om het subopdrachtpatroon weer te geven (zie
spx help webjob)
Insectenmoeilijke
- Er is een fout opgelost wanneer beide
--output vtt FILE en --output batch FILE tegelijkertijd worden gebruikt
-
spx [...] --zip ZIPFILENAME bevat nu alle binaire bestanden die vereist zijn voor alle scenario's (indien aanwezig)
-
spx profile en spx speaker opdrachten retourneren nu gedetailleerde foutinformatie over annulering
Release van 2021-mei
Nieuwe functies
- Er is ondersteuning toegevoegd voor profiel-, spreker-id- en sprekercontrole: probeer
spx profile en spx speaker vanaf de opdrachtregel.
- We hebben ook ondersteuning voor dialoogvensters toegevoegd: probeer
spx dialog het vanaf de opdrachtregel.
- Verbeterde
spx hulp. Geef ons feedback over hoe dit voor u werkt door een GitHub probleem te openen.
- We hebben de grootte van de installatie van het .NET hulpprogramma verlaagd.
COVID-19 verkorte tests
Naarmate de doorlopende pandemie onze technici blijft verplichten om thuis te werken, worden handmatige verificatiescripts voor de pre-pandemie beperkt tot testen op minder apparaten met minder configuraties en kan de kans op omgevingsspecifieke bugs die doorsluipen, worden verhoogd. We valideren nog steeds grondig met een grote set automatisering. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons weten op GitHub.
Blijf gezond!
Release van 2021-maart
Nieuwe functies
- Opdracht
spx intent toegevoegd voor intentieherkenning, vervangen spx recognize intent.
- Herkennen en intenties kunnen nu Azure functies gebruiken om de foutfrequentie van woorden te berekenen met behulp van
spx recognize --wer url <URL>.
- Recognize kan nu resultaten uitvoeren als VTT-bestanden met behulp van
spx recognize --output vtt file <FILENAME>.
- Gevoelige sleutelgegevens worden nu verborgen in foutopsporing/uitgebreide uitvoer.
- URL-controle en foutbericht toegevoegd voor inhoudsveld in batchtranscriptie maken.
COVID-19 verkorte tests
Naarmate de doorlopende pandemie onze technici blijft verplichten om thuis te werken, worden handmatige verificatiescripts voor de pre-pandemie beperkt tot testen op minder apparaten met minder configuraties en kan de kans op omgevingsspecifieke bugs die doorsluipen, worden verhoogd. We valideren nog steeds grondig met een grote set automatisering. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons weten op GitHub.
Blijf gezond!
Release van 2021-januari
Nieuwe functies
- Speech CLI is nu beschikbaar als een NuGet-pakket en kan worden geïnstalleerd via .NET CLI als een .NET globaal hulpprogramma dat u kunt aanroepen vanaf de shell/opdrachtregel.
- De custom speech DevOps Template-opslagplaats is bijgewerkt om Speech CLI te gebruiken voor de aangepaste spraakwerkstromen.
COVID-19 verkorte tests
Naarmate de doorlopende pandemie onze technici blijft verplichten om thuis te werken, worden handmatige verificatiescripts voor de pre-pandemie beperkt tot testen op minder apparaten met minder configuraties en kan de kans op omgevingsspecifieke bugs die doorsluipen, worden verhoogd. We valideren nog steeds grondig met een grote set automatisering. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons weten op GitHub.
Blijf gezond!
Release van 2020-oktober
SPX is de opdrachtregelinterface voor het gebruik van de Speech-service zonder code te schrijven.
Download hier de nieuwste versie.
Nieuwe functies
-
spx csr dataset upload --kind audio|language|acoustic – gegevenssets maken op basis van lokale gegevens, niet alleen van URL's.
-
spx csr evaluation create|status|list|update|delete – vergelijk nieuwe modellen met basislijnwaar/andere modellen.
-
spx * list – ondersteunt niet-pagina-ervaring (vereist geen --top X --skip X).
-
spx * --http header A=B – ondersteuning voor aangepaste headers (toegevoegd voor Office voor aangepaste verificatie).
-
spx help – verbeterde tekst- en back-tick-tekstkleur gecodeerd (blauw).
Release van 2020-juni
- In-CLI help-zoekfuncties toegevoegd:
spx help find --text TEXT
spx help find --topic NAME
- Bijgewerkt voor gebruik met nieuw geïmplementeerde v3.0 Batch- en aangepaste spraak-API's:
spx help batch examples
spx help csr examples
COVID-19 verkorte tests
Omdat we de afgelopen weken op afstand werken, konden we niet zoveel handmatige verificatietests uitvoeren als normaal. We hebben geen wijzigingen aangebracht die we denken te hebben verbroken, en onze geautomatiseerde tests zijn allemaal geslaagd. In het onwaarschijnlijke geval dat we iets hebben gemist, laat het ons weten op GitHub.
Blijf gezond!
Speech CLI (ook wel BEKEND als SPX): release van 2020 mei
SPX is een nieuw opdrachtregelprogramma waarmee u vanaf de opdrachtregel herkenning, synthese, vertaling, batchtranscriptie en aangepast spraakbeheer kunt uitvoeren. Gebruik deze om de Speech-service te testen of om de Speech-servicetaken te scripten die u moet uitvoeren. Download het hulpprogramma en lees de documentatie hier.
Release van mei 2026
Aangepaste stemafstemming in de Microsoft Foundry (nieuwe) portal
Werkstromen voor aangepaste spraak zijn nu beschikbaar via de Microsoft Foundry-portal (nieuw). De speeltuinervaring begeleidt u bij het selecteren van modellen, het registreren van spraaktalent, het uploaden van trainingsgegevens, het trainen van modellen en het implementeren van eindpunten vanuit het deelvenster Een model verfijnen .
Aangepast avatargebruik in Microsoft Foundry
Nadat u een aangepaste avatar hebt geïmplementeerd, kunt u deze nu rechtstreeks proberen vanuit het Gebruik uw avatarvak door Try tekst-naar-spraak Avatar of Try Voice Live te selecteren. U kunt de speeltuinen ook openen via de navigatieModellen en uw aangepaste avatar selecteren op het tabblad Aangepast . Zie Een aangepaste tekst voor spraak-avatar maken voor meer informatie.
Release van maart 2026
Openbare preview van MAI-Voice-1
MAI-Voice-1 is een nieuw neuraal tekst-naar-spraakmodel dat is gebouwd op de interne modellen van spraakbasis van Microsoft. Het produceert expressieve, natuurlijke spraak met consistente kwaliteit van spraakpersoon en ondersteunt emotie- en stijlbesturing via SSML mstts:express-as. MAI-Voice-1 is beschikbaar in de regio VS - oost. Zie MAI-Voice-1 in Azure Speech voor meer informatie.
| Spraak-id |
Geslacht |
Aanbevolen use case |
en-us-Jasper:MAI-Voice-1 |
Mannelijke |
Algemeen gesprek, Verkoop, Emotionele stijlen |
en-us-June:MAI-Voice-1 |
Vrouwelijke |
Algemeen gesprek, Klantenservice, Professional, Emotionele stijlen |
en-us-Grant:MAI-Voice-1 |
Mannelijke |
Algemeen gesprek, Professioneel, Emotionele stijlen |
en-us-Iris:MAI-Voice-1 |
Vrouwelijke |
Algemeen gesprek, gesproken tekst, emotionele stijlen |
en-us-Reed:MAI-Voice-1 |
Mannelijke |
Algemeen gesprek |
en-us-Joy:MAI-Voice-1 |
Vrouwelijke |
Algemeen gesprek |
Neurale HD 2.5-update naar nieuwste versie in productie
Neurale HD 2.5 wordt gepromoveerd naar Latest in Production, waardoor verbeteringen in natuurlijke prosody, expressiviteit en uitvoerconsistentie worden geleverd, met name voor lange en complexe inhoud. Deze update breidt de ondersteuning uit voor expressieve spreekstijlen en paralinguistische elementen, waardoor meer menselijke en emotionele rijke spraak mogelijk is voor gesproken tekst, conversationele AI en virtuele assistentscenario's.
Belangrijke verbeteringen zijn onder andere:
- Verbeterde expressieve bereik en stabiliteit tussen domeinen
- Stijlen en paralinguistische tags die worden ondersteund via SSML en invoer voor tekst zonder opmaak
- Verbeterde tagging en metagegevens om spraakevaluatie en selectie te vereenvoudigen
Opmerking
Stijlen en paralinguistische functies zijn beschikbaar op alle HDLatestNeural stemmen, met uitzondering van stemmen met primaire landinstellingen als en‑IN.
Neurale HD Omni-kwaliteit en expressiviteitsupdate
Neurale HD Omni-stemmen ontvangen een kwaliteitsupgrade met extra ondersteuning voor expressieve stijlen en paralinguistische tags in de Omni-stemset. Deze verbetering verbetert emotionele controle en conversationele natuurlijkheid, terwijl het unieke karakter van elke stem behouden blijft, waardoor deze goed geschikt is voor klantenservice, toegankelijkheid en creatieve scenario's.
Opmerking
Stijlen en paralinguistische functies zijn beschikbaar voor alle HDOmniLatestNeural stemmen.
Neurale HD Flash - HD-stemmen met lage latentie
NeuralE HD Flash introduceert een variant met lage latentie van Neural HD, geoptimaliseerd voor responsiviteitskritieke scenario's zoals spraakassistenten en automatisering van het callcenter. HD Flash balanceert snelle synthese met duidelijke uitspraak en natuurlijke prosody, zodat ontwikkelaars kunnen kiezen tussen expressiviteit en latentie op basis van toepassingsbehoeften.
Regionale beschikbaarheidsuitbreiding neurale HD
Vanaf maart 2026 breiden neurale HD-stemmen zich uit buiten hun oorspronkelijke regio's en zijn ze nu beschikbaar in:
- VS - west 2
- VS - oost 2
- India - centraal
- Canada - centraal
- Frankrijk - centraal
- Zweden - centraal
Uitbreiding van neurale HD Multi-Talker-stemmen
Neurale HD Multi-Talker-stemmen bieden nu ondersteuning voor multi-sprekersynthese in extra invoertalen, die verder gaan dan en-US, inclusief fr-FR, es-ES, de-DE, it-IT, pt-BR, ko-KR, ja-JP en zh-CN.
Verschillende nieuwe modellen: en‑MultiTalker‑1:DragonHDLatestNeural, , introduceer fr-Multitalker:DragonHDLatestNeuralzh-Multitalker:DragonHDLatestNeural een uitgebreide set sprekers, waardoor flexibelere dialoog wordt gemaakt voor podcasts, verhalen vertellen en gesproken tekst op basis van rollen.
Sprekers in en‑MultiTalker‑1:DragonHDLatestNeural
|
Geslacht |
Namen van sprekers |
| Vrouwelijke |
Ada, Ava, Emma, Jane |
| Mannelijke |
Andrew, Brian, Davis, Steffan |
Sprekers in fr-Multitalker:DragonHDLatestNeural
|
Geslacht |
Namen van sprekers |
| Vrouwelijke |
Vivienne |
| Mannelijke |
Remy |
Sprekers in zh-Multitalker:DragonHDLatestNeural
|
Geslacht |
Namen van sprekers |
| Vrouwelijke |
Dexiao van Den |
| Mannelijke |
Yunxiao |
Neurale HD-prijsupdate
Vanaf maart 2026 worden de prijzen voor Neural HD verlaagd. Bekijk de details op prijzen.
Release van december 2025
Openbare preview van nieuw spraaktype Dragon HD Omni
Dragon HD Omni integreert een breed scala aan vooraf samengestelde stemmen in één geavanceerd stemmodel, waardoor contextuele aanpassing, prosody, expressiviteit en onderhoud van elk stem uniek karakter worden verbeterd. Het biedt nauwkeurigere, flexibele en levensechte spraak voor scenario's zoals klantenservice, toegankelijkheid en creatieve productie.
|
Landinstelling (BCP-47) |
Spraaknaam |
en-US |
en-US-Ava-DragonHDOmniLatestNeural (Vrouwelijk) |
en-US |
en-US-Andrew-DragonHDOmniLatestNeural (Mannelijk) |
en-US |
en-US-Dana-DragonHDOmniLatestNeural (Vrouwelijk) |
en-US |
en-US-Caleb-DragonHDOmniLatestNeural (Mannelijk) |
en-US |
en-US-Phoebe-DragonHDOmniLatestNeural (Vrouwelijk) |
en-US |
en-US-Lewis-DragonHDOmniLatestNeural (Mannelijk) |
zh-CN |
zh-CN-Xiaoyue-DragonHDOmniLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Yunqi-DragonHDOmniLatestNeural (Vrouwelijk) |
U kunt deze spraaknaamindeling ook gebruiken door het achtervoegsel :DragonHDOmniLatestNeural toe te voegen om de Omni-versie van de opgegeven stem te proberen via een directe SSML-aanroep
Bijvoorbeeld:
|
Vorige neurale stem |
Spraaknaam omniversie |
de-DE-ConradNeural |
de-DE-Conrad:DragonHDOmniLatestNeural |
Neurale tekst naar spraak 4.1.0
- Opgeloste beveiligingsproblemen
Release van november 2025
Openbare preview van nieuwe HD-stemmen
Azure hd-stemmen (speech high definition) zijn beschikbaar in openbare preview. De HD-stemmen kunnen de inhoud begrijpen, emoties automatisch detecteren in de invoertekst en de spreektoon in realtime aanpassen aan het gevoel. Zie Wat zijn Azure HD-stemmen (Speech High Definition)? voor meer informatie.
|
Landinstelling (BCP-47) |
Spraaknaam |
en-GB |
en-GB-Ada:DragonHDLatestNeural (Vrouwelijk) |
en-GB |
en-GB-Ollie:DragonHDLatestNeural (Mannelijk) |
es-MX |
es-MX-Tristan:DragonHDLatestNeural (Mannelijk) |
es-MX |
es-MX-Ximena:DragonHDLatestNeural (Vrouwelijk) |
fr-CA |
fr-CA-Sylvie:DragonHDLatestNeural (Vrouwelijk) |
fr-CA |
fr-CA-Thierry:DragonHDLatestNeural (Mannelijk) |
ko-KR |
ko-KR-Hyunsu:DragonHDLatestNeural (Mannelijk) |
ko-KR |
ko-KR-SunHi:DragonHDLatestNeural (Vrouwelijk) |
33 vorige HD-stemmen zijn bijgewerkt naar v2.0 met verbeterde kwaliteit en bugs opgelost
|
Landinstelling (BCP-47) |
Spraaknaam |
de-DE |
de-DE-Florian:DragonHDLatestNeural (Mannelijk) |
de-DE |
de-DE-Seraphina:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Adam:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Alloy:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Andrew:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Andrew2:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Andrew3:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Aria:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Ava:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Ava3:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Bree:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Brian:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Davis:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Emma:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Emma2:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Jane:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Jenny:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Nova:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Phoebe:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Serena:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Steffan:DragonHDLatestNeural (Mannelijk) |
es-ES |
es-ES-Tristan:DragonHDLatestNeural (Mannelijk) |
es-ES |
es-ES-Ximena:DragonHDLatestNeural (Vrouwelijk) |
fr-FR |
fr-FR-Remy:DragonHDLatestNeural (Mannelijk) |
fr-FR |
fr-FR-Vivienne:DragonHDLatestNeural (Vrouwelijk) |
it-IT |
it-IT-Alessio:DragonHDLatestNeural (Mannelijk) |
it-IT |
it-IT-Isabella:DragonHDLatestNeural (Vrouwelijk) |
ja-JP |
ja-JP-Masaru:DragonHDLatestNeural (Mannelijk) |
ja-JP |
ja-JP-Nanami:DragonHDLatestNeural (Vrouwelijk) |
pt-BR |
pt-BR-Macerio:DragonHDLatestNeural (Mannelijk) |
pt-BR |
pt-BR-Thalita:DragonHDLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Xiaochen:DragonHDLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Yunfan:DragonHDLatestNeural (Mannelijk) |
Opmerking
Als u na deze update een probleem ondervindt bij het aanroepen en-US-MultiTalker-Ava-Andrew:DragonHDLatestNeural en en-US-MultiTalker-Ava-Steffan:DragonHDLatestNeural, werkt u uw spraaknaam bij naar en-US-MultiTalker-Ava-Andrew:DragonHDv1.2Neural & en-US-MultiTalker-Ava-Steffan:DragonHDv1.2Neural
Neurale tekst naar spraak 4.0.0-preview
- Besturingssysteem bijgewerkt naar Azure Linux 3
- Opgeloste beveiligingsproblemen
Release van oktober 2025
Neurale tekst naar spraak 3.14.0
- Ondersteuning toegevoegd voor nieuwe neurale stemmen:
nl-nl-maartenneural, nl-be-arnaudneural, nl-be-denaneuralde-de-elkeneural
- Opgeloste beveiligingsproblemen
Release van augustus 2025
Openbare preview van nieuwe HD-stemmen
|
Landinstelling (BCP-47) |
Spraaknaam |
it-IT |
it-IT-Alessio:DragonHDLatestNeural (Mannelijk) |
it-IT |
it-IT-Isabella:DragonHDLatestNeural (Vrouwelijk) |
pt-BR |
pt-BR-Macerio:DragonHDLatestNeural (Mannelijk) |
pt-BR |
pt-BR-Thalita:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Jane:DragonHDLatestNeural (Vrouwelijk) |
Release van juli 2025
Openbare preview Personal Voice bijgewerkt naar v2.1
Ons nieuwe "DragonV2.1"-model brengt verbeteringen aan de natuurlijkheid van spraak, wat meer realistische en stabiele prosody biedt en tegelijkertijd betere nauwkeurigheid van de uitspraak behoudt.
Release van juni 2025
VoiceLive API-update
- Ondersteuning voor meer GenAI-modellen: GPT-4.1, GPT-4.1 Mini, Phi-4 mini en Phi-4 Multimodal modellen worden nu systeemeigen ondersteund.
- Ondersteuning voor meer aanpassingsmogelijkheden
- Azure Semantische VAD wordt uitgebreid ter ondersteuning van GPT-Realtime en GPT-4o-Mini-Realtime.
- Beschikbaarheid in meer regio's
Openbare preview van de functie Spraakconversie op geselecteerde en-US stemmen
De volgende stemmen zijn nu beschikbaar voor de functie:
|
Landinstelling (BCP-47) |
Spraaknaam |
en-US |
en-US-Adam:MultilingualNeural (Mannelijk) |
en-US |
en-US-Amanda:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Andrew:MultilingualNeural (Mannelijk) |
en-US |
en-US-Ava:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Brandon:MultilingualNeural (Mannelijk) |
en-US |
en-US-Brian:MultilingualNeural (Mannelijk) |
en-US |
en-US-Christopher:MultilingualNeural (Mannelijk) |
en-US |
en-US-Cora:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Davis:MultilingualNeural (Mannelijk) |
en-US |
en-US-Derek:MultilingualNeural (Mannelijk) |
en-US |
en-US-Dustin:MultilingualNeural (Mannelijk) |
en-US |
en-US-EchoTurbo:MultilingualNeural (Mannelijk) |
en-US |
en-US-Emma:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Evelyn:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-FableTurbo:MultilingualNeural (Neutraal) |
en-US |
en-US-Jenny:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Lewis:MultilingualNeural (Mannelijk) |
en-US |
en-US-Lola:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Nancy:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-NovaTurbo:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-OnyxTurbo:MultilingualNeural (Mannelijk) |
en-US |
en-US-Phoebe:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Ryan:MultilingualNeural (Mannelijk) |
en-US |
en-US-Samuel:MultilingualNeural (Mannelijk) |
en-US |
en-US-Serena:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-ShimmerTurbo:MultilingualNeural (Vrouwelijk) |
en-US |
en-US-Steffan:MultilingualNeural (Mannelijk) |
Release van mei 2025
Openbare preview voor VoiceLive-API
Azure Speech in Foundry Tools biedt één geïntegreerde API voor het bouwen van spraakagenten. Deze nieuwe API, die vanaf vandaag beschikbaar is in openbare preview, biedt ondersteuning voor schaalbare spraak-naar-spraak-interacties met lage latentie met behulp van basismodellen van uw keuze.
Release van april 2025
Openbare preview van nieuwe HD-stemmen
De volgende HD-stemmen zijn nu beschikbaar voor preview:
|
Landinstelling (BCP-47) |
Spraaknaam |
en-US |
en-US-MultiTalker-Ava-Steffan:DragonHDLatestNeural (Neutraal) |
en-US |
en-US-Bree:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-AshTurboMultilingualNeural (Mannelijk) |
Release van maart 2025
Algemene beschikbaarheid van sommige HD-stemmen
De volgende HD-stemmen zijn nu algemeen beschikbaar:
|
Landinstelling (BCP-47) |
Spraaknaam |
de-DE |
de-DE-Florian:DragonHDLatestNeural (Mannelijk) |
de-DE |
de-DE-Seraphina:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Adam:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Andrew:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Andrew2:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Ava:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Brian:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Davis:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Emma:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Emma2:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Steffan:DragonHDLatestNeural (Mannelijk) |
es-ES |
es-ES-Tristan:DragonHDLatestNeural (Mannelijk) |
es-ES |
es-ES-Ximena:DragonHDLatestNeural (Vrouwelijk) |
fr-FR |
fr-FR-Remy:DragonHDLatestNeural (Mannelijk) |
fr-FR |
fr-FR-Vivienne:DragonHDLatestNeural (Vrouwelijk) |
ja-JP |
ja-JP-Masaru:DragonHDLatestNeural (Mannelijk) |
ja-JP |
ja-JP-Nanami:DragonHDLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Xiaochen:DragonHDLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Yunfan:DragonHDLatestNeural (Mannelijk) |
Stemmen met meerdere talkers voor podcastscenario's (preview)
|
Landinstelling (BCP-47) |
Spraaknaam |
en-US |
en-US-MultiTalker-Ava-Andrew:DragonHDLatestNeural (Neutraal) |
Nieuwe HD-stemmen (preview)
|
Landinstelling (BCP-47) |
Spraaknaam |
en-US |
en-US-Ava3:DragonHDLatestNeural (Vrouwelijk) - geoptimaliseerd voor Podcast |
en-US |
en-US-Andrew3:DragonHDLatestNeural (Male) - geoptimaliseerd voor Podcast |
Dragon HD Flash-modellen (preview)
|
Landinstelling (BCP-47) |
Spraaknaam |
zh-CN |
zh-CN-Xiaochen:DragonHDFlashLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Xiaoxiao:DragonHDFlashLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Xiaoxiao2:DragonHDFlashLatestNeural (Vrouwelijk, Geoptimaliseerd voor vrije gesprekken) |
zh-CN |
zh-CN-Yunxiao:DragonHDFlashLatestNeural (Mannelijk) |
zh-CN |
zh-CN-Yunyi:DragonHDFlashLatestNeural (Mannelijk) |
Release van februari 2025
Bijgewerkte HD-stemmen (preview)
Bijgewerkte 13 huidige HD-stemmen bijgewerkt om meertalige stemmen te ondersteunen.
|
Landinstelling (BCP-47) |
Spraaknaam |
de-DE |
de-DE-Seraphina:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Brian:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Davis:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Ava:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Andrew:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Andrew2:DragonHDLatestNeural (Mannelijk) - geoptimaliseerd voor gratis praten |
en-US |
en-US-Emma:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Emma2:DragonHDLatestNeural (Vrouwelijk) - geoptimaliseerd voor vrije gesprekken |
en-US |
en-US-Steffan:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Aria:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Jenny:DragonHDLatestNeural (Vrouwelijk) |
ja-JP |
ja-JP-Masaru:DragonHDLatestNeural (Mannelijk) |
zh-CN |
zh-CN-Xiaochen:DragonHDLatestNeural (Vrouwelijk) |
Nieuwe HD-stemmen (preview)
Nog 14 HD-stemmen toegevoegd
|
Landinstelling (BCP-47) |
Spraaknaam |
de-DE |
de-DE-Florian:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Adam:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Brian:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Davis:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Phoebe:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Serena:DragonHDLatestNeural (Vrouwelijk) |
en-US |
en-US-Alloy:DragonHDLatestNeural (Mannelijk) |
en-US |
en-US-Nova:DragonHDLatestNeural (Vrouwelijk) |
es-ES |
es-ES-Ximena:DragonHDLatestNeural (Vrouwelijk) |
es-ES |
es-ES-Tristan:DragonHDLatestNeural (Mannelijk) |
fr-FR |
fr-FR-Vivienne:DragonHDLatestNeural (Vrouwelijk) |
fr-FR |
fr-FR-Remy:DragonHDLatestNeural (Mannelijk) |
ja-JP |
ja-JP-Nanami:DragonHDLatestNeural (Vrouwelijk) |
zh-CN |
zh-CN-Yunfan:DragonHDLatestNeural (Mannelijk) |
Introductie van nieuwe meertalige stemmen (preview)
Er zijn 4 meertaligere stemmen toegevoegd met en-US emotiesondersteuning.
|
Landinstelling (BCP-47) |
Spraaknaam |
Stijlen |
en-US |
DerekMultilingualNeural (Mannelijk) |
empathetic, , , excitedrelievedshy |
en-US |
PhoebeMultilingualNeural (Vrouwelijk) |
empathetic, , sadserious |
en-US |
DavisMultilingualNeural (Mannelijk) |
empathetic, , funnyrelieved |
en-US |
NancyMultilingualNeural (Vrouwelijk) |
excited
friendly, funny, relievedshy |
Azure OpenAI in Microsoft Foundry Models turbo stemmen (algemeen beschikbaar)
Deze 6 turbostemmen zijn nu algemeen beschikbaar:
|
Landinstelling (BCP-47) |
Spraaknaam |
en-US |
en-US-AlloyTurboMultilingualNeural (Mannelijk) |
en-US |
en-US-EchoTurboMultilingualNeural (Mannelijk) |
en-US |
en-US-FableTurboMultilingualNeural (Neutraal) |
en-US |
en-US-NovaTurboMultilingualNeural (Vrouwelijk) |
en-US |
en-US-OnyxTurboMultilingualNeural (Mannelijk) |
en-US |
en-US-ShimmerTurboMultilingualNeural (Vrouwelijk) |
Verbeteringen in spraakkwaliteit (algemeen beschikbaar)
Verbeterde kwaliteit van 16 stemmen.
|
Landinstelling (BCP-47) |
Spraaknaam |
ar-EG |
ar-EG-ShakirNeural (Mannelijk) |
ca-ES |
ca-ES-EnricNeural (Mannelijk) |
en-IE |
en-IE-EmilyNeural (Vrouwelijk) |
fi-FI |
fi-FI-HarriNeural (Mannelijk) |
fi-FI |
fi-FI-SelmaNeural (Vrouwelijk) |
fr-CH |
fr-CH-FabriceNeural (Vrouwelijk) |
hr-HR |
hr-HR-GabrijelaNeural (Vrouwelijk) |
nl-NL |
nl-NL-MaartenNeural (Mannelijk) |
pt-PT |
pt-PT-RaquelNeural (Vrouwelijk) |
ro-RO |
ro-RO-AlinaNeural (Vrouwelijk) |
sv-SE |
sv-SE-MattiasNeural (Mannelijk) |
sv-SE |
sv-SE-SofieNeural (Vrouwelijk) |
vi-VN |
vi-VN-HoaiMyNeural (Vrouwelijk) |
vi-VN |
vi-VN-NamMinhNeural (Mannelijk) |
zh-HK |
zh-HK-HiuMaanNeural (Vrouwelijk) |
zh-HK |
zh-HK-WanLungNeural (Mannelijk) |
Ingesloten Jenny met meerdere stijlen (algemeen beschikbaar)
Er is stijlondersteuning toegevoegd voor en-US-JennyNeuralingesloten spraak. Dezelfde stijlen worden ondersteund als in de cloud. De volgende stijlen worden ondersteund: angry, assistant, , chat, cheerfulcustomerservice, , excited, , friendlyhopefulnewscastsadshoutingterrifiedunfriendlyen .whispering
Release van januari 2025
Aangepaste avatartraining
U kunt nu aangepaste avatars trainen in Speech Studio. Voorheen moest je wachten tot Microsoft je aangepaste avatar moest trainen.
Zie een aangepaste tekst voor spraak-avatar maken voor meer informatie over het maken van een aangepaste avatar.
Release van oktober 2024
Standaardstem
Geïntroduceerd 4 turboversie van Azure OpenAI-stemmen in openbare preview: en-US-EchoTurboMultilingualNeural, en-US-FableTurboMultilingualNeural, en-US-OnyxTurboMultilingualNeural en en-US-ShimmerTurboMultilingualNeural. Turbo-versie van Azure OpenAI-stemmen heeft dezelfde stempersoon als Azure OpenAI-stemmen, maar ondersteunt extra functies. Turbo-stemmen ondersteunen de volledige set SSML-elementen en meer functies zoals woordgrens, net als andere Azure Spraakstemmen. Zie de volledige taal- en spraaklijst voor meer informatie.
Deze stemmen zijn nu algemeen beschikbaar:
|
Landinstelling (BCP-47) |
Spraaknaam |
de-DE |
SeraphinaMultilingualNeural |
de-DE |
FlorianMultilingualNeural |
en-GB |
AdaMultilingualNeural |
en-GB |
OllieMultilingualNeural |
en-US |
LunaNeural |
en-US |
KaiNeural |
en-US |
CoraMultilingualNeural |
en-US |
ChristopherMultilingualNeural |
en-US |
BrandonMultilingualNeural |
es-ES |
IsidoraMultilingualNeural |
es-ES |
ArabellaMultilingualNeural |
es-ES |
TristanMultilingualNeural |
es-ES |
XimenaMultilingualNeural |
fr-FR |
LucienMultilingualNeural |
fr-FR |
VivienneMultilingualNeural |
fr-FR |
RemyMultilingualNeural |
it-IT |
IsabellaMultilingualNeural |
it-IT |
MarcelloMultilingualNeural |
it-IT |
AlessioMultilingualNeural |
it-IT |
GiuseppeMultilingualNeural |
ko-KR |
HyunsuMultilingualNeural |
pt-BR |
ThalitaMultilingualNeural |
pt-BR |
MacerioMultilingualNeural |
Hd-spraak (Standard High Definition)
Azure Hd-stemmen (Speech High Definition) zijn beschikbaar in openbare preview. De HD-stemmen kunnen de inhoud begrijpen, emoties automatisch detecteren in de invoertekst en de spreektoon in realtime aanpassen aan het gevoel. HD-stemmen behouden een consistente spraakpersoonspersoon van hun neurale (en niet-HD)-tegenhangers en leveren nog meer waarde via verbeterde functies. Zie Wat zijn Azure HD-stemmen (Speech High Definition)? voor meer informatie.
Aangepaste neurale spraak
Voorheen werden sommige landinstellingen alleen ondersteund met V3 voor het trainingsrecept. Deze landinstellingen ondersteunen nu ook V9, waardoor verbeterde trainingskwaliteit en uitgebreide functies mogelijk zijn. Raadpleeg de volgende tabel voor deze landinstellingen:
|
Landinstelling (BCP-47) |
Language |
ar-EG |
Arabisch (Egypte) |
ar-SA |
Arabisch (Saoedi-Arabië) |
ca-ES |
Catalaans |
cs-CZ |
Tsjechisch (Tsjechië) |
da-DK |
Deens (Denemarken) |
de-AT |
Duits (Oostenrijk) |
de-CH |
Duits (Zwitserland) |
el-GR |
Grieks (Griekenland) |
en-IN |
Engels (India) |
fi-FI |
Fins (Finland) |
fr-CH |
Frans (Zwitserland) |
he-IL |
Hebreeuws (Israël) |
hi-IN |
Hindi (India) |
hu-HU |
Hongaars (Hongarije) |
ms-MY |
Maleis (Maleisië) |
nb-NO |
Noors Bokmål (Noorwegen) |
nl-NL |
Nederlands (Nederland) |
pl-PL |
Pools (Polen) |
pt-PT |
Portugees (Portugal) |
ro-RO |
Roemeens (Roemenië) |
ru-RU |
Russisch (Rusland) |
sk-SK |
Slowaaks (Slowakije) |
sv-SE |
Zweeds (Zweden) |
th-TH |
Thais (Thailand) |
r-TR |
Turks (Türk calendar) |
vi-VN |
Vietnamees (Vietnam) |
zh-HK |
Chinees (Kantonees, traditioneel) |
zh-TW |
Chinees (Taiwanese Mandarijn, Traditioneel) |
Custom Neural Voice Pro ondersteunt nu de volgende nieuwe landinstellingen:
-
en-NZ: Engels (Nieuw-Zeeland)
-
es-CL: Spaans (Chili)
-
es-US: Spaans (Verenigde Staten)
-
ta-MY: Tamil (Maleisië)
Zie de taallijst voor aangepaste neurale spraak voor de volledige lijst met ondersteunde landinstellingen.
De functie voor meerdere talen ondersteunt nu de volgende nieuwe landinstellingen als bronlandinstellingen:
|
Landinstelling (BCP-47) |
Language |
da-DK |
Deens (Denemarken) |
de-AT |
Duits (Oostenrijk) |
de-CH |
Duits (Zwitserland) |
de-DE |
Duits (Duitsland) |
en-CA |
Engels (Canada) |
fi-FI |
Fins (Finland) |
fr-CH |
Frans (Zwitserland) |
hu-HU |
Hongaars (Hongarije) |
ms-MY |
Maleis (Maleisië) |
nb-NO |
Noors Bokmål (Noorwegen) |
pt-PT |
Portugees (Portugal) |
sv-SE |
Zweeds (Zweden) |
tr-TR |
Turks (Türk calendar) |
ta-IN |
Tamil (India) |
zh-HK |
Chinees (Kantonees, traditioneel) |
Zie de taallijst voor aangepaste neurale spraak voor de volledige lijst met ondersteunde landinstellingen.
De spraakfunctie met meerdere stijlen ondersteunt nu de volgende nieuwe landinstellingen:
|
Landinstelling (BCP-47) |
Language |
ar-EG |
Arabisch (Egypte) |
ar-SA |
Arabisch (Saoedi-Arabië) |
ca-ES |
Catalaans |
cs-CZ |
Tsjechisch (Tsjechië) |
da-DK |
Deens (Denemarken) |
de-AT |
Duits (Oostenrijk) |
de-CH |
Duits (Zwitserland) |
de-DE |
Duits (Duitsland) |
el-GR |
Grieks (Griekenland) |
en-AU |
Engels (Australië) |
en-CA |
Engels (Canada) |
en-GB |
Engels (Verenigd Koninkrijk) |
en-IN |
Engels (India) |
es-ES |
Spaans (Spanje) |
es-MX |
Spaans (Mexico) |
fi-FI |
Fins (Finland) |
fr-CA |
Frans (Canada) |
fr-CH |
Frans (Zwitserland) |
fr-FR |
Frans (Frankrijk) |
he-IL |
Hebreeuws (Israël) |
hi-IN |
Hindi (India) |
hu-HU |
Hongaars (Hongarije) |
it-IT |
Italiaans (Italië) |
ko-KR |
Koreaans (Korea) |
ms-MY |
Maleis (Maleisië) |
nb-NO |
Noors Bokmål (Noorwegen) |
nl-BE |
Nederlands (België) |
nl-NL |
Nederlands (Nederland) |
pl-PL |
Pools (Polen) |
pt-BR |
Portugees (Brazilië) |
pt-PT |
Portugees (Portugal) |
ro-RO |
Roemeens (Roemenië) |
ru-RU |
Russisch (Rusland) |
sk-SK |
Slowaaks (Slowakije) |
sv-SE |
Zweeds (Zweden) |
th-TH |
Thais (Thailand) |
tr-TR |
Turks (Türk calendar) |
vi-VN |
Vietnamees (Vietnam) |
zh-HK |
Chinees (Kantonees, traditioneel) |
zh-TW |
Chinees (Taiwanese Mandarijn, Traditioneel) |
Zie de taallijst voor aangepaste neurale spraak voor de volledige lijst met ondersteunde landinstellingen.
Release van september 2024
Standaardstem
Ondersteuning en algemene beschikbaarheid toegevoegd voor nieuwe stemmen in de volgende landinstellingen:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
as-IN |
Assamees (India) |
as-IN-YashicaNeural (Vrouwelijk)
as-IN-PriyomNeural (Mannelijk) |
or-IN |
Odia (India) |
or-IN-SubhasiniNeural (Vrouwelijk)
or-IN-SukantNeural (Mannelijk) |
pa-IN |
Punjabi (India) |
pa-IN-OjasNeural (Mannelijk)
pa-IN-VaaniNeural (Vrouwelijk) |
De ene stem in deze tabel is algemeen beschikbaar en ondersteunt alleen de landinstelling 'en-IN'.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-IN |
Engels (India) |
en-IN-AashiNeural (Vrouwelijk) |
De vijf stemmen in deze tabel zijn algemeen beschikbaar en ondersteunen zowel de landinstellingen 'en-IN' als 'hi-IN'.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-IN |
Engels (India) |
en-IN-AaravNeural (Mannelijk)
en-IN-AnanyaNeural (Vrouwelijk)
en-IN-KavyaNeural (Vrouwelijk)
en-IN-KunalNeural (Mannelijk)
en-IN-RehaanNeural (Mannelijk) |
hi-IN |
Hindi (India) |
hi-IN-AaravNeural (Mannelijk)
hi-IN-AnanyaNeural (Vrouwelijk)
hi-IN-KavyaNeural (Vrouwelijk)
hi-IN-KunalNeural (Mannelijk)
hi-IN-RehaanNeural (Mannelijk) |
Spraakstijlen en -rollen
Toegevoegd newscast, cheerfulempathetic stijlen ondersteuning voor de en-IN-NeerjaNeural en hi-IN-SwaraNeural stemmen.
Nieuwe stijlen toegevoegd voor de volgende stemmen:
-
es-MX-DaliaNeural: whispering, , sadcheerful
-
fr-FR-DeniseNeural: whispering, , sadexcited
-
it-IT-IsabellaNeural: whispering, sad, , , excitedcheerful
-
pt-PT-RaquelNeural: , whisperingsad
-
de-DE-ConradNeural: , sadcheerful
-
en-GB-RyanNeural: , whisperingsad
-
es-MX-JorgeNeural: whispering, sad, , , excitedcheerful
-
fr-FR-HenriNeural: whispering, , sadexcited
-
it-IT-DiegoNeural: sad, , excitedcheerful
-
es-ES-AlvaroNeural: , cheerfulsad
-
ko-KR-InjoonNeural: sad
Zie de stemstijlen en -rollen voor meer informatie.
Release van augustus 2024
Standaardstem
Introduceer nieuwe meertalige stemmen in openbare preview. Zie de volledige taal- en spraaklijst voor meer informatie.
Gloednieuwe meertalige stemmen
| Locale |
Language |
Geslacht |
Spraaknaam |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-AdamMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-AmandaMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-DerekMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-LewisMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-LolaMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-PhoebeMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-SamuelMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-SerenaMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-DustinMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-EvelynMultilingualNeural |
| es-ES |
Spaans (Spanje) |
Mannelijke |
es-ES-TristanMultilingualNeural |
| fr-FR |
Frans (Frankrijk) |
Mannelijke |
fr-FR-LucienMultilingualNeural |
| pt-BR |
Portugees (Brazilië) |
Mannelijke |
pt-BR-MacerioMultilingualNeural |
| zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
Mannelijke |
zh-CN-YunfanMultilingualNeural |
| zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
Mannelijke |
zh-CN-YunxiaoMultilingualNeural |
| zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
Mannelijke |
zh-CN-YunyiMultilingualNeural |
Monoculturele modellen bijgewerkt naar meertalige stemmen met verbeteringen in de natuurlijkheid
| Locale |
Language |
Geslacht |
Spraaknaam |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-NancyMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-BrandonMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-ChristopherMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-CoraMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-DavisMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-SteffanMultilingualNeural |
| es-ES |
Spaans (Spanje) |
Vrouwelijke |
es-ES-XimenaMultilingualNeural |
| it-IT |
Italiaans (Italië) |
Mannelijke |
IT-GiuseppeMultilingualNeural |
| ko-KR |
Koreaans (Korea) |
Mannelijke |
ko-KR-HyunsuMultilingualNeural |
Verbeter de volgende meertalige stemmen met een betere kwaliteit.
| Locale |
Language |
Geslacht |
Spraaknaam |
| en-US |
Engels (Verenigde Staten) |
Mannelijke |
en-US-AndrewMultilingualNeural |
| en-US |
Engels (Verenigde Staten) |
Vrouwelijke |
en-US-AvaMultilingualNeural |
Drie meertalige stemmen ondersteunen nu stijlen. Zie de stemstijlen en -rollen voor meer informatie.
- en-US-SerenaMultiplicalNeural:
empathetic, , excitedfriendly, shy, , serious, , relieveden sad.
- en-US-AndrewMultiplicalNeural:
empathetic en relieved.
- zh-CN-SourcexiaoMultiplicalNeural:
affectionate, , cheerfulempathetic, excited, poetry-reading, , sorryen story.
Release van juli 2024
Avatar voor tekst-naar-spraak (GA)
Avatar voor tekst-naar-spraak is nu algemeen beschikbaar. Zie tekst-naar-spraak-avatar voor meer informatie.
Standaardstem
Introduceer 2 turboversies van Azure OpenAI-stemmen in openbare preview: en-US-AlloyTurboMultilingualNeural en en-US-NovaTurboMultilingualNeural. Turbo-versie van Azure OpenAI-stemmen heeft dezelfde stempersoon als Azure OpenAI-stemmen, maar ondersteunt extra functies. Turbo-stemmen ondersteunen de volledige set SSML-elementen en meer functies zoals woordgrens, net als andere Azure Spraakstemmen. Zie de volledige taal- en spraaklijst voor meer informatie.
Introduceer 2 nieuwe meertalige stemmen in openbare preview: zh-CN-YunfanMultilingualNeural en zh-CN-YunxiaoMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Ingesloten neurale stem
Release van juni 2024
Standaardstem
Introductie van 6 nieuwe stemmen in openbare preview beschikbaar in specifieke regio's: Azië - oost, Azië - zuidoost, VS - oost, VS - west en India - centraal.
| Locale |
Language |
Stemmen voor tekst naar spraak |
or-IN |
Odia (India) |
or-IN-SubhasiniNeural (Vrouwelijk) |
or-IN |
Odia (India) |
or-IN-SukantNeural (Mannelijk) |
pa-IN |
Punjabi (India) |
pa-IN-VaaniNeural (Vrouwelijk) |
pa-IN |
Punjabi (India) |
pa-IN-OjasNeural (Mannelijk) |
as-IN |
Assamees (India) |
as-IN-YashicaNeural (Vrouwelijk) |
as-IN |
Assamees (India) |
as-IN-PriyomNeural (Mannelijk) |
Zie de volledige taal- en spraaklijst voor meer informatie.
Avatar tekst naar spraak
- Avatar voor tekst-naar-spraak ondersteunt nu de volgende regio's: Azië - zuidoost, Europa - noord, Europa - west, Zweden - centraal, VS - zuid-centraal en VS - west 2. Zie Speech-serviceregio's voor meer informatie.
Release van mei 2024
Persoonlijke stem (GA)
Persoonlijke stem is nu algemeen beschikbaar. Met persoonlijke stem kunt u binnen enkele seconden ai-gegenereerde replicatie van uw stem (of gebruikers van uw toepassing) krijgen. U geeft een spraakvoorbeeld van één minuut op als de audioprompt en gebruikt deze om spraak te genereren in een van de meer dan 90 talen die worden ondersteund in meer dan 100 landinstellingen. Zie het persoonlijke spraakoverzicht voor meer informatie.
Standaardstem
Introduceer 8 nieuwe meertalige stemmen in openbare preview: , , , , , en-GB-AdaMultilingualNeuralen-GB-OllieMultilingualNeural, , es-ES-ArabellaMultilingualNeuralen es-ES-IsidoraMultilingualNeural. it-IT-AlessioMultilingualNeuralit-IT-IsabellaMultilingualNeuralit-IT-MarcelloMultilingualNeuralpt-BR-ThalitaMultilingualNeural Zie de volledige taal- en spraaklijst voor meer informatie.
Introduceer 2 nieuwe en-US stemmen die zijn geoptimaliseerd voor het callcenterscenario in openbare preview: en-US-LunaNeural en en-US-KaiNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Release van april 2024
Avatar tekst naar spraak
- U kunt nu een statische achtergrondafbeelding instellen voor uw avatars. Als u deze functie wilt gebruiken, gebruikt u de
avatarConfig.backgroundImage eigenschap en geeft u een URL op die verwijst naar de gewenste afbeelding. Raadpleeg de eigenschappen van de avatar van batchsynthese voor meer informatie.
Release van maart 2024
Standaardstem
9 meertalige stemmen zijn algemeen beschikbaar in alle regio's: en-US-AvaMultilingualNeural, , en-US-AndrewMultilingualNeural, en-US-EmmaMultilingualNeural, en-US-BrianMultilingualNeuralde-DE-FlorianMultilingualNeural, de-DE-SeraphinaMultilingualNeural, , fr-FR-RemyMultilingualNeural, , , fr-FR-VivienneMultilingualNeuralen zh-CN-XiaoxiaoMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Introductie van een nieuwe meertalige stem voor openbare preview: ja-JP-MasaruMultilingualNeural. Zie de volledige taal- en spraaklijst voor meer informatie.
Aanvullende updates:
-
en-US-RyanMultilingualNeural is algemeen beschikbaar in alle regio's.
-
en-US-JennyMultilingualV2Neural is algemeen beschikbaar in alle regio's, samengevoegd met en-US-JennyMultilingualNeural.
- Preview beschikbaar voor de bijgewerkte
en-IN-NeerjaNeural en hi-IN-SwaraNeural met drie nieuwe stijlen in VS - oost, Europa - west en Azië - zuidoost.
- Preview beschikbaar voor nieuwe vrouwelijke stemmen in Centraal-India:
en-IN-KavyaNeural, en-IN-AnanyaNeural, en-IN-AashiNeural, hi-IN-KavyaNeuralen hi-IN-AnanyaNeural.
Avatar tekst naar spraak
Release van februari 2024
OpenAI-stemmen
De Azure Speech-service ondersteunt OpenAI-tekst naar spraakstemmen in de volgende regio's: VS - noord-centraal en Zweden - centraal. Net als Azure Spraakstemmen leveren OpenAI-tekst aan spraakstemmen spraaksynthese van hoge kwaliteit om geschreven tekst om te zetten in natuurlijk klinkende gesproken audio. Dit biedt een breed scala aan mogelijkheden voor insluitende en interactieve gebruikerservaringen. Zie Wat zijn OpenAI-tekst voor spraakstemmen? voor meer informatie.
Opmerking
OpenAI-tekst naar spraakstemmen zijn ook beschikbaar in Azure OpenAI.
Met deze update hebben we de prijzen van standaardstemmen aangepast met Azure Speech. Bekijk hier de bijgewerkte prijzen.
Persoonlijke stem
De persoonlijke spraakfunctie ondersteunt DragonLatestNeural nu en PhoenixLatestNeural modellen. Deze nieuwe modellen verbeteren de natuurlijkheid van gesynthetiseerde stemmen en lijken beter op de spraakkenmerken van de stem in de prompt. Raadpleeg Persoonlijke stem integreren in uw toepassing voor meer informatie.
Release van december 2023
Aangepaste spraak-API
De aangepaste spraak-API is beschikbaar voor het maken en beheren van professionele en persoonlijke aangepaste neurale spraakmodellen.
Aangepaste neurale spraak
De nieuw getrainde spraakmodellen ondersteunen nu de samplefrequentie van 48 kHz, ongeacht de modelversie. Voor eerder getrainde spraakmodellen is het noodzakelijk om de engineversie te upgraden naar ten minste 2023.11.13.0 om de steekproefsnelheid te verbeteren tot 48 kHz.
Standaardstem
- Introductie van nieuwe meertalige stemmen voor openbare preview:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
de-DE |
Duits (Duitsland) |
de-DE-FlorianMultilingualNeural (Mannelijk) |
de-DE |
Duits (Duitsland) |
de-DE-SeraphinaMultilingualNeural (Vrouwelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-AvaMultilingualNeural (Vrouwelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-EmmaMultilingualNeural (Vrouwelijk) |
fr-FR |
Frans (Frankrijk) |
fr-FR-RemyMultilingualNeural (Mannelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-BrianMultilingualNeural (Mannelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-AndrewMultilingualNeural (Mannelijk) |
fr-FR |
Frans (Frankrijk) |
fr-FR-VivienneMultilingualNeural (Vrouwelijk) |
zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
zh-CN-XiaoxiaoMultilingualNeural (Vrouwelijk) |
zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
zh-CN-XiaochenMultilingualNeural (Vrouwelijk) |
zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
zh-CN-YunyiMultilingualNeural (Mannelijk) |
- Introductie van nieuwe
zh-CN-XiaoxiaoDialectsNeural stemmen voor openbare preview die ondersteuning bieden voor verschillende Chinese dialecten en accenten:
| Voicename |
Secundaire taal |
Dialect/accent |
zh-CN-XiaoxiaoDialectsNeural |
zh-CN-shaanxi |
Chinees (Het Mandarijn Shaanxi, Vereenvoudigd) |
|
zh-CN-sichuan |
Chinees (Zuidwestelijk Mandarijn, Vereenvoudigd) |
|
zh-CN-shanxi |
Chinees (Shanxi Accent Mandarijn, Vereenvoudigd) |
|
nan-CN |
Chinees (Zuid-Min, Vereenvoudigd) |
|
zh-CN-anhui |
Chinees (Jianghuai Mandarijn Anhui, Vereenvoudigd) |
|
zh-CN-hunan |
Chinees (Hunan Accent Mandarijn, Vereenvoudigd) |
|
zh-CN-gansu |
Chinees (Lanyin Mandarijn Gansu, Vereenvoudigd) |
|
zh-CN-shandong |
Chinees (Jilu Mandarijn, Vereenvoudigd) |
|
zh-CN-henan |
Chinees (Het Mandarijn Henan, Vereenvoudigd) |
|
zh-CN-liaoning |
Chinees (Noordoostelijk Mandarijn, Vereenvoudigd) |
|
zh-TW |
Chinees (Taiwanese Mandarijn, Traditioneel) |
Release van november 2023
Persoonlijke stem
Persoonlijke stem is beschikbaar in preview in de volgende regio's: Europa - west, VS - oost en Azië - zuidoost. Met persoonlijke stem (preview) kunt u binnen een paar seconden ai-gegenereerde replicatie van uw stem (of gebruikers van uw toepassing) krijgen. U geeft een spraakvoorbeeld van één minuut op als de audioprompt en gebruikt deze om spraak te genereren in een van de meer dan 90 talen die worden ondersteund in meer dan 100 landinstellingen.
Zie persoonlijke stem voor meer informatie.
Avatar tekst naar spraak
Avatar voor tekst-naar-spraak is beschikbaar in de preview-versie in de volgende regio's: VS - west 2, Europa - west en Azië - zuidoost.
Tekst-naar-spraak-avatar converteert tekst naar een digitale video van een fotorealistisch mens (een standaard avatar of een aangepaste tekst naar spraak avatar) die spreekt met een natuurlijke stem. De video van de tekst naar spraak-avatar kan asynchroon of in realtime worden gesynthetiseerd. Ontwikkelaars kunnen toepassingen bouwen die zijn geïntegreerd met tekst-naar-spraak-avatar via een API of een hulpprogramma voor het maken van inhoud in Speech Studio gebruiken om video-inhoud te maken zonder code te coderen.
Zie tekst-naar-spraak-avatar, transparantienotities en openbaarmaking voor stem- en avatartalent voor meer informatie.
Aangepaste neurale spraak
Ondersteuning toegevoegd voor de 24 nieuwe landinstellingen voor cross-lingual voice. Zie de volledige taallijst voor meer informatie.
Standaardstem
Introductie van nieuwe stemmen voor openbare preview:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
de-DE |
Duits (Duitsland) |
SeraphinaNeural (Vrouwelijk) |
es-ES |
Spaans (Spanje) |
XimenaNeural (Vrouwelijk) |
fr-CA |
Frans (Canada) |
ThierryNeural (Mannelijk) |
fr-FR |
Frans (Frankrijk) |
VivienneNeural (Vrouwelijk) |
it-IT |
Italiaans (Italië) |
GiuseppeNeural (Mannelijk) |
ko-KR |
Koreaans (Korea) |
HyunsuNeural (Mannelijk) |
pt-BR |
Portugees (Brazilië) |
ThalitaNeural (Vrouwelijk) |
Modellen bijgewerkt met fouten die zijn opgelost en kwaliteitsverbetering:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
es-ES |
Spaans (Spanje) |
AlvaroNeural (Mannelijk) |
en-GB |
Engels (Verenigd Koninkrijk) |
RyanNeural (Mannelijk) |
ko-KR |
Koreaans (Korea) |
InjoonNeural (Mannelijk) |
Zie de volledige taal- en spraaklijst voor meer informatie.
Release van oktober 2023
Aangepaste neurale spraak
- Ondersteuning toegevoegd voor de 12 nieuwe landinstellingen met aangepaste neurale spraak Pro. Zie de volledige taallijst voor meer informatie.
Release van september 2023
Standaardstem
- Introductie van nieuwe stemmen voor openbare preview:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-US |
Engels (Verenigde Staten) |
en-US-EmmaNeural (Vrouwelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-AndrewNeural (Mannelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-BrianNeural (Mannelijk) |
Zie de volledige taal- en spraaklijst voor meer informatie.
Ingesloten neurale stem
- Alle 147 landinstellingen (behalve fa-IR, Perzisch (Iran)) zijn beschikbaar in de doos met ofwel 1 geselecteerde vrouwelijke en/of 1 geselecteerde mannelijke stemmen.
Release van augustus 2023
Aangepaste neurale spraak
- De nieuwste CNV Lite trainingsreceptversie is nu uitgebracht. Deze release biedt verschillende verbeteringen aan de kwaliteit van uw taalmodellen.
Probeer Speech Studio uit.
Release van juli 2023
Aangepaste neurale spraak
Standaardstemmen
Introductie van nieuwe en-US genderneutrale stem voor openbare preview:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-US |
Engels (Verenigde Staten) |
en-US-BlueNeural (Neutraal) |
Introductie van nieuwe meertalige stemmen voor openbare preview:
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-US |
Engels (Verenigde Staten) |
en-US-JennyMultilingualV2Neural (Vrouwelijk) |
en-US |
Engels (Verenigde Staten) |
en-US-RyanMultilingualNeural (Mannelijk) |
De meertalige stemmen en-US-JennyMultilingualV2Neural en en-US-RyanMultilingualNeural automatisch de taal van de invoertekst detecteren. U kunt het <lang> element echter nog steeds gebruiken om de spreektaal voor deze stemmen aan te passen.
Deze nieuwe meertalige stemmen kunnen in 41 talen en accenten spreken: Arabic (Egypt), Arabic (Saudi Arabia), Catalan, Czech (Czechia), Danish (Denmark), German (Austria), German (Switzerland), German (Germany), English (Australia), English (Canada), English (United Kingdom), English (Hong Kong SAR), English (Ireland), English (India), English (Verenigde Staten), Spanish (Spain), Spanish (Mexico), Finnish (Finland), French (Belgium), French (Canada), French (Switzerland), French (France), Hindi (India), Hungarian (Hungary), Indonesian (Indonesia), Italian (Italy), Japanese (Japan), Korean (Korea), Norwegian Bokmål (Norway), Dutch (Belgium), Dutch (Netherlands), Polish (Poland), Portuguese (Brazil), Portuguese (Portugal), Russian (Russia), Swedish (Sweden), Thai (Thailand), Turkish (Türkiye), Chinese (Mandarin, Simplified), Chinese (Cantonese, Traditional), Chinese (Taiwanese Mandarin, Traditional).
Deze meertalige stemmen ondersteunen bepaalde SSML-elementen niet volledig, zoals onderbreking, nadruk, stilte en sub.
Belangrijk
De en-US-JennyMultilingualV2Neural stem wordt tijdelijk in openbare preview aangeboden voor evaluatiedoeleinden. Deze wordt in de toekomst verwijderd.
Als u in een andere taal dan Engels wilt spreken, moet u voor de huidige implementatie van de en-US-JennyMultilingualNeural stem het <lang xml:lang> element instellen. We verwachten dat in het kalenderjaar 2023 van Q4 de en-US-JennyMultilingualNeural stem wordt bijgewerkt om te spreken in de taal van de invoertekst zonder het <lang xml:lang> element. Dit is in pariteit met de en-US-JennyMultilingualV2Neural stem.
Maak kennis met nieuwe functies in openbare preview voor onderstaande stemmen:
- Latijnse invoer toegevoegd voor Servische stemmen
sr-RS (Servië): sr-latn-RS-SophieNeural en sr-latn-RS-NicholasNeural.
- Engelse uitspraakondersteuning toegevoegd voor Albanese stemmen
sq-AL (Albanië): sq-AL-AnilaNeural en sq-AL-IlirNeural.
Release van mei 2023
Audio-inhoud maken
- Alle standaardstemmen met spreekstijlen en aangepaste stemmen met meerdere stijlen ondersteunen aanpassing van stijlgraden.
- U kunt nu de uitspraak van een woord oplossen door het woord te spreken en op te nemen. De telefoontjes kunnen automatisch worden herkend vanuit uw opname. De functie Recognize by speaking is nu beschikbaar als openbare preview.
Release van april 2023
Standaardstemmen
- De volgende functies van deze stemmen zijn verplaatst van openbare preview naar algemene beschikbaarheid:
| Stijl |
Stemmen voor tekst naar spraak |
| style="chat" |
en-GB-RyanNeural, en es-MX-JorgeNeuralit-IT-IsabellaNeural |
| style="vrolijk" |
en-GB-RyanNeural, , en-GB-SoniaNeurales-MX-JorgeNeural, fr-FR-DeniseNeural, , , en fr-FR-HenriNeuralit-IT-IsabellaNeural |
| style="sad" |
en-GB-SoniaNeural, en fr-FR-DeniseNeuralfr-FR-HenriNeural |
- Verbeter de Engelse uitspraak voor
hi-IN, ta-IN en te-IN stemmen, nu vlucht in openbare preview-regio's
Zie de taal- en spraaklijst voor meer informatie.
Release van maart 2023
Nieuwe functies
Speech Synthesis Markup Language (SSML) wordt bijgewerkt ter ondersteuning van audio-effectprocessorelementen die de kwaliteit van de gesynthetiseerde spraakuitvoer optimaliseren voor specifieke scenario's op apparaten. Meer informatie over spraaksynthesemarkeringen.
Aangepaste neurale spraak
Ondersteuning toegevoegd voor de nl-BE landinstelling met Custom Neural Voice Pro. Zie de volledige taal- en spraaklijst voor meer informatie.
Standaardstemmen
De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-AU |
Engels (Australië) |
en-AU-AnnetteNeural (Vrouwelijk)
en-AU-CarlyNeural (Vrouwelijk)
en-AU-DarrenNeural (Mannelijk)
en-AU-DuncanNeural (Mannelijk)
en-AU-ElsieNeural (Vrouwelijk)
en-AU-FreyaNeural (Vrouwelijk)
en-AU-JoanneNeural (Vrouwelijk)
en-AU-KenNeural (Mannelijk)
en-AU-KimNeural (Vrouwelijk)
en-AU-NeilNeural (Mannelijk)
en-AU-TimNeural (Mannelijk)
en-AU-TinaNeural (Vrouwelijk)
en-AU-WilliamNeural (Mannelijk) |
en-GB |
Engels (Verenigd Koninkrijk) |
en-GB-RyanNeural (Mannelijk)
en-GB-SoniaNeural (Vrouwelijk) |
es-ES |
Spaans (Spanje) |
es-ES-AbrilNeural (Vrouwelijk)
es-ES-ArnauNeural (Mannelijk)
es-ES-DarioNeural (Mannelijk)
es-ES-EliasNeural (Mannelijk)
es-ES-EstrellaNeural (Vrouwelijk)
es-ES-IreneNeural (Vrouwelijk)
es-ES-LaiaNeural (Vrouwelijk)
es-ES-LiaNeural (Vrouwelijk)
es-ES-NilNeural (Mannelijk)
es-ES-SaulNeural (Mannelijk)
es-ES-TeoNeural (Mannelijk)
es-ES-TrianaNeural (Vrouwelijk)
es-ES-VeraNeural (Vrouwelijk) |
es-MX |
Spaans (Mexico) |
es-MX-JorgeNeural (Mannelijk) |
fr-FR |
Frans (Frankrijk) |
fr-FR-HenriNeural (Mannelijk) |
it-IT |
Italiaans (Italië) |
it-IT-IsabellaNeural (Vrouwelijk) |
ja-JP |
Japans (Japan) |
ja-JP-AoiNeural (Vrouwelijk)
ja-JP-DaichiNeural (Mannelijk)
ja-JP-MayuNeural (Vrouwelijk)
ja-JP-NaokiNeural (Mannelijk)
ja-JP-ShioriNeural (Vrouwelijk) |
Ondersteuning toegevoegd voor de cheerful stijl met de de-DE-ConradNeural stem.
Release van februari 2023
Standaardstemmen
De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
zh-CN |
Chinees (Mandarijn, Vereenvoudigd) |
zh-CN-XiaomengNeural (Vrouwelijk)
zh-CN-XiaoyiNeural (Vrouwelijk)
zh-CN-XiaozhenNeural (Vrouwelijk)
zh-CN-YunfengNeural (Mannelijk)
zh-CN-YunhaoNeural (Mannelijk)
zh-CN-YunjianNeural (Mannelijk)
zh-CN-YunxiaNeural (Mannelijk)
zh-CN-YunzeNeural (Mannelijk) |
zh-CN-henan |
Chinees (Het Mandarijn Henan, Vereenvoudigd) |
zh-CN-henan-YundengNeural (Mannelijk) |
Release van december 2022
REST API voor batchsynthese (preview)
De Batch-synthese-API is momenteel beschikbaar als openbare preview. Zodra deze algemeen beschikbaar is, wordt de Long Audio-API afgeschaft. Zie Migreren naar batchsynthese-API voor meer informatie.
Release van november 2022
Standaardstemmen (GA)
De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
es-MX |
Spaans (Mexico) |
es-MX-BeatrizNeural (Vrouwelijk)
es-MX-CandelaNeural (Vrouwelijk)
es-MX-CarlotaNeural (Vrouwelijk)
es-MX-CecilioNeural (Mannelijk)
es-MX-GerardoNeural (Mannelijk)
es-MX-LarissaNeural (Vrouwelijk)
es-MX-LibertoNeural (Mannelijk)
es-MX-LucianoNeural (Mannelijk)
es-MX-MarinaNeural (Vrouwelijk)
es-MX-NuriaNeural (Vrouwelijk)
es-MX-PelayoNeural (Mannelijk)
es-MX-RenataNeural (Vrouwelijk)
es-MX-YagoNeural (Mannelijk) |
it-IT |
Italiaans (Italië) |
it-IT-BenignoNeural (Mannelijk)
it-IT-CalimeroNeural (Mannelijk)
it-IT-CataldoNeural (Mannelijk)
it-IT-FabiolaNeural (Vrouwelijk)
it-IT-FiammaNeural (Vrouwelijk)
it-IT-GianniNeural (Mannelijk)
it-IT-ImeldaNeural (Vrouwelijk)
it-IT-IrmaNeural (Vrouwelijk)
it-IT-LisandroNeural (Mannelijk)
it-IT-PalmiraNeural (Vrouwelijk)
it-IT-PierinaNeural (Vrouwelijk)
it-IT-RinaldoNeural (Mannelijk) |
pt-BR |
Portugees (Brazilië) |
pt-BR-BrendaNeural (Vrouwelijk)
pt-BR-DonatoNeural (Mannelijk)
pt-BR-ElzaNeural (Vrouwelijk)
pt-BR-FabioNeural (Mannelijk)
pt-BR-GiovannaNeural (Vrouwelijk)
pt-BR-HumbertoNeural (Mannelijk)
pt-BR-JulioNeural (Mannelijk)
pt-BR-LeilaNeural (Vrouwelijk)
pt-BR-LeticiaNeural (Vrouwelijk)
pt-BR-ManuelaNeural (Vrouwelijk)
pt-BR-NicolauNeural (Mannelijk)
pt-BR-ValerioNeural (Mannelijk)
pt-BR-YaraNeural (Vrouwelijk) |
Aangepaste neurale spraak
De volgende landinstellingsondersteuning wordt toegevoegd voor aangepaste neurale spraak. Zie de volledige taal- en spraaklijst voor meer informatie.
- Ondersteuning toegevoegd voor de
fr-BE landinstelling met aangepaste neurale spraak Pro.
- Ondersteuning toegevoegd voor de
es-ES landinstelling met aangepaste neurale spraak lite.
Release van oktober 2022
Standaardstemmen (GA)
De volgende stemmen zijn nu algemeen beschikbaar. Zie de volledige taal- en spraaklijst voor meer informatie.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
eu-ES |
Baskisch |
eu-ES-AinhoaNeural (Vrouwelijk)
eu-ES-AnderNeural (Mannelijk) |
hy-AM |
Armeens (Armenië) |
hy-AM-AnahitNeural (Vrouwelijk)
hy-AM-HaykNeural (Mannelijk) |
Standaardstemmen (preview)
De volgende stemmen zijn nu beschikbaar in openbare preview. Zie de volledige taal- en spraaklijst voor meer informatie.
| Landinstelling (BCP-47) |
Language |
Stemmen voor tekst naar spraak |
en-AU |
Engels (Australië) |
en-AU-AnnetteNeural(Vrouwelijk)
en-AU-CarlyNeural(Vrouwelijk)
en-AU-DarrenNeural(Mannelijk)
en-AU-DuncanNeural(Mannelijk)
en-AU-ElsieNeural(Vrouwelijk)
en-AU-FreyaNeural(Vrouwelijk)
en-AU-JoanneNeural(Vrouwelijk)
en-AU-KenNeural(Mannelijk)
en-AU-KimNeural(Vrouwelijk)
en-AU-NeilNeural(Mannelijk)
en-AU-TimNeural(Mannelijk)
en-AU-TinaNeural(Vrouwelijk) |
es-ES |
Spaans (Spanje) |
es-ES-AbrilNeural(Vrouwelijk)
es-ES-AlvaroNeural(Mannelijk)
es-ES-ArnauNeural(Mannelijk)
es-ES-DarioNeural(Mannelijk)
es-ES-EliasNeural(Mannelijk)
es-ES-EstrellaNeural(Vrouwelijk)
es-ES-IreneNeural(Vrouwelijk)
es-ES-LaiaNeural(Vrouwelijk)
es-ES-LiaNeural(Vrouwelijk)
es-ES-NilNeural(Mannelijk)
es-ES-SaulNeural(Mannelijk)
es-ES-TeoNeural(Mannelijk)
es-ES-TrianaNeural(Vrouwelijk)
es-ES-VeraNeural(Vrouwelijk) |
ja-JP |
Japans (Japan) |
ja-JP-AoiNeural(Vrouwelijk)
ja-JP-DaichiNeural(Mannelijk)
ja-JP-MayuNeural(Vrouwelijk)
ja-JP-NaokiNeural(Mannelijk)
ja-JP-ShioriNeural(Vrouwelijk) |
ko-KR |
Koreaans (Korea) |
ko-KR-BongJinNeural(Mannelijk)
ko-KR-GookMinNeural(Mannelijk)
ko-KR-JiMinNeural(Vrouwelijk)
ko-KR-SeoHyeonNeural(Vrouwelijk)
ko-KR-SoonBokNeural(Vrouwelijk)
ko-KR-YuJinNeural(Vrouwelijk) |
wuu-CN |
Chinees (Wu, Vereenvoudigd) |
wuu-CN-XiaotongNeural (Vrouwelijk)
wuu-CN-YunzheNeural (Mannelijk) |
yue-CN |
Chinees (Kantonees, Vereenvoudigd) |
yue-CN-XiaoMinNeural (Vrouwelijk)
yue-CN-YunSongNeural (Mannelijk) |
Algemene TTS-spraakupdates
- Verbeterde kwaliteit voor de
fil-PH-AngeloNeural en fil-PH-BlessicaNeural stemmen.
- Tekstnormalisatieregels worden bijgewerkt voor stemmen met de
es-CL Spaanse (Chili) en uz-UZ Oezbeekse landinstellingen ....
- Engelse lettersspelling toegevoegd voor stemmen met de
sq-AL Albanese (Albanië) en az-AZ Azerbeidzjaanse landinstellingen (Azerbeidzjaans).
- Verbeterde Engelse uitspraak voor de
zh-HK-WanLungNeural stem.
- Verbeterde vraagtoon voor de
nl-NL-MaartenNeural en pt-BR-AntonioNeural stemmen.
- Ondersteuning toegevoegd voor de
<lang ="en-US"> tag voor betere Engelse uitspraak met de volgende stemmen: de-DE-ConradNeural, , de-DE-KatjaNeural, es-ES-AlvaroNeurales-MX-DaliaNeural, es-MX-JorgeNeural, fr-CA-SylvieNeural, , fr-FR-DeniseNeural, , fr-FR-HenriNeural, en it-IT-DiegoNeuralit-IT-IsabellaNeural.
- Er is ondersteuning toegevoegd voor de
style="chat" tag met de volgende stemmen: en-GB-RyanNeural, es-MX-JorgeNeuralen it-IT-IsabellaNeural.
- Er is ondersteuning toegevoegd voor de
style="cheerful" tag met de volgende stemmen: en-GB-RyanNeural, en-GB-SoniaNeural, es-MX-JorgeNeural, fr-FR-DeniseNeural, en fr-FR-HenriNeuralit-IT-IsabellaNeural.
- Er is ondersteuning toegevoegd voor de
style="sad" tag met de volgende stemmen: en-GB-SoniaNeuralen fr-FR-DeniseNeuralfr-FR-HenriNeural.
Release van september 2022
Standaardstem
- Alle standaardstemmen zijn geüpgraded naar hoogwaardige stemmen met een samplefrequentie van 48 kHz.
Release van augustus 2022
Standaardstem
Uitgebrachte nieuwe stemmen in openbare preview:
- Stemmen voor Engels (Verenigde Staten):
en-US-AIGenerate1Neural en en-US-AIGenerate2Neural.
- Stemmen voor Chinese regionale talen:
zh-CN-henan-YundengNeural, zh-CN-shaanxi-XiaoniNeuralen zh-CN-shandong-YunxiangNeural.
Zie de taal- en spraaklijst voor meer informatie.
Release van juli 2022
Standaardstem
- Er zijn 5 nieuwe stemmen toegevoegd van
zh-CN Chinees (Mandarijn, Vereenvoudigd) en 1 nieuwe stem van en-US Engels (Verenigde Staten) in openbare preview. Bekijk de volledige taal en spraaklijst.
| Language |
Locale |
Geslacht |
Spraaknaam |
Stijlondersteuning |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN |
Vrouwelijke |
zh-CN-XiaomengNeural
Nieuw |
Algemeen, meerdere stijlen beschikbaar met SSML |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN |
Vrouwelijke |
zh-CN-XiaoyiNeural
Nieuw |
Algemeen, meerdere stijlen beschikbaar met SSML |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN |
Vrouwelijke |
zh-CN-XiaozhenNeural
Nieuw |
Algemeen, meerdere stijlen beschikbaar met SSML |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN |
Mannelijke |
zh-CN-YunxiaNeural
Nieuw |
Algemeen, meerdere stijlen beschikbaar met SSML |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN |
Mannelijke |
zh-CN-YunzeNeural
Nieuw |
Algemeen, meerdere stijlen beschikbaar met SSML |
| Engels (Verenigde Staten) |
en-US |
Mannelijke |
en-US-RogerNeural
Nieuw |
Algemene |
- Ondersteunde stijlen en rollen voor de toegevoegde neurale stemmen.
| Stem |
Stijlen |
Stijlgraad |
Rollen |
| zh-CN-XiaomengNeural Openbare preview |
chat |
Ondersteund |
|
| zh-CN-XiaoyiNeural Openbare preview |
affectionate, , angrycheerful, disgruntled, , embarrassed, fearful, gentlesadserious |
Ondersteund |
|
| zh-CN-XiaozhenNeural Openbare preview |
angry, , cheerfuldisgruntled, fearful, , , sadserious |
Ondersteund |
|
| zh-CN-YunxiaNeural Openbare preview |
angry
calm, cheerful, fearfulsad |
Ondersteund |
|
| zh-CN-YunzeNeural Openbare preview |
angry, , calmcheerful, depressed, , disgruntled, documentary-narration, fearfulsadserious |
Ondersteund |
Ondersteund |
Gezichtspositie met viseme krijgen
Release van juni 2022
Standaardstem
- Er zijn 9 nieuwe talen en varianten toegevoegd voor neurale tekst naar spraak:
| Language |
Locale |
Geslacht |
Spraaknaam |
Stijlondersteuning |
| Arabisch (Libanon) |
ar-LB |
Vrouwelijke |
ar-LB-LaylaNeural
Nieuw |
Algemene |
| Arabisch (Libanon) |
ar-LB |
Mannelijke |
ar-LB-RamiNeural
Nieuw |
Algemene |
| Arabisch (Oman) |
ar-OM |
Vrouwelijke |
ar-OM-AyshaNeural
Nieuw |
Algemene |
| Arabisch (Oman) |
ar-OM |
Mannelijke |
ar-OM-AbdullahNeural
Nieuw |
Algemene |
| Azerbeidzjaans (Azerbeidzjaans) |
az-AZ |
Vrouwelijke |
az-AZ-BabekNeural
Nieuw |
Algemene |
| Azerbeidzjaans (Azerbeidzjaans) |
az-AZ |
Mannelijke |
az-AZ-BanuNeural
Nieuw |
Algemene |
| Bosnisch (Bosnië en Herzegovina) |
bs-BA |
Vrouwelijke |
bs-BA-VesnaNeural
Nieuw |
Algemene |
| Bosnisch (Bosnië en Herzegovina) |
bs-BA |
Mannelijke |
bs-BA-GoranNeural
Nieuw |
Algemene |
| Georgisch (Georgië) |
ka-GE |
Vrouwelijke |
ka-GE-EkaNeural
Nieuw |
Algemene |
| Georgisch (Georgië) |
ka-GE |
Mannelijke |
ka-GE-GiorgiNeural
Nieuw |
Algemene |
| Mongools (Mongools) |
mn-MN |
Vrouwelijke |
mn-MN-YesuiNeural
Nieuw |
Algemene |
| Mongools (Mongools) |
mn-MN |
Mannelijke |
mn-MN-BataaNeural
Nieuw |
Algemene |
| Nepalee (Nepalee) |
ne-NP |
Vrouwelijke |
ne-NP-HemkalaNeural
Nieuw |
Algemene |
| Nepalee (Nepalee) |
ne-NP |
Mannelijke |
ne-NP-SagarNeural
Nieuw |
Algemene |
| Albanese (Albanië) |
sq-AL |
Vrouwelijke |
sq-AL-AnilaNeural
Nieuw |
Algemene |
| Albanese (Albanië) |
sq-AL |
Mannelijke |
sq-AL-IlirNeural
Nieuw |
Algemene |
| Tamil (Maleisië) |
ta-MY |
Vrouwelijke |
ta-MY-KaniNeural
Nieuw |
Algemene |
| Tamil (Maleisië) |
ta-MY |
Mannelijke |
ta-MY-SuryaNeural
Nieuw |
Algemene |
- GA 36 stemmen van openbare preview voor
en-GB Engels (Verenigd Koninkrijk), fr-FR Frans (Frankrijk) en de-DE Duits (Duitsland):
| Language |
Locale |
Geslacht |
Spraaknaam |
Stijlondersteuning |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-AbbiNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-BellaNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-HollieNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-MaisieNeural |
Algemene, kinderstem |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-OliviaNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-SoniaNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-AlfieNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-ElliotNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-EthanNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-NoahNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-OliverNeural |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-ThomasNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-BrigitteNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-CelesteNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-CoralieNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-EloiseNeural |
Algemene, kinderstem |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-JacquelineNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-JosephineNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-YvetteNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-AlainNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-ClaudeNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-JeromeNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-MauriceNeural |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-YvesNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-AmalaNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-ElkeNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-GiselaNeural |
Algemene, kinderstem |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-KlarissaNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-LouisaNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-MajaNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-TanjaNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-BerndNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-ChristophNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-KasperNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-KillianNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-KlausNeural |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-RalfNeural |
Algemene |
- Er zijn 40 nieuwe stemmen toegevoegd voor
es-MX Spaans (Mexico), it-IT Italiaans (Italië), pt-BR Portugees (Brazilië) en 2 accenten voor zh-CN Chinees (Mandarijn, Vereenvoudigd) in openbare preview:
| Language |
Locale |
Geslacht |
Spraaknaam |
Stijlondersteuning |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-BeatrizNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-CarlotaNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-NuriaNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-RenataNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-LarissaNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-CandelaNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Vrouwelijke |
es-MX-MarinaNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Vrouwelijke |
it-IT-FiammaNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Vrouwelijke |
it-IT-IrmaNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Vrouwelijke |
it-IT-FabiolaNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Vrouwelijke |
it-IT-PalmiraNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Vrouwelijke |
it-IT-ImeldaNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Vrouwelijke |
it-IT-PierinaNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-ElzaNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-ManuelaNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-BrendaNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-LeilaNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-YaraNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-GiovannaNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Vrouwelijke |
pt-BR-LeticiaNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Mannelijke |
es-MX-CecilioNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Mannelijke |
es-MX-LibertoNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Mannelijke |
es-MX-LucianoNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Mannelijke |
es-MX-PelayoNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Mannelijke |
es-MX-YagoNeural
Nieuw |
Algemene |
| Spaans (Mexico) |
es-MX |
Mannelijke |
es-MX-GerardoNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Mannelijke |
it-IT-BenignoNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Mannelijke |
it-IT-CataldoNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Mannelijke |
it-IT-LisandroNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Mannelijke |
it-IT-CalimeroNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Mannelijke |
it-IT-RinaldoNeural
Nieuw |
Algemene |
| Italiaans (Italië) |
it-IT |
Mannelijke |
it-IT-GianniNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Mannelijke |
pt-BR-DonatoNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Mannelijke |
pt-BR-HumbertoNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Mannelijke |
pt-BR-FabioNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Mannelijke |
pt-BR-JulioNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Mannelijke |
pt-BR-ValerioNeural
Nieuw |
Algemene |
| Portugees (Brazilië) |
pt-BR |
Mannelijke |
pt-BR-NicolauNeural
Nieuw |
Algemene |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN-sichuan |
Mannelijke |
zh-CN-sichuan-YunxiSichuanNeural
Nieuw |
Algemeen, Sichuan accent |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN-liaoning |
Vrouwelijke |
zh-CN-liaoning-XiaobeiNeural
Nieuw |
Algemeen, Liaoning accent |
- Verbeterde kwaliteit voor
en-SG-LunaNeural en en-SG-WayneNeural
- 48kHz-uitvoerondersteuning voor openbare preview met en-US-JennyNeural, en-US-AriaNeural en zh-CN-XiaoxiaoNeural
Aangepaste neurale spraak
Hulpprogramma voor het maken van audio-inhoud
- Ondersteunde paginering.
- Ingeschakeld om globaal te sorteren op naam, bestandstype en updatetijd op werkbestandspagina.
Release van mei 2022
Standaardstem
- Uitgebracht 5 nieuwe stemmen in openbare preview met meerdere stijlen om de variëteit in amerikaans Engels te verrijken. Bekijk de volledige taal en spraaklijst.
- Ondersteuning voor deze nieuwe stijlen
Angry, , , ExcitedFriendly, , Hopeful, Sad, en ShoutingUnfriendlyTerrified in openbare preview voor .Whisperingen-US-AriaNeural
- Ondersteuning voor deze nieuwe stijlen
Angry, Cheerful, , Excited, Friendly, Hopeful, Sad, Shouting, en UnfriendlyTerrifiedWhisperingin openbare preview voor en-US-GuyNeural, en-US-JennyNeural.
- Ondersteuning voor deze nieuwe stijlen, , , ,
Exciteden FriendlyHopefulShouting in openbare preview voor Unfriendly. TerrifiedWhisperingen-US-SaraNeural
Toonstijlen en -rollen bekijken.
- Nieuwe stemmen
zh-CN-YunjianNeuraluitgebracht, zh-CN-YunhaoNeuralen zh-CN-YunfengNeural in openbare preview. Bekijk de volledige taal en spraaklijst.
- Ondersteuning voor 2 nieuwe stijlen
sports-commentary, sports-commentary-excited in openbare preview voor zh-CN-YunjianNeural.
Toonstijlen en -rollen bekijken.
- Ondersteuning voor 1 nieuwe stijl
advertisement-upbeat in openbare preview voor zh-CN-YunhaoNeural.
Toonstijlen en -rollen bekijken.
- De
cheerful stijlen en sad stijlen fr-FR-DeniseNeural voor zijn algemeen beschikbaar in alle regio's.
- SSML is bijgewerkt ter ondersteuning van MathML-elementen voor en-US en en-AU stemmen. Meer informatie over spraaksynthesemarkeringen.
Aangepaste neurale spraak
Hulpprogramma voor het maken van audio-inhoud
- Ingeschakeld om het hulpprogramma Audio-inhoud maken uit te proberen zonder u aan te melden.
- Verbeterde indeling voor het aanpassen van telefoontjes.
- Verbeterde prestaties: geef het maximum aantal (200) bestanden op dat tegelijk moet worden geüpload.
- Verbeterde prestaties: geef het maximale niveau van de directorydiepte (5 niveaus) op.
Release van maart 2022
Standaardstem
Aangepaste neurale spraak
Hulpprogramma voor het maken van audio-inhoud
- De bestandsgrootte en gelijktijdigheidslimiet bijgewerkt voor F0-resources (free-tier) om de ervaring consistent te maken met de Speech SDK en API's. Bekijk quota en limieten voor spraakservices.
Release van februari 2022
Aangepaste neurale spraak
Hulpprogramma voor het maken van audio-inhoud
- De uitvoerlengtelimiet voor het downloaden van audio's is verwijderd.
Release van januari 2022
Nieuwe talen en stemmen
Er zijn 10 nieuwe talen en varianten toegevoegd voor neurale tekst naar spraak:
| Language |
Locale |
Geslacht |
Spraaknaam |
Stijlondersteuning |
| Bengaals (India) |
bn-IN |
Vrouwelijke |
bn-IN-TanishaaNeural
Nieuw |
Algemene |
| Bengaals (India) |
bn-IN |
Mannelijke |
bn-IN-BashkarNeural
Nieuw |
Algemene |
| IJslands (IJsland) |
is-IS |
Vrouwelijke |
is-IS-GudrunNeural
Nieuw |
Algemene |
| IJslands (IJsland) |
is-IS |
Mannelijke |
is-IS-GunnarNeural
Nieuw |
Algemene |
| Kannada (India) |
kn-IN |
Vrouwelijke |
kn-IN-SapnaNeural
Nieuw |
Algemene |
| Kannada (India) |
kn-IN |
Mannelijke |
kn-IN-GaganNeural
Nieuw |
Algemene |
| Kazachs (Kazachstan) |
kk-KZ |
Vrouwelijke |
kk-KZ-AigulNeural
Nieuw |
Algemene |
| Kazachs (Kazachstan) |
kk-KZ |
Mannelijke |
kk-KZ-DauletNeural
Nieuw |
Algemene |
| Lao (Laos) |
lo-LA |
Vrouwelijke |
lo-LA-KeomanyNeural
Nieuw |
Algemene |
| Lao (Laos) |
lo-LA |
Mannelijke |
lo-LA-ChanthavongNeural
Nieuw |
Algemene |
| Macedonisch (Republiek Noord-Macedonië) |
mk-MK |
Vrouwelijke |
mk-MK-MarijaNeural
Nieuw |
Algemene |
| Macedonisch (Republiek Noord-Macedonië) |
mk-MK |
Mannelijke |
mk-MK-AleksandarNeural
Nieuw |
Algemene |
| Malayalam (India) |
ml-IN |
Vrouwelijke |
ml-IN-SobhanaNeural
Nieuw |
Algemene |
| Malayalam (India) |
ml-IN |
Mannelijke |
ml-IN-MidhunNeural
Nieuw |
Algemene |
| Pashto (Afghanistan) |
ps-AF |
Vrouwelijke |
ps-AF-LatifaNeural
Nieuw |
Algemene |
| Pashto (Afghanistan) |
ps-AF |
Mannelijke |
ps-AF-GulNawazNeural
Nieuw |
Algemene |
| Servisch (Servië, Cyrillisch) |
sr-RS |
Vrouwelijke |
sr-RS-SophieNeural
Nieuw |
Algemene |
| Servisch (Servië, Cyrillisch) |
sr-RS |
Mannelijke |
sr-RS-NicholasNeural
Nieuw |
Algemene |
| Sinhala (Sri Lanka) |
si-LK |
Vrouwelijke |
si-LK-ThiliniNeural
Nieuw |
Algemene |
| Sinhala (Sri Lanka) |
si-LK |
Mannelijke |
si-LK-SameeraNeural
Nieuw |
Algemene |
Zie Taalondersteuning voor de volledige lijst met beschikbare stemmen.
Nieuwe stemmen in preview
Er zijn nieuwe stemmen toegevoegd voor en-GB, fr-FR en de-DE in preview:
| Language |
Locale |
Geslacht |
Spraaknaam |
Stijlondersteuning |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-AbbiNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-BellaNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-HollieNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Vrouwelijke |
en-GB-OliviaNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Meisje |
en-GB-MaisieNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-AlfieNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-ElliotNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-EthanNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-NoahNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-OliverNeural
Nieuw |
Algemene |
| Engels (Verenigd Koninkrijk) |
en-GB |
Mannelijke |
en-GB-ThomasNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-BrigitteNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-CelesteNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-CoralieNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-JacquelineNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-JosephineNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Vrouwelijke |
fr-FR-YvetteNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Meisje |
fr-FR-EloiseNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-AlainNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-ClaudeNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-JeromeNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-MauriceNeural
Nieuw |
Algemene |
| Frans (Frankrijk) |
fr-FR |
Mannelijke |
fr-FR-YvesNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-AmalaNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-ElkeNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-KlarissaNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-LouisaNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-MajaNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Vrouwelijke |
de-DE-TanjaNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Meisje |
de-DE-GiselaNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-BerndNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-ChristophNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-KasperNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-KillianNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-KlausNeural
Nieuw |
Algemene |
| Duits (Duitsland) |
de-DE |
Mannelijke |
de-DE-RalfNeural
Nieuw |
Algemene |
Zie Taalondersteuning voor de volledige lijst met beschikbare stemmen.
Nauwkeurigheid van uitspraak
- Verbeterde uitspraak van Engels woord voor alle
he-IL stemmen.
- Verbeterde uitspraaknauwkeurigheid op woordniveau voor
cs-CZ en da-DK.
- Verbeterde Arabische diakritische tekens en Hebreeuwse Nikud-verwerking.
- Verbeterde entiteitsleesing voor
ja-JP
Speech Studio
- Aangepaste neurale spraak: aanvullende modeltests ingeschakeld met behulp van de batch-API (lange audio-API)
- Audio-inhoud maken: meer uitvoerindelingen inschakelen
Release van oktober 2021
Nieuwe talen en stemmen
Er zijn 49 nieuwe talen en 98 stemmen toegevoegd voor neurale tekst naar spraak:
Adri in af-ZA Afrikaans (Zuid-Afrika), Willem in af-ZA Afrikaans (Zuid-Afrika), Mekdes in am-ET Amharisch (Ethiopië), Ameha in am-ET Amharisch (Ethiopië), Azure in ar-AE Arabisch (Verenigde Arabische Emiraten), Hamdan in ar-AE Arabisch (Verenigde Arabische Emiraten), Laila in Arabisch (Arabisch), Ali in Arabisch (Jordanië), Amina in ar-BH Arabisch (Algerije), Ismael in ar-BH Arabisch (Algerije), Office in ar-DZ Arabisch (Irak), Bassel in ar-DZar-IQ Arabisch (Irak), Sana in Arabisch (Jordanië), Sana in ar-IQar-JO Arabisch (Jordanië), Taim in ar-JO Arabisch (Jordanië), Noura in ar-KW Arabisch (Koeweit), Fahed in ar-KW Arabisch (Koeweit), Iman in ar-LY Arabisch (Libië), Omar in ar-LY Arabisch (Libië), Mouna in ar-MA Arabisch (Marokko), Jamal in ar-MA Arabisch (Marokko), Amal in ar-QA Arabisch (Qatar), Moaz in Arabisch (Qatar), Amany in ar-QA Arabisch (Syrië), Laith in ar-SY Arabisch (Syrië), Reem in ar-SY Arabisch (Tunesië), Hedi in ar-TN Arabisch (Tunesië), Maryam in ar-TNar-YE Arabisch (Jemen), Saleh in ar-YE Arabisch (Jemen), Nabanita in bn-BD Bangla (Bangladesh), Pradeep in bn-BD Bangla (Bangladesh), Asilia in en-KE het Engels (Kenia), Chilimba in en-KE het Engels (Kenia), Ezinne in en-NG het Engels (Nigeria), Abeo in en-NG het Engels (Nigeria), Imani in en-TZ het Engels (Tanzania), Elimu in het Engels (Tanzania), Sofia in en-TZ Spaans (Bolivia), Marcelo in es-BO Het Spaans (Bolivia), Catalina in es-BO Spaans (Chili), Lorenzo in es-CL Spaans (Chili), Maria in Het Spaans (Chili), Maria in es-CLes-CR Het Engels Spaans (Costa Rica), Juan in es-CR Het Spaans (Costa Rica), Belkys in es-CU Het Spaans (Cuba), Manuel in es-CU Het Spaans (Cuba), Ramona in es-DO het Spaans (Dominicaanse Republiek), Spain in es-DO Het Spaans (Dominicaanse Republiek), Andrea in es-EC Spaans (Ecuador), Luis in es-EC Spaans (Ecuador), Teresa in es-GQ Spaans (Equatoriaal Guinea), Javier in es-GQ Spaans (Equatoriaal Guinea), Martha in es-GT Het Spaans (Guatemala), Andres in es-GT Het Spaans (Guatemala), Karla in es-HN Het Spaans Spaans (Honduras), Carlos in es-HN het Spaans (Honduras), Yolanda in es-NI het Spaans (Nicaragua), De Spaans es-NI (Nicaragua), De Spaanse (Panama), De Carlos in es-PA het Spaans (Panama), Camila in es-PAes-PE het Spaans (Peru), Alex in es-PE het Spaans (Peru), Karina in es-PR het Spaans (Puerto Rico), Victor in es-PR Het Spaans (Puerto Rico), Tania in es-PY het Spaans (Paraguay), Mario in es-PY het Spaans (Paraguay), Lorena in es-SV Het Spaans (El Salvador), Eenvan es-SV Spaans (El Salvador), Valentina in es-UY het Spaans (Uruguay), Mateo in es-UY het Spaans (Uruguay), Paola in es-VE het Spaans (Venezuela), Sebastian in es-VE het Spaans (Venezuela), Dilara in fa-IR Perzisch (Iran), Farid in fa-IR Perzisch (Iran), Blessica in Filipijns (Filippijnen), Angelo in fil-PH Filipijns (Filippijnen), Sabela in Galicisch, Roi in fil-PH Galicisch, Siti in gl-ES Javaans (Indonesië), Dimas in gl-ESjv-ID Javaans (Indonesië), Sreymom in jv-ID Khmer (Cambodja), Piseth in km-KHkm-KH Khmer (Cambodja), Nilar in my-MM Burmese (Myanmar), Thiha in my-MM Burmese (Myanmar), Ubax in so-SO Somalië (Somalië), Muuse in so-SO Somalië (Somalië), Tuti in su-ID Sundanese (Indonesië), Jajang in su-ID Sundanese (Indonesië), Rehema in sw-TZ Swahili (Swahili) Tanzania), Daudi in sw-TZ Swahili (Tanzania), Saranya in ta-LK Tamil (Sri Lanka), Kumar in ta-LK Tamil (Sri Lanka), Venba in ta-SG Tamil (Singapore), Anbu in Tamil (Singapore), Gul in ta-SGur-IN Urdu (India), Salman in Urdu (India), Salman in ur-IN Urdu (India), Madina in uz-UZ Oezbeeks (Zuid-Afrika), Sardor in uz-UZ Oezbeeks (Zuid-Afrika), Thando in zu-ZA Zulu (Zuid-Afrika), Themba in zu-ZA Zulu (Zuid-Afrika).
Release van september 2021
-
Nieuwe chatbot-stem in
en-US Engels (VS): Sara vertegenwoordigt een jonge vrouwelijke volwassene die informeler praat en het beste past voor de chatbotscenario's.
-
Nieuwe stijlen toegevoegd voor
ja-JP Japanse stem Nanami: Er zijn nu drie nieuwe stijlen beschikbaar met Nanami: chat, klantenservice en vrolijk.
-
Algehele uitspraak verbetering: Opgegeven in
id-ID, Premwadee in th-TH, Christel in da-DK, HoaiMy en NamMinh in vi-VN.
-
Twee nieuwe stemmen in
zh-CN Chinees (Mandarijn, China) in preview: Hiermee zijn Den Haag en Deyan,geoptimaliseerd voor spontane spraak- en klantenservicescenario's.
Release van juli 2021
Neurale tekst naar spraakupdates
- Verminderde uitspraakfouten in het Hebreeuws door 20%.
Speech Studio-updates
-
Aangepaste neurale spraak: de trainingspijplijn bijgewerkt naar UniTTSv3 waarmee de modelkwaliteit wordt verbeterd terwijl de trainingstijd met 50% voor akoestische modellen wordt verminderd.
-
Audio-inhoud maken: het prestatieprobleem 'Exporteren' en de bug in aangepaste neurale spraakselectie opgelost.
Release van juni 2021
Speech Studio-updates
-
Aangepaste neurale spraak: Aangepaste neurale spraaktraining uitgebreid ter ondersteuning van Zuidoost-Azië. Nieuwe functies die zijn uitgebracht ter ondersteuning van de statuscontrole voor het uploaden van gegevens.
-
Audio-inhoud maken: een nieuwe functie uitgebracht ter ondersteuning van aangepaste lexicon. Met deze functie kunnen gebruikers eenvoudig hun lexiconbestanden maken en de aangepaste uitspraak voor hun audio-uitvoer definiëren.
Release van mei 2021
Nieuwe talen en stemmen toegevoegd voor neurale TTS
Tien nieuwe talen geïntroduceerd - 20 nieuwe stemmen in 10 nieuwe landinstellingen worden toegevoegd aan de neurale TTS-taallijst: Yan in en-HK het Engels (Hongkong), Sam in en-HK het Engels (Hongkong), Molly in en-NZ het Engels (Nieuw-Zeeland), Mitchell in en-NZ het Engels (Nieuw-Zeeland), Luna in en-SG het Engels (Singapore), Wayne in en-SG Het Engels (Singapore), Leah in en-ZA Het Engels (Zuid-Afrika), Luke in en-ZA het Engels (Zuid-Afrika), Dhwani in gu-IN Gujarati (India), Niranjan in gu-IN Gujarati (India), Aarohi in mr-IN Marathi (India), Manohar in mr-IN Marathi (India), Elena in es-AR Het Spaans (Argentinië), Tomas in es-AR Het Spaans (Argentinië), Salome in es-CO Het Spaans (Colombia), Gonzalo in es-CO Het Spaans (Colombia), Alonso es-US in es-US Spaans (VS), Zuri in sw-KE Swahili (Kenia), Rafiki in sw-KE Swahili (Kenia).
Elf nieuwe en-US stemmen in preview - 11 nieuwe en-US stemmen in preview worden toegevoegd aan Amerikaans Engels, ze zijn Ashley, Amber, Ana, Brandon, Christopher, Cora, Elizabeth, Eric, Michelle, Monica, Jacob.
Vijf zh-CN Chinese stemmen (Mandarijn, Vereenvoudigd) zijn algemeen beschikbaar - 5 Chinese stemmen (Mandarijn, Vereenvoudigd) worden gewijzigd van preview naar algemeen beschikbaar. Het zijn Yunxi, Yunmo, Azure, Deman, Dexuane, Derui. Deze stemmen zijn nu beschikbaar in alle regio's. Yunxi wordt toegevoegd met een nieuwe 'assistent'-stijl, die geschikt is voor chatbot en spraakagent. De stemstijlen van Powermo zijn verfijnder om natuurlijker en aanbevolen te zijn.
Release van april 2021
Neurale tekst naar spraak is beschikbaar in 21 regio's
-
Twaalf nieuwe regio's toegevoegd : neurale tekst naar spraak is nu beschikbaar in deze nieuwe 12 regio's:
Japan East, , Japan WestKorea Central, , North Central US, North Europe, South Central USSoutheast AsiaUK Southwest Central US, . West EuropeWest USWest US 2 Kijk hier voor een volledige lijst met 21 ondersteunde regio's.
Release van maart 2021
Nieuwe talen en stemmen toegevoegd voor neurale TTS
Zes nieuwe talen geïntroduceerd - 12 nieuwe stemmen in 6 nieuwe landinstellingen worden toegevoegd aan de neurale TTS-taallijst: Nia in cy-GB Welsh (Verenigd Koninkrijk), Aled in cy-GB Welsh (Verenigd Koninkrijk), Rosa in en-PH het Engels (Filippijnen), James in en-PH het Engels (Filippijnen), Charline in fr-BE het Frans (België), Gerard in fr-BE het Frans (België), Dena in nl-BE Het Nederlands (België), Azure In nl-BE Het Nederlands (België), Polina in uk-UA Oekraïens (Oekraïne), Ostap in uk-UA Oekraïens (Oekraïne), Uzma in ur-PK Urdu (Pakistan), Asad in ur-PK Urdu (Pakistan).
Vijf talen van preview tot GA - 10 stemmen in 5 landinstellingen die in november zijn geïntroduceerd, zijn nu GA: Kert in et-EE Estland (Estland), Colm in ga-IE Iers (Ierland), Nils in lv-LV Letland (Letland), Leonas in lt-LT Litouwen (Litouwen), Joseph in mt-MT Maltees (Malta).
Nieuwe mannelijke stem toegevoegd voor Frans (Canada) - Er is een nieuwe stem Voor Frans (Canada) beschikbaar fr-CA .
Kwaliteitsverbetering - Uitspraakfoutvermindering op hu-HU Hongaars - 48.17%, nb-NO Noors - 52,76%, nl-NL Nederlands (Nederland) - 22.11%.
Met deze release ondersteunen we nu in totaal 142 neurale stemmen in 60 talen/landinstellingen. Daarnaast zijn meer dan 70 standaardstemmen beschikbaar in 49 talen/landinstellingen. Ga naar Taalondersteuning voor de volledige lijst.
Gezichtshoudingsgebeurtenissen ophalen om tekens te animeren
Neurale tekst naar spraak bevat nu de viseme-gebeurtenis. Met Viseme-gebeurtenissen kunnen gebruikers een reeks gezichtshoudingen krijgen, samen met gesynthetiseerde spraak. Visemes kan worden gebruikt om de beweging van 2D- en 3D avatarmodellen te beheersen, die overeenkomen met mondbewegingen tot gesynthetiseerde spraak. Viseme-gebeurtenissen zijn momenteel alleen beschikbaar voor en-US-AriaNeural spraak.
Het bladwijzerelement toevoegen in Speech Synthesis Markup Language (SSML)
Met het bladwijzerelement kunt u aangepaste markeringen invoegen in SSML om de offset van elke markering in de audiostream op te halen. Deze kan worden gebruikt om te verwijzen naar een specifieke locatie in de tekst- of tagvolgorde.
Release van februari 2021
Algemene beschikbaarheid van aangepaste neurale spraak
Aangepaste neurale stem is algemeen beschikbaar in februari in 13 talen: Chinees (Mandarijn, Vereenvoudigd), Engels (Australië), Engels (India), Engels (Verenigd Koninkrijk), Engels (Verenigde Staten), Frans (Canada), Frans (Frankrijk), Duits (Duitsland), Italiaans (Italië), Japans (Japan), Koreaans (Korea), Portugees (Brazilië), Spaans (Mexico) en Spaans (Spanje). Meer informatie over wat aangepaste neurale stem is en hoe u deze op verantwoorde wijze kunt gebruiken.
Aangepaste neurale spraakfunctie vereist registratie en Microsoft kan de toegang beperken op basis van de geschiktheidscriteria van Microsoft. Meer informatie over de beperkte toegang.
Release van december 2020
Nieuwe neurale stemmen in algemene beschikbaarheid en preview
51 nieuwe stemmen uitgebracht voor in totaal 129 neurale stemmen in 54 talen/landinstellingen:
46 nieuwe stemmen in ga landinstellingen: Shakir in ar-EG Arabisch (Egypte), Hamed in ar-SA Arabisch (Saoedi-Arabië), Boroun in bg-BG Bulgaars (Bulgarije), Joana in Catalaans, Antonin in ca-ES Tsjechië (Tsjechische Republiek), Jeppe in cs-CZ Deens (Denemarken), Jonas in da-DK Het Duits (Oostenrijk), Jan in de-AT Het Duits (Zwitserland), Nestoras in de-CH Het Grieks (Griekenland), Liam in el-GRen-CA het Engels (Canada), Connor in en-IE Het Engels (Ierland), Madhur in en-IN Hindi (India), Mohan in en-IN Telugu (India), Prabhat in en-IN het Engels (India), Valluvar in en-IN Tamil (India), Enric in es-ES Catalaans, Kert in et-EE Estlands (Estland), Harri in fi-FI Fins (Finland), Selma in fi-FI Fins (Finland), Fabrice in fr-CH Frans (Zwitserland), Colm in ga-IE Iers (Ierland), Avri in he-IL Hebreeuws (Israël), Srecko in hr-HR Kroatisch (Kroatië), Tamas in Hongaars (Hongarije), Gadis hu-HU in id-ID Indonesisch (Indonesië), Leonas in lt-LT Litouwen (Litouwen), Nils in lv-LV Lets (Letland), Osman in ms-MY Maleis (Maleisië), Joseph in mt-MT Maltees (Malta), Finn in nb-NO Noors, Bokmål (Noorwegen), Pernille in nb-NO Noors, Bokmål (Noorwegen), Fenna in nl-NL Het Nederlands (Nederland), Maarten in nl-NL Nederlands (Nederland),A in pl-PL Pools (Polen), Marek in pl-PL Pools (Polen), Duarte in pt-BR Portugees (Brazilië), Raquel in pt-PT Portugees (Potugal), Emil in ro-RO Roemeens (Roemenië), Dmitry in ru-RU Het Russisch (Rusland), Svetlana in ru-RU Russisch Russisch (Rusland), Loekas in sk-SK Slowaaks (Slowakije), Rok in sl-SI Slovenië (Slovenië), Mattias in sv-SE Zweeds (Zweden), Sofie in sv-SE Zweeds (Zweden), Niwat in th-TH Thai (Thailand), Ahmet in tr-TR Turks (), NamMinh in vi-VN Vietnamees (Vietnam), HsiaoChen in Taiwanese Mandarijn (Taiwan), YunJhe in zh-TW Taiwanese Mandarijn (Taiwan), HiuMaan in zh-TW Chinees Kantonees (Hong Kong Special Administrative Region), WanLung in zh-HKzh-HK Chinese Kantonese (Hongkong SAR).
5 nieuwe stemmen in preview-landinstellingen: Kert in et-EE Estland (Estland), Colm in ga-IE Iers (Ierland), Nils in lv-LV Letland (Letland), Leonas in lt-LT Litouwen (Litouwen), Joseph in mt-MT Maltees (Malta).
Met deze release ondersteunen we nu in totaal 129 neurale stemmen in 54 talen/landinstellingen. Daarnaast zijn meer dan 70 standaardstemmen beschikbaar in 49 talen/landinstellingen. Ga naar Taalondersteuning voor de volledige lijst.
Updates voor het maken van audio-inhoud
- Verbeterde gebruikersinterface voor spraakselectie met spraakcategorieën en gedetailleerde spraakbeschrijvingen.
- Intonatieafstemming ingeschakeld voor alle neurale stemmen in verschillende talen.
- Geautomatiseerde lokalisatie van de gebruikersinterface op basis van de taal van de browser.
- Besturingselementen ingeschakeld
StyleDegree voor alle zh-CN neurale stemmen.
Ga naar het hulpprogramma Voor het maken van audio-inhoud om de nieuwe functies te bekijken.
Updates voor zh-CN stemmen
-
zh-CN Alle neurale stemmen bijgewerkt ter ondersteuning van Engels spreken.
- Schakel alle
zh-CN neurale stemmen in om intonatieaanpassing te ondersteunen. Het hulpprogramma voor het maken van SSML- of audio-inhoud kan worden gebruikt om de beste intonatie aan te passen.
-
zh-CN Alle neurale stemmen in meerdere stijlen bijgewerkt ter ondersteuning van StyleDegree de controle. Emotie-intensiteit (zacht of sterk) is aanpasbaar.
- Bijgewerkt
zh-CN-YunyeNeural ter ondersteuning van meerdere stijlen die verschillende emoties kunnen uitvoeren.
Release van november 2020
Nieuwe landinstellingen en stemmen in preview
-
Er worden vijf nieuwe stemmen en talen geïntroduceerd in de portfolio neurale tekst naar spraak. Ze zijn: Respijt in Maltees (Malta), Ona in Litouws (Litouwen), Anu in Estland (Estland), Orla in Het Ierse (Ierland) en Everita in Letland (Letland).
-
Vijf nieuwe
zh-CN stemmen met meerdere stijlen en rollen ondersteunen: Stijlenhan, Stijlenmo, Machtigingenrui, Stijlenxuan en Yunxi.
Deze stemmen zijn beschikbaar in openbare preview in drie Azure regio's: EastUS, SouthEastAsia en WestEurope.
Algemene beschikbaarheid van neurale tekst naar spraakcontainer
- Met Neurale tekst naar spraakcontainer kunnen ontwikkelaars spraaksynthese uitvoeren met de meest natuurlijke digitale stemmen in hun eigen omgeving voor specifieke vereisten voor beveiliging en gegevensbeheer. Controleer hoe u Speech Containers installeert.
Nieuwe functies
-
Aangepaste spraak: ingeschakelde gebruikers om een spraakmodel van de ene regio naar de andere te kopiëren; ondersteunde eindpuntvering en hervatting. Ga hier naar de Azure portal.
-
Ondersteuning voor SSML-stiltetags .
- Algemene verbeteringen in de spraakkwaliteit van TTS: Verbeterde uitspraaknauwkeurigheid op woordniveau in nb-NO. Minder dan 53% uitspraakfout.
Zie neurale tekst-naar-spraak-previews van vijf nieuwe talen met innovatieve modellen in de instelling voor lage resources voor meer informatie.
Release van oktober 2020
Nieuwe functies
- Jenny ondersteunt een nieuwe
newscast stijl. Lees hoe u de spreekstijlen in SSML gebruikt.
-
Neurale stemmen zijn bijgewerkt naar HiFiNet vocoder, met hogere geluidskwaliteit en snellere synthesesnelheid. Dit profiteert klanten van wie het scenario afhankelijk is van hi-fi audio of lange interacties, waaronder videoomzetting, audioboeken of online onderwijsmateriaal.
Lees meer over het verhaal en hoor de stemvoorbeelden op onze tech community-blog
-
Custom voice & Audio Content Creation Studio gelokaliseerd naar 17 landinstellingen. Gebruikers kunnen de gebruikersinterface eenvoudig overschakelen naar een lokale taal voor een meer vriendelijke ervaring.
-
Audio content creation: Added style degree control for AzureXiaoNeural; De aangepaste onderbrekingsfunctie verfijnd met incrementele einden van 50 ms.
Algemene verbeteringen in de spraakkwaliteit van TTS
- Verbeterde uitspraaknauwkeurigheid op woordniveau in
pl-PL (foutpercentagevermindering: 51%) en fi-FI (foutpercentagevermindering: 58%)
- Verbeterd
ja-JP lezen van één woord voor het woordenlijstscenario. Verminderde uitspraakfout met 80%.
-
zh-CN-XiaoxiaoNeural: Verbeterde sentiment/CustomerService/Newscast/Vrolijke/Boze stemkwaliteit.
-
zh-CN: Verbeterde Uitspraak van Erhua en lichte toon en verfijnde ruimte prosody, wat de begrijpelijkheid aanzienlijk verbetert.
Release van september 2020
Nieuwe functies
Neurale tekst naar spraak
- Uitgebreid ter ondersteuning van 18 nieuwe talen/landinstellingen. Ze zijn Bulgaars, Tsjechisch, Duits (Oostenrijk), Duits (Zwitserland), Grieks, Engels (Ierland), Frans (Zwitserland), Hebreeuws, Kroatisch, Hongaars, Indonesisch, Maleis, Roemeens, Slowaaks, Slovenië, Tamil, Telugu en Vietnamees.
- 14 nieuwe stemmen uitgebracht om de verscheidenheid in de bestaande talen te verrijken. Bekijk de volledige taal en spraaklijst.
- Nieuwe spreekstijlen voor
en-US en zh-CN stemmen. Jenny, de nieuwe stem in het Engels (VS), ondersteunt chatbot-, klantenservice- en assistentstijlen. Er zijn 10 nieuwe spreekstijlen beschikbaar met onze zh-CN stem, MicrosoftXiao. Daarnaast ondersteunt StyleDegree de neurale stem van DeXiao-neuraal stem van Het afstemmen. Lees hoe u de spreekstijlen in SSML gebruikt.
Containers: Neurale tekst naar spraakcontainer uitgebracht in openbare preview met 16 stemmen beschikbaar in 14 talen. Meer informatie over het implementeren van Spraakcontainers voor neurale tekst naar spraak
Lees de volledige aankondiging van de TTS-updates voor Ignite 2020
Release van augustus 2020
Nieuwe functies
Neurale tekst naar spraak: nieuwe spreekstijl voor en-US Aria stem. AriaNeural kan klinken als een nieuwscaster bij het lezen van nieuws. De stijl 'newscast-formal' klinkt serieuzer, terwijl de stijl 'newscast-casual' meer ontspannen en informeel is. Lees hoe u de spreekstijlen in SSML gebruikt.
Aangepaste spraak: er wordt een nieuwe functie uitgebracht om de kwaliteit van trainingsgegevens automatisch te controleren. Wanneer u uw gegevens uploadt, onderzoekt het systeem verschillende aspecten van uw audio- en transcriptgegevens en lost het problemen automatisch op of filtert om de kwaliteit van het spraakmodel te verbeteren. Dit omvat het volume van uw audio, het ruisniveau, de uitspraaknauwkeurigheid van spraak, de uitlijning van spraak met de genormaliseerde tekst, stilte in de audio, naast de audio- en scriptindeling.
Audio-inhoud maken: een set nieuwe functies om krachtigere mogelijkheden voor spraakafstemming en audiobeheer mogelijk te maken.
Uitspraak: de functie voor het afstemmen van de uitspraak wordt bijgewerkt naar de nieuwste telefoonset. U kunt het juiste phoneme-element uit de bibliotheek kiezen en de uitspraak van de geselecteerde woorden verfijnen.
Download: de functie 'Downloaden'/'Exporteren' is verbeterd om het genereren van audio per alinea te ondersteunen. U kunt inhoud in hetzelfde bestand/SSML bewerken terwijl u meerdere audio-uitvoer genereert. De bestandsstructuur van 'Downloaden' is ook verfijnd. U kunt nu eenvoudig alle audiobestanden in één map ophalen.
Taakstatus: De exportervaring voor meerdere bestanden is verbeterd. Wanneer u in het verleden meerdere bestanden exporteert en een van de bestanden is mislukt, mislukt de hele taak. Maar nu worden alle andere bestanden geëxporteerd. Het taakrapport is verrijkt met gedetailleerdere en gestructureerde informatie. U kunt nu de logboeken controleren op alle mislukte bestanden en zinnen met het rapport.
SSML-documentatie: gekoppeld aan SSML-document om u te helpen bij het controleren van de regels voor het gebruik van alle afstemmingsfuncties.
De Voice List-API wordt bijgewerkt met een gebruiksvriendelijke weergavenaam en de spreekstijlen die worden ondersteund voor neurale stemmen.
Algemene verbeteringen in de spraakkwaliteit van TTS
Uitspraakfout op woordniveau % voor ru-RU (fouten verminderd met 56%) en sv-SE (fouten verminderd met 49%)
Verbeterd polyfoniewoord lezen op en-US neurale stemmen door 40%. Voorbeelden van polyfoniewoorden zijn 'read', 'live', 'content', 'record', 'object', enzovoort.
Verbeterde natuurlijkheid van de vraagtoon in fr-FR. MOS (Mean Opinion Score) winst: +0,28
De vocoders bijgewerkt voor de volgende stemmen, met kwaliteitsverbeteringen en algehele prestaties versnellen met 40%.
| Locale |
Stem |
en-GB |
Mia |
es-MX |
Dalia |
fr-CA |
Sylvie |
fr-FR |
Denise |
ja-JP |
Nanami |
ko-KR |
Sun-Hi |
Insectenmoeilijke
- Er zijn een aantal fouten opgelost met het hulpprogramma Voor het maken van audio-inhoud
- Probleem opgelost met automatisch vernieuwen.
- Problemen met spraakstijlen in zh-CN in de regio Azië - zuidoost opgelost.
- Er is een stabiliteitsprobleem opgelost, waaronder een exportfout met de tag 'einde' en fouten in interpunctie.
Release van mei 2026
Aangepaste spraakafstemming in de Microsoft Foundry -portal (nieuw)
De aangepaste werkstroom voor spraakafstemming wordt nu gedocumenteerd voor de Microsoft Foundry-portal (nieuw). De wizardgestuurde ervaring begeleidt u bij het maken van projecten, het uploaden van gegevens, gegevensinspectie, modeltraining, evaluatie en eindpuntimplementatie. Zie Een aangepast spraakproject maken voor meer informatie.
Algemene beschikbaarheid van LLM Speech-API
LLM Speech-API is nu algemeen beschikbaar, biedt geavanceerde LLM-transcriptie en vertaling voor audiobestanden, met meertalige ondersteuning voor 25 talen (meer dan 90 landinstellingen), verbeterde nauwkeurigheid en verbeterde mogelijkheden voor het afstemmen van prompts. Zie LLM-spraak voor meer informatie.
Algemene beschikbaarheid van Speech Transcription SDK
De Speech Transcription SDK is nu algemeen beschikbaar (versie 1.0.0) voor C#, Python, Java en JavaScript/TypeScript. De SDK biedt een geïntegreerde client voor de mogelijkheden van Fast Transcription en LLM Speech van de Speech-service. Zie Wat is de Speech Transcription SDK? voor meer informatie.
Release van april 2026
Verfijning na de stream (openbare preview)
Verfijning na de stream is nu beschikbaar in openbare preview voor realtime spraak-naar-tekst. Wanneer deze optie is ingeschakeld, voert de service een tweede herkenningspas parallel met realtime streaming uit om de uiteindelijke nauwkeurigheid van transcripties te verbeteren. Tussenliggende resultaten blijven lage latentie; alleen het uiteindelijke resultaat voor elk segment wordt vervangen door een nauwkeurigere versie. Stel de eigenschap in om deze SpeechServiceResponse_PostProcessingOption in te PostRefinement schakelen. Zie Voor meer informatie het gebruik van naverwerking en het herkennen van spraak.
Verbeterd beoordelingsmodel voor uitspraak
We hebben het beoordelingsmodel voor de uitspraak bijgewerkt voor de-DEhet verbeteren van de Pearson Correlatiecoëfficiënten (PCC), wat nauwkeuriger en betrouwbaardere evaluaties betekent.
Het bijgewerkte model is klaar voor gebruik via de API en de Microsoft Foundry-speeltuin.
Release van maart 2026
Release van februari 2026
De spraak-naar-tekst-speeltuin in de nieuwe Microsoft Foundry biedt nu ondersteuning voor de realtime spraak-naar-tekst-API. U kunt realtime transcriptie rechtstreeks in de browser testen zonder code te schrijven. Aan de slag met de snelstart voor spraak naar tekst.
Release van december 2025
Spraak naar tekst 5.1.0
- Algemene beschikbaarheid van realtime-diarisatie met behulp van de spraak-naar-tekstcontainer.
- Opgeloste beveiligingsproblemen
Release van november 2025
LLM-spraak-API is nu openbare preview. Het maakt gebruik van een uitgebreid spraakmodel met een groot taalmodel dat verbeterde kwaliteit, diepgaand contextueel begrip, meertalige ondersteuning en mogelijkheden voor het afstemmen van prompts biedt. Het ondersteunt momenteel de volgende spraaktaken:
-
transcribe: converteer vooraf opgenomen audio naar tekst.
-
translate: converteer vooraf opgenomen audio naar tekst in een opgegeven doeltaal.
Zie LLM-spraak voor meer informatie.
Snelle transcriptie is algemeen beschikbaar. Het kan audio veel sneller transcriberen dan de werkelijke audioduur. Zie de handleiding voor de snelle transcriptie-API voor meer informatie.
Als u meertalige inhoud continu en nauwkeurig wilt transcriberen in een audiobestand, kunt u nu het nieuwste meertalige model gebruiken zonder de landinstellingencodes op te geven via een snelle transcriptie-API. Zie meertalige transcriptie in snelle transcriptie voor meer informatie.
Videoomzetting is nu beschikbaar in de Azure Speech-service. Zie Wat is videovertaling voor meer informatie?
Release van oktober 2025
Spraak-naar-tekst REST API-versie 2025-10-15
De spraak-naar-tekst-REST API-versie 2025-10-15 wordt uitgebracht voor algemene beschikbaarheid. Zie de naslagdocumentatie voor spraak-naar-tekst-REST API en de rest API-handleiding voor spraak-naar-tekst voor meer informatie.
Gewichtsregelaar voor woordgroepenlijst voor Speech SDK
U kunt nu de invloed van woordgroepenlijsten op spraakherkenningsresultaten beheren wanneer u de Speech SDK gebruikt met realtimetranscriptie. Met de nieuwe functie voor woordgroepenlijstdikte kunt u een vooroordelenniveau instellen tussen 0.0 (uitgeschakeld) en 2.0 (maximale invloed) om aan te geven hoeveel woordenlijsttermen met prioriteit worden ontvangen in de standaardwoordenlijst. Zie Herkenningsnauwkeurigheid verbeteren met de frasenlijst voor meer informatie.
Release van september 2025
Spraak-naar-tekst 5.0.3-preview
- Beveiligingsproblemen opgelost
- Ondersteuningsgebruiker stelt redis-eindpunt in voor diarisatie.
- STT-back-end-/front-end-engine-update
- Dekking toegevoegd van landinstellingen die eerder worden ondersteund in versie 4.12.
Release van augustus 2025
Nieuwe landinstellingen die worden ondersteund in Snelle transcriptie
Snelle transcriptie ondersteunt nu extra landinstellingen, waaronder enkele en- varianten (12 landinstellingen), es- varianten (19 landinstellingen) en ar- varianten (13 landinstellingen). Zie spraak-naar-tekst ondersteunde talen voor meer informatie.
Release van juli 2025
Verbeterde spraak-naar-tekstmodellen
De Engelse modellen (alle en-* modellen met uitzondering van en-IN) zijn bijgewerkt met een nieuwe VAD (spraakactiviteitsdetector) die de latentie met 100 ms of meer helpt verminderen. Het kan de nauwkeurigheid en stiltesegmentatie zowel positief als negatief beïnvloeden, met als doel latentie te verminderen. De komende maanden is er nog meer taaluitbreiding beschikbaar.
Release van juni 2025
Verbeterd beoordelingsmodel voor uitspraak
We hebben belangrijke upgrades geïmplementeerd voor de uitspraak-evaluatiemodellen voor ta-IN en ms-MY. U ziet een merkbare sprong in Pearson Correlation Coefficients (PCC), wat nauwkeurigere en betrouwbare evaluaties betekent.
Deze bijgewerkte modellen zijn klaar om te gebruiken via de API en de Microsoft Foundry-speeltuin, net als voorheen.
Verbeterde spraak-naar-tekstmodellen
Nauwkeurigheid van spraak-naar-tekstmodellen in snelle transcriptie voor de-DE, en-US, , en-GB, es-ESes-MXfr-FRit-ITja-JP, ko-KR, en pt-BRzh-CN landinstellingen verbeteren respectievelijk met 10%-25% procent, met name met verbeterde leesbaarheid en herkenning van entiteiten.
Release van mei 2025
Verbeterde spraak-naar-tekstmodellen
Nauwkeurigheid van spraak-naar-tekstmodellen voorta-IN, te-INen en-INhu-HU landinstellingen die respectievelijk met 5-10 procent worden verbeterd. We hebben ook ongeveer 20x minder spookwoorden voor de ta-IN en te-IN modellen.
Snelle transcriptie-API - meertalige spraaktranscriptie
Als u de meertalige inhoud continu en nauwkeurig in een audiobestand wilt transcriberen, kunt u nu het nieuwste meertalige model gebruiken zonder de landinstellingencodes op te geven via een snelle transcriptie-API. Zie meertalige transcriptie in snelle transcriptie voor meer informatie.
Nieuwe landinstellingen die worden ondersteund in Snelle transcriptie
Snelle transcriptie ondersteunt nu aanvullende landinstellingen, waaronder fi-FI, he-IL, id-ID, pl-PL, pt-PT, sv-SE, enzovoort. Zie spraak-naar-tekst ondersteunde talen voor meer informatie.
Release van april 2025
Uitspraakbeoordeling
We zijn verheugd om aanzienlijke verbeteringen aan te kondigen in onze beoordelingsmodellen voor de uitspraak van deze landinstellingen: , , , de-DE, , en .es-MXit-ITja-JPko-KRpt-BR Deze verbeteringen zorgen voor aanzienlijke vooruitgang in Pearson Correlation Coefficients (PCC), waardoor nauwkeurigere en betrouwbare evaluaties mogelijk zijn.
Net als voorheen zijn de modellen beschikbaar via de API en Microsoft Foundry playground.
Release van maart 2025
Gesprektranscriptie met meerdere kanalen (buiten gebruik gesteld)
Gesprektranscriptie voor meerdere kanalen is buiten gebruik gesteld op 28 maart 2025.
Als u spraak-naar-tekst wilt blijven gebruiken met diarisatie, gebruikt u in plaats daarvan de volgende functies:
Deze spraak-naar-tekstfuncties bieden alleen ondersteuning voor diarisatie voor audio met één kanaal. Audio met meerdere kanalen die u hebt gebruikt met gesprektranscriptie voor meerdere kanalen, wordt niet ondersteund.
Release van januari 2025
Nieuwe functie - Semantische segmentatie
Aankondiging van de release van een nieuwe functie: Semantische segmentatie. Deze functie integreert een interpunctiemodule binnen decoder die audio segmenteert op basis van semantische informatie, wat resulteert in meer logische en nauwkeurige segmentatiegrenzen.
Belangrijke voordelen:
- Verbeterde nauwkeurigheid van segmentatie: Door semantische informatie te gebruiken, vermindert deze functie aanzienlijk exemplaren van lange segmenten die worden veroorzaakt door het ontbreken van pauzes in de invoeraudio.
- Latentie verminderen die wordt veroorzaakt door ondersegmentatie: de totale latentie voor spraakherkenning wordt verminderd, met een vermindering van 40%-60% de lengte van de langste 5% segmenten.
- Over-Segmentation Risicobeperking: Deze functie helpt ook oversegmentatie te voorkomen door segmentatie uit te stellen wanneer een betere zin kan worden gevormd.
Ondersteunde landinstellingen:
- Engels (en-US, en-GB)
- Chinees (zh-CN, zh-HK)
- Japans (ja-JP)
- Koreaans (ko-KR)
- Duits (de-DE)
- Frans (fr-FR)
- Italiaans (it-IT)
- Spaans (es-ES, es-MX)
- Hindoestaans (hi-IN)
- Portugees (pt-BR, pt-PT)
- Turks (tr-TR)
- Russisch (ru-RU)
- Thai (th-TH)
- Indonesisch (id-ID)
Raadpleeg de documentatie voor implementatiedetails: Spraak herkennen in de sectie Semantische segmentatie.
Realtime spraak naar tekst - Release van nieuw Engels model
Aankondiging van de release van het nieuwste Engelse spraakmodel (en-US, en-CA), wat aanzienlijke verbeteringen brengt in verschillende prestatiemetrieken. Hieronder ziet u de belangrijkste hoogtepunten van deze release:
- Toegankelijkheidsverbeteringen: 36% vermindering van Word foutpercentage (WER) op Microsoft interne toegankelijkheidstestsets bereikt, waardoor spraakherkenning nauwkeuriger en betrouwbaarder wordt voor het herkennen van spraak van personen met een spraakbeperking.
- Ghost Word Reductie: Een opmerkelijke 90% vermindering van geestwoorden op de ghost word ontwikkelingsset en verminderingen variëren van 63% tot 100% in andere ghost word gegevenssets, waardoor de duidelijkheid en nauwkeurigheid van transcripties aanzienlijk wordt verbeterd.
Het nieuwe model heeft ook de algehele prestaties verbeterd, waaronder entiteitsherkenning en betere herkenning van gespelde letters.
Deze ontwikkelingen zullen naar verwachting een nauwkeurigere, efficiënte en bevredigende ervaring bieden voor alle gebruikers. Het nieuwe model is beschikbaar via de API en Microsoft Foundry playground. Feedback wordt aangemoedigd om de mogelijkheden verder te verfijnen.
Release van november 2024
Spraak naar tekst REST API versie 2024-11-15
De spraak-naar-tekst-REST API-versie 2024-11-15 wordt uitgebracht voor algemene beschikbaarheid. Zie de naslagdocumentatie voor spraak-naar-tekst-REST API en de rest API-handleiding voor spraak-naar-tekst voor meer informatie.
Opmerking
De spraak-naar-tekst-REST API-versie 2024-05-15-preview is afgeschaft.
Snelle transcriptie (GA)
Snelle transcriptie is nu algemeen beschikbaar via spraak naar tekst REST API versie 2024-11-15. Met snelle transcriptie kunt u audiobestanden nauwkeurig en synchroon transcriberen naar tekst, met een hoge snelheidsfactor. Het kan audio sneller transcriberen dan de werkelijke audioduur. Zie de handleiding voor de snelle transcriptie-API voor meer informatie.
Release van oktober 2024
Realtime spraak naar tekst (tweetalig)
Er zijn aanzienlijke verbeteringen aangebracht in de erkenningskwaliteit van korte Spaanse termen via de es-US tweetalige modellen. Het model is tweetalig en ondersteunt ook Engels. De kwaliteit van Engelse erkenning wordt ook verbeterd.
Videovertaling (preview)
De API voor videoomzetting is nu beschikbaar in openbare preview. Zie de videoomzetting gebruiken voor meer informatie.
Release van september 2024
Realtime spraak naar tekst
Realtime spraak naar tekst heeft nieuwe modellen uitgebracht, met een betere kwaliteit, voor de volgende talen.
fi-FI/id-ID/zh-TW/pl-PL/pt-PT es-SV/es-EC/es-BO/es-PY/es-AR/es-DO/es-UY/es-CR/es-VE/es-NI/es-HN/es-PR/es-COes-CL/es-CU/es-PE/es-PA/es-GT/es-GQ
Snelle transcriptie (preview)
Snelle transcriptie ondersteunt nu diarisatie voor het herkennen en scheiden van meerdere luidsprekers op een monokanaals audiobestand. Zie de handleiding voor snelle transcriptie-API voor meer informatie.
Release van augustus 2024
Taal leren (preview)
Taal leren is nu beschikbaar in openbare preview. Interactieve taal leren kan uw leerervaring aantrekkelijker en effectiever maken. Zie Interactieve taal leren met uitspraakbeoordeling voor meer informatie.
Uitspraakbeoordeling
Evaluatie van uitspraak van spraak ondersteunt nu 33 talen die algemeen beschikbaar zijn en elke taal is beschikbaar in alle spraak-naar-tekstregio's. Zie de volledige lijst met talen voor uitspraakbeoordeling voor meer informatie.
| Language |
Landinstelling (BCP-47) |
| Arabisch (Egypte) |
ar-EG |
| Arabisch (Saoedi-Arabië) |
ar-SA |
| Catalaans |
ca-ES |
| Chinees (Kantonees, traditioneel) |
zh-HK |
| Chinees (Mandarijn, Vereenvoudigd) |
zh-CN |
| Chinees (Taiwanese Mandarijn, Traditioneel) |
zh-TW |
| Deens (Denemarken) |
da-DK |
| Nederlands (Nederland) |
nl-NL |
| Engels (Australië) |
en-AU |
| Engels (Canada) |
en-CA |
| Engels (India) |
en-IN |
| Engels (Verenigd Koninkrijk) |
en-GB |
| Engels (Verenigde Staten) |
en-US |
| Fins (Finland) |
fi-FI |
| Frans (Canada) |
fr-CA |
| Frans (Frankrijk) |
fr-FR |
| Duits (Duitsland) |
de-DE |
| Hindi (India) |
hi-IN |
| Italiaans (Italië) |
it-IT |
| Japans (Japan) |
ja-JP |
| Koreaans (Korea) |
ko-KR |
| Maleis (Maleisië) |
ms-MY |
| Noors Bokmål (Noorwegen) |
nb-NO |
| Pools (Polen) |
pl-PL |
| Portugees (Brazilië) |
pt-BR |
| Portugees (Portugal) |
pt-PT |
| Russisch (Rusland) |
ru-RU |
| Spaans (Mexico) |
es-MX |
| Spaans (Spanje) |
es-ES |
| Zweeds (Zweden) |
sv-SE |
| Tamil (India) |
ta-IN |
| Thais (Thailand) |
th-TH |
| Vietnamees (Vietnam) |
vi-VN |
Release van juli 2024
Snelle transcriptie-API (preview)
Snelle transcriptie is nu beschikbaar in openbare preview. Met snelle transcriptie kunt u audiobestanden nauwkeurig en synchroon transcriberen naar tekst, met een hoge snelheidsfactor. Het kan audio sneller transcriberen dan de werkelijke audioduur. Zie de handleiding voor de snelle transcriptie-API voor meer informatie.
Release van juni 2024
Algemene beschikbaarheid voor spraak-naar-tekst-REST API v3.2
Rest API-versie 3.2 van spraak-naar-tekst is nu algemeen beschikbaar. Zie de naslagdocumentatie voor spraak-naar-tekst en de rest-API voor spraak-naar-tekst en de rest API-handleiding voor spraak-naar-tekst-REST APIv3.2 voor spraak-naar-tekst.
Opmerking
Preview-versies 3.2-preview.1 en 3.2-preview.2 zijn vanaf september 2024 buiten gebruik gesteld.
Spraak-naar-tekst-REST API v3.1 en v3.0 zijn buiten gebruik gesteld op 31 maart 2026. Zie de migratiehandleidingen voor spraak-naar-tekst-REST API v3.0 naar v3.1 en v3.1 naar v3.2 voor meer informatie over het upgraden.
Release van mei 2024
Videovertaling (preview)
Videoomzetting is nu beschikbaar in openbare preview. Videoomzetting is een functie in Azure Spraak in Foundry Tools waarmee u video's in meerdere talen naadloos kunt vertalen en genereren. Deze functie is ontworpen om u te helpen uw video-inhoud te lokaliseren voor diverse doelgroepen over de hele wereld. U kunt efficiënt meeslepende, gelokaliseerde video's maken in verschillende gebruiksvoorbeelden, zoals vlogs, onderwijs, nieuws, bedrijfstraining, reclame, film, tv-programma's en meer. Zie het overzicht van videoomzetting voor meer informatie.
Uitspraakbeoordeling
De evaluatie van de uitspraak van spraak ondersteunt nu 24 talen die algemeen beschikbaar zijn (met één nieuwe taal toegevoegd), met nog 7 talen die beschikbaar zijn in openbare preview. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.
Release van april 2024
Automatische meertalige spraakomzetting (preview)
Automatische meertalige spraakomzetting is beschikbaar in openbare preview. Deze innovatieve functie verandert de manier waarop taalbarrières worden overwinnen en biedt ongeëvenaarde mogelijkheden voor naadloze communicatie in diverse taalkundige landschappen.
Belangrijkste hoogtepunten
- Niet-opgegeven invoertaal: spraakomzetting in meerdere talen kan audio ontvangen in een breed scala aan talen en u hoeft niet op te geven wat de verwachte invoertaal is. Het maakt het een waardevolle functie om inzicht te hebben in en samen te werken in wereldwijde contexten zonder dat er vooraf moet worden ingesteld.
- Taalwisseling: spraakomzetting in meerdere talen zorgt ervoor dat meerdere talen tijdens dezelfde sessie kunnen worden gesproken en dat ze allemaal in dezelfde doeltaal worden vertaald. U hoeft een sessie niet opnieuw te starten wanneer de invoertaal of andere acties door u worden gewijzigd.
Hoe het werkt
- Reisinterpreter: meertalige spraakomzetting kan de ervaring van toeristen die buitenlandse bestemmingen bezoeken verbeteren door hen informatie en hulp te geven in hun voorkeurstaal. Hotel concierge diensten, rondleidingen en bezoekerscentra kunnen gebruikmaken van deze technologie om tegemoet te komen aan diverse taalkundige behoeften.
- Internationale conferenties: meertalige spraakomzetting kan communicatie mogelijk maken tussen deelnemers uit verschillende regio's die verschillende talen kunnen spreken met live vertaald bijschrift. Deelnemers kunnen in hun eigen talen spreken zonder ze op te geven, zodat ze naadloos begrip en samenwerking kunnen garanderen.
- Educatieve vergaderingen: In multi-culturele klaslokalen of onlineleeromgevingen kan meertalige spraakomzetting taaldiversiteit tussen studenten en docenten ondersteunen. Het maakt naadloze communicatie en deelname mogelijk zonder dat u de taal van elke leerling of docent hoeft op te geven.
Toegang krijgen
Ga naar het overzicht van spraakomzetting voor een gedetailleerde inleiding. Daarnaast kunt u verwijzen naar de codevoorbeelden bij het vertalen van spraak. Deze nieuwe functie wordt volledig ondersteund door alle SDK-versies vanaf 1.37.0.
Realtime spraak naar tekst met diariazation (GA)
Realtime spraak naar tekst met diariazatie is nu algemeen beschikbaar.
U kunt spraak-naar-teksttoepassingen maken die gebruikmaken van diarisatie om onderscheid te maken tussen de verschillende sprekers die deelnemen aan het gesprek. Raadpleeg de quickstart voor realtime-diarisatie voor meer informatie over realtime-diarisatie.
Spraak-naar-tekstmodel bijwerken
Realtime spraak naar tekst heeft nieuwe modellen uitgebracht met tweetalige mogelijkheden. Het en-IN model ondersteunt nu zowel Engelstalige als Hindi tweetalige scenario's en biedt verbeterde nauwkeurigheid. Arabische landinstellingen (ar-AE, ar-BH, ar-DZ, ar-IL, ar-IQ, ar-KW, ar-LB, , ar-LY, , ar-MAar-OMar-PSar-QAar-SAar-SYar-TNar-YE) zijn nu uitgerust met tweetalige ondersteuning voor Engels, verbeterde nauwkeurigheid en ondersteuning van het callcenter.
Batchtranscriptie biedt modellen met nieuwe architectuur voor deze landinstellingen: es-ES, , es-MXfr-FR, it-IT, ja-JP, , ko-KR, , en pt-BRzh-CN. Deze modellen verbeteren de leesbaarheid en entiteitsherkenning aanzienlijk.
Release van maart 2024
Algemene beschikbaarheid van Fluisteren (GA)
Het Fluisterse spraak-naar-tekstmodel met Azure Speech is nu algemeen beschikbaar.
Bekijk Wat is het Fluistermodel? voor meer informatie over het gebruik van Azure Speech versus Azure OpenAI in Microsoft Foundry Models.
Release van februari 2024
Uitspraakbeoordeling
Woordgroepenlijst
Ondersteuning voor woordgroepenlijst toegevoegd voor de volgende landinstellingen: ar-SA, de-CH, en-IE, en-ZA, es-US, id-ID, nl-NL, pl-PL, pt-PT, ru-RU, sv-SE, th-TH, vi-VN, zh-HK, zh-TW.
Release van november 2023
Inleiding tot tweetalige spraakmodellering!
We zijn blij om een baanbrekende toevoeging aan onze realtime spraakmodellering te onthullen: tweetalige spraakmodellering. Dankzij deze aanzienlijke verbetering biedt ons spraakmodel naadloos ondersteuning voor tweetalige taalparen, zoals Engels en Spaans, evenals Engels en Frans. Met deze functie kunnen gebruikers moeiteloos schakelen tussen talen tijdens realtime interacties, waarbij ze een centraal moment markeren in onze toezegging om communicatie-ervaringen te verbeteren.
Belangrijke hoogtepunten:
- Tweetalige ondersteuning: Met onze nieuwste release kunnen gebruikers naadloos schakelen tussen Engels en Spaans of tussen Engels en Frans tijdens realtime spraakinteracties. Deze functionaliteit is afgestemd op tweetalige sprekers die vaak schakelen tussen deze twee talen.
- Verbeterde gebruikerservaring: Tweetalige sprekers, zowel op het werk, thuis als in verschillende community-instellingen, zullen deze functie enorm nuttig vinden. Het vermogen van het model om zowel Engels als Spaans in realtime te begrijpen en erop te reageren, biedt nieuwe mogelijkheden voor effectieve en vloeiende communicatie.
Procedure:
Kies es-US (Spaans en Engels) of fr-CA (Frans en Engels) wanneer u de Speech Service-API aanroept of probeer het uit in Speech Studio. Voel u vrij om taal te spreken of ze samen te combineren. Het model is ontworpen om dynamisch aan te passen en nauwkeurige en contextbewuste antwoorden in beide talen te bieden.
Het is tijd om uw communicatiespel te verhogen met onze nieuwste functierelease: naadloze, meertalige communicatie binnen handbereik!
Spraak-naar-tekstmodellen worden bijgewerkt
We zijn verheugd om een belangrijke update te introduceren voor onze spraakmodellen, veelbelovende verbeterde nauwkeurigheid, verbeterde leesbaarheid en verfijnde entiteitsherkenning. Deze upgrade wordt geleverd met een robuuste nieuwe structuur, ondersteund door een uitgebreide trainingsgegevensset, waardoor een gemarkeerde vooruitgang in de algehele prestaties wordt gegarandeerd. Het bevat onlangs uitgebrachte modellen voor en-US, zh-CN, ja-JP, it-IT, pt-BR, es-MX, es-ES, fr-FR, de-DE, ko-KR, tr-TR, sv-SEen he-IL.
Hoogtepunten:
- Betere nauwkeurigheid met nieuwe modelstructuur: de opnieuw gedefinieerde modelstructuur, in combinatie met een uitgebreidere trainingsgegevensset, verhoogt de nauwkeurigheidsniveaus en belooft nauwkeurigere spraakuitvoer.
- Verbetering van de leesbaarheid: Ons nieuwste model zorgt voor een aanzienlijke verbetering van de leesbaarheid, waardoor de samenhang en duidelijkheid van gesproken inhoud wordt verbeterd.
- Geavanceerde entiteitsherkenning: Entiteitsherkenning ontvangt een aanzienlijke upgrade, wat resulteert in nauwkeurigere en genuanceerde resultaten.
Mogelijke gevolgen: Ondanks deze ontwikkelingen is het van cruciaal belang om rekening te houden met mogelijke gevolgen:
- Aangepaste time-outfunctie voor stiltes: gebruikers die een time-out voor aangepaste stilte gebruiken, met name met lage instellingen, kunnen te maken krijgen met oversegmentatie en mogelijke weglatingen van woordgroepen met één woord.
- Het nieuwe model kan compatibiliteitsproblemen vertonen met de functie Trefwoordvoorvoegsel en gebruikers worden geadviseerd om de prestaties in hun specifieke toepassingen te beoordelen.
- Minder vloeiende woorden of woordgroepen: Gebruikers merken mogelijk een vermindering van onfluency-woorden of woordgroepen zoals 'um' of 'uh' in de spraakuitvoer.
- Onnauwkeurigheden in tijdstempelduur van woorden: sommige onfluencywoorden kunnen onjuistheden weergeven in tijdstempelduur, waarbij aandacht nodig is in toepassingen die afhankelijk zijn van de precieze timing.
- Afwijking van betrouwbaarheidsscoreverdeling: gebruikers die afhankelijk zijn van betrouwbaarheidsscores en bijbehorende drempelwaarden, moeten rekening houden met mogelijke variaties in de distributie, waarbij aanpassingen nodig zijn voor optimale prestaties.
- De nauwkeurigheidsverbetering van de woordgroepenlijstfunctie kan worden beïnvloed door de onjuiste cognitieve weergave van bepaalde zinnen.
We raden u aan om deze verbeteringen te verkennen en potentiële problemen voor een naadloze overgang te overwegen, en zoals altijd is uw feedback van cruciaal belang bij het verfijnen en bevorderen van onze services.
Uitspraakbeoordeling
Evaluatie van uitspraak van spraak ondersteunt nu 18 talen algemeen beschikbaar, met zes talen die beschikbaar zijn in openbare preview. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.
We zijn verheugd om aan te kondigen dat uitspraakbeoordeling nieuwe functies introduceert vanaf 1 november 2023: Prosody, Grammatica, Vocabulaire en Onderwerp. Deze verbeteringen zijn gericht op een nog uitgebreidere taalleerervaring voor zowel lees- als spreekbeoordelingen. Voer een upgrade uit naar SDK-versie 1.35.0 of hoger om meer informatie te bekijken in de uitspraakbeoordeling en uitspraakbeoordeling in Speech Studio.
Release van september 2023
Fluister openbare preview
Azure Speech ondersteunt nu het Whisper-model van OpenAI via de batchtranscriptie-API. Raadpleeg de handleiding Een batchtranscriptie maken voor meer informatie.
Opmerking
Azure OpenAI ondersteunt ook het Fluistermodel van OpenAI voor spraak-naar-tekst met een synchrone REST API. Bekijk de quickstart voor meer informatie.
Bekijk What is the Whisper model? voor meer informatie over het gebruik van Azure Speech versus Azure OpenAI.
Openbare preview voor spraak-naar-tekst-REST API v3.2
Rest API v3.2 voor spraak-naar-tekst is beschikbaar in de preview-versie.
Spraak-naar-tekst REST API v3.1 is algemeen beschikbaar. Spraak-naar-tekst-REST API v3.0 is buiten gebruik gesteld op 31 maart 2026. Zie de migratiehandleidingen spraak-naar-tekst-REST API v3.0 naar v3.1 en v3.1 naar v3.2 voor meer informatie.
Release van augustus 2023
Nieuwe spraak-naar-tekst-landinstellingen:
Spraak-naar-tekst ondersteunt twee nieuwe landinstellingen, zoals wordt weergegeven in de volgende tabel. Raadpleeg hier de volledige taallijst.
| Locale |
Language |
pa-IN |
Punjabi (India) |
ur-IN |
Urdu (India) |
Uitspraakbeoordeling
Release van mei 2023
Uitspraakbeoordeling
-
Beoordeling van spraakuitspraak ondersteunt nu 3 extra talen die algemeen beschikbaar zijn in het Duits (Duitsland), Japans (Japan) en Spaans (Mexico), met 4 extra talen die beschikbaar zijn in preview. Zie de volledige taallijst voor uitspraakbeoordeling voor meer informatie.
- U kunt nu de standaardlaag spraak-naar-teksttoezegging gebruiken voor uitspraakbeoordeling in alle openbare regio's. Als u een toezeggingslaag koopt voor standaard spraak-naar-tekst, gaat de uitgaven voor uitspraakbeoordeling naar het voldoen aan de toezegging. Zie prijscategorieën voor toezeggingscategorieën.
Release van februari 2023
Uitspraakbeoordeling
-
De uitspraakbeoordeling van spraak ondersteunt nu 5 extra talen die algemeen beschikbaar zijn in het Engels (Verenigd Koninkrijk), Engels (Australië), Frans (Frankrijk), Spaans (Spanje) en Chinees (Mandarijn, Vereenvoudigd), met andere talen die beschikbaar zijn in preview.
- Voorbeeldcodes toegevoegd die laten zien hoe u uitspraakbeoordeling gebruikt in de streamingmodus in uw eigen toepassing.
Aangepaste spraak
Ondersteuning voor audio + door mensen gelabelde transcriptie wordt toegevoegd voor de de-AT landinstellingen.
Release van januari 2023
Aangepaste spraak
Ondersteuning voor audio + door mensen gelabelde transcriptie wordt toegevoegd voor extra landinstellingen: ar-BH, , ar-DZar-EG, ar-MA, ar-SA, , ar-TNen ar-YEja-JP.
Ondersteuning voor aanpassing van gestructureerde tekst wordt toegevoegd voor landinstellingen de-AT.
Release van december 2022
REST API voor spraak-naar-tekst
Rest API-versie 3.1 van spraak-naar-tekst is algemeen beschikbaar. Versie 3.0 van de REST API voor spraak-naar-tekst wordt buiten gebruik gesteld. Zie de handleiding voor meer informatie over het migreren.
Release van oktober 2022
Nieuwe landinstelling voor spraak naar tekst
Ondersteuning toegevoegd voor Malayalam (India) met de ml-IN landinstelling. Bekijk hier de volledige taallijst.
Release van juli 2022
Nieuwe spraak-naar-tekst-landinstellingen:
Er zijn 7 nieuwe landinstellingen toegevoegd, zoals wordt weergegeven in de volgende tabel. Bekijk hier de volledige taallijst.
| Locale |
Language |
bs-BA |
Bosnisch (Bosnië en Herzegovina) |
yue-CN |
Chinees (Kantonees, Vereenvoudigd) |
zh-CN-sichuan |
Chinees (Zuidwestelijk Mandarijn, Vereenvoudigd) |
wuu-CN |
Chinees (Wu, Vereenvoudigd) |
ps-AF |
Pashto (Afghanistan) |
so-SO |
Somalië (Somalië) |
cy-GB |
Welsh (Verenigd Koninkrijk) |
Release van juni 2022
Nieuwe spraak-naar-tekst-landinstellingen:
Er zijn 10 nieuwe landinstellingen toegevoegd, zoals wordt weergegeven in de volgende tabel. Bekijk hier de volledige taallijst.
| Locale |
Language |
sq-AL |
Albanese (Albanië) |
hy-AM |
Armeens (Armenië) |
az-AZ |
Azerbeidzjaans (Azerbeidzjaans) |
eu-ES |
Baskisch |
gl-ES |
Galicisch |
ka-GE |
Georgisch (Georgië) |
it-CH |
Italiaans (Zwitserland) |
kk-KZ |
Kazachs (Kazachstan) |
mn-MN |
Mongools (Mongools) |
ne-NP |
Nepalee (Nepalee) |
Release van april 2022
Nieuwe spraak-naar-tekst-landinstellingen:
Hieronder ziet u een lijst met de nieuwe landinstellingen. Bekijk hier de volledige taallijst.
| Locale |
Language |
bn-IN |
Bengaals (India) |
Release van januari 2022
Nieuwe spraak-naar-tekst-landinstellingen:
Hieronder ziet u een lijst met de nieuwe landinstellingen. Bekijk hier de volledige taallijst.
| Locale |
Language |
af-ZA |
Afrikaans (Zuid-Afrika) |
am-ET |
Amharisch (Ethiopië) |
de-CH |
Duits (Zwitserland) |
fr-BE |
Frans (België) |
is-IS |
IJslands (IJsland) |
jv-ID |
Javaans (Indonesië) |
km-KH |
Khmer (Cambodja) |
kn-IN |
Kannada (India) |
lo-LA |
Lao (Laos) |
mk-MK |
Macedonisch (Noord-Macedonië) |
my-MM |
Birmees (Myanmar) |
nl-BE |
Nederlands (België) |
si-LK |
Sinhala (Sri Lanka) |
sr-RS |
Servisch (Servië) |
sw-TZ |
Swahili (Tanzania) |
uk-UA |
Oekraïens (Oekraïne) |
uz-UZ |
Oezbeeks (Oezbeeks) |
zu-ZA |
Zulu (Zuid-Afrika) |
Release van juli 2021
Nieuwe spraak-naar-tekst-landinstellingen:
Hieronder ziet u een lijst met de nieuwe landinstellingen. Bekijk hier de volledige taallijst.
| Locale |
Language |
ar-DZ |
Arabisch (Algerije) |
ar-LY |
Arabisch (Libië) |
ar-MA |
Arabisch (Marokko) |
ar-TN |
Arabisch (Tunesië) |
ar-YE |
Arabisch (Jemen) |
bg-BG |
Bulgaars (Bulgarije) |
el-GR |
Grieks (Griekenland) |
et-EE |
Estlands (Estland) |
fa-IR |
Perzisch (Iran) |
ga-IE |
Iers (Ierland) |
hr-HR |
Kroatisch (Kroatië) |
lt-LT |
Litouws (Litouwen) |
lv-LV |
Lets (Letland) |
mt-MT |
Maltees (Malta) |
ro-RO |
Roemeens (Roemenië) |
sk-SK |
Slowaaks (Slowakije) |
sl-SI |
Sloveens (Slovenië) |
sw-KE |
Swahili (Kenia) |
Release van januari 2021
Nieuwe spraak-naar-tekst-landinstellingen:
Hieronder ziet u een lijst met de nieuwe landinstellingen. Bekijk hier de volledige taallijst.
| Locale |
Language |
ar-AE |
Arabisch (Verenigde Arabische Emiraten) |
ar-IL |
Arabisch (Israël) |
ar-IQ |
Arabisch (Irak) |
ar-OM |
Arabisch (Oman) |
ar-PS |
Arabisch (Palestijnse Autoriteit) |
de-AT |
Duits (Oostenrijk) |
en-GH |
Engels (Ghana) |
en-KE |
Engels (Kenia) |
en-NG |
Engels (Nigeria) |
en-TZ |
Engels (Tanzania) |
es-GQ |
Spaans (Equatoriaal Guinea) |
fil-PH |
Filipijns (Filipijnen) |
fr-CH |
Frans (Zwitserland) |
he-IL |
Hebreeuws (Israël) |
id-ID |
Indonesisch (Indonesië) |
ms-MY |
Maleis (Maleisië) |
vi-VN |
Vietnamees (Vietnam) |
Release van augustus 2020
Nieuwe landinstellingen voor spraak naar tekst:
Spraak naar tekst uitgebracht 26 nieuwe landinstellingen in augustus: 2 Europese talen cs-CZ en hu-HU, 5 Engelse landinstellingen en 19 Spaanse landinstellingen die de meeste Zuid-Amerikaanse landen/regio's beslaan. Hieronder ziet u een lijst met de nieuwe landinstellingen. Bekijk hier de volledige taallijst.
| Locale |
Language |
cs-CZ |
Tsjechisch (Tsjechische Republiek) |
en-HK |
Engels (Hong Kong Special Administrative Region) |
en-IE |
Engels (Ierland) |
en-PH |
Engels (Filipijnen) |
en-SG |
Engels (Singapore) |
en-ZA |
Engels (Zuid-Afrika) |
es-AR |
Spaans (Argentinië) |
es-BO |
Spaans (Bolivia) |
es-CL |
Spaans (Chili) |
es-CO |
Spaans (Colombia) |
es-CR |
Spaans (Costa Rica) |
es-CU |
Spaans (Cuba) |
es-DO |
Spaans (Dominicaanse Republiek) |
es-EC |
Spaans (Ecuador) |
es-GT |
Spaans (Guatemala) |
es-HN |
Spaans (Honduras) |
es-NI |
Spaans (Nicaragua) |
es-PA |
Spaans (Panama) |
es-PE |
Spaans (Peru) |
es-PR |
Spaans (Puerto Rico) |
es-PY |
Spaans (Paraguay) |
es-SV |
Spaans (El Salvador) |
es-US |
Spaans (VS) |
es-UY |
Spaans (Uruguay) |
es-VE |
Spaans (Venezuela) |
hu-HU |
Hongaars (Hongarije) |
Release van mei 2026
De Voice Live-evaluatie-harnas is beschikbaar in preview. Evalueer de kwaliteit van uw Voice Live-spraakagents door vooraf opgenomen audio uit te voeren via verschillende sessieconfiguraties en reacties te scoren met Microsoft Foundry ingebouwde evaluators. Zie Voice Live-agents evalueren voor meer informatie.
Release van april 2026
Voice Live API-versie 2026-04-10 is beschikbaar en voegt nieuwe algemeen beschikbare functies en preview-mogelijkheden toe. Zie Voice Live API Reference 2026-04-10 voor de volledige API-verwijzing.
De volgende eerder preview-functies zijn nu algemeen beschikbaar:
Nieuwe GA-functie:
Nieuwe preview-functie:
-
MAI Transcribe is beschikbaar in preview als een optie voor spraakherkenningsmodel voor Voice Live.
Bijgewerkte GA SDK-versies:
-
azure-ai-voicelive Python 1.2.0
- C#
Azure.AI.VoiceLive 1.1.0
-
azure-ai-voicelive Java 1.0.0
- JavaScript
@azure/ai-voicelive 1.0.0
Release van februari 2026
Voice Agent-integratie met Foundry Agent Service is beschikbaar in preview met SDK-ondersteuning voor Python, Java, C# en JavaScript. Bouw realtime spraakagents met de nieuwe quickstart en instructies. Zie Aan de slag met Voice Live en Foundry Agent Service en hoe u een spraakagent bouwt voor meer informatie.
Er zijn nieuwe handleidingen beschikbaar:
Release van januari 2026
De Voice Live API Reference 2026-01-01-preview is beschikbaar in preview, met bijgewerkte gebeurtenis- en configuratiedekking voor Voice Live-sessies. Zie Voice Live API Reference 2026-01-01-01-preview voor meer informatie.
November 2025
De Voice Live-API is algemeen beschikbaar. Transformeer gesprekken in naadloze ervaringen met Voice Live API: de alles-in-één oplossing die spraakherkenning, generatieve AI en tekst-naar-spraak combineert tot één interface met lage latentie voor het bouwen van intelligente spraakagenten. Zie Voice Live voor meer informatie.
Release van 2025-juni
Neurale tekst naar spraak 3.11.0
Vrijgegeven neurale tekst naar spraakversie 3.11.0.
- Ondersteuning toegevoegd voor nieuwe neurale stemmen:
de-DE-SeraphinaMultilingualNeural, es-ES-XimenaMultilingualNeural, fi-FI-SelmaNeural. nb-NO-FinnNeural
- Ondersteuning toegevoegd voor meertalige aangepaste lexicons.
Release van 2025-mei
Voeg ondersteuning toe voor de nieuwste modelversies:
Voor tekst-naar-spraak:
- De tekst bijgewerkt naar de back-end van spraak en front-end-engine naar de nieuwste versies.
- Ondersteuning toegevoegd voor meertalige aangepaste lexicons.
- De statuscontrolefunctionaliteit is verbeterd. Het eindpunt van de statuscontrole is nu
/synthesize/health. Wanneer de service in orde is, retourneert dit eindpunt DE HTTP-status 200; als de service niet in orde is, wordt de HTTP-status 503 geretourneerd.
- De basisinstallatiekopieën zijn bijgewerkt naar AspNet 8.0.16 om beveiligingsproblemen te verhelpen vanaf de beveiligingsupdate van maart/april 2025 Microsoft ASP.NET Core.
Release van 2025-maart
Voeg ondersteuning toe voor de nieuwste modelversies:
- Neurale tekst naar spraak 3.9.0
- Spraak naar tekst 5.0.1 (preview)
- Aangepaste spraak naar tekst 5.0.1 (preview)
Voor spraak-naar-tekst en aangepaste spraak-naar-tekst zijn de volgende functies opgenomen:
- Ondersteuning voor nieuwe spraak-naar-tekstmodellen
- Het besturingssysteem wordt gewijzigd in Azure Linux 3.0
- Ondersteuning voor nieuwe landinstellingen: ar-dz, as-in, es-gq or-in, pa-in en ur-in
- Decoderupdate
- Mogelijkheid om nieuwere aangepaste modellen te gebruiken (2023+) in container
Voor tekst-naar-spraak is ondersteuning toegevoegd voor nieuwe neurale stemmen: en-GB-OliviaNeuralen en-US-ChristopherNeuralnl-NL-FennaNeural.
Release van 2025-februari
Voeg ondersteuning toe voor de nieuwste modelversies:
- Spraaktaalidentificatie 1.18.0
- Neurale tekst naar spraak 3.7.0
- Spraak naar tekst 4.12.0
- Aangepaste spraak naar tekst 4.12.0
Hier volgen de hoogtepunten van de releases:
| Onderdelenupdate |
Spraak naar tekst |
Aangepaste spraak naar tekst |
Neurale tekst naar spraak |
Spraaktaalidentificatie |
| Oplossingen voor beveiligingsproblemen |
✅ |
✅ |
✅ |
✅ |
| Gemigreerd besturingssysteem van Ubuntu 20.04 naar Ubuntu 22.04 |
✅ |
✅ |
✅ |
✅ |
| Nieuwe landinstellingen: ar-ly, fr-be, nl-be en uz-uz |
✅ |
✅ |
|
|
| Bijgewerkte nuget-pakketten, Go-versie |
✅ |
✅ |
|
|
| Parallelle uitvoering van modeldownload toegevoegd om de downloadtijd van het model te verminderen |
✅ |
✅ |
✅ |
|
Release van 2024-oktober
Voeg ondersteuning toe voor de nieuwste modelversies:
- Spraaktaalidentificatie 1.16.0
- Neurale tekst naar spraak 3.5.0
- Een alias maken
en-us-ariacpuneural op en-us-jessacpuneural
- De versie van de back-end-engine voor spraak bijwerken
- Spraak naar tekst 4.10.0
- Ondersteuning voor landinstellingen herstellen
uk-UA
- Instellingen voor stilte herstellen om te werken met lange perioden van stilte in de audio
- Afgeschafte modellen vervangen:
cs-CZ, , da-DKen-GB, fr-CA, , hu-HUit-CHtr-TRzh-CN-sichuan
- Aangepaste spraak naar tekst 4.10.0
Release van 2024-september
Voeg ondersteuning toe voor de nieuwste modelversies:
- Spraaktaalidentificatie 1.15.0
- Beveiligingsproblemen beperken
- Neurale tekst naar spraak 3.4.0
- Nieuwe stemmen:
en-us-andrewmultilingualneural, en-us-jessaneural, es-us-alonsoneural, , es-us-palomaneuralit-it-isabellamultilingualneural
- Beveiligingsproblemen beperken
- Spraak naar tekst 4.9.0
- Nieuwe landinstellingen:
ar-YE, af-ZA, am-ET, ar-MA, , ar-TN, sw-KEsw-TZzu-ZA
- Beveiligingsproblemen beperken
- Afgeschafte modellen bijwerken
- Aangepaste spraak naar tekst 4.9.0
- Beveiligingsproblemen beperken
Release van 2024 augustus
Voeg ondersteuning toe voor de nieuwste modelversies:
- Spraaktaalidentificatie 1.14.0
- Upgrade uitvoeren .NET 8.0
- Beveiligingsproblemen beperken
- Neurale tekst naar spraak 3.3.0
- Upgrade uitvoeren .NET 8.0
- Beveiligingsproblemen beperken
- Spraak naar tekst 4.8.0
- Upgrade uitvoeren .NET 8.0
- Beveiligingsproblemen beperken
- Engine voor upgradeherkenning
- Los het probleem op waarbij
PropertyId.Speech_SegmentationSilenceTimeoutMs werd genegeerd.
- Afgeschafte modellen bijwerken
-
uk-UA De landinstelling verwijderen
Release van 2024-februari
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 4.6.0
- Spraak naar tekst 4.6.0
- Neurale tekst naar spraak 3.1.0
Voer een upgrade uit van spraak naar tekstonderdelen naar de nieuwste versie.
Upgrade alle es landinstellingen naar de nieuwste versie.
Vergroot de mediatransformatiebuffer voor gebruiksvoorbeelden voor spraak naar tekst.
Release van 2023-november
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 4.5.0
- Spraak naar tekst 4.5.0
- Neurale tekst naar spraak 2.19.0
Release van 2023-oktober
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 4.4.0
- Spraak naar tekst 4.4.0
- Neurale tekst naar spraak 2.18.0
Los een aantal problemen met beveiligingsproblemen met een hoog risico op.
Verwijder redundante logboeken in containers.
Voer een upgrade uit naar het interne mediaonderdeel naar de nieuwste versie.
Voeg ondersteuning toe voor spraak en-IN-NeerjaNeural.
Release van 2023-september
Voeg ondersteuning toe voor de nieuwste modelversies:
- Spraaktaalidentificatie 1.12.0
- Aangepaste spraak naar tekst 4.3.0
- Spraak naar tekst 4.3.0
- Neurale tekst naar spraak 2.17.0
Werk aangepaste spraak naar tekst en spraak naar tekst bij naar het nieuwste framework.
Los beveiligingsproblemen op.
Voeg ondersteuning toe voor spraak ar-AE-FatimaNeural.
Release van 2023-juli
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 4.1.0
- Spraak naar tekst 4.1.0
- Neurale tekst naar spraak 2.15.0
Los het probleem op van het uitvoeren van spraak-naar-tekstcontainer via docker koppelopties met lokale aangepaste modelbestanden.
Los het probleem op dat in sommige gevallen niet RECOGNIZING wordt weergegeven in reactie via de Speech SDK.
Los beveiligingsproblemen op.
Release van 2023-juni
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 4.0.0
- Spraak naar tekst 4.0.0
- Neurale tekst naar spraak 2.14.0
On-premises spraak-naar-tekstafbeeldingen worden bijgewerkt naar .NET 6.0
Voer een upgrade uit voor weergavemodellen voor landinstellingen, waaronderen-us, ar-egar-bh, , ja-jpen ko-krmeer.
Werk het spraak-naar-tekstcontaineronderdeel bij om problemen met beveiligingsproblemen op te lossen.
Ondersteuning toevoegen voor landinstellingende-DE-AmalaNeural,de-AT-IngridNeuralde-AT-JonasNeural enen-US-JennyMultilingualNeural
Release van 2023-mei
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.14.0
- Spraak naar tekst 3.14.0
- Neurale tekst naar spraak 2.13.0
he-IL Probleem met interpunctie oplossen
Problemen met beveiligingsproblemen oplossen
Nieuwe landinstellingsstem en-US-MichelleNeuraltoevoegen en es-MX-CandelaNeural
Release van 2023-april
Beveiligingsupdates
Problemen met beveiligingsproblemen oplossen
Release van 2023-maart
Voeg ondersteuning toe voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.12.0
- Spraak naar tekst 3.12.0
- Spraaktaalidentificatie 1.11.0
- Neurale tekst naar spraak 2.11.0
Problemen met beveiligingsproblemen oplossen
tr-TR Het probleem met hoofdlettergebruik oplossen
De spraak-naar-tekstweergavemodellen en-US upgraden
Voeg ondersteuning toe voor de ar-AE-HamdanNeural standaardstem.
Release van 2023-februari
Nieuwe containerversies
Ondersteuning toevoegen voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.11.0
- Spraak naar tekst 3.11.0
- Neurale tekst naar spraak 2.10.0
Problemen met beveiligingsproblemen oplossen
Reguliere upgrade voor spraakmodellen
Nieuwe Abraic-landinstellingen toevoegen:
Hebreeuwse en Turkse weergavemodellen upgraden
Release van 2023-januari
Nieuwe containerversies
Ondersteuning toevoegen voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.10.0
- Spraak naar tekst 3.10.0
- Neurale tekst naar spraak 2.9.0
Probleem met hypothesemodus oplossen
Probleem met HTTP-proxy oplossen
De niet-verbonden modus aangepaste spraak-naar-tekstcontainer
CNV-ondersteuning voor niet-verbonden containers toevoegen aan TTS-front-end
Voeg ondersteuning toe voor deze landinstellingen:
- da-DK-ChristelNeural
- da-DK-JeppeNeural
- en-IN-PrabhatNeural
Release van 2022-december
Nieuwe containerversies
Ondersteuning toevoegen voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.9.0
- Spraak naar tekst 3.9.0
- Neurale tekst naar spraak 2.8.0
Probleem met ipv4/ipv6 oplossen
Probleem met beveiligingsproblemen oplossen
Release van 2022-november
Nieuwe containerversies
Ondersteuning toevoegen voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.8.0
- Spraak naar tekst 3.8.0
- Neurale tekst naar spraak 2.7.0
Release van 2022 oktober
Nieuwe containerversies
Ondersteuning toevoegen voor de nieuwste modelversies:
- Aangepaste spraak naar tekst 3.7.0
- Spraak naar tekst 3.7.0
- Neurale tekst naar spraak 2.6.0
Release van 2022-september
Spraak naar tekst 3.6.0-amd64
Voeg ondersteuning toe voor de nieuwste modelversies.
Voeg ondersteuning toe voor deze landinstellingen:
- az-az
- bn-in
- bs-ba
- cy-gb
- eu-es
- fa-ir
- gl-es
- he-il
- hy-am
- it-ch
- ka-ge
- kk-kz
- mk-mk
- mn-mn
- ne-np
- ps-af
- so-so
- sq-al
- wuu-cn
- yue-cn
- zh-cn-sichuan
Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.
Aangepaste spraak naar tekst 3.6.0-amd64
Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.
Neurale tekst naar spraak v2.5.0
Voeg ondersteuning toe voor deze standaardstemmen:
az-az-babekneural
az-az-banuneural
fa-ir-dilaraneural
fa-ir-faridneural
fil-ph-angeloneural
fil-ph-blessicaneural
he-il-avrineural
he-il-hilaneural
id-id-ardineural
id-id-gadisneural
ka-ge-ekaneural
ka-ge-giorgineural
Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.
Release van 2022 mei
Spraak-taal-detectie Container v1.9.0-amd64-preview
Oplossingen voor spraaktaaldetectie.
Release van 2022 maart
Aangepaste spraak-naar-tekstcontainer v3.1.0
Voeg ondersteuning toe om weergavemodellen op te halen.
Release van 2022-januari
Spraak-naar-tekstcontainer v3.0.0
Voeg ondersteuning toe voor het gebruik van containers in niet-verbonden omgevingen.
Spraak-naar-tekstcontainer v2.18.0
Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.
Neural-Neural tekst naar spraakcontainer v1.12.0
Voeg ondersteuning toe voor deze standaardstemmen: am-et-amehaneural, am-et-mekdesneural, so-so-muuseneuralen so-so-ubaxneural.
Regelmatige maandelijkse updates, waaronder beveiligingsupgrades en oplossingen voor beveiligingsproblemen.