Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Belangrijk
Niet-Engelse vertalingen zijn alleen voor het gemak beschikbaar. Raadpleeg de EN-US versie van dit document voor de definitieve versie.
Wat is een transparantienotitie?
Een AI-systeem omvat niet alleen de technologie, maar ook de mensen die het gebruiken, de personen die worden beïnvloed door het systeem en de omgeving waarin het wordt geïmplementeerd. Voor het maken van een systeem dat geschikt is voor het beoogde doel, moet u begrijpen hoe technologie werkt, wat de mogelijkheden en beperkingen zijn en hoe u de beste prestaties kunt behalen. de transparantienotities van Microsoft zijn bedoeld om inzicht te krijgen in de werking van onze AI-technologie, de keuzes die systeemeigenaren kunnen maken die de prestaties en het gedrag van het systeem beïnvloeden, en het belang van nadenken over het hele systeem, met inbegrip van de technologie, de mensen en de omgeving. U kunt Transparantienotities gebruiken bij het ontwikkelen of implementeren van uw eigen systeem of deze delen met de personen die door uw systeem worden gebruikt of beïnvloed.
de transparantienotities van Microsoft maken deel uit van een bredere inspanning op Microsoft om onze AI-principes in de praktijk te brengen. Zie de Microsoft AI-principes voor meer informatie.
De basisbeginselen van tekst naar spraak
Inleiding
Tekst naar spraak, onderdeel van Azure Speech in Foundry Tools, is een veelzijdig hulpmiddel waarmee geschreven tekst kan worden geconverteerd naar spraakaudio met natuurlijke klank. De functie heeft invoer in de vorm van tekst en genereert spraakaudio van hoge kwaliteit die op apparaten kan worden afgespeeld. Voor de spraakaudio-uitvoer biedt tekst-naar-spraak een scala aan vooraf gebouwde neurale stemmen of, voor klanten met beperkte toegang, de optie om een aangepaste neurale stem te maken voor uw product of merk.
Tekst-naar-spraak heeft ook visuele mogelijkheden. Met behulp van tekst-naar-spraak-avatar kunnen klanten tekst invoeren en een synthetische video maken van een avatar die spreekt. Zowel vooraf samengestelde tekst-naar-spraak avatars als aangepaste tekst-naar-spraak avatars zijn beschikbaar, die kunnen worden gebruikt met zowel vooraf samengestelde neurale spraak als aangepaste neurale stem, hoewel sommige functies alleen beschikbaar zijn voor klanten met beperkte toegang.
In een tekst-naar-spraaksysteem kunnen klanten geschreven informatie omzetten in hoorbare spraak en de toegankelijkheid voor gebruikers verbeteren. Of u nu luistert naar documenten of gebruikerservaringen verbetert met gesynthetiseerde spraak, tekst naar spraak transformeert tekst in natuurlijke gesproken woorden.
Belangrijkste termen
| Termijn | Definitie |
|---|---|
| Real-time spraaksynthese | Gebruik de Speech SDK of REST API om tekst naar spraak te converteren met behulp van vooraf gedefinieerde neurale spraak, vooraf samengestelde tekst naar spraak avatar, aangepaste neurale spraak en aangepaste tekst naar spraak avatar. |
| Spraakmodel | In een tekst naar spraaksysteem verwijst een spraakmodel naar een machine learning-model of algoritme dat synthetische spraak genereert op basis van geschreven tekst. Dit model is getraind om tekstinvoer te converteren naar uitvoer van gesproken taal, waarbij de kenmerken van een menselijke stem worden nagebootst, inclusief toonhoogte, toon en uitspraak. |
| Prosodie | Prosody verwijst naar de modulatie van spraakelementen zoals toonhoogte, duur, volume en pauzes om synthetische stemmen te combineren met een natuurlijke en expressieve kwaliteit, het overbrengen van emotionele nuances en contextuele betekenis, waardoor de robotkwaliteit van de gegenereerde spraak wordt verminderd en het aantrekkelijker en begrijpelijker wordt voor listeners. |
| Speech Synthesis Markup Language (SSML) | Speech Synthesis Markup Language (SSML) is een xml-opmaaktaal die wordt gebruikt om tekst aan te passen aan spraakuitvoer. Met SSML kunt u de toonhoogte aanpassen, pauzes toevoegen, uitspraak verbeteren, spreeksnelheid wijzigen, volume aanpassen en meerdere stemmen aan één document toewijzen. U kunt SSML gebruiken om uw eigen lexicons te definiëren of over te schakelen naar verschillende spreekstijlen. |
| Asynchrone synthese van lange audiofragmenten | Gebruik de batchsynthese-API (preview) om tekst asynchroon te synthetiseren naar spraakbestanden die langer zijn dan 10 minuten (bijvoorbeeld audioboeken of lezingen). In tegenstelling tot synthese die wordt uitgevoerd via de Speech SDK of Speech to text REST API, worden antwoorden niet in realtime geretourneerd. De verwachting is dat aanvragen asynchroon worden verzonden, antwoorden worden gepeild naar en gesynthetiseerde audio wordt gedownload wanneer de service deze beschikbaar maakt. |
| Visemes | Visemen zijn de belangrijkste houdingen in waargenomen spraak, waaronder de positie van de lippen, kaak en tong bij het produceren van een bepaald foneem. Visemes heeft een sterke correlatie met stemmen en telefoontjes. |
- Vooraf samengestelde neurale stem
- Aangepaste neurale spraak
- Vooraf samengestelde tekst naar spraak-avatar
- Aangepaste tekst naar spraak-avatar
- Videovertaling
Inleiding
Vooraf gemaakte neurale stemmen bieden een breed scala aan stemmen, met meer dan 400 opties in meer dan 140 talen en regio's. Met deze tekst naar spraakstemmen kunt u snel de functionaliteit voor voorlezen integreren in uw toepassingen voor verbeterde toegankelijkheid.
Belangrijkste termen
| Termijn | Definitie |
|---|---|
| Vooraf samengestelde neurale stem | Microsoft biedt een set vooraf gebouwde neurale stemmen, die gebruikmaken van diepe neurale netwerken om de grenzen van traditionele spraaksynthese te overwinnen met betrekking tot stress en intonatie in gesproken taal. Prosody voorspelling en spraaksynthese worden gelijktijdig uitgevoerd, wat resulteert in meer vloeiende en natuurlijk klinkende resultaten. Elk voorgebouwd neuraal spraakmodel is beschikbaar op 24 kHz en 48 kHz van hoge kwaliteit en de uitvoer kan worden geüpsampled of gedownsampled naar andere indelingen. |
Mogelijkheden
Systeemgedrag
Tekst naar spraak
Tekst naar spraak converteert tekst naar natuurlijke spraak.
Hieronder ziet u de belangrijkste opties voor het gebruik van de tekst-naar-spraakservice.
Real-time tekst-naar-spraak API
Dit is een veelvoorkomende API-aanroep via de Speech SDK of REST API voor het verzenden van tekstinvoer en het ontvangen van een audio-uitvoer in realtime. Het Spraaksysteem maakt gebruik van een spraak-naar-spraakmodel om de tekst om te zetten in menselijke, synthetische spraak. De uitvoeraudio kan worden opgeslagen als een bestand of worden afgespeeld op een uitvoerapparaat zoals een luidspreker (meer informatie over het synthetiseren van spraak uit tekst). Gebruikers kunnen SSML ook gebruiken om de tekst af te stemmen op spraakuitvoer.
Tekst-naar-spraakmodellen worden getraind op grote hoeveelheden verschillende audio in typische gebruiksscenario's en een breed scala aan sprekers. De tekst-naar-spraakservice wordt bijvoorbeeld vaak gebruikt voor spraakgestuurde chatbots of voor het maken van audio-inhoud.
Batchsynthese-API
Batchsynthese is een ander type API-aanroep. Het wordt meestal gebruikt om grote tekstbestanden te verzenden en audio-uitvoer asynchroon te ontvangen (dat wil gezegd op een later tijdstip). Als u deze API wilt gebruiken, kunt u locaties opgeven voor meerdere tekstbestanden. De tekst-naar-spraaktechnologie leest de tekstinvoer uit het bestand en genereert audiobestanden die worden geretourneerd naar de opslaglocatie die u opgeeft. Deze functie wordt gebruikt om grotere spraaksynthesetaken te ondersteunen waarin het niet nodig is om eindgebruikers in realtime de audio-uitvoer te bieden. Een voorbeeld is het maken van audioboeken.
Tekst naar spraak - aangepaste neurale spraak
Aangepaste neurale spraak is een spraakfunctie voor tekst waarmee klanten met beperkte toegang een een-op-een-soort aangepaste synthetische stem voor hun toepassingen kunnen maken door hun eigen audiogegevens te verstrekken van de geselecteerde stemtalenten van de klant.
Met aangepaste neurale spraak kunt u uw stemtalent opnemen door ze Microsoft voorziene scripts in Speech Studio te laten lezen en snel een synthetische stem te maken die klinkt als uw stemtalent met behulp van een lite-project (preview). Een lite project is ideaal voor een snelle proefversie of een proof of concept.
Met een pro-project kunt u door studio opgenomen hoogwaardige spraakgegevens van uw geselecteerde stemtalent uploaden en een realistisch klinkende stem creëren. Pro ondersteunt zeer natuurlijke spraaktraining die nog meer lijkt op de stem van uw stemtalent en kan worden aangepast om te spreken in meerdere emoties en in verschillende talen, zonder dat er extra emotiespecifieke of taalspecifieke trainingsgegevens nodig zijn.
Zodra een aangepaste neurale spraak is gemaakt, kunt u het spraakmodel implementeren met een uniek eindpunt en het model gebruiken om synthetische spraak te genereren met de realtime synthese-API of de batchsynthese-API die hierboven wordt beschreven.
Zie Overzicht van aangepaste neurale spraak voor meer informatie over aangepaste neurale spraak.
Persoonlijke stem
Met de functie voor persoonlijke spraak kunnen klanten met beperkte toegang een spraakmodel maken op basis van een kort voorbeeld van menselijke spraak. De functie kan binnen een paar seconden een spraakmodel maken op basis van de prompt. Deze functie wordt doorgaans gebruikt om persoonlijke spraakervaringen te bieden voor zakelijke klantentoepassingen. Persoonlijke spraakmodellen kunnen realistische stemmen creëren die in bijna 100 talen kunnen spreken.
Watermerken worden toegevoegd aan aangepaste neurale stemmen die zijn gemaakt met de persoonlijke spraakfunctie. Met watermerken kunnen gebruikers bepalen of spraak wordt gesynthetiseerd met behulp van Azure Spraak, en met name welke stem is gebruikt. In aanmerking komende klanten kunnen gebruikmaken van Azure detectiemogelijkheden voor spraakwatermerken. Als u wilt aanvragen om watermerkdetectie toe te voegen aan uw toepassingen, neemt u contact op met mstts[at]microsoft.com.
Zie persoonlijke stem voor meer informatie over persoonlijke stem.
Avatar voor tekst naar spraak
Tekst-naar-spraak-avatar converteert tekst naar een digitale video van een fotorealistisch mens (een vooraf samengestelde avatar of een aangepaste avatar) die spreekt met een natuurlijk klinkende stem die wordt aangedreven door tekst naar spraakfuncties, zoals vooraf samengestelde neurale spraak of aangepaste neurale stem. De video van de tekst naar spraak-avatar kan asynchroon of in realtime worden gesynthetiseerd. Ontwikkelaars kunnen toepassingen bouwen die zijn geïntegreerd met tekst-naar-spraak-avatar via een API of een hulpprogramma voor het maken van inhoud in Speech Studio gebruiken om video-inhoud te maken zonder code te coderen.
Met de geavanceerde neurale netwerkmodellen van avatars voor tekst naar spraak biedt de functie gebruikers de mogelijkheid om levensachtige en hoogwaardige synthetische avatarvideo's voor verschillende toepassingen te leveren.
Voor tekst-naar-spraak-avatar wordt de Coalition for Content Provenance and Authenticity (C2PA) Standard gebruikt om doelgroepen duidelijker inzicht te geven in de bron en geschiedenis van video-inhoud die door avatars is gemaakt. Deze standaard biedt transparante informatie over ai-generatie video-inhoud. Raadpleeg Content Credentials in Azure tekst-naar-spraak Avatar voor meer informatie over de integratie van C2PA met text to speech avatars.
Daarnaast is avatar-uitvoer automatisch gewatermerkt. Met watermerken kunnen goedgekeurde gebruikers bepalen of een video wordt gesynthetiseerd met behulp van de avatarfunctie van Azure Speech. Als u watermerkdetectie wilt aanvragen, neemt u contact op met avatarvoice[at]microsoft.com.
Videovertaling
Met videovertaling kunt u uw video-inhoud efficiënt lokaliseren zodat deze geschikt is voor diverse doelgroepen over de hele wereld. Videovertaling zal automatisch dialoogaudio extraheren, transcriberen, vertalen en de inhoud met vooraf samengestelde of persoonlijke stem in de doeltaal dubben, met nauwkeurige ondertitels voor verbeterde toegankelijkheid. Functies met meerdere luidsprekers helpen bij het identificeren van het aantal personen dat spreekt en het aanbevelen van geschikte stemmen. Door inhoud te bewerken met een mens in de lus, kan de inhoud nauwkeurig worden afgestemd op de voorkeur van de klant. Verbeterde vertaalkwaliteit zorgt voor nauwkeurige audio- en video-afstemming met GPT-integratie. Videovertaling maakt authentieke en gepersonaliseerde dubibbelervaringen mogelijk met persoonlijke stem.
Gebruiksscenario's
Tekst-naar-spraak biedt een verscheidenheid aan functies die geschikt zijn voor een breed scala aan beoogde toepassingen in verschillende branches en domeinen. Alle tekst-naar-spraakfuncties, waaronder videovertaling, zijn onderworpen aan de voorwaarden die van toepassing zijn op het Azure-abonnement van klanten, waaronder het Azure beleid voor acceptabel gebruik en de gedragscode voor Azure tekst-naar-spraak.
Daarnaast zijn aangepaste tekst naar spraakfuncties zoals aangepaste neurale spraak, persoonlijke spraak en aangepaste tekst naar spraak-avatar beperkt tot de goedgekeurde gebruiksvoorbeelden, zoals beschreven in de specifieke scenario's die hieronder worden beschreven:
Bedoeld voor Custom Neural Voice Pro en Custom Neural Voice Lite
Hieronder volgen de goedgekeurde gebruiksvoorbeelden voor Custom Neural Voice Pro en Custom Neural Voice Lite:
- Educatief of interactief leren: Om een fictieve merk- of karakterstem te creëren voor het lezen of spreken van educatieve materialen, online leren, interactieve lesplannen, simulatieleer of begeleide museumrondleidingen.
- Media: Entertainment: Om een fictief merk of karakterstem te creëren voor het lezen of spreken van entertainmentinhoud voor videogames, films, tv, opgenomen muziek, podcasts, audioboeken of augmented of virtual reality.
- Media: Marketing: Om een fictieve merk- of karakterstem te creëren voor het lezen of spreken van marketing- en product- of servicemedia, productintroducties, bedrijfspromotie of advertenties.
- Zelfgeschreven inhoud: Om een stem te creëren voor het lezen van inhoud die door het spraaktalent is geschreven.
- Toegankelijkheidsfuncties: voor gebruik in audiobeschrijvingssystemen en gesproken tekst, inclusief fictieve merk- of karakterstem, of om communicatie door mensen met spraakproblemen te vergemakkelijken.
- IVR-systemen (Interactive Voice Response): Om stemmen te maken, inclusief fictieve merk- of karakterstem, voor callcenterbewerkingen, telefoniesystemen of antwoorden voor telefooninteracties.
- Openbare dienst en informatieve aankondigingen: om een fictieve merk- of karakterstem te creëren voor het communiceren van openbare service-informatie, inclusief aankondigingen voor openbare locaties of voor informatieve uitzendingen zoals verkeer, weer, gebeurtenisinformatie en planningen. Deze use case is niet bedoeld voor journalistische of nieuwsinhoud.
- Vertaling en lokalisatie: voor gebruik in vertaaltoepassingen voor het vertalen van gesprekken in verschillende talen of het vertalen van audiomedia.
- Virtual Assistant of Chatbot: Een fictieve merk- of karakterstem maken voor slimme assistenten in of voor virtuele webassistenten, apparaten, auto's, huisapparaten, speelgoed, beheer van IoT-apparaten, navigatiesystemen, het lezen van persoonlijke berichten, virtuele assistenten of scenario's voor klantenservice.
Bedoeld gebruik voor persoonlijke stem
De persoonlijke spraak-API (zie Persoonlijke stem voor meer informatie) is beschikbaar in de preview-versie van Beperkte toegang. Alleen klanten die voldoen aan geschiktheidscriteria voor beperkte toegang, kunnen de persoonlijke spraak-API integreren met hun toepassingen. Deze in aanmerking komende klanten mogen alleen persoonlijke stemmen gebruiken voor de volgende gebruiksvoorbeelden:
- Toepassingen: Voor gebruik in toepassingen waarbij spraakuitvoer wordt beperkt en gedefinieerd door klanten, en waarbij de stem door de gebruiker gegenereerde of geopende inhoud niet leest. Spraakmodelgebruik moet binnen de toepassing blijven en uitvoer mag niet kunnen worden gepubliceerd of deelbaar zijn vanuit de toepassing. Enkele voorbeelden van toepassingen die aan deze beschrijving voldoen, zijn spraakassistenten in slimme apparaten en het aanpassen van een tekenstem in gaming.
- Media, films en tv: Om te nasynchroniseren voor films, tv, video en audio voor entertainmentdoeleinden, waarbij klanten de volledige controle houden over het creëren van, de toegang tot en het gebruik van de spraakmodellen en hun output.
- Zakelijke inhoud: om audio- en video-inhoud te maken voor bedrijfsscenario's om productinformatie, marketingmateriaal, zakelijke promotie-inhoud en interne bedrijfscommunicatie te communiceren.
- Speciaal gebruik, gebundeld met videoomzetting: stemmen synthetiseren voor elke spreker in een video. Klanten kunnen audio-inhoud met lipsynchronisatie ook bewerken en genereren in doeltalen. Klanten hoeven in dit scenario geen aanvullende audiotoestemming in te dienen bij Microsoft voor video-inhoud, maar klanten moeten wel de exclusieve controle behouden over de creatie, toegang tot en het gebruik van de stemmodellen en hun resultaten.
Alle andere toepassingen van aangepaste neurale spraak, waaronder Custom Neural Voice Pro, Custom Neural Voice Lite en persoonlijke stem, zijn verboden. Daarnaast is aangepaste neurale spraak een beperkte toegangsservice en registratie is vereist voor toegang tot deze service. Raadpleeg Functies voor beperkte toegang voor Foundry Tools voor meer informatie over het beleid voor beperkte toegang van Microsoft. Bepaalde functies zijn alleen beschikbaar voor Microsoft beheerde klanten en partners, en alleen voor bepaalde gebruiksvoorbeelden die zijn goedgekeurd door Microsoft op het moment van registratie.
Vooraf gemaakte neurale spraak kan ook worden gebruikt voor de bovenstaande aangepaste neurale spraakgebruiksscenario's, evenals aanvullende gebruiksvoorbeelden die door klanten zijn geselecteerd en consistent zijn met het beleid Azure Acceptabel gebruik en de Code van gedrag voor Azure Spraaktekst naar spraak. Er is geen registratie of goedkeuring vereist voor aanvullende gebruiksvoorbeelden voor vooraf gedefinieerde neurale spraak die voldoen aan alle toepasselijke voorwaarden.
Beoogde gebruiksvoorbeelden voor videoomzetting
Videoomzetting kan worden gebruikt voor films, tv en andere visuals (waaronder maar niet beperkt tot video of animatie) en audiotoepassingen, waarbij klanten de enige controle houden over het maken, openen en gebruiken van de spraakmodellen en hun uitvoer. Persoonlijke spraak- en lipsynchronisatie zijn onderworpen aan het Framework voor beperkte toegang en in aanmerking komende klanten kunnen deze mogelijkheden gebruiken met videovertaling. Hier volgen de goedgekeurde gebruiksvoorbeelden voor de vertaalservice voor video:
- Education & learning: Audio vertalen in educatieve visuals, online cursussen, trainingsmodules, simulatiegebaseerde training of rondleidingsvisuals voor meertalige cursisten.
- Media: Entertainment: Om audio te vertalen in films, films, tv-programma's, documentaires, videogames, miniseries, shortplay en AR/VR-inhoud voor wereldwijde doelgroepen, zorgen voor naadloze verhalen in verschillende talen.
- Media: Marketing: Audio vertalen in promotievisuals, productdemo's, advertenties en huisstijlcampagnes om te resoneren met internationale markten en culturen.
- Zelfgeschreven Inhoud: Audio vertalen in vlogs, korte visuele elementen, influencerinhoud, reisgidsen, promotievideo's, visuals voor sociale media en culturele hoogtepunten, waardoor ze aantrekkelijk en toegankelijk worden.
- Bedrijfstraining en -communicatie: audio vertalen in interne communicatievisuals, voorbereidingsmateriaal voor werknemers, compliancetraining en wereldwijde bedrijfsaankondigingen voor internationale teams.
- E-commerce en productdemonstraties: audio vertalen in visuals voor het uitpakken van producten, zelfstudies, aanbevelingen van klanten en uitlegvisuals om tegemoet te komen aan internationale klanten.
- Openbare dienst en informatieve aankondigingen: audio vertalen in visuals voor publiek bewustzijn, evenementenschema's, veiligheidsaankondigingen en overheidsinformatie-uitzendingen voor meertalige toegankelijkheid.
- Toegankelijkheidsfuncties: de toegankelijkheid van video-inhoud uitbreiden via meertalige audio en ondertitels.
- Nieuws en journalistische inhoud: audio vertalen in nieuwssegmenten, interviews, persberichten en nieuwsrapporten voor diverse taalkundige doelgroepen. Klanten die nieuwsbronnen willen vertalen, hebben extra beoordeling nodig.
Bedoeld voor aangepaste tekst-naar-spraak-avatar en vooraf samengestelde tekst naar spraak-avatar
Hier volgen de goedgekeurde gebruiksvoorbeelden voor aangepaste tekst-naar-spraak-avatar:
- Virtual Assistant of Chatbot: Om virtuele assistenten, virtuele metgezellen, virtuele verkoopassistenten te maken of voor klantenservicetoepassingen.
- Inhoudsgeneratie voor bedrijfscontexten: voor gebruik om productinformatie, marketingmateriaal, zakelijke promotie-inhoud en interne bedrijfscommunicatie te communiceren. Voorbeelden zijn karakteravatars of digitale replica's van een bedrijfsleider om een merk te promoten.
- Educatief of interactief leren: Om een fictieve merk- of karakter-avatar te maken voor het presenteren van educatieve materialen, online leren, interactieve lesplannen, simulatieleer of begeleide museumrondleidingen.
- Media: Entertainment: Om updates te presenteren, kennis te delen, interactieve media of pratende hoofdvideo's te maken voor entertainmentdoeleinden zoals video's, gaming en augmented of virtual reality.
- Toegankelijkheidsfuncties: voor gebruik om communicatie door mensen met spraakproblemen mogelijk te maken.
- Zelfauteur inhoud: een avatar maken voor het lezen van inhoud die is geschreven door het avatartalent.
- Openbare dienst en informatieve aankondigingen: om een fictief merk of karakterafbeelding te maken voor het communiceren van openbare service-informatie, inclusief aankondigingen voor openbare locaties of voor informatieve uitzendingen zoals verkeer, weer, gebeurtenisinformatie en planningen. Deze use case is niet bedoeld voor journalistische of nieuwsinhoud.
- Vertaling en lokalisatie: voor gebruik in vertaaltoepassingen voor het vertalen van gesprekken in verschillende talen of het vertalen van audiomedia in video-indeling.
Alle andere toepassingen van aangepaste tekst naar spraak-avatar zijn verboden. Daarnaast is aangepaste tekst naar spraak avatar een beperkte toegangsservice en registratie is vereist voor toegang tot deze functie. Ga naar aka.ms/limitedaccesscogservices voor meer informatie over het beleid voor beperkte toegang van Microsoft. Bepaalde functies zijn alleen beschikbaar voor Microsoft beheerde klanten en partners, en alleen voor bepaalde gebruiksvoorbeelden die zijn goedgekeurd door Microsoft op het moment van registratie.
Vooraf gemaakte tekst naar spraak-avatar kan ook worden gebruikt voor de bovenstaande aangepaste avatargebruiksvoorbeelden, evenals aanvullende gebruiksvoorbeelden die door klanten zijn geselecteerd en consistent zijn met Azure Beleid voor acceptabel gebruik en de Code van gedrag voor Azure Spraaktekst naar spraak. Er is geen registratie of goedkeuring vereist voor aanvullende gebruiksvoorbeelden voor vooraf samengestelde tekst naar spraak-avatar die voldoen aan alle toepasselijke voorwaarden.
Overwegingen bij het kiezen van use cases
We moedigen klanten aan om tekst te gebruiken voor spraakfuncties in hun innovatieve oplossingen of toepassingen. Alle tekst-naar-spraakfuncties moeten voldoen aan het beleid Azure Acceptabel gebruik en de Code van gedrag voor Azure Spraaktekst naar spraak. Daarnaast kunnen aangepaste neurale spraak en aangepaste tekst naar spraak-avatars alleen worden gebruikt voor de gebruiksvoorbeelden die zijn goedgekeurd via het registratieformulier voor beperkte toegang. Hier volgen enkele overwegingen bij het kiezen van een use-case voor een functie voor tekst-naar-spraak:
- Zorg voor uitlijning van use-case: zorg ervoor dat het beoogde gebruik van tekst-naar-spraakfuncties overeenkomt met de mogelijkheden en het beoogde doel van de functie tekst naar spraak.
- Verantwoorde AI-overwegingen: prioriteit geven aan verantwoorde AI-praktijken door het maken van misleidende of schadelijke inhoud te voorkomen. Houd zich aan privacy, gegevensbescherming en wettelijke voorschriften bij het gebruik van tekst-naar-spraakfuncties.
- Voorbeeld van de gedragscode: Microsoft heeft een gedragscode vastgesteld die bepaalde toepassingen van alle tekst-naar-spraakfuncties verbiedt. Zorg ervoor dat de gedragscode wordt nageleefd wanneer u een use-case voor tekst-naar-spraakservices selecteert.
- Oefen redactionele controle: Overweeg zorgvuldig om synthetische stemmen te gebruiken met inhoud die geen goede redactionele controle heeft, omdat synthetische stemmen menselijk lijken en het effect van onjuiste of misleidende inhoud kunnen versterken.
- Openbaarmaking: Maak de synthetische aard van stemmen, afbeeldingen en/of video's bekend aan gebruikers, zodat gebruikers niet misleid of beetgenomen worden en anderen niet voor de gek kunnen houden door te laten geloven dat ze met een echte persoon communiceren.
- Overwegingen voor juridische en regelgeving: organisaties moeten potentiële specifieke wettelijke en wettelijke verplichtingen evalueren bij het gebruik van Foundry Tools en oplossingen, die mogelijk niet geschikt zijn voor gebruik in elke branche of scenario. Bovendien zijn Foundry Tools of oplossingen niet ontworpen voor en kunnen niet worden gebruikt op manieren die verboden zijn in toepasselijke servicevoorwaarden en relevante gedragscodes.
Door aan deze overwegingen te houden, kunnen gebruikers op verantwoorde wijze gebruikmaken van zowel vooraf gebouwde als aangepaste neurale spraak.
Beperkingen
De beperkingen van tekst-naar-spraak moeten worden overwogen op het snijpunt van technologie en de menselijke, sociale en organisatiefactoren die van invloed zijn op het gebruik en de impact ervan. Hoewel tekst-naar-spraak geavanceerde spraaksynthesemogelijkheden biedt, zijn er bepaalde beperkingen waarmee u rekening moet houden bij het implementeren ervan op verantwoorde wijze om potentiële fouten te minimaliseren.
Technische beperkingen, operationele factoren en reikwijdtes
Technische beperkingen om rekening mee te houden bij het gebruik van tekst naar spraak, zijn onder andere de nauwkeurigheid van uitspraak en intonatie. Hoewel tekst-naar-spraak is ontworpen om natuurlijke spraak te genereren, kan het moeite hebben met bepaalde woorden, namen of ongebruikelijke uitdrukkingen. Gebruikers moeten zich ervan bewust zijn dat er gevallen kunnen zijn waarbij het systeem verkeerd aankondigt of woorden onjuist benadrukt, met name bij het omgaan met niche- of domeinspecifieke woordenlijst.
Het is belangrijk om te weten dat bepaalde populaties mogelijk negatiever worden beïnvloed door deze technische beperkingen. Personen met gehoorproblemen die sterk afhankelijk zijn van gesynthetiseerde spraak, kunnen bijvoorbeeld problemen ondervinden bij het begrijpen van onduidelijke of vervormde spraakuitvoer. Op dezelfde manier kunnen gebruikers met cognitieve of taalgerelateerde beperkingen het moeilijk vinden om spraak te begrijpen met onnatuurlijke intonatie of verkeerd aangekondigde woorden.
- Vooraf samengestelde neurale stem
- Aangepaste neurale spraak
- Vooraf samengestelde tekst naar spraak-avatar
- Aangepaste tekst naar spraak-avatar
- Videovertaling
- Taalkundige beperkingen: Hoewel we trainingsgegevens zorgvuldig cureren en voorbereiden om vooroordelen te minimaliseren, met name met betrekking tot geslacht, etniciteit of regionale accenten, en terwijl tekst-naar-spraak meerdere talen en accenten ondersteunt, kunnen er variaties zijn in de kwaliteit en beschikbaarheid van stemmen in verschillende talen. Klanten moeten zich bewust zijn van mogelijke beperkingen in uitspraaknauwkeurigheid, intonatie en taalkundige nuances die specifiek zijn voor bepaalde talen of dialecten.
- Context en emotie: tekst-naar-spraak kan beperkingen hebben bij het nauwkeurig overbrengen van contextuele informatie en emoties. Klanten moeten rekening houden met het onvermogen van het systeem om de emotionele nuances of subtiele aanwijzingen in de invoertekst te begrijpen. Overwegingen moeten worden gemaakt om extra context te bieden of andere methoden te gebruiken om emoties effectief over te brengen.
- Beschikbaarheid: Microsoft geeft klanten een kennisgeving van 12 maanden voordat ze vooraf samengestelde neurale stemmen uit onze catalogus verwijderen, tenzij beveiligings-, juridische of systeemprestatieoverwegingen een versnelde verwijdering vereisen. Dit is niet van toepassing op previews.
Elke toepassing is verschillend en ons basismodel komt mogelijk niet overeen met uw context of bestrijkt alle scenario's die vereist zijn voor uw use-case. We raden ontwikkelaars aan om de kwaliteit van tekst naar synthetische spraak en video grondig te evalueren met echte gegevens die uw gebruiksscenario weerspiegelen, waaronder testen met gebruikers uit verschillende demografische groepen en met verschillende spraakkenmerken. Bekijk de sectie Kwaliteit van het getrainde stemmodel voor de beste werkwijzen voor het bouwen van hoogwaardige stemmodellen.
Naast het garanderen van prestaties, is het belangrijk om na te denken over het minimaliseren van risico's van stereotyperingen en uitsluiting die kunnen voortvloeien uit synthetische stemmen en avatars. Als u bijvoorbeeld een aangepaste neurale stem maakt voor een slimme spraakassistent, moet u zorgvuldig overwegen welke stem geschikt is om te maken en diverse perspectieven te zoeken van personen op verschillende achtergronden. Bij het bouwen en evalueren van uw systeem zoekt u altijd diverse input.
Overwegingen met betrekking tot redelijkheid
Bij Microsoft streven we ernaar om iedereen op de planeet meer te laten doen. Een essentieel onderdeel van dit doel is het creëren van technologieën en producten die eerlijk en inclusief zijn. Fairness is een multidimensionaal, sociaal technisch onderwerp en heeft invloed op veel verschillende aspecten van onze productontwikkeling. Meer informatie over de benadering van Microsoft voor eerlijkheid hier.
Een belangrijke dimensie die u moet overwegen bij het gebruik van AI-systemen, inclusief tekst-naar-spraak, is hoe goed het systeem presteert voor verschillende groepen personen. Onderzoek heeft aangetoond dat zonder bewuste inspanningen gericht op het verbeteren van de prestaties voor alle groepen, AI-systemen verschillende prestatieniveaus kunnen vertonen voor verschillende demografische factoren, zoals ras, etniciteit, geslacht en leeftijd.
Als onderdeel van onze evaluatie van Azure AI-tekst naar spraak hebben we een analyse uitgevoerd om mogelijke schade aan de redelijkheid te beoordelen. We hebben de prestaties van het systeem in verschillende demografische groepen onderzocht, gericht op het identificeren van eventuele verschillen of verschillen die mogelijk van invloed zijn op de billijkheid.
In sommige gevallen kunnen er resterende prestatieverschillen zijn. Het is belangrijk te weten dat deze verschillen het doel kunnen overschrijden en dat we actief werken aan het aanpakken en minimaliseren van mogelijke vooroordelen of prestatieproblemen, zorgvuldig rekening houden met de demografische groep van de actor en verschillende perspectieven zoeken vanuit verschillende achtergronden.
Wat betreft vertegenwoordigingsschade, zoals stereotyperende, denigrerende of uitgewiste resultaten, erkennen we de risico's die deze problemen met zich meebrengen. Hoewel ons evaluatieproces is gericht op het beperken van dergelijke risico's, raden we gebruikers aan om hun specifieke use cases zorgvuldig te overwegen en waar nodig aanvullende oplossingen te implementeren. Het hebben van een mens in het proces kan een extra laag toezicht bieden om mogelijke vooroordelen of onbedoelde gevolgen aan te pakken. Het gebruik van bloklijsten of acceptatielijsten kan ook helpen ervoor te zorgen dat de gesynthetiseerde spraak overeenkomt met de gewenste standaarden en schadelijke of ongepaste inhoud vermijdt.
We streven ernaar onze fairness-evaluaties voortdurend te verbeteren om meer inzicht te krijgen in de prestaties van het systeem in verschillende demografische groepen en mogelijke problemen met betrekking tot redelijkheid. Het evaluatieproces is gaande en we werken actief aan de verbetering van de billijkheid en inclusiviteit, en beperken eventuele geïdentificeerde verschillen. We begrijpen het belang van het aanpakken van redelijkheidsoverwegingen en streven ernaar om ervoor te zorgen dat tekst in spraak betrouwbare en rechtvaardige gesynthetiseerde spraakuitvoer levert.
Houd er rekening mee dat deze informatie aangeeft wat we tot nu toe weten over fairness-evaluaties, en we blijven gewijd aan het verfijnen van onze evaluatiemethoden en het aanpakken van eventuele problemen die zich kunnen voordoen.
Systeemprestaties
De prestaties van de tekst naar spraaksysteem verwijzen naar hoe nauwkeurig en natuurlijk geschreven tekst kan worden omgezet in gesynthetiseerde spraak. Dit wordt gemeten met behulp van verschillende metrische gegevens om de kwaliteit en effectiviteit van de gegenereerde audio-uitvoer te evalueren. Enkele algemene metrische gegevens over prestaties die worden gebruikt, zijn:
- Mean opinion score (MOS): een beoordelingssysteem waarbij rechters een score bieden die de algehele kwaliteit van gesynthetiseerde spraak en avatarvideo vertegenwoordigt. Een hogere MOS geeft een betere kwaliteit aan.
- MOS-kloof: het verschil tussen de MOS-score van menselijke opnamen en de gegenereerde audiosporen/video's. Een kleinere MOS Gap duidt op een grotere gelijkenis met menselijke spraak/menselijke gelijkenis.
- Similarity MOS (SMOS):meet de gelijkenis van de gegenereerde audiosporen/video's aan de menselijke opnamen. Een hogere SMOS geeft een betere gelijkenis aan.
- Begrijpelijkheid: het percentage correct begrijpelijke woorden in gesynthetiseerde spraak.
Zelfs met state-of-the-art modellen kunnen AI-systemen zoals tekst-naar-spraak fouten veroorzaken. Het systeem kan bijvoorbeeld gesynthetiseerde spraak produceren met subtiele onnatuurlijke intonaties of uitspraakfouten, wat leidt tot een minder dan ideale gebruikerservaring, of het systeem kan tekst verkeerd interpreteren of moeite hebben met ongebruikelijke taalkundige constructies, wat resulteert in onnatuurlijke of onleesbare spraak.
Aanbevolen procedures voor het verbeteren van systeemprestaties
Om systeemprestaties te verbeteren en systeemgedrag aan te passen in tekst naar spraak, zijn er verschillende aanbevolen procedures die kunnen worden gevolgd. Deze procedures omvatten het aanpassen van verschillende onderdelen en parameters om de compromissen te optimaliseren en te voldoen aan specifieke use-casevereisten. Het is echter belangrijk om rekening te houden met de mogelijke impact op verschillende populaties om billijkheid en inclusiviteit te garanderen.
- Vooraf samengestelde neurale stem
- Aangepaste neurale spraak
- Vooraf samengestelde tekst naar spraak-avatar
- Aangepaste tekst naar spraak-avatar
- Videovertaling
Het gebruik van SSML (Speech Synthesis Markup Language) wordt beschouwd als een best practice om de kwaliteit van de spraakuitvoer te verbeteren. Met SSML kunnen gebruikers meer controle uitoefenen over gesynthetiseerde spraak, waardoor de uitspraak, intonatie, nadruk en andere prosodice functies kunnen worden aangepast. Door SSML-tags in de tekst op te nemen, kunnen gebruikers pauzes toevoegen, spraaksnelheid aanpassen, fonetische uitspraak opgeven en de toonhoogte en het volume regelen, onder andere parameters. Dit niveau van fijnregeling helpt bij het creëren van meer natuurlijke en expressieve spraak, waardoor de tekst-naar-spraak-uitvoer menselijker en aantrekkelijker klinkt. Alle SSML-markeringen kunnen rechtstreeks aan de API worden doorgegeven. We bieden ook een online tool, Audio Content Creation, waarmee klanten kunnen afstemmen met behulp van een intuïtieve gebruikersinterface.
Als uw gebruiksgeval gespecialiseerde terminologie of domeinspecifieke inhoud omvat, kunt u overwegen de functie voor aangepast lexicon te gebruiken om het vermogen van het systeem om domeinspecifieke termen of woordgroepen nauwkeurig te communiceren en over te brengen te verbeteren.
Evaluatie van tekst naar spraak
Evaluatiemethoden
Enkele veelgebruikte metrische gegevens voor het evalueren van tekst naar algemene spraaksysteemprestaties zijn:
- Mean opinion score (MOS)-verschil met menselijke opname: meestal gebruikt om de kwaliteit van het tekst-naar-spraak stemmodel te vergelijken met een menselijke opname. De kwaliteit van een spraakmodel dat is gemaakt door aangepaste neurale stem, vergeleken met die van een opname door een mens, wordt verwacht dichtbij te zijn, met een verschil van niet meer dan 0,5 in de MOS-score.
- Voor aangepaste neurale spraak kunt u ook SMOS (Similarity MOS) gebruiken om te meten hoe vergelijkbaar de aangepaste spraakgeluiden zijn vergeleken met de oorspronkelijke menselijke opnamen. Met SMOS-studies worden rechters gevraagd om naar een set gekoppelde audionummers te luisteren, één die wordt gegenereerd met behulp van de aangepaste stem, de andere van de oorspronkelijke menselijke opnamen in de trainingsgegevens, en beoordelen of de twee audiosporen in elk paar door dezelfde persoon worden gesproken, met behulp van een vijfpuntschaal (1 het laagste, 5 de hoogste). De gemiddelde score wordt gerapporteerd als de SMOS-score. Wij raden aan dat een goede aangepaste neurale stem een SMOS zou moeten hebben die hoger is dan 4.0.
- Naast het meten van natuurlijkheid met MOS en SMOS, kunt u ook de begrijpelijkheid van het spraakmodel beoordelen door de nauwkeurigheid van de uitspraak van de gegenereerde spraak te controleren. Dit wordt gedaan door rechters te laten luisteren naar een reeks testvoorbeelden, om te bepalen of ze de betekenis kunnen begrijpen en eventuele woorden aan te geven die onleesbaar waren voor hen. De leesbaarheid wordt berekend met behulp van het percentage van de correct begrijpelijke woorden onder het totale aantal geteste woorden (dat wil zeggen het aantal begrijpelijke woorden/het totale aantal geteste woorden * 100%). Normaal gesproken moet een bruikbare tekst-naar-spraak engine een score van > 98% behalen om begrijpelijk te zijn.
Evaluatieresultaten
Tekst-naar-spraak technologie levert consistent hoogwaardige, natuurlijk klinkende spraak, die voldoet aan de vereisten van diverse branches en domeinen. Onze evaluaties omvatten uitgebreide tests van de trainings- en testgegevens van het systeem, om ervoor te zorgen dat het de beoogde toepassingen en operationele factoren vertegenwoordigt die in praktijkscenario's worden aangetroffen, evenals testvoorbeelden van gesynthetiseerde spraakuitvoer.
De evaluatieresultaten hebben invloed gehad op beslissingen over de beperkingen in het ontwerp van het systeem, zoals de maximale casegrootte en de minimale hoeveelheid vereiste trainingsgegevens. Door de prestaties van het systeem in verschillende gegevenssets, instellingen en parameters te analyseren, zijn de juiste beperkingen ingesteld om het gedrag, de betrouwbaarheid en de veiligheid van het systeem te optimaliseren.
Hoewel de evaluatie betrekking heeft op een breed scala aan gebruiksvoorbeelden, is het belangrijk om te weten dat de resultaten in zekere mate kunnen worden generaliseerbaar voor gebruiksvoorbeelden die niet rechtstreeks deel uitmaken van de evaluatie. De robuustheid en prestaties van het systeem bieden vertrouwen in de mogelijkheid om verschillende scenario's af te handelen, waaronder scenario's die mogelijk niet expliciet zijn getest.
Hier volgen enkele aanbevolen tests en scorebereiken op basis van onze ervaring:
| Meting | Definitie | Hoe deze wordt berekend | Aanbevolen tekengrootte | Aanbevolen score |
|---|---|---|---|---|
| MOS | Gemiddelde meningsscore van de kwaliteit van de audionummers | Gemiddeld van de beoordelingsscores van elke rechter voor elke audio | > 30 gegenereerde audiosporen | > 4.0 (normaal gesproken is de MOS van de menselijke opname hoger dan 4,5) |
| MOS-kloof | Het MOS-scoreverschil tussen menselijke opnamen en de gegenereerde audionummers | De MOS-score op de menselijke opnamen min de MOS-score op de gegenereerde audiotracks. | > 10 menselijke opnamen, > 30 gegenereerde audiotracks, > 20 rechters bij elke audio | < 0.5 |
| SMOS | De gelijkenis van de gegenereerde audiosporen aan de menselijke opnamen | Gemiddelde van de waarderingsscores van het gelijkenisniveau op elk paar audionummers | > 40 paren, > 20 rechters op elk paar | > 4.0, > 3.5 (secundaire taal) |
| Verstaanbaarheid | De uitspraaknauwkeurigheid van de gegenereerde spraak op woordniveau | Percentage van de correct begrijpelijke woorden onder het totale aantal geteste woorden | > 60 gegenereerde audionummers, > 10 rechters op elk geluid | > 98% |
Tekst naar spraak evalueren en integreren voor uw gebruik
Hieronder zijn enkele aanbevolen werkwijzen om u te helpen tekst-naar-spraakfuncties op verantwoorde wijze in uw gebruiksscenario's te integreren.
Openbaar maken wanneer de stem synthetisch is
Het onthullen dat een stem computergestuurd is, minimaliseert niet alleen het risico op negatieve gevolgen van misleiding, maar verhoogt ook het vertrouwen in de organisatie die de stem levert. Meer informatie over het vrijgeven van gegevens.
Microsoft vereist dat haar klanten de synthetische aard van tekst-naar-spraakstemmen aan gebruikers openbaar maken.
- Zorg ervoor dat u voldoende informatie verstrekt aan het publiek, vooral wanneer u de stem van een bekende persoon gebruikt. Mensen beoordelen informatie gedeeltelijk op basis van de persoon die het levert, of ze dat nu bewust of onbewust doen. Een openbaarmaking kan bijvoorbeeld aan het begin van een uitzending verbaal worden gedeeld. Ga naar openbaarmakingspatronen voor meer informatie.
- Overweeg de juiste openbaarmaking aan ouders of andere partijen met gebruiksvoorbeelden die zijn ontworpen voor of kunnen worden gebruikt in situaties waarin minderjarigen en kinderen betrokken zijn. Als uw use case bedoeld is voor minderjarigen of kinderen, moet u ervoor zorgen dat uw openbaarmaking duidelijk en transparant is, zodat ouders of wettelijke voogden de rol van synthetische media kunnen begrijpen en een weloverwogen beslissing kunnen nemen namens minderjarigen of kinderen over het gebruik van de ervaring.
Openbaar maken wanneer de avatarvideo synthetische is
Het onthullen dat een sprekende avatarvideo computergestuurd is, minimaliseert niet alleen het risico op schadelijke resultaten van misleiding, maar verhoogt ook het vertrouwen in de organisatie die de video levert. Meer informatie over het vrijgeven van gegevens.
Microsoft vereist dat haar klanten de synthetische aard van tekst-naar-spraak avatars openbaar maken voor hun gebruikers.
- Zorg ervoor dat u voldoende openbaarmaking biedt aan doelgroepen, met name wanneer u de afbeelding (en stem) van een bekende persoon gebruikt. Mensen beoordelen informatie gedeeltelijk op basis van de persoon die het levert, of ze dat nu bewust of onbewust doen. Er kan bijvoorbeeld een openbaarmaking worden gedaan met een watermerk, zoals 'De stem en afbeelding in deze video zijn AI gegenereerd', in tekst of verbaal gedeeld aan het begin van een video. Ga voor meer informatie naar openbaarmakingspatronen.
- Overweeg de juiste openbaarmaking aan ouders of andere partijen met gebruiksvoorbeelden die zijn ontworpen voor of kunnen worden gebruikt in situaties waarin minderjarigen en kinderen betrokken zijn. Als uw use case bedoeld is voor minderjarigen of kinderen, moet u ervoor zorgen dat uw openbaarmaking duidelijk en transparant is, zodat ouders of wettelijke voogden de rol van synthetische media kunnen begrijpen en een weloverwogen beslissing kunnen nemen namens minderjarigen of kinderen over het gebruik van de ervaring.
De juiste spraaktypen voor uw scenario selecteren
Houd zorgvuldig rekening met de context van gebruik en de mogelijke schade die samenhangt met het gebruik van tekst naar spraakstemmen of avatars. Synthetische stemmen van hoge kwaliteit zijn bijvoorbeeld mogelijk niet geschikt in scenario's met een hoog risico, zoals voor persoonlijke berichten, financiële transacties of complexe situaties waarvoor menselijke aanpassing of empathie is vereist.
Gebruikers kunnen ook verschillende verwachtingen hebben voor spraaktypen en avatarexpressies of gebaren, afhankelijk van de context. Wanneer u bijvoorbeeld luistert naar gevoelig nieuws dat wordt gelezen door een synthetische stem, geven sommige gebruikers de voorkeur aan een meer empathische en mensachtige toon, terwijl anderen de voorkeur geven aan een neutrale stem. U kunt uw toepassing testen om meer inzicht te krijgen in gebruikersvoorkeuren.
Wees transparant over mogelijkheden en beperkingen
Gebruikers hebben waarschijnlijk hogere verwachtingen bij interactie met synthetische spraakagenten met hoge kwaliteit. Wanneer systeemmogelijkheden niet aan deze verwachtingen voldoen, kan vertrouwen leiden tot onaangename of zelfs schadelijke ervaringen.
Optionele menselijke ondersteuning bieden
In dubbelzinnige, transactionele scenario's (bijvoorbeeld een callcenter), vertrouwen gebruikers er niet altijd op dat een computeragent hun aanvragen adequaat beantwoordt. In deze situaties kan menselijke steun nodig zijn, ongeacht de realistische kwaliteit van de stem of de mogelijkheid van het systeem.
Overwegingen voor stemprofessionals
Wanneer klanten samenwerken met stemkunstenaars om aangepaste neurale spraak te maken, zijn de onderstaande richtlijnen van toepassing.
- Stemtalent moeten controle hebben over hun stemmodel (hoe en waar het wordt gebruikt) en moeten worden gecompenseerd voor het gebruik ervan. Microsoft vereist dat klanten van aangepaste neurale spraak expliciete schriftelijke toestemming krijgen van spraaktalent om een synthetische stem te maken en ervoor te zorgen dat de overeenkomst van de klant met elke persoon de duur, het gebruik en eventuele inhoudsbeperkingen overweegt. Als u een synthetische stem van een bekende persoon maakt, moet u een manier bieden voor het stemtalent om de inhoud van de uitvoer die u wilt genereren met het spraakmodel te bewerken of goed te keuren.
- Sommige stemtalent zijn zich mogelijk niet bewust van potentieel kwaadwillend gebruik van technologie en moeten worden geïnformeerd door systeemeigenaren over de mogelijkheden van de technologie. Microsoft vereist dat klanten Microsofts Disclosure voor stem- en avatartalent delen met stemtalent rechtstreeks of via de gemachtigde vertegenwoordiger van het stemtalent om te beschrijven hoe synthetische stemmen worden ontwikkeld en functioneren in combinatie met tekst-naar-spraakdiensten.
Overwegingen betreffende talent voor avatars
Wanneer klanten werken met avatartalent om aangepaste avatars te maken, zijn de onderstaande richtlijnen van toepassing.
- Avatartalent moeten controle hebben over hun avatarmodel (hoe en waar het wordt gebruikt) en moeten worden gecompenseerd voor het gebruik ervan. Microsoft vereist dat aangepaste avatarklanten expliciet schriftelijke toestemming krijgen van hun avatartalent om een synthetische tekst naar spraak-avatar te maken en ervoor te zorgen dat de overeenkomst van de klant met elke persoon de duur, het gebruik en eventuele inhoudsbeperkingen overweegt. Als u een aangepaste avatar van een bekende persoon maakt, moet u een manier bieden voor het avatartalent om de inhoud van de uitvoer die u wilt genereren met het spraakmodel te bewerken of goed te keuren.
- Sommige avatartalent zijn zich mogelijk niet bewust van potentieel kwaadwillend gebruik van technologie en moeten worden geïnformeerd door systeemeigenaren over de mogelijkheden van de technologie. Microsoft vereist dat klanten het Disclosure for voice and avatar talent van Microsoft rechtstreeks met het avatar-talent of via de geautoriseerde vertegenwoordiger van het avatartalent delen om te beschrijven hoe synthetische avatarvideo wordt ontwikkeld en werkt in combinatie met tekst-naar-spraakdiensten.
Overwegingen voor mensen met spraakstoornissen
Bij het werken met individuen met spraakstoornissen om synthetische spraaktechnologie te maken of te implementeren, zijn de volgende richtlijnen van toepassing.
Richtlijnen bieden voor contracten met talent in toegankelijkheidsscenario's
Klanten moeten richtlijnen ontwikkelen voor het opzetten van contracten met personen die synthetische stemmen gebruiken voor hulp bij het spreken. Klanten moeten overwegen om in hun contracten met personen de duur van gebruik, eigendomsoverdracht en/of licentiecriteria op te geven, procedures voor het verwijderen van het spraakmodel en het voorkomen van onbevoegde toegang.
Hou rekening met inconsistenties in spraakpatronen
Voor personen met spraakstoornissen die hun eigen spraaklettertypen opnemen, kunnen inconsistenties in hun spraakpatroon (slurring of onvermogen om bepaalde woorden uit te spreken) het opnameproces bemoeilijken. In deze gevallen moeten synthetische spraaktechnologie en opnamesessies worden ontworpen met de juiste accommodaties die door de klant worden bepaald (bijvoorbeeld pauzes of extra opnamesessies bieden).
Wijziging in de loop van de tijd toestaan
Personen met spraakstoornissen willen hun synthetische stem mogelijk bijwerken om veranderingen te weerspiegelen als gevolg van veroudering of andere factoren. Personen kunnen ook stijlvoorkeuren hebben die na verloop van tijd veranderen en mogelijk wijzigingen aanbrengen in toonhoogte, accent of andere stemkenmerken.
Meer informatie over verantwoorde AI
- Microsoft AI-principes
- Microsoft middelen voor verantwoordelijke AI
- Microsoft Azure Cursussen voor verantwoorde AI