Wat is aangepaste stem?

Aangepaste spraak is een spraakfunctie voor tekst waarmee u een een-op-een-soort, aangepaste, synthetische stem voor uw toepassingen kunt maken. Met aangepaste spraak kunt u een zeer natuurlijke stem bouwen voor uw merk of personages door menselijke spraakvoorbeelden te bieden als verfijningsgegevens.

Belangrijk

Aangepaste spraaktoegang is beperkt op basis van geschiktheids- en gebruikscriteria. Vraag toegang aan op het intakeformulier.

Met standaardstemmen kan text-to-speech direct gebruikt worden voor elke ondersteunde taal. De standaardstemmen werken goed in de meeste tekst-naar-spraakscenario's als een unieke stem niet vereist is.

Aangepaste spraak is gebaseerd op de neurale tekst-naar-spraaktechnologie en het meertalige, meersprekers-universele model. U kunt synthetische stemmen maken met uiteenlopende spreekstijlen, of die aanpasbaar zijn voor meerdere talen. De realistische en natuurlijke stem van aangepaste spraak kan merken vertegenwoordigen, machines personifyen en gebruikers in staat stellen om met toepassingen te communiceren. Bekijk de ondersteunde talen voor aangepaste spraak.

Hoe werkt het?

Als u een aangepaste stem wilt maken, gebruikt u Speech Studio om de opgenomen audio en bijbehorende scripts te uploaden, het model te trainen en de stem naar een aangepast eindpunt te implementeren.

Het maken van een geweldige aangepaste stem vereist zorgvuldige kwaliteitscontrole in elke stap, van spraakontwerp en gegevensvoorbereiding tot de implementatie van het spraakmodel in uw systeem.

Voordat u aan de slag gaat in Speech Studio, moet u rekening houden met enkele overwegingen:

  • Ontwerp een persona van de stem die uw merk vertegenwoordigt met behulp van een persona-kort document. In dit document worden elementen gedefinieerd, zoals de functies van de stem en het teken achter de stem. Dit helpt bij het maken van een aangepast spraakmodel, waaronder het definiëren van de scripts, het selecteren van uw stemtalent, training en stemafstemming.
  • Selecteer het opnamescript om de gebruikersscenario's voor uw stem weer te geven. U kunt bijvoorbeeld de woordgroepen uit botgesprekken gebruiken als uw opnamescript als u een klantenservicebot maakt. Voeg verschillende zinstypen toe aan uw scripts, waaronder instructies, vragen en uitroeptekens.

Hier volgt een overzicht van de stappen voor het maken van een aangepaste stem in Speech Studio:

  1. Maak een project dat uw gegevens, spraakmodellen, tests en eindpunten bevat. Elk project is specifiek voor een land/regio en taal. Als u meerdere stemmen gaat maken, is het raadzaam om voor elke stem een project te maken.
  2. Stel stemtalent in. Voordat u een professionele stem kunt afstemmen, moet u een opname indienen van de toestemmingsverklaring van het stemtalent. De voice talent statement is een opname van het stemtalent dat een verklaring leest dat ze toestemming geven voor het gebruik van hun spraakgegevens voor professionele stemafstemming.
  3. Bereid de gegevens voor in de juiste indeling. Het is een goed idee om de audio-opnamen vast te leggen in een professionele opnamestudio van hoge kwaliteit om een hoge signaal-naar-ruis-verhouding te bereiken. De kwaliteit van het spraakmodel is sterk afhankelijk van uw verfijningsgegevens. Consistent volume, spreeksnelheid, toonhoogte en consistentie in expressieve manieren van spraak zijn vereist.
  4. Train uw stemmodel. Selecteer ten minste 300 utterances om een aangepaste stem te maken. Er wordt automatisch een reeks gegevenskwaliteitscontroles uitgevoerd wanneer u ze uploadt. Als u spraakmodellen van hoge kwaliteit wilt bouwen, moet u eventuele fouten oplossen en opnieuw verzenden.
  5. Test je stem. Bereid testscripts voor op uw spraakmodel dat de verschillende gebruiksvoorbeelden voor uw apps behandelt. Het is een goed idee om scripts binnen en buiten de trainingsgegevensset te gebruiken, zodat u de kwaliteit breder kunt testen voor verschillende inhoud.
  6. Implementeer en gebruik uw spraakmodel in uw apps.

U kunt uw aangepaste stem afstemmen, aanpassen en gebruiken, net zoals u een standaardstem zou gebruiken. Converteer tekst in realtime naar spraak of genereer audio-inhoud offline met tekstinvoer. U gebruikt de REST API, de Speech SDK of de Speech Studio.

Aanbeveling

Bekijk de codevoorbeelden in de Speech SDK-opslagplaats op GitHub om te zien hoe u aangepaste spraak gebruikt in uw toepassing.

De stijl en de kenmerken van het getrainde spraakmodel zijn afhankelijk van de stijl en de kwaliteit van de opnamen van het stemtalent dat wordt gebruikt voor training. U kunt echter verschillende aanpassingen aanbrengen met behulp van SSML (Speech Synthesis Markup Language) wanneer u de API-aanroepen naar uw spraakmodel uitvoert om synthetische spraak te genereren. SSML is de opmaaktaal die wordt gebruikt om met de tekst-naar-spraakservice te communiceren en tekst om te zetten in audio. De aanpassingen die u kunt aanbrengen zijn wijziging van toonhoogte, snelheid, intonatie en uitspraakcorrectie. Als het spraakmodel is gebouwd met meerdere stijlen, kunt u SSML ook gebruiken om de stijlen te wijzigen.

Volgorde van onderdelen

Aangepaste stem bestaat uit drie belangrijke onderdelen: de tekstanalyse, het neurale akoestische model en de neurale vocoder. Om natuurlijke synthetische spraak te genereren op basis van tekst, wordt tekst eerst ingevoerd in de tekstanalyse, die uitvoer levert in de vorm van een fonetische reeks. Een foneem is een basiseenheid van klank waarmee het ene woord van het andere wordt onderscheiden in een bepaalde taal. Een reeks fonemen bepaalt de uitspraak van de woorden die in de tekst voorkomen.

Vervolgens gaat de fonetische reeks naar het neurale akoestische model om akoestische kenmerken te voorspellen die spraaksignalen definiëren. Akoestische kenmerken zijn onder andere het timbre, de spreekstijl, snelheid, intonaties en stresspatronen. Ten slotte converteert de neurale vocoder de akoestische kenmerken naar hoorbare golven, zodat synthetische spraak wordt gegenereerd.

Stroomdiagram met de onderdelen van aangepaste spraak.

Neurale tekst-naar-spraakmodellen worden getraind met behulp van diepe neurale netwerken op basis van de opnamevoorbeelden van menselijke stemmen. Zie dit Microsoft-blogbericht voor meer informatie. Zie dit Microsoft-blogbericht voor meer informatie over hoe een neurale vocoder wordt getraind.

Verantwoorde AI

Een AI-systeem omvat niet alleen de technologie, maar ook de mensen die het gebruiken, de mensen die worden beïnvloed door het systeem en de omgeving waarin het wordt geïmplementeerd. Lees de transparantienotities voor meer informatie over verantwoord AI-gebruik en -implementatie in uw systemen.

Volgende stappen