Uw professionele spraakmodel trainen

In dit artikel leert u hoe u een professionele stem kunt afstemmen via de Microsoft Foundry-portal.

Belangrijk

Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. Nadat uw spraakmodel is getraind in een ondersteunde regio, kunt u indien nodig het professionele spraakmodel copy naar een Microsoft Foundry-resource in een andere regio. Zie de voetnoten in de speech-servicetabel voor meer informatie.

De duur van de training varieert, afhankelijk van de hoeveelheid gegevens die u gebruikt. Het kost gemiddeld ongeveer 10 uur computingtijd om een professionele stem af te stemmen. Met een Microsoft Foundry Standard-resource (S0) kunt u vier stemmen tegelijk trainen. Als u de limiet bereikt, wacht u totdat ten minste één van uw spraakmodellen klaar is met trainen en probeert u het opnieuw.

Opmerking

Hoewel het totale aantal benodigde uren per trainingsmethode varieert, geldt dezelfde eenheidsprijs voor elk. Zie de prijsinformatie voor aangepaste neurale training voor meer informatie.

Een trainingsmethode kiezen

Nadat u uw gegevensbestanden hebt gevalideerd, gebruikt u deze om uw aangepaste spraakmodel te bouwen. Wanneer u een aangepaste stem maakt, kunt u ervoor kiezen om deze te trainen met een van de volgende methoden:

  • Neurale - HD Voice: Maak een HD-stem in dezelfde taal als uw trainingsgegevens. Azure neurale HD-stemmen zijn gebaseerd op LLM, geoptimaliseerd voor dynamische gesprekken. Hier vindt u meer informatie over neurale HD-stemmen.

  • Neurale: Maak een stem aan in dezelfde taal als uw trainingsgegevens.

  • Neurale- meertalige: Maak een stem die meerdere talen spreekt met behulp van de trainingsgegevens voor één taal. Met de en-US primaire trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US, de-DE, zh-CN enzovoort.

    De primaire taal van de trainingsgegevens en de secundaire talen moet zijn in de talen die worden ondersteund voor meertalige spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de secundaire talen.

  • Neurale - meerdere stijlen: Maak een aangepaste stem die in meerdere stijlen en emoties spreekt, zonder nieuwe trainingsgegevens toe te voegen. Meerdere stijlstemmen zijn handig voor videogamepersonages, conversatiechatbots, audioboeken, contentlezers en meer.

    Als u een stem met meerdere stijlen wilt maken, moet u een set algemene trainingsgegevens voorbereiden, ten minste 300 utterances. Selecteer een of meer van de vooraf ingestelde doelstijlen voor spreken. U kunt ook meerdere aangepaste stijlen maken door stijlvoorbeelden, van ten minste 100 utterances per stijl, als extra trainingsgegevens voor dezelfde stem op te geven. De ondersteunde vooraf ingestelde stijlen variëren afhankelijk van verschillende talen. Bekijk beschikbare vooraf ingestelde stijlen in verschillende talen.

  • Neurale taaloverschrijding: creëer een stem die een andere taal spreekt dan de oorspronkelijke trainingsgegevens. Met de zh-CN trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US.

    De taal van de trainingsgegevens en de doeltaal moet beide een van de talen zijn die worden ondersteund voor taaloverschrijdende spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de doeltaal, maar uw testscript moet in de doeltaal zijn.

De taal van de trainingsgegevens moet een van de talen zijn die worden ondersteund voor aangepaste spraak, taaloverschrijdende of meerdere stijltrainingen.

Uw aangepaste spraakmodel trainen

Als u een aangepaste stem wilt maken in Microsoft Foundry-portal, volgt u deze stappen voor een van de volgende methoden:

In de nieuwe Microsoft Foundry-portal gebruikt de wizard Een model verfijnen één vervolgkeuzelijst Trainingsmethode die alle varianten omvat. Deze stappen gaan verder vanuit de wizard die u hebt geopend in Een professionele stem maken nadat u trainingsgegevens hebt geüpload in het deelvenster Trainingsgegevens .

  1. Selecteer in het deelvenster Trainingsgegevens de trainingsmethode die overeenkomt met uw scenario. De opties zijn Neural - HD, Neural - Default, Neural - multilingual, Neural - multi style en Neural - cross lingual. Zie Een trainingsmethode kiezen voor meer informatie over elke methode.
  2. Selecteer de versie van het trainingsrecept. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. In sommige gevallen kunt u een eerdere versie kiezen om de trainingstijd te verminderen.
  3. Bevestig de modeltaal.
  4. Selecteer in de vervolgkeuzelijst Dataset selecteren de dataset die u hebt geüpload.
  5. Selecteer Volgende.
  6. Controleer in het deelvenster Controle de instellingen en ga akkoord met de gebruiksvoorwaarden.
  7. Selecteer Trainen om het model te trainen.

Het trainingsproces bewaken

In de tabel Model trainen wordt een nieuwe vermelding die overeenkomt met het nieuwe model weergegeven. De status weerspiegelt het proces van het converteren van uw gegevens naar een spraakmodel, zoals beschreven in deze tabel:

Staat Betekenis
Verwerking Uw spraakmodel wordt gemaakt.
Geslaagd Uw spraakmodel is gemaakt en kan worden geïmplementeerd.
Mislukt Uw spraakmodel is mislukt tijdens de training. De oorzaak van de fout kan bijvoorbeeld onzichtbare gegevensproblemen of netwerkproblemen zijn.
Geannuleerd De training voor uw spraakmodel is geannuleerd.

Terwijl de modelstatus Verwerking is, kunt u het model selecteren en vervolgens Training annuleren selecteren om de training te annuleren. Er worden geen kosten in rekening gebracht voor deze geannuleerde training.

Schermopname die laat zien hoe u de training voor een model annuleert.

Nadat u klaar bent met het trainen van het model, kunt u de modeldetails bekijken en uw spraakmodel testen.

De naam van uw model wijzigen

U moet uw model klonen om de naam ervan te wijzigen. U kunt de naam van het model niet rechtstreeks wijzigen.

  1. Selecteer het model.
  2. Selecteer Kloonmodel om een kloon van het model te maken met een nieuwe naam in het huidige project.
  3. Voer de nieuwe naam in het venster Stemmodel klonen in.
  4. Selecteer Verzenden. De tekst Neural wordt automatisch toegevoegd als achtervoegsel aan de naam van uw nieuwe model.

Uw spraakmodel testen

Nadat uw spraakmodel is gebouwd, kunt u de gegenereerde voorbeeldaudiobestanden gebruiken om het te testen voordat u het implementeert.

Opmerking

Neurale - meertalige en Neurale - HD Voice bieden geen ondersteuning voor dit type testen.

De kwaliteit van de stem is afhankelijk van veel factoren, zoals:

  • De grootte van de trainingsgegevens.
  • De kwaliteit van de opname.
  • De nauwkeurigheid van het transcriptbestand.
  • Hoe goed de opgenomen stem in de trainingsgegevens overeenkomt met de persoonlijkheid van de ontworpen stem voor uw beoogde gebruiksscenario.

Selecteer DefaultTests onder Testen om naar de voorbeeldaudiobestanden te luisteren. De standaardtestvoorbeelden bevatten 100 voorbeeldaudiobestanden die automatisch tijdens de training worden gegenereerd om u te helpen het model te testen. Naast deze 100 audiobestanden die standaard worden geleverd, worden uw eigen testscriptuitingen ook toegevoegd aan defaulttestset . Deze toevoeging bestaat uit maximaal 100 uitingen. Er worden geen kosten in rekening gebracht voor het testen met DefaultTests.

Als u uw eigen testscripts wilt uploaden om uw model verder te testen, selecteert u Testscripts toevoegen om uw eigen testscript te uploaden.

Voordat u een testscript uploadt, controleert u de vereisten voor testscripts. Er worden kosten in rekening gebracht voor het extra testen met de batchsynthese op basis van het aantal factureerbare tekens. Zie Azure Speech in Foundry Tools-prijzen.

Selecteer onder Testscripts toevoegen de optie Bladeren naar een bestand om uw eigen script te selecteren en selecteer Vervolgens Toevoegen om het te uploaden.

Vereisten voor testscripts

Het testscript moet een .txt-bestand zijn dat kleiner is dan 1 MB. Ondersteunde coderingsindelingen zijn ANSI/ASCII, UTF-8, UTF-8-BOM, UTF-16-LE of UTF-16-BE.

In tegenstelling tot de transcriptiebestanden van de training moet het testscript de uitings-id uitsluiten. Dit is de bestandsnaam van elke utterance. Anders worden deze id's uitgesproken.

Hier volgt een voorbeeldset utterances in één .txt-bestand :

This is the waistline, and it's falling.
We have trouble scoring.
It was Janet Maslin.

Elke alinea van de uiting resulteert in een afzonderlijke audio. Als u alle zinnen in één audio wilt combineren, maakt u ze één alinea.

Opmerking

De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts.

Engine-versie voor uw spraakmodel bijwerken

Azure tekst-naar-spraakengines worden van tijd tot tijd bijgewerkt om het nieuwste taalmodel vast te leggen waarmee de uitspraak van de taal wordt gedefinieerd. Nadat u uw stem hebt getraind, kunt u uw stem toepassen op het nieuwe taalmodel door bij te werken naar de nieuwste engineversie.

  • Wanneer er een nieuwe engine beschikbaar is, wordt u gevraagd uw neurale spraakmodel bij te werken.
  • Ga naar de pagina met modeldetails en volg de instructies op het scherm om de nieuwste engine te installeren.
  • Selecteer de nieuwste engine later te installeren om uw model bij te werken naar de nieuwste engineversie. Er worden geen kosten in rekening gebracht voor de engine-update. De vorige versies worden nog steeds bewaard.
  • U kunt alle engineversies voor het model controleren in de engineversielijst of een versie verwijderen als u deze niet meer nodig hebt.

De bijgewerkte versie wordt automatisch als standaard ingesteld. Maar u kunt de standaardversie wijzigen door een versie te selecteren in de vervolgkeuzelijst en Als standaard instellen te selecteren.

Als u elke engineversie van uw spraakmodel wilt testen, kunt u een versie in de lijst selecteren en vervolgens DefaultTests selecteren onder Testen om naar de voorbeeldaudiobestanden te luisteren. Als u uw eigen testscripts wilt uploaden om uw huidige engineversie verder te testen, controleert u eerst of de versie als standaard is ingesteld en volgt u de stappen in Uw spraakmodel testen.

Als u de engine bijwerkt, wordt er zonder extra kosten een nieuwe versie van het model gemaakt. Nadat u de engineversie voor uw spraakmodel hebt bijgewerkt, moet u de nieuwe versie implementeren om een nieuw eindpunt te maken. U kunt alleen de standaardversie implementeren.

Nadat u een nieuw eindpunt hebt gemaakt, moet u het verkeer overdragen naar het nieuwe eindpunt in uw product.

Zie Kenmerken en beperkingen voor het gebruik van aangepaste spraak voor meer informatie over de mogelijkheden en limieten van deze functie en de best practice om de kwaliteit van uw model te verbeteren.

Uw spraakmodel kopiëren naar een ander project

Opmerking

In deze context verwijst 'project' naar een verfijntaak in plaats van een Microsoft Foundry-project.

Na de training kunt u uw spraakmodel kopiëren naar een ander project voor dezelfde regio of een andere regio.

U kunt bijvoorbeeld een professioneel spraakmodel kopiëren dat in de ene regio is getraind, naar een project voor een andere regio. Professionele afstemming van stem is momenteel alleen beschikbaar in sommige regio's.

Uw aangepaste spraakmodel kopiëren naar een ander project:

  1. Selecteer op het tabblad Model trainen een spraakmodel dat u wilt kopiëren en selecteer vervolgens Kopiëren naar project.
  2. Selecteer het abonnement, de doelregio, de Connected AI Service-resource (Foundry-resource) en de doeltaak voor finetuning waar u het model wilt kopiëren.
  3. Selecteer Kopiëren om het model te kopiëren.
  4. Selecteer Model weergeven onder het meldingsbericht van de succesvolle kopieeractie.

Navigeer naar het project waar u het model hebt gekopieerd om de modelkopie te implementeren.

Volgende stappen

In dit artikel leert u hoe u een professionele stem kunt afstemmen via de Speech Studio-portal.

Belangrijk

Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. Nadat uw spraakmodel is getraind in een ondersteunde regio, kunt u het indien nodig kopiëren naar een Foundry-resource voor Spraak in een andere regio. Zie de voetnoten in de speech-servicetabel voor meer informatie.

De duur van de training varieert, afhankelijk van de hoeveelheid gegevens die u gebruikt. Het kost gemiddeld ongeveer 10 uur computingtijd om een professionele stem af te stemmen. Gebruikers van een Standard-abonnement (S0) kunnen vier stemmen tegelijk trainen. Als u de limiet bereikt, wacht u totdat ten minste één van uw spraakmodellen klaar is met trainen en probeert u het opnieuw.

Opmerking

Hoewel het totale aantal benodigde uren per trainingsmethode varieert, geldt dezelfde eenheidsprijs voor elk. Zie de prijsinformatie voor aangepaste neurale training voor meer informatie.

Een trainingsmethode kiezen

Nadat u uw gegevensbestanden hebt gevalideerd, gebruikt u deze om uw aangepaste spraakmodel te bouwen. Wanneer u een aangepaste stem maakt, kunt u ervoor kiezen om deze te trainen met een van de volgende methoden:

  • Neurale - HD Voice: Maak een HD-stem in dezelfde taal als uw trainingsgegevens. Azure neurale HD-stemmen zijn gebaseerd op LLM, geoptimaliseerd voor dynamische gesprekken. Hier vindt u meer informatie over neurale HD-stemmen.

  • Neurale: Maak een stem aan in dezelfde taal als uw trainingsgegevens.

  • Neurale- meertalige: Maak een stem die meerdere talen spreekt met behulp van de trainingsgegevens voor één taal. Met de en-US primaire trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US, de-DE, zh-CN enzovoort.

    De primaire taal van de trainingsgegevens en de secundaire talen moet zijn in de talen die worden ondersteund voor meertalige spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de secundaire talen.

  • Neurale - meerdere stijlen: Maak een aangepaste stem die in meerdere stijlen en emoties spreekt, zonder nieuwe trainingsgegevens toe te voegen. Meerdere stijlstemmen zijn handig voor videogamepersonages, conversatiechatbots, audioboeken, contentlezers en meer.

    Als u een stem met meerdere stijlen wilt maken, moet u een set algemene trainingsgegevens voorbereiden, ten minste 300 utterances. Selecteer een of meer van de vooraf ingestelde doelstijlen voor spreken. U kunt ook meerdere aangepaste stijlen maken door stijlvoorbeelden, van ten minste 100 utterances per stijl, als extra trainingsgegevens voor dezelfde stem op te geven. De ondersteunde vooraf ingestelde stijlen variëren afhankelijk van verschillende talen. Bekijk beschikbare vooraf ingestelde stijlen in verschillende talen.

  • Neurale taaloverschrijding: creëer een stem die een andere taal spreekt dan de oorspronkelijke trainingsgegevens. Met de zh-CN trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US.

    De taal van de trainingsgegevens en de doeltaal moet beide een van de talen zijn die worden ondersteund voor taaloverschrijdende spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de doeltaal, maar uw testscript moet in de doeltaal zijn.

De taal van de trainingsgegevens moet een van de talen zijn die worden ondersteund voor aangepaste spraak, taaloverschrijdende of meerdere stijltrainingen.

Uw aangepaste spraakmodel trainen

Als u een aangepaste stem wilt maken in Speech Studio, volgt u deze stappen voor een van de volgende methoden:

  1. Meld u aan bij Speech Studio.

  2. Selecteer Aangepaste stem><Uw projectnaam>>Model trainen>Een nieuw model trainen.

  3. Selecteer Neural - HD Voice als trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual, Neural - multi-style of Neural - meertalige.

    Schermopname van het selecteren van neurale HD-spraaktraining.

    Opmerking

    HD-stemmen zijn alleen beschikbaar in regio's die ondersteuning bieden voor high performance type. Zie de kolom Custom Voice High Performance Endpoint in het tabblad Tekst naar spraak van de tabel Regio's voor meer informatie over regio's waar het eindpunttype High Performance wordt ondersteund.

  4. Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.

    U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet. Bij voorkeur selecteert u trainingsgegevens die worden verwerkt als contextueel.

  5. Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.

  6. Selecteer Volgende.

  7. Elk trainingsproces genereert automatisch 100 primaire taalvoorbeeldaudiobestanden om u te helpen bij het testen van het model met een standaardscript.

Desgewenst kunt u ook Mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om de standaardstijl zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.

  1. Voer een naam in om het model te identificeren. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen. Het Dragon HD-achtervoegsel wordt automatisch toegevoegd aan uw modelnaam.
  2. Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
  3. Selecteer Volgende.
  4. Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
  5. Selecteer Verzenden om het model te trainen.

Het trainingsproces bewaken

In de tabel Model trainen wordt een nieuwe vermelding die overeenkomt met het nieuwe model weergegeven. De status weerspiegelt het proces van het converteren van uw gegevens naar een spraakmodel, zoals beschreven in deze tabel:

Staat Betekenis
Verwerking Uw spraakmodel wordt gemaakt.
Geslaagd Uw spraakmodel is gemaakt en kan worden geïmplementeerd.
Mislukt Uw spraakmodel is mislukt tijdens de training. De oorzaak van de fout kan bijvoorbeeld onzichtbare gegevensproblemen of netwerkproblemen zijn.
Geannuleerd De training voor uw spraakmodel is geannuleerd.

Terwijl de modelstatus Verwerking is, kunt u Training annuleren selecteren om uw spraakmodel te annuleren. Er worden geen kosten in rekening gebracht voor deze geannuleerde training.

Schermopname die laat zien hoe u de training voor een model annuleert.

Nadat u klaar bent met het trainen van het model, kunt u de modeldetails bekijken en uw spraakmodel testen.

U kunt het hulpprogramma Voor het maken van audio-inhoud in Speech Studio gebruiken om audio te maken en uw geïmplementeerde stem af te stemmen. Indien van toepassing op uw stem, kunt u een van de stijlen selecteren.

De naam van uw model wijzigen

  1. Als u de naam van het model dat u hebt gemaakt, wilt wijzigen, selecteert u Kloonmodel om een kloon van het model te maken met een nieuwe naam in het huidige project.

    Schermopname van het selecteren van de knop Model klonen.

  2. Voer de nieuwe naam in het Spraakmodel klonen-venster in en selecteer Verzenden. De tekst Neural wordt automatisch toegevoegd als achtervoegsel aan de naam van uw nieuwe model.

    Schermopname van het klonen van een model met een nieuwe naam.

Uw spraakmodel testen

Nadat uw spraakmodel is gebouwd, kunt u de gegenereerde voorbeeldaudiobestanden gebruiken om het te testen voordat u het implementeert.

Opmerking

Neurale - meertalige en Neurale - HD Voice bieden geen ondersteuning voor dit type testen.

De kwaliteit van de stem is afhankelijk van veel factoren, zoals:

  • De grootte van de trainingsgegevens.
  • De kwaliteit van de opname.
  • De nauwkeurigheid van het transcriptbestand.
  • Hoe goed de opgenomen stem in de trainingsgegevens overeenkomt met de persoonlijkheid van de ontworpen stem voor uw beoogde gebruiksscenario.

Selecteer DefaultTests onder Testen om naar de voorbeeldaudiobestanden te luisteren. De standaardtestvoorbeelden bevatten 100 voorbeeldaudiobestanden die automatisch tijdens de training worden gegenereerd om u te helpen het model te testen. Naast deze 100 audiobestanden die standaard worden geleverd, worden uw eigen testscriptuitingen ook toegevoegd aan defaulttestset . Deze toevoeging bestaat uit maximaal 100 uitingen. Er worden geen kosten in rekening gebracht voor het testen met DefaultTests.

Schermopname van het selecteren van DefaultTests onder Testen.

Als u uw eigen testscripts wilt uploaden om uw model verder te testen, selecteert u Testscripts toevoegen om uw eigen testscript te uploaden.

Schermopname van het toevoegen van modeltestscripts.

Voordat u een testscript uploadt, controleert u de vereisten voor testscripts. Er worden kosten in rekening gebracht voor het extra testen met de batchsynthese op basis van het aantal factureerbare tekens. Zie Azure Speech in Foundry Tools-prijzen.

Selecteer onder Testscripts toevoegen de optie Bladeren naar een bestand om uw eigen script te selecteren en selecteer Vervolgens Toevoegen om het te uploaden.

Schermopname van het uploaden van modeltestscripts.

Vereisten voor testscripts

Het testscript moet een .txt-bestand zijn dat kleiner is dan 1 MB. Ondersteunde coderingsindelingen zijn ANSI/ASCII, UTF-8, UTF-8-BOM, UTF-16-LE of UTF-16-BE.

In tegenstelling tot de transcriptiebestanden van de training moet het testscript de uitings-id uitsluiten. Dit is de bestandsnaam van elke utterance. Anders worden deze id's uitgesproken.

Hier volgt een voorbeeldset utterances in één .txt-bestand :

This is the waistline, and it's falling.
We have trouble scoring.
It was Janet Maslin.

Elke alinea van de uiting resulteert in een afzonderlijke audio. Als u alle zinnen in één audio wilt combineren, maakt u ze één alinea.

Opmerking

De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts.

Engine-versie voor uw spraakmodel bijwerken

Azure tekst-naar-spraakengines worden van tijd tot tijd bijgewerkt om het nieuwste taalmodel vast te leggen waarmee de uitspraak van de taal wordt gedefinieerd. Nadat u uw stem hebt getraind, kunt u uw stem toepassen op het nieuwe taalmodel door bij te werken naar de nieuwste engineversie.

  1. Wanneer er een nieuwe engine beschikbaar is, wordt u gevraagd uw neurale spraakmodel bij te werken.

    Schermopname van het weergeven van het updatebericht van de engine.

  2. Ga naar de pagina met modeldetails en volg de instructies op het scherm om de nieuwste engine te installeren.

    Schermopname van het volgen van instructies op het scherm voor het installeren van de nieuwe engine.

    Selecteer de nieuwste engine later te installeren om uw model bij te werken naar de nieuwste engineversie.

    Schermopname van het selecteren van de knop De meest recente engine installeren om de engine bij te werken.

    Er worden geen kosten in rekening gebracht voor de engine-update. De vorige versies worden nog steeds bewaard.

  3. U kunt alle engineversies voor het model controleren in de engineversielijst of een versie verwijderen als u deze niet meer nodig hebt.

    Schermopname van het weergeven van de vervolgkeuzelijst Engine-versie.

    De bijgewerkte versie wordt automatisch als standaard ingesteld. Maar u kunt de standaardversie wijzigen door een versie te selecteren in de vervolgkeuzelijst en Als standaard instellen te selecteren.

    Schermopname die laat zien hoe u een versie als standaard instelt.

Als u elke engineversie van uw spraakmodel wilt testen, kunt u een versie in de lijst selecteren en vervolgens DefaultTests selecteren onder Testen om naar de voorbeeldaudiobestanden te luisteren. Als u uw eigen testscripts wilt uploaden om uw huidige engineversie verder te testen, controleert u eerst of de versie als standaard is ingesteld en volgt u de stappen in Uw spraakmodel testen.

Als u de engine bijwerkt, wordt er zonder extra kosten een nieuwe versie van het model gemaakt. Nadat u de engineversie voor uw spraakmodel hebt bijgewerkt, moet u de nieuwe versie implementeren om een nieuw eindpunt te maken. U kunt alleen de standaardversie implementeren.

Schermopname van het opnieuw implementeren van een nieuwe versie van uw spraakmodel.

Nadat u een nieuw eindpunt hebt gemaakt, moet u het verkeer overdragen naar het nieuwe eindpunt in uw product.

Zie Kenmerken en beperkingen voor het gebruik van aangepaste spraak voor meer informatie over de mogelijkheden en limieten van deze functie en de best practice om de kwaliteit van uw model te verbeteren.

Uw spraakmodel kopiëren naar een ander project

U kunt uw spraakmodel kopiëren naar een ander project voor dezelfde regio of een andere regio. U kunt bijvoorbeeld een neuraal spraakmodel kopiëren dat in de ene regio is getraind, naar een project voor een andere regio.

Opmerking

Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. U kunt een neuraal spraakmodel van die regio's naar andere regio's kopiëren. Zie voor meer informatie de regio's voor aangepaste spraak.

Uw aangepaste spraakmodel kopiëren naar een ander project:

  1. Selecteer op het tabblad Model trainen een spraakmodel dat u wilt kopiëren en selecteer vervolgens Kopiëren naar project.

    Schermopname van de optie Kopiëren naar project.

  2. Selecteer de Subscription, Region, Speech-resource en Project waar u het model wilt kopiëren. U moet een spraakresource en -project in de doelregio hebben, anders moet u ze eerst maken.

    Schermopname van het dialoogvenster om het stemmodel te kopiëren.

  3. Selecteer Verzenden om het model te kopiëren.

  4. Selecteer Model weergeven onder het meldingsbericht van de succesvolle kopieeractie.

Navigeer naar het project waar u het model hebt gekopieerd om de modelkopie te implementeren.

Volgende stappen

In dit artikel leert u hoe u een professionele stem kunt afstemmen via de aangepaste spraak-API.

Belangrijk

Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. Nadat uw spraakmodel is getraind in een ondersteunde regio, kunt u het indien nodig kopiëren naar een Foundry-resource in een andere regio. Zie de voetnoten in de speech-servicetabel voor meer informatie.

De duur van de training varieert, afhankelijk van de hoeveelheid gegevens die u gebruikt. Het kost gemiddeld ongeveer 10 uur computingtijd om een professionele stem af te stemmen. Gebruikers van een Standard-abonnement (S0) kunnen vier stemmen tegelijk trainen. Als u de limiet bereikt, wacht u totdat ten minste één van uw spraakmodellen klaar is met trainen en probeert u het opnieuw.

Opmerking

Hoewel het totale aantal benodigde uren per trainingsmethode varieert, geldt dezelfde eenheidsprijs voor elk. Zie de prijsinformatie voor aangepaste neurale training voor meer informatie.

Een trainingsmethode kiezen

Nadat u uw gegevensbestanden hebt gevalideerd, gebruikt u deze om uw aangepaste spraakmodel te bouwen. Wanneer u een aangepaste stem maakt, kunt u ervoor kiezen om deze te trainen met een van de volgende methoden:

  • Neurale - HD Voice: Maak een HD-stem in dezelfde taal als uw trainingsgegevens. Azure neurale HD-stemmen zijn gebaseerd op LLM, geoptimaliseerd voor dynamische gesprekken. Hier vindt u meer informatie over neurale HD-stemmen.

  • Neurale: Maak een stem aan in dezelfde taal als uw trainingsgegevens.

  • Neurale - meerdere stijlen: Maak een aangepaste stem die in meerdere stijlen en emoties spreekt, zonder nieuwe trainingsgegevens toe te voegen. Meerdere stijlstemmen zijn handig voor videogamepersonages, conversatiechatbots, audioboeken, contentlezers en meer.

    Als u een stem met meerdere stijlen wilt maken, moet u een set algemene trainingsgegevens voorbereiden, ten minste 300 utterances. Selecteer een of meer van de vooraf ingestelde doelstijlen voor spreken. U kunt ook meerdere aangepaste stijlen maken door stijlvoorbeelden, van ten minste 100 utterances per stijl, als extra trainingsgegevens voor dezelfde stem op te geven. De ondersteunde vooraf ingestelde stijlen variëren afhankelijk van verschillende talen. Bekijk beschikbare vooraf ingestelde stijlen in verschillende talen.

  • Neurale taaloverschrijding: creëer een stem die een andere taal spreekt dan de oorspronkelijke trainingsgegevens. Met de fr-FR trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US.

    De taal van de trainingsgegevens en de doeltaal moet beide een van de talen zijn die worden ondersteund voor taaloverschrijdende spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de doeltaal, maar uw testscript moet in de doeltaal zijn.

De taal van de trainingsgegevens moet een van de talen zijn die worden ondersteund voor aangepaste spraak, taaloverschrijdende of meerdere stijlen of HD-spraaktraining.

Een spraakmodel maken

Als u een HD-stem wilt maken, gebruikt u de Models_Create bewerking van de aangepaste spraak-API. Bouw de aanvraagbody volgens de volgende instructies:

  • Stel de vereiste projectId eigenschap in. Zie Een project maken.
  • Stel de vereiste consentId eigenschap in. Zie Stemtalenttoestemming toevoegen.
  • Stel de vereiste trainingSetId eigenschap in. Zie Een trainingsset maken.
  • Stel de vereiste recepteigenschap kind in op HD voor neurale spraaktraining. Het recepttype geeft de trainingsmethode aan en kan later niet meer worden gewijzigd. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual of Neural - multi-style. Zie Tweetalige training voor meer informatie over tweetalige training en verschillen tussen landinstellingen.
  • Stel de vereiste voiceName eigenschap in. De naam van de stem voegt automatisch het Dragon HD-achtervoegsel toe en kan later niet meer worden gewijzigd. Kies zorgvuldig een naam. De SDK- en SSML-invoer gebruiken de spraaknaam in uw aanvraag voor spraaksynthese. Alleen letters, cijfers en enkele interpunctietekens zijn toegestaan vóór het specifieke achtervoegsel. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
  • U kunt desgewenst de description eigenschap voor de spraakbeschrijving instellen. De spraakbeschrijving kan later worden gewijzigd.

Maak een HTTP PUT-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Create voorbeeld.

  • Vervang YourResourceKey door uw Spraak-resourcesleutel.
  • Vervang YourResourceName door de naam van uw Speech-resource.
  • Vervang door JessicaModelId een model-id van uw keuze. De hoofdlettergevoelige id wordt gebruikt in de URI van het model en kan later niet meer worden gewijzigd.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
  "voiceName": "Jessica",
  "description": "Jessica HD voice",
  "recipe": {
    "kind": "HD"
  },
  "projectId": "ProjectId",
  "consentId": "JessicaConsentId",
  "trainingSetId": "JessicaTrainingSetId"
} '  "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01"

U ontvangt een antwoordtekst in de volgende indeling:

{
  "id": "JessicaModelId",
  "voiceName": "Jessica:DragonHDLatestNeural",
  "description": "Jessica HD voice",
  "recipe": {
    "kind": "HD",
    "version": "V1.0"
  },
  "projectId": "ProjectId",
  "consentId": "JessicaConsentId",
  "trainingSetId": "JessicaTrainingSetId",
  "locale": "en-US",
  "engineVersion": "2023.07.04.0",
  "status": "NotStarted",
  "createdDateTime": "2023-04-01T05:30:00.000Z",
  "lastActionDateTime": "2023-04-02T10:15:30.000Z"
}

Tweetalige training

Als u het type neurale training selecteert, kunt u een stem trainen om in meerdere talen te spreken. De zh-CN, zh-HK en zh-TW lokalisaties ondersteunen tweetalige training voor de stem om zowel Chinees als Engels te spreken. Afhankelijk van uw trainingsgegevens kan de gesynthetiseerde stem Engels spreken met een Engels accent of Engels met hetzelfde accent als de trainingsgegevens.

Opmerking

Als u wilt dat een stem in de zh-CN landinstelling Engels spreekt met hetzelfde accent als de voorbeeldgegevens, moet u Engelse gegevens uploaden naar een contextuele trainingsset of kiezen Chinese (Mandarin, Simplified), English bilingual wanneer u een project maakt of de zh-CN (English bilingual) landinstelling voor de trainingsetgegevens opgeeft via REST API.

Neem in uw contextuele trainingsset ten minste 100 zinnen of 10 minuten Engelse inhoud op en overschrijd niet de hoeveelheid Chinese inhoud.

In de volgende tabel ziet u de verschillen tussen de locaties.

Locale-instellingen van Speech Studio REST API-landinstellingen Tweetalige ondersteuning
Chinese (Mandarin, Simplified) zh-CN Als uw voorbeeldgegevens Engels bevatten, spreekt de gesynthetiseerde stem Engels met een Engels accent, in plaats van hetzelfde accent als de voorbeeldgegevens, ongeacht de hoeveelheid Engelse gegevens.
Chinese (Mandarin, Simplified), English bilingual zh-CN (English bilingual) Als u wilt dat de gesynthetiseerde stem Engels spreekt met hetzelfde accent als de voorbeeldgegevens, raden we u aan meer dan 10% Engelse gegevens in uw trainingsset op te nemen. Anders is het Engels sprekende accent mogelijk niet ideaal.
Chinese (Cantonese, Simplified) zh-HK Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent.
Chinese (Taiwanese Mandarin, Traditional) zh-TW Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent.

Beschikbare vooraf ingestelde stijlen in verschillende talen

De volgende tabel bevat een overzicht van de verschillende vooraf ingestelde stijlen op basis van verschillende talen.

Spreekstijl Taal (landinstelling)
Boos Engels (Verenigde Staten) (en-US)
Japans (Japan) (ja-JP) 1
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Kalm Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Chat Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Vrolijke Engels (Verenigde Staten) (en-US)
Japans (Japan) (ja-JP) 1
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Ontstemd Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Enthousiast Engels (Verenigde Staten) (en-US)
Angstig Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Vriendelijke Engels (Verenigde Staten) (en-US)
Hoopvol Engels (Verenigde Staten) (en-US)
Triest Engels (Verenigde Staten) (en-US)
Japans (Japan) (ja-JP) 1
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Schreeuwen Engels (Verenigde Staten) (en-US)
Ernstige Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1
Doodsbang Engels (Verenigde Staten) (en-US)
Gebruikersonvriendelijk Engels (Verenigde Staten) (en-US)
fluisteren Engels (Verenigde Staten) (en-US)

1 De neurale stemstijl is beschikbaar in openbare previewversie. Raadpleeg de tabel van Speech-serviceregio's voor de huidige lijst met regio's die stijlen ondersteunen in de publieke preview.


Trainingsstatus ophalen

Als u de trainingsstatus van een spraakmodel wilt ophalen, gebruikt u de Models_Get bewerking van de aangepaste spraak-API. Bouw de aanvraag-URI volgens de volgende instructies:

Maak een HTTP GET-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Get voorbeeld.

  • Vervang YourResourceKey door uw Spraak-resourcesleutel.
  • Vervang YourResourceName door de naam van uw Speech-resource.
  • Vervang JessicaModelId als u in de vorige stap een andere model-id hebt opgegeven.
curl -v -X GET "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01" -H "Ocp-Apim-Subscription-Key: YourResourceKey"

U ontvangt een antwoordtekst in de volgende indeling.

Opmerking

Het recept kind en andere eigenschappen zijn afhankelijk van hoe u de stem hebt getraind. In dit voorbeeld is Default het recepttype bedoeld voor neurale spraaktraining.

{
  "id": "JessicaModelId",
  "voiceName": "Jessica",
  "description": "Jessica voice",
  "recipe": {
    "kind": "Default",
    "version": "V9.0"
  },
  "projectId": "ProjectId",
  "consentId": "JessicaConsentId",
  "trainingSetId": "JessicaTrainingSetId",
  "locale": "en-US",
  "engineVersion": "2023.07.04.0",
  "status": "Succeeded",
  "createdDateTime": "2023-04-01T05:30:00.000Z",
  "lastActionDateTime": "2023-04-02T10:15:30.000Z"
}

Mogelijk moet u enkele minuten wachten voordat de training is voltooid. Uiteindelijk verandert de status in Succeeded of Failed.

Volgende stappen