In dit artikel leert u hoe u een professionele stem kunt afstemmen via de Microsoft Foundry-portal.
Belangrijk
Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. Nadat uw spraakmodel is getraind in een ondersteunde regio, kunt u indien nodig het professionele spraakmodel copy naar een Microsoft Foundry-resource in een andere regio. Zie de voetnoten in de speech-servicetabel voor meer informatie.
De duur van de training varieert, afhankelijk van de hoeveelheid gegevens die u gebruikt. Het kost gemiddeld ongeveer 10 uur computingtijd om een professionele stem af te stemmen. Met een Microsoft Foundry Standard-resource (S0) kunt u vier stemmen tegelijk trainen. Als u de limiet bereikt, wacht u totdat ten minste één van uw spraakmodellen klaar is met trainen en probeert u het opnieuw.
Een trainingsmethode kiezen
Nadat u uw gegevensbestanden hebt gevalideerd, gebruikt u deze om uw aangepaste spraakmodel te bouwen. Wanneer u een aangepaste stem maakt, kunt u ervoor kiezen om deze te trainen met een van de volgende methoden:
Neurale - HD Voice: Maak een HD-stem in dezelfde taal als uw trainingsgegevens. Azure neurale HD-stemmen zijn gebaseerd op LLM, geoptimaliseerd voor dynamische gesprekken. Hier vindt u meer informatie over neurale HD-stemmen.
Neurale: Maak een stem aan in dezelfde taal als uw trainingsgegevens.
Neurale- meertalige: Maak een stem die meerdere talen spreekt met behulp van de trainingsgegevens voor één taal. Met de en-US primaire trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US, de-DE, zh-CN enzovoort.
De primaire taal van de trainingsgegevens en de secundaire talen moet zijn in de talen die worden ondersteund voor meertalige spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de secundaire talen.
Neurale - meerdere stijlen: Maak een aangepaste stem die in meerdere stijlen en emoties spreekt, zonder nieuwe trainingsgegevens toe te voegen. Meerdere stijlstemmen zijn handig voor videogamepersonages, conversatiechatbots, audioboeken, contentlezers en meer.
Als u een stem met meerdere stijlen wilt maken, moet u een set algemene trainingsgegevens voorbereiden, ten minste 300 utterances. Selecteer een of meer van de vooraf ingestelde doelstijlen voor spreken. U kunt ook meerdere aangepaste stijlen maken door stijlvoorbeelden, van ten minste 100 utterances per stijl, als extra trainingsgegevens voor dezelfde stem op te geven. De ondersteunde vooraf ingestelde stijlen variëren afhankelijk van verschillende talen. Bekijk beschikbare vooraf ingestelde stijlen in verschillende talen.
Neurale taaloverschrijding: creëer een stem die een andere taal spreekt dan de oorspronkelijke trainingsgegevens. Met de zh-CN trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US.
De taal van de trainingsgegevens en de doeltaal moet beide een van de talen zijn die worden ondersteund voor taaloverschrijdende spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de doeltaal, maar uw testscript moet in de doeltaal zijn.
De taal van de trainingsgegevens moet een van de talen zijn die worden ondersteund voor aangepaste spraak, taaloverschrijdende of meerdere stijltrainingen.
Uw aangepaste spraakmodel trainen
Als u een aangepaste stem wilt maken in Microsoft Foundry-portal, volgt u deze stappen voor een van de volgende methoden:
In de nieuwe Microsoft Foundry-portal gebruikt de wizard Een model verfijnen één vervolgkeuzelijst Trainingsmethode die alle varianten omvat. Deze stappen gaan verder vanuit de wizard die u hebt geopend in Een professionele stem maken nadat u trainingsgegevens hebt geüpload in het deelvenster Trainingsgegevens .
- Selecteer in het deelvenster Trainingsgegevens de trainingsmethode die overeenkomt met uw scenario. De opties zijn Neural - HD, Neural - Default, Neural - multilingual, Neural - multi style en Neural - cross lingual. Zie Een trainingsmethode kiezen voor meer informatie over elke methode.
- Selecteer de versie van het trainingsrecept. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. In sommige gevallen kunt u een eerdere versie kiezen om de trainingstijd te verminderen.
- Bevestig de modeltaal.
- Selecteer in de vervolgkeuzelijst Dataset selecteren de dataset die u hebt geüpload.
- Selecteer Volgende.
- Controleer in het deelvenster Controle de instellingen en ga akkoord met de gebruiksvoorwaarden.
- Selecteer Trainen om het model te trainen.
Selecteer in de Microsoft Foundry -portal (klassiek) hieronder een trainingsmethode en volg de bijbehorende stappen.
Meld u aan bij de Microsoft Foundry-portal.
Selecteer Fine-tuning in het linkerdeelvenster en selecteer vervolgens AI Service fine-tuning.
Selecteer de professionele stemafstemmingstaak (op modelnaam) die u hebt gestart, zoals beschreven in het artikel Professionele stem creëren.
Selecteer Train model>+ Train model.
Selecteer Neural - HD als trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual, Neural - multi-style of Neural - meertalige.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Gebruik normaal gesproken de nieuwste versie. Kies in sommige gevallen een eerdere versie om de trainingstijd te verkorten.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Selecteer een testscript en selecteer dan Volgende.
- Elke training genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
- U kunt ook mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
Voer de naam van een Spraakmodel in. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Schakel het selectievakje in om de gebruiksvoorwaarden te accepteren en selecteer vervolgens Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Trainen om het model te trainen.
Meld u aan bij de Microsoft Foundry-portal.
Selecteer Fine-tuning in het linkerdeelvenster en selecteer vervolgens AI Service fine-tuning.
Selecteer de professionele stemafstemmingstaak (op modelnaam) die u hebt gestart, zoals beschreven in het artikel Professionele stem creëren.
Selecteer Train model>+ Train model.
Selecteer Neural als de trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural - cross lingual, Neural - multi style, Neural - meertalige of Neural - HD Voice.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Gebruik normaal gesproken de nieuwste versie. Kies in sommige gevallen een eerdere versie om de trainingstijd te verkorten. Zie Tweetalige training voor meer informatie over tweetalige training en verschillen tussen landinstellingen.
Selecteer Volgende.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Als u de trainingsset niet in de lijst ziet, controleert u de verwerkingsstatus van uw gegevens.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Selecteer een testscript en selecteer dan Volgende.
- Elke training genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
- U kunt ook mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
Voer de naam van een Spraakmodel in. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Schakel het selectievakje in om de gebruiksvoorwaarden te accepteren en selecteer vervolgens Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Trainen om het model te trainen.
Tweetalige training
Als u het type neurale training selecteert, kunt u een stem trainen om in meerdere talen te spreken. De zh-CN, zh-HK en zh-TW lokalisaties ondersteunen tweetalige training voor de stem om zowel Chinees als Engels te spreken. Afhankelijk van uw trainingsgegevens kan de gesynthetiseerde stem Engels spreken met een Engels accent of Engels met hetzelfde accent als de trainingsgegevens.
Opmerking
Als u wilt dat een stem in de zh-CN landinstelling Engels spreekt met hetzelfde accent als de voorbeeldgegevens, moet u Engelse gegevens uploaden naar een contextuele trainingsset of kiezen Chinese (Mandarin, Simplified), English bilingual wanneer u een project maakt of de zh-CN (English bilingual) landinstelling voor de trainingsetgegevens opgeeft via REST API.
Neem in uw contextuele trainingsset ten minste 100 zinnen of 10 minuten Engelse inhoud op en overschrijd niet de hoeveelheid Chinese inhoud.
In de volgende tabel ziet u de verschillen tussen de locaties.
| Locale-instellingen van Speech Studio |
REST API-landinstellingen |
Tweetalige ondersteuning |
Chinese (Mandarin, Simplified) |
zh-CN |
Als uw voorbeeldgegevens Engels bevatten, spreekt de gesynthetiseerde stem Engels met een Engels accent, in plaats van hetzelfde accent als de voorbeeldgegevens, ongeacht de hoeveelheid Engelse gegevens. |
Chinese (Mandarin, Simplified), English bilingual |
zh-CN (English bilingual) |
Als u wilt dat de gesynthetiseerde stem Engels spreekt met hetzelfde accent als de voorbeeldgegevens, raden we u aan meer dan 10% Engelse gegevens in uw trainingsset op te nemen. Anders is het Engels sprekende accent mogelijk niet ideaal. |
Chinese (Cantonese, Simplified) |
zh-HK |
Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent. |
Chinese (Taiwanese Mandarin, Traditional) |
zh-TW |
Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent. |
Meld u aan bij de Microsoft Foundry-portal.
Selecteer Fine-tuning in het linkerdeelvenster en selecteer vervolgens AI Service fine-tuning.
Selecteer de professionele stemafstemmingstaak (op modelnaam) die u hebt gestart, zoals beschreven in het artikel Professionele stem creëren.
Selecteer Train model>+ Train model.
Selecteer Neural - meertalige als trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual, Neural - multi style of Neural - HD Voice.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Normaal gesproken raden we de nieuwste versie aan. In sommige gevallen kunt u een eerdere versie kiezen om de trainingstijd te verminderen.
Selecteer de extra taal die uw stem spreekt. U kunt een of meer secundaire talen voor een spraakmodel selecteren, en de stem spreekt de door u geselecteerde talen volgens de trainingsgegevens.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Selecteer een testscript en selecteer dan Volgende.
- Elke training genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
- U kunt ook mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
Voer de naam van een Spraakmodel in. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Schakel het selectievakje in om de gebruiksvoorwaarden te accepteren en selecteer vervolgens Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Trainen om het model te trainen.
Meld u aan bij de Microsoft Foundry-portal.
Selecteer Fine-tuning in het linkerdeelvenster en selecteer vervolgens AI Service fine-tuning.
Selecteer de professionele stemafstemmingstaak (op modelnaam) die u hebt gestart, zoals beschreven in het artikel Professionele stem creëren.
Selecteer Train model>+ Train model.
Selecteer Neural - meerdere stijlen als de trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual, Neural - meertalig, of Neural - HD Voice.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Normaal gesproken raden we de nieuwste versie aan. In sommige gevallen kunt u een eerdere versie kiezen om de trainingstijd te verminderen.
Selecteer Volgende.
Selecteer een of meer vooraf ingestelde spreekstijlen om te trainen.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer Volgende.
U kunt desgewenst andere aangepaste spreekstijlen toevoegen. Het maximum aantal aangepaste stijlen varieert per taal: English (Verenigde Staten) biedt maximaal 10 aangepaste stijlen, Chinese (Mandarin, Simplified) maximaal vier aangepaste stijlen toestaat en Japanese (Japan) maximaal vijf aangepaste stijlen toestaat.
- Selecteer + Een aangepaste stijl toevoegen en voer een aangepaste stijlnaam van uw keuze in. Deze naam wordt door uw toepassing in het
style-element van Speech Synthesis Markup Language (SSML) gebruikt.
- Selecteer stijlvoorbeelden als trainingsgegevens. Zorg ervoor dat de trainingsgegevens voor aangepaste spreekstijlen afkomstig zijn van dezelfde spreker als de gegevens die worden gebruikt om de standaardstijl te maken.
Selecteer Volgende.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Selecteer een testscript en selecteer dan Volgende.
- Elke training genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
- U kunt ook mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
Voer de naam van een Spraakmodel in. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Schakel het selectievakje in om de gebruiksvoorwaarden te accepteren en selecteer vervolgens Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Trainen om het model te trainen.
Beschikbare vooraf ingestelde stijlen in verschillende talen
De volgende tabel bevat een overzicht van de verschillende vooraf ingestelde stijlen op basis van verschillende talen.
| Spreekstijl |
Taal (landinstelling) |
| Boos |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Kalm |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Chat |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Vrolijke |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Ontstemd |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Enthousiast |
Engels (Verenigde Staten) (en-US) |
| Angstig |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Vriendelijke |
Engels (Verenigde Staten) (en-US) |
| Hoopvol |
Engels (Verenigde Staten) (en-US) |
| Triest |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Schreeuwen |
Engels (Verenigde Staten) (en-US) |
| Ernstige |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Doodsbang |
Engels (Verenigde Staten) (en-US) |
| Gebruikersonvriendelijk |
Engels (Verenigde Staten) (en-US) |
| fluisteren |
Engels (Verenigde Staten) (en-US) |
1 De neurale stemstijl is beschikbaar in openbare previewversie. Raadpleeg de tabel van Speech-serviceregio's voor de huidige lijst met regio's die stijlen ondersteunen in de publieke preview.
Meld u aan bij de Microsoft Foundry-portal.
Selecteer Fine-tuning in het linkerdeelvenster en selecteer vervolgens AI Service fine-tuning.
Selecteer de professionele stemafstemmingstaak (op modelnaam) die u hebt gestart, zoals beschreven in het artikel Professionele stem creëren.
Selecteer Train model>+ Train model.
Selecteer Neural - Cross lingual als de trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - multi-stijl, Neural - meertalig of Neural - HD Voice.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Normaal gesproken raden we de nieuwste versie aan. In sommige gevallen kunt u een eerdere versie kiezen om de trainingstijd te verminderen.
Selecteer de primaire doeltaal die uw stem spreekt. De stem spreekt een andere taal dan uw trainingsgegevens. U kunt slechts één doeltaal voor een spraakmodel selecteren.
Selecteer Volgende.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Selecteer een testscript en selecteer dan Volgende.
- Elke training genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
- U kunt ook mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
Voer de naam van een Spraakmodel in. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Schakel het selectievakje in om de gebruiksvoorwaarden te accepteren en selecteer vervolgens Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Trainen om het model te trainen.
Het trainingsproces bewaken
In de tabel Model trainen wordt een nieuwe vermelding die overeenkomt met het nieuwe model weergegeven. De status weerspiegelt het proces van het converteren van uw gegevens naar een spraakmodel, zoals beschreven in deze tabel:
| Staat |
Betekenis |
| Verwerking |
Uw spraakmodel wordt gemaakt. |
| Geslaagd |
Uw spraakmodel is gemaakt en kan worden geïmplementeerd. |
| Mislukt |
Uw spraakmodel is mislukt tijdens de training. De oorzaak van de fout kan bijvoorbeeld onzichtbare gegevensproblemen of netwerkproblemen zijn. |
| Geannuleerd |
De training voor uw spraakmodel is geannuleerd. |
Terwijl de modelstatus Verwerking is, kunt u het model selecteren en vervolgens Training annuleren selecteren om de training te annuleren. Er worden geen kosten in rekening gebracht voor deze geannuleerde training.
Nadat u klaar bent met het trainen van het model, kunt u de modeldetails bekijken en uw spraakmodel testen.
De naam van uw model wijzigen
U moet uw model klonen om de naam ervan te wijzigen. U kunt de naam van het model niet rechtstreeks wijzigen.
- Selecteer het model.
- Selecteer Kloonmodel om een kloon van het model te maken met een nieuwe naam in het huidige project.
- Voer de nieuwe naam in het venster Stemmodel klonen in.
- Selecteer Verzenden. De tekst Neural wordt automatisch toegevoegd als achtervoegsel aan de naam van uw nieuwe model.
Uw spraakmodel testen
Nadat uw spraakmodel is gebouwd, kunt u de gegenereerde voorbeeldaudiobestanden gebruiken om het te testen voordat u het implementeert.
De kwaliteit van de stem is afhankelijk van veel factoren, zoals:
- De grootte van de trainingsgegevens.
- De kwaliteit van de opname.
- De nauwkeurigheid van het transcriptbestand.
- Hoe goed de opgenomen stem in de trainingsgegevens overeenkomt met de persoonlijkheid van de ontworpen stem voor uw beoogde gebruiksscenario.
Selecteer DefaultTests onder Testen om naar de voorbeeldaudiobestanden te luisteren. De standaardtestvoorbeelden bevatten 100 voorbeeldaudiobestanden die automatisch tijdens de training worden gegenereerd om u te helpen het model te testen. Naast deze 100 audiobestanden die standaard worden geleverd, worden uw eigen testscriptuitingen ook toegevoegd aan defaulttestset . Deze toevoeging bestaat uit maximaal 100 uitingen. Er worden geen kosten in rekening gebracht voor het testen met DefaultTests.
Als u uw eigen testscripts wilt uploaden om uw model verder te testen, selecteert u Testscripts toevoegen om uw eigen testscript te uploaden.
Voordat u een testscript uploadt, controleert u de vereisten voor testscripts. Er worden kosten in rekening gebracht voor het extra testen met de batchsynthese op basis van het aantal factureerbare tekens. Zie Azure Speech in Foundry Tools-prijzen.
Selecteer onder Testscripts toevoegen de optie Bladeren naar een bestand om uw eigen script te selecteren en selecteer Vervolgens Toevoegen om het te uploaden.
Vereisten voor testscripts
Het testscript moet een .txt-bestand zijn dat kleiner is dan 1 MB. Ondersteunde coderingsindelingen zijn ANSI/ASCII, UTF-8, UTF-8-BOM, UTF-16-LE of UTF-16-BE.
In tegenstelling tot de transcriptiebestanden van de training moet het testscript de uitings-id uitsluiten. Dit is de bestandsnaam van elke utterance. Anders worden deze id's uitgesproken.
Hier volgt een voorbeeldset utterances in één .txt-bestand :
This is the waistline, and it's falling.
We have trouble scoring.
It was Janet Maslin.
Elke alinea van de uiting resulteert in een afzonderlijke audio. Als u alle zinnen in één audio wilt combineren, maakt u ze één alinea.
Opmerking
De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts.
Engine-versie voor uw spraakmodel bijwerken
Azure tekst-naar-spraakengines worden van tijd tot tijd bijgewerkt om het nieuwste taalmodel vast te leggen waarmee de uitspraak van de taal wordt gedefinieerd. Nadat u uw stem hebt getraind, kunt u uw stem toepassen op het nieuwe taalmodel door bij te werken naar de nieuwste engineversie.
- Wanneer er een nieuwe engine beschikbaar is, wordt u gevraagd uw neurale spraakmodel bij te werken.
- Ga naar de pagina met modeldetails en volg de instructies op het scherm om de nieuwste engine te installeren.
- Selecteer de nieuwste engine later te installeren om uw model bij te werken naar de nieuwste engineversie. Er worden geen kosten in rekening gebracht voor de engine-update. De vorige versies worden nog steeds bewaard.
- U kunt alle engineversies voor het model controleren in de engineversielijst of een versie verwijderen als u deze niet meer nodig hebt.
De bijgewerkte versie wordt automatisch als standaard ingesteld. Maar u kunt de standaardversie wijzigen door een versie te selecteren in de vervolgkeuzelijst en Als standaard instellen te selecteren.
Als u elke engineversie van uw spraakmodel wilt testen, kunt u een versie in de lijst selecteren en vervolgens DefaultTests selecteren onder Testen om naar de voorbeeldaudiobestanden te luisteren. Als u uw eigen testscripts wilt uploaden om uw huidige engineversie verder te testen, controleert u eerst of de versie als standaard is ingesteld en volgt u de stappen in Uw spraakmodel testen.
Als u de engine bijwerkt, wordt er zonder extra kosten een nieuwe versie van het model gemaakt. Nadat u de engineversie voor uw spraakmodel hebt bijgewerkt, moet u de nieuwe versie implementeren om een nieuw eindpunt te maken. U kunt alleen de standaardversie implementeren.
Nadat u een nieuw eindpunt hebt gemaakt, moet u het verkeer overdragen naar het nieuwe eindpunt in uw product.
Zie Kenmerken en beperkingen voor het gebruik van aangepaste spraak voor meer informatie over de mogelijkheden en limieten van deze functie en de best practice om de kwaliteit van uw model te verbeteren.
Uw spraakmodel kopiëren naar een ander project
Opmerking
In deze context verwijst 'project' naar een verfijntaak in plaats van een Microsoft Foundry-project.
Na de training kunt u uw spraakmodel kopiëren naar een ander project voor dezelfde regio of een andere regio.
U kunt bijvoorbeeld een professioneel spraakmodel kopiëren dat in de ene regio is getraind, naar een project voor een andere regio. Professionele afstemming van stem is momenteel alleen beschikbaar in sommige regio's.
Uw aangepaste spraakmodel kopiëren naar een ander project:
- Selecteer op het tabblad Model trainen een spraakmodel dat u wilt kopiëren en selecteer vervolgens Kopiëren naar project.
- Selecteer het abonnement, de doelregio, de Connected AI Service-resource (Foundry-resource) en de doeltaak voor finetuning waar u het model wilt kopiëren.
- Selecteer Kopiëren om het model te kopiëren.
- Selecteer Model weergeven onder het meldingsbericht van de succesvolle kopieeractie.
Navigeer naar het project waar u het model hebt gekopieerd om de modelkopie te implementeren.
Volgende stappen
In dit artikel leert u hoe u een professionele stem kunt afstemmen via de Speech Studio-portal.
Belangrijk
Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. Nadat uw spraakmodel is getraind in een ondersteunde regio, kunt u het indien nodig kopiëren naar een Foundry-resource voor Spraak in een andere regio. Zie de voetnoten in de speech-servicetabel voor meer informatie.
De duur van de training varieert, afhankelijk van de hoeveelheid gegevens die u gebruikt. Het kost gemiddeld ongeveer 10 uur computingtijd om een professionele stem af te stemmen. Gebruikers van een Standard-abonnement (S0) kunnen vier stemmen tegelijk trainen. Als u de limiet bereikt, wacht u totdat ten minste één van uw spraakmodellen klaar is met trainen en probeert u het opnieuw.
Een trainingsmethode kiezen
Nadat u uw gegevensbestanden hebt gevalideerd, gebruikt u deze om uw aangepaste spraakmodel te bouwen. Wanneer u een aangepaste stem maakt, kunt u ervoor kiezen om deze te trainen met een van de volgende methoden:
Neurale - HD Voice: Maak een HD-stem in dezelfde taal als uw trainingsgegevens. Azure neurale HD-stemmen zijn gebaseerd op LLM, geoptimaliseerd voor dynamische gesprekken. Hier vindt u meer informatie over neurale HD-stemmen.
Neurale: Maak een stem aan in dezelfde taal als uw trainingsgegevens.
Neurale- meertalige: Maak een stem die meerdere talen spreekt met behulp van de trainingsgegevens voor één taal. Met de en-US primaire trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US, de-DE, zh-CN enzovoort.
De primaire taal van de trainingsgegevens en de secundaire talen moet zijn in de talen die worden ondersteund voor meertalige spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de secundaire talen.
Neurale - meerdere stijlen: Maak een aangepaste stem die in meerdere stijlen en emoties spreekt, zonder nieuwe trainingsgegevens toe te voegen. Meerdere stijlstemmen zijn handig voor videogamepersonages, conversatiechatbots, audioboeken, contentlezers en meer.
Als u een stem met meerdere stijlen wilt maken, moet u een set algemene trainingsgegevens voorbereiden, ten minste 300 utterances. Selecteer een of meer van de vooraf ingestelde doelstijlen voor spreken. U kunt ook meerdere aangepaste stijlen maken door stijlvoorbeelden, van ten minste 100 utterances per stijl, als extra trainingsgegevens voor dezelfde stem op te geven. De ondersteunde vooraf ingestelde stijlen variëren afhankelijk van verschillende talen. Bekijk beschikbare vooraf ingestelde stijlen in verschillende talen.
Neurale taaloverschrijding: creëer een stem die een andere taal spreekt dan de oorspronkelijke trainingsgegevens. Met de zh-CN trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US.
De taal van de trainingsgegevens en de doeltaal moet beide een van de talen zijn die worden ondersteund voor taaloverschrijdende spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de doeltaal, maar uw testscript moet in de doeltaal zijn.
De taal van de trainingsgegevens moet een van de talen zijn die worden ondersteund voor aangepaste spraak, taaloverschrijdende of meerdere stijltrainingen.
Uw aangepaste spraakmodel trainen
Als u een aangepaste stem wilt maken in Speech Studio, volgt u deze stappen voor een van de volgende methoden:
Meld u aan bij Speech Studio.
Selecteer Aangepaste stem><Uw projectnaam>>Model trainen>Een nieuw model trainen.
Selecteer Neural - HD Voice als trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual, Neural - multi-style of Neural - meertalige.
Opmerking
HD-stemmen zijn alleen beschikbaar in regio's die ondersteuning bieden voor high performance type. Zie de kolom Custom Voice High Performance Endpoint in het tabblad Tekst naar spraak van de tabel Regio's voor meer informatie over regio's waar het eindpunttype High Performance wordt ondersteund.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Bij voorkeur selecteert u trainingsgegevens die worden verwerkt als contextueel.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Elk trainingsproces genereert automatisch 100 primaire taalvoorbeeldaudiobestanden om u te helpen bij het testen van het model met een standaardscript.
Desgewenst kunt u ook Mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om de standaardstijl zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
- Voer een naam in om het model te identificeren. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen. Het Dragon HD-achtervoegsel wordt automatisch toegevoegd aan uw modelnaam.
- Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
- Selecteer Volgende.
- Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
- Selecteer Verzenden om het model te trainen.
Meld u aan bij Speech Studio.
Selecteer Aangepaste stem><Uw projectnaam>>Model trainen>Een nieuw model trainen.
Selecteer Neural als de trainingsmethode voor uw model en selecteer vervolgens Volgende. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural - cross lingual, Neural - multi style, Neural - meertalige of Neural - HD Voice.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Gebruik normaal gesproken de nieuwste versie. Kies in sommige gevallen een eerdere versie om de trainingstijd te verkorten. Zie Tweetalige training voor meer informatie over tweetalige training en verschillen tussen landinstellingen.
Opmerking
Modelversies V3.0, V7.0 en V8.0 worden op 25 juli 2025 buiten gebruik gesteld. De spraakmodellen die al in deze buiten gebruik gestelde versies zijn gemaakt, worden niet beïnvloed.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Als u de trainingsset niet in de lijst ziet, controleert u de verwerkingsstatus van uw gegevens.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Elk trainingsproces genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
U kunt eventueel ook Mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
Voer een naam in om het model te identificeren. Kies zorgvuldig een naam. De SDK- en SSML-invoer gebruiken de modelnaam als de spraaknaam in uw aanvraag voor spraaksynthese. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Selecteer Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Verzenden om het model te trainen.
Tweetalige training
Als u het type neurale training selecteert, kunt u een stem trainen om in meerdere talen te spreken. De zh-CN, zh-HK en zh-TW lokalisaties ondersteunen tweetalige training voor de stem om zowel Chinees als Engels te spreken. Afhankelijk van uw trainingsgegevens kan de gesynthetiseerde stem Engels spreken met een Engels accent of Engels met hetzelfde accent als de trainingsgegevens.
Opmerking
Als u wilt dat een stem in de zh-CN landinstelling Engels spreekt met hetzelfde accent als de voorbeeldgegevens, moet u Engelse gegevens uploaden naar een contextuele trainingsset of kiezen Chinese (Mandarin, Simplified), English bilingual wanneer u een project maakt of de zh-CN (English bilingual) landinstelling voor de trainingsetgegevens opgeeft via REST API.
Neem in uw contextuele trainingsset ten minste 100 zinnen of 10 minuten Engelse inhoud op en overschrijd niet de hoeveelheid Chinese inhoud.
In de volgende tabel ziet u de verschillen tussen de locaties.
| Locale-instellingen van Speech Studio |
REST API-landinstellingen |
Tweetalige ondersteuning |
Chinese (Mandarin, Simplified) |
zh-CN |
Als uw voorbeeldgegevens Engels bevatten, spreekt de gesynthetiseerde stem Engels met een Engels accent, in plaats van hetzelfde accent als de voorbeeldgegevens, ongeacht de hoeveelheid Engelse gegevens. |
Chinese (Mandarin, Simplified), English bilingual |
zh-CN (English bilingual) |
Als u wilt dat de gesynthetiseerde stem Engels spreekt met hetzelfde accent als de voorbeeldgegevens, raden we u aan meer dan 10% Engelse gegevens in uw trainingsset op te nemen. Anders is het Engels sprekende accent mogelijk niet ideaal. |
Chinese (Cantonese, Simplified) |
zh-HK |
Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent. |
Chinese (Taiwanese Mandarin, Traditional) |
zh-TW |
Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent. |
Meld u aan bij Speech Studio.
Selecteer Aangepaste stem><Uw projectnaam>>Model trainen>Een nieuw model trainen.
Selecteer Neural - meertalige als trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural of Neural - cross lingual of Neural - multi style of Neural - HD Voice.
Selecteer de secundaire taal die uw stem spreekt. U kunt een of meer secundaire talen voor een spraakmodel selecteren, en de stem spreekt de door u geselecteerde talen volgens de trainingsgegevens.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Elke training genereert automatisch 100 primaire taalvoorbeelden om u te helpen het model te testen met een standaardscript.
Voer een naam in om het model te identificeren. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Selecteer Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Verzenden om het model te trainen.
Meld u aan bij Speech Studio.
Selecteer Aangepaste stem><Uw projectnaam>>Model trainen>Een nieuw model trainen.
Selecteer Neural - meerdere stijlen als de trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural of Neural - cross lingual of Neural - meertalig of Neural - HD Voice.
Selecteer een of meer vooraf ingestelde spreekstijlen om te trainen.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer Volgende.
U kunt desgewenst andere aangepaste spreekstijlen toevoegen. Het maximum aantal aangepaste stijlen varieert per taal: English (Verenigde Staten) biedt maximaal 10 aangepaste stijlen, Chinese (Mandarin, Simplified) maximaal vier aangepaste stijlen toestaat en Japanese (Japan) maximaal vijf aangepaste stijlen toestaat.
- Selecteer Een aangepaste stijl toevoegen en voer een aangepaste stijlnaam van uw keuze in. Deze naam wordt door uw toepassing in het
style-element van Speech Synthesis Markup Language (SSML) gebruikt. U kunt ook de naam van de aangepaste stijl als SSML gebruiken met behulp van het hulpprogramma Voor het maken van audio-inhoud in Speech Studio.
- Selecteer stijlvoorbeelden als trainingsgegevens. Zorg ervoor dat de trainingsgegevens voor aangepaste spreekstijlen afkomstig zijn van dezelfde spreker als de gegevens die worden gebruikt om de standaardstijl te maken.
Selecteer Volgende.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Elke training genereert automatisch 100 voorbeeldaudiobestanden voor de standaardstijl en 20 voor elke vooraf ingestelde stijl om het model te testen met een standaardscript.
Desgewenst kunt u ook Mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om de standaardstijl zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie testscriptvereisten voor meer informatie.
- Voer een naam in om het model te identificeren. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
- Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
- Selecteer Volgende.
- Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
- Selecteer Verzenden om het model te trainen.
Beschikbare vooraf ingestelde stijlen in verschillende talen
De volgende tabel bevat een overzicht van de verschillende vooraf ingestelde stijlen op basis van verschillende talen.
| Spreekstijl |
Taal (landinstelling) |
| Boos |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Kalm |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Chat |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Vrolijke |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Ontstemd |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Enthousiast |
Engels (Verenigde Staten) (en-US) |
| Angstig |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Vriendelijke |
Engels (Verenigde Staten) (en-US) |
| Hoopvol |
Engels (Verenigde Staten) (en-US) |
| Triest |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Schreeuwen |
Engels (Verenigde Staten) (en-US) |
| Ernstige |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Doodsbang |
Engels (Verenigde Staten) (en-US) |
| Gebruikersonvriendelijk |
Engels (Verenigde Staten) (en-US) |
| fluisteren |
Engels (Verenigde Staten) (en-US) |
1 De neurale stemstijl is beschikbaar in openbare previewversie. Raadpleeg de tabel van Speech-serviceregio's voor de huidige lijst met regio's die stijlen ondersteunen in de publieke preview.
Meld u aan bij Speech Studio.
Selecteer Aangepaste stem><Uw projectnaam>>Model trainen>Een nieuw model trainen.
Selecteer Neural - cross lingual als de trainingsmethode voor uw model. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural of Neural , meerdere stijlen of Neurale - meertalige of Neurale - HD Voice.
Selecteer een versie van het trainingsrecept voor uw model. De nieuwste versie is standaard geselecteerd. De ondersteunde functies en trainingstijd kunnen per versie verschillen. Normaal gesproken raden we de nieuwste versie aan.
Opmerking
De modelversie V3.0 is buiten gebruik gesteld op 25 juli 2025. De spraakmodellen die al in deze buiten gebruik gestelde versies zijn gemaakt, worden niet beïnvloed.
Selecteer de doeltaal waarmee u spreekt. De stem spreekt een andere taal dan uw trainingsgegevens. U kunt slechts één doeltaal voor een spraakmodel selecteren.
Selecteer de gegevens die u wilt gebruiken voor training. Dubbele audionamen worden uit de training verwijderd. Zorg ervoor dat de gegevens die u selecteert niet dezelfde audionamen bevatten voor meerdere .zip bestanden.
U kunt alleen succesvol verwerkte gegevenssets selecteren voor training. Controleer de verwerkingsstatus van uw gegevens als u de trainingsset niet in de lijst ziet.
Selecteer een sprekerbestand met een stemtalentverklaring die overeenkomt met de spreker in uw trainingsgegevens.
Selecteer Volgende.
Elke training genereert automatisch 100 voorbeeldaudiobestanden om u te helpen het model te testen met een standaardscript.
U kunt eventueel ook Mijn eigen testscript toevoegen selecteren en uw eigen testscript opgeven met maximaal 100 utterances om het model zonder extra kosten te testen. De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts. Zie Testscriptvereisten voor meer informatie.
Voer een naam in om het model te identificeren. Kies zorgvuldig een naam. De modelnaam wordt gebruikt als de spraaknaam in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
Voer desgewenst de beschrijving in om u te helpen het model te identificeren. Een veelvoorkomend gebruik van de beschrijving is het vastleggen van de namen van de gegevens die u hebt gebruikt om het model te maken.
Selecteer Volgende.
Controleer de instellingen en selecteer het vakje om de gebruiksvoorwaarden te accepteren.
Selecteer Verzenden om het model te trainen.
Het trainingsproces bewaken
In de tabel Model trainen wordt een nieuwe vermelding die overeenkomt met het nieuwe model weergegeven. De status weerspiegelt het proces van het converteren van uw gegevens naar een spraakmodel, zoals beschreven in deze tabel:
| Staat |
Betekenis |
| Verwerking |
Uw spraakmodel wordt gemaakt. |
| Geslaagd |
Uw spraakmodel is gemaakt en kan worden geïmplementeerd. |
| Mislukt |
Uw spraakmodel is mislukt tijdens de training. De oorzaak van de fout kan bijvoorbeeld onzichtbare gegevensproblemen of netwerkproblemen zijn. |
| Geannuleerd |
De training voor uw spraakmodel is geannuleerd. |
Terwijl de modelstatus Verwerking is, kunt u Training annuleren selecteren om uw spraakmodel te annuleren. Er worden geen kosten in rekening gebracht voor deze geannuleerde training.
Nadat u klaar bent met het trainen van het model, kunt u de modeldetails bekijken en uw spraakmodel testen.
U kunt het hulpprogramma Voor het maken van audio-inhoud in Speech Studio gebruiken om audio te maken en uw geïmplementeerde stem af te stemmen. Indien van toepassing op uw stem, kunt u een van de stijlen selecteren.
De naam van uw model wijzigen
Als u de naam van het model dat u hebt gemaakt, wilt wijzigen, selecteert u Kloonmodel om een kloon van het model te maken met een nieuwe naam in het huidige project.
Voer de nieuwe naam in het Spraakmodel klonen-venster in en selecteer Verzenden. De tekst Neural wordt automatisch toegevoegd als achtervoegsel aan de naam van uw nieuwe model.
Uw spraakmodel testen
Nadat uw spraakmodel is gebouwd, kunt u de gegenereerde voorbeeldaudiobestanden gebruiken om het te testen voordat u het implementeert.
De kwaliteit van de stem is afhankelijk van veel factoren, zoals:
- De grootte van de trainingsgegevens.
- De kwaliteit van de opname.
- De nauwkeurigheid van het transcriptbestand.
- Hoe goed de opgenomen stem in de trainingsgegevens overeenkomt met de persoonlijkheid van de ontworpen stem voor uw beoogde gebruiksscenario.
Selecteer DefaultTests onder Testen om naar de voorbeeldaudiobestanden te luisteren. De standaardtestvoorbeelden bevatten 100 voorbeeldaudiobestanden die automatisch tijdens de training worden gegenereerd om u te helpen het model te testen. Naast deze 100 audiobestanden die standaard worden geleverd, worden uw eigen testscriptuitingen ook toegevoegd aan defaulttestset . Deze toevoeging bestaat uit maximaal 100 uitingen. Er worden geen kosten in rekening gebracht voor het testen met DefaultTests.
Als u uw eigen testscripts wilt uploaden om uw model verder te testen, selecteert u Testscripts toevoegen om uw eigen testscript te uploaden.
Voordat u een testscript uploadt, controleert u de vereisten voor testscripts. Er worden kosten in rekening gebracht voor het extra testen met de batchsynthese op basis van het aantal factureerbare tekens. Zie Azure Speech in Foundry Tools-prijzen.
Selecteer onder Testscripts toevoegen de optie Bladeren naar een bestand om uw eigen script te selecteren en selecteer Vervolgens Toevoegen om het te uploaden.
Vereisten voor testscripts
Het testscript moet een .txt-bestand zijn dat kleiner is dan 1 MB. Ondersteunde coderingsindelingen zijn ANSI/ASCII, UTF-8, UTF-8-BOM, UTF-16-LE of UTF-16-BE.
In tegenstelling tot de transcriptiebestanden van de training moet het testscript de uitings-id uitsluiten. Dit is de bestandsnaam van elke utterance. Anders worden deze id's uitgesproken.
Hier volgt een voorbeeldset utterances in één .txt-bestand :
This is the waistline, and it's falling.
We have trouble scoring.
It was Janet Maslin.
Elke alinea van de uiting resulteert in een afzonderlijke audio. Als u alle zinnen in één audio wilt combineren, maakt u ze één alinea.
Opmerking
De gegenereerde audiobestanden zijn een combinatie van de automatische testscripts en aangepaste testscripts.
Engine-versie voor uw spraakmodel bijwerken
Azure tekst-naar-spraakengines worden van tijd tot tijd bijgewerkt om het nieuwste taalmodel vast te leggen waarmee de uitspraak van de taal wordt gedefinieerd. Nadat u uw stem hebt getraind, kunt u uw stem toepassen op het nieuwe taalmodel door bij te werken naar de nieuwste engineversie.
Wanneer er een nieuwe engine beschikbaar is, wordt u gevraagd uw neurale spraakmodel bij te werken.
Ga naar de pagina met modeldetails en volg de instructies op het scherm om de nieuwste engine te installeren.
Selecteer de nieuwste engine later te installeren om uw model bij te werken naar de nieuwste engineversie.
Er worden geen kosten in rekening gebracht voor de engine-update. De vorige versies worden nog steeds bewaard.
U kunt alle engineversies voor het model controleren in de engineversielijst of een versie verwijderen als u deze niet meer nodig hebt.
De bijgewerkte versie wordt automatisch als standaard ingesteld. Maar u kunt de standaardversie wijzigen door een versie te selecteren in de vervolgkeuzelijst en Als standaard instellen te selecteren.
Als u elke engineversie van uw spraakmodel wilt testen, kunt u een versie in de lijst selecteren en vervolgens DefaultTests selecteren onder Testen om naar de voorbeeldaudiobestanden te luisteren. Als u uw eigen testscripts wilt uploaden om uw huidige engineversie verder te testen, controleert u eerst of de versie als standaard is ingesteld en volgt u de stappen in Uw spraakmodel testen.
Als u de engine bijwerkt, wordt er zonder extra kosten een nieuwe versie van het model gemaakt. Nadat u de engineversie voor uw spraakmodel hebt bijgewerkt, moet u de nieuwe versie implementeren om een nieuw eindpunt te maken. U kunt alleen de standaardversie implementeren.
Nadat u een nieuw eindpunt hebt gemaakt, moet u het verkeer overdragen naar het nieuwe eindpunt in uw product.
Zie Kenmerken en beperkingen voor het gebruik van aangepaste spraak voor meer informatie over de mogelijkheden en limieten van deze functie en de best practice om de kwaliteit van uw model te verbeteren.
Uw spraakmodel kopiëren naar een ander project
U kunt uw spraakmodel kopiëren naar een ander project voor dezelfde regio of een andere regio. U kunt bijvoorbeeld een neuraal spraakmodel kopiëren dat in de ene regio is getraind, naar een project voor een andere regio.
Opmerking
Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. U kunt een neuraal spraakmodel van die regio's naar andere regio's kopiëren. Zie voor meer informatie de regio's voor aangepaste spraak.
Uw aangepaste spraakmodel kopiëren naar een ander project:
Selecteer op het tabblad Model trainen een spraakmodel dat u wilt kopiëren en selecteer vervolgens Kopiëren naar project.
Selecteer de Subscription, Region, Speech-resource en Project waar u het model wilt kopiëren. U moet een spraakresource en -project in de doelregio hebben, anders moet u ze eerst maken.
Selecteer Verzenden om het model te kopiëren.
Selecteer Model weergeven onder het meldingsbericht van de succesvolle kopieeractie.
Navigeer naar het project waar u het model hebt gekopieerd om de modelkopie te implementeren.
Volgende stappen
In dit artikel leert u hoe u een professionele stem kunt afstemmen via de aangepaste spraak-API.
Belangrijk
Professionele stemaanpassing is momenteel alleen beschikbaar in sommige regio's. Nadat uw spraakmodel is getraind in een ondersteunde regio, kunt u het indien nodig kopiëren naar een Foundry-resource in een andere regio. Zie de voetnoten in de speech-servicetabel voor meer informatie.
De duur van de training varieert, afhankelijk van de hoeveelheid gegevens die u gebruikt. Het kost gemiddeld ongeveer 10 uur computingtijd om een professionele stem af te stemmen. Gebruikers van een Standard-abonnement (S0) kunnen vier stemmen tegelijk trainen. Als u de limiet bereikt, wacht u totdat ten minste één van uw spraakmodellen klaar is met trainen en probeert u het opnieuw.
Een trainingsmethode kiezen
Nadat u uw gegevensbestanden hebt gevalideerd, gebruikt u deze om uw aangepaste spraakmodel te bouwen. Wanneer u een aangepaste stem maakt, kunt u ervoor kiezen om deze te trainen met een van de volgende methoden:
Neurale - HD Voice: Maak een HD-stem in dezelfde taal als uw trainingsgegevens. Azure neurale HD-stemmen zijn gebaseerd op LLM, geoptimaliseerd voor dynamische gesprekken. Hier vindt u meer informatie over neurale HD-stemmen.
Neurale: Maak een stem aan in dezelfde taal als uw trainingsgegevens.
Neurale - meerdere stijlen: Maak een aangepaste stem die in meerdere stijlen en emoties spreekt, zonder nieuwe trainingsgegevens toe te voegen. Meerdere stijlstemmen zijn handig voor videogamepersonages, conversatiechatbots, audioboeken, contentlezers en meer.
Als u een stem met meerdere stijlen wilt maken, moet u een set algemene trainingsgegevens voorbereiden, ten minste 300 utterances. Selecteer een of meer van de vooraf ingestelde doelstijlen voor spreken. U kunt ook meerdere aangepaste stijlen maken door stijlvoorbeelden, van ten minste 100 utterances per stijl, als extra trainingsgegevens voor dezelfde stem op te geven. De ondersteunde vooraf ingestelde stijlen variëren afhankelijk van verschillende talen. Bekijk beschikbare vooraf ingestelde stijlen in verschillende talen.
Neurale taaloverschrijding: creëer een stem die een andere taal spreekt dan de oorspronkelijke trainingsgegevens. Met de fr-FR trainingsgegevens kunt u bijvoorbeeld een stem maken die spreekt en-US.
De taal van de trainingsgegevens en de doeltaal moet beide een van de talen zijn die worden ondersteund voor taaloverschrijdende spraaktraining. U hoeft geen trainingsgegevens voor te bereiden in de doeltaal, maar uw testscript moet in de doeltaal zijn.
De taal van de trainingsgegevens moet een van de talen zijn die worden ondersteund voor aangepaste spraak, taaloverschrijdende of meerdere stijlen of HD-spraaktraining.
Een spraakmodel maken
Als u een HD-stem wilt maken, gebruikt u de Models_Create bewerking van de aangepaste spraak-API. Bouw de aanvraagbody volgens de volgende instructies:
- Stel de vereiste
projectId eigenschap in. Zie Een project maken.
- Stel de vereiste
consentId eigenschap in. Zie Stemtalenttoestemming toevoegen.
- Stel de vereiste
trainingSetId eigenschap in. Zie Een trainingsset maken.
- Stel de vereiste recepteigenschap
kind in op HD voor neurale spraaktraining. Het recepttype geeft de trainingsmethode aan en kan later niet meer worden gewijzigd. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural, Neural - cross lingual of Neural - multi-style. Zie Tweetalige training voor meer informatie over tweetalige training en verschillen tussen landinstellingen.
- Stel de vereiste
voiceName eigenschap in. De naam van de stem voegt automatisch het Dragon HD-achtervoegsel toe en kan later niet meer worden gewijzigd. Kies zorgvuldig een naam. De SDK- en SSML-invoer gebruiken de spraaknaam in uw aanvraag voor spraaksynthese. Alleen letters, cijfers en enkele interpunctietekens zijn toegestaan vóór het specifieke achtervoegsel. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
- U kunt desgewenst de
description eigenschap voor de spraakbeschrijving instellen. De spraakbeschrijving kan later worden gewijzigd.
Maak een HTTP PUT-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Create voorbeeld.
- Vervang
YourResourceKey door uw Spraak-resourcesleutel.
- Vervang
YourResourceName door de naam van uw Speech-resource.
- Vervang door
JessicaModelId een model-id van uw keuze. De hoofdlettergevoelige id wordt gebruikt in de URI van het model en kan later niet meer worden gewijzigd.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
"voiceName": "Jessica",
"description": "Jessica HD voice",
"recipe": {
"kind": "HD"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId"
} ' "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01"
U ontvangt een antwoordtekst in de volgende indeling:
{
"id": "JessicaModelId",
"voiceName": "Jessica:DragonHDLatestNeural",
"description": "Jessica HD voice",
"recipe": {
"kind": "HD",
"version": "V1.0"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId",
"locale": "en-US",
"engineVersion": "2023.07.04.0",
"status": "NotStarted",
"createdDateTime": "2023-04-01T05:30:00.000Z",
"lastActionDateTime": "2023-04-02T10:15:30.000Z"
}
Als u een neurale stem wilt maken, gebruikt u de Models_Create bewerking van de aangepaste spraak-API. Bouw de aanvraagbody volgens de volgende instructies:
- Stel de vereiste
projectId eigenschap in. Zie Een project maken.
- Stel de vereiste
consentId eigenschap in. Zie Stemtalenttoestemming toevoegen.
- Stel de vereiste
trainingSetId eigenschap in. Zie Een trainingsset maken.
- Stel de vereiste recepteigenschap
kind in op Default voor neurale spraaktraining. Het recepttype geeft de trainingsmethode aan en kan later niet meer worden gewijzigd. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural - cross lingual, Neural - multi style of Neural - HD Voice. Zie Tweetalige training voor meer informatie over tweetalige training en verschillen tussen landinstellingen.
- Stel de vereiste
voiceName eigenschap in. Kies zorgvuldig een naam. De spraaknaam wordt gebruikt in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
- U kunt desgewenst de
description eigenschap voor de spraakbeschrijving instellen. De spraakbeschrijving kan later worden gewijzigd.
Maak een HTTP PUT-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Create voorbeeld.
- Vervang
YourResourceKey door uw Spraak-resourcesleutel.
- Vervang
YourResourceName door de naam van uw Speech-resource.
- Vervang door
JessicaModelId een model-id van uw keuze. De hoofdlettergevoelige id wordt gebruikt in de URI van het model en kan later niet meer worden gewijzigd.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
"voiceName": "Jessica",
"description": "Jessica voice",
"recipe": {
"kind": "Default"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId"
} ' "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01"
U ontvangt een antwoordtekst in de volgende indeling:
{
"id": "JessicaModelId",
"voiceName": "Jessica",
"description": "Jessica voice",
"recipe": {
"kind": "Default",
"version": "V10.0"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId",
"locale": "en-US",
"engineVersion": "2023.07.04.0",
"status": "NotStarted",
"createdDateTime": "2023-04-01T05:30:00.000Z",
"lastActionDateTime": "2023-04-02T10:15:30.000Z"
}
Als u een neurale stem met meerdere stijlen wilt maken, gebruikt u de Models_Create bewerking van de aangepaste spraak-API. Bouw de aanvraagbody volgens de volgende instructies:
- Stel de vereiste
projectId eigenschap in. Zie Een project maken.
- Stel de vereiste
consentId eigenschap in. Zie Stemtalenttoestemming toevoegen.
- Stel de vereiste
trainingSetId eigenschap in. Zie Een trainingsset maken.
- Stel de vereiste recepteigenschap
kind in op MultiStyle voor meerdere stijl stemtrainingen. Het recepttype geeft de trainingsmethode aan en kan later niet meer worden gewijzigd. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural of Neural - cross lingual of Neural - HD Voice.
- Stel de vereiste
voiceName eigenschap in. Kies zorgvuldig een naam. De spraaknaam wordt gebruikt in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
- Stel de vereiste
locale eigenschap in voor de taal voor uw spraakmodel.
- Stel de vereiste
presetStyles eigenschap in op een of meer van de beschikbare vooraf ingestelde stijlen voor de doeltaal.
- Stel desgewenst de
styleTrainingSetIds eigenschap in om trainingsgegevens te bieden voor uw aangepaste spreekstijlen. Het maximum aantal aangepaste stijlen varieert per taal: In het Engels (Verenigde Staten) zijn maximaal 10 aangepaste stijlen toegestaan. Chinees (Mandarijn, Vereenvoudigd) biedt maximaal vier aangepaste stijlen en Japans (Japan) maakt maximaal vijf aangepaste stijlen mogelijk.
De styleTrainingSetIds eigenschap is een woordenlijst met stijlnamen en trainingsset-id's.
- Geef voor elke woordenlijstsleutel een aangepaste stijlnaam van uw keuze op. Deze naam wordt door uw toepassing in het
style-element van Speech Synthesis Markup Language (SSML) gebruikt.
- Geef voor elke woordenlijstwaarde de id op van een trainingsset die u al hebt gemaakt voor hetzelfde spraakmodel. De trainingsset moet ten minste 100 utterances voor elke stijl bevatten.
- U kunt desgewenst de
description eigenschap voor de spraakbeschrijving instellen. De spraakbeschrijving kan later worden gewijzigd.
Maak een HTTP PUT-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Create voorbeeld.
- Vervang
YourResourceKey door uw Spraak-resourcesleutel.
- Vervang
YourResourceName door de naam van uw Speech-resource.
- Vervang door
JessicaModelId een model-id van uw keuze. De hoofdlettergevoelige id wordt gebruikt in de URI van het model en kan later niet meer worden gewijzigd.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
"voiceName": "JessicaNeuralMultiStyle",
"description": "Jessica multi-style voice",
"recipe": {
"kind": "MultiStyle"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId",
"locale": "en-US",
"properties": {
"presetStyles": [
"cheerful",
"sad"
],
"styleTrainingSetIds": {
"happyJessica": "JessicaHappyTrainingSetId",
"myStyle2": "JessicaStyle2TrainingSetId"
}
}
} ' "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01"
U ontvangt een antwoordtekst in de volgende indeling:
{
"id": "JessicaModelId",
"voiceName": "JessicaNeuralMultiStyle",
"description": "Jessica multi-style voice",
"recipe": {
"kind": "MultiStyle",
"version": "V1.0"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId",
"locale": "en-US",
"engineVersion": "2023.07.04.0","properties": {
"presetStyles": [
"cheerful",
"sad"
],
"styleTrainingSetIds": {
"happyJessica": "JessicaHappyTrainingSetId",
"myStyle2": "JessicaStyle2TrainingSetId"
},
"voiceStyles": [
"cheerful",
"sad",
"happyJessica",
"myStyle2"
]
}
"status": "NotStarted",
"createdDateTime": "2023-04-01T05:30:00.000Z",
"lastActionDateTime": "2023-04-02T10:15:30.000Z"
}
Als u een meertalige neurale stem wilt maken, gebruikt u de Models_Create bewerking van de aangepaste spraak-API. Bouw de aanvraagbody volgens de volgende instructies:
- Stel de vereiste
projectId eigenschap in. Zie Een project maken.
- Stel de vereiste
consentId eigenschap in. Zie Stemtalenttoestemming toevoegen.
- Stel de vereiste
trainingSetId eigenschap in. Zie Een trainingsset maken.
- Stel de vereiste recepteigenschap
kind in op CrossLingual voor taaloverschrijdende spraaktraining. Het recepttype geeft de trainingsmethode aan en kan later niet meer worden gewijzigd. Als u een andere trainingsmethode wilt gebruiken, raadpleegt u Neural of Neural - multi-style of Neural - HD Voice.
- Stel de vereiste
voiceName eigenschap in. Kies zorgvuldig een naam. De spraaknaam wordt gebruikt in uw aanvraag voor spraaksynthese door de SDK en SSML-invoer. Alleen letters, cijfers en een paar interpunctietekens zijn toegestaan. Gebruik verschillende namen voor verschillende neurale spraakmodellen.
- Stel de vereiste
locale eigenschap in voor de taal die uw stem spreekt. De stem spreekt een andere taal dan uw trainingsgegevens. U kunt slechts één doeltaal opgeven voor een spraakmodel.
- U kunt desgewenst de
description eigenschap voor de spraakbeschrijving instellen. De spraakbeschrijving kan later worden gewijzigd.
Maak een HTTP PUT-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Create voorbeeld.
- Vervang
YourResourceKey door uw Spraak-resourcesleutel.
- Vervang
YourResourceName door de naam van uw Speech-resource.
- Vervang door
JessicaModelId een model-id van uw keuze. De hoofdlettergevoelige id wordt gebruikt in de URI van het model en kan later niet meer worden gewijzigd.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
"voiceName": "JessicaCrossLingualNeural",
"description": "Jessica cross lingual voice",
"recipe": {
"kind": "CrossLingual"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "Jessica-en-US-TrainingSetId",
"locale": "fr-FR"
} ' "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01"
U ontvangt een antwoordtekst in de volgende indeling:
{
"id": "JessicaModelId",
"voiceName": "JessicaNeuralCrossLingual",
"description": "Jessica cross lingual voice",
"recipe": {
"kind": "CrossLingual",
"version": "V5.0"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "Jessica-en-US-TrainingSetId",
"locale": "fr-FR",
"engineVersion": "2023.11.14.0",
"status": "NotStarted",
"createdDateTime": "2023-04-01T05:30:00.000Z",
"lastActionDateTime": "2023-04-02T10:15:30.000Z"
}
Momenteel niet ondersteund via de REST API.
Tweetalige training
Als u het type neurale training selecteert, kunt u een stem trainen om in meerdere talen te spreken. De zh-CN, zh-HK en zh-TW lokalisaties ondersteunen tweetalige training voor de stem om zowel Chinees als Engels te spreken. Afhankelijk van uw trainingsgegevens kan de gesynthetiseerde stem Engels spreken met een Engels accent of Engels met hetzelfde accent als de trainingsgegevens.
Opmerking
Als u wilt dat een stem in de zh-CN landinstelling Engels spreekt met hetzelfde accent als de voorbeeldgegevens, moet u Engelse gegevens uploaden naar een contextuele trainingsset of kiezen Chinese (Mandarin, Simplified), English bilingual wanneer u een project maakt of de zh-CN (English bilingual) landinstelling voor de trainingsetgegevens opgeeft via REST API.
Neem in uw contextuele trainingsset ten minste 100 zinnen of 10 minuten Engelse inhoud op en overschrijd niet de hoeveelheid Chinese inhoud.
In de volgende tabel ziet u de verschillen tussen de locaties.
| Locale-instellingen van Speech Studio |
REST API-landinstellingen |
Tweetalige ondersteuning |
Chinese (Mandarin, Simplified) |
zh-CN |
Als uw voorbeeldgegevens Engels bevatten, spreekt de gesynthetiseerde stem Engels met een Engels accent, in plaats van hetzelfde accent als de voorbeeldgegevens, ongeacht de hoeveelheid Engelse gegevens. |
Chinese (Mandarin, Simplified), English bilingual |
zh-CN (English bilingual) |
Als u wilt dat de gesynthetiseerde stem Engels spreekt met hetzelfde accent als de voorbeeldgegevens, raden we u aan meer dan 10% Engelse gegevens in uw trainingsset op te nemen. Anders is het Engels sprekende accent mogelijk niet ideaal. |
Chinese (Cantonese, Simplified) |
zh-HK |
Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent. |
Chinese (Taiwanese Mandarin, Traditional) |
zh-TW |
Als u een gesynthetiseerde stem wilt trainen die Engels kan spreken met hetzelfde accent als uw voorbeeldgegevens, moet u ervoor zorgen dat u meer dan 10% Engelse gegevens in uw trainingsset opgeeft. Anders wordt het standaard ingesteld op een Engels native accent. De drempelwaarde voor 10% wordt berekend op basis van de gegevens die zijn geaccepteerd na het uploaden, niet de gegevens voordat ze worden geüpload. Als sommige geüploade Engelse gegevens worden geweigerd vanwege defecten en niet voldoen aan de drempelwaarde van 10%, wordt de gesynthetiseerde stem standaard ingesteld op een Engels native accent. |
Beschikbare vooraf ingestelde stijlen in verschillende talen
De volgende tabel bevat een overzicht van de verschillende vooraf ingestelde stijlen op basis van verschillende talen.
| Spreekstijl |
Taal (landinstelling) |
| Boos |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Kalm |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Chat |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Vrolijke |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Ontstemd |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Enthousiast |
Engels (Verenigde Staten) (en-US) |
| Angstig |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Vriendelijke |
Engels (Verenigde Staten) (en-US) |
| Hoopvol |
Engels (Verenigde Staten) (en-US) |
| Triest |
Engels (Verenigde Staten) (en-US) Japans (Japan) (ja-JP) 1 Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Schreeuwen |
Engels (Verenigde Staten) (en-US) |
| Ernstige |
Chinees (Mandarijn, Vereenvoudigd) (zh-CN) 1 |
| Doodsbang |
Engels (Verenigde Staten) (en-US) |
| Gebruikersonvriendelijk |
Engels (Verenigde Staten) (en-US) |
| fluisteren |
Engels (Verenigde Staten) (en-US) |
1 De neurale stemstijl is beschikbaar in openbare previewversie. Raadpleeg de tabel van Speech-serviceregio's voor de huidige lijst met regio's die stijlen ondersteunen in de publieke preview.
Trainingsstatus ophalen
Als u de trainingsstatus van een spraakmodel wilt ophalen, gebruikt u de Models_Get bewerking van de aangepaste spraak-API. Bouw de aanvraag-URI volgens de volgende instructies:
Maak een HTTP GET-aanvraag met behulp van de URI, zoals wordt weergegeven in het volgende Models_Get voorbeeld.
- Vervang
YourResourceKey door uw Spraak-resourcesleutel.
- Vervang
YourResourceName door de naam van uw Speech-resource.
- Vervang
JessicaModelId als u in de vorige stap een andere model-id hebt opgegeven.
curl -v -X GET "https://YourResourceName.cognitiveservices.azure.com/customvoice/models/JessicaModelId?api-version=2026-01-01" -H "Ocp-Apim-Subscription-Key: YourResourceKey"
U ontvangt een antwoordtekst in de volgende indeling.
Opmerking
Het recept kind en andere eigenschappen zijn afhankelijk van hoe u de stem hebt getraind. In dit voorbeeld is Default het recepttype bedoeld voor neurale spraaktraining.
{
"id": "JessicaModelId",
"voiceName": "Jessica",
"description": "Jessica voice",
"recipe": {
"kind": "Default",
"version": "V9.0"
},
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"trainingSetId": "JessicaTrainingSetId",
"locale": "en-US",
"engineVersion": "2023.07.04.0",
"status": "Succeeded",
"createdDateTime": "2023-04-01T05:30:00.000Z",
"lastActionDateTime": "2023-04-02T10:15:30.000Z"
}
Mogelijk moet u enkele minuten wachten voordat de training is voltooid. Uiteindelijk verandert de status in Succeeded of Failed.
Volgende stappen