Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Aby używać osobistego głosu w aplikacji, musisz uzyskać identyfikator profilu osoby mówiącej. Identyfikator profilu osoby mówiącej służy do generowania syntetyzowanego dźwięku z podanym tekstem.
Utworzysz identyfikator profilu osoby mówiącej na podstawie słownej instrukcji wyrażania zgody osoby mówiącej i monitu audio (czystej próbki głosu ludzkiego z zakresu od 5 do 90 sekund). Cechy głosu użytkownika są kodowane w speakerProfileId właściwości używanej do text to speech. Aby uzyskać więcej informacji, zobacz Używanie głosu osobistego w aplikacji.
Uwaga
Osobisty identyfikator głosu i identyfikator profilu osoby mówiącej nie są takie same. Możesz wybrać osobisty identyfikator głosu, ale identyfikator profilu osoby mówiącej jest generowany przez usługę. Osobisty identyfikator głosu służy do zarządzania głosem osobistym. Identyfikator profilu osoby mówiącej jest używany do text to speech.
Format dźwięku monitu
Obsługiwane formaty plików audio monitu to:
| Formatuj | Częstotliwość próbkowania | Szybkość transmisji bitów | Głębokość bitu |
|---|---|---|---|
| mp3 | 16 kHz, 24 kHz, 44,1 kHz, 48 kHz | 128 kb/s, 192 kb/s, 256 kb/s, 320 kb/s | / |
| wav | 16 kHz, 24 kHz, 44,1 kHz, 48 kHz | / | 16-bitowy, 24-bitowy, 32-bitowy |
Dodawanie zestawu danych trenowania głosowego
Te kroki stanowią dalszy ciąg pracy w kreatorze Dostrajanie modelu, otwartym w Tworzenie osobistego projektu głosowego i kontynuowanym w Dodawanie zgody użytkownika.
W okienku Dane trenowania kreatora wybierz jedną z następujących opcji:
- Prześlij dane, aby przesłać wcześniej nagrany komunikat audio.
- Rejestruj dane w celu zarejestrowania monitu audio bezpośrednio w portalu.
Prześlij wcześniej nagrany komunikat głosowy
- W panelu Przekazywanie danych przeciągnij i upuść plik audio do obszaru przesyłania lub wybierz opcję Przeglądaj pliki, aby go wybrać. Plik musi być czystą próbką głosu ludzkiego z zakresu od 5 do 90 sekund.
- Wybierz pozycję Prześlij.
Rejestrowanie monitu audio w portalu
W okienku Rejestrowanie danych przeczytaj i postępuj zgodnie z poradami dotyczącymi nagrywania:
- Unikaj szumu tła: rejestruj w cichym środowisku, aby zminimalizować szum tła w celu uzyskania lepszej jakości dźwięku.
- Bądź zrelaksowany: Mówić naturalnie i w wygodnym tempie. Unikaj mówienia w pośpiechu lub przesadnej artykulacji.
- Użyj mikrofonu jakości: użyj zestawu słuchawkowego lub mikrofonu zewnętrznego, aby uzyskać najlepsze wyniki. Unikaj wbudowanych mikrofonów laptopów.
- Przejrzyj metryki jakości: po zarejestrowaniu przejrzyj wyniki jakości, aby upewnić się, że dźwięk spełnia wymagane standardy.
Naciśnij przycisk mikrofonu, aby rozpocząć nagrywanie 5–90 sekund dźwięku.
Zatrzymaj nagranie, przejrzyj je, a następnie wybierz przycisk Dalej , aby przesłać.
Testowanie osobistego głosu
Po przetworzeniu danych treningowych możesz przetestować swój osobisty głos w Playground:
- Wybierz pozycję Dostrajanie w lewym panelu, a następnie wybierz kartę Usługa AI.
- Wybierz zadanie dostrajania osobistego głosu, które zostało przesłane.
- Wybierz Otwórz w Playground w górnym prawym rogu.
- Wprowadź zwykły tekst lub SSML, aby syntetyzować mowę za pomocą osobistego głosu.
Aby zintegrować osobisty głos w aplikacji przy użyciu usługi speakerProfileId, zobacz Używanie głosu osobistego w aplikacji.
Należy podać pliki audio z publicznie dostępnego adresu URL (PersonalVoices_Create) lub przekazać pliki audio (PersonalVoices_Post).
Tworzenie osobistego głosu na podstawie pliku
W tym scenariuszu pliki audio muszą być dostępne lokalnie.
Aby utworzyć głos osobisty i uzyskać identyfikator profilu osoby mówiącej, użyj operacji PersonalVoices_Post niestandardowego interfejsu API głosu. Skonstruuj treść żądania zgodnie z następującymi instrukcjami:
- Ustaw wymaganą
projectIdwłaściwość. Zobacz jak stworzyć projekt. - Ustaw wymaganą
consentIdwłaściwość. Zobacz Dodawanie zgody użytkownika. - Ustaw wymaganą
audiodatawłaściwość. W tym samym żądaniu można określić co najmniej jeden plik audio. Maksymalny rozmiar pliku to 30 MB.
Utwórz żądanie HTTP POST przy użyciu adresu URI, jak pokazano w poniższym przykładzie PersonalVoices_Post.
- Zastąp
YourResourceKeykluczem zasobu usługi Rozpoznawanie Mowy. - Zastąp
YourResourceNamenazwą zasobu Speech. - Zamień
JessicaPersonalVoiceIdna wybrany przez siebie osobisty identyfikator głosu. Identyfikator, który rozróżnia wielkość liter, będzie używany w URI głosu osobistego i nie można go zmienić później.
curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourResourceKey" -F 'projectId="ProjectId"' -F 'consentId="JessicaConsentId"' -F 'audiodata=@"D:\PersonalVoiceTest\CNVSample001.wav"' -F 'audiodata=@"D:\PersonalVoiceTest\CNVSample002.wav"' "https://YourResourceName.cognitiveservices.azure.com/customvoice/personalvoices/JessicaPersonalVoiceId?api-version=2026-01-01"
Treść odpowiedzi powinna zostać wyświetlona w następującym formacie:
{
"id": "JessicaPersonalVoiceId",
"speakerProfileId": "3059912f-a3dc-49e3-bdd0-02e449df1fe3",
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"status": "NotStarted",
"createdDateTime": "2024-09-01T05:30:00.000Z",
"lastActionDateTime": "2024-09-02T10:15:30.000Z"
}
Użyj właściwości speakerProfileId, aby zintegrować osobisty głos w aplikacji text to speech. Aby uzyskać więcej informacji, zobacz Używanie głosu osobistego w aplikacji.
Nagłówek odpowiedzi zawiera Operation-Location właściwość . Użyj tego URI, aby uzyskać szczegółowe informacje o operacji PersonalVoices_Post. Oto przykład nagłówka odpowiedzi:
Operation-Location: https://YourResourceName.cognitiveservices.azure.com/customvoice/operations/1321a2c0-9be4-471d-83bb-bc3be4f96a6f?api-version=2026-01-01
Operation-Id: 1321a2c0-9be4-471d-83bb-bc3be4f96a6f
Tworzenie osobistego głosu na podstawie adresu URL
W tym scenariuszu pliki audio muszą być już przechowywane w kontenerze Azure Blob Storage.
Aby utworzyć osobisty głos i uzyskać identyfikator profilu osoby mówiącej, użyj PersonalVoices_Create operacji niestandardowego interfejsu API głosu. Skonstruuj treść żądania zgodnie z następującymi instrukcjami:
- Ustaw wymaganą
projectIdwłaściwość. Zobacz jak stworzyć projekt. - Ustaw wymaganą
consentIdwłaściwość. Zobacz Dodawanie zgody użytkownika. - Ustaw wymaganą
audioswłaściwość. W ramachaudioswłaściwości ustaw następujące właściwości:- Ustaw wymaganą właściwość
containerUrlna adres URL kontenera Azure Blob Storage zawierającego pliki audio. Użyj shared access signatures (SAS) dla kontenera z uprawnieniami do odczytu i wyświetlania listy. - Ustaw wymaganą
extensionswłaściwość dla rozszerzeń plików audio. - Opcjonalnie ustaw właściwość
prefixdo ustawienia prefiksu nazwy obiektu blob.
- Ustaw wymaganą właściwość
Wykonaj żądanie HTTP PUT przy użyciu adresu URI, jak pokazano w poniższym przykładzie PersonalVoices_Create.
- Zastąp
YourResourceKeykluczem zasobu usługi Rozpoznawanie Mowy. - Zastąp
YourResourceNamenazwą zasobu Speech. - Zamień
JessicaPersonalVoiceIdna wybrany przez siebie osobisty identyfikator głosu. Identyfikator, który rozróżnia wielkość liter, będzie używany w URI głosu osobistego i nie można go zmienić później.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"audios": {
"containerUrl": "https://contoso.blob.core.windows.net/voicecontainer?mySasToken",
"prefix": "jessica/",
"extensions": [
".wav"
]
}
} ' "https://YourResourceName.cognitiveservices.azure.com/customvoice/personalvoices/JessicaPersonalVoiceId?api-version=2026-01-01"
# Ensure the `containerUrl` has both read and list permissions.
# Ensure the `.wav` files are located in the "jessica" folder within the container. The `prefix` matches all `.wav` files in the "jessica" folder. If there is no such folder, the prefix will match `.wav` files with names starting with "jessica".
Treść odpowiedzi powinna zostać wyświetlona w następującym formacie:
{
"id": "JessicaPersonalVoiceId",
"speakerProfileId": "3059912f-a3dc-49e3-bdd0-02e449df1fe3",
"projectId": "ProjectId",
"consentId": "JessicaConsentId",
"status": "NotStarted",
"createdDateTime": "2024-09-01T05:30:00.000Z",
"lastActionDateTime": "2024-09-02T10:15:30.000Z"
}
Użyj właściwości speakerProfileId, aby zintegrować osobisty głos w aplikacji text to speech. Aby uzyskać więcej informacji, zobacz Używanie głosu osobistego w aplikacji.
Nagłówek odpowiedzi zawiera Operation-Location właściwość . Użyj tego identyfikatora URI, aby uzyskać szczegółowe informacje o operacji PersonalVoices_Create . Oto przykład nagłówka odpowiedzi:
Operation-Location: https://YourResourceName.cognitiveservices.azure.com/customvoice/operations/1321a2c0-9be4-471d-83bb-bc3be4f96a6f?api-version=2026-01-01
Operation-Id: 1321a2c0-9be4-471d-83bb-bc3be4f96a6f