Uzyskiwanie identyfikatora profilu osoby mówiącej dla osobistego głosu

Aby używać osobistego głosu w aplikacji, musisz uzyskać identyfikator profilu osoby mówiącej. Identyfikator profilu osoby mówiącej służy do generowania syntetyzowanego dźwięku z podanym tekstem.

Utworzysz identyfikator profilu osoby mówiącej na podstawie słownej instrukcji wyrażania zgody osoby mówiącej i monitu audio (czystej próbki głosu ludzkiego z zakresu od 5 do 90 sekund). Cechy głosu użytkownika są kodowane w speakerProfileId właściwości używanej do text to speech. Aby uzyskać więcej informacji, zobacz Używanie głosu osobistego w aplikacji.

Uwaga

Osobisty identyfikator głosu i identyfikator profilu osoby mówiącej nie są takie same. Możesz wybrać osobisty identyfikator głosu, ale identyfikator profilu osoby mówiącej jest generowany przez usługę. Osobisty identyfikator głosu służy do zarządzania głosem osobistym. Identyfikator profilu osoby mówiącej jest używany do text to speech.

Format dźwięku monitu

Obsługiwane formaty plików audio monitu to:

Formatuj Częstotliwość próbkowania Szybkość transmisji bitów Głębokość bitu
mp3 16 kHz, 24 kHz, 44,1 kHz, 48 kHz 128 kb/s, 192 kb/s, 256 kb/s, 320 kb/s /
wav 16 kHz, 24 kHz, 44,1 kHz, 48 kHz / 16-bitowy, 24-bitowy, 32-bitowy

Dodawanie zestawu danych trenowania głosowego

Te kroki stanowią dalszy ciąg pracy w kreatorze Dostrajanie modelu, otwartym w Tworzenie osobistego projektu głosowego i kontynuowanym w Dodawanie zgody użytkownika.

  1. W okienku Dane trenowania kreatora wybierz jedną z następujących opcji:

    • Prześlij dane, aby przesłać wcześniej nagrany komunikat audio.
    • Rejestruj dane w celu zarejestrowania monitu audio bezpośrednio w portalu.

Prześlij wcześniej nagrany komunikat głosowy

  1. W panelu Przekazywanie danych przeciągnij i upuść plik audio do obszaru przesyłania lub wybierz opcję Przeglądaj pliki, aby go wybrać. Plik musi być czystą próbką głosu ludzkiego z zakresu od 5 do 90 sekund.
  2. Wybierz pozycję Prześlij.

Rejestrowanie monitu audio w portalu

  1. W okienku Rejestrowanie danych przeczytaj i postępuj zgodnie z poradami dotyczącymi nagrywania:

    • Unikaj szumu tła: rejestruj w cichym środowisku, aby zminimalizować szum tła w celu uzyskania lepszej jakości dźwięku.
    • Bądź zrelaksowany: Mówić naturalnie i w wygodnym tempie. Unikaj mówienia w pośpiechu lub przesadnej artykulacji.
    • Użyj mikrofonu jakości: użyj zestawu słuchawkowego lub mikrofonu zewnętrznego, aby uzyskać najlepsze wyniki. Unikaj wbudowanych mikrofonów laptopów.
    • Przejrzyj metryki jakości: po zarejestrowaniu przejrzyj wyniki jakości, aby upewnić się, że dźwięk spełnia wymagane standardy.
  2. Naciśnij przycisk mikrofonu, aby rozpocząć nagrywanie 5–90 sekund dźwięku.

  3. Zatrzymaj nagranie, przejrzyj je, a następnie wybierz przycisk Dalej , aby przesłać.

Testowanie osobistego głosu

Po przetworzeniu danych treningowych możesz przetestować swój osobisty głos w Playground:

  1. Wybierz pozycję Dostrajanie w lewym panelu, a następnie wybierz kartę Usługa AI.
  2. Wybierz zadanie dostrajania osobistego głosu, które zostało przesłane.
  3. Wybierz Otwórz w Playground w górnym prawym rogu.
  4. Wprowadź zwykły tekst lub SSML, aby syntetyzować mowę za pomocą osobistego głosu.

Aby zintegrować osobisty głos w aplikacji przy użyciu usługi speakerProfileId, zobacz Używanie głosu osobistego w aplikacji.

Należy podać pliki audio z publicznie dostępnego adresu URL (PersonalVoices_Create) lub przekazać pliki audio (PersonalVoices_Post).

Tworzenie osobistego głosu na podstawie pliku

W tym scenariuszu pliki audio muszą być dostępne lokalnie.

Aby utworzyć głos osobisty i uzyskać identyfikator profilu osoby mówiącej, użyj operacji PersonalVoices_Post niestandardowego interfejsu API głosu. Skonstruuj treść żądania zgodnie z następującymi instrukcjami:

  • Ustaw wymaganą projectId właściwość. Zobacz jak stworzyć projekt.
  • Ustaw wymaganą consentId właściwość. Zobacz Dodawanie zgody użytkownika.
  • Ustaw wymaganą audiodata właściwość. W tym samym żądaniu można określić co najmniej jeden plik audio. Maksymalny rozmiar pliku to 30 MB.

Utwórz żądanie HTTP POST przy użyciu adresu URI, jak pokazano w poniższym przykładzie PersonalVoices_Post.

  • Zastąp YourResourceKey kluczem zasobu usługi Rozpoznawanie Mowy.
  • Zastąp YourResourceName nazwą zasobu Speech.
  • Zamień JessicaPersonalVoiceId na wybrany przez siebie osobisty identyfikator głosu. Identyfikator, który rozróżnia wielkość liter, będzie używany w URI głosu osobistego i nie można go zmienić później.
curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourResourceKey" -F 'projectId="ProjectId"' -F 'consentId="JessicaConsentId"' -F 'audiodata=@"D:\PersonalVoiceTest\CNVSample001.wav"' -F 'audiodata=@"D:\PersonalVoiceTest\CNVSample002.wav"' "https://YourResourceName.cognitiveservices.azure.com/customvoice/personalvoices/JessicaPersonalVoiceId?api-version=2026-01-01"

Treść odpowiedzi powinna zostać wyświetlona w następującym formacie:

{
  "id": "JessicaPersonalVoiceId",
  "speakerProfileId": "3059912f-a3dc-49e3-bdd0-02e449df1fe3",
  "projectId": "ProjectId",
  "consentId": "JessicaConsentId",
  "status": "NotStarted",
  "createdDateTime": "2024-09-01T05:30:00.000Z",
  "lastActionDateTime": "2024-09-02T10:15:30.000Z"
}

Użyj właściwości speakerProfileId, aby zintegrować osobisty głos w aplikacji text to speech. Aby uzyskać więcej informacji, zobacz Używanie głosu osobistego w aplikacji.

Nagłówek odpowiedzi zawiera Operation-Location właściwość . Użyj tego URI, aby uzyskać szczegółowe informacje o operacji PersonalVoices_Post. Oto przykład nagłówka odpowiedzi:

Operation-Location: https://YourResourceName.cognitiveservices.azure.com/customvoice/operations/1321a2c0-9be4-471d-83bb-bc3be4f96a6f?api-version=2026-01-01
Operation-Id: 1321a2c0-9be4-471d-83bb-bc3be4f96a6f

Tworzenie osobistego głosu na podstawie adresu URL

W tym scenariuszu pliki audio muszą być już przechowywane w kontenerze Azure Blob Storage.

Aby utworzyć osobisty głos i uzyskać identyfikator profilu osoby mówiącej, użyj PersonalVoices_Create operacji niestandardowego interfejsu API głosu. Skonstruuj treść żądania zgodnie z następującymi instrukcjami:

  • Ustaw wymaganą projectId właściwość. Zobacz jak stworzyć projekt.
  • Ustaw wymaganą consentId właściwość. Zobacz Dodawanie zgody użytkownika.
  • Ustaw wymaganą audios właściwość. W ramach audios właściwości ustaw następujące właściwości:
    • Ustaw wymaganą właściwość containerUrl na adres URL kontenera Azure Blob Storage zawierającego pliki audio. Użyj shared access signatures (SAS) dla kontenera z uprawnieniami do odczytu i wyświetlania listy.
    • Ustaw wymaganą extensions właściwość dla rozszerzeń plików audio.
    • Opcjonalnie ustaw właściwość prefix do ustawienia prefiksu nazwy obiektu blob.

Wykonaj żądanie HTTP PUT przy użyciu adresu URI, jak pokazano w poniższym przykładzie PersonalVoices_Create.

  • Zastąp YourResourceKey kluczem zasobu usługi Rozpoznawanie Mowy.
  • Zastąp YourResourceName nazwą zasobu Speech.
  • Zamień JessicaPersonalVoiceId na wybrany przez siebie osobisty identyfikator głosu. Identyfikator, który rozróżnia wielkość liter, będzie używany w URI głosu osobistego i nie można go zmienić później.
curl -v -X PUT -H "Ocp-Apim-Subscription-Key: YourResourceKey" -H "Content-Type: application/json" -d '{
  "projectId": "ProjectId",
  "consentId": "JessicaConsentId",
  "audios": {
    "containerUrl": "https://contoso.blob.core.windows.net/voicecontainer?mySasToken",
    "prefix": "jessica/", 
    "extensions": [
      ".wav"
    ]
  }
} '  "https://YourResourceName.cognitiveservices.azure.com/customvoice/personalvoices/JessicaPersonalVoiceId?api-version=2026-01-01"

# Ensure the `containerUrl` has both read and list permissions. 
# Ensure the `.wav` files are located in the "jessica" folder within the container. The `prefix` matches all `.wav` files in the "jessica" folder. If there is no such folder, the prefix will match `.wav` files with names starting with "jessica". 

Treść odpowiedzi powinna zostać wyświetlona w następującym formacie:

{
  "id": "JessicaPersonalVoiceId",
  "speakerProfileId": "3059912f-a3dc-49e3-bdd0-02e449df1fe3",
  "projectId": "ProjectId",
  "consentId": "JessicaConsentId",
  "status": "NotStarted",
  "createdDateTime": "2024-09-01T05:30:00.000Z",
  "lastActionDateTime": "2024-09-02T10:15:30.000Z"
}

Użyj właściwości speakerProfileId, aby zintegrować osobisty głos w aplikacji text to speech. Aby uzyskać więcej informacji, zobacz Używanie głosu osobistego w aplikacji.

Nagłówek odpowiedzi zawiera Operation-Location właściwość . Użyj tego identyfikatora URI, aby uzyskać szczegółowe informacje o operacji PersonalVoices_Create . Oto przykład nagłówka odpowiedzi:

Operation-Location: https://YourResourceName.cognitiveservices.azure.com/customvoice/operations/1321a2c0-9be4-471d-83bb-bc3be4f96a6f?api-version=2026-01-01
Operation-Id: 1321a2c0-9be4-471d-83bb-bc3be4f96a6f

Następne kroki