Przekaż zestawy danych szkoleniowych i testowych dla funkcji Niestandardowa mowa

Potrzebujesz danych dźwiękowych lub tekstowych do testowania dokładności rozpoznawania mowy lub trenowania modeli niestandardowych. Aby uzyskać informacje o typach danych obsługiwanych do testowania lub trenowania modelu, zobacz Trenowanie i testowanie zestawów danych.

Przekazywanie zestawów danych

Wykonaj następujące kroki, aby załadować zestawy danych do trenowania (dostrajania) niestandardowego modelu mowy.

Ważne

Powtórz kroki przekazywania testowych zestawów danych (takich jak tylko dźwięk), które będą potrzebne później podczas tworzenia testu. Na potrzeby trenowania i testowania można przekazać wiele zestawów danych.

W nowym portalu Microsoft Foundry udostępniasz treningowe i walidacyjne zestawy danych bezpośrednio w kreatorze Dostrajanie modelu, który został otwarty podczas rozpoczęcia niestandardowego dostrajania mowy.

  1. W okienku Dane trenowania połącz źródło danych i wybierz zestaw danych, którego chcesz użyć do trenowania. Następnie wybierz Dalej.
  2. W okienku Dane weryfikacji wybierz zestaw danych, którego chcesz użyć, aby ocenić dostosowany model. Następnie wybierz Dalej.

Pozostaw panel Dostrajanie modelu otwarty i przejdź do Trenowanie niestandardowego modelu mowy, aby przesłać zadanie dostrajania.

Aby przekazać własne zestawy danych w programie Speech Studio, wykonaj następujące kroki:

  1. Zaloguj się do programu Speech Studio.

  2. Wybierz pozycję Mowa niestandardowa> nazwa projektu >Zestawy danych mowy>Przekaż dane.

  3. Wybierz kartę Dane szkoleniowe lub Dane testowania.

  4. Wybierz typ zestawu danych, a następnie wybierz pozycję Dalej.

  5. Określ lokalizację zestawu danych, a następnie wybierz pozycję Dalej. Możesz wybrać plik lokalny lub wprowadzić lokalizację zdalną, taką jak adres URL obiektu blob platformy Azure. Jeśli wybierzesz lokalizację zdalną i nie używasz mechanizmu zabezpieczeń zaufanych usług platformy Azure, lokalizacja zdalna powinna być adresem URL, który można pobrać przy użyciu prostego anonimowego żądania GET. Na przykład adres URL SAS lub publicznie dostępny adres URL. Adresy URL, które wymagają dodatkowej autoryzacji lub oczekują interakcji z użytkownikiem, nie są obsługiwane.

    Uwaga

    Jeśli używasz adresu URL obiektu blob platformy Azure, możesz zapewnić maksymalne bezpieczeństwo plików zestawu danych przy użyciu mechanizmu zabezpieczeń zaufanych usług platformy Azure. Te same techniki są używane w przypadku transkrypcji usługi Batch i zwykłych adresów URL konta magazynu dla plików zestawu danych. Więcej szczegółów można znaleźć tutaj.

  6. Wprowadź nazwę i opis zestawu danych, a następnie wybierz pozycję Dalej.

  7. Przejrzyj ustawienia, a następnie wybierz pozycję Zapisz i zamknij.

Po przesłaniu zestawu danych przejdź do strony Trenowanie modeli niestandardowych, aby wytrenować model niestandardowy.

Przed kontynuowaniem upewnij się, że masz zainstalowany i skonfigurowany Speech CLI.

Korzystając z Speech CLI i REST API do zamiany mowy na tekst, w przeciwieństwie do portalu Microsoft Foundry i Speech Studio, nie wybierasz, czy zestaw danych jest przeznaczony do testowania, czy trenowania w momencie przesyłania. Określasz sposób użycia zestawu danych podczas trenowania modelu lub uruchamiania testu.

Chociaż nie wskazujesz, czy zestaw danych jest przeznaczony do testowania lub trenowania, musisz określić rodzaj zestawu danych. Rodzaj zestawu danych służy do określania typu zestawu danych. W niektórych przypadkach rodzaj zestawu danych jest używany tylko do testowania lub trenowania, ale nie należy na tym polegać. Wartości interfejsu wiersza polecenia usługi Speech i interfejsu API kind REST odpowiadają opcjom w portalu Microsoft Foundry i portalu Speech Studio, zgodnie z opisem w poniższej tabeli.

Typ CLI i API Opcje portalu
Akustyczny Dane szkoleniowe: audio + transkrypcja oznaczona przez człowieka
Testowanie danych: Transkrypcja (automatyczna synteza dźwięku)
Testowanie danych: audio i transkrypcja oznaczona przez człowieka
Pliki audio Testowanie danych: dźwięk
Język Dane szkoleniowe: zwykły tekst
LanguageMarkdown Dane szkoleniowe: tekst ustrukturyzowany w formacie markdown
Wymowa Dane treningowe: wymowa
Formatowanie danych wyjściowych Dane treningowe: format danych wyjściowych

Ważne

Nie używasz interfejsu wiersza polecenia Speech ani interfejsu API REST do bezpośredniego przesyłania plików danych. Najpierw należy zapisać pliki treningowego lub testowego zestawu danych pod adresem URL, do którego Speech CLI lub interfejs API REST ma dostęp. Po przekazaniu plików danych możesz użyć interfejsu wiersza polecenia usługi Mowa lub interfejsu API REST, aby utworzyć zestaw danych na potrzeby niestandardowego testowania lub trenowania mowy.

Aby utworzyć zestaw danych i połączyć go z istniejącym projektem, użyj spx csr dataset create polecenia . Skonstruuj parametry żądania zgodnie z następującymi instrukcjami:

  • Ustaw właściwość project na identyfikator istniejącego projektu. Aby również zarządzać dostosowaniem mowy niestandardowej w portalu Microsoft Foundry, użyj właściwości project. Aby uzyskać identyfikator projektu, zobacz Pobieranie identyfikatora projektu dla dokumentacji interfejsu API REST .

  • Ustaw wymaganą kind właściwość. Możliwe wartości dla rodzaju treningowego zestawu danych to: Acoustic, AudioFiles, Language, LanguageMarkdown i Pronunciation.

  • Ustaw wymaganą contentUrl właściwość. Ten parametr jest lokalizacją zestawu danych. Jeśli nie używasz mechanizmu zabezpieczeń zaufanych usług platformy Azure (zobacz następną notatkę), contentUrl właściwość powinna być adresem URL, który można pobrać za pomocą prostego anonimowego żądania GET. Na przykład adres URL SAS lub publicznie dostępny adres URL. Adresy URL, które wymagają dodatkowej autoryzacji lub oczekują interakcji z użytkownikiem, nie są obsługiwane.

    Uwaga

    Jeśli używasz adresu URL obiektu blob platformy Azure, możesz zapewnić maksymalne bezpieczeństwo plików zestawu danych przy użyciu mechanizmu zabezpieczeń zaufanych usług platformy Azure. Te same techniki są używane w przypadku transkrypcji usługi Batch i zwykłych adresów URL konta magazynu dla plików zestawu danych. Więcej szczegółów można znaleźć tutaj.

  • Ustaw wymaganą language właściwość. Ustawienia regionalne zestawu danych muszą być zgodne z ustawieniami regionalnymi projektu. Nie można później zmienić ustawień regionalnych. Właściwość language interfejsu wiersza polecenia usługi Mowa odpowiada właściwości locale w żądaniu i odpowiedzi w formacie JSON.

  • Ustaw wymaganą name właściwość. Ten parametr to nazwa wyświetlana w portalu Microsoft Foundry. Właściwość name interfejsu wiersza polecenia usługi Mowa odpowiada właściwości displayName w żądaniu i odpowiedzi w formacie JSON.

Oto przykładowe polecenie interfejsu wiersza polecenia usługi Speech, które tworzy zestaw danych i łączy go z istniejącym projektem:

spx csr dataset create --api-version v3.2 --kind "Acoustic" --name "My Acoustic Dataset" --description "My Acoustic Dataset Description" --project YourProjectId --content YourContentUrl --language "en-US"

Ważne

Musisz ustawić wartość --api-version v3.2. Interfejs wiersza polecenia usługi Mowa używa interfejsu API REST, ale nie obsługuje jeszcze wersji nowszych niż v3.2.

Otrzymujesz treść odpowiedzi w następującym formacie:

{
  "self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/aaaabbbb-0000-cccc-1111-dddd2222eeee",
  "kind": "Acoustic",
  "links": {
    "files": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/23b6554d-21f9-4df1-89cb-f84510ac8d23/files"
  },
  "project": {
    "self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/bbbbcccc-1111-dddd-2222-eeee3333ffff"
  },
  "properties": {
    "textNormalizationKind": "Default",
    "acceptedLineCount": 2,
    "rejectedLineCount": 0,
    "duration": "PT59S"
  },
  "lastActionDateTime": "2024-07-14T17:36:30Z",
  "status": "Succeeded",
  "createdDateTime": "2024-07-14T17:36:14Z",
  "locale": "en-US",
  "displayName": "My Acoustic Dataset",
  "description": "My Acoustic Dataset Description",
  "customProperties": {
    "PortalAPIVersion": "3"
  }
}

Właściwość najwyższego poziomu self w treści odpowiedzi to identyfikator URI zestawu danych. Użyj tego identyfikatora URI, aby uzyskać szczegółowe informacje o projekcie i plikach zestawu danych. Ten identyfikator URI służy również do aktualizowania lub usuwania zestawu danych.

Aby uzyskać pomoc dotyczącą zestawów danych w narzędziu Speech CLI, uruchom następujące polecenie:

spx help csr dataset

Korzystając z Speech CLI i REST API do zamiany mowy na tekst, w przeciwieństwie do portalu Microsoft Foundry i Speech Studio, nie wybierasz, czy zestaw danych jest przeznaczony do testowania, czy trenowania w momencie przesyłania. Określasz sposób użycia zestawu danych podczas trenowania modelu lub uruchamiania testu.

Chociaż nie wskazujesz, czy zestaw danych jest przeznaczony do testowania lub trenowania, musisz określić rodzaj zestawu danych. Rodzaj zestawu danych służy do określania typu zestawu danych. W niektórych przypadkach rodzaj zestawu danych jest używany tylko do testowania lub trenowania, ale nie należy na tym polegać. Wartości interfejsu wiersza polecenia usługi Speech i interfejsu API kind REST odpowiadają opcjom w portalu Microsoft Foundry i portalu Speech Studio, zgodnie z opisem w poniższej tabeli.

Typ CLI i API Opcje portalu
Akustyczny Dane szkoleniowe: audio + transkrypcja oznaczona przez człowieka
Testowanie danych: Transkrypcja (automatyczna synteza dźwięku)
Testowanie danych: audio i transkrypcja oznaczona przez człowieka
Pliki audio Testowanie danych: dźwięk
Język Dane szkoleniowe: zwykły tekst
LanguageMarkdown Dane szkoleniowe: tekst ustrukturyzowany w formacie markdown
Wymowa Dane treningowe: wymowa
Formatowanie danych wyjściowych Dane treningowe: format danych wyjściowych

Ważne

Nie używasz interfejsu wiersza polecenia Speech ani interfejsu API REST do bezpośredniego przesyłania plików danych. Najpierw należy zapisać pliki treningowego lub testowego zestawu danych pod adresem URL, do którego Speech CLI lub interfejs API REST ma dostęp. Po przekazaniu plików danych możesz użyć interfejsu wiersza polecenia usługi Mowa lub interfejsu API REST, aby utworzyć zestaw danych na potrzeby niestandardowego testowania lub trenowania mowy.

Aby utworzyć zestaw danych i połączyć go z istniejącym projektem, użyj operacji Datasets_Create interfejsu API REST usługi zamiany mowy na tekst. Skonstruuj treść żądania zgodnie z następującymi instrukcjami:

  • Ustaw właściwość project na identyfikator istniejącego projektu. Aby również zarządzać dostosowaniem mowy niestandardowej w portalu Microsoft Foundry, użyj właściwości project. Aby uzyskać identyfikator projektu, zobacz Pobieranie identyfikatora projektu dla dokumentacji interfejsu API REST .

  • Ustaw wymaganą kind właściwość. Możliwe wartości dla rodzaju treningowego zestawu danych to: Acoustic, AudioFiles, Language, LanguageMarkdown i Pronunciation.

  • Ustaw wymaganą contentUrl właściwość. Ta właściwość jest lokalizacją zestawu danych. Jeśli nie używasz mechanizmu zabezpieczeń zaufanych usług platformy Azure (zobacz następną notatkę), contentUrl właściwość powinna być adresem URL, który można pobrać za pomocą prostego anonimowego żądania GET. Na przykład adres URL SAS lub publicznie dostępny adres URL. Adresy URL, które wymagają dodatkowej autoryzacji lub oczekują interakcji z użytkownikiem, nie są obsługiwane.

    Uwaga

    Jeśli używasz adresu URL obiektu blob platformy Azure, możesz zapewnić maksymalne bezpieczeństwo plików zestawu danych przy użyciu mechanizmu zabezpieczeń zaufanych usług platformy Azure. Te same techniki są używane w przypadku transkrypcji usługi Batch i zwykłych adresów URL konta magazynu dla plików zestawu danych. Więcej szczegółów można znaleźć tutaj.

  • Ustaw wymaganą locale właściwość. Ustawienia regionalne zestawu danych muszą być zgodne z ustawieniami regionalnymi projektu. Nie można później zmienić ustawień regionalnych.

  • Ustaw wymaganą displayName właściwość. Ta właściwość to nazwa wyświetlana w portalu Microsoft Foundry.

Utwórz żądanie HTTP POST przy użyciu identyfikatora URI, jak pokazano w poniższym przykładzie. Zastąp element YourSpeechResoureKey kluczem zasobu usługi Speech, element YourResourceName nazwą zasobu usługi Speech i ustaw właściwości treści żądania zgodnie z wcześniejszym opisem.

curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourSpeechResoureKey" -H "Content-Type: application/json" -d '{
  "kind": "Acoustic",
  "displayName": "My Acoustic Dataset",
  "description": "My Acoustic Dataset Description",
  "project": {
    "self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/bbbbcccc-1111-dddd-2222-eeee3333ffff"
  },
  "contentUrl": "https://contoso.com/mydatasetlocation",
  "locale": "en-US",
}'  "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets"

Otrzymujesz treść odpowiedzi w następującym formacie:

{
  "self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/aaaabbbb-0000-cccc-1111-dddd2222eeee",
  "kind": "Acoustic",
  "links": {
    "files": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/23b6554d-21f9-4df1-89cb-f84510ac8d23/files"
  },
  "project": {
    "self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/bbbbcccc-1111-dddd-2222-eeee3333ffff"
  },
  "properties": {
    "textNormalizationKind": "Default",
    "acceptedLineCount": 2,
    "rejectedLineCount": 0,
    "duration": "PT59S"
  },
  "lastActionDateTime": "2024-07-14T17:36:30Z",
  "status": "Succeeded",
  "createdDateTime": "2024-07-14T17:36:14Z",
  "locale": "en-US",
  "displayName": "My Acoustic Dataset",
  "description": "My Acoustic Dataset Description",
  "customProperties": {
    "PortalAPIVersion": "3"
  }
}

Właściwość najwyższego poziomu self w treści odpowiedzi to identyfikator URI zestawu danych. Użyj tego identyfikatora URI, aby uzyskać szczegółowe informacje o projekcie i plikach zestawu danych. Ten identyfikator URI służy również do aktualizowania lub usuwania zestawu danych.

Ważne

Nie musisz łączyć zestawu danych z projektem niestandardowej mowy w celu trenowania i testowania modelu niestandardowego przy użyciu interfejsu API REST lub interfejsu wiersza polecenia usługi Mowa. Jeśli jednak nie połączysz zestawu danych z projektem, nie możesz go wybrać do trenowania ani testowania w portalu Microsoft Foundry.

Następne kroki