Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Potrzebujesz danych dźwiękowych lub tekstowych do testowania dokładności rozpoznawania mowy lub trenowania modeli niestandardowych. Aby uzyskać informacje o typach danych obsługiwanych do testowania lub trenowania modelu, zobacz Trenowanie i testowanie zestawów danych.
Przekazywanie zestawów danych
Wykonaj następujące kroki, aby załadować zestawy danych do trenowania (dostrajania) niestandardowego modelu mowy.
Ważne
Powtórz kroki przekazywania testowych zestawów danych (takich jak tylko dźwięk), które będą potrzebne później podczas tworzenia testu. Na potrzeby trenowania i testowania można przekazać wiele zestawów danych.
W nowym portalu Microsoft Foundry udostępniasz treningowe i walidacyjne zestawy danych bezpośrednio w kreatorze Dostrajanie modelu, który został otwarty podczas rozpoczęcia niestandardowego dostrajania mowy.
- W okienku Dane trenowania połącz źródło danych i wybierz zestaw danych, którego chcesz użyć do trenowania. Następnie wybierz Dalej.
- W okienku Dane weryfikacji wybierz zestaw danych, którego chcesz użyć, aby ocenić dostosowany model. Następnie wybierz Dalej.
Pozostaw panel Dostrajanie modelu otwarty i przejdź do Trenowanie niestandardowego modelu mowy, aby przesłać zadanie dostrajania.
Aby przekazać własne zestawy danych w programie Speech Studio, wykonaj następujące kroki:
Zaloguj się do programu Speech Studio.
Wybierz pozycję Mowa niestandardowa> nazwa projektu >Zestawy danych mowy>Przekaż dane.
Wybierz kartę Dane szkoleniowe lub Dane testowania.
Wybierz typ zestawu danych, a następnie wybierz pozycję Dalej.
Określ lokalizację zestawu danych, a następnie wybierz pozycję Dalej. Możesz wybrać plik lokalny lub wprowadzić lokalizację zdalną, taką jak adres URL obiektu blob platformy Azure. Jeśli wybierzesz lokalizację zdalną i nie używasz mechanizmu zabezpieczeń zaufanych usług platformy Azure, lokalizacja zdalna powinna być adresem URL, który można pobrać przy użyciu prostego anonimowego żądania GET. Na przykład adres URL SAS lub publicznie dostępny adres URL. Adresy URL, które wymagają dodatkowej autoryzacji lub oczekują interakcji z użytkownikiem, nie są obsługiwane.
Uwaga
Jeśli używasz adresu URL obiektu blob platformy Azure, możesz zapewnić maksymalne bezpieczeństwo plików zestawu danych przy użyciu mechanizmu zabezpieczeń zaufanych usług platformy Azure. Te same techniki są używane w przypadku transkrypcji usługi Batch i zwykłych adresów URL konta magazynu dla plików zestawu danych. Więcej szczegółów można znaleźć tutaj.
Wprowadź nazwę i opis zestawu danych, a następnie wybierz pozycję Dalej.
Przejrzyj ustawienia, a następnie wybierz pozycję Zapisz i zamknij.
Po przesłaniu zestawu danych przejdź do strony Trenowanie modeli niestandardowych, aby wytrenować model niestandardowy.
Przed kontynuowaniem upewnij się, że masz zainstalowany i skonfigurowany Speech CLI.
Korzystając z Speech CLI i REST API do zamiany mowy na tekst, w przeciwieństwie do portalu Microsoft Foundry i Speech Studio, nie wybierasz, czy zestaw danych jest przeznaczony do testowania, czy trenowania w momencie przesyłania. Określasz sposób użycia zestawu danych podczas trenowania modelu lub uruchamiania testu.
Chociaż nie wskazujesz, czy zestaw danych jest przeznaczony do testowania lub trenowania, musisz określić rodzaj zestawu danych. Rodzaj zestawu danych służy do określania typu zestawu danych. W niektórych przypadkach rodzaj zestawu danych jest używany tylko do testowania lub trenowania, ale nie należy na tym polegać. Wartości interfejsu wiersza polecenia usługi Speech i interfejsu API kind REST odpowiadają opcjom w portalu Microsoft Foundry i portalu Speech Studio, zgodnie z opisem w poniższej tabeli.
| Typ CLI i API | Opcje portalu |
|---|---|
| Akustyczny | Dane szkoleniowe: audio + transkrypcja oznaczona przez człowieka Testowanie danych: Transkrypcja (automatyczna synteza dźwięku) Testowanie danych: audio i transkrypcja oznaczona przez człowieka |
| Pliki audio | Testowanie danych: dźwięk |
| Język | Dane szkoleniowe: zwykły tekst |
| LanguageMarkdown | Dane szkoleniowe: tekst ustrukturyzowany w formacie markdown |
| Wymowa | Dane treningowe: wymowa |
| Formatowanie danych wyjściowych | Dane treningowe: format danych wyjściowych |
Ważne
Nie używasz interfejsu wiersza polecenia Speech ani interfejsu API REST do bezpośredniego przesyłania plików danych. Najpierw należy zapisać pliki treningowego lub testowego zestawu danych pod adresem URL, do którego Speech CLI lub interfejs API REST ma dostęp. Po przekazaniu plików danych możesz użyć interfejsu wiersza polecenia usługi Mowa lub interfejsu API REST, aby utworzyć zestaw danych na potrzeby niestandardowego testowania lub trenowania mowy.
Aby utworzyć zestaw danych i połączyć go z istniejącym projektem, użyj spx csr dataset create polecenia . Skonstruuj parametry żądania zgodnie z następującymi instrukcjami:
Ustaw właściwość
projectna identyfikator istniejącego projektu. Aby również zarządzać dostosowaniem mowy niestandardowej w portalu Microsoft Foundry, użyj właściwościproject. Aby uzyskać identyfikator projektu, zobacz Pobieranie identyfikatora projektu dla dokumentacji interfejsu API REST .Ustaw wymaganą
kindwłaściwość. Możliwe wartości dla rodzaju treningowego zestawu danych to: Acoustic, AudioFiles, Language, LanguageMarkdown i Pronunciation.Ustaw wymaganą
contentUrlwłaściwość. Ten parametr jest lokalizacją zestawu danych. Jeśli nie używasz mechanizmu zabezpieczeń zaufanych usług platformy Azure (zobacz następną notatkę),contentUrlwłaściwość powinna być adresem URL, który można pobrać za pomocą prostego anonimowego żądania GET. Na przykład adres URL SAS lub publicznie dostępny adres URL. Adresy URL, które wymagają dodatkowej autoryzacji lub oczekują interakcji z użytkownikiem, nie są obsługiwane.Uwaga
Jeśli używasz adresu URL obiektu blob platformy Azure, możesz zapewnić maksymalne bezpieczeństwo plików zestawu danych przy użyciu mechanizmu zabezpieczeń zaufanych usług platformy Azure. Te same techniki są używane w przypadku transkrypcji usługi Batch i zwykłych adresów URL konta magazynu dla plików zestawu danych. Więcej szczegółów można znaleźć tutaj.
Ustaw wymaganą
languagewłaściwość. Ustawienia regionalne zestawu danych muszą być zgodne z ustawieniami regionalnymi projektu. Nie można później zmienić ustawień regionalnych. Właściwośćlanguageinterfejsu wiersza polecenia usługi Mowa odpowiada właściwościlocalew żądaniu i odpowiedzi w formacie JSON.Ustaw wymaganą
namewłaściwość. Ten parametr to nazwa wyświetlana w portalu Microsoft Foundry. Właściwośćnameinterfejsu wiersza polecenia usługi Mowa odpowiada właściwościdisplayNamew żądaniu i odpowiedzi w formacie JSON.
Oto przykładowe polecenie interfejsu wiersza polecenia usługi Speech, które tworzy zestaw danych i łączy go z istniejącym projektem:
spx csr dataset create --api-version v3.2 --kind "Acoustic" --name "My Acoustic Dataset" --description "My Acoustic Dataset Description" --project YourProjectId --content YourContentUrl --language "en-US"
Ważne
Musisz ustawić wartość --api-version v3.2. Interfejs wiersza polecenia usługi Mowa używa interfejsu API REST, ale nie obsługuje jeszcze wersji nowszych niż v3.2.
Otrzymujesz treść odpowiedzi w następującym formacie:
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/aaaabbbb-0000-cccc-1111-dddd2222eeee",
"kind": "Acoustic",
"links": {
"files": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/23b6554d-21f9-4df1-89cb-f84510ac8d23/files"
},
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/bbbbcccc-1111-dddd-2222-eeee3333ffff"
},
"properties": {
"textNormalizationKind": "Default",
"acceptedLineCount": 2,
"rejectedLineCount": 0,
"duration": "PT59S"
},
"lastActionDateTime": "2024-07-14T17:36:30Z",
"status": "Succeeded",
"createdDateTime": "2024-07-14T17:36:14Z",
"locale": "en-US",
"displayName": "My Acoustic Dataset",
"description": "My Acoustic Dataset Description",
"customProperties": {
"PortalAPIVersion": "3"
}
}
Właściwość najwyższego poziomu self w treści odpowiedzi to identyfikator URI zestawu danych. Użyj tego identyfikatora URI, aby uzyskać szczegółowe informacje o projekcie i plikach zestawu danych. Ten identyfikator URI służy również do aktualizowania lub usuwania zestawu danych.
Aby uzyskać pomoc dotyczącą zestawów danych w narzędziu Speech CLI, uruchom następujące polecenie:
spx help csr dataset
Korzystając z Speech CLI i REST API do zamiany mowy na tekst, w przeciwieństwie do portalu Microsoft Foundry i Speech Studio, nie wybierasz, czy zestaw danych jest przeznaczony do testowania, czy trenowania w momencie przesyłania. Określasz sposób użycia zestawu danych podczas trenowania modelu lub uruchamiania testu.
Chociaż nie wskazujesz, czy zestaw danych jest przeznaczony do testowania lub trenowania, musisz określić rodzaj zestawu danych. Rodzaj zestawu danych służy do określania typu zestawu danych. W niektórych przypadkach rodzaj zestawu danych jest używany tylko do testowania lub trenowania, ale nie należy na tym polegać. Wartości interfejsu wiersza polecenia usługi Speech i interfejsu API kind REST odpowiadają opcjom w portalu Microsoft Foundry i portalu Speech Studio, zgodnie z opisem w poniższej tabeli.
| Typ CLI i API | Opcje portalu |
|---|---|
| Akustyczny | Dane szkoleniowe: audio + transkrypcja oznaczona przez człowieka Testowanie danych: Transkrypcja (automatyczna synteza dźwięku) Testowanie danych: audio i transkrypcja oznaczona przez człowieka |
| Pliki audio | Testowanie danych: dźwięk |
| Język | Dane szkoleniowe: zwykły tekst |
| LanguageMarkdown | Dane szkoleniowe: tekst ustrukturyzowany w formacie markdown |
| Wymowa | Dane treningowe: wymowa |
| Formatowanie danych wyjściowych | Dane treningowe: format danych wyjściowych |
Ważne
Nie używasz interfejsu wiersza polecenia Speech ani interfejsu API REST do bezpośredniego przesyłania plików danych. Najpierw należy zapisać pliki treningowego lub testowego zestawu danych pod adresem URL, do którego Speech CLI lub interfejs API REST ma dostęp. Po przekazaniu plików danych możesz użyć interfejsu wiersza polecenia usługi Mowa lub interfejsu API REST, aby utworzyć zestaw danych na potrzeby niestandardowego testowania lub trenowania mowy.
Aby utworzyć zestaw danych i połączyć go z istniejącym projektem, użyj operacji Datasets_Create interfejsu API REST usługi zamiany mowy na tekst. Skonstruuj treść żądania zgodnie z następującymi instrukcjami:
Ustaw właściwość
projectna identyfikator istniejącego projektu. Aby również zarządzać dostosowaniem mowy niestandardowej w portalu Microsoft Foundry, użyj właściwościproject. Aby uzyskać identyfikator projektu, zobacz Pobieranie identyfikatora projektu dla dokumentacji interfejsu API REST .Ustaw wymaganą
kindwłaściwość. Możliwe wartości dla rodzaju treningowego zestawu danych to: Acoustic, AudioFiles, Language, LanguageMarkdown i Pronunciation.Ustaw wymaganą
contentUrlwłaściwość. Ta właściwość jest lokalizacją zestawu danych. Jeśli nie używasz mechanizmu zabezpieczeń zaufanych usług platformy Azure (zobacz następną notatkę),contentUrlwłaściwość powinna być adresem URL, który można pobrać za pomocą prostego anonimowego żądania GET. Na przykład adres URL SAS lub publicznie dostępny adres URL. Adresy URL, które wymagają dodatkowej autoryzacji lub oczekują interakcji z użytkownikiem, nie są obsługiwane.Uwaga
Jeśli używasz adresu URL obiektu blob platformy Azure, możesz zapewnić maksymalne bezpieczeństwo plików zestawu danych przy użyciu mechanizmu zabezpieczeń zaufanych usług platformy Azure. Te same techniki są używane w przypadku transkrypcji usługi Batch i zwykłych adresów URL konta magazynu dla plików zestawu danych. Więcej szczegółów można znaleźć tutaj.
Ustaw wymaganą
localewłaściwość. Ustawienia regionalne zestawu danych muszą być zgodne z ustawieniami regionalnymi projektu. Nie można później zmienić ustawień regionalnych.Ustaw wymaganą
displayNamewłaściwość. Ta właściwość to nazwa wyświetlana w portalu Microsoft Foundry.
Utwórz żądanie HTTP POST przy użyciu identyfikatora URI, jak pokazano w poniższym przykładzie. Zastąp element YourSpeechResoureKey kluczem zasobu usługi Speech, element YourResourceName nazwą zasobu usługi Speech i ustaw właściwości treści żądania zgodnie z wcześniejszym opisem.
curl -v -X POST -H "Ocp-Apim-Subscription-Key: YourSpeechResoureKey" -H "Content-Type: application/json" -d '{
"kind": "Acoustic",
"displayName": "My Acoustic Dataset",
"description": "My Acoustic Dataset Description",
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/bbbbcccc-1111-dddd-2222-eeee3333ffff"
},
"contentUrl": "https://contoso.com/mydatasetlocation",
"locale": "en-US",
}' "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets"
Otrzymujesz treść odpowiedzi w następującym formacie:
{
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/aaaabbbb-0000-cccc-1111-dddd2222eeee",
"kind": "Acoustic",
"links": {
"files": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/datasets/23b6554d-21f9-4df1-89cb-f84510ac8d23/files"
},
"project": {
"self": "https://YourResourceName.cognitiveservices.azure.com/speechtotext/v3.2/projects/bbbbcccc-1111-dddd-2222-eeee3333ffff"
},
"properties": {
"textNormalizationKind": "Default",
"acceptedLineCount": 2,
"rejectedLineCount": 0,
"duration": "PT59S"
},
"lastActionDateTime": "2024-07-14T17:36:30Z",
"status": "Succeeded",
"createdDateTime": "2024-07-14T17:36:14Z",
"locale": "en-US",
"displayName": "My Acoustic Dataset",
"description": "My Acoustic Dataset Description",
"customProperties": {
"PortalAPIVersion": "3"
}
}
Właściwość najwyższego poziomu self w treści odpowiedzi to identyfikator URI zestawu danych. Użyj tego identyfikatora URI, aby uzyskać szczegółowe informacje o projekcie i plikach zestawu danych. Ten identyfikator URI służy również do aktualizowania lub usuwania zestawu danych.
Ważne
Nie musisz łączyć zestawu danych z projektem niestandardowej mowy w celu trenowania i testowania modelu niestandardowego przy użyciu interfejsu API REST lub interfejsu wiersza polecenia usługi Mowa. Jeśli jednak nie połączysz zestawu danych z projektem, nie możesz go wybrać do trenowania ani testowania w portalu Microsoft Foundry.