Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Podobnie jak Azure Speech w głosach narzędzi Foundry Tools, głosy tekstu na mowę OpenAI zapewniają wysokiej jakości syntezę mowy, aby przekształcić tekst pisany w naturalnie brzmiący dźwięk mówiony. Dzięki temu można uzyskać szeroką gamę możliwości immersyjnych i interaktywnych środowisk użytkownika.
Głosy tekstu na mowę OpenAI są dostępne za pośrednictwem dwóch wariantów modelu: Neural i NeuralHD.
-
Neural: Zoptymalizowane pod kątem przypadków użycia w czasie rzeczywistym z najniższym opóźnieniem, ale niższej jakości niżNeuralHD. -
NeuralHD: zoptymalizowany pod kątem jakości.
Dostępny tekst na głosy mowy w narzędziach Foundry Tools
Możesz zapytać: Jeśli chcę użyć głosu tekstu na mowę OpenAI, czy powinienem to zrobić za pośrednictwem Microsoft Foundry Models Azure OpenAI, czy za pośrednictwem Azure Speech? Jakie scenariusze prowadzą mnie do korzystania z jednego lub drugiego?
Każdy model głosu oferuje różne funkcje i możliwości, co pozwala wybrać ten, który najlepiej odpowiada twoim potrzebom. Chcesz poznać opcje i różnice między dostępnym tekstem i głosami mowy w narzędziach Foundry Tools.
Możesz wybrać jedną z następujących opcji tekstowych na głosy mowy w narzędziach Foundry Tools:
- Tekst openAI na głosy mowy w Azure OpenAI. Aby zapoznać się z bieżącą listą obsługiwanych regionów, zobacz tabelę Regiony usługi Mowa.
- Otwórz tekst AI na głosy mowy w Azure Mowa. Aby zapoznać się z bieżącą listą obsługiwanych regionów, zobacz tabelę Regiony usługi Mowa.
- Azure usługa zamiany tekstu na mowę. Dostępne w kilkudziesięciu regionach. Zobacz listę regionów.
"Tekst na mowę OpenAI za pośrednictwem usług Azure OpenAI lub Azure Speech?"
Jeśli chcesz używać tekstu OpenAI do mowy głosów, możesz wybrać, czy używać ich za pośrednictwem Azure OpenAI lub za pośrednictwem Azure Speech. Możesz odwiedzić galerię Voice aby nasłuchiwać próbek głosów Azure OpenAI lub syntetyzować mowę własnym tekstem przy użyciu Audio Content Creation. Dźwięk wyjściowy jest identyczny w obu przypadkach, z jedynie kilkoma różnicami w funkcjach między dwiema usługami. Aby uzyskać szczegółowe informacje, zobacz poniższą tabelę.
Poniżej przedstawiono porównanie cech między głosami tekstu na mowę OpenAI w Azure OpenAI a głosami tekstu na mowę OpenAI w usłudze Azure Speech.
| Funkcja | Azure OpenAI (głosy OpenAI) | Azure Usługa Mowy (głosy OpenAI) | Głosy w usłudze Azure Speech |
|---|---|---|---|
| Region | Zobacz tabelę regionów modeli odlewniczych | Zobacz tabelę regionów modeli odlewniczych | Dostępne w kilkudziesięciu regionach. Zobacz listę regionów. |
| Różnorodność głosu | 6 | 12 | Ponad 500 |
| Wielojęzyczny numer głosu | 6 | 12 | 49 |
| Maksymalna obsługa języków wielojęzycznych | 57 | 57 | 77 |
| Obsługa języka znaczników syntezy mowy (SSML) | Niewspierany | Obsługa podzbioru elementów SSML. | Obsługa pełnego zestawu SSML w Azure Speech. |
| Opcje programowania | interfejs API REST | Speech SDK, Speech CLI, REST API | Speech SDK, Speech CLI, interfejs API REST |
| Opcja wdrożenia | Tylko chmura | Tylko chmura | Chmura, systemy wbudowane, hybryda i kontenery. |
| Synteza w czasie rzeczywistym lub przetwarzanie wsadowe | Realny czas | Realny czas | Synteza w czasie rzeczywistym i wsadowa |
| Opóźnienie | więcej niż 500 ms | więcej niż 500 ms | mniej niż 300 ms |
| Częstotliwość próbkowania syntetyzowanego dźwięku | 24 kHz | 8, 16, 24 i 48 kHz | 8, 16, 24 i 48 kHz |
| Format dźwięku wyjściowego mowy | opus, mp3, aac, flac | opus, mp3, pcm, truesilk | opus, mp3, pcm, truesilk |
Istnieją dodatkowe funkcje i możliwości dostępne w usłudze Azure Mowa, które nie są dostępne w przypadku głosów openAI. Na przykład:
- Głosy mowy OpenAI w Azure Speech tylko obsługują podzestaw elementów SSML. Głosy usługi mowy Azure obsługują pełny zestaw elementów SSML.
- Usługa Azure Speech obsługuje zdarzenia granic słów. Głosy OpenAI nie obsługują zdarzeń granic słów.
Dostępny tekst OpenAI na głosy mowy
Dostępne głosy OpenAI w programie Azure OpenAI to:
alloyechofableonyxnovashimmer
Dostępne głosy openAI w usłudze Azure Mowa to:
en-US-AlloyMultilingualNeuralen-US-EchoMultilingualNeuralen-US-FableMultilingualNeuralen-US-OnyxMultilingualNeuralen-US-NovaMultilingualNeuralen-US-ShimmerMultilingualNeuralen-US-AlloyMultilingualNeuralHDen-US-EchoMultilingualNeuralHDen-US-FableMultilingualNeuralHDen-US-OnyxMultilingualNeuralHDen-US-NovaMultilingualNeuralHDen-US-ShimmerMultilingualNeuralHD
Elementy SSML obsługiwane przez głosy syntezatora mowy OpenAI w usłudze Azure Speech
Język znaczników syntezy mowy (SSML) wraz z tekstem wejściowym określa strukturę, zawartość oraz inne cechy tekstu na potrzeby syntezy mowy. Na przykład można użyć języka SSML do zdefiniowania akapitu, zdania, przerwania lub wstrzymania lub ciszy. Tekst można otagować tagami zdarzeń, takimi jak zakładka lub viseme, które można później przetwarzać w aplikacji.
Poniższa tabela przedstawia elementy języka SSML (Speech Synthesis Markup Language) obsługiwane przez głosy tekstu na mowę OpenAI w usłudze Azure Speech. Tylko następujący podzestaw tagów SSML jest obsługiwany w przypadku głosów openAI. Aby uzyskać więcej informacji, zobacz strukturę i zdarzenia dokumentu SSML .
| Nazwa elementu SSML | Opis |
|---|---|
<speak> |
Otacza całą zawartość, która ma być wypowiadana. Jest to element główny dokumentu SSML. |
<voice> |
Określa głos używany do zamiany tekstu na mowę. |
<sub> |
Wskazuje, że wartość tekstowa atrybutu aliasu powinna być wymawiana zamiast tekstu zawartego w elemencie. |
<say-as> |
Wskazuje typ zawartości, taki jak liczba lub data, tekstu elementu.interpret-as Wszystkie wartości właściwości są obsługiwane dla tego elementu z wyjątkiem interpret-as="name". Na przykład jest obsługiwany, <say-as interpret-as="date" format="dmy">10-12-2016</say-as> ale <say-as interpret-as="name">ED</say-as> nie jest obsługiwany. Aby uzyskać więcej informacji, zobacz wymowa za pomocą języka SSML. |
<s> |
Oznacza zdania. |
<lang> |
Wskazuje domyślne ustawienia regionalne dla języka, który ma mówić neuronowy głos. |
<break> |
Służy do zastępowania domyślnego zachowania podziałów lub pauz między wyrazami. |