Czym są głosy zamiany tekstu na mowę w OpenAI?

Podobnie jak Azure Speech w głosach narzędzi Foundry Tools, głosy tekstu na mowę OpenAI zapewniają wysokiej jakości syntezę mowy, aby przekształcić tekst pisany w naturalnie brzmiący dźwięk mówiony. Dzięki temu można uzyskać szeroką gamę możliwości immersyjnych i interaktywnych środowisk użytkownika.

Głosy tekstu na mowę OpenAI są dostępne za pośrednictwem dwóch wariantów modelu: Neural i NeuralHD.

  • Neural: Zoptymalizowane pod kątem przypadków użycia w czasie rzeczywistym z najniższym opóźnieniem, ale niższej jakości niż NeuralHD.
  • NeuralHD: zoptymalizowany pod kątem jakości.

Dostępny tekst na głosy mowy w narzędziach Foundry Tools

Możesz zapytać: Jeśli chcę użyć głosu tekstu na mowę OpenAI, czy powinienem to zrobić za pośrednictwem Microsoft Foundry Models Azure OpenAI, czy za pośrednictwem Azure Speech? Jakie scenariusze prowadzą mnie do korzystania z jednego lub drugiego?

Każdy model głosu oferuje różne funkcje i możliwości, co pozwala wybrać ten, który najlepiej odpowiada twoim potrzebom. Chcesz poznać opcje i różnice między dostępnym tekstem i głosami mowy w narzędziach Foundry Tools.

Możesz wybrać jedną z następujących opcji tekstowych na głosy mowy w narzędziach Foundry Tools:

"Tekst na mowę OpenAI za pośrednictwem usług Azure OpenAI lub Azure Speech?"

Jeśli chcesz używać tekstu OpenAI do mowy głosów, możesz wybrać, czy używać ich za pośrednictwem Azure OpenAI lub za pośrednictwem Azure Speech. Możesz odwiedzić galerię Voice aby nasłuchiwać próbek głosów Azure OpenAI lub syntetyzować mowę własnym tekstem przy użyciu Audio Content Creation. Dźwięk wyjściowy jest identyczny w obu przypadkach, z jedynie kilkoma różnicami w funkcjach między dwiema usługami. Aby uzyskać szczegółowe informacje, zobacz poniższą tabelę.

Poniżej przedstawiono porównanie cech między głosami tekstu na mowę OpenAI w Azure OpenAI a głosami tekstu na mowę OpenAI w usłudze Azure Speech.

Funkcja Azure OpenAI (głosy OpenAI) Azure Usługa Mowy (głosy OpenAI) Głosy w usłudze Azure Speech
Region Zobacz tabelę regionów modeli odlewniczych Zobacz tabelę regionów modeli odlewniczych Dostępne w kilkudziesięciu regionach. Zobacz listę regionów.
Różnorodność głosu 6 12 Ponad 500
Wielojęzyczny numer głosu 6 12 49
Maksymalna obsługa języków wielojęzycznych 57 57 77
Obsługa języka znaczników syntezy mowy (SSML) Niewspierany Obsługa podzbioru elementów SSML. Obsługa pełnego zestawu SSML w Azure Speech.
Opcje programowania interfejs API REST Speech SDK, Speech CLI, REST API Speech SDK, Speech CLI, interfejs API REST
Opcja wdrożenia Tylko chmura Tylko chmura Chmura, systemy wbudowane, hybryda i kontenery.
Synteza w czasie rzeczywistym lub przetwarzanie wsadowe Realny czas Realny czas Synteza w czasie rzeczywistym i wsadowa
Opóźnienie więcej niż 500 ms więcej niż 500 ms mniej niż 300 ms
Częstotliwość próbkowania syntetyzowanego dźwięku 24 kHz 8, 16, 24 i 48 kHz 8, 16, 24 i 48 kHz
Format dźwięku wyjściowego mowy opus, mp3, aac, flac opus, mp3, pcm, truesilk opus, mp3, pcm, truesilk

Istnieją dodatkowe funkcje i możliwości dostępne w usłudze Azure Mowa, które nie są dostępne w przypadku głosów openAI. Na przykład:

  • Głosy mowy OpenAI w Azure Speech tylko obsługują podzestaw elementów SSML. Głosy usługi mowy Azure obsługują pełny zestaw elementów SSML.
  • Usługa Azure Speech obsługuje zdarzenia granic słów. Głosy OpenAI nie obsługują zdarzeń granic słów.

Dostępny tekst OpenAI na głosy mowy

Dostępne głosy OpenAI w programie Azure OpenAI to:

  • alloy
  • echo
  • fable
  • onyx
  • nova
  • shimmer

Dostępne głosy openAI w usłudze Azure Mowa to:

  • en-US-AlloyMultilingualNeural
  • en-US-EchoMultilingualNeural
  • en-US-FableMultilingualNeural
  • en-US-OnyxMultilingualNeural
  • en-US-NovaMultilingualNeural
  • en-US-ShimmerMultilingualNeural
  • en-US-AlloyMultilingualNeuralHD
  • en-US-EchoMultilingualNeuralHD
  • en-US-FableMultilingualNeuralHD
  • en-US-OnyxMultilingualNeuralHD
  • en-US-NovaMultilingualNeuralHD
  • en-US-ShimmerMultilingualNeuralHD

Elementy SSML obsługiwane przez głosy syntezatora mowy OpenAI w usłudze Azure Speech

Język znaczników syntezy mowy (SSML) wraz z tekstem wejściowym określa strukturę, zawartość oraz inne cechy tekstu na potrzeby syntezy mowy. Na przykład można użyć języka SSML do zdefiniowania akapitu, zdania, przerwania lub wstrzymania lub ciszy. Tekst można otagować tagami zdarzeń, takimi jak zakładka lub viseme, które można później przetwarzać w aplikacji.

Poniższa tabela przedstawia elementy języka SSML (Speech Synthesis Markup Language) obsługiwane przez głosy tekstu na mowę OpenAI w usłudze Azure Speech. Tylko następujący podzestaw tagów SSML jest obsługiwany w przypadku głosów openAI. Aby uzyskać więcej informacji, zobacz strukturę i zdarzenia dokumentu SSML .

Nazwa elementu SSML Opis
<speak> Otacza całą zawartość, która ma być wypowiadana. Jest to element główny dokumentu SSML.
<voice> Określa głos używany do zamiany tekstu na mowę.
<sub> Wskazuje, że wartość tekstowa atrybutu aliasu powinna być wymawiana zamiast tekstu zawartego w elemencie.
<say-as> Wskazuje typ zawartości, taki jak liczba lub data, tekstu elementu.

interpret-as Wszystkie wartości właściwości są obsługiwane dla tego elementu z wyjątkiem interpret-as="name". Na przykład jest obsługiwany, <say-as interpret-as="date" format="dmy">10-12-2016</say-as> ale <say-as interpret-as="name">ED</say-as> nie jest obsługiwany. Aby uzyskać więcej informacji, zobacz wymowa za pomocą języka SSML.
<s> Oznacza zdania.
<lang> Wskazuje domyślne ustawienia regionalne dla języka, który ma mówić neuronowy głos.
<break> Służy do zastępowania domyślnego zachowania podziałów lub pauz między wyrazami.