Głosy wysokiej jakości w usłudze Azure Speech

Azure Speech in Foundry Tools nadal rozwija technologię zamiany tekstu na mowę za pomocą neuronowych głosów o wysokiej rozdzielczości (HD). Te głosy HD rozumieją zawartość, automatycznie wykrywają emocje w tekście wejściowym i dostosowują ton wypowiedzi w czasie rzeczywistym, aby dopasować tonację. Utrzymują spójne persony głosowe, zapewniając zwiększoną wyrazistość, naturalność i kontrolę.

Omówienie głosu w usłudze HD

Azure Speech oferuje dwa zaawansowane modele głosu HD, z których każdy jest zoptymalizowany pod kątem różnych przypadków użycia:

Model Liczba głosów Kluczowe cechy Najlepsze dla
DragonHD 30+ dopracowane głosy Profesjonalna jakość, dokładna wymowa, obsługa wielu rozmówców Aplikacje dla przedsiębiorstw wymagające wysokiej jakości danych wyjściowych
DragonHDOmni 500+ głosów (wszystkie wydane głosy) Obsługa stylów, wsparcie dla wielu języków, łatwość w dodawaniu nowych głosów i stylów. Różnorodne aplikacje, tworzenie zawartości, szeroka różnorodność osób

Kluczowe funkcje głosów HD

W poniższej tabeli opisano kluczowe funkcje głosów usługi Speech HD Azure:

Kluczowe funkcje Opis
Generowanie mowy podobnej do człowieka Neuralne głosy syntezy mowy HD generują bardzo naturalną mowę przypominającą ludzką. Model jest szkolony na miliony godzin wielojęzycznych danych, umożliwiając dokładne interpretowanie tekstu wejściowego i generowanie mowy przy użyciu odpowiednich emocji, tempa i rytmu bez ręcznych korekt.
Konwersacyjne Neuronalne głosy syntezatora mowy HD odwzorowują naturalne wzorce mowy, w tym spontaniczne pauzy i akcentowanie. Kiedy model ma do czynienia z tekstem konwersacyjnym, może odtworzyć typowe fonemy, takie jak pauzy i wyrazy wypełniacze. Wygenerowany głos brzmi tak, jakby ktoś rozmawiał bezpośrednio z tobą.
Odmiany prosody Neuronalne głosy syntezy mowy HD wprowadzają niewielkie różnice w każdym wygenerowanym nagraniu, aby zwiększyć realizm. Te odmiany sprawiają, że mowa brzmi bardziej naturalnie, ponieważ ludzkie głosy naturalnie wykazują zmienność.
Wysoka wierność Podstawowym celem neuronowych głosów syntezy mowy HD jest generowanie dźwięku o wysokiej jakości. Syntetyczna mowa wytwarzana przez system może ściśle naśladować ludzką mowę zarówno w jakości, jak i naturalności.

Porównanie głosów HD Azure Speech z innymi głosami systemu zamiany tekstu na mowę Azure

Jak głosy Azure Speech HD wypadają w porównaniu z innymi głosami syntezowanymi w Azure? Oto szczegółowe porównanie:

Funkcja Azure głosy usługi Speech HD Głosy HD od Azure OpenAI Głosy do mowy Azure (nie HD)
Region Zobacz Regiony usługi mowy Zobacz Regiony usługi mowy Dostępne w kilkudziesięciu regionach. Zobacz regiony usługi rozpoznawania mowy.
Liczba głosów 30 6 Ponad 500
Wielojęzycznych Tak Tak Tak (dotyczy tylko wielojęzycznych głosów)
Obsługa języka SSML Obsługa podzbioru elementów SSML. Obsługa podzbioru elementów SSML. Obsługa pełnego zestawu SSML w usłudze Azure Speech.
Opcje programowania Speech SDK, Speech CLI, interfejs API REST Speech SDK, Speech CLI, interfejs API REST Speech SDK, Speech CLI, interfejs API REST
Opcje wdrażania Tylko chmura Tylko chmura Chmura, osadzona, hybrydowa i kontenery.
Synteza w czasie rzeczywistym lub przetwarzanie wsadowe Tylko w czasie rzeczywistym Synteza w czasie rzeczywistym i wsadowa Synteza w czasie rzeczywistym i wsadowa
Opóźnienie Mniej niż 300 ms Więcej niż 500 ms Mniej niż 300 ms
Częstotliwość próbkowania syntetyzowanego dźwięku 8, 16, 24 i 48 kHz 8, 16, 24 i 48 kHz 8, 16, 24 i 48 kHz
Format dźwięku wyjściowego mowy opus, mp3, pcm, truesilk opus, mp3, pcm, truesilk opus, mp3, pcm, truesilk

Obsługiwane głosy Azure Mowa HD

usługa Azure Speech udostępnia dwa zestawy głosów HD z różnymi architekturami modelu:

Głosy Dragon HD

Wartości głosowe Azure Speech HD używają formatu voicename:DragonHD:version. Nazwa przed dwukropkiem, taka jak en-US-Ava, jest nazwą persony głosowej i jej oryginalnym ustawieniem lokalnym.

Aby upewnić się, że używasz najnowszej wersji modelu podstawowego, który Microsoft udostępnia, użyj wersji LatestNeural.

Na przykład dla osoby en-US-Avamożna określić:

  • en-US-Ava:DragonHDLatestNeural: zawsze używa najnowszej wersji modelu podstawowego DragonHD.

W poniższej tabeli wymieniono dostępne głosy DragonHD:

Nazwa głosu Płci Stan Uwaga
de-de-Florian:DragonHDLatestNeural Mężczyzna ogólna dostępność
de-de-Seraphina:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Adam:DragonHDLatestNeural Mężczyzna ogólna dostępność
en-us-Alloy:DragonHDLatestNeural Mężczyzna ogólna dostępność
en-us-Andrew:DragonHDLatestNeural Mężczyzna ogólna dostępność
en-us-Andrew2:DragonHDLatestNeural Mężczyzna ogólna dostępność Zoptymalizowane pod kątem zawartości konwersacyjnej
en-us-Andrew3:DragonHDLatestNeural Mężczyzna Podgląd Zoptymalizowane pod kątem zawartości podcastów
en-us-Aria:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Ava:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Ava3:DragonHDLatestNeural Kobieta Podgląd Zoptymalizowane pod kątem zawartości podcastów
en-us-Brian:DragonHDLatestNeural Mężczyzna ogólna dostępność
en-us-Davis:DragonHDLatestNeural Mężczyzna ogólna dostępność
en-us-Emma:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Emma2:DragonHDLatestNeural Kobieta ogólna dostępność Zoptymalizowane pod kątem zawartości konwersacyjnej
en-us-Jenny:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-MultiTalker-Ava-Andrew:DragonHDLatestNeural Mężczyzna Podgląd
en-us-Nova:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Phoebe:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Serena:DragonHDLatestNeural Kobieta ogólna dostępność
en-us-Steffan:DragonHDLatestNeural Mężczyzna ogólna dostępność
es-es-Tristan:DragonHDLatestNeural Mężczyzna ogólna dostępność
es-es-Ximena:DragonHDLatestNeural Kobieta ogólna dostępność
fr-fr-Remy:DragonHDLatestNeural Mężczyzna ogólna dostępność
fr-fr-Vivienne:DragonHDLatestNeural Kobieta ogólna dostępność
ja-jp-Masaru:DragonHDLatestNeural Mężczyzna ogólna dostępność
ja-jp-Nanami:DragonHDLatestNeural Kobieta ogólna dostępność
zh-cn-Xiaochen:DragonHDLatestNeural Kobieta ogólna dostępność
zh-cn-Yunfan:DragonHDLatestNeural Mężczyzna ogólna dostępność

Obsługiwane są następujące style i znaczniki paralingwistyczne w głosach HD:

Typ Tag
Style amazed, amused, angry, annoyed, anxious, appreciative, calm, cautious, concerned, confident, confused, curious, defeated, defensive, defiant, determined, disappointed, disgusted, doubtful, ecstatic, encouraging, excited, fast, fearful, frustrated, happy, hesitant, hurt, impatient, impressed, intrigued, joking, laughing, optimistic, painful, panicked, panting, pleading, proud, quiet, reassuring, reflective, relieved, remorseful, resigned, sad, sarcastic, secretive, serious, shocked, shouting, shy, skeptical, slow, struggling, surprised, suspicious, sympathetic, terrified, upset, urgent, whispering
Paralinguistyka laughter, , coughing, throat_clearing, breathing, , sighingyawning

Uwaga

Style i cechy paralingwistyczne są dostępne dla wszystkich treści w języku angielskim i dla wszystkich głosów. Wyniki stylu są silnie istotne dla zawartości wejściowej: model dostosowuje aplikację stylu na podstawie semantycznego znaczenia tekstu. Zobacz style i paralinguistics szablon SSML.

Głosy Dragon HD Omni

Dragon HD Omni to ujednolicony model nowej generacji usługi Speech Azure, który łączy wstępnie utworzone i generowane przez sztuczną inteligencję głosy w jedną, elastyczną platformę. Oferuje ponad 700 głosów z rozszerzoną ekspresyjnością, obsługą wielojęzyczną, zaawansowaną kontrolą stylu i automatycznym przewidywaniem stylu.

Kluczowe funkcje Dragon HD Omni

  • 700+ Głosy: obejmuje większość poprzednich głosów o lepszej jakości i ponad 300 głosów generowanych przez sztuczną inteligencję z różnymi cechami.
  • Zaawansowana kontrola stylu: automatyczne przewidywanie stylu przy użyciu opisów języka naturalnego (początkowo dostępne dla en-US-Ava i en-US-Andrew).
  • Obsługa wielojęzyczna: wszystkie głosy Dragon HD Omni obsługują wiele języków z automatycznym wykrywaniem języka i obsługą tagów SSML <lang> .
  • Ulepszona prozodia: Większa naturalność dzięki automatycznej adaptacji kontekstowej.
  • Obsługa zdarzeń granic słów: Umożliwia precyzyjne określanie czasu na poziomie słów dla zsynchronizowanych aplikacji.

Obsługiwane style dla Dragon HD Omni

Następujące style i paralinguistyczne tagi są obsługiwane w głosach HDOmni:

Typ Tag
Style amazed, amused, angry, annoyedanxiousappreciativecalmcautiousconcernedconfidentconfusedcuriousdefeateddefensivedefiantdetermineddisappointeddisgusteddoubtfulecstaticencouragingexcitedfastfearfulfrustratedhappyhesitanthurtimpatientimpressedintriguedjokinglaughingoptimisticpainfulpanickedpantingpleadingproudquietreassuringreflectiverelievedremorsefulresignedsadsarcasticsecretiveseriousshockedshoutingshyskepticalslowstrugglingsurprisedsuspicioussympatheticterrifiedupseturgent
Paralinguistyka laughter, , coughing, throat_clearing, breathing, , sighingyawning

Uwaga

Style są dostępne we wszystkich angielskich treściach dla wszystkich głosów. Wyniki stylu są silnie istotne dla zawartości wejściowej: model dostosowuje aplikację stylu na podstawie semantycznego znaczenia tekstu. Cechy paralingwistyczne są dostępne we wszystkich głosach ze wszystkimi językami. Zobacz style i paralinguistics szablon SSML.

Konwencja nazewnictwa głosu Dragon HD Omni

Głosy Dragon HD Omni są zgodne ze wzorcem nazewnictwa: languagelocale-voicename:DragonHDOmniLatestNeural. Aby szybko znaleźć wersję Omni, dodaj sufiks :DragonHDOmniLatestNeural do formatu nazwy głosu:

Przykład:

Poprzedni głos neuronowy Nazwa głosu wersji Omni
de-DE-ConradNeural de-DE-Conrad:DragonHDOmniLatestNeural

Głosy Dragon HD Flash

Głosy HD Flash są zoptymalizowanymi wariantami wybranych głosów DragonHD, obsługując obecnie tekst w języku chińskim (zh-CN) i angielskim (en-US). Te głosy zapewniają zwiększoną naturalność i są dostępne w standardowych regionach Azure (eastus, westeurope), southeastasiaa także w regionach Chin (chinanorth3).

Poniższa tabela zawiera listę wszystkich dostępnych głosów HD Flash i obsługiwanych stylów.

Nazwa głosu Obsługiwane style
zh-CN-Xiaoxiao:DragonHDFlashLatestNeural angry, chat, cheerful, customer-service, , excited, fearful, sadvoice-assistant
zh-CN-Xiaoxiao2:DragonHDFlashLatestNeural affectionate angry anxious cheerful curious disappointed empathetic encouraging excited fearful guilty lonely poetry-reading sad sentimental sorry story surprised tired whispering
zh-CN-Xiaochen:DragonHDFlashLatestNeural cheerful, debating, empathetic, live-commercial, , poetry-reading, sadsorry
zh-CN-Xiaoyi:DragonHDFlashLatestNeural angry, complaining, cute, gentle, , nervous, sad, shystrict
zh-CN-Xiaoyu:DragonHDFlashLatestNeural angry, , debating, cheerful, comforting, , sadsorry
zh-CN-Xiaohan:DragonHDFlashLatestNeural affectionate, angry, , cheerful, complainingfearful, gentle, , sadshystrict
zh-CN-Xiaoshuang:DragonHDFlashLatestNeural chat
zh-CN-Xiaoyou:DragonHDFlashLatestNeural chat, angry, cheerful, poetry-reading, , sad, storycute
zh-CN-Yunxi:DragonHDFlashLatestNeural angry, chat, cheerful, complaining, depressed, fearful, news, sad, shy, strict, voice-assistant
zh-CN-Yunyi:DragonHDFlashLatestNeural assassin, captain, cavalier, prince, , game-narrator, geomancerpoet
zh-CN-Yunxiao:DragonHDFlashLatestNeural
zh-CN-Yunhan:DragonHDFlashLatestNeural angry cheerful curious empathetic encouraging excited guilty lonely sad serious sorry whispering surprised tired
zh-CN-Yunxia:DragonHDFlashLatestNeural affectionate, angry, , cheerful, comfortingencouraging, excited, , fearfulsadsurprised
zh-CN-Yunye:DragonHDFlashLatestNeural
en-US-Tiana:DragonHDFlashLatestNeural
en-US-Tyler:DragonHDFlashLatestNeural
en-US-Jimmie:DragonHDFlashLatestNeural

Uwaga

HD Flash obsługuje tylko tekst w zh-CN i en-US.

Jak używać głosów usługi Azure Speech HD

Użyj tego samego zestawu Speech SDK i interfejsów API REST dla głosów HD, co dla głosów innych niż HD.

Podczas korzystania z Azure głosów usługi Speech HD należy wziąć pod uwagę następujące kluczowe kwestie:

  • Ustawienia regionalne głosu: ustawienia regionalne w nazwie głosu wskazują jego oryginalny język i region.
  • Modele podstawowe:
    • Głosy HD obejmują model podstawowy, który rozumie tekst wejściowy i odpowiednio przewiduje wzorzec mówienia. Można określić żądany model, taki jak DragonHDLatestNeural, na podstawie dostępności każdego głosu.
  • Użycie SSML: aby odwołać się do głosu w języku SSML, użyj formatu voicename:basemodel:version. Nazwa przed dwukropkiem, taka jak de-DE-Seraphina, jest nazwą persony głosowej i jej oryginalnym ustawieniem lokalnym. Model podstawowy jest śledzony przez wersje w kolejnych aktualizacjach.
  • Parametr temperatury:
    • Wartość temperatury jest liczbą zmiennoprzecinkową z zakresu od 0 do 1, co wpływa na losowość wyników. Możesz dostosować parametr temperatury, aby kontrolować zmienność danych wyjściowych. Mniej losowości daje bardziej stabilne wyniki, podczas gdy większa losowość oferuje różnorodność, ale mniejszą spójność.
    • Niższa temperatura skutkuje mniejszą losowością, co prowadzi do bardziej przewidywalnych danych wyjściowych. Wyższa temperatura zwiększa losowość, umożliwiając uzyskanie bardziej zróżnicowanych danych wyjściowych. Domyślna temperatura jest ustawiona na wartość 1.0.

Oto przykład używania głosów usługi Azure Speech HD w języku SSML:

<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='https://www.w3.org/2001/mstts' xml:lang='en-US'>
<voice name='en-US-Ava:DragonHDLatestNeural' parameters='temperature=0.8'>Here is a test</voice>
</speak>

Dragon HD Omni zaawansowane funkcje

Kontrola stylu za pomocą Express-As

Dragon HD Omni obsługuje zaawansowaną kontrolę stylu przy użyciu elementu mstts:express-as i opisów w języku naturalnym. Aby uzyskać więcej informacji, zobacz szablon SSML.

Obsługa wielu języków

Wszystkie głosy Dragon HD Omni obsługują wiele języków z automatycznym wykrywaniem języka. Możesz również użyć tagu <lang xml:lang> , aby jawnie określić język i akcent. Aby uzyskać więcej informacji, zobacz szablon SSML.

Zdarzenia granicy słowa

Dragon HD Omni obsługuje zdarzenia granic wyrazów, dzięki czemu można uzyskać precyzyjne znaczniki czasowe na poziomie wyrazów w zsynchronizowanych aplikacjach, takich jak karaoke, napisy w czasie rzeczywistym i interaktywne aplikacje głosowe.

Gdy jest uruchamiane zdarzenie granicy słowa, zapewnia:

  • Tekst: słowo mówione
  • AudioOffset: przesunięcie czasu w strumieniu audio (milisekundy)
  • TextOffset: pozycja wyrazu w tekście wejściowym

Przykład w Pythonie ze zdarzeniami związanymi z granicami słów

import azure.cognitiveservices.speech as speechsdk

def word_boundary_cb(evt):
    print(f"Word: '{evt.text}', AudioOffset: {evt.audio_offset / 10000}ms, TextOffset: {evt.text_offset}")

speech_config = speechsdk.SpeechConfig(subscription="YourSubscriptionKey", region="YourServiceRegion")
synthesizer = speechsdk.SpeechSynthesizer(speech_config=speech_config)

synthesizer.synthesis_word_boundary.connect(word_boundary_cb)

ssml = """
<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis'
       xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
  <voice name='en-us-ava:DragonHDOmniLatestNeural'>
    Hello Azure, welcome to Dragon HD Omni!
  </voice>
</speak>
"""

result = synthesizer.speak_ssml_async(ssml).get()

Przykładowe dane wyjściowe:

Word: 'Hello', AudioOffset: 110.0ms, TextOffset: 182
Word: 'Azure', AudioOffset: 590.0ms, TextOffset: 188
Word: ',', AudioOffset: 1110.0ms, TextOffset: 193
Word: 'welcome', AudioOffset: 1270.0ms, TextOffset: 195
Word: 'to', AudioOffset: 1750.0ms, TextOffset: 203
Word: 'Dragon HD Omni', AudioOffset: 1910.0ms, TextOffset: 206
Word: '!', AudioOffset: 2750.0ms, TextOffset: 216

Zaawansowane dostrajanie parametrów dla Dragon HD Omni

Dragon HD Omni obsługuje zaawansowane dostrajanie parametrów w celu dostosowania danych wyjściowych głosu w różnych scenariuszach.

Referencja parametrów

Parametr Domyślny Zakres Cel
temperature 0.7 0.3–1.0 Kontroluje kreatywność a stabilność
top_p 0.7 0.3–1.0 Filtrowanie danych wyjściowych pod kątem różnorodności
top_k 22 1–50 Limity liczby rozważanych opcji
cfg_scale 1.4 1.0–2.0 Dostosowuje istotność i szybkość mowy

Strategie dostrajania

Dla wyrazistości a stabilności:

  • Wyższe wartości dla temperature, top_pi top_k powodują bardziej wyrazistą, emocjonalnie zróżnicowaną mowę.
  • Niższe wartości generują bardziej stabilne i przewidywalne dane wyjściowe.
  • Zalecenie: Utrzymuj top_p na tym samym poziomie co temperature, aby uzyskać najlepsze wyniki.

Aby uzyskać szybkość i znaczenie kontekstowe:

  • cfg_scale wpływa na to, jak szybko głos mówi i jak dobrze pasuje do kontekstu.
    • Wyższe wartości (1.8–2.0): szybsza mowa o silniejszym znaczeniu kontekstowym.
    • Niższe wartości (1.0–1.2): wolniejsza mowa z mniejszym wyrównaniem kontekstowym.

Sugerowana tabela dostrajania

Cel Sugerowane dostosowanie
Bardziej wyraziste Zwiększ temperature, top_p i top_k jednocześnie
Bardziej stabilna Najpierw obniż temperature, a następnie dostosuj top_p w razie potrzeby
Szybsze i istotne Zwiększyć cfg_scale
Wolniejsze i neutralne Zmniejszyć cfg_scale

Przykłady użycia parametrów

Dostosowanie pojedynczego parametru:

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" 
        xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
  <voice name="en-us-ava:DragonHDOmniLatestNeural" parameters="top_p=0.8">
    Hello Azure!
  </voice>
</speak>

Dostosowanie wielu parametrów:

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" 
        xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
  <voice name="en-us-ava:DragonHDOmniLatestNeural" parameters="top_p=0.8;top_k=22;temperature=0.7;cfg_scale=1.2">
    Hello Azure! Welcome to Dragon HD Omni!
  </voice>
</speak>

Obsługiwane i nieobsługiwane elementy SSML dla głosów usługi Mowa HD Azure

Język znaczników syntezy mowy (SSML) z tekstem wejściowym określa strukturę, zawartość i inne cechy tekstu dla generowania mowy. Na przykład można użyć języka SSML do zdefiniowania akapitu, zdania, przerwania lub wstrzymania lub ciszy. Tekst można opakowować za pomocą tagów zdarzeń, takich jak zakładka lub viseme, które aplikacja przetwarza później.

Głosy usługi Speech HD Azure obsługują różne elementy SSML w zależności od modelu:

  • Głosy DragonHD: obsługa podzbioru elementów SSML (patrz poniższa tabela)
  • Głosy Dragon HD Omni: obsługują dodatkowe elementy, w tym mstts:express-as kontrolkę stylu i zdarzenia granic słów

Aby uzyskać szczegółowe informacje na temat obsługiwanych i nieobsługiwanych elementów SSML dla głosów usługi Speech HD Azure, zapoznaj się z poniższą tabelą. Aby uzyskać instrukcje dotyczące używania elementów SSML, zapoznaj się z dokumentacją języka SSML (Speech Synthesis Markup Language).

SSML: element Opis DragonHD Dragon HD Omni
<voice> Określa efekty głosowe i opcjonalne (eq_car i eq_telecomhp8k). Tak Tak
<mstts:express-as> Określa style i role mówienia. Nie Tak
<mstts:ttsembedding> Określa speakerProfileId właściwość dla osobistego głosu. Nie Nie
<lang xml:lang> Określa język mówiący. Tak Tak
<prosody> Dostosowuje ton, kontur, zakres, tempo i głośność. Nie Nie
<emphasis> Dodaje lub usuwa akcent w wyrazach w tekście. Nie Nie
<audio> Osadza wstępnie rozpoznany dźwięk w dokumencie SSML. Nie Nie
<mstts:audioduration> Określa czas trwania dźwięku wyjściowego. Nie Nie
<mstts:backgroundaudio> Dodaje dźwięk tła do dokumentów SSML lub miesza plik audio z tekstem do mowy. Nie Nie
<phoneme> Określa wymowę fonetyczną w dokumentach SSML. Tak Nie
<lexicon> Definiuje sposób odczytu wielu jednostek w języku SSML. Tak (obsługuje tylko pseudonimy) Tak (obsługuje tylko pseudonimy)
<say-as> Wskazuje typ zawartości, taki jak liczba lub data, tekstu elementu. Tak Tak
<sub> Wskazuje, że wartość tekstowa atrybutu aliasu powinna być wymawiana zamiast tekstu zawartego w elemencie. Tak Tak
<math> Używa języka MathML jako tekstu wejściowego, aby prawidłowo wymawiać notacje matematyczne w wyjściowym dźwięku. Nie Nie
<bookmark> Pobiera przesunięcie każdego znacznika w strumieniu audio. Nie Nie
<break> Zastępuje domyślne zachowanie przerw lub pauz między wyrazami. Tak Nie
<mstts:silence> Implementuje pauzę przed tekstem, po nim lub między dwoma sąsiednimi zdaniami. Nie Nie
<mstts:viseme> Definiuje położenie twarzy i ust, gdy osoba mówi. Nie Nie
<p> Określa akapity w dokumentach SSML. Tak Tak
<s> Określa zdania w dokumentach SSML. Tak Tak

Uwaga

Chociaż poprzednia sekcja w tym przewodniku również porównała głosy Azure Speech HD do Azure OpenAI HD głosów, elementy SSML obsługiwane przez Azure Speech nie mają zastosowania do Azure OpenAI głosów.

Ulepszanie parametruPronunciation

Parametr enhancePronunciation umożliwia ulepszoną obsługę wymowy podczas syntezy mowy. Po ustawieniu tej opcji na wartość true głosy NeuralHD stosują dodatkowe optymalizacje wymowy, aby poprawić wyrazistość i poprawność generowanej mowy, zwłaszcza w przypadku złożonego, niejednoznacznego lub niestandardowego tekstu.

Po włączeniu enhancePronunciation usługa nadaje priorytet dokładności wymowy, stosując rozszerzone przetwarzanie językowe podczas syntezy. To ulepszenie może pomóc w sposobie, w jaki system odczytuje:

  • Odpowiednie nouny, nazwy i nietypowe wyrazy
  • Akronimy, skróty i tekst z użyciem wielkich i małych liter
  • Słowa z wieloma możliwymi wymowami w zależności od kontekstu Ten parametr uzupełnia istniejące kontrolki wymowy, takie jak tagi wymowy oparte na języku SSML i leksykony, i nie zastępuje ich. Domyślna wartość to false, aby zachować przewidywalny, zgodny wstecznie wynik syntezy mowy. Włącz ją, gdy chcesz, aby usługa zastosowała dodatkowe optymalizacje wymowy w celu zwiększenia jasności i naturalności.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
  <voice name="en-US-Ava:DragonHDLatestNeural" parameters="enhancePronunciation=true">
    This is a pronunciation enhanced example for technical terms like
    Kubernetes, Azure OpenAI, and multilingual content such as 今、何か軽く摘めそうなものある?
  </voice>
</speak>

Włącz enhancePronunciation w scenariuszach z zawartością specyficzną dla domeny ustrukturyzowanej lub technicznej.

Uwaga

Parametr ma wpływ tylko na obsługę wymowy; nie zmienia wyboru głosu, stylu mówienia ani kontrolek prosody. Wyniki mogą się różnić w zależności od języka, głosu i tekstu wejściowego. W przypadku deterministycznej kontroli wymowy elementy wymowy SSML pozostają zalecanym podejściem.

Wybór między DragonHD i Dragon HD Omni

Oba modele głosu HD zapewniają wysokiej jakości syntezę, ale obsługują różne przypadki użycia:

Rozważenie DragonHD Dragon HD Omni
Liczba głosów Ponad 30 dostrojonych głosów Ponad 700 głosów, w tym poprzednie głosy i nowe głosy generowane przez sztuczną inteligencję
Różnorodność głosu Ograniczone do wstępnie zdefiniowanych osób Obszerna różnorodność z różnorodnymi cechami pochodzącymi ze wszystkich głosów biblioteki
Kontrolka stylu Tylko parametry temperatury i parametry zaawansowane Automatyczne przewidywanie stylów i sterowanie ponad 100 stylami dla Ava i Andrew
Przypadki użycia Obsługa klienta, ułatwienia dostępu, aplikacje ukierunkowane na spójność Tworzenie zawartości, audiobooki, podcasty, zróżnicowane wymagania dotyczące osób

Kiedy należy używać każdego modelu

Wybierz Dragon HD, jeśli:

  • Potrzebna jest konkretna osoba głosowa, aby określone języki musiały być wysokiej jakości
  • Tworzą aplikacje do obsługi klienta dla przedsiębiorstw
  • Potrzebujesz precyzyjnej kontroli przez temperaturę i zaawansowane parametry

Wybierz Dragon HD Omni, jeśli:

  • Potrzebna elastyczność przy użyciu wielu opcji głosowych
  • Tworzą zróżnicowaną zawartość (audiobooki, podcasty, opowiadanie historii)
  • Chcesz ulepszyć bieżące głosy neuronowe, ale ustawienia regionalne nie obsługują jeszcze modelu HD
  • Potrzeba szerokiej gamy osób w różnych przypadkach użycia