Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Azure Speech in Foundry Tools nadal rozwija technologię zamiany tekstu na mowę za pomocą neuronowych głosów o wysokiej rozdzielczości (HD). Te głosy HD rozumieją zawartość, automatycznie wykrywają emocje w tekście wejściowym i dostosowują ton wypowiedzi w czasie rzeczywistym, aby dopasować tonację. Utrzymują spójne persony głosowe, zapewniając zwiększoną wyrazistość, naturalność i kontrolę.
Omówienie głosu w usłudze HD
Azure Speech oferuje dwa zaawansowane modele głosu HD, z których każdy jest zoptymalizowany pod kątem różnych przypadków użycia:
| Model | Liczba głosów | Kluczowe cechy | Najlepsze dla |
|---|---|---|---|
| DragonHD | 30+ dopracowane głosy | Profesjonalna jakość, dokładna wymowa, obsługa wielu rozmówców | Aplikacje dla przedsiębiorstw wymagające wysokiej jakości danych wyjściowych |
| DragonHDOmni | 500+ głosów (wszystkie wydane głosy) | Obsługa stylów, wsparcie dla wielu języków, łatwość w dodawaniu nowych głosów i stylów. | Różnorodne aplikacje, tworzenie zawartości, szeroka różnorodność osób |
Kluczowe funkcje głosów HD
W poniższej tabeli opisano kluczowe funkcje głosów usługi Speech HD Azure:
| Kluczowe funkcje | Opis |
|---|---|
| Generowanie mowy podobnej do człowieka | Neuralne głosy syntezy mowy HD generują bardzo naturalną mowę przypominającą ludzką. Model jest szkolony na miliony godzin wielojęzycznych danych, umożliwiając dokładne interpretowanie tekstu wejściowego i generowanie mowy przy użyciu odpowiednich emocji, tempa i rytmu bez ręcznych korekt. |
| Konwersacyjne | Neuronalne głosy syntezatora mowy HD odwzorowują naturalne wzorce mowy, w tym spontaniczne pauzy i akcentowanie. Kiedy model ma do czynienia z tekstem konwersacyjnym, może odtworzyć typowe fonemy, takie jak pauzy i wyrazy wypełniacze. Wygenerowany głos brzmi tak, jakby ktoś rozmawiał bezpośrednio z tobą. |
| Odmiany prosody | Neuronalne głosy syntezy mowy HD wprowadzają niewielkie różnice w każdym wygenerowanym nagraniu, aby zwiększyć realizm. Te odmiany sprawiają, że mowa brzmi bardziej naturalnie, ponieważ ludzkie głosy naturalnie wykazują zmienność. |
| Wysoka wierność | Podstawowym celem neuronowych głosów syntezy mowy HD jest generowanie dźwięku o wysokiej jakości. Syntetyczna mowa wytwarzana przez system może ściśle naśladować ludzką mowę zarówno w jakości, jak i naturalności. |
Porównanie głosów HD Azure Speech z innymi głosami systemu zamiany tekstu na mowę Azure
Jak głosy Azure Speech HD wypadają w porównaniu z innymi głosami syntezowanymi w Azure? Oto szczegółowe porównanie:
| Funkcja | Azure głosy usługi Speech HD | Głosy HD od Azure OpenAI | Głosy do mowy Azure (nie HD) |
|---|---|---|---|
| Region | Zobacz Regiony usługi mowy | Zobacz Regiony usługi mowy | Dostępne w kilkudziesięciu regionach. Zobacz regiony usługi rozpoznawania mowy. |
| Liczba głosów | 30 | 6 | Ponad 500 |
| Wielojęzycznych | Tak | Tak | Tak (dotyczy tylko wielojęzycznych głosów) |
| Obsługa języka SSML | Obsługa podzbioru elementów SSML. | Obsługa podzbioru elementów SSML. | Obsługa pełnego zestawu SSML w usłudze Azure Speech. |
| Opcje programowania | Speech SDK, Speech CLI, interfejs API REST | Speech SDK, Speech CLI, interfejs API REST | Speech SDK, Speech CLI, interfejs API REST |
| Opcje wdrażania | Tylko chmura | Tylko chmura | Chmura, osadzona, hybrydowa i kontenery. |
| Synteza w czasie rzeczywistym lub przetwarzanie wsadowe | Tylko w czasie rzeczywistym | Synteza w czasie rzeczywistym i wsadowa | Synteza w czasie rzeczywistym i wsadowa |
| Opóźnienie | Mniej niż 300 ms | Więcej niż 500 ms | Mniej niż 300 ms |
| Częstotliwość próbkowania syntetyzowanego dźwięku | 8, 16, 24 i 48 kHz | 8, 16, 24 i 48 kHz | 8, 16, 24 i 48 kHz |
| Format dźwięku wyjściowego mowy | opus, mp3, pcm, truesilk | opus, mp3, pcm, truesilk | opus, mp3, pcm, truesilk |
Obsługiwane głosy Azure Mowa HD
usługa Azure Speech udostępnia dwa zestawy głosów HD z różnymi architekturami modelu:
Głosy Dragon HD
Wartości głosowe Azure Speech HD używają formatu voicename:DragonHD:version. Nazwa przed dwukropkiem, taka jak en-US-Ava, jest nazwą persony głosowej i jej oryginalnym ustawieniem lokalnym.
Aby upewnić się, że używasz najnowszej wersji modelu podstawowego, który Microsoft udostępnia, użyj wersji LatestNeural.
Na przykład dla osoby en-US-Avamożna określić:
-
en-US-Ava:DragonHDLatestNeural: zawsze używa najnowszej wersji modelu podstawowego DragonHD.
W poniższej tabeli wymieniono dostępne głosy DragonHD:
| Nazwa głosu | Płci | Stan | Uwaga |
|---|---|---|---|
de-de-Florian:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
de-de-Seraphina:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Adam:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
en-us-Alloy:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
en-us-Andrew:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
en-us-Andrew2:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | Zoptymalizowane pod kątem zawartości konwersacyjnej |
en-us-Andrew3:DragonHDLatestNeural |
Mężczyzna | Podgląd | Zoptymalizowane pod kątem zawartości podcastów |
en-us-Aria:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Ava:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Ava3:DragonHDLatestNeural |
Kobieta | Podgląd | Zoptymalizowane pod kątem zawartości podcastów |
en-us-Brian:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
en-us-Davis:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
en-us-Emma:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Emma2:DragonHDLatestNeural |
Kobieta | ogólna dostępność | Zoptymalizowane pod kątem zawartości konwersacyjnej |
en-us-Jenny:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-MultiTalker-Ava-Andrew:DragonHDLatestNeural |
Mężczyzna | Podgląd | |
en-us-Nova:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Phoebe:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Serena:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
en-us-Steffan:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
es-es-Tristan:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
es-es-Ximena:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
fr-fr-Remy:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
fr-fr-Vivienne:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
ja-jp-Masaru:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność | |
ja-jp-Nanami:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
zh-cn-Xiaochen:DragonHDLatestNeural |
Kobieta | ogólna dostępność | |
zh-cn-Yunfan:DragonHDLatestNeural |
Mężczyzna | ogólna dostępność |
Obsługiwane są następujące style i znaczniki paralingwistyczne w głosach HD:
| Typ | Tag |
|---|---|
| Style |
amazed, amused, angry, annoyed, anxious, appreciative, calm, cautious, concerned, confident, confused, curious, defeated, defensive, defiant, determined, disappointed, disgusted, doubtful, ecstatic, encouraging, excited, fast, fearful, frustrated, happy, hesitant, hurt, impatient, impressed, intrigued, joking, laughing, optimistic, painful, panicked, panting, pleading, proud, quiet, reassuring, reflective, relieved, remorseful, resigned, sad, sarcastic, secretive, serious, shocked, shouting, shy, skeptical, slow, struggling, surprised, suspicious, sympathetic, terrified, upset, urgent, whispering |
| Paralinguistyka |
laughter, , coughing, throat_clearing, breathing, , sighingyawning |
Uwaga
Style i cechy paralingwistyczne są dostępne dla wszystkich treści w języku angielskim i dla wszystkich głosów. Wyniki stylu są silnie istotne dla zawartości wejściowej: model dostosowuje aplikację stylu na podstawie semantycznego znaczenia tekstu. Zobacz style i paralinguistics szablon SSML.
Głosy Dragon HD Omni
Dragon HD Omni to ujednolicony model nowej generacji usługi Speech Azure, który łączy wstępnie utworzone i generowane przez sztuczną inteligencję głosy w jedną, elastyczną platformę. Oferuje ponad 700 głosów z rozszerzoną ekspresyjnością, obsługą wielojęzyczną, zaawansowaną kontrolą stylu i automatycznym przewidywaniem stylu.
Kluczowe funkcje Dragon HD Omni
- 700+ Głosy: obejmuje większość poprzednich głosów o lepszej jakości i ponad 300 głosów generowanych przez sztuczną inteligencję z różnymi cechami.
-
Zaawansowana kontrola stylu: automatyczne przewidywanie stylu przy użyciu opisów języka naturalnego (początkowo dostępne dla
en-US-Avaien-US-Andrew). -
Obsługa wielojęzyczna: wszystkie głosy Dragon HD Omni obsługują wiele języków z automatycznym wykrywaniem języka i obsługą tagów SSML
<lang>. - Ulepszona prozodia: Większa naturalność dzięki automatycznej adaptacji kontekstowej.
- Obsługa zdarzeń granic słów: Umożliwia precyzyjne określanie czasu na poziomie słów dla zsynchronizowanych aplikacji.
Obsługiwane style dla Dragon HD Omni
Następujące style i paralinguistyczne tagi są obsługiwane w głosach HDOmni:
| Typ | Tag |
|---|---|
| Style |
amazed, amused, angry, annoyedanxiousappreciativecalmcautiousconcernedconfidentconfusedcuriousdefeateddefensivedefiantdetermineddisappointeddisgusteddoubtfulecstaticencouragingexcitedfastfearfulfrustratedhappyhesitanthurtimpatientimpressedintriguedjokinglaughingoptimisticpainfulpanickedpantingpleadingproudquietreassuringreflectiverelievedremorsefulresignedsadsarcasticsecretiveseriousshockedshoutingshyskepticalslowstrugglingsurprisedsuspicioussympatheticterrifiedupseturgent |
| Paralinguistyka |
laughter, , coughing, throat_clearing, breathing, , sighingyawning |
Uwaga
Style są dostępne we wszystkich angielskich treściach dla wszystkich głosów. Wyniki stylu są silnie istotne dla zawartości wejściowej: model dostosowuje aplikację stylu na podstawie semantycznego znaczenia tekstu. Cechy paralingwistyczne są dostępne we wszystkich głosach ze wszystkimi językami. Zobacz style i paralinguistics szablon SSML.
Konwencja nazewnictwa głosu Dragon HD Omni
Głosy Dragon HD Omni są zgodne ze wzorcem nazewnictwa: languagelocale-voicename:DragonHDOmniLatestNeural. Aby szybko znaleźć wersję Omni, dodaj sufiks :DragonHDOmniLatestNeural do formatu nazwy głosu:
Przykład:
| Poprzedni głos neuronowy | Nazwa głosu wersji Omni |
|---|---|
| de-DE-ConradNeural | de-DE-Conrad:DragonHDOmniLatestNeural |
Głosy Dragon HD Flash
Głosy HD Flash są zoptymalizowanymi wariantami wybranych głosów DragonHD, obsługując obecnie tekst w języku chińskim (zh-CN) i angielskim (en-US). Te głosy zapewniają zwiększoną naturalność i są dostępne w standardowych regionach Azure (eastus, westeurope), southeastasiaa także w regionach Chin (chinanorth3).
Poniższa tabela zawiera listę wszystkich dostępnych głosów HD Flash i obsługiwanych stylów.
| Nazwa głosu | Obsługiwane style |
|---|---|
zh-CN-Xiaoxiao:DragonHDFlashLatestNeural |
angry, chat, cheerful, customer-service, , excited, fearful, sadvoice-assistant |
zh-CN-Xiaoxiao2:DragonHDFlashLatestNeural |
affectionate
angry
anxious
cheerful
curious
disappointed
empathetic
encouraging
excited
fearful
guilty
lonely
poetry-reading
sad
sentimental
sorry
story
surprised
tired
whispering
|
zh-CN-Xiaochen:DragonHDFlashLatestNeural |
cheerful, debating, empathetic, live-commercial, , poetry-reading, sadsorry |
zh-CN-Xiaoyi:DragonHDFlashLatestNeural |
angry, complaining, cute, gentle, , nervous, sad, shystrict |
zh-CN-Xiaoyu:DragonHDFlashLatestNeural |
angry, , debating, cheerful, comforting, , sadsorry |
zh-CN-Xiaohan:DragonHDFlashLatestNeural |
affectionate, angry, , cheerful, complainingfearful, gentle, , sadshystrict |
zh-CN-Xiaoshuang:DragonHDFlashLatestNeural |
chat |
zh-CN-Xiaoyou:DragonHDFlashLatestNeural |
chat, angry, cheerful, poetry-reading, , sad, storycute |
zh-CN-Yunxi:DragonHDFlashLatestNeural |
angry, chat, cheerful, complaining, depressed, fearful, news, sad, shy, strict, voice-assistant |
zh-CN-Yunyi:DragonHDFlashLatestNeural |
assassin, captain, cavalier, prince, , game-narrator, geomancerpoet |
zh-CN-Yunxiao:DragonHDFlashLatestNeural |
— |
zh-CN-Yunhan:DragonHDFlashLatestNeural |
angry
cheerful
curious
empathetic
encouraging
excited
guilty
lonely
sad
serious
sorry
whispering
surprised
tired
|
zh-CN-Yunxia:DragonHDFlashLatestNeural |
affectionate, angry, , cheerful, comfortingencouraging, excited, , fearfulsadsurprised |
zh-CN-Yunye:DragonHDFlashLatestNeural |
— |
en-US-Tiana:DragonHDFlashLatestNeural |
— |
en-US-Tyler:DragonHDFlashLatestNeural |
— |
en-US-Jimmie:DragonHDFlashLatestNeural |
— |
Uwaga
HD Flash obsługuje tylko tekst w zh-CN i en-US.
Jak używać głosów usługi Azure Speech HD
Użyj tego samego zestawu Speech SDK i interfejsów API REST dla głosów HD, co dla głosów innych niż HD.
Podczas korzystania z Azure głosów usługi Speech HD należy wziąć pod uwagę następujące kluczowe kwestie:
- Ustawienia regionalne głosu: ustawienia regionalne w nazwie głosu wskazują jego oryginalny język i region.
-
Modele podstawowe:
- Głosy HD obejmują model podstawowy, który rozumie tekst wejściowy i odpowiednio przewiduje wzorzec mówienia. Można określić żądany model, taki jak
DragonHDLatestNeural, na podstawie dostępności każdego głosu.
- Głosy HD obejmują model podstawowy, który rozumie tekst wejściowy i odpowiednio przewiduje wzorzec mówienia. Można określić żądany model, taki jak
-
Użycie SSML: aby odwołać się do głosu w języku SSML, użyj formatu
voicename:basemodel:version. Nazwa przed dwukropkiem, taka jakde-DE-Seraphina, jest nazwą persony głosowej i jej oryginalnym ustawieniem lokalnym. Model podstawowy jest śledzony przez wersje w kolejnych aktualizacjach. -
Parametr temperatury:
- Wartość temperatury jest liczbą zmiennoprzecinkową z zakresu od 0 do 1, co wpływa na losowość wyników. Możesz dostosować parametr temperatury, aby kontrolować zmienność danych wyjściowych. Mniej losowości daje bardziej stabilne wyniki, podczas gdy większa losowość oferuje różnorodność, ale mniejszą spójność.
- Niższa temperatura skutkuje mniejszą losowością, co prowadzi do bardziej przewidywalnych danych wyjściowych. Wyższa temperatura zwiększa losowość, umożliwiając uzyskanie bardziej zróżnicowanych danych wyjściowych. Domyślna temperatura jest ustawiona na wartość 1.0.
Oto przykład używania głosów usługi Azure Speech HD w języku SSML:
<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='https://www.w3.org/2001/mstts' xml:lang='en-US'>
<voice name='en-US-Ava:DragonHDLatestNeural' parameters='temperature=0.8'>Here is a test</voice>
</speak>
Dragon HD Omni zaawansowane funkcje
Kontrola stylu za pomocą Express-As
Dragon HD Omni obsługuje zaawansowaną kontrolę stylu przy użyciu elementu mstts:express-as i opisów w języku naturalnym. Aby uzyskać więcej informacji, zobacz szablon SSML.
Obsługa wielu języków
Wszystkie głosy Dragon HD Omni obsługują wiele języków z automatycznym wykrywaniem języka. Możesz również użyć tagu <lang xml:lang> , aby jawnie określić język i akcent. Aby uzyskać więcej informacji, zobacz szablon SSML.
Zdarzenia granicy słowa
Dragon HD Omni obsługuje zdarzenia granic wyrazów, dzięki czemu można uzyskać precyzyjne znaczniki czasowe na poziomie wyrazów w zsynchronizowanych aplikacjach, takich jak karaoke, napisy w czasie rzeczywistym i interaktywne aplikacje głosowe.
Gdy jest uruchamiane zdarzenie granicy słowa, zapewnia:
- Tekst: słowo mówione
- AudioOffset: przesunięcie czasu w strumieniu audio (milisekundy)
- TextOffset: pozycja wyrazu w tekście wejściowym
Przykład w Pythonie ze zdarzeniami związanymi z granicami słów
import azure.cognitiveservices.speech as speechsdk
def word_boundary_cb(evt):
print(f"Word: '{evt.text}', AudioOffset: {evt.audio_offset / 10000}ms, TextOffset: {evt.text_offset}")
speech_config = speechsdk.SpeechConfig(subscription="YourSubscriptionKey", region="YourServiceRegion")
synthesizer = speechsdk.SpeechSynthesizer(speech_config=speech_config)
synthesizer.synthesis_word_boundary.connect(word_boundary_cb)
ssml = """
<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis'
xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
<voice name='en-us-ava:DragonHDOmniLatestNeural'>
Hello Azure, welcome to Dragon HD Omni!
</voice>
</speak>
"""
result = synthesizer.speak_ssml_async(ssml).get()
Przykładowe dane wyjściowe:
Word: 'Hello', AudioOffset: 110.0ms, TextOffset: 182
Word: 'Azure', AudioOffset: 590.0ms, TextOffset: 188
Word: ',', AudioOffset: 1110.0ms, TextOffset: 193
Word: 'welcome', AudioOffset: 1270.0ms, TextOffset: 195
Word: 'to', AudioOffset: 1750.0ms, TextOffset: 203
Word: 'Dragon HD Omni', AudioOffset: 1910.0ms, TextOffset: 206
Word: '!', AudioOffset: 2750.0ms, TextOffset: 216
Zaawansowane dostrajanie parametrów dla Dragon HD Omni
Dragon HD Omni obsługuje zaawansowane dostrajanie parametrów w celu dostosowania danych wyjściowych głosu w różnych scenariuszach.
Referencja parametrów
| Parametr | Domyślny | Zakres | Cel |
|---|---|---|---|
temperature |
0.7 | 0.3–1.0 | Kontroluje kreatywność a stabilność |
top_p |
0.7 | 0.3–1.0 | Filtrowanie danych wyjściowych pod kątem różnorodności |
top_k |
22 | 1–50 | Limity liczby rozważanych opcji |
cfg_scale |
1.4 | 1.0–2.0 | Dostosowuje istotność i szybkość mowy |
Strategie dostrajania
Dla wyrazistości a stabilności:
- Wyższe wartości dla
temperature,top_pitop_kpowodują bardziej wyrazistą, emocjonalnie zróżnicowaną mowę. - Niższe wartości generują bardziej stabilne i przewidywalne dane wyjściowe.
- Zalecenie: Utrzymuj
top_pna tym samym poziomie cotemperature, aby uzyskać najlepsze wyniki.
Aby uzyskać szybkość i znaczenie kontekstowe:
-
cfg_scalewpływa na to, jak szybko głos mówi i jak dobrze pasuje do kontekstu.- Wyższe wartości (1.8–2.0): szybsza mowa o silniejszym znaczeniu kontekstowym.
- Niższe wartości (1.0–1.2): wolniejsza mowa z mniejszym wyrównaniem kontekstowym.
Sugerowana tabela dostrajania
| Cel | Sugerowane dostosowanie |
|---|---|
| Bardziej wyraziste | Zwiększ temperature, top_p i top_k jednocześnie |
| Bardziej stabilna | Najpierw obniż temperature, a następnie dostosuj top_p w razie potrzeby |
| Szybsze i istotne | Zwiększyć cfg_scale |
| Wolniejsze i neutralne | Zmniejszyć cfg_scale |
Przykłady użycia parametrów
Dostosowanie pojedynczego parametru:
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis"
xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-us-ava:DragonHDOmniLatestNeural" parameters="top_p=0.8">
Hello Azure!
</voice>
</speak>
Dostosowanie wielu parametrów:
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis"
xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-us-ava:DragonHDOmniLatestNeural" parameters="top_p=0.8;top_k=22;temperature=0.7;cfg_scale=1.2">
Hello Azure! Welcome to Dragon HD Omni!
</voice>
</speak>
Obsługiwane i nieobsługiwane elementy SSML dla głosów usługi Mowa HD Azure
Język znaczników syntezy mowy (SSML) z tekstem wejściowym określa strukturę, zawartość i inne cechy tekstu dla generowania mowy. Na przykład można użyć języka SSML do zdefiniowania akapitu, zdania, przerwania lub wstrzymania lub ciszy. Tekst można opakowować za pomocą tagów zdarzeń, takich jak zakładka lub viseme, które aplikacja przetwarza później.
Głosy usługi Speech HD Azure obsługują różne elementy SSML w zależności od modelu:
- Głosy DragonHD: obsługa podzbioru elementów SSML (patrz poniższa tabela)
-
Głosy Dragon HD Omni: obsługują dodatkowe elementy, w tym
mstts:express-askontrolkę stylu i zdarzenia granic słów
Aby uzyskać szczegółowe informacje na temat obsługiwanych i nieobsługiwanych elementów SSML dla głosów usługi Speech HD Azure, zapoznaj się z poniższą tabelą. Aby uzyskać instrukcje dotyczące używania elementów SSML, zapoznaj się z dokumentacją języka SSML (Speech Synthesis Markup Language).
| SSML: element | Opis | DragonHD | Dragon HD Omni |
|---|---|---|---|
<voice> |
Określa efekty głosowe i opcjonalne (eq_car i eq_telecomhp8k). |
Tak | Tak |
<mstts:express-as> |
Określa style i role mówienia. | Nie | Tak |
<mstts:ttsembedding> |
Określa speakerProfileId właściwość dla osobistego głosu. |
Nie | Nie |
<lang xml:lang> |
Określa język mówiący. | Tak | Tak |
<prosody> |
Dostosowuje ton, kontur, zakres, tempo i głośność. | Nie | Nie |
<emphasis> |
Dodaje lub usuwa akcent w wyrazach w tekście. | Nie | Nie |
<audio> |
Osadza wstępnie rozpoznany dźwięk w dokumencie SSML. | Nie | Nie |
<mstts:audioduration> |
Określa czas trwania dźwięku wyjściowego. | Nie | Nie |
<mstts:backgroundaudio> |
Dodaje dźwięk tła do dokumentów SSML lub miesza plik audio z tekstem do mowy. | Nie | Nie |
<phoneme> |
Określa wymowę fonetyczną w dokumentach SSML. | Tak | Nie |
<lexicon> |
Definiuje sposób odczytu wielu jednostek w języku SSML. | Tak (obsługuje tylko pseudonimy) | Tak (obsługuje tylko pseudonimy) |
<say-as> |
Wskazuje typ zawartości, taki jak liczba lub data, tekstu elementu. | Tak | Tak |
<sub> |
Wskazuje, że wartość tekstowa atrybutu aliasu powinna być wymawiana zamiast tekstu zawartego w elemencie. | Tak | Tak |
<math> |
Używa języka MathML jako tekstu wejściowego, aby prawidłowo wymawiać notacje matematyczne w wyjściowym dźwięku. | Nie | Nie |
<bookmark> |
Pobiera przesunięcie każdego znacznika w strumieniu audio. | Nie | Nie |
<break> |
Zastępuje domyślne zachowanie przerw lub pauz między wyrazami. | Tak | Nie |
<mstts:silence> |
Implementuje pauzę przed tekstem, po nim lub między dwoma sąsiednimi zdaniami. | Nie | Nie |
<mstts:viseme> |
Definiuje położenie twarzy i ust, gdy osoba mówi. | Nie | Nie |
<p> |
Określa akapity w dokumentach SSML. | Tak | Tak |
<s> |
Określa zdania w dokumentach SSML. | Tak | Tak |
Uwaga
Chociaż poprzednia sekcja w tym przewodniku również porównała głosy Azure Speech HD do Azure OpenAI HD głosów, elementy SSML obsługiwane przez Azure Speech nie mają zastosowania do Azure OpenAI głosów.
Ulepszanie parametruPronunciation
Parametr enhancePronunciation umożliwia ulepszoną obsługę wymowy podczas syntezy mowy. Po ustawieniu tej opcji na wartość true głosy NeuralHD stosują dodatkowe optymalizacje wymowy, aby poprawić wyrazistość i poprawność generowanej mowy, zwłaszcza w przypadku złożonego, niejednoznacznego lub niestandardowego tekstu.
Po włączeniu enhancePronunciation usługa nadaje priorytet dokładności wymowy, stosując rozszerzone przetwarzanie językowe podczas syntezy. To ulepszenie może pomóc w sposobie, w jaki system odczytuje:
- Odpowiednie nouny, nazwy i nietypowe wyrazy
- Akronimy, skróty i tekst z użyciem wielkich i małych liter
- Słowa z wieloma możliwymi wymowami w zależności od kontekstu Ten parametr uzupełnia istniejące kontrolki wymowy, takie jak tagi wymowy oparte na języku SSML i leksykony, i nie zastępuje ich. Domyślna wartość to false, aby zachować przewidywalny, zgodny wstecznie wynik syntezy mowy. Włącz ją, gdy chcesz, aby usługa zastosowała dodatkowe optymalizacje wymowy w celu zwiększenia jasności i naturalności.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural" parameters="enhancePronunciation=true">
This is a pronunciation enhanced example for technical terms like
Kubernetes, Azure OpenAI, and multilingual content such as 今、何か軽く摘めそうなものある?
</voice>
</speak>
Zalecane przypadki użycia
Włącz enhancePronunciation w scenariuszach z zawartością specyficzną dla domeny ustrukturyzowanej lub technicznej.
Uwaga
Parametr ma wpływ tylko na obsługę wymowy; nie zmienia wyboru głosu, stylu mówienia ani kontrolek prosody. Wyniki mogą się różnić w zależności od języka, głosu i tekstu wejściowego. W przypadku deterministycznej kontroli wymowy elementy wymowy SSML pozostają zalecanym podejściem.
Wybór między DragonHD i Dragon HD Omni
Oba modele głosu HD zapewniają wysokiej jakości syntezę, ale obsługują różne przypadki użycia:
| Rozważenie | DragonHD | Dragon HD Omni |
|---|---|---|
| Liczba głosów | Ponad 30 dostrojonych głosów | Ponad 700 głosów, w tym poprzednie głosy i nowe głosy generowane przez sztuczną inteligencję |
| Różnorodność głosu | Ograniczone do wstępnie zdefiniowanych osób | Obszerna różnorodność z różnorodnymi cechami pochodzącymi ze wszystkich głosów biblioteki |
| Kontrolka stylu | Tylko parametry temperatury i parametry zaawansowane | Automatyczne przewidywanie stylów i sterowanie ponad 100 stylami dla Ava i Andrew |
| Przypadki użycia | Obsługa klienta, ułatwienia dostępu, aplikacje ukierunkowane na spójność | Tworzenie zawartości, audiobooki, podcasty, zróżnicowane wymagania dotyczące osób |
Kiedy należy używać każdego modelu
Wybierz Dragon HD, jeśli:
- Potrzebna jest konkretna osoba głosowa, aby określone języki musiały być wysokiej jakości
- Tworzą aplikacje do obsługi klienta dla przedsiębiorstw
- Potrzebujesz precyzyjnej kontroli przez temperaturę i zaawansowane parametry
Wybierz Dragon HD Omni, jeśli:
- Potrzebna elastyczność przy użyciu wielu opcji głosowych
- Tworzą zróżnicowaną zawartość (audiobooki, podcasty, opowiadanie historii)
- Chcesz ulepszyć bieżące głosy neuronowe, ale ustawienia regionalne nie obsługują jeszcze modelu HD
- Potrzeba szerokiej gamy osób w różnych przypadkach użycia