Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Sie können die Markupsprache für Sprachsynthese (Speech Synthesis Markup Language, SSML) verwenden, um die Stimme, die Sprache, den Namen, den Stil und die Rolle für Sprachsynthese für Ihre Sprachausgabe anzugeben. Sie können auch mehrere Stimmen in einem einzelnen SSML-Dokument verwenden und die Betonung, die Sprachrate, die Tonhöhe und die Lautstärke anpassen. Darüber hinaus bietet SSML die Möglichkeit, vorab aufgezeichnete Audiodaten einzufügen, z. B. einen Soundeffekt oder eine musikalische Note.
In diesem Artikel erfahren Sie, wie Sie SSML-Elemente verwenden, um Sprache und Sound anzugeben. Weitere Informationen zur SSML-Syntax finden Sie unter SSML-Dokumentstruktur und -ereignisse.
Sprachelemente nutzen
Mindestens ein voice Element muss in jedem SSML-speak-Element angegeben werden. Dieses Element bestimmt die Stimme, die für die Text-zu-Sprache-Wiedergabe verwendet wird.
Sie können mehrere voice Elemente in ein einzelnes SSML-Dokument einschließen. Jedes voice Element kann eine andere Stimme angeben. Sie können dieselbe Stimme auch mehrmals mit unterschiedlichen Einstellungen verwenden, z. B. wenn Sie die Stille zwischen Sätzen ändern.
In der folgenden Tabelle wird die Verwendung der Attribute des voice Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
name |
Die Stimme, die für die Text-zu-Sprache-Ausgabe verwendet wird. Eine vollständige Liste der unterstützten Standardstimmungen finden Sie unter Sprachunterstützung. | Erforderlich |
effect |
Der Audioeffektprozessor, der verwendet wird, um die Qualität der synthetisierten Sprachausgabe für bestimmte Szenarien auf Geräten zu optimieren. Bei einigen Szenarien in Produktionsumgebungen kann die Klangerfahrung aufgrund von Verzerrungen bei der Wiedergabe auf bestimmten Geräten beeinträchtigt werden. Die synthetisierte Rede eines Autolautsprechers klingt z. B. aufgrund von Umgebungsfaktoren wie Lautsprecherantwort, Raumverberung und Hintergrundgeräuschen schlämpfend und muffiert. Möglicherweise muss der Passagier die Lautstärke erhöhen, um deutlicher zu hören. Um manuelle Vorgänge in einem solchen Szenario zu vermeiden, kann der Audioeffektprozessor den Sound deutlicher machen, indem die Verzerrung der Wiedergabe kompensiert wird. Die folgenden Werte werden unterstützt:
Wenn der Wert fehlt oder ungültig ist, wird dieses Attribut ignoriert, und es wird kein Effekt angewendet. |
Optional |
Sprachbeispiele
Informationen zu den unterstützten Werten für Attribute des voice Elements finden Sie unter Verwenden von Sprachelementen.
Beispiel für Einzelstimme
In diesem Beispiel wird die en-US-Ava:DragonHDLatestNeural Stimme verwendet.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural">
This is the text that is spoken.
</voice>
</speak>
Beispiel für mehrere Stimmen
Innerhalb des speak Elements können Sie mehrere Stimmen für die Sprachausgabe angeben. Diese Stimmen können in verschiedenen Sprachen vorliegen. Für jede Stimme muss der Text in ein voice Element eingeschlossen werden.
In diesem Beispiel wird zwischen den en-US-Ava:DragonHDLatestNeural- und en-US-Andrew:DragonHDLatestNeural-Stimmen gewechselt. Die neuralen mehrsprachigen Stimmen können je nach Eingabetext unterschiedliche Sprachen sprechen.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural">
Good morning!
</voice>
<voice name="en-US-Andrew:DragonHDLatestNeural">
Good morning to you too Ava!
</voice>
</speak>
Beispiel für benutzerdefinierte Stimme
Um Ihre benutzerdefinierte Stimme zu verwenden, geben Sie den Modellnamen als Sprachnamen in SSML an.
In diesem Beispiel wird eine benutzerdefinierte Stimme namens "my-custom-voice" verwendet.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="my-custom-voice">
This is the text that is spoken.
</voice>
</speak>
Beispiel für Audioeffekt
Sie verwenden das effect-Attribut, um das Audioerlebnis für Anwendungen wie im Fahrzeugbereich und der Telekommunikation zu optimieren. Im folgenden SSML-Beispiel wird das effect-Attribut mit der Konfiguration in Fahrzeugszenarien verwendet.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-AvaMultilingualNeural" effect="eq_car">
This is the text that is spoken.
</voice>
</speak>
Sprachbeispiel für mehrere Sprecher
Multi-Talker-Stimmen ermöglichen natürliche, dynamische Unterhaltungen mit mehreren unterschiedlichen Lautsprechern. Diese Innovation verbessert den Realismus von synthetisierten Dialogen, indem Kontextfluss, emotionale Konsistenz und natürliche Sprachmuster erhalten bleiben.
Verwenden Sie diese Funktion, um ansprechende, Podcast-Stil-Sprach- oder Unterhaltungsaustausche mit nahtlosen Übergängen zwischen Lautsprechern zu generieren. Im Gegensatz zu Single-Talker-Modellen, die jede Drehung isoliert synthetisieren, behalten Multi-Talker-Stimmen die Kohärenz im dialogübergreifenden Bereich bei, wodurch eine authentischere und immersivere Hörerfahrung gewährleistet wird.
Für en-US-MultiTalker-Ava-Andrew:DragonHDLatestNeural innerhalb des <mstts:dialog> Elements können Sie für jeden Sprecherwechsel die Text-to-Speech-Ausgabe mit dem folgenden Format festlegen, um jeweils zwischen den Sprechern ava und andrew zu wechseln.
<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='https://www.w3.org/2001/mstts' xml:lang='en-US'>
<voice name='en-US-MultiTalker-Ava-Andrew:DragonHDLatestNeural'>
<mstts:dialog>
<mstts:turn speaker="ava">Hello, Andrew! How's your day going?</mstts:turn>
<mstts:turn speaker="andrew">Hey Ava! It's been great, just exploring some AI advancements in communication.</mstts:turn>
<mstts:turn speaker="ava">That sounds interesting! What kind of projects are you working on?</mstts:turn>
<mstts:turn speaker="andrew">Well, we've been experimenting with text-to-speech applications, including turning emails into podcasts.</mstts:turn>
<mstts:turn speaker="ava">Wow, that could really improve content accessibility! Are you looking for collaborators?</mstts:turn>
<mstts:turn speaker="andrew">Absolutely! We're open to testing new ideas and seeing how AI can enhance communication.</mstts:turn>
</mstts:dialog>
</voice>
</speak>
Unterstützte Stimmen finden Sie in der Dokumentation zur Sprachunterstützung .
Verwenden von Sprachstilen, Paralinguistik und Rollen
Stile und Paralinguistik in HD-Stimmen
In HD-Stimmen (DragonHD, DragonHD Omni und DragonHD Flash) können Stile und paralinguistische Elemente auf die folgenden drei Arten verwendet werden:
| Eingabetyp | Beispiel |
|---|---|
| SSML (Express-as-Tag) |
<Sprechen> <voice name="en-us-Ava:DragonHDLatestNeural"> <mstts:express-as style="flüstert">Sagen Sie niemandem...</mstts:express-as> <mstts:express-as style="ecstatic">Das ist fantastisch!</mstts:express-as> </Stimme> </speak> |
| SSML (Formatmarkierungen) |
<Sprechen> <voice name="en-us-Ava:DragonHDLatestNeural"> [flüsternd] Sagen Sie niemandem... [ekstatisch] Das ist erstaunlich! </Stimme> </speak> |
| Klartext (nach der Wahl der Stimme) | [flüsternd] Sagen Sie niemandem... [ekstatisch] Das ist erstaunlich! |
Hinweis
Eine Stilmarkierung gilt für alle nachfolgenden Sätze, bis Sie den Stil zurücksetzen.
- Verwenden Sie
[Neutral], um zum Standardstil zu wechseln. -
\r\n, das<p>-Tag und automatische Satzgrenzen wechseln zum Standardstil. - Das
<break>-Tag wechselt nicht zum Standardstil.
Unterstützte Stile für Dragon HD
Die folgenden Formatvorlagen und paralinguistischen Tags werden in HD-Stimmen unterstützt.
| Typ | Tag |
|---|---|
| Stile |
amazed, amused, annoyed, joking, shouting, shy, serious, secretive, sarcastic, sad, resigned, remorseful, reflective, relieved, quiet, proud, pleading, panting, panicked, painful, laughing, optimistic, impressed, impatient, hurt, hesitant, reassuring, disgusted, doubtful, disappointed, ecstatic, defiant, skeptical, defensive, shocked, curious, slow, happy, frustrated, fast, encouraging, confident, cautious, calm, concerned, confused, appreciative, defeated, anxious, determined, excited, fearful, angry, intrigued, struggling, surprised, suspicious, sympathetic, terrified, upset, urgent, whispering |
| Paralinguistik |
laughter, , coughingthroat_clearing, breathing, , sighingyawning |
Hinweis
Stile sind für alle englischen Inhalte und für alle Sprachvarianten verfügbar. Formatvorlagenergebnisse sind für den Eingabeinhalt stark relevant: Das Modell passt die Formatvorlagenanwendung basierend auf der semantischen Bedeutung des Texts an. Paralinguistik steht für alle Stimmen mit allen Sprachen zur Verfügung.
Unterstützte Stile für Dragon HD Omni
Die folgenden Formatvorlagen und paralinguistischen Tags werden in HDOmni-Stimmen unterstützt.
| Typ | Tag |
|---|---|
| Stile |
amazed, amused, annoyed, joking, slow, skeptical, shy, shouting, shocked, secretive, serious, sad, resigned, remorseful, relieved, reflective, reassuring, proud, quiet, panting, panicked, painful, optimistic, laughing, intrigued, impatient, impressed, pleading, disgusted, doubtful, disappointed, ecstatic, encouraging, excited, defensive, sarcastic, defiant, hurt, hesitant, frustrated, fearful, determined, anxious, confident, appreciative, concerned, angry, cautious, defeated, fast, confused, calm, curious, happy, upset, suspicious, terrified, sympathetic, struggling, surprised, urgent |
| Paralinguistik |
laughter, , coughingthroat_clearing, breathing, , sighingyawning |
Hinweis
Stile sind für alle englischen Inhalte und für alle Sprachvarianten verfügbar. Formatvorlagenergebnisse sind für den Eingabeinhalt stark relevant: Das Modell passt die Formatvorlagenanwendung basierend auf der semantischen Bedeutung des Texts an. Paralinguistik ist für alle Stimmen mit allen Sprachen verfügbar.
Stile und Rollen in neuralen Stimmen
Neuronale Stimmen weisen standardmäßig einen neutralen Sprechstil auf. Sie können den Sprechstil, den Stilgrad und die Rolle auf Satzebene anpassen.
Hinweis
Der Sprachdienst unterstützt Stile, Stilgrad und Rollen für eine Teilmenge neuraler Stimmen, wie in der Dokumentation zu Sprachstilen und Rollen beschrieben. Um die unterstützten Stile und Rollen für jede Stimme zu ermitteln, können Sie auch die Listenstimme-API und die Webanwendung für die Erstellung von Audioinhalten verwenden.
In der folgenden Tabelle wird die Verwendung der Attribute des mstts:express-as Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
style |
Der stimmenspezifische Sprechstil. Sie können Emotionen wie Fröhlichkeit, Empathie und Ruhe ausdrücken. Sie können die Stimme auch für verschiedene Szenarien wie Kundendienst, Newscast und Sprachassistent optimieren. Wenn der Style-Wert fehlt oder ungültig ist, wird das gesamte mstts:express-as-Element ignoriert, und der Dienst verwendet die neutrale Standardeinstellung. Benutzerdefinierte Sprachstile finden Sie im Beispiel für benutzerdefinierte Sprachstile. |
Erforderlich |
styledegree |
Die Intensität des Sprechstils. Sie können einen stärkeren oder weicheren Stil angeben, um die Sprache ausdrucksstärker oder subduziert zu machen. Der Bereich der akzeptierten Werte ist: 0.01 bis 2 einschließlich. Der Standardwert ist 1, was die vordefinierte Stilintensität bedeutet. Die minimale Einheit ist 0.01, was zu einer leichten Tendenz zur Zielsprechweise führt. Ein Wert von 2 führt zu einer Verdoppelung der Intensität des Standardstils. Wenn der Stilgrad fehlt oder für Ihre Stimme nicht unterstützt wird, wird dieses Attribut ignoriert. |
Optional |
role |
Das sprechende Rollenspiel. Die Stimme kann ein anderes Alter und Geschlecht imitieren, aber der Stimmenname wird nicht geändert. Beispielsweise kann eine männliche Stimme die Tonhöhe erhöhen und die Intonation ändern, um eine weibliche Stimme zu imitieren, aber der Stimmenname wird nicht geändert. Wenn die Rolle fehlt oder für Ihre Stimme nicht unterstützt wird, wird dieses Attribut ignoriert. | Optional |
In der folgenden Tabelle werden die einzelnen unterstützten style Attribute beschrieben:
| Stil | Beschreibung |
|---|---|
style="advertisement_upbeat" |
Drückt einen aufgeregten und energiereichen Ton aus, um ein Produkt oder eine Dienstleistung zu fördern. |
style="affectionate" |
Drückt einen warmen und liebevollen Ton aus, mit höherer Tonhöhe und Stimmenergie. Der Sprecher ist in einem Zustand, in dem er die Aufmerksamkeit der Zuhörer auf sich zieht. Die Persönlichkeit des Sprechers ist oft von Natur aus liebenswert. |
style="angry" |
Drückt einen wütenden und verärgerten Ton aus. |
style="assistant" |
Drückt einen warmen und entspannten Ton für digitale Assistenten aus. |
style="calm" |
Drückt eine coole, gesammelte und gefasste Haltung beim Sprechen aus. Ton, Tonhöhe und Prosodie sind im Vergleich zu anderen Spracharten gleichmäßiger. |
style="chat" |
Drückt einen lässigen und entspannten Ton aus. |
style="cheerful" |
Drückt einen positiven und glücklichen Ton aus. |
style="customerservice" |
Bringt einen freundlichen und hilfreichen Ton für den Kundensupport zum Ausdruck. |
style="depressed" |
Drückt einen melancholischen und despondenten Ton mit niedrigerer Tonhöhe und Energie aus. |
style="disgruntled" |
Drückt einen verächtlichen und klagenden Ton aus. Die Rede dieser Emotion zeigt Unmut und Verachtung. |
style="documentary-narration" |
Spricht Dokumentationen in einem lockeren, interessierten und informativen Stil, der sich für Dokumentarfilme, Fachkommentare und ähnliche Inhalte eignet. |
style="embarrassed" |
Drückt einen unsicheren und zögerlichen Ton aus, wenn der Sprecher sich unwohl fühlt. |
style="empathetic" |
Drückt ein Gefühl der Pflege und des Verständnisses aus. |
style="envious" |
Drückt einen Bewunderungston aus, wenn Sie etwas wünschen, das jemand anderes hat. |
style="excited" |
Drückt einen optimistischen und hoffnungsvollen Ton aus. Es klingt wie etwas Großartiges, und der Sprecher freut sich darüber. |
style="fearful" |
Drückt einen beängstigten und nervösen Ton aus, mit höherer Tonhöhe, höherer Stimmenergie und schnellerer Rate. Der Sprecher befindet sich in einem Spannungszustand und Unbehagen. |
style="friendly" |
Drückt einen angenehmen, einladenden und warmen Ton aus. Es klingt aufrichtig und pflegend. |
style="gentle" |
Drückt einen milden, freundlichen und angenehmen Ton aus, mit tieferer Tonhöhe und Stimmenergie. |
style="hopeful" |
Drückt einen warmen und sehnsüchtigen Ton aus. Es klingt, als ob etwas Gutes vom Sprecher erwartet wird. |
style="lyrical" |
Drückt Emotionen auf melodische und sentimentale Weise aus. |
style="narration-professional" |
Drückt einen professionellen, objektiven Ton für das Lesen von Inhalten aus. |
style="narration-relaxed" |
Drückt einen beruhigenden und melodischen Ton für das Lesen von Inhalten aus. |
style="newscast" |
Drückt einen formalen und professionellen Ton aus, um Nachrichten zu erzählen. |
style="newscast-casual" |
Drückt einen vielseitigen und lässigen Ton für die allgemeine Nachrichtenübermittlung aus. |
style="newscast-formal" |
Drückt einen formalen, sicheren und autorisierenden Ton für die Nachrichtenübermittlung aus. |
style="poetry-reading" |
Drückt einen emotionalen und rhythmischen Ton aus, während er ein Gedicht liest. |
style="sad" |
Drückt einen traurigen Ton aus. |
style="serious" |
Drückt einen strengen und autoritären Ton aus. Der Sprecher klingt oft steifer und viel weniger entspannt mit einem festen Rhythmus. |
style="shouting" |
Drückt einen Ton aus, der klingt, als ob die Stimme aus der Ferne oder einem anderen Ort käme und sich bemüht, deutlich gehört zu werden. |
style="sports_commentary" |
Drückt einen entspannten und interessierten Ton für die Übertragung eines Sportereignisses aus. |
style="sports_commentary_excited" |
Drückt einen intensiven und energetischen Ton aus, um spannende Momente in einem Sportereignis zu übertragen. |
style="whispering" |
Drückt einen weichen Ton aus, der versucht, einen ruhigen und sanften Klang zu erzeugen. |
style="terrified" |
Drückt einen beängstigten Ton aus, mit einem schnelleren Tempo und einer wackeligen Stimme. Es klingt, als wäre der Sprecher in einem instabilen und hektischen Zustand. |
style="unfriendly" |
Drückt einen kalten und gleichgültigen Ton aus. |
Die folgende Tabelle enthält Beschreibungen der einzelnen unterstützten role Attribute:
| Rolle | Beschreibung |
|---|---|
role="Girl" |
Die Stimme imitiert ein Mädchen. |
role="Boy" |
Die Stimme imitiert einen Jungen. |
role="YoungAdultFemale" |
Die Stimme imitiert eine junge erwachsene Frau. |
role="YoungAdultMale" |
Die Stimme imitiert einen jungen erwachsenen Mann. |
role="OlderAdultFemale" |
Die Stimme imitiert eine ältere erwachsene Frau. |
role="OlderAdultMale" |
Die Stimme imitiert einen älteren erwachsenen Mann. |
role="SeniorFemale" |
Die Stimme imitiert eine ältere Frau. |
role="SeniorMale" |
Die Stimme imitiert einen älteren Mann. |
mstts express-as-Beispiele
Informationen zu den unterstützten Werten für Attribute des mstts:express-as Elements finden Sie unter Verwenden von Sprachstilen und Rollen.
Beispiel für Stil und Grad
Sie verwenden das mstts:express-as Element, um Emotionen wie Fröhlichkeit, Empathie und Ruhe auszudrücken. Sie können die Stimme auch für verschiedene Szenarien wie Kundendienst, Newscast und Sprachassistent optimieren.
Im folgenden SSML-Beispiel wird das <mstts:express-as> -Element mit dem Grad sad für den 2 Stil verwendet.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="zh-CN">
<voice name="zh-CN-XiaomoNeural">
<mstts:express-as style="sad" styledegree="2">
快走吧,路上一定要注意安全,早去早回。
</mstts:express-as>
</voice>
</speak>
Rollenbeispiel
Abgesehen von der Anpassung der Sprachstile und des Stilgrads können Sie auch den role Parameter so anpassen, dass die Stimme ein anderes Alter und Geschlecht imitiert. Beispielsweise kann eine männliche Stimme die Tonhöhe erhöhen und die Intonation ändern, um eine weibliche Stimme zu imitieren, aber der Stimmenname wird nicht geändert.
Dieser SSML-Snippet veranschaulicht, wie das role-Attribut verwendet wird, um das Rollenspiel für zh-CN-XiaomoNeural zu ändern.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="zh-CN">
<voice name="zh-CN-XiaomoNeural">
女儿看见父亲走了进来,问道:
<mstts:express-as role="YoungAdultFemale" style="calm">
“您来的挺快的,怎么过来的?”
</mstts:express-as>
父亲放下手提包,说:
<mstts:express-as role="OlderAdultMale" style="calm">
“刚打车过来的,路上还挺顺畅。”
</mstts:express-as>
</voice>
</speak>
Beispiel für benutzerdefinierte Sprachstile
Sie können Ihre benutzerdefinierte Stimme trainieren, um mit einigen voreingestellten Stilen wie cheerful, sad, und whispering zu sprechen. Sie können auch eine professionelle Stimme optimieren , um in einem benutzerdefinierten Stil zu sprechen, wie sie durch Ihre Schulungsdaten bestimmt wird. Wenn Sie Ihren benutzerdefinierten Sprachstil in SSML verwenden möchten, geben Sie den Formatvorlagennamen an, den Sie zuvor in Speech Studio eingegeben haben.
In diesem Beispiel wird eine benutzerdefinierte Stimme namens "my-custom-voice" verwendet. Die benutzerdefinierte Stimme spricht mit dem voreingestellten Stil cheerful und dem Stilgrad 2 und dann mit einem benutzerdefinierten Stil namens my-custom-style und dem Stilgrad 0.01.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="my-custom-voice">
<mstts:express-as style="cheerful" styledegree="2">
That'd be just amazing!
</mstts:express-as>
<mstts:express-as style="my-custom-style" styledegree="0.01">
What's next?
</mstts:express-as>
</voice>
</speak>
Sprecherprofil-ID
Sie verwenden das mstts:ttsembedding Element, um die speakerProfileId Eigenschaft für eine persönliche Stimme anzugeben. Persönliche Stimme ist eine benutzerdefinierte Stimme, die auf Ihrer eigenen Stimme oder der Stimme Ihres Kunden trainiert wird. Weitere Informationen finden Sie unter Erstellen einer persönlichen Stimme.
Im folgenden SSML-Beispiel wird das <mstts:ttsembedding> Element mit einem Sprachnamen und einer Sprecherprofil-ID verwendet.
<speak version='1.0' xmlns='http://www.w3.org/2001/10/synthesis' xmlns:mstts='http://www.w3.org/2001/mstts' xml:lang='en-US'>
<voice xml:lang='en-US' xml:gender='Male' name='PhoenixV2Neural'>
<mstts:ttsembedding speakerProfileId='your speaker profile ID here'>
I'm happy to hear that you find me amazing and that I have made your trip planning easier and more fun. 我很高兴听到你觉得我很了不起,我让你的旅行计划更轻松、更有趣。Je suis heureux d'apprendre que vous me trouvez incroyable et que j'ai rendu la planification de votre voyage plus facile et plus amusante.
</mstts:ttsembedding>
</voice>
</speak>
Sprachsprachen anpassen
Standardmäßig können mehrsprachige Stimmen die Sprache des Eingabetexts automatisch erkennen und in der Sprache des Standardgebietsschemas des Eingabetexts sprechen, ohne SSML zu verwenden. Optional können Sie das <lang xml:lang> Element verwenden, um die Sprachsprache für diese Stimmen anzupassen, um den bevorzugten Akzent festzulegen, z en-GB . B. für Britisches Englisch. Sie können die Sprachsprache sowohl auf Satzebene als auch auf Wortebene anpassen. Informationen zu den unterstützten Sprachen für mehrsprachige Stimmen finden Sie unter "Mehrsprachige Stimmen" mit dem Lang-Element in einer Tabelle mit den <lang> Syntax- und Attributdefinitionen.
In der folgenden Tabelle wird die Verwendung der Attribute des <lang xml:lang> Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
xml:lang |
Die Sprache, die die neurale Stimme sprechen soll. | Erforderlich, um die Sprachsprache für die neurale Stimme anzupassen. Wenn Sie lang xml:lang verwenden, muss das Gebietsschema angegeben werden. |
Hinweis
Nicht mehrsprachige Stimmen unterstützen das <lang xml:lang> Element nicht nach Design.
Mehrsprachige Stimmen mit dem lang-Element
Verwenden Sie den Abschnitt "Mehrsprachige Stimmen" , um zu bestimmen, welche Sprachsprachen der Sprachdienst für jede neurale Stimme unterstützt, wie in der folgenden Beispieltabelle gezeigt. Wenn die Stimme nicht die Sprache des Eingabetexts spricht, gibt der Sprachdienst keine synthetisierte Audioausgabe aus.
| Stimme | Automatisch erkannte Sprachnummer | Sprache automatisch erkannt (Region) | Alle lokalen Nummern | Alle von SSML unterstützten Sprachen (Gebietsschema) |
|---|---|---|---|---|
en-US-AndrewMultilingualNeural
1 (männlich)en-US-AvaMultilingualNeural
1 (Weiblich)en-US-BrianMultilingualNeural
1 (männlich)en-US-EmmaMultilingualNeural
1 (Weiblich) |
77 | Afrikaans (af-ZA), Albanisch (sq-AL), Amharisch (am-ET), Arabisch (ar-EG), Armenisch (hy-AM), Aserbaidschanisch (az-AZ), Bahasa Indonesia (id-ID), Bangla (bn-BD), Baskisch (eu-ES), Bengalisch (bn-IN), Bosnisch (bs-BA), Bulgarisch (bg-BG), Birmanisch (my-MM), Katalanisch (ca-ES), Chinesisch (Kantonesisch) (zh-HK), Chinesisch (Mandarin) (zh-CN), Chinesisch (Taiwanesisch) (zh-TW), Kroatisch (hr-HR), Tschechisch (cs-CZ), Dänisch (da-DK), Niederländisch (nl-NL), Englisch (en-US), Estnisch (et-EE), Filipino (fil-PH), Finnisch (fi-FI), Französisch (fr-FR), Galicisch (gl-ES), Georgisch (ka-GE), Deutsch (de-DE), Griechisch (el-GR), Hebräisch (he-IL), Hindi (hi-IN), Ungarisch (hu-HU), Isländisch (is-IS), Irisch (ga-IE), Italienisch (it-IT), Japanisch (ja-JP), Javanisch (jv-ID), Kannada (kn-IN), Kasachisch (kk-KZ), Khmer (km-KH), Koreanisch (ko-KR), Laotisch (lo-LA), Lettisch (lv-LV), Litauisch (lt-LT), Mazedonisch (mk-MK), Malaysisch (ms-MY), Malayalam (ml-IN), Maltesisch (mt-MT), Mongolisch (mn-MN), Nepali (ne-NP), Norwegisch (Bokmål) (nb-NO), Paschtunisch (ps-AF), Persisch (fa-IR), Polnisch (pl-PL), Portugiesisch (pt-BR), Rumänisch (ro-RO), Russisch (ru-RU), Serbisch (sr-RS), Singhalesisch (si-LK), Slowakisch (sk-SK), Slowenisch (sl-SI), Somali (so-SO), Spanisch (es-ES), Sundanesisch (su-ID), Kisuaheli (sw-KE), Schwedisch (sv-SE), Tamil (ta-IN), Telugu (te-IN), Thailändisch (th-TH), Türkisch (tr-TR), Ukrainisch (uk-UA), Urdu (ur-PK), Usbekisch (uz-UZ), Vietnamesisch (vi-VN), Walisisch (cy-GB), Zulu (zu-ZA) |
91 | Afrikaans (Südafrika) (af-ZA), Albanisch (Albanien) (sq-AL), Amharisch (Äthiopien) (am-ET), Arabisch (Ägypten) (ar-EG), Arabisch (Saudi-Arabien) (ar-SA), Armenisch (Armenien) (hy-AM), Aserbaidschanisch (Aserbaidschan) (az-AZ), Baskisch (Baskenland) (eu-ES), Bengalisch (Indien) (bn-IN), Bosnisch (Bosnien und Herzegowina) (bs-BA), Bulgarisch (Bulgarien) (bg-BG), Birmanisch (Myanmar) (my-MM), Katalanisch (Spanien) (ca-ES), Chinesisch (Kantonesisch, traditionell) (zh-HK), Chinesisch (Mandarin, vereinfacht) (zh-CN), Chinesisch ( Taiwanesisches Mandarin) (zh-TW), Kroatisch (Kroatien) (hr-HR), Tschechisch (Tschechien) (cs-CZ), Dänisch (Dänemark) (da-DK), Niederländisch (Belgien) (nl-BE), Niederländisch (Niederlande) (nl-NL), Englisch (Australien) (en-AU), Englisch (Kanada) (en-CA), Englisch (Hongkong SAR) (en-HK), Englisch (Indien) (en-IN), Englisch (Irland) (en-IE), Englisch (Vereinigtes Königreich) (en-GB), Englisch (USA) (en-US), Estnisch (Estland) (et-EE), Filipino (Philippinen) (fil-PH), Finnisch (Finnland) (fi-FI), Französisch (Belgien) (fr-BE), Französisch (Kanada) (fr-CA), Französisch (Frankreich) (fr-FR), Französisch (Schweiz) (fr-CH), Galizisch (Galizien) (gl-ES), Georgisch (Georgien) (ka-GE), Deutsch (Österreich) (de-AT), Deutsch (Deutschland) (de-DE), Deutsch (Schweiz) (de-CH), Griechisch (Griechenland) (el-GR), Hebräisch (Israel) (he-IL), Hindi (Indien) (hi-IN), Ungarisch (Ungarn) (hu-HU), Isländisch (Island) (is-IS), Indonesisch (Indonesien) (id-ID), Irisch (Irland) (ga-IE), Italienisch (Italien) (it-IT), Japanisch (Japan) (ja-JP), Javanisch (Indonesien) (jv-ID), Kannada (Indien) (kn-IN), Kasachisch (Kasachstan) (kk-KZ), Khmer (Kambodscha) (km-KH), Koreanisch (Korea) (ko-KR), Laotisch (Laos) (lo-LA), Lettisch (Lettland) (lv-LV), Litauisch (Litauen) (lt-LT), Mazedonisch (Nordmazedonien) (mk-MK), Malaiisch (Malaysia) (ms-MY), Malayalam (Indien) (ml-IN), Maltesisch (Malta) (mt-MT), Mongolisch (Mongolei) (mn-MN), Nepali (Nepal) (ne-NP), Norwegisch (Bokmål, Norwegen) (nb-NO), Paschtu (Afghanistan) (ps-AF), Persisch (Iran) (fa-IR), Polnisch (Polen) (pl-PL), Portugiesisch (Brasilien) (pt-BR), Portugiesisch (Portugal) (pt-PT), Rumänisch (Rumänien) (ro-RO), Russisch (Russland) (ru-RU), Serbisch (Kyrillisch, Serbien) (sr-RS), Singhalesisch (Sri Lanka) (si-LK), Slowakisch (Slowakei) (sk-SK), Slowenisch (Slowenien) (sl-SI), Somalisch (Somalia) (so-SO), Spanisch (Mexiko) (es-MX), Spanisch (Spanien) (es-ES), Sundanisch (Indonesien) (su-ID), Swahili (Kenia) (sw-KE), Schwedisch (Schweden) (sv-SE), Tamil (Indien) (ta-IN), Telugu (Indien) (te-IN), Thai (Thailand) (th-TH), Türkisch (Türkiye) (tr-TR), Ukrainisch (Ukraine) (uk-UA), Urdu (Pakistan) (ur-PK), Usbekisch (Usbekistan) (uz-UZ), Vietnamesisch (Vietnam) (vi-VN), Walisisch (Vereinigtes Königreich) (cy-GB), Zulu (Südafrika) (zu-ZA) |
1 Dies sind neuronale mehrsprachige Stimmen in Azure Sprachdiensten in Foundry Tools. Alle mehrsprachigen Stimmen können in der Sprache im Standardgebietsschema des Eingabetexts sprechen, ohne SSML zu verwenden. Sie können das <lang xml:lang> Element jedoch weiterhin verwenden, um den sprechenden Akzent jeder Sprache anzupassen, um bevorzugte Akzente wie britische Akzente (en-GB) für Englisch festzulegen. Das Präfix im Namen jeder Stimme gibt das primäre Gebietsschema an; zum Beispiel ist das primäre Gebietsschema für en-US-AndrewMultilingualNeuralen-US.
Lang-Beispiele
Informationen zu den unterstützten Werten für Attribute des lang Elements finden Sie unter "Sprache anpassen".
Sie müssen en-US als Standardsprache innerhalb des speak Elements angeben, unabhängig davon, ob die Sprache an anderer Stelle angepasst wird. In diesem Beispiel ist en-US-Ava:DragonHDLatestNeural die primäre Sprache für en-US.
Dieser SSML-Codeausschnitt zeigt, wie <lang xml:lang> genutzt wird, um de-DE mit der neuronalen Stimme en-US-Ava:DragonHDLatestNeural zu sprechen.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural">
<lang xml:lang="de-DE">
Wir freuen uns auf die Zusammenarbeit mit Ihnen!
</lang>
</voice>
</speak>
Innerhalb des speak-Elements können Sie mehrere Sprachen festlegen, einschließlich en-US für Text-zu-Sprache-Ausgabe. Für jede angepasste Sprache muss der Text mit der Sprache übereinstimmen und in ein voice Element eingeschlossen werden. Dieser SSML-Codeausschnitt zeigt, wie Sie die Sprechsprachen zu <lang xml:lang> ändern, es-MX, en-US und fr-FR.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural">
<lang xml:lang="es-MX">
¡Esperamos trabajar con usted!
</lang>
<lang xml:lang="en-US">
We look forward to working with you!
</lang>
<lang xml:lang="fr-FR">
Nous avons hâte de travailler avec vous!
</lang>
</voice>
</speak>
Prosodie anpassen
Mit dem prosody Element können Sie Änderungen an Tonhöhe, Kontur, Spannweite, Sprechgeschwindigkeit und Lautstärke für die Text-to-Speech-Ausgabe angeben. Das prosody Element kann Text und die folgenden Elemente enthalten: audio, , p, phoneme, , prosody, say-as, und subs.
Da prosodische Attributwerte über einen breiten Bereich variieren können, interpretiert die Spracherkennung die zugewiesenen Werte als Vorschlag dafür, was die tatsächlichen prosodischen Werte der ausgewählten Stimme sein sollen. Text-in-Sprache begrenzt oder ersetzt Werte, die nicht unterstützt werden. Beispiele für nicht unterstützte Werte sind ein Neigungswinkel von 1 MHz oder ein Volumen von 120.
In der folgenden Tabelle wird die Verwendung der Attribute des prosody Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
contour |
Die Kontur stellt Änderungen an der Tonhöhe dar. Diese Änderungen werden als Array von Zielen bei bestimmten Zeitpositionen in der Sprachausgabe dargestellt. Sätze von Parameterpaaren definieren jedes Ziel. Zum Beispiel: <prosody contour="(0%,+20Hz) (10%,-2st) (40%,+10Hz)">Der erste Wert in jedem Parametersatz gibt die Position der Tonhöhenänderung als Prozentsatz der Dauer des Textes an. Der zweite Wert gibt die Menge an, um die die Tonhöhe mit einem relativen Wert oder einem Enumerationswert für die Tonhöhe erhöht oder verringert wird (siehe pitch). Der Tonhöhenverlauf funktioniert nicht bei einzelnen Wörtern und kurzen Ausdrücken. Es wird empfohlen, die Tonhöhenkontur in ganzen Sätzen oder langen Phrasen anzupassen. |
Optional |
pitch |
Gibt die Grundfrequenz für den Text an. Tonhöhenänderungen können auf Satzebene angewendet werden. Die Tonhöhenänderungen sollten innerhalb von 0,5 bis 1,5 Mal der ursprünglichen Audiodatei liegen. Sie können die Tonhöhe ausdrücken als:
|
Optional |
range |
Ein Wert, der den Bereich der Tonhöhe für den Text darstellt. Sie können ausdrücken range , indem Sie dieselben absoluten Werte, relative Werte oder Enumerationswerte verwenden, die zum Beschreiben pitchverwendet werden. |
Optional |
rate |
Gibt die Sprachrate des Texts an. Die Sprachrate kann auf Wort- oder Satzebene angewendet werden. Die Geschwindigkeitsänderungen sollten innerhalb von 0.5 bis 2 Mal der ursprünglichen Audiowiedergabe betragen. Sie können rate folgendermaßen ausdrücken:
|
Optional |
volume |
Gibt die Lautstärke der sprechenden Stimme an. Volumenänderungen können auf Satzebene angewendet werden. Sie können die Lautstärke ausdrücken als:
|
Optional |
Prosody-Beispiele
Informationen zu den unterstützten Werten für Attribute des prosody-Elements finden Sie unter Prosodie anpassen.
Beispiel für Änderung der Sprechgeschwindigkeit
Dieser SSML-Codeausschnitt veranschaulicht, wie das rate Attribut verwendet wird, um die Sprachrate auf 30% größer als die Standardrate zu ändern.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural">
<prosody rate="+30.00%">
Enjoy using text to speech.
</prosody>
</voice>
</speak>
Beispiel für "Lautstärke ändern"
Dieser SSML-Codeausschnitt veranschaulicht, wie das volume Attribut verwendet wird, um das Volume auf 20% größer als das Standardvolume zu ändern.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-Ava:DragonHDLatestNeural">
<prosody volume="+20.00%">
Enjoy using text to speech.
</prosody>
</voice>
</speak>
Beispiel für Änderung der Tonhöhe
Dieser SSML-Codeausschnitt veranschaulicht, wie das pitch Attribut verwendet wird, damit die Stimme mit hoher Tonhöhe spricht.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-AvaMultilingualNeural">
Welcome to <prosody pitch="high">Enjoy using text to speech.</prosody>
</voice>
</speak>
Beispiel zum Ändern der Tonhöhenkontur
Dieser SSML-Codeausschnitt veranschaulicht, wie das contour Attribut verwendet wird, um die Kontur zu ändern.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-AvaMultilingualNeural">
<prosody contour="(60%,-60%) (100%,+80%)" >
Were you the only person in the room?
</prosody>
</voice>
</speak>
Hervorhebung anpassen
Sie können das optionale emphasis Element zum Hinzufügen oder Entfernen von Stress auf Wortebene für den Text verwenden. Dieses Element kann nur Text und die folgenden Elemente enthalten: audio, , break, emphasis, lang, phoneme, prosody, say-as, , , und subvoice.
Hinweis
Die Hervorhebungsoptimierung auf Wortebene ist nur für diese neuronalen Stimmen verfügbar: en-US-GuyNeural, en-US-DavisNeural, und en-US-JaneNeural.
Bei Wörtern mit niedriger Tonhöhe und kurzer Dauer könnte die Tonhöhe nicht genügend angehoben werden, um wahrgenommen zu werden.
In der folgenden Tabelle werden die Attribute des emphasis Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
level |
Gibt die Stärke der Betonung an, die angewendet werden soll:
Wenn das level Attribut nicht angegeben ist, lautet moderatedie Standardebene . Ausführliche Informationen zu den einzelnen Attributen finden Sie im Hervorhebungselement. |
Optional |
Betonungsbeispiele
Informationen zu den unterstützten Werten für Attribute des Elements finden Sie unter Anpassen der emphasisHervorhebung.
Dieser SSML-Codeausschnitt veranschaulicht, wie Sie das emphasis Element verwenden können, um dem Wort "Besprechungen" eine moderate Betonung hinzuzufügen.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-US-AndrewMultilingualNeural">
I can help you join your <emphasis level="moderate">meetings</emphasis> fast.
</voice>
</speak>
Hinzufügen von aufgezeichneten Audiodaten
Das audio Element ist optional. Sie können es verwenden, um vorab aufgezeichnete Audiodaten in ein SSML-Dokument einzufügen. Der Textkörper des audio-Elements kann Nur-Text oder SSML-Markup enthalten, das verwendet wird, wenn die Audiodatei nicht verfügbar ist oder nicht wiedergegeben werden kann. Das audio Element kann auch Text und die folgenden Elemente enthalten: audio, , break, p, s, , phoneme, prosody, und say-assub.
Alle im SSML-Dokument enthaltenen Audiodaten müssen die folgenden Anforderungen erfüllen:
- Die Audiodatei muss gültig sein *.mp3, *.wav, *.opus, *.ogg, *.flac oder *.wma Dateien.
- Die kombinierte Gesamtzeit für alle Text- und Audiodateien in einer einzigen Antwort darf 600 Sekunden nicht überschreiten.
- Die Audiodaten dürfen keine kundenspezifischen oder anderen vertraulichen Informationen enthalten.
Hinweis
Das audio Element wird von der Langen Audio-API nicht unterstützt. Verwenden Sie die Batchsynthese-API stattdessen für die Umwandlung von Langformtext in Sprache.
In der folgenden Tabelle wird die Verwendung der Attribute des audio Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
src |
Der URI-Speicherort der Audiodatei. Die Audiodaten müssen auf einem über das Internet zugänglichen HTTPS-Endpunkt gehostet werden. HTTPS ist erforderlich. Die Domäne, in der die Datei gehostet wird, muss ein gültiges, vertrauenswürdiges TLS/SSL-Zertifikat aufweisen. Sie sollten die Audiodatei in Blob Storage im selben Azure Bereich wie der Text-zu-Sprachendpunkt einfügen, um die Latenz zu minimieren. | Erforderlich |
Audiobeispiele
Informationen zu den unterstützten Werten für Attribute des audio Elements finden Sie unter Hinzufügen von aufgezeichneten Audiodaten.
Dieser SSML-Codeausschnitt veranschaulicht, wie Sie mithilfe des src Attributs Audio aus zwei .wav Dateien einfügen.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US">
<voice name="en-US-AvaMultilingualNeural">
<p>
<audio src="https://contoso.com/opinionprompt.wav"/>
Thanks for offering your opinion. Please begin speaking after the beep.
<audio src="https://contoso.com/beep.wav">
Could not play the beep, please voice your opinion now.
</audio>
</p>
</voice>
</speak>
Anpassen der Audiodauer
Verwenden Sie das mstts:audioduration Element, um die Dauer des Ausgabeaudios festzulegen. Verwenden Sie dieses Element, um das Timing des Abschlusses der Audioausgabe zu synchronisieren. Die Audiodauer kann um das 0.5- bis 2-Fache der ursprünglichen Wiedergabegeschwindigkeit verlangsamt oder beschleunigt werden. Bei der ursprünglichen Audioausgabe handelt es sich um die Audiodaten ohne andere Wiedergabeeinstellungen. Die Sprachrate wird je nach festgelegtem Wert verlangsamt oder beschleunigt.
Die Einstellung für die Audiodauer gilt für alle Eingabetexte innerhalb des eingeschlossenen voice Elements. Um die Einstellung für die Audiodauer erneut zurückzusetzen oder zu ändern, müssen Sie ein neues voice Element entweder mit derselben Stimme oder einer anderen Stimme verwenden.
In der folgenden Tabelle wird die Verwendung der Attribute des mstts:audioduration Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
value |
Angeforderte Dauer der Audioausgabe in Sekunden, z. B. 2s, oder in Millisekunden, z. B. 2000ms.Der Maximalwert für die Ausgabeaudiodauer beträgt 300 Sekunden. Dieser Wert sollte dem 0.5- bis 2-Fachen der ursprünglichen Audiodauer ohne weitere Wiedergabeeinstellungen entsprechen. Wenn beispielsweise die angeforderte Dauer Ihres Audiosignals lautet 30s, muss die ursprüngliche Audiodaten andernfalls zwischen 15 und 60 Sekunden betragen. Wenn Sie einen Wert außerhalb dieser Grenzen festlegen, wird die Dauer entsprechend dem jeweiligen Minimum oder Maximum multiple festgelegt. Bei Audioausgaben mit einer Länge von mehr als 300 Sekunden erstellen Sie zunächst das Original-Audio ohne weitere Einstellungen zur Sprechgeschwindigkeit und berechnen dann die anzupassende Geschwindigkeit anhand der Prosodie-Geschwindigkeit, um die gewünschte Dauer zu erzielen. |
Erforderlich |
Beispiele für die Dauer von mstts-Audio
Informationen zu den unterstützten Werten für Attribute des mstts:audioduration Elements finden Sie unter Anpassen der Audiodauer.
In diesem Beispiel beträgt die ursprüngliche Audiowiedergabe etwa 15 Sekunden. Das mstts:audioduration Element wird verwendet, um die Audiodauer auf 20 Sekunden oder 20s.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-US-AvaMultilingualNeural">
<mstts:audioduration value="20s"/>
If we're home schooling, the best we can do is roll with what each day brings and try to have fun along the way.
A good place to start is by trying out the slew of educational apps that are helping children stay happy and smash their schooling at the same time.
</voice>
</speak>
Hinzufügen von Hintergrundaudio
Sie können das mstts:backgroundaudio Element verwenden, um Ihren SSML-Dokumenten Hintergrundaudio hinzuzufügen oder eine Audiodatei mit Text zu Sprache zu mischen. Mithilfe von mstts:backgroundaudio können Sie im Hintergrund eine Audiodatei in einer Schleife laufen lassen, am Anfang der Sprachsynthese einblenden und am Ende der Sprachsynthese ausblenden.
Wenn die bereitgestellte Hintergrundaudioaufnahme kürzer ist als die Sprachsynthese oder das Ausblenden, wird sie in einer Schleife laufen gelassen. Wenn sie länger ist als die Sprachsynthese, wird sie angehalten, sobald das Ausblenden abgeschlossen ist.
Pro SSML-Dokument ist nur eine Hintergrundaudiodatei zulässig. Sie können audio Tags innerhalb des voice Elements einfügen, um Ihrem SSML-Dokument weitere Audiodaten hinzuzufügen.
Hinweis
Das mstts:backgroundaudio Element sollte vor allen voice Elementen platziert werden. Wenn angegeben, muss es das erste untergeordnete Element des speak Elements sein.
Das mstts:backgroundaudio Element wird von der Langen Audio-API nicht unterstützt. Verwenden Sie stattdessen die Batchsynthese-API (Vorschau) für längerformatigen Text-zu-Sprache.
In der folgenden Tabelle wird die Verwendung der Attribute des mstts:backgroundaudio Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
src |
Die URI-Adresse der Hintergrund-Audio-Datei. | Erforderlich |
volume |
Die Lautstärke der Hintergrundaudiodatei. Akzeptierte Werte: 0 bis 100 einschließlich. Der Standardwert ist 1. |
Optional |
fadein |
Die Dauer der Hintergrundaudio-Einblendungszeit in Millisekunden. Der Standardwert ist 0, was dem „Nicht einblenden“ entspricht. Akzeptierte Werte: 0 bis 10000 einschließlich. |
Optional |
fadeout |
Die Dauer des Ausblendens von Hintergrundaudio in Millisekunden. Der Standardwert ist 0, was keine Ausblendung bedeutet. Einschließlich akzeptierter Werte: 0 bis 10000. |
Optional |
Mstss Hintergrundaudio-Beispiele
Informationen zu den unterstützten Werten für Attribute des mstts:backgroundaudi Elements finden Sie unter Hinzufügen von Hintergrundaudio.
<speak version="1.0" xml:lang="en-US" xmlns:mstts="http://www.w3.org/2001/mstts">
<mstts:backgroundaudio src="https://contoso.com/sample.wav" volume="0.7" fadein="3000" fadeout="4000"/>
<voice name="en-US-AvaMultilingualNeural">
The text provided in this document are spoken over the background audio.
</voice>
</speak>
Viseme-Element
Ein Viseme ist die visuelle Beschreibung eines Phoneme in gesprochener Sprache. Er definiert die Position des Gesichts und des Mundes, während eine Person spricht. Sie können das mstts:viseme-Element in SSML verwenden, um die Visemausgabe anzufordern. Weitere Informationen finden Sie unter Abrufen der Gesichtsposition mit Mundbild.
Die Viseme-Einstellung gilt für den gesamten Eingabetext innerhalb des umschließenden voice-Elements. Um die Viseme-Einstellung erneut zurückzusetzen oder zu ändern, müssen Sie ein neues voice Element entweder mit derselben Stimme oder einer anderen Stimme verwenden.
Die Verwendung der Attribute des viseme Elements wird in der folgenden Tabelle beschrieben.
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
type |
Der Typ der Viseme-Ausgabe.
|
Erforderlich |
Hinweis
Derzeit unterstützt nur redlips_front neuronale Stimmen im Gebietsschema en-US, und FacialExpression unterstützt neuronale Stimmen in den Gebietsschemas en-US und zh-CN.
Viseme-Beispiele
Die unterstützten Werte für Attribute des viseme Elements wurden zuvor beschrieben.
Dieser SSML-Codeausschnitt zeigt, wie man Blendshapes mit der synthetisierten Sprache anfordern kann.
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="http://www.w3.org/2001/mstts" xml:lang="en-US">
<voice name="en-US-AvaNeural">
<mstts:viseme type="FacialExpression"/>
Rainbow has seven colors: Red, orange, yellow, green, blue, indigo, and violet.
</voice>
</speak>
Sprachkonvertierungselement
Die Sprachkonvertierung (Vorschau) ist der Prozess der Umwandlung der Sprachmerkmale einer bestimmten Audioaufnahme in die Stimme eines Zielsprechers. Nach der Sprachkonvertierung bleiben beim resultierenden Audio der sprachliche Inhalt und die Prosodie der Originalquelle erhalten, während die Stimmlage der Zielperson entspricht. Weitere Informationen finden Sie unter Sprachkonvertierung.
Verwenden Sie das <mstts:voiceconversion> Tag über Speech Synthesis Markup Language (SSML), um die Quellaudio-URL und die Zielstimme für die Konvertierung anzugeben. Eine vollständige Liste der unterstützten Zielstimme finden Sie unter "Unterstützte Stimmen für die Sprachkonvertierung".
In der folgenden Tabelle wird die Verwendung der Attribute des mstts:voiceconversion Elements beschrieben:
| Attribut | Beschreibung | Erforderlich oder optional |
|---|---|---|
url |
Die URL der Quellaudiodatei, die sprachlichen Inhalt und Prosody für die synthetisierte Sprache bereitstellt. Der url Zugriff muss über HTTPS-URL erfolgen. Zum Beispiel https://example.com/source.wavEingabeaudio muss unter 100 MB betragen. |
Erforderlich |
So funktioniert die Sprachkonvertierung:
- Die Quellaudio ist eine vorab aufgezeichnete Audiodatei, die die gesprochenen Wörter und Prosody enthält.
- Textinhalt: Die endgültige synthetisierte Sprache folgt den gesprochenen Wörtern im Quellaudio.
- Prosodie und Rhythmus: Die Sprachausgabe behält Timing und Intonation der Ausgangsquelle bei.
- Das
<voice>Tag gibt die Zielstimme an, die für die Ausgabeaudio verwendet wird. Weitere Informationen zu den unterstützten Zielstimmen sehen Sie unter unterstützten Stimmen für die Sprachkonvertierung. - Die Audioausgabe behält die Klangfarbe (Ton und Stimmqualität) der Zielstimme bei, folgt jedoch dem Text und dem Sprachstil der Quell-Audioaufnahme.
Hinweis
Alle SSML-Elemente im Zusammenhang mit Prosodie und Aussprache, wie zum Beispiel <prosody> oder <mstts:express-as>, werden ignoriert.
Die Texteingabe ist optional, und jeder text, der im SSML enthalten ist, wird beim Rendern ignoriert.
mstss Stimmentransformation Beispiele
Im folgenden Beispiel wird veranschaulicht, wie mit <mstts:voiceconversion> Sprache mithilfe einer neuralen Zielstimme synthetisiert wird und dabei sowohl der Inhalt als auch die Prosodie eines bestimmten Quellaudios abgeglichen werden:
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xmlns:mstts="https://www.w3.org/2001/mstts" xml:lang="en-US">
<voice xml:lang="en-US" xml:gender="Female" name="en-US-AvaMultilingualNeural">
<mstts:voiceconversion url="https://your.blob.core.windows.net/sourceaudio.wav"/>
</voice>
</speak>