Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Wichtig
Nicht englische Übersetzungen werden nur zur Bequemlichkeit bereitgestellt. Bitte konsultieren Sie die EN-US Version dieses Dokuments für die endgültige Version.
Ziel dieses Artikels ist es, Sprach- und Avatar-Talenten dabei zu helfen, die Technologie hinter den Text-zu-Sprache-Funktionen zu verstehen, die durch ihre Stimmen und Bilder möglich gemacht werden. Darüber hinaus enthält sie wichtige Datenschutzerklärungen für Talent darüber, wie Microsoft Audio- und Videodateien, die die aufgezeichneten Stimmen und Bilder von Talent enthalten, verarbeiten, verwenden und aufbewahren kann. Sie hilft Microsoft auch dabei, den Missbrauch von Foundry Tools zu verhindern oder darauf zu reagieren.
Microsoft ist bestrebt, KI verantwortungsbewusst zu entwerfen. Wir hoffen, dass diese Notiz ein größeres gemeinsames Verständnis zwischen Tech-Generatoren, Sprachtalenten, Avatar-Talenten und der allgemeinen Öffentlichkeit über die beabsichtigten und nützlichen Nutzung dieser Technologie fördern wird.
Schlüsseltext zu Sprachbegriffen
Sprachmodell: Ein Text-zu-Sprache-Computermodell, das die einzigartigen Stimmeigenschaften eines Ziellautsprechers nachahmen kann. Ein Sprachmodell wird auch als Sprachschriftart oder synthetische Stimme bezeichnet. Ein Sprachmodell ist eine Reihe von Parametern im Binärformat, die nicht lesbar sind und keine Audioaufzeichnungen enthalten. Es kann nicht umgekehrt entwickelt werden, um die Audioaufzeichnungen eines sprechenden Menschen abzuleiten oder zu konstruieren.
Sprachtalent: Personen oder Ziellautsprecher, deren Stimmen aufgezeichnet und verwendet werden, um Sprachmodelle zu erstellen, die wie die Stimme des Sprachtalents klingen sollen.
Avatarmodell: Ein Text-zu-Sprache-Avatarmodell, das einzigartige Gesichtsmerkmale eines Zieldarstellers nachahmen kann. Ein Avatarmodell ist eine Reihe von Parametern im Binärformat, die nicht lesbar sind und keine Video- oder Audioaufzeichnungen enthalten. Das Ableiten oder Erstellen von Videoaufzeichnungen von Personen durch Reverse Engineering ist nicht möglich.
Avatar-Talent: Das Erstellen eines benutzerdefinierten Avatarmodells für Text zu Sprache erfordert Schulungen in einer Videoaufzeichnung eines echten Menschen. Diese Person ist das Avatar-Talent. Kunden müssen gemäß allen relevanten Gesetzen und Vorschriften des Avatar-Talents ausreichende Zustimmung erhalten, um ihr Bild zu verwenden, um einen benutzerdefinierten Avatar zu erstellen.
Funktionsweise von neuralem Text-to-Speech
Funktionsweise: Neuronaler Text zu Sprache synthetisiert Sprache mithilfe von tiefen neuralen Netzwerken, die "gelernt" haben, wie Phonetik in natürlicher menschlicher Sprache kombiniert werden, anstatt klassische Programmierung oder statistische Methoden zu verwenden. Neben den Aufzeichnungen eines bestimmten Sprachtalents verwendet neuraler Text für Sprache eine Quellbibliothek, die Sprachaufzeichnungen von vielen verschiedenen Lautsprechern enthält.
Wissenswertes dazu: Aufgrund der Art und Weise, wie sie Stimmen synthetisiert, kann neuronale Text-zu-Sprache Stile erzeugen, die nicht Teil der originalen Aufzeichnungen waren, z. B. Änderungen des Stimmtons und der Sprachmanierismen. Neuronale Sprachsynthese-Stimmen klingen flüssig und können gut die natürlichen Pausen, Eigenheiten und Zögerlichkeiten nachahmen, die typisch sind, wenn Menschen sprechen. Diejenigen, die synthetische Stimmen hören, die über neuronaler Text-zu-Sprache gemacht werden, neigen dazu, sie eher mit menschlicher Sprache zu vergleichen als Standard-Text-zu-Sprache-Stimmen.
Examples, wie Microsoft es verwendet:
- Vorkonfigurierte neurale Stimme ist eine Funktion von Text-zu-Sprache, die sofort einsatzbereite Sprachmodelle für die Kundennutzung bietet. Vorkonfigurierte neurale Stimmen werden auch in mehreren Microsoft Produkten verwendet, einschließlich Edge-Browser, Sprachausgabe, Office und Teams.
-
Benutzerdefinierte neurale Stimme ist ein Feature der Text-zu-Sprache-Technologie, das die Erstellung einzigartiger synthetischer Sprachmodelle ermöglicht. Die folgenden Funktionen gehören zu einer benutzerdefinierten neuronalen Stimme:
- Sprachübertragung, mit der die ursprünglichen Sprachaufzeichnungen in einer anderen Sprache wiedergegeben werden können.
- Die Stilübertragung kann sich in einem anderen Sprachstil als bei den ursprünglichen Sprachaufzeichnungen ausdrücken. Beispielsweise eine Newscasterstimme.
- Die Sprachtransformation kann sich von den ursprünglichen Sprachaufzeichnungen unterscheiden. Ändern Sie z. B. den Ton oder die Tonhöhe, um unterschiedliche Charakterstimmen zu erzeugen.
- Andere Stimmen, die in Microsoft-Produkten und Diensten verwendet werden, z. B.: Cortana.
Was bei der Aufzeichnung zu erwarten ist: Tragen Sie mindestens 300 Zeilen zu einem Sprachmodell-Prototyp bei und ca. 2.000 Zeilen, um ein neues Sprachmodell für den Produktionseinsatz zu erstellen.
Wie ein Text-zu-Sprache-Avatar funktioniert
Funktionsweise: Text-zu-Sprache-Avatar basiert auf vordefinierter neuraler Stimme und benutzerdefinierter neuraler Stimme und synthetisiert Avatarvideoinhalte mit synchronisierten Text mit vorkonfigurierter neuraler Stimme oder benutzerdefinierter neuraler Stimme. Der Syntheseprozess verwendet tiefe neuronale Netzwerke, die auf Modellen trainiert werden, die basierend auf Videoaufzeichnungen von Avatar-Darstellern entwickelt werden. Die Modelle werden mit den akustischen Merkmalen trainiert, die aus den Audioelementen der Aufzeichnung extrahiert werden, sowie physische Eigenschaften, Mundbewegungen, Gesichtsausdrücke und verwandte visuelle Elemente, die aus den Videoelementen der Aufzeichnung extrahiert werden.
Was Sie darüber wissen sollten: Das Gesicht, der Körper und die Bewegungen des synthetisierten Text-zu-Sprache-Avatars ähneln dem Avatar-Talent stark, aber die Stimme des Text-zu-Sprache-Avatars kann aus einer der von Microsoft bereitgestellten neuralen Standardstimmen oder einer benutzerdefinierten neuralen Stimme generiert werden, einschließlich der Fälle, in denen der Sprecher dieselbe Person wie das Avatar-Talent ist, wenn die Person diese Verwendung autorisiert hat.
Examples, wie Microsoft es verwendet:
- Prebuilt text to speech avatar ist ein Feature von Azure Speech in Foundry Tools für Text-to-Speech, das vorgefertigte Text-to-Speech-Avatar-Modelle zur Nutzung durch Kunden anbietet.
- Custom text to speech avatar ist eine Funktion von Azure Speech Text-to-Speech, die die Erstellung von einzigartigen benutzerdefinierten synthetischen Text-to-Speech-Avatar-Modellen ermöglicht.
Was Sie bei der Aufzeichnung erwarten müssen: Sie müssen mindestens 10 Minuten Videoaufzeichnung für ein benutzerdefiniertes Proof-of-Concept-Avatarmodell und ca. 20 Minuten Videoaufzeichnung beitragen, um ein vollständiges benutzerdefiniertes Avatarmodell für die Produktionsverwendung zu erzeugen.
Sprachtalente und synthetische Stimmen: eine sich entwickelnde Beziehung
Microsoft erkannte die integrale Beziehung zwischen Sprachtalent und synthetischen Stimmen und interviewte Sprachtalent, um deren Perspektiven auf neue technologische Entwicklungen besser zu verstehen. Untersuchungen, die wir 2019 durchgeführt haben, haben gezeigt, dass Sprachtalente potenzielle Vorteile durch die Funktionen von neuraler Text-zu-Sprache-Technologie sahen, z. B. das Sparen von Studiozeit, um Aufnahmeaufträge abzuschließen, und das Hinzufügen von Kapazitäten, um mehr Sprachaufträge zu erledigen. Gleichzeitig gab es unterschiedliche Bewusstseinsbildungen darüber, wie sich die Entwicklung von Text-zu-Sprache-Technologie möglicherweise auf ihren Beruf auswirken könnte.
Insgesamt äußerten Sprachtalente den Wunsch nach Transparenz und Klarheit über:
- Beschränkungen bezüglich dessen, wofür ihr Stimmabbild verwendet werden durften und wofür nicht.
- Die Dauer der zulässigen Verwendung ihrer Stimmähnlichkeit.
- Potenzielle Auswirkungen auf zukünftige Aufnahmemöglichkeiten.
- Die Persona des Stimmbilds
Synthetische Stimme bei breiterer Verwendung
Traditionell waren Text-zu-Sprache-Stimmen aufgrund ihres robotischen Klangs nur eingeschränkt nutzbar. Die meisten wurden verwendet, um die Barrierefreiheit zu unterstützen, z. B. als Bildschirmsprachausgabe für Menschen, die blind sind oder sehbehindert sind. Stimmen für die Sprachsynthese wurden auch von Personen mit Sprachbeeinträchtigung verwendet. Beispielsweise verwendete der verstorbene Stephen Hawking eine durch Text-zu-Sprache-Technologie erzeugte Stimme.
Jetzt, mit zunehmend realistisch klingenden synthetischen Stimmen und dem Anstieg vertrauter, alltäglicher Interaktionen zwischen Maschinen und Menschen, haben sich die Verwendungsmöglichkeiten dieser Technologie verbreitet und erweitert. Text-zu-Sprachsysteme unterstützen Sprachassistenten über ein Array von Geräten und Anwendungen hinweg. Sie lesen Nachrichten, Suchergebnisse, Ankündigungen des öffentlichen Dienstes, Bildungsinhalte und vieles mehr.
Synthetischer Avatar in breiterer Verwendung
Ähnlich wie Text-in-Sprache Stimmen bieten Avatare jetzt realistische Darstellungen, Bewegungen und Gesichtsausdrücke, die sich mit lebensnah klingenden Stimmen paaren. Diese sprechenden Avatare können in einer Vielzahl von Situationen verwendet werden, z. B. zum Präsentieren von Inhalten in einer Onlineschulung, zum Präsentieren einer Rede im Namen eines Unternehmens, zur Interaktion mit Kunden in den Kundendiensteinstellungen und vieles mehr.
Microsofts Ansatz für die verantwortungsvolle Verwendung von Text-zu-Sprache
Jeden Tag finden menschen neue Wege, Text auf Sprachtechnologie anzuwenden, und nicht alle sind für das Wohl der Menschen oder der Gesellschaft. Wenn missbraucht, könnten glaubhaft menschlich klingende Text-zu-Sprache-Stimmen oder realistische sprechende Avatare Schaden anrichten. Beispielsweise könnte eine Falschinformationskampagne viel stärker werden, wenn sie die Stimme und das Bild einer bekannten öffentlichen Figur verwendet.
Wir wissen, dass es keine perfekte Möglichkeit gibt, Medien daran zu hindern, geändert zu werden oder unmissverständlich zu beweisen, woher sie stammt. Daher hat sich unser Ansatz zur verantwortungsvollen Verwendung darauf konzentriert, in Bezug auf die Funktionen der Text-zu-Sprache-Umwandlung von Azure transparent zu sein. Dies wird erreicht, indem wir die zulässigen Verwendungen von benutzerdefinierten Versionen dieser Funktionen einschränken und unsere Werte durch Taten demonstrieren.
Anforderungen und Tipps für eine sinnvolle Einwilligung von Stimm- und Avatar-Talenten
Wenn Sie Microsoft Produkte oder Dienste verwenden, um biometrische Daten zu verarbeiten, sind Sie dafür verantwortlich: (i) Bereitstellung einer Mitteilung an betroffene Personen, einschließlich in Bezug auf Aufbewahrungsfristen und Vernichtung; ii) Einholen der Zustimmung von betroffenen Personen; und (iii), Löschen der biometrischen Daten, alle gemäß den geltenden Datenschutzanforderungen angemessen und erforderlich. "Biometrische Daten" haben die in Artikel 4 der DSGVO dargelegte Bedeutung und gegebenenfalls gleichwertige Begriffe in anderen Datenschutzanforderungen.
Um benutzerdefinierte neurale Stimme zu verwenden, müssen kunden vertraglich folgende Aktionen ausführen:
- Erhalten Sie explizite schriftliche Erlaubnis von Sprachtalenten, um die Stimme dieser Person zum Erstellen einer benutzerdefinierten neuralen Stimme zu verwenden.
- Stellen Sie Sprechertalenten dieses Dokument zur Verfügung, damit sie verstehen können, wie Text-zu-Sprache funktioniert und wie diese Technologie verwendet werden kann, sobald sie den Audioaufzeichnungsprozess abgeschlossen haben.
- Erhalten Sie die notwendigen Berechtigungen von den Sprachtalenten für die Verarbeitung, Verwendung und Aufbewahrung ihrer Audiodateien durch Microsoft, um die Sprecherüberprüfung anhand von Schulungsdaten durchzuführen und um Sprachmodelle zu verwenden und aufzubewahren, wie unten beschrieben.
Außerdem wird empfohlen, dass Kunden die folgenden Aktionen ausführen:
- Teilen Sie die beabsichtigten Kontexte der Verwendung mit Sprachtalenten, damit sie wissen, wer ihre Stimme hören wird, in welchen Szenarien und ob/wie Personen damit interagieren können.
- Stellen Sie sicher, dass die Sprechenden wissen, dass ein Stimmmodell aus ihren Aufzeichnungen Dinge sagen könnte, die sie nicht explizit im Studio aufgenommen haben.
- Besprechen Sie, ob es etwas gibt, das für sie bei der Verwendung des Sprachmodells unangenehm wäre.
Microsoft Verarbeitung, Nutzung und Aufbewahrung von Daten
Microsofts Verwendung von Sprachtalent-Audiodateien zur Sprecherverifikation
Kunden müssen die Erlaubnis von Sprachkünstlern erhalten, deren Stimme zu verwenden, um benutzerdefinierte Sprachmodelle für eine synthetische Stimme zu erstellen. Dieser technische Schutz soll dazu beitragen, den Missbrauch unseres Dienstes zu verhindern, indem beispielsweise verhindert wird, dass jemand Sprachmodelle mit Audioaufzeichnungen trainiert und die Modelle verwendet, um eine Stimme ohne Wissen oder Zustimmung des Sprechers zu spoofen.
In Speech Studio müssen Sie eine Audiodatei mit einer aufgezeichneten Bestätigung von dem Sprachkünstler hochladen. Microsoft behält sich das Recht vor, die Lautsprechererkennungstechnologie Microsoft auf dieser aufgezeichneten Bestätigungserklärung zu verwenden und gegen die Schulungsaudiodaten zu überprüfen, um zu bestätigen, dass die Stimmen vom gleichen Sprecher stammen, oder falls anderweitig erforderlich, um den Missbrauch von Azure Speech zu untersuchen.
Die Sprachsignaturen des Sprechers, die aus den aufgezeichneten Bestätigungserklärungsdateien und Schulungsaudiodaten erstellt wurden, werden von Microsoft ausschließlich zu den oben genannten Zwecken verwendet. Microsoft behält die aufgezeichnete Anweisungsdatei so lange bei, wie erforderlich, um die Sicherheit und Integrität der Foundry Tools von Microsoft zu erhalten. Erfahren Sie mehr darüber, wie wir Daten im Dokument "Daten", "Datenschutz" und "Sicherheit" verarbeiten, verwenden und aufbewahren.
Microsofts Verwendung von benutzerdefinierten Modellen
Während Kunden die exklusiven Nutzungsrechte für ihr benutzerdefiniertes neurales Sprachmodell beibehalten, kann Microsoft eine Kopie von benutzerdefinierten neuralen Sprachmodellen beliebig lange aufbewahren. Microsoft können Ihr benutzerdefiniertes neurales Sprachmodell ausschließlich zum Schutz der Sicherheit und Integrität von Foundry Tools verwenden.
Microsoft wird eine Kopie der aufgezeichneten Bestätigungsaufzeichnung und des benutzerdefinierten neuronalen Sprachmodells mit der gleichen hohen Sicherheit sichern und speichern, die es für seine anderen Azure-Dienste verwendet. Weitere Informationen finden Sie im Microsoft Trust Center.
Wir werden weiterhin die absichtlichen, nützlichen und beabsichtigten Verwendungen von Text-zu-Sprache identifizieren und explizit darüber sein, die auf bestehenden sozialen Normen und Erwartungen basieren, die Menschen in Bezug auf Medien haben, wenn sie glauben, dass sie real oder gefälscht sind. Im Einklang mit den Vertrauensprinzipien von Microsoft überwacht oder moderiert Microsoft nicht aktiv die audioinhalte, die von Ihrer Verwendung von benutzerdefinierter neuraler Stimme generiert werden. Die Kunden sind allein dafür verantwortlich, sicherzustellen, dass die Nutzung allen anwendbaren Gesetzen und Vorschriften entspricht, und in Übereinstimmung mit den Bedingungen der Vereinbarung des Kunden mit Voice Talent.
Verwendung der Daten von Sprechenden bei Benutzerdefinierte neuronale Stimme Lite durch Microsoft
Custom neural voice lite ist ein Projekttyp in der öffentlichen Vorschau, der dir die Möglichkeit bietet, 20-50 Beispiele mit Speech Studio aufzunehmen und ein schlankes, angepasstes Stimmmodell für Demonstrations- und Evaluierungszwecke zu erstellen. Sowohl das Aufzeichnungsskript als auch das Testskript sind durch Microsoft vordefiniert. Ein synthetisches Stimmmodell, das Sie mit benutzerdefinierter neuronaler Stimme Lite erstellen, darf nur bereitgestellt und in einem breiteren Umfang verwendet werden, wenn Sie sich für einen vollständigen Zugriff auf die benutzerdefinierte neuronale Stimme bewerben und diesen erhalten (vorbehaltlich geltender Bedingungen).
Die synthetische Stimme und die zugehörige Audioaufzeichnung, die Sie über das Speech Studio übermitteln, werden innerhalb von 90 Tagen automatisch gelöscht, es sei denn, Sie erhalten vollzugriff auf benutzerdefinierte neurale Stimme und entscheiden sich für die Bereitstellung der synthetischen Stimme, in diesem Fall steuern Sie die Dauer der Aufbewahrung. Wenn das VoIP-Talent die synthetische Stimme und die zugehörigen Audioaufzeichnungen vor 90 Tagen gelöscht haben möchte, können sie sie direkt im Portal löschen oder sich an ihr Unternehmen wenden.
Bevor Sie ein synthetisches Sprachmodell bereitstellen können, das mit einem benutzerdefinierten Neural Voice Lite-Projekt erstellt wird, muss das Sprachtalent eine zusätzliche Aufzeichnung bereitstellen, in der sie erkennen, dass die synthetische Stimme für zusätzliche Zwecke verwendet wird, die über Demonstration und Auswertung hinausgehen.
Richtlinien für die verantwortungsvolle Bereitstellung
Da Text-zu-Sprache eine anpassbare Technologie ist, gibt es graue Bereiche, die bestimmen, wie sie verwendet werden sollte oder nicht. Um zu navigieren, haben wir die folgenden Richtlinien für die Verwendung synthetischer Sprach- und Avatarmodelle formuliert:
- Schützen Sie Die Besitzer von Stimmen und Bildern/Likenessen vor Missbrauch oder Identitätsdiebstahl.
- Verhindern Sie die Verbreitung gefälschter und irreführender Inhalte.
- Fördern Sie die Verwendung in Szenarien, in denen Verbraucher erwarten, dass sie mit synthetischen Inhalten interagieren.
- Fördern Sie die Verwendung in Szenarien, in denen Verbraucher die Generierung des synthetischen Inhalts beobachten.
Beispiele für unangemessene Verwendung
Azure KI-Text-zu-Sprache darf nicht verwendet werden.
- Um Personen zu täuschen und/oder absichtlich irrezuführen;
- Zum Zweck falscher Werbung, einschließlich durch Live-Werbung; Um vorzugeben, ohne ausdrückliche Erlaubnis von einer Person, Firma, Regierungsstelle oder Entität zu stammen, oder sich als diese auszugeben;
- Sich ohne ausdrückliche Erlaubnis als eine andere Person ausgeben, um Informationen oder Berechtigungen zu erlangen;
- Mit dem Ziel, Hassreden, Diskriminierungen, Verleumdungen, Terrorismus oder Gewalttaten zu fördern, anzuheizen oder zu verschleiern;
- Um Kinder auszunutzen oder zu manipulieren;
- Um unerwünschte Telefonanrufe, Massenkommunikation, Beiträge oder Nachrichten zu tätigen;
- Um politische Positionen oder politische Ideologien zu verschleiern;
- Um nicht zugeordnete Inhalte oder falsch dargestellte Quellen zu verbreiten.
Beispiele für die geeignete Verwendung
Zu den geeigneten Anwendungsfällen kann folgendes gehören, sind jedoch nicht beschränkt auf:
- Virtuelle Agenten, die auf fiktiven Personas basieren. Beispiel: On-Demand-Websuche, IoT-Steuerung oder Kundensupport, der von einer Markenfigur eines Unternehmens bereitgestellt wird.
- Unterhaltungsmedien für die Verwendung in fiktiven Inhalten. Beispielsweise Filme, Videospiele, Tv, aufgezeichnete Musik oder Hörbücher.
- Akkreditierte Bildungseinrichtungen oder Bildungsmedien. Zum Beispiel interaktive Unterrichtspläne oder geführte Museumstouren.
- Hilfstechnologie und Echtzeitübersetzung. So behalten beispielsweise ALS-afflizierte Personen ihre Stimmen bei.
- Ankündigungen öffentlicher Dienste mit fiktiven Personas. Beispielsweise Flughafen- oder Zugterminalankündigungen.
- Werbung/Livestreaming: Werbeinhalte, Livestreaming im Zusammenhang mit Marketing oder Verkauf eines Produkts.