Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ważne
Tłumaczenia nieanglojęzyczne są dostępne tylko dla wygody. Zapoznaj się zEN-US wersją tego dokumentu, aby uzyskać ostateczną wersję.
Co to jest notatka dotycząca przezroczystości?
System sztucznej inteligencji obejmuje nie tylko technologię, ale także osoby, które będą jej używać, osoby, których to dotyczy, oraz środowisko, w którym jest wdrażana. Utworzenie systemu dopasowanego do zamierzonego celu wymaga zrozumienia, jak działa technologia, jakie są jego możliwości i ograniczenia oraz jak osiągnąć najlepszą wydajność. Uwagi dotyczące przejrzystości firmy Microsoft mają pomóc zrozumieć, jak działa nasza technologia sztucznej inteligencji, jakie wybory mogą dokonywać właściciele systemu, które wpływają na wydajność i zachowanie systemu, oraz znaczenie myślenia o całym systemie, w tym o technologiach, ludziach oraz środowisku. Możesz użyć notatek przezroczystości podczas tworzenia lub wdrażania własnego systemu lub udostępniania ich osobom, które będą korzystać z systemu lub mają na nie wpływ.
Microsoft Uwagi dotyczące przejrzystości są częścią szerszego wysiłku Microsoft, aby w praktyce wprowadzić nasze zasady sztucznej inteligencji. Aby dowiedzieć się więcej, zobacz zasady sztucznej inteligencji Microsoftu.
Podstawy zamiany tekstu na mowę
Wprowadzenie
Text to speech, część Azure Speech in Foundry Tools, jest wszechstronnym narzędziem, które umożliwia konwertowanie tekstu pisanego na naturalnie brzmiące dźwięk mowy. Funkcja przyjmuje dane wejściowe w postaci tekstu i generuje wysokiej jakości dane wyjściowe dźwięku mowy, które mogą być odtwarzane na urządzeniach. W przypadku wyjścia dźwięku mowy, syntezator mowy oferuje szereg wstępnie przygotowanych głosów neuralnych lub, dla klientów z ograniczonym dostępem, możliwość utworzenia głosu neuronowego dopasowanego do produktu lub marki.
Funkcja zamiany tekstu na mowę ma także możliwości wizualne. Używając tekstu do awatara mowy, klienci mogą wprowadzać tekst i tworzyć syntetyczne wideo awatara mówiącego. Dostępne są zarówno wstępnie utworzone awatary tekstu na mowę, jak i niestandardowe awatary tekstu na mowę, które mogą być używane ze wstępnie utworzonym głosem neuronowym oraz niestandardowym głosem neuronowym, chociaż niektóre funkcje są dostępne tylko dla klientów z ograniczonym dostępem.
W systemie zamiany tekstu na mowę klienci mogą przekształcić zapisane informacje w słyszalną mowę i zwiększyć dostępność dla użytkowników. Niezależnie od tego, czy słuchasz dokumentów, czy poprawiasz doświadczenia użytkownika za pomocą mowy syntezowanej, tekst na mowę przekształca tekst w naturalnie brzmiące słowa mówione.
Kluczowe terminy
| Termin | Definicji |
|---|---|
| Synteza mowy w czasie rzeczywistym | Użyj zestawu SPEECH SDK lub interfejsu API REST , aby przekonwertować tekst na mowę przy użyciu wstępnie utworzonego neuronowego głosu, wstępnie utworzonego tekstu na awatar mowy, niestandardowego neuronowego głosu i niestandardowego tekstu na awatar mowy. |
| Model głosu | W systemie zamiany tekstu na mowę model głosowy odnosi się do modelu opartego na uczeniu maszynowym lub algorytmu, który generuje syntetyczną mowę na podstawie tekstu pisanego. Ten model jest trenowany w celu konwertowania danych wejściowych tekstu na dane wyjściowe języka mówionego, naśladując cechy ludzkiego głosu, w tym ton, ton i wymowę. |
| Prozodia | Prosody odnosi się do modulacji elementów mowy, takich jak wysokość, trwanie, głośność i pauzy, aby nadawać głosom syntetycznym naturalną i wyrazistą jakość. Dzięki temu przekazywane są emocjonalne niuanse oraz kontekstowe znaczenie, co zmniejsza robotyczny charakter wygenerowanej mowy, czyniąc ją bardziej angażującą i zrozumiałą dla słuchaczy. |
| Język znaczników syntezy mowy ("SSML") | Speech Synthesis Markup Language (SSML) to język znaczników oparty na języku XML, który służy do dostosowywania tekstu do danych wyjściowych mowy. Za pomocą języka SSML można dostosować ton, dodać przerwy, poprawić wymowę, zmienić częstotliwość mówienia, dostosować głośność i przypisywać wiele głosów do pojedynczego dokumentu. Możesz użyć języka SSML, aby zdefiniować własne leksykony lub przełączyć się na różne style mówienia. |
| Asynchroniczna synteza długiego dźwięku | Użyj API syntezy wsadowej (wersja zapoznawcza) do asynchronicznej syntezy tekstu na pliki mowy dłuższe niż 10 minut (na przykład książki audio lub wykłady). W przeciwieństwie do syntezy wykonywanej za pośrednictwem zestawu Speech SDK lub interfejsu REST API zamiany mowy na tekst, odpowiedzi nie są zwracane w czasie rzeczywistym. Oczekuje się, że żądania są wysyłane asynchronicznie, odpowiedzi są sondowane i syntetyzowany dźwięk jest pobierany, gdy usługa udostępnia je. |
| Visemes | Visemes są kluczowymi pozycjami w obserwowanej mowie, w tym położenie ust, szczęki i języka w produkcji konkretnej fonemy. Visemy mają silną korelację z głosami i fonemami. |
- Wstępnie utworzony głos neuronowy
- Spersonalizowany neuronowy głos
- Wstępnie utworzony tekst do awatara mowy
- Niestandardowy tekst do awatara mowy
- Tłumaczenie wideo
Wprowadzenie
Wstępnie utworzony głos neuronowy oferuje szeroką gamę głosów, oferując ponad 400 opcji w ponad 140 językach i ustawieniach regionalnych. Te głosy do zamiany tekstu na mowę umożliwiają szybką integrację funkcji odczytu w celu zwiększenia dostępności w aplikacjach.
Kluczowe terminy
| Termin | Definicji |
|---|---|
| Wstępnie utworzony głos neuronowy | Microsoft oferuje zestaw wstępnie utworzonych głosów neuronowych, które wykorzystują głębokie sieci neuronowe do przezwyciężenia ograniczeń tradycyjnej syntezy mowy w odniesieniu do stresu i intonacji w języku mówionym. Przewidywanie prosody i synteza głosu odbywają się jednocześnie, co skutkuje bardziej płynnymi i naturalnie brzmiącymi wyjściami. Każdy wstępnie utworzony model głosu neuronowego jest dostępny o częstotliwości próbkowania 24kHz i wysokiej wierności 48kHz, a wyjście może być poddane procesowi oversamplingu lub downsamplingu do innych formatów. |
Możliwości
Zachowanie systemu
Zamiana tekstu na mowę
Zamiana tekstu na mowę przekształca tekst w naturalnie brzmiącą mowę.
Poniżej przedstawiono główne opcje wywoływania usługi zamiany tekstu na mowę.
API konwersji tekstu na mowę w czasie rzeczywistym
Jest to typowe wywołanie interfejsu API za pośrednictwem zestawu Speech SDK lub REST API w celu wysyłania wejścia tekstowego i odbierania wyjścia audio w czasie rzeczywistym. System mowy używa modelu głosu do konwersji tekstu, aby przekształcić tekst w syntetyczną mowę naśladującą ludzki głos. Dźwięk wyjściowy może być zapisywany jako plik lub odtwarzany z powrotem na urządzeniu wyjściowym, takim jak głośnik (dowiedz się więcej na temat syntezowania mowy z tekstu). Użytkownicy mogą również używać języka SSML do dostosowywania tekstu do danych wyjściowych mowy.
Modele zamiany tekstu na mowę są trenowane na dużych ilościach zróżnicowanego dźwięku w typowych scenariuszach użycia i szerokiej gamie głośników. Na przykład usługa zamiany tekstu na mowę jest często używana na potrzeby czatbotów z obsługą głosu lub tworzenia zawartości audio.
API do syntezy wsadowej
Synteza wsadowa to inny typ wywołania interfejsu API. Zazwyczaj służy do wysyłania dużych plików tekstowych i odbierania wyjść dźwiękowych asynchronicznie (czyli w późniejszym czasie). Aby użyć tego interfejsu API, można określić lokalizacje dla wielu plików tekstowych. Technologia zamiany tekstu na mowę odczytuje dane wejściowe tekstu z pliku i generuje pliki audio, które są zwracane do określonej lokalizacji przechowywania. Ta funkcja służy do obsługi większych zadań syntezy mowy, w których nie jest konieczne zapewnienie użytkownikom końcowym danych wyjściowych dźwięku w czasie rzeczywistym. Przykładem jest utworzenie książek audio.
Konwersja tekstu na mowę — niestandardowy neuronowy głos
Niestandardowy neuronowy głos to funkcja zamiany tekstu na mowę, która umożliwia klientom z ograniczonym dostępem do programu tworzenie wyjątkowego, niestandardowego głosu syntetycznego dla ich aplikacji poprzez dostarczenie własnych danych dźwiękowych wybranych przez klienta talentów głosowych.
Dzięki niestandardowemu neuronowemu głosowi możesz rejestrować swój talent głosowy, prosząc ich o odczytanie skryptów dostarczonych przez Microsoft w programie Speech Studio, i szybko tworzyć syntetyczny głos, który brzmi jak twój talent głosowy, przy użyciu lekkiego projektu (wersja zapoznawcza). Projekt lite jest idealny do szybkiej wersji próbnej lub weryfikacji koncepcji.
W ramach projektu Pro, możesz przekazać nagrane w studio wysokiej jakości dane głosowe wybranego talentu głosowego i utworzyć realistycznie brzmiący głos. Pro obsługuje wysoce naturalne trenowanie głosu, które jeszcze bardziej przypomina głos talentów głosowych i może być dostosowane do mówienia w wielu emocjach i w różnych językach, bez konieczności dodatkowych danych szkoleniowych specyficznych dla emocji lub języka.
Po utworzeniu niestandardowego neuronowego głosu można wdrożyć model głosu z unikatowym punktem końcowym i użyć modelu do generowania syntetycznej mowy za pomocą interfejsu API syntezy w czasie rzeczywistym lub interfejsu API syntezy wsadowej opisanego powyżej.
Aby uzyskać więcej informacji na temat niestandardowego neuronowego głosu, zobacz Omówienie niestandardowego neuronowego głosu.
Osobisty głos
Funkcja głosu osobistego umożliwia klientom z ograniczonym dostępem tworzenie modelu głosu na podstawie krótkiej próbki głosu ludzkiego. Funkcja może utworzyć model głosowy na podstawie monitu w ciągu zaledwie kilku sekund. Ta funkcja jest zwykle używana do obsługi spersonalizowanych środowisk głosowych dla aplikacji klientów biznesowych. Osobiste modele głosowe mogą tworzyć realistycznie brzmiące głosy, które mogą mówić w pobliżu 100 języków.
Znaki wodne są dodawane do niestandardowych neuronowych głosów utworzonych za pomocą funkcji głosu osobistego. Znaki wodne umożliwiają użytkownikom określenie, czy mowa jest syntetyzowana przy użyciu Azure Speech, a w szczególności, który głos został użyty. Uprawnieni klienci mogą korzystać z możliwości wykrywania znaków wodnych w danych mowy w ramach usługi Azure Speech. Aby poprosić o dodanie wykrywania znaku wodnego do aplikacji, skontaktuj się z mstts[at]microsoft.com.
Aby uzyskać więcej informacji na temat głosu osobistego, zobacz osobisty głos.
Awatar zamiany tekstu na mowę
Awatar zamiany tekstu na mowę konwertuje tekst na cyfrowe wideo fotorealistycznego człowieka (wstępnie utworzonego awatara lub niestandardowego awatara), który mówi za pomocą naturalnie brzmiącego głosu, wspieranego przez funkcje zamiany tekstu na mowę, takie jak wstępnie utworzony głos neuronowy lub niestandardowy głos neuronowy. Wideo z awatarem tekstu na mowę może być syntezowane asynchronicznie lub w czasie rzeczywistym. Deweloperzy mogą budować aplikacje zintegrowane z funkcją tekst na mowę awatara przez API lub skorzystać z narzędzia do tworzenia treści w usłudze Speech Studio, aby tworzyć treści wideo bez kodowania.
Dzięki awatarowi zamiany tekstu na mowę z zaawansowanymi modelami sieci neuronowej funkcja pozwala użytkownikom tworzyć filmy z syntetycznymi awatarami, które są wysokiej jakości i wiernie odzwierciedlają rzeczywistość dla różnych zastosowań.
Awatar do przekształcania tekstu na mowę przyjmuje Standard Coalition for Content Provenance and Authenticity (C2PA), aby dostarczyć widzom lepszy wgląd w źródło i historię treści wideo tworzone przez awatary. Ten standard oferuje przejrzyste informacje na temat generacji sztucznej inteligencji zawartości wideo. Aby uzyskać więcej informacji na temat integracji C2PA z awatarami text to speech, zobacz Content Credentials in Azure Text to Speech Avatar .
Ponadto dane wyjściowe awatara są automatycznie oznaczane znakiem wodnym. Znaki wodne umożliwiają zatwierdzonym użytkownikom określenie, czy wideo jest syntetyzowane przy użyciu funkcji awatara Azure Speech. Aby poprosić o wykrywanie znaku wodnego, skontaktuj się z avatarvoice[at]microsoft.com.
Tłumaczenie wideo
Tłumaczenie wideo może efektywnie lokalizować zawartość wideo, aby zaspokoić różne grupy odbiorców na całym świecie. Automatyczne tłumaczenie wideo wyodrębni dźwięk dialogowy i przetranskrybuje, przetłumaczy oraz zdubbingować zawartość, używając wstępnie utworzonego lub osobistego głosu na język docelowy, z dokładnymi napisami w celu lepszej dostępności. Funkcje wielogłosowe pomogą zidentyfikować liczbę osób mówiących i zalecić odpowiednie głosy. Edycja treści z udziałem człowieka umożliwia precyzyjne dopasowanie do preferencji klientów. Ulepszona jakość tłumaczenia zapewnia precyzyjne dopasowanie dźwięku i wideo z integracją GPT. Tłumaczenie wideo umożliwia autentyczne i personalizowane doświadczenia dubbingu z osobistym głosem.
Przypadki użycia
Synteza mowy oferuje szeroki wachlarz funkcji dostosowanych do różnorodnych zastosowań w różnych branżach i domenach. Wszystkie funkcje zamiany tekstu na mowę, w tym tłumaczenie wideo, podlegają warunkom i postanowieniom odnoszącym się do subskrypcji Azure klienckiej, w tym Zasady dopuszczalnego użycia w Azure oraz Kodeks postępowania dotyczący funkcji zamiany tekstu na mowę w Azure.
Ponadto niestandardowe funkcje zamiany tekstu na mowę, takie jak niestandardowy neuronowy głos, osobisty głos i niestandardowy awatar tekstu na mowę, są ograniczone do zatwierdzonych przypadków użycia, jak opisano w scenariuszach poniżej.
Zamierzone zastosowania dla niestandardowego neuronowego głosu Pro i niestandardowego neuronowego głosu Lite
Poniżej przedstawiono zatwierdzone przypadki użycia dla niestandardowego głosu neuronowego Pro i Lite:
- Edukacja lub nauka interaktywna: Aby utworzyć fikcyjną markę lub głos postaci do czytania lub mówienia materiałów edukacyjnych, nauki online, interaktywnych planów lekcji, nauki poprzez symulacje lub przewodników po muzeach.
- Media: Rozrywka: Aby utworzyć fikcyjną markę lub głos postaci do czytania lub odtwarzania treści rozrywkowej dla gier wideo, filmów, telewizji, nagranej muzyki, podcastów, książek audio lub w rozszerzonej lub wirtualnej rzeczywistości.
- Media: Marketing: Aby stworzyć fikcyjną markę lub głos postaci do wykorzystania w odczytach lub wystąpieniach dotyczących marketingu, prezentacji produktów lub usług, promocji biznesu czy reklam.
- Treści stworzone przez siebie: Aby stworzyć głos do odczytywania treści stworzonych przez talent głosowy.
- Funkcje ułatwień dostępu: do użytku w systemach opisu audio i narracji, w tym w fikcyjnej marce lub głosie postaci, lub aby ułatwić komunikację osobom z wadami mowy.
- Systemy interaktywnej odpowiedzi głosowej (IVR): do tworzenia głosów, w tym fikcyjną markę lub głos postaci, dla operacji centrów telefonicznych, systemów telefonicznych lub odpowiedzi na interakcje telefoniczne.
- Ogłoszenia publiczne i informacyjne: aby utworzyć fikcyjną markę lub głos postaci do przekazywania informacji o usługach publicznych, w tym anonsów dla miejsc publicznych, lub do informacyjnych transmisji, takich jak ruch, pogoda, informacje o wydarzeniach i harmonogramy. Ten przypadek użycia nie jest przeznaczony do wiadomości dziennikarskich ani informacyjnych.
- Tłumaczenie i lokalizacja: do użycia w aplikacjach tłumaczenia na potrzeby tłumaczenia konwersacji w różnych językach lub tłumaczenia multimediów audio.
- Asystent wirtualny lub Chatbot: Aby utworzyć fikcyjną markę lub znak głosu dla inteligentnych asystentów w lub dla wirtualnych asystentów internetowych, urządzeń, samochodów, urządzeń domowych, zabawek, kontroli urządzeń IoT, systemów nawigacji, odczytywania wiadomości osobistych, wirtualnych towarzyszy lub scenariuszy obsługi klienta.
Zamierzone zastosowania na potrzeby głosu osobistego
Osobisty interfejs API głosu (zobacz Osobisty głos, aby uzyskać więcej informacji) jest dostępny w wersji zapoznawczej ograniczonego dostępu. Tylko klienci, którzy spełniają kryteria uprawnień ograniczonego dostępu, mogą zintegrować osobisty interfejs API głosu ze swoimi aplikacjami. Ci uprawnieni klienci mogą używać osobistych głosów tylko w następujących przypadkach użycia:
- Aplikacje: w przypadku aplikacji, w których dane wyjściowe głosowe są ograniczone i definiowane przez klientów oraz gdzie głos nie odczytuje zawartości generowanej przez użytkownika ani zawartości typu open-end. Użycie modelu głosowego musi pozostać w aplikacji, a dane wyjściowe nie mogą być publikowane ani udostępniane z aplikacji. Niektóre przykłady aplikacji, które pasują do tego opisu, to asystenci głosowi w inteligentnych urządzeniach i dostosowywanie głosu postaci w grach.
- Media, filmy i telewizja: do dubbingu filmów, telewizji, wideo i audio wyłącznie w sytuacjach rozrywkowych, gdzie klienci posiadają wyłączną kontrolę nad tworzeniem, dostępem i wykorzystaniem modeli głosowych oraz ich wyników.
- Zawartość biznesowa: aby utworzyć zawartość audio i wideo dla scenariuszy biznesowych w celu komunikowania informacji o produkcie, materiałów marketingowych, zawartości promocyjnej biznesowej i wewnętrznej komunikacji biznesowej.
- Specjalne użycie, połączone z tłumaczeniem wideo: aby syntetyzować głosy dla każdego mówcy w filmie. Klienci mogą również edytować i generować zsynchronizowaną z ruchem ust zawartość audio w językach docelowych. Klienci nie muszą przesyłać do firmy Microsoft dodatkowej zgody audio w przypadku zawartości wideo w tym scenariuszu, ale klienci muszą zachować wyłączną kontrolę nad tworzeniem, dostępem do, i wykorzystaniem modeli głosowych oraz ich wynikiem.
Wszystkie inne zastosowania niestandardowego neuronowego głosu, w tym Custom Neural Voice Pro, Custom Neural Voice Lite oraz osobisty głos, są zabronione. Ponadto głos neuronowy niestandardowy jest usługą o ograniczonym dostępie, a rejestracja jest wymagana do uzyskania dostępu do tej usługi. Aby dowiedzieć się więcej na temat zasad ograniczonego dostępu Microsoft, zobacz Limited Access features for Foundry Tools( Niektóre funkcje są dostępne tylko dla Microsoft zarządzanych klientów i partnerów oraz tylko w przypadku niektórych przypadków użycia zatwierdzonych przez Microsoft w momencie rejestracji.
Wbudowany głos neuronowy może być również używany dla niestandardowych przypadków użycia głosu neuronowego powyżej, a także dla dodatkowych przypadków użycia, które są wybierane przez klientów i zgodne z zasadami dopuszczalnego użycia Azure oraz kodeks postępowania dotyczący usługi zamiany tekstu na mowę w Azure. Do dodatkowych przypadków użycia wstępnie utworzonych neuronowych głosów spełniających wszystkie odpowiednie warunki i postanowienia nie jest wymagana rejestracja ani wstępne zatwierdzenie.
Zamierzone przypadki użycia tłumaczenia wideo
Tłumaczenie wideo może służyć do filmów, telewizji i innych wizualizacji (w tym wideo lub animacji) i aplikacji audio, gdzie klienci zachowują wyłączną kontrolę nad tworzeniem, dostępem do i używaniem modeli głosowych i ich danych wyjściowych. Personalizacja głosu i synchronizacja ruchu ust podlegają ramom ograniczonego dostępu, a uprawnieni klienci mogą korzystać z tych funkcji równocześnie z tłumaczeniem wideo. Poniżej przedstawiono zatwierdzone przypadki użycia usługi tłumaczenia wideo:
- Edukacja i nauka: aby przetłumaczyć dźwięk w wizualizacjach edukacyjnych, kursach online, modułach szkoleniowych, uczeniu opartym na symulacji lub wizualizacjach przewodnika po muzeum z przewodnikiem dla osób uczących się w wielu językach.
- Media: Rozrywka: Aby przetłumaczyć dźwięk w filmach, filmach, programach telewizyjnych, dokumentach, grach wideo, miniserialiach, krótkiej grze i zawartości AR/VR dla odbiorców globalnych, zapewniając bezproblemowe opowiadanie historii w różnych językach.
- Media: Marketing: Aby przetłumaczyć dźwięk w wizualizacjach promocyjnych, pokazach produktów, reklamach i kampaniach brandingowych, aby rezonować z międzynarodowymi rynkami i kulturami.
- Treści Autorskie: aby przetłumaczyć dźwięk we vlogach, krótkie formy wizualne, treści influencerów, przewodniki turystyczne, promocyjne filmy o miejscach docelowych, wizualne treści społecznościowe i filmy o kulturze, czyniąc je dostępnymi i angażującymi.
- Szkolenia i komunikacja firmowa: aby przetłumaczyć audio w materiałach wizualnych komunikacji wewnętrznej, materiały wdrożeniowe dla nowych pracowników, szkolenia z zakresu zgodności oraz globalne ogłoszenia korporacyjne dla międzynarodowych zespołów.
- Pokazy handlu elektronicznego i produktów: aby przetłumaczyć dźwięk w wizualizacjach rozpboxowania produktów, samouczkach, opiniach klientów i wizualizacjach wyjaśniających, aby zaspokoić potrzeby międzynarodowych kupujących.
- Ogłoszenia publiczne i informacyjne: aby przetłumaczyć dźwięk w wizualizacjach świadomości publicznej, harmonogramach zdarzeń, ogłoszeniach o bezpieczeństwie i emisjach informacyjnych dla instytucji rządowych na potrzeby wielojęzycznych ułatwień dostępu.
- Funkcje ułatwień dostępu: aby poszerzyć dostępność zawartości wideo za pomocą wielojęzycznego dźwięku i napisów.
- Wiadomości i treści dziennikarskie: aby przetłumaczyć dźwięk w segmentach wiadomości, wywiadach, komunikatach prasowych i aktualnościach dla różnych odbiorców językowych. Klienci, którzy zamierzają przetłumaczyć źródła wiadomości, będą wymagać dodatkowej weryfikacji.
Przeznaczenie dla niestandardowego tekstu do awatara mowy i wstępnie utworzonego tekstu do awatara mowy
Poniżej przedstawiono zatwierdzone przypadki użycia niestandardowego tekstu na awatar mowy:
- Asystent wirtualny lub Chatbot: Aby utworzyć asystentów wirtualnych, wirtualnych towarzyszy, wirtualnych asystentów sprzedaży lub aplikacji obsługi klienta.
- Generowanie zawartości dla kontekstów przedsiębiorstwa: służy do przekazywania informacji o produkcie, materiałów marketingowych, zawartości promocyjnej biznesowej i wewnętrznej komunikacji biznesowej. Przykłady obejmują awatary postaci lub cyfrowe reprezentacje bliźniacze lidera firmy w celu promowania marki.
- Edukacja lub interaktywne uczenie się: Aby utworzyć fikcyjną markę lub awatar postaci do prezentowania materiałów edukacyjnych, uczenia się online, interaktywnych planów lekcji, uczenia symulacji lub przewodnikowanych wycieczek po muzeum.
- Media: Rozrywka: prezentowanie aktualizacji, udostępnianie wiedzy, tworzenie interaktywnych multimediów lub filmów typu 'mówiąca głowa' z myślą o scenariuszach rozrywkowych, takich jak filmy, gry i rzeczywistość wirtualna lub rozszerzona.
- Funkcje ułatwień dostępu: do ułatwienia komunikacji przez osoby z wadami mowy.
- Treść własnego autorstwa: Aby utworzyć awatara do czytania treści stworzonych przez twórcę umiejętności awatara.
- Ogłoszenia publiczne i informacyjne: aby utworzyć fikcyjną markę lub obraz postaci do przekazywania informacji o usługach publicznych, w tym anonsów dla miejsc publicznych, lub do informacyjnych transmisji, takich jak ruch, pogoda, informacje o wydarzeniach i harmonogramy. Ten przypadek użycia nie jest przeznaczony do wiadomości dziennikarskich ani informacyjnych.
- Tłumaczenie i lokalizacja: do użycia w aplikacjach tłumaczeń na potrzeby tłumaczenia konwersacji w różnych językach lub tłumaczenia multimediów audio w formacie wideo.
Wszystkie inne zastosowania tekstu niestandardowego do awatara mowy są zabronione. Ponadto niestandardowy awatar tekstu na mowę jest usługą z ograniczonym dostępem, a rejestracja jest wymagana do uzyskania dostępu do tej funkcji. Aby dowiedzieć się więcej na temat zasad ograniczonego dostępu Microsoft, odwiedź stronę aka.ms/limitedaccesscogservices. Niektóre funkcje są dostępne tylko dla Microsoft zarządzanych klientów i partnerów oraz tylko w przypadku niektórych przypadków użycia zatwierdzonych przez Microsoft w momencie rejestracji.
Gotowy awatar tekstu na mowę może być również używany w powyższych przypadkach użycia awatara niestandardowego, a także w dodatkowych przypadkach użycia wybranych przez klientów i zgodnych z zasadami dopuszczalnego użycia Azure oraz Kodeksem postępowania dla funkcji zamiany tekstu na mowę Azure. Do dodatkowych przypadków użycia wstępnie zbudowanego awatara tekstu na mowę spełniających wszystkie obowiązujące warunki i postanowienia, nie są wymagane żadne rejestracje ani wstępne zatwierdzenie.
Zagadnienia dotyczące wybierania przypadków użycia
Zachęcamy klientów do korzystania z funkcji zamiany tekstu na mowę w swoich innowacyjnych rozwiązaniach lub aplikacjach. Wszystkie funkcje zamiany tekstu na mowę muszą być zgodne z Zasadami Dopuszczalnego Użytkowania Azure oraz Kodeksem postępowania dla zamiany tekstu na mowę Azure. Ponadto niestandardowy neuronowy głos i niestandardowy tekst do awatarów mowy mogą być używane tylko w przypadku przypadków użycia zatwierdzonych za pośrednictwem formularza rejestracji ograniczonego dostępu. Ponadto poniżej przedstawiono niektóre zagadnienia dotyczące wybierania przypadku użycia dla dowolnej funkcji zamiany tekstu na mowę:
- Upewnij się, że dopasowanie przypadków użycia: upewnij się, że zamierzone użycie dowolnej funkcji zamiany tekstu na mowę jest zgodne z możliwościami i zamierzonym celem tej funkcji.
- Zagadnienia dotyczące odpowiedzialnej sztucznej inteligencji: określanie priorytetów praktyk w zakresie odpowiedzialnej sztucznej inteligencji przez unikanie tworzenia mylącej lub szkodliwej zawartości. Przestrzegaj zasad ochrony prywatności, ochrony danych i przepisów prawnych podczas korzystania z funkcji zamiany tekstu na mowę.
- Przegląd kodeksu postępowania: Microsoft ustanowił kodeks postępowania, który zakazuje niektórych zastosowań wszystkich funkcji zamiany tekstu na mowę. Zapewnij zgodność z kodeksem postępowania podczas wybierania przypadku użycia dla usług zamiany tekstu na mowę.
- Stosuj kontrolę redakcyjną: Starannie rozważ użycie syntetycznych głosów z treścią, która nie ma odpowiedniej kontroli redakcyjnej, ponieważ syntetyczne głosy mogą brzmieć jak ludzki głos i nasilają efekt niepoprawnej lub wprowadzającej w błąd treści.
- Ujawnienie: ujawnić syntetyczny charakter głosów, obrazów i/lub filmów wideo użytkownikom, tak aby użytkownicy nie zostali prawdopodobnie wprowadzeni w błąd lub nie mogli nabrać innych, wierząc, że wchodzą w interakcję z prawdziwą osobą.
- Zagadnienia prawne i prawne: Organizacje muszą ocenić potencjalne konkretne zobowiązania prawne i prawne w przypadku korzystania z narzędzi i rozwiązań usługi Foundry, które mogą nie być odpowiednie do użycia w każdej branży lub scenariuszu. Ponadto, Foundry Tools lub rozwiązania nie są przeznaczone do używania i mogą nie być używane w sposób zabroniony w odpowiednich warunkach świadczenia usług i obowiązujących kodeksach postępowania.
Stosując się do tych zagadnień, użytkownicy mogą odpowiedzialnie korzystać zarówno ze wstępnie utworzonego, jak i niestandardowego neuronowego głosu.
Ograniczenia
Ograniczenia dotyczące zamiany tekstu na mowę powinny być brane pod uwagę na skrzyżowaniu technologii oraz czynników ludzkich, społecznych i organizacyjnych, które wpływają na ich użycie i wpływ. Chociaż zamiana tekstu na mowę oferuje zaawansowane możliwości syntezy mowy, istnieją pewne ograniczenia, które należy wziąć pod uwagę podczas odpowiedzialnego wdrażania, aby zminimalizować potencjalne błędy.
Ograniczenia techniczne, czynniki operacyjne i zakresy
Ograniczenia techniczne, które należy wziąć pod uwagę podczas używania tekstu do mowy, obejmują dokładność wymowy i intonacji. Podczas gdy zamiana tekstu na mowę jest przeznaczona do generowania naturalnie brzmiącej mowy, może wystąpić trudności z niektórymi wyrazami, nazwami lub nietypowymi frazami. Użytkownicy powinni pamiętać, że mogą istnieć wystąpienia, w których system może błędnie wywrzeć lub podkreślać słowa niepoprawnie, zwłaszcza w przypadku czynienia z niszowym lub specyficznym dla domeny słownictwem.
Należy pamiętać, że niektóre populacje mogą mieć bardziej negatywny wpływ na te ograniczenia techniczne. Na przykład osoby z wadami słuchu, które w dużym stopniu polegają na syntetyzowanej mowie, mogą napotkać wyzwania w zrozumieniu niejasnych lub zniekształconych danych wyjściowych mowy. Podobnie użytkownicy z niepełnosprawnością poznawczą lub związaną z językiem mogą trudno zrozumieć mowę z nienaturalną intonacją lub błędnie sformułowanymi słowami.
- Wstępnie utworzony głos neuronowy
- Spersonalizowany neuronowy głos
- Wstępnie utworzony tekst do awatara mowy
- Niestandardowy tekst do awatara mowy
- Tłumaczenie wideo
- Ograniczenia językowe: Podczas gdy starannie sprawdzamy i przygotowujemy dane szkoleniowe w celu zminimalizowania uprzedzeń, szczególnie związanych z płcią, pochodzeniem etnicznym lub regionalnymi akcentami, a tekst na mowę obsługuje wiele języków i akcentów, mogą występować różnice w jakości i dostępności głosów w różnych językach. Klienci powinni mieć świadomość potencjalnych ograniczeń dokładności wymowy, intonacji i niuansów językowych specyficznych dla niektórych języków lub dialektów.
- Kontekst i emocje: zamiana tekstu na mowę może mieć ograniczenia dotyczące dokładnego przekazywania kontekstowych informacji i emocji. Klienci powinni pamiętać o niezdolności systemu do zrozumienia niuansów emocjonalnych lub subtelnych wskazówek znajdujących się w tekście wejściowym. Należy rozważyć zapewnienie dodatkowego kontekstu lub wykorzystanie innych metod efektywnego przekazywania emocji.
- Availability: Microsoft zapewni klientom 12-miesięczne powiadomienie przed usunięciem wstępnie utworzonych głosów neuronowych z naszego katalogu, chyba że wzgląd na bezpieczeństwo, prawne lub wydajność systemu wymaga przyspieszonego usunięcia. Nie dotyczy to wersji zapoznawczych.
Każda aplikacja jest inna, a nasz model podstawowy może nie być zgodny z kontekstem lub obejmować wszystkie scenariusze wymagane w twoim przypadku użycia. Zachęcamy deweloperów do dokładnej oceny jakości tekstu na syntetyczny głos mowy i wideo przy użyciu rzeczywistych danych, które odzwierciedlają przypadek użycia, w tym testowanie z użytkownikami z różnych grup demograficznych i o różnych cechach mowy. Zobacz sekcję Jakość wytrenowanego modelu głosu, aby uzyskać najlepsze rozwiązania dotyczące tworzenia modeli głosowych wysokiej jakości.
Oprócz zapewnienia wydajności, ważne jest, aby rozważyć, jak zminimalizować ryzyko stereotypów i wymazywania, które mogą wynikać z syntetycznych głosów i awatara. Jeśli na przykład tworzysz niestandardowy neuronowy głos dla inteligentnego asystenta głosowego, dokładnie zastanów się, jaki głos jest odpowiedni do utworzenia, i staraj się uzyskać różne perspektywy od osób z różnych pochodzeń. Podczas kompilowania i oceniania systemu zawsze szukasz różnorodnych danych wejściowych.
Zagadnienia dotyczące sprawiedliwości
W Microsoft staramy się wspierać każdą osobę na świecie, aby robić więcej. Istotną częścią tego celu jest stworzenie technologii i produktów, które są sprawiedliwe i inkluzywne. Sprawiedliwość jest wielowymiarowym, społeczno-technicznym tematem i ma wpływ na wiele różnych aspektów naszego rozwoju produktu. Więcej informacji na temat podejścia Microsoft do sprawiedliwości here.
Jednym z ważnych wymiarów, które należy wziąć pod uwagę podczas korzystania z systemów sztucznej inteligencji, w tym zamiany tekstu na mowę, jest to, jak dobrze system działa dla różnych grup osób. Badania wykazały, że bez świadomego wysiłku ukierunkowanego na poprawę wydajności dla wszystkich grup systemy sztucznej inteligencji mogą wykazywać różne poziomy wydajności w różnych czynnikach demograficznych, takich jak rasa, pochodzenie etniczne, płeć i wiek.
W ramach naszej oceny programu Azure AI dla zamiany tekstu na mowę, przeprowadziliśmy analizę w celu oceny potencjalnych zagrożeń dla sprawiedliwości. Zbadaliśmy wydajność systemu w różnych grupach demograficznych, mając na celu zidentyfikowanie wszelkich różnic lub różnic, które mogą istnieć i mogą mieć potencjalnie wpływ na sprawiedliwość.
W niektórych przypadkach mogą występować różnice w wydajności. Należy pamiętać, że te różnice mogą przewyższać zakładane cele, a my aktywnie pracujemy nad eliminacją potencjalnych uprzedzeń lub różnic w wydajności. Starannie rozważamy wybór aktorów reprezentujących różne grupy demograficzne i dążymy do uwzględnienia różnych perspektyw pochodzących z rozmaitych środowisk.
W odniesieniu do szkód reprezentujących, takich jak stereotypy, poniżanie lub wymazywanie danych wyjściowych, uznajemy ryzyko związane z tymi problemami. Chociaż nasz proces oceny ma na celu ograniczenie takich zagrożeń, zachęcamy użytkowników do dokładnego rozważenia konkretnych przypadków użycia i wdrożenia dodatkowych środków zaradczych zgodnie z potrzebami. Posiadanie czynnika ludzkiego w procesie może zapewnić dodatkową warstwę kontroli, aby przeciwdziałać potencjalnym stronniczościom lub niezamierzonym konsekwencjom. Użycie list zablokowanych lub dozwolonych może również pomóc w zapewnieniu, że syntetyzowana mowa jest zgodna z żądanymi standardami i pozwala uniknąć szkodliwych lub nieodpowiednich treści.
Jesteśmy zobowiązani do ciągłego ulepszania naszych ocen sprawiedliwości, aby lepiej zrozumieć wydajność systemu w różnych grupach demograficznych i potencjalne obawy dotyczące sprawiedliwości. Trwa proces oceny i aktywnie pracujemy nad zwiększeniem sprawiedliwości i inkluzywności oraz eliminowaniem zidentyfikowanych różnic. Rozumiemy znaczenie uwzględniania kwestii sprawiedliwości i staramy się zapewnić, że zamiana tekstu na mowę dostarcza niezawodne i sprawiedliwe syntetyzowane wyniki mowy.
Należy pamiętać, że te informacje reprezentują to, co wiemy do tej pory o ocenach sprawiedliwości, i pozostajemy oddani udoskonalić nasze metodologie oceny i rozwiązać wszelkie problemy dotyczące sprawiedliwości, które mogą wystąpić.
Wydajność systemu
Wydajność systemu zamiany tekstu na mowę odnosi się do tego, jak dokładnie i naturalnie może przekonwertować tekst pisany na syntetyzowaną mowę. Jest to mierzone przy użyciu różnych metryk w celu oceny jakości i skuteczności wygenerowanego wyjścia audio. Oto niektóre typowe używane metryki wydajności:
- Średni wynik opinii (MOS): system oceny, w którym sędziowie zapewniają wynik, który reprezentuje ogólną jakość syntetyzowanej mowy i wideo awatara. Wyższy MOS wskazuje lepszą jakość.
- Luka MOS: Różnica między wynikiem MOS nagrań ludzkich a wygenerowanymi utworami/filmami audio. Mniejsza różnica MOS wskazuje bliższe podobieństwo do mowy ludzkiej/do podobieństwa ludzkiego.
- Podobieństwo MOS (SMOS): Mierzy podobieństwo wygenerowanych utworów audio/wideo do ludzkich nagrań. Wyższy SMOS oznacza lepsze podobieństwo.
- Intelligibility: Procent poprawnie zrozumiałych słów w syntetyzowanej mowie.
Nawet w przypadku najnowocześniejszych modeli sztucznej inteligencji systemy sztucznej inteligencji, takie jak zamiana tekstu na mowę, mogą powodować błędy. Na przykład system może produkować syntezowaną mowę z subtelnymi nienaturalnymi intonacjami lub błędami wymowy, co prowadzi do mniej niż idealnego doświadczenia użytkownika, lub system może błędnie interpretować tekst lub mieć trudności z nietypowymi konstrukcjami językowymi, co powoduje nienaturalną lub niezrozumiałą mowę.
Najlepsze rozwiązania dotyczące poprawy wydajności systemu
Aby poprawić wydajność systemu i dostosować zachowanie systemu w tekście do mowy, istnieje kilka najlepszych rozwiązań, które można zastosować. Te rozwiązania obejmują dostosowanie różnych składników i parametrów, aby zoptymalizować kompromisy i spełnić określone wymagania dotyczące przypadków użycia. Ważne jest jednak, aby rozważyć potencjalny wpływ na różne populacje w celu zapewnienia sprawiedliwości i niekluzywności.
- Wstępnie utworzony głos neuronowy
- Spersonalizowany neuronowy głos
- Wstępnie utworzony tekst do awatara mowy
- Niestandardowy tekst do awatara mowy
- Tłumaczenie wideo
Użycie języka SSML (Speech Synthesis Markup Language) jest uważane za najlepszą praktykę w celu poprawy jakości zamiany tekstu na mowę. SSML umożliwia użytkownikom wywieranie większej kontroli nad syntetyzacją mowy, co umożliwia dostosowanie wymowy, intonacji, podkreślenia i innych cech prodykycznych. Dzięki włączeniu tagów SSML do tekstu użytkownicy mogą dodawać pauzy, dostosowywać szybkość mowy, określać wymowę fonetyczną oraz kontrolować ton i głośność oraz inne parametry. Ten poziom precyzyjnego dostrajania pomaga stworzyć bardziej naturalną i wyrazistą mowę, dzięki czemu tekst do danych wyjściowych mowy brzmi bardziej jak człowiek i angażujący. Wszystkie znaczniki SSML można przekazać bezpośrednio do interfejsu API. Udostępniamy również narzędzie online, tworzenie zawartości audio, które umożliwia klientom dostosowywanie przy użyciu intuicyjnego interfejsu użytkownika.
Jeśli twój przypadek użycia obejmuje specjalistyczne słownictwo lub zawartość specyficzną dla domeny, rozważ użycie niestandardowej funkcji leksykonu w celu poprawy zdolności systemu do dokładnego wymawiania i przekazywania terminów lub fraz specyficznych dla domeny.
Ocena zamiany tekstu na mowę
Metody oceny
Niektóre często używane metryki do oceny ogólnej wydajności systemu syntezatora mowy obejmują:
- Średnia różnica w ocenie opinii (MOS) z nagraniem ludzkim: zwykle służy do porównywania jakości tekstu z modelem głosu mowy względem nagrania ludzkiego. Oczekuje się, że jakość modelu głosu utworzonego przez model neuronowy na zamówienie w porównaniu z nagraniem ludzkim będzie bliska, z różnicą nie większą niż 0,5 punktu w skali MOS.
- W przypadku niestandardowego neuronowego głosu można również użyć Podobieństwo MOS (SMOS), aby zmierzyć, jak podobny jest niestandardowy głos w porównaniu z oryginalnymi nagraniami ludzkimi. W badaniach SMOS sędziowie są proszeni o nasłuchiwanie zestawu sparowanych utworów audio, jeden wygenerowany przy użyciu głosu niestandardowego, drugi z oryginalnych nagrań ludzkich w danych treningowych i oceniać, czy dwa utwory audio w każdej parze są mówione przez tę samą osobę, przy użyciu skali pięciu punktów (1 jest najniższa, 5 najwyższych). Średni wynik jest zgłaszany jako wynik SMOS. Zalecamy, aby dobry niestandardowy głos neuronowy osiągnął SMOS wyższy niż 4,0.
- Oprócz pomiaru naturalności za pomocą mos i SMOS można również ocenić zrozumiałość modelu głosu, sprawdzając dokładność wymowy wygenerowanej mowy. Dzieje się tak, gdy sędziowie słuchają zestawu próbek testowych, określając, czy mogą zrozumieć znaczenie i wskazać wszelkie wyrazy, które były dla nich niezrozumiały. Współczynnik zrozumiałości jest obliczany przy użyciu wartości procentowej poprawnie zrozumiałych wyrazów wśród całkowitej liczby przetestowanych wyrazów (tj. liczby zrozumiałych słów/całkowitej liczby wyrazów przetestowanych * 100%). Zwykle silnik przekształcania tekstu na mowę, aby był użyteczny, musi osiągnąć wynik > 98% zrozumiałości.
Wyniki oceny
Synteza mowy konsekwentnie dostarcza wysokiej jakości i naturalnie brzmiącą mowę syntetyzowaną, spełniającą wymagania różnych branż i przemysłów. Nasze oceny obejmują obszerne testowanie danych treningowych i testowych systemu, zapewniając, że reprezentuje zamierzone zastosowania i czynniki operacyjne napotkane w rzeczywistych scenariuszach, a także testowanie próbek syntetyzowanych danych wyjściowych mowy.
Wyniki oceny miały wpływ na decyzje dotyczące ograniczeń projektu systemu, takich jak maksymalny rozmiar przypadku i minimalna wymagana ilość danych treningowych. Analizując wydajność systemu w różnych zestawach danych, ustawieniach i parametrach, zostały ustawione odpowiednie ograniczenia w celu zoptymalizowania zachowania, niezawodności i bezpieczeństwa systemu.
Podczas gdy ocena obejmuje szeroką gamę przypadków użycia, należy pamiętać, że wyniki są uogólnialne w pewnym zakresie w różnych przypadkach użycia, które nie były bezpośrednio częścią oceny. Niezawodność i wydajność systemu zapewnia zaufanie do możliwości obsługi różnych scenariuszy, w tym tych, które mogły nie zostać jawnie przetestowane.
Poniżej przedstawiono kilka zalecanych testów i zakresów oceny na podstawie naszego doświadczenia:
| Pomiar | Definicji | Jak jest obliczany | Zalecany rozmiar tekstu | Zalecana ocena |
|---|---|---|---|---|
| MOS | Średnia ocena opinii jakości ścieżek dźwiękowych | Średnia ocen poszczególnych sędziów dla każdego nagrania audio | > 30 wygenerowanych ścieżek dźwiękowych | > 4.0 (zwykle wymaga, aby MOS nagrań ludzkich był wyższy niż 4,5) |
| Luka w mos | Różnica wyników MOS między nagraniami ludzkimi a wygenerowanymi ścieżkami audio | Wynik MOS na nagraniach ludzkich minus wynik MOS na wygenerowanych utworach audio | > 10 ludzkich nagrań, > 30 wygenerowanych utworów audio, > 20 sędziów na każdej ścieżce audio | < 0.5 |
| SMOS | Podobieństwo wygenerowanych ścieżek dźwiękowych do ludzkich nagrań | Średnia ocen poziomu podobieństwa dla każdej pary ścieżek dźwiękowych | > 40 par, > 20 sędziów na każdej parze | > 4.0, > 3.5 (język pomocniczy) |
| Zrozumiałość | Dokładność wymowy wygenerowanej mowy na poziomie słowa | Procent poprawnie zrozumiałych wyrazów wśród całkowitej liczby przetestowanych wyrazów | > 60 wygenerowanych ścieżek dźwiękowych, > 10 sędziów na każdej ścieżce | > 98% |
Ocenianie i integrowanie syntezy mowy dla Twojego użytku
Poniżej przedstawiono kilka najlepszych rozwiązań, które pomogą Ci w odpowiedzialny sposób zintegrować funkcje zamiany tekstu na mowę w swoich przypadkach użycia.
Ujawnianie, kiedy głos jest syntetyczny
Ujawnianie, że głos jest generowany przez komputer, nie tylko minimalizuje ryzyko szkodliwych skutków oszustwa, ale także zwiększa zaufanie do organizacji, która dostarcza głos. Dowiedz się więcej o tym, jak ujawnić.
Microsoft wymaga od swoich klientów ujawnienia użytkownikom, że głosy wykorzystywane w technologii tekst-na-mowę są syntetyczne.
- Pamiętaj, aby zapewnić odpowiednie ujawnienie informacji odbiorcom, zwłaszcza podczas korzystania z głosu dobrze znanej osoby. Ludzie oceniają informacje oparte częściowo na osobie, która ją dostarcza, niezależnie od tego, czy robią to świadomie, czy nieprzytomnie. Na przykład ujawnienie może być udostępniane słownie na początku emisji. Aby uzyskać więcej informacji, odwiedź stronę Wzorce ujawniania.
- Należy rozważyć właściwe ujawnienie rodzicom lub innym stronom przypadków użycia, które są przeznaczone do lub mogą być używane w sytuacjach dotyczących nieletnich i dzieci. Jeśli twój przypadek użycia jest przeznaczony dla nieletnich lub dzieci, musisz upewnić się, że ujawnienie jest jasne i przejrzyste, aby rodzice lub opiekunowie prawni mogli zrozumieć rolę syntetycznych mediów i podjąć świadomą decyzję w imieniu nieletnich lub dzieci o tym, czy korzystać z tego doświadczenia.
Ujawniaj, kiedy wideo awatara jest syntetyczne
Ujawnianie, że awatar mówiący na wideo jest generowany komputerowo, nie tylko minimalizuje ryzyko szkodliwych skutków wynikających z oszustwa, ale także zwiększa zaufanie do organizacji dostarczającej wideo. Dowiedz się więcej o tym, jak ujawnić.
Microsoft wymaga od swoich klientów ujawnienia syntetycznego charakteru tekstu użytkownikom awatarów mowy.
- Pamiętaj, aby zapewnić odpowiednie ujawnienie informacji odbiorcom, zwłaszcza w przypadku korzystania z wizerunku (i głosu) dobrze znanej osoby. Ludzie oceniają informacje oparte częściowo na osobie, która ją dostarcza, niezależnie od tego, czy robią to świadomie, czy nieprzytomnie. Na przykład: ujawnienie może być dokonane za pomocą znaku wodnego, takiego jak "Głos i obraz w tym filmie są generowane przez AI", w formie tekstowej lub ustnej, na początku nagrania. Aby uzyskać więcej informacji, odwiedź stronę Wzorce ujawniania.
- Należy rozważyć właściwe ujawnienie rodzicom lub innym stronom przypadków użycia, które są przeznaczone do lub mogą być używane w sytuacjach dotyczących nieletnich i dzieci. Jeśli twój przypadek użycia jest przeznaczony dla nieletnich lub dzieci, musisz upewnić się, że ujawnienie jest jasne i przejrzyste, aby rodzice lub opiekunowie prawni mogli zrozumieć rolę syntetycznych mediów i podjąć świadomą decyzję w imieniu nieletnich lub dzieci o tym, czy korzystać z tego doświadczenia.
Wybieranie odpowiednich typów głosów dla danego scenariusza
Uważnie rozważ kontekst użycia oraz potencjalne szkody, które mogą wyniknąć z użycia głosów generowanych z tekstu lub awatarów. Na przykład syntetyczne głosy o wysokiej wierności mogą nie być odpowiednie w scenariuszach wysokiego ryzyka, takich jak wiadomości osobiste, transakcje finansowe lub złożone sytuacje, które wymagają ludzkiej adaptacji lub empatii.
Użytkownicy mogą również mieć różne oczekiwania dotyczące typów głosu i wyrażeń awatara lub gestów, w zależności od kontekstu. Na przykład podczas słuchania poufnych wiadomości odczytanych przez syntetyczny głos niektórzy użytkownicy wolą bardziej empatyczny i ludzki ton, podczas gdy inni wolą neutralny głos. Rozważ przetestowanie aplikacji, aby lepiej zrozumieć preferencje użytkownika.
Bądź przejrzysty w przypadku możliwości i ograniczeń
Użytkownicy są bardziej skłonni do wyższych oczekiwań podczas kontaktu z syntetycznymi agentami głosowymi o wysokiej wierności. Gdy możliwości systemowe nie spełniają tych oczekiwań, zaufanie może cierpieć i może spowodować nieprzyjemne, a nawet szkodliwe doświadczenia.
Opcjonalne zapewnienie wsparcia przez człowieka
W niejednoznacznych scenariuszach transakcyjnych (na przykład w centrum obsługi telefonicznej) użytkownicy nie zawsze ufają agentowi komputera, aby odpowiednio reagować na swoje żądania. Wsparcie człowieka może być konieczne w takich sytuacjach, niezależnie od realistycznej jakości głosu lub możliwości systemu.
Zagadnienia dotyczące talentów głosowych
Gdy klienci pracują z talentami głosowymi w celu utworzenia niestandardowego neuronowego głosu, stosowane są poniższe wskazówki.
- Talent głosowy powinien mieć kontrolę nad modelem głosu (jak i gdzie będzie używany) i być zrekompensowany za jego użycie. Microsoft wymaga, aby klienci korzystający z niestandardowego głosu neuronowego uzyskali wyraźną pisemną zgodę od talentu głosowego na utworzenie syntetycznego głosu i zapewnili, że umowa klienta z każdą osobą uwzględnia czas trwania, użycie i wszelkie ograniczenia zawartości. Jeśli tworzysz syntetyczny głos dobrze znanej osoby, musisz zapewnić możliwość edytowania lub zatwierdzania zawartości danych wyjściowych, które mają zostać wygenerowane za pomocą modelu głosu.
- Niektóre talenty głosowe mogą być nieświadome potencjalnych złośliwych zastosowań technologii i powinny być wykształcone przez właścicieli systemu na temat możliwości technologii. Microsoft wymaga, aby klienci przekazywali Disclosure talentów głosowych i awatarów talentowi głosowemu bezpośrednio lub za pośrednictwem autoryzowanego przedstawiciela talentu głosowego w celu wyjaśnienia, jak syntetyczne głosy są opracowywane i działają w połączeniu z usługami przetwarzania tekstu na mowę.
Zagadnienia dotyczące talentu awatara
Gdy klienci pracują z talentem awatara, aby tworzyć niestandardowe awatary, stosowane są poniższe wytyczne.
- Talent Awatara powinien mieć kontrolę nad modelem awatara (jak i gdzie będzie używany) i być zrekompensowany za jego użycie. Microsoft wymaga, aby klienci korzystający z niestandardowych awatarów uzyskali wyraźną pisemną zgodę od swoich talentów awatara na stworzenie syntetycznego awatara zamieniającego tekst na mowę i upewnili się, że umowa klienta z każdą osobą uwzględnia czas trwania, użycie i wszelkie ograniczenia zawartości. Jeśli tworzysz niestandardowy awatar dobrze znanej osoby, powinieneś zapewnić możliwość, aby osoba użyczająca głos mogła edytować lub zatwierdzić treści, które planujesz wygenerować za pomocą modelu głosu.
- Niektóre talenty awatara mogą być nieświadome potencjalnych złośliwych zastosowań technologii i powinny być wykształcone przez właścicieli systemu na temat możliwości technologii. Microsoft wymaga, aby klienci dzielili się ujawnieniem Microsoft dla talentów głosowych i awatarów z talentem awatara bezpośrednio lub za pośrednictwem jego autoryzowanego przedstawiciela, w celu opisania, jak syntetyczne wideo awatara jest opracowywane i działa w połączeniu z usługami zamiany tekstu na mowę.
Zagadnienia dotyczące osób z zaburzeniami mowy
Podczas pracy z osobami z zaburzeniami mowy w celu utworzenia lub wdrożenia syntetycznej technologii głosowej obowiązują poniższe wytyczne.
Dostarczanie wytycznych dotyczących kontraktów z talentami w kontekście dostępności
Klienci powinni opracować wytyczne dotyczące ustanawiania umów z osobami, które używają syntetycznych głosów w celu uzyskania pomocy w mówieniu. Klienci powinni rozważyć określenie w umowach z osobami fizycznymi czasu użytkowania, przeniesienia własności i/lub kryteriów licencji, procedur usuwania modelu głosowego oraz sposobu zapobiegania nieautoryzowanemu dostępowi.
Uwzględnianie niespójności we wzorcach mowy
W przypadku osób z zaburzeniami mowy, które rejestrują własne profile głosowe, niespójności w wzorcach mowy (bełkotanie lub niezdolność do wypowiadania niektórych słów) mogą skomplikować proces nagrywania. W takich przypadkach technologia syntezatora mowy i sesje nagrywania powinny być zaprojektowane z odpowiednimi udogodnieniami określonymi przez klienta (na przykład zapewniać przerwy lub dodatkowe sesje nagrywania).
Zezwalaj na modyfikację w czasie
Osoby z zaburzeniami mowy mogą chcieć zaktualizować ich syntetyczny głos, aby odzwierciedlać zmiany ze względu na starzenie się lub inne czynniki. Osoby mogą również mieć preferencje stylistyczne, które zmieniają się w czasie, i mogą chcieć wprowadzić zmiany w prezentacji, akcentze lub innych cechach głosu.
Dowiedz się więcej o odpowiedzialnej sztucznej inteligencji
- Microsoft zasady sztucznej inteligencji
- Microsoft zasoby dotyczące odpowiedzialnej sztucznej inteligencji
- Microsoft Azure Kursy szkoleniowe dotyczące odpowiedzialnej sztucznej inteligencji