Mi az a szövegfelolvasás?

Ebben az áttekintésben megismerheti az Öntödei eszközök részét képező Speech szolgáltatás szövegfelolvasási funkciójának előnyeit és képességeit.

A szövegfelolvasás lehetővé teszi az alkalmazások, eszközök vagy eszközök számára, hogy a szöveget emberivé, például szintetizált beszédgé alakítják. A szövegfelolvasási képességet beszédszintézisnek is nevezik. Használjon emberi hangokat, mint a szabványos hangokat a dobozból, vagy hozzon létre egy egyéni hangot, amely egyedi a termék vagy a márka számára. A támogatott hangok, nyelvek és területi beállítások teljes listájáért tekintse meg a Speech szolgáltatás nyelv- és hangtámogatását.

A Speech szolgáltatás szabványos (neurális) hangokat és egyéni hangbeállításokat biztosít:

  • Standard hangok: Kiváló minőségű neurális hangok, több mint 100 nyelven és területi beállításban érhetők el a dobozból
  • Egyéni hangok: Egyedi márkahangok létrehozása professzionális hang finomhangolással vagy személyes hangbeállításokkal

Az elérhető hangok és nyelvek teljes listáját a Nyelv és a hangtámogatás című témakörben találja.

Első lépések

Átfogóbb oktatóanyagok és példák:

Tipp.

Ha kód nélküli megközelítéssel szeretne szöveget beszédgé alakítani, próbálja ki a Hangtartalom létrehozása eszközt a Speech Studióban.

Neurális szövegfelolvasási funkciók

A szövegfelolvasás mély neurális hálózatokkal teszi szinte megkülönböztethetetlenné a számítógépes hangokat az emberi felvételekből. A tiszta artikulációval a neurális szöveg a beszédhez csökkenti a figyelési fáradtságot az AI-interakciók során.

Legfontosabb funkciók

Funkció Összegzés Bemutató
Standard hang (a díjszabási oldalonneurálisnak hívják) Nagyon természetes, azonnal használható hangok. Hozzon létre egy Azure-előfizetést és egy Speech-erőforrást, majd használja a Speech SDK-t , vagy látogasson el a Speech Studio portáljára , és válassza ki a standard hangokat az első lépésekhez. Tekintse meg a díjszabás részleteit. Ellenőrizze a Hangtárat , és határozza meg az üzleti igényeinek megfelelő hangot.
Egyéni hang Könnyen használható önkiszolgáló megoldás természetes márkahang létrehozására, korlátozott hozzáféréssel a felelősségteljes használathoz. Hozzon létre egy Azure-előfizetést és a Microsoft Foundry-erőforrást, majd alkalmazza az egyéni hang használatára. Miután megkapta a hozzáférést, keresse fel a professzionális hang finomhangolási dokumentációt az első lépésekhez. Tekintse meg a díjszabás részleteit. Ellenőrizze a hangmintákat.

Speciális funkciók

  • Valós idejű beszédszintézis: A Speech SDK vagy a REST API használatával szabványos hangokkal vagy egyéni hangokkal konvertálhat szöveget beszédgé.

  • A hosszú hang aszinkron szintézise: A batch synthesis API használatával aszinkron módon szintetizálhatja a szöveget a 10 percnél hosszabb beszédfájlokhoz (például hangkönyvekhez vagy előadásokhoz). A Speech SDK-val vagy a Speech to text REST API-val végzett szintézissel ellentétben a válaszok nem valós időben jelennek meg. Az elvárás az, hogy a kéréseket aszinkron módon küldi el a rendszer, a rendszer lekérdezi a válaszokat, és amikor a szolgáltatás elérhetővé teszi, a rendszer letölti a szintetizált hangot.

  • Standard hangok: Az Azure Speech in Foundry Tools mély neurális hálózatokkal oldja meg a hagyományos beszédszintézis korlátait a stressz és az intonáció tekintetében a beszélt nyelven. A prozódia előrejelzése és a hangszintézis egyidejűleg történik, ami folyamatos és természetes hangzást eredményez. Minden standard hangmodell 24 kHz-en és 48 kHz-en érhető el. A neurális hangokat a következőhöz használhatja:

    • A csevegőrobotokkal és a hangsegédekkel folytatott interakciók természetesebbé és vonzóbbá tétele.
    • Digitális szövegek, például e-könyvek átalakítása hangoskönyvekké.
    • Autón belüli navigációs rendszerek továbbfejlesztése.

    A Standard Azure Speech in Foundry Tools neurális hangjainak teljes listájáért tekintse meg a Speech szolgáltatás nyelv- és hangtámogatását.

  • A szöveg beszédkimenetének javítása az SSML-vel: A Beszédszintézis korrektúranyelv (SSML) egy XML-alapú korrektúranyelv, amellyel a szöveg a beszédkimenetekre szabható. Az SSML-vel beállíthatja a hangmagasságot, szüneteltethet, javíthatja a kiejtést, módosíthatja a beszédsebességet, módosíthatja a hangerőt, és több hangot rendelhet egyetlen dokumentumhoz.

    Az SSML használatával saját lexikonokat definiálhat, vagy válthat különböző beszédstílusokra. A többnyelvű hangokkal az SSML-en keresztül is módosíthatja a beszélő nyelveket. A forgatókönyv hangkimenetének javításához tekintse meg a Beszédszintézis korrektúranyelv és a Beszédszintézis fejlesztése a Hangtartalom-létrehozás eszközzel című témakört.

  • Visemák: A visemák a megfigyelt beszédben a legfontosabb pózok, beleértve az ajkak, az állkapocs és a nyelv helyzetét egy adott fonéma előállítása során. A visémák erős korrelációt mutatnak a hangokkal és a fonémákkal.

    A Speech SDK viseme eseményeinek használatával arcanimációs adatokat hozhat létre. Ezek az adatok az arcok animálására használhatók az olvasási kommunikációban, az oktatásban, a szórakozásban és az ügyfélszolgálatban. A Viseme jelenleg csak az en-US (amerikai angol) neurális hangok esetében támogatott.

Feljegyzés

Az Azure Speech neurális (nem HD) hangjai mellett azure Speech nagy felbontású (HD) ésAzure OpenAI neurális (HD és nem HD) hangokat is használhat. A HD-hangok magasabb minőséget biztosítanak a sokoldalúbb forgatókönyvekhez.

Egyes hangok nem támogatják az összes beszédszintézis-korrektúrajelölési (SSML) címkét. Ez magában foglalja a neurális szövegből beszédet készítő HD-hangokat, a személyes hangokat és a beágyazott hangokat.

Mintakód

A szövegfelolvasás mintakódja a GitHubon érhető el. Ezek a minták a legnépszerűbb programozási nyelvek szövegről beszédre konvertálását ismertetik:

Egyéni hang

A szabványos hangok mellett olyan egyéni hangokat is létrehozhat, amelyek egyediek a termék vagy a márka számára. Az egyéni hang egy olyan gyűjtőkifejezés, amely magában foglalja a professzionális hang finomhangolását és a személyes hangolást. Az első lépésekhez mindössze néhány hangfájlra és a kapcsolódó átiratra van szükség. További információkért tekintse meg a professzionális hang finomhangolási dokumentációját.

Díjszabási megjegyzés

Számlázható karakterek

A szövegfelolvasási funkció használatakor a számlázás az egyes sikeresen feldolgozott kérelmekben szereplő karakterek teljes számán alapul. Ez a szám tartalmazza az összes karaktert/betűt, számot, szóközt és írásjelet; függetlenül attól, hogy a hangkimenet létre van-e hozva. A díjak akkor is érvényesek, ha a beszéd nem a kijelölt hangnyelv és a bemeneti szöveg közötti eltérés miatt jön létre. Íme egy lista a számlázható díjakról:

  • A kérés SSML-törzsében a szövegfelolvasási funkciónak átadott szöveg
  • A kérelem törzsének szövegmezőjében lévő összes jelölőnyelvi elem SSML formátumban, a <speak> és <voice> címkék kivételével.
  • Betűk, írásjelek, szóközök, tabulátorok, jelölés és minden fehér szóköz karakter
  • Unicode-ban definiált minden kódpont

Részletes információkért lásd a Speech service díjszabását.

Fontos

Minden kínai karakter két karakternek számít a számlázáshoz, beleértve a japánul használt kanjit, a koreai nyelven használt handzsát vagy a más nyelveken használt hanzit.

Modell betanítási és üzemeltetési ideje egyéni hanghoz

Az egyéni hangbetanítást és -üzemeltetést óránként és másodpercenként számlázva számítjuk ki. A számlázási egység árának megtekintéséhez tekintse meg a Speech szolgáltatás díjszabását.

A professzionális hang finomhangolási idejét a "számítási óra" (a gép futási idejének mérésére szolgáló egység) méri. Hangmodell betanításakor általában két számítási feladat fut párhuzamosan. A számított számítási órák tehát hosszabbak, mint a tényleges betanítási idő. A professzionális hang finomhangolásához általában 20–40 számítási órát vesz igénybe egy egystílusú hang betanítása, és körülbelül 90 számítási órát vesz igénybe egy többstílusú hang betanítása. A professzionális hang finomhangolási ideje 96 számítási óra korláttal van számlázva. Tehát ha egy hangmodellt 98 számítási óra alatt tanít be, csak 96 számítási órát kell fizetnie.

Az egyéni hangalapú végpont üzemeltetése a tényleges idő (óra) alapján történik. Az egyes végpontok üzemeltetési idejét (óraszámát) az előző 24 órában minden nap 00:00 (UTC) időpontban számítjuk ki. Ha például a végpont az első napon 24 órán keresztül aktív volt, akkor a második napon 24 órán át kell számlázni, UTC 00:00-kor. Ha a végpontot a nap folyamán újonnan hozták létre vagy függesztették fel, akkor a rendszer a második napon 00:00-ig (UTC) számítja fel a halmozott futási időt. Ha a végpont jelenleg nincs üzemeltetve, a számlázás nem történik meg. A naponta 00:00 (UTC) időpontban történő számítás mellett a számlázás azonnal aktiválódik, amikor egy végpontot törölnek vagy felfüggesztenek. Például egy végpont, amely december 1-jén 08:00-kor (UTC) lett létrehozva, a december 2-án 00:00-kor (UTC) kezdődő időszakban 16 üzemórára lesz kiszámítva, december 3-án pedig 00:00-kor (UTC) 24 üzemórára. Ha a felhasználó december 3-án 16:30 -kor (UTC) felfüggeszti a végpont üzemeltetését, a számlázáshoz az időtartam (16,5 óra) számítható ki 00:00 és 16:30 (UTC) között december 3-án.

Személyes hang

Ha a személyes hangfunkciót használja, a profiltárolásért és a szintézisért is fizetnie kell.

  • Profiltároló: Miután egy személyes hangprofil létrejött, számlázva van a rendszer által, amíg el nem távolítják azt a rendszerből. A számlázási egység naponta hangonként van megadva. Ha a hangtárolás 24 óránál rövidebb ideig tart, akkor is egy teljes nap lesz számlázva.
  • Szintézis: Karakterenként számlázva. A számlázható karakterek részleteiért lásd a fenti számlázható karaktereket.

Avatar a szövegfelolvasáshoz

Ha a szövegfelolvasási avatar funkciót használja, a díjakat másodpercenként számítjuk fel a videó kimenetének hossza alapján. A valós idejű avatar esetében azonban a díjak másodpercenként kerülnek számlázásra attól függően, hogy az avatar mikor aktív, függetlenül attól, hogy beszél-e, vagy csendes marad. A valós idejű avatar használat költségeinek optimalizálásához tekintse meg az avatar csevegési mintakódjában található "Helyi videó használata tétlen állapotban" tippeket.

A testre szabott szöveg–beszéd avatar betanítása az időt a "számítási órák" (a gép futási ideje) segítségével mérik, és másodperc alapú számlázással történik. A betanítás időtartama a használt adatok mennyiségétől függően változik. Az egyéni avatarok betanítása általában átlagosan 20-40 számítási órát vesz igénybe. Az avatar betanítási ideje 96 számítási óra korláttal van kiszámlázva. Tehát ha az történik, hogy egy avatarmodell 98 számítási óra alatt kerül betanításra, akkor csak 96 számítási időóráért számítanak fel költséget.

Az Avatar-üzemeltetés másodpercenkénti számlázása végpontonként történik. A költségek csökkentése érdekében felfüggesztheti a végpontot. Ha fel szeretné függeszteni a végpontot, közvetlenül törölheti azt. Az ismételt használathoz helyezze újra üzembe a végpontot.

A fotó avatarja, beleértve a standard és az egyéni változatokat is, integrálható a Voice Live-tal alacsony késésű, kétirányú beszélgetési forgatókönyvek esetén.

Azure-szöveg és beszédmetrikák monitorozása

Az erőforrás-használat kezeléséhez és a költségek szabályozásához elengedhetetlen a szöveggel a beszédszolgáltatásokhoz társított főbb metrikák monitorozása. Ez a szakasz bemutatja, hogyan kereshet használati adatokat az Azure Portalon, és részletes definíciókat adhat meg a főbb metrikákról. Az Azure Monitor-metrikákkal kapcsolatos további információkért tekintse meg az Azure Monitor-metrikák áttekintését.

Használati adatok keresése az Azure Portalon

Az Azure-erőforrások hatékony kezeléséhez elengedhetetlen a használati adatok rendszeres elérése és áttekintése. A használati adatok a következőképpen találhatók:

  1. Lépjen az Azure Portalra , és jelentkezzen be az Azure-fiókjával.

  2. Lépjen az Erőforrások elemre, és válassza ki a figyelni kívánt erőforrást.

  3. A bal oldali menüben válassza a Figyelés csoportban lévő Metrikákat.

    Képernyőkép a metrika kiválasztásáról a figyelés alatt.

  4. Metrikanézetek testreszabása.

    Az adatokat erőforrástípus, metrikatípus, időtartomány és egyéb paraméterek szerint szűrheti, hogy a monitorozási igényeknek megfelelő egyéni nézeteket hozzon létre. Emellett a metrikanézetet az irányítópultokra is mentheti a Gyakran használt metrikákhoz való könnyű hozzáférés érdekében a Mentés irányítópultra lehetőség kiválasztásával.

  5. Riasztások beállítása.

    A használat hatékonyabb kezeléséhez a riasztásokat a bal oldali menü Figyelés csoportjában található Riasztások lapra lépve állíthatja be. Amikor a használat eléri a meghatározott küszöbértékeket, a riasztások segítségével értesítést kaphat, így elkerülhetőek a váratlan költségek.

Mérőszámok meghatározása

Íme egy táblázat, amely összefoglalja az Azure-szövegek beszédre vonatkozó főbb metrikáit.

Metrika neve Leírás
Szintetizált karakterek Nyomon követi a beszédté konvertált karakterek számát, beleértve a standard és az egyéni hangot is. A számlázható karakterekről további információt a Számlázható karakterek című témakörben talál.
Videószekundumok szintetizálva A videószintézis teljes időtartamát méri, beleértve a kötegelt avatarszintézist, a valós idejű avatarszintézist és az egyéni avatarszintézist.
Avatarmodell hosztolási idő másodpercben Nyomon követi, hogy az egyéni avatarmodell mennyi ideig van "hostolva" másodpercben.
Hangmodell üzemeltetési ideje Nyomon követi az egyéni hangmodell üzemeltetése során eltelt órák teljes idejét.
Hangmodell képzési percek Az egyéni hangmodell betanításához szükséges percek teljes idejét méri.

Referenciadokumentumok

Felelős mesterséges intelligencia

Az AI-rendszerek nem csak a technológiát, hanem az azt használó személyeket, az érintett személyeket és az üzembe helyezett környezetet is magukban foglalják. Az átláthatósági megjegyzésekből megtudhatja, hogyan lehet felelősségteljesen használni és üzembe helyezni a mesterséges intelligenciát a rendszereiben.

Következő lépések