Mi az egyéni hang?

Az egyéni hang egy szövegfelolvasási funkció, amellyel egyedi, testre szabott, szintetikus hangokat hozhat létre az alkalmazásokhoz. Az egyéni hanggal rendkívül természetes hangzású hangot hozhat létre a márka vagy a karakterek számára, ha emberi beszédmintákat biztosít finomhangolási adatokként.

Fontos

Az egyéni hanghozzáférés a jogosultsági és használati feltételek alapján korlátozott . Hozzáférés kérése a beviteli űrlapon.

A szövegfelolvasás minden támogatott nyelvhez használható szabványos hangokkal. A szabványos hangok a legtöbb szövegfelolvasási forgatókönyvben jól működnek, ha nincs szükség egyedi hangra.

Az egyedi hang a neurális szöveg-beszéd technológián és a többnyelvű, többszereplős, univerzális modellen alapul. Létrehozhat olyan szintetikus hangokat, amelyek beszédstílusokban gazdagok, vagy adaptálható keresztnyelvek. Az egyéni hang valósághű és természetes hangzása márkákat képviselhet, személyre szabhatja a gépeket, és lehetővé teszi a felhasználók számára, hogy beszélgetéssel kommunikáljanak az alkalmazásokkal. Az egyéni hanghoz támogatott nyelvek megtekintése.

Hogyan működik?

Egyéni hang létrehozásához használja a Speech Studiót a rögzített hang és a hozzájuk tartozó szkriptek feltöltésére, a modell betanítására és a hang egyéni végponton való üzembe helyezésére.

A kiváló egyéni hang létrehozásához minden lépésben gondos minőségellenőrzésre van szükség, a hangtervezéstől és az adatelőkészítéstől kezdve a hangmodell üzembe helyezéséig a rendszerig.

Mielőtt elkezdené a Speech Studiót, íme néhány szempont:

  • Egy rövid persona-dokumentum segítségével megtervezheti a márkát jelképező hangszemélyeket. Ez a dokumentum olyan elemeket határoz meg, mint a hang jellemzői és a hang mögötti karakter. Ez segít az egyéni hangmodellek létrehozásának folyamatában, beleértve a szkriptek meghatározását, a hangtehetség kiválasztását, a betanítást és a hanghangolást.
  • Válassza ki a rögzítési szkriptet a hang felhasználói forgatókönyveinek megjelenítéséhez. Ha például ügyfélszolgálati robotot hoz létre, használhatja például a robotbeszélgetések kifejezéseit felvételi szkriptként. A szkriptekben különböző mondattípusokat is tartalmazhat, például utasításokat, kérdéseket és felkiáltójeleket.

Az alábbiakban áttekintjük az egyéni hang létrehozásának lépéseit a Speech Studióban:

  1. Hozzon létre egy projektet , amely tartalmazza az adatokat, hangmodelleket, teszteket és végpontokat. Minden projekt egy adott országra/régióra és nyelvre vonatkozik. Ha több hangot szeretne létrehozni, javasoljuk, hogy minden hanghoz hozzon létre egy projektet.
  2. Hangtehetség beállítása. Mielőtt finomhangolhat egy professzionális hangot, be kell küldenie egy felvételt a hangtehetség hozzájárulási nyilatkozatáról. A hangtehetség nyilatkozata egy felvétel arról, hogy a hangtehetség egy nyilatkozatot olvas fel, amelyben hozzájárul a beszédadatok professzionális hang finomhangolására történő felhasználásához.
  3. Készítse elő az adatok finomhangolását a megfelelő formátumban. Érdemes professzionális minőségű stúdióban rögzíteni a hangfelvételeket, hogy magas jel-zaj arányt érjen el. A hangmodell minősége nagymértékben függ a finomhangolási adatoktól. Konzisztens hangerőre, beszédsebességre, hangmagasságra és konzisztenciára van szükség a beszéd kifejező módjában.
  4. Hangmodell betanítása. Válasszon legalább 300 kimondott szöveget egyéni hang létrehozásához. A rendszer automatikusan elvégzi az adatminőség-ellenőrzéseket a feltöltéskor. A kiváló minőségű hangmodellek létrehozásához ki kell javítania a hibákat, és újra be kell küldenie.
  5. Tesztelje a hangját. Készítsen tesztszkripteket a hangmodellhez, amelyek lefedik az alkalmazások különböző használati eseteit. Érdemes szkripteket használni a betanítási adatkészleten belül és kívül, hogy szélesebb körben tesztelhesse a minőséget a különböző tartalmakhoz.
  6. Hangmodell üzembe helyezése és használata az alkalmazásokban.

Az egyéni hangokat ugyanúgy hangolhatja, módosíthatja és használhatja, mint a hagyományos hangokat. Valós idejű szöveggé alakíthatja a szöveget, vagy offline hangtartalmat hozhat létre szövegbevitellel. A REST API-t, a Speech SDK-t vagy a Speech Studiót használja.

Tipp

A GitHub Speech SDK-adattárában található kódmintákból megtudhatja, hogyan használhat egyéni hangokat az alkalmazásban.

A betanított hangmodell stílusa és jellemzői a betanításhoz használt hangtehetségből származó felvételek stílusától és minőségétől függenek. Az SSML (Speech Synthesis Markup Language) használatával azonban több módosítást is elvégezhet, amikor az API-hívásokat a hangmodellbe indítja, hogy szintetikus beszédet generáljon. Az SSML a szöveggel a beszédszolgáltatással való kommunikációhoz használt korrektúranyelv a szöveg hanggá alakításához. A módosítható beállítások közé tartozik a hangmagasság, a sebesség, az intonáció és a kiejtés korrekciója. Ha a hangmodell több stílussal készült, az SSML használatával is válthat a stílusok között.

Összetevők sorozata

Az egyéni hang három fő összetevőből áll: a szövegelemzőből, a neurális akusztikai modellből és a neurális vocoderból. Ha természetes szintetikus beszédet szeretne létrehozni a szövegből, a szöveg az első bemenet a szövegelemzőbe, amely a kimenetet fonetikai szekvenciák formájában biztosítja. A fonéma egy alapvető hangegység, amely egy adott nyelvben megkülönbözteti az egyik szót a másiktól. A fonefonok sorozata határozza meg a szövegben megadott szavak kiejtését.

Ezután a fonálütemezés a neurális akusztikai modellbe kerül, hogy előre jelezhesse a beszédjeleket meghatározó akusztikai jellemzőket. Az akusztikai jellemzők közé tartozik a hangjelzés, a beszédstílus, a sebesség, az intonációk és a stresszminták. Végül a neurális vocoder hallható hullámokká alakítja az akusztikai jellemzőket, így szintetikus beszéd jön létre.

Az egyéni hang összetevőit megjelenítő folyamatábra.

A neurális szövegek beszédhangmodelljeinek betanítása mély neurális hálózatok használatával történik az emberi hangok felvételmintái alapján. További információkért tekintse meg ezt a Microsoft-blogbejegyzést. Ha többet szeretne megtudni a neurális vocoderok betanításáról, tekintse meg ezt a Microsoft-blogbejegyzést.

Felelős mesterséges intelligencia

Az AI-rendszerek nem csak a technológiát, hanem az azt használó személyeket, az érintett személyeket és az üzembe helyezett környezetet is magukban foglalják. Olvassa el az átláthatósági megjegyzéseket, hogy többet megtudjon a mesterséges intelligencia felelős használatáról és üzembe helyezéséről a rendszereiben.

Következő lépések