Voice Live API valós idejű hangügynökökhöz

Mi az a Voice Live API?

A Voice Live API egy olyan megoldás, amely alacsony késleltetésű, kiváló minőségű beszéd-beszéd interakciókat tesz lehetővé a hangügynökök számára. Az API méretezhető és hatékony hangvezérelt szolgáltatásokat kereső fejlesztők számára készült, mivel nem szükséges több összetevő manuális vezénylése. A beszédfelismerés, a generatív AI és a szöveg-beszéd funkciók egyetlen, egységes felületen való integrálásával teljes körű megoldást kínál a zökkenőmentes élmények létrehozásához.

A Voice Live API teljes mértékben felügyelt, így nem kell kezelnie a háttérbeli vezénylést vagy az összetevők integrációját. A fejlesztők hangbemenetet biztosítanak, és hangkimenetet, avatarvizualizációkat és műveleti eseményindítókat fogadnak – mindezt minimális késéssel. Nem kell generatív AI-modelleket üzembe helyeznie vagy kezelnie, mivel az API kezeli a mögöttes infrastruktúrát.

Beszédről beszédre élmények megértése

A beszédfelolvasási technológia forradalmasítja, hogy az emberek hogyan kommunikálnak a rendszerekkel, és intuitív hangalapú megoldásokat kínálnak. A hagyományos implementációk különböző modulok, például a beszéd-szöveg, a párbeszédpanel-kezelés, a szöveg-beszéd stb. kombinálásával foglalkoznak. Az ilyen láncolás a mérnöki összetettség növekedéséhez és a végfelhasználó által érzékelt késéshez vezethet.

A nagy nyelvi modellek (LLM-ek) és a multimodális AI fejlesztései révén a Voice Live API egyesíti ezeket a funkciókat, leegyszerűsítve a fejlesztők munkafolyamatait. Ez a megközelítés javítja a valós idejű interakciókat, és biztosítja a kiváló minőségű, természetes kommunikációt, így alkalmassá teszi az azonnali, hangalapú megoldásokat igénylő iparágak számára.

A Voice Live API főbb forgatókönyvei

Az Azure AI Voice Live API ideális olyan helyzetekhez, ahol a hangalapú interakciók javítják a felhasználói élményt. Ide sorolhatóak például a következők:

  • Kapcsolattartási központok: Interaktív hangrobotok fejlesztése ügyfélszolgálati, termékkatalógus-navigációs és önkiszolgáló megoldásokhoz.
  • Autóipari asszisztensek: Lehetővé teszi a kihangosító, autón belüli hangsegédek használatát parancsvégrehajtáshoz, navigációhoz és általános kérdésekhez.
  • Oktatás: Hangalapú oktatópartnerek és virtuális oktatók létrehozása interaktív oktatáshoz és oktatáshoz.
  • Közszolgáltatások: Hangügynökök létrehozása a polgárok adminisztratív lekérdezéseihez és a közszolgáltatási információkhoz való segítségnyújtáshoz.
  • Emberi erőforrások: A HR-folyamatok fejlesztése hangalapú eszközökkel az alkalmazottak támogatásához, a karrierfejlesztéshez és a képzéshez.

A Voice Live API funkciói

A Voice Live API számos funkciót tartalmaz a különböző használati esetek támogatásához és a kiváló hang interakciók biztosításához:

  • Széles területi lefedettség: Több mint 140 területi beállítás támogatja a szöveghez való beszédet, és több mint 600 szabványos hangszínt kínál több mint 150 különböző területi beállítással a szövegről a beszédre, biztosítva a globális akadálymentességet.
  • Testreszabható bemenet és kimenet: Kifejezéslista használata a hangbemenet és az egyéni beszédmodellek egyszerű igény szerint történő testreszabásához a beszédfelismerés finomhangolásához. Egyéni hang használatával egyedi, márkahoz igazított hangokat hozhat létre a hangkimenethez. További információ : A Voice Live bemenetének és kimenetének testreszabása .
  • Rugalmas generatív AI-modelllehetőségek: Több modell közül választhat, például a GPT-5, a GPT-4.1, a GPT-4o, a Phi és a beszélgetési követelményeknek megfelelően.
  • Speciális beszélgetési funkciók:
    • Zajelnyomás: Csökkenti a környezeti zajt a tisztább kommunikáció érdekében.
    • Visszhang törlés: Megakadályozza, hogy az ügynök a saját válaszait vegye fel.
    • Robusztus megszakításészlelés: Biztosítja a beszélgetések során előforduló megszakítások pontos felismerését.
    • Speciális fordulóvégi észlelés: Lehetővé teszi a természetes szüneteket anélkül, hogy idő előtt interakciókat zárnál be.
  • Avatar-integráció: Szabványos vagy testreszabható avatárokat biztosít a hangkimenettel szinkronizálva, és vizuális identitást kínál a hangügynökök számára.
  • Függvényhívás: Engedélyezi a külső műveleteket, az eszközök használatát és a megalapozott válaszokat a VoiceRAG-mintával.

API-tervezés és kompatibilitás

A Voice Live API az Azure OpenAI Realtime API-val való kompatibilitásra lett tervezve. A támogatott valós idejű események többnyire megfelelnek az Azure OpenAI Realtime API-eseményeknek, néhány kivételt a Voice Live API útmutatójában leírtak szerint.

A Voice Live API-ra jellemző funkciók opcionálisak és additívak. Az Azure Speech szolgáltatást a Foundry Tools képességeihez, mint például a zajelnyomás, a visszhanglemondás és a speciális végpontfelismerés, adhatja hozzá anélkül, hogy módosítaná a meglévő architektúrát a meglévő alkalmazásokban.

Az API-t WebSocket-események támogatják, ami lehetővé teszi a kiszolgálók közötti egyszerű integrációt. A háttér- vagy középszintű szolgáltatás websocketeken keresztül csatlakozik a Voice Live API-hoz. A WebSocket-üzeneteket közvetlenül használhatja az API-val való interakcióhoz.

Támogatott modellek és régiók

A hangügynök intelligenciájának használatához rugalmasságot és választási lehetőségeket kínál a GPT-Realtime, a GPT-5, a GPT-4.1, a Phi és a további lehetőségek közötti generatív AI-modellben. A különböző generatív AI-modellek különböző képességeket, intelligenciaszinteket, a következtetés sebességét és késését és költségeit biztosítják. Attól függően, hogy mi számít a leginkább az ön vállalkozásának és használati esetének, válassza ki az igényeinek leginkább megfelelő modellt.

A natívan támogatott modellek teljes mértékben felügyeltek, így nem kell modelleket üzembe helyeznie, nem kell foglalkoznia a kapacitástervezéssel vagy az átviteli sebesség kiosztásával. Használja a szükséges modellt, és a Voice Live API gondoskodik a többiről.

A Voice Live API a következő modelleket támogatja. A támogatott régiókról az Azure Speech szolgáltatás régióiban olvashat.

Modell Leírás
gpt-realtime-1.5 GPT valós idejű 1.5 + lehetőség Azure szövegfelolvasó hangok használatára, beleértve az egyéni hangot is audiohoz.
gpt-realtime-1.5-datazone GPT 1.5 valós idejű, standard adatkezelési zónás feldolgozással. A kérések és válaszok az erőforrásrégióhoz társított adatzónán belül maradnak. Támogatja Azure szövegfelolvasást, beleértve az egyéni hangokat is.
gpt-realtime GPT valós idejű + lehetőség az Azure szöveg-beszéd hangok használatára, beleértve az egyéni hangot is.
gpt-realtime-datazone GPT valós idejű Data Zone Standard feldolgozással. A kérések és válaszok az erőforrásrégióhoz társított adatzónán belül maradnak. Támogatja Azure szövegfelolvasást, beleértve az egyéni hangokat is.
gpt-realtime-mini GPT mini valós idejű + lehetőség az Azure-beli szövegek beszédhangokhoz való használatára, beleértve az egyéni hanghangot is.
gpt-4o GPT-4o + hangbemenet az Azure beszédfelismerés segítségével szövegre, valamint hangkimenet az Azure szövegfelolvasó hangjaival, beleértve az egyéni hangokat is.
gpt-4o-mini GPT-4o mini + audio bemenet az Azure speech to text rendszerén keresztül + audio kimenet az Azure text to speech hangokkal, beleértve az egyéni hangokat is.
gpt-4.1 GPT-4.1 + hangbemenet azure-beli beszédről szövegre + hangkimenet azure-beli szövegről beszédhangra, beleértve az egyéni hangokat is.
gpt-4.1-mini GPT-4.1 mini + hangbemenet az Azure Speech-to-Text szolgáltatáson keresztül + hangkimenet az Azure Text-to-Speech hangjain keresztül, beleértve az egyéni hangokat is.
gpt-4.1-nano GPT-4.1 nano + hangbemenet az Azure beszédfelismerésen keresztül + hangkimenet az Azure beszédszintézis-hangjain keresztül, beleértve az egyéni hangot is.
gpt-5.6-terra GPT-5.6 Terra + hangbemenet Azure beszédfelismeréssel + hangkimenet Azure szövegfelolvasási hangokkal, beleértve az egyéni hangokat is.
gpt-5.4 GPT-5.4 + hangbemenet az Azure Speech to Texten keresztül + hangkimenet az Azure Text to Speech hangjaival, beleértve az egyéni hangot is.
gpt-5.2 GPT-5.2 + hangbemenet az Azure beszédfelismerési szolgáltatásán keresztül + hangkimenet az Azure szövegfelolvasó hangjaival, beleértve az egyéni hangot is.
gpt-5.1 GPT-5.1 + hangbemenet az Azure speech-to-text szolgáltatásán keresztül + hangkimenet az Azure text-to-speech hangjaival, beleértve az egyéni hangot is.
gpt-5 GPT-5 + hangbemenet az Azure Speech to Text szolgáltatáson keresztül + hangkimenet az Azure Text to Speech hangjain keresztül, beleértve az egyéni hangot is.
gpt-5-mini GPT-5 mini + hangbemenet Azure Speech to Text szolgáltatással + hangkimenet Azure Text to Speech szolgáltatással, beleértve az egyéni hangokat is.
gpt-5-nano GPT-5 nano + hangbemenet azure-beli beszédből szövegbe + hangkimenet azure-beli szövegről beszédhangra, beleértve az egyéni hangokat is.
phi4-mm-realtime (előzetes verzió) Phi4-mm + hangkimenet az Azure szöveg-beszédhangokon keresztül, beleértve az egyéni hangokat is.
azure-realtime Azure valós idejű + dedikált azure-realtime-native hangok hanganyaghoz.

Note

A modelleket gpt-5.5gpt-5.4-minigpt-5.4-nano a Voice Live támogatja és teszteli, de nincsenek előre üzembe helyezve. A használatukhoz helyezze üzembe őket a Foundry erőforrásában, és csatlakozzon a Hozd saját modelled (BYOM) használatával.

A Voice Live API összehasonlítása más beszédfelolvasási megoldásokkal

A Voice Live API alternatívát jelent több összetevő, például a beszédfelismerés, a generatív AI és a szövegfelolvasás vezénylésére. Ez a vezénylés összetett és időigényes lehet, ami jelentős mérnöki erőfeszítést igényel az integrációhoz és a karbantartáshoz. A Voice Live API leegyszerűsíti ezt a folyamatot azáltal, hogy egyetlen felületet biztosít ezeknek az összetevőknek. A fejlesztők az alapul szolgáló infrastruktúra kezelése helyett az alkalmazások létrehozására összpontosíthatnak.

A követelmények teljesítéséhez létrehozhatja saját megoldását, vagy használhatja a Voice Live API-t. Ez a táblázat a következő megközelítéseket hasonlítja össze:

Alkalmazáskövetelmény Csináld magad Voice Live API
Széles területi lefedettség nagy pontossággal (hangbemenet)
Márka- és karakter-személyiség fenntartása (hangkimenet)
Beszélgetési fejlesztések
Generatív AI-modellek kiválasztása
Látványos megjelenés szöveg-beszéd avatárral
Alacsony mérnöki költség
A végfelhasználó által érzékelt alacsony késés

Árképzés

A Voice Live API díjszabása 2025. július 1-jén lép érvénybe.

A Voice Live API díjszabása a használt generatív AI-modell alapján rétegzett (Pro, Basic és Lite). Nem jelöl ki szintet. Generatív AI-modellt választ, és a megfelelő díjszabás érvényes:

Tarifakategória Modellek
Voice Live pro gpt-realtime, gpt-realtime-datazone, gpt-realtime-1.5, gpt-realtime-1.5-datazonegpt-4o, gpt-4.1, gpt-5, , gpt-5-chatgpt-5.6-terra
Alapszintű Voice Live gpt-realtime-mini, gpt-4o-mini, gpt-4.1-minigpt-5-mini
Voice Live lite gpt-5-nano, phi4-mm-realtime

Ha egyéni beszédet, egyéni hangot vagy egyéni avatart használ a beszédbemenethez vagy -kimenethez, a modell betanításáért és üzemeltetéséért külön díjat számítunk fel. Részletekért tekintse meg a Speech Services díjszabását .

Fontos

Az egyéni hanghozzáférés a jogosultsági és használati feltételek alapján korlátozott . Hozzáférés kérése a beviteli űrlapon.

Fontos

Az egyéni szöveg és a beszéd avatarhoz való hozzáférés a jogosultsági és használati feltételek alapján korlátozott . Hozzáférés kérése a beviteli űrlapon.

Példa díjszabási forgatókönyvekre

Íme néhány példa díjszabási forgatókönyvek, amelyek segítenek megérteni a Voice Live API díjának módját:

Szcenárió 1

Egy szabványos Azure Speech-bemenettel, GPT-4.1-sel, egyéni Azure Speech-kimenettel és egyéni avatarral készült ügyfélszolgálati ügynök.

A Voice Live Pro díjszabása szerint a következőért kell fizetnie:

  • Szöveg
  • Hang az Azure Speech használatával – Standard
  • Hang az Azure Speechdel – Egyéni

A következő betanítási és modellüzemeltetési költségek külön kerülnek felszámításra:

  • Egyéni hang – professzionális
  • Egyéni avatar

Forgatókönyv 2

Tanulási ügynök készült standard Azure Speech-kimenettel és gpt-realtime natív hangbemenettel.

A Voice Live Pro díjszabása szerint a következőért kell fizetnie:

  • Szöveg
  • Natív hang gpt-realtime
  • Hang az Azure Speech használatával – Standard

3. forgatókönyv

Egy natív hangbemenettel és szabványos Azure Speech-kimenettel és standard avatarral gpt-realtime-mini készült tehetséginterjú-ügynök.

Önt a Voice Live alapdíja alapján terhelik az alábbiakért:

  • Szöveg
  • Natív hang gpt-realtime-mini
  • Hang az Azure Speech használatával – Standard

Az alábbiakért külön kell fizetnie:

  • Szöveg–beszéd avatar (standard)

4. forgatókönyv

Egy autós asszisztens, amely phi4-mm-realtime és Azure egyedi hanggal készült.

Az alábbiakért a Voice Live lite díjszabása szerint kell fizetnie:

  • Szöveg
  • Natív hang phi4-mm-realtime

A Voice Live Pro díjszabása szerint a következőért kell fizetnie:

  • Hang az Azure Speechdel – Egyéni

A következő betanítási és modellüzemeltetési költségek külön kerülnek felszámításra:

  • Egyéni hang – professzionális

Tokenek használata és költségbecslése

A tokenek azok az egységek, amelyeket a generatív AI-modellek használnak a bemenet feldolgozásához és a kimenet létrehozásához. 

A hanghossz alapján megbecsülheti a különböző modellcsaládok tokenhasználatát a Voice Live API-val. Az alábbi token-számítások minden modellcsaládra vonatkoznak.

Modellcsalád Bemeneti hang (tokenek másodpercenként) Kimeneti hang (tokenek másodpercenként)
Azure OpenAI-modellek ~10 szóegység ~20 token
Phi-modellek ~12,5 token ~20 token

A gyorsítótárazott hang- és szövegbevitelekért is díjat számítunk fel, beleértve a kérdés és a beszélgetések kontextusát is.