Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Mi az a Voice Live API?
A Voice Live API egy olyan megoldás, amely alacsony késleltetésű, kiváló minőségű beszéd-beszéd interakciókat tesz lehetővé a hangügynökök számára. Az API méretezhető és hatékony hangvezérelt szolgáltatásokat kereső fejlesztők számára készült, mivel nem szükséges több összetevő manuális vezénylése. A beszédfelismerés, a generatív AI és a szöveg-beszéd funkciók egyetlen, egységes felületen való integrálásával teljes körű megoldást kínál a zökkenőmentes élmények létrehozásához.
A Voice Live API teljes mértékben felügyelt, így nem kell kezelnie a háttérbeli vezénylést vagy az összetevők integrációját. A fejlesztők hangbemenetet biztosítanak, és hangkimenetet, avatarvizualizációkat és műveleti eseményindítókat fogadnak – mindezt minimális késéssel. Nem kell generatív AI-modelleket üzembe helyeznie vagy kezelnie, mivel az API kezeli a mögöttes infrastruktúrát.
Beszédről beszédre élmények megértése
A beszédfelolvasási technológia forradalmasítja, hogy az emberek hogyan kommunikálnak a rendszerekkel, és intuitív hangalapú megoldásokat kínálnak. A hagyományos implementációk különböző modulok, például a beszéd-szöveg, a párbeszédpanel-kezelés, a szöveg-beszéd stb. kombinálásával foglalkoznak. Az ilyen láncolás a mérnöki összetettség növekedéséhez és a végfelhasználó által érzékelt késéshez vezethet.
A nagy nyelvi modellek (LLM-ek) és a multimodális AI fejlesztései révén a Voice Live API egyesíti ezeket a funkciókat, leegyszerűsítve a fejlesztők munkafolyamatait. Ez a megközelítés javítja a valós idejű interakciókat, és biztosítja a kiváló minőségű, természetes kommunikációt, így alkalmassá teszi az azonnali, hangalapú megoldásokat igénylő iparágak számára.
A Voice Live API főbb forgatókönyvei
Az Azure AI Voice Live API ideális olyan helyzetekhez, ahol a hangalapú interakciók javítják a felhasználói élményt. Ide sorolhatóak például a következők:
- Kapcsolattartási központok: Interaktív hangrobotok fejlesztése ügyfélszolgálati, termékkatalógus-navigációs és önkiszolgáló megoldásokhoz.
- Autóipari asszisztensek: Lehetővé teszi a kihangosító, autón belüli hangsegédek használatát parancsvégrehajtáshoz, navigációhoz és általános kérdésekhez.
- Oktatás: Hangalapú oktatópartnerek és virtuális oktatók létrehozása interaktív oktatáshoz és oktatáshoz.
- Közszolgáltatások: Hangügynökök létrehozása a polgárok adminisztratív lekérdezéseihez és a közszolgáltatási információkhoz való segítségnyújtáshoz.
- Emberi erőforrások: A HR-folyamatok fejlesztése hangalapú eszközökkel az alkalmazottak támogatásához, a karrierfejlesztéshez és a képzéshez.
A Voice Live API funkciói
A Voice Live API számos funkciót tartalmaz a különböző használati esetek támogatásához és a kiváló hang interakciók biztosításához:
- Széles területi lefedettség: Több mint 140 területi beállítás támogatja a szöveghez való beszédet, és több mint 600 szabványos hangszínt kínál több mint 150 különböző területi beállítással a szövegről a beszédre, biztosítva a globális akadálymentességet.
- Testreszabható bemenet és kimenet: Kifejezéslista használata a hangbemenet és az egyéni beszédmodellek egyszerű igény szerint történő testreszabásához a beszédfelismerés finomhangolásához. Egyéni hang használatával egyedi, márkahoz igazított hangokat hozhat létre a hangkimenethez. További információ : A Voice Live bemenetének és kimenetének testreszabása .
- Rugalmas generatív AI-modelllehetőségek: Több modell közül választhat, például a GPT-5, a GPT-4.1, a GPT-4o, a Phi és a beszélgetési követelményeknek megfelelően.
-
Speciális beszélgetési funkciók:
- Zajelnyomás: Csökkenti a környezeti zajt a tisztább kommunikáció érdekében.
- Visszhang törlés: Megakadályozza, hogy az ügynök a saját válaszait vegye fel.
- Robusztus megszakításészlelés: Biztosítja a beszélgetések során előforduló megszakítások pontos felismerését.
- Speciális fordulóvégi észlelés: Lehetővé teszi a természetes szüneteket anélkül, hogy idő előtt interakciókat zárnál be.
- Avatar-integráció: Szabványos vagy testreszabható avatárokat biztosít a hangkimenettel szinkronizálva, és vizuális identitást kínál a hangügynökök számára.
- Függvényhívás: Engedélyezi a külső műveleteket, az eszközök használatát és a megalapozott válaszokat a VoiceRAG-mintával.
API-tervezés és kompatibilitás
A Voice Live API az Azure OpenAI Realtime API-val való kompatibilitásra lett tervezve. A támogatott valós idejű események többnyire megfelelnek az Azure OpenAI Realtime API-eseményeknek, néhány kivételt a Voice Live API útmutatójában leírtak szerint.
A Voice Live API-ra jellemző funkciók opcionálisak és additívak. Az Azure Speech szolgáltatást a Foundry Tools képességeihez, mint például a zajelnyomás, a visszhanglemondás és a speciális végpontfelismerés, adhatja hozzá anélkül, hogy módosítaná a meglévő architektúrát a meglévő alkalmazásokban.
Az API-t WebSocket-események támogatják, ami lehetővé teszi a kiszolgálók közötti egyszerű integrációt. A háttér- vagy középszintű szolgáltatás websocketeken keresztül csatlakozik a Voice Live API-hoz. A WebSocket-üzeneteket közvetlenül használhatja az API-val való interakcióhoz.
Támogatott modellek és régiók
A hangügynök intelligenciájának használatához rugalmasságot és választási lehetőségeket kínál a GPT-Realtime, a GPT-5, a GPT-4.1, a Phi és a további lehetőségek közötti generatív AI-modellben. A különböző generatív AI-modellek különböző képességeket, intelligenciaszinteket, a következtetés sebességét és késését és költségeit biztosítják. Attól függően, hogy mi számít a leginkább az ön vállalkozásának és használati esetének, válassza ki az igényeinek leginkább megfelelő modellt.
A natívan támogatott modellek teljes mértékben felügyeltek, így nem kell modelleket üzembe helyeznie, nem kell foglalkoznia a kapacitástervezéssel vagy az átviteli sebesség kiosztásával. Használja a szükséges modellt, és a Voice Live API gondoskodik a többiről.
A Voice Live API a következő modelleket támogatja. A támogatott régiókról az Azure Speech szolgáltatás régióiban olvashat.
| Modell | Leírás |
|---|---|
gpt-realtime-1.5 |
GPT valós idejű 1.5 + lehetőség Azure szövegfelolvasó hangok használatára, beleértve az egyéni hangot is audiohoz. |
gpt-realtime-1.5-datazone |
GPT 1.5 valós idejű, standard adatkezelési zónás feldolgozással. A kérések és válaszok az erőforrásrégióhoz társított adatzónán belül maradnak. Támogatja Azure szövegfelolvasást, beleértve az egyéni hangokat is. |
gpt-realtime |
GPT valós idejű + lehetőség az Azure szöveg-beszéd hangok használatára, beleértve az egyéni hangot is. |
gpt-realtime-datazone |
GPT valós idejű Data Zone Standard feldolgozással. A kérések és válaszok az erőforrásrégióhoz társított adatzónán belül maradnak. Támogatja Azure szövegfelolvasást, beleértve az egyéni hangokat is. |
gpt-realtime-mini |
GPT mini valós idejű + lehetőség az Azure-beli szövegek beszédhangokhoz való használatára, beleértve az egyéni hanghangot is. |
gpt-4o |
GPT-4o + hangbemenet az Azure beszédfelismerés segítségével szövegre, valamint hangkimenet az Azure szövegfelolvasó hangjaival, beleértve az egyéni hangokat is. |
gpt-4o-mini |
GPT-4o mini + audio bemenet az Azure speech to text rendszerén keresztül + audio kimenet az Azure text to speech hangokkal, beleértve az egyéni hangokat is. |
gpt-4.1 |
GPT-4.1 + hangbemenet azure-beli beszédről szövegre + hangkimenet azure-beli szövegről beszédhangra, beleértve az egyéni hangokat is. |
gpt-4.1-mini |
GPT-4.1 mini + hangbemenet az Azure Speech-to-Text szolgáltatáson keresztül + hangkimenet az Azure Text-to-Speech hangjain keresztül, beleértve az egyéni hangokat is. |
gpt-4.1-nano |
GPT-4.1 nano + hangbemenet az Azure beszédfelismerésen keresztül + hangkimenet az Azure beszédszintézis-hangjain keresztül, beleértve az egyéni hangot is. |
gpt-5.6-terra |
GPT-5.6 Terra + hangbemenet Azure beszédfelismeréssel + hangkimenet Azure szövegfelolvasási hangokkal, beleértve az egyéni hangokat is. |
gpt-5.4 |
GPT-5.4 + hangbemenet az Azure Speech to Texten keresztül + hangkimenet az Azure Text to Speech hangjaival, beleértve az egyéni hangot is. |
gpt-5.2 |
GPT-5.2 + hangbemenet az Azure beszédfelismerési szolgáltatásán keresztül + hangkimenet az Azure szövegfelolvasó hangjaival, beleértve az egyéni hangot is. |
gpt-5.1 |
GPT-5.1 + hangbemenet az Azure speech-to-text szolgáltatásán keresztül + hangkimenet az Azure text-to-speech hangjaival, beleértve az egyéni hangot is. |
gpt-5 |
GPT-5 + hangbemenet az Azure Speech to Text szolgáltatáson keresztül + hangkimenet az Azure Text to Speech hangjain keresztül, beleértve az egyéni hangot is. |
gpt-5-mini |
GPT-5 mini + hangbemenet Azure Speech to Text szolgáltatással + hangkimenet Azure Text to Speech szolgáltatással, beleértve az egyéni hangokat is. |
gpt-5-nano |
GPT-5 nano + hangbemenet azure-beli beszédből szövegbe + hangkimenet azure-beli szövegről beszédhangra, beleértve az egyéni hangokat is. |
phi4-mm-realtime (előzetes verzió) |
Phi4-mm + hangkimenet az Azure szöveg-beszédhangokon keresztül, beleértve az egyéni hangokat is. |
azure-realtime |
Azure valós idejű + dedikált azure-realtime-native hangok hanganyaghoz. |
Note
A modelleket gpt-5.5gpt-5.4-minigpt-5.4-nano a Voice Live támogatja és teszteli, de nincsenek előre üzembe helyezve. A használatukhoz helyezze üzembe őket a Foundry erőforrásában, és csatlakozzon a Hozd saját modelled (BYOM) használatával.
A Voice Live API összehasonlítása más beszédfelolvasási megoldásokkal
A Voice Live API alternatívát jelent több összetevő, például a beszédfelismerés, a generatív AI és a szövegfelolvasás vezénylésére. Ez a vezénylés összetett és időigényes lehet, ami jelentős mérnöki erőfeszítést igényel az integrációhoz és a karbantartáshoz. A Voice Live API leegyszerűsíti ezt a folyamatot azáltal, hogy egyetlen felületet biztosít ezeknek az összetevőknek. A fejlesztők az alapul szolgáló infrastruktúra kezelése helyett az alkalmazások létrehozására összpontosíthatnak.
A követelmények teljesítéséhez létrehozhatja saját megoldását, vagy használhatja a Voice Live API-t. Ez a táblázat a következő megközelítéseket hasonlítja össze:
| Alkalmazáskövetelmény | Csináld magad | Voice Live API |
|---|---|---|
| Széles területi lefedettség nagy pontossággal (hangbemenet) | ✅ | ✅ |
| Márka- és karakter-személyiség fenntartása (hangkimenet) | ✅ | ✅ |
| Beszélgetési fejlesztések | ❌ | ✅ |
| Generatív AI-modellek kiválasztása | ✅ | ✅ |
| Látványos megjelenés szöveg-beszéd avatárral | ✅ | ✅ |
| Alacsony mérnöki költség | ❌ | ✅ |
| A végfelhasználó által érzékelt alacsony késés | ❌ | ✅ |
Árképzés
A Voice Live API díjszabása 2025. július 1-jén lép érvénybe.
A Voice Live API díjszabása a használt generatív AI-modell alapján rétegzett (Pro, Basic és Lite). Nem jelöl ki szintet. Generatív AI-modellt választ, és a megfelelő díjszabás érvényes:
| Tarifakategória | Modellek |
|---|---|
| Voice Live pro |
gpt-realtime, gpt-realtime-datazone, gpt-realtime-1.5, gpt-realtime-1.5-datazonegpt-4o, gpt-4.1, gpt-5, , gpt-5-chatgpt-5.6-terra |
| Alapszintű Voice Live |
gpt-realtime-mini, gpt-4o-mini, gpt-4.1-minigpt-5-mini |
| Voice Live lite |
gpt-5-nano, phi4-mm-realtime |
Ha egyéni beszédet, egyéni hangot vagy egyéni avatart használ a beszédbemenethez vagy -kimenethez, a modell betanításáért és üzemeltetéséért külön díjat számítunk fel. Részletekért tekintse meg a Speech Services díjszabását .
Fontos
Az egyéni hanghozzáférés a jogosultsági és használati feltételek alapján korlátozott . Hozzáférés kérése a beviteli űrlapon.
Fontos
Az egyéni szöveg és a beszéd avatarhoz való hozzáférés a jogosultsági és használati feltételek alapján korlátozott . Hozzáférés kérése a beviteli űrlapon.
Példa díjszabási forgatókönyvekre
Íme néhány példa díjszabási forgatókönyvek, amelyek segítenek megérteni a Voice Live API díjának módját:
Szcenárió 1
Egy szabványos Azure Speech-bemenettel, GPT-4.1-sel, egyéni Azure Speech-kimenettel és egyéni avatarral készült ügyfélszolgálati ügynök.
A Voice Live Pro díjszabása szerint a következőért kell fizetnie:
- Szöveg
- Hang az Azure Speech használatával – Standard
- Hang az Azure Speechdel – Egyéni
A következő betanítási és modellüzemeltetési költségek külön kerülnek felszámításra:
- Egyéni hang – professzionális
- Egyéni avatar
Forgatókönyv 2
Tanulási ügynök készült standard Azure Speech-kimenettel és gpt-realtime natív hangbemenettel.
A Voice Live Pro díjszabása szerint a következőért kell fizetnie:
- Szöveg
- Natív hang
gpt-realtime - Hang az Azure Speech használatával – Standard
3. forgatókönyv
Egy natív hangbemenettel és szabványos Azure Speech-kimenettel és standard avatarral gpt-realtime-mini készült tehetséginterjú-ügynök.
Önt a Voice Live alapdíja alapján terhelik az alábbiakért:
- Szöveg
- Natív hang
gpt-realtime-mini - Hang az Azure Speech használatával – Standard
Az alábbiakért külön kell fizetnie:
- Szöveg–beszéd avatar (standard)
4. forgatókönyv
Egy autós asszisztens, amely phi4-mm-realtime és Azure egyedi hanggal készült.
Az alábbiakért a Voice Live lite díjszabása szerint kell fizetnie:
- Szöveg
- Natív hang
phi4-mm-realtime
A Voice Live Pro díjszabása szerint a következőért kell fizetnie:
- Hang az Azure Speechdel – Egyéni
A következő betanítási és modellüzemeltetési költségek külön kerülnek felszámításra:
- Egyéni hang – professzionális
Tokenek használata és költségbecslése
A tokenek azok az egységek, amelyeket a generatív AI-modellek használnak a bemenet feldolgozásához és a kimenet létrehozásához.
A hanghossz alapján megbecsülheti a különböző modellcsaládok tokenhasználatát a Voice Live API-val. Az alábbi token-számítások minden modellcsaládra vonatkoznak.
| Modellcsalád | Bemeneti hang (tokenek másodpercenként) | Kimeneti hang (tokenek másodpercenként) |
|---|---|---|
| Azure OpenAI-modellek | ~10 szóegység | ~20 token |
| Phi-modellek | ~12,5 token | ~20 token |
A gyorsítótárazott hang- és szövegbevitelekért is díjat számítunk fel, beleértve a kérdés és a beszélgetések kontextusát is.
Kapcsolódó tartalom
- További információ a Voice Live API használatáról
- A Voice Live API gyorsútmutatójának kipróbálása
- A Voice Live API referenciájának megtekintése