收集使用者輸入

隨著 Azure 通訊服務 Call Automation Recognize 動作發行,開發人員現在可以強化其 IVR 或聯絡中心應用程式,以辨識使用者輸入。 最常見的辨識情境之一是為使用者播放訊息,提示他們提供回應;應用程式辨識到回應後,會執行對應的動作。 來電者的輸入可透過多種方式接收,包括 DTMF (透過來電裝置上的數字鍵輸入)、語音,或 DTMF 與語音的組合。

使用語音轉文字進行語音辨識

Azure Communications Services 與 Foundry Tools 的整合,允許你透過「識別」動作即時分析音訊,將口語轉錄成文字。 Microsoft 預設使用通用語言模型作為基礎模型,該模型以 Microsoft 擁有的資料訓練,並反映常用的口語語言。 此模型已針對各種常見領域的方言與語音特徵進行預先訓練。 如需支援語言的詳細資訊,請參閱 Speech 服務的語言與語音支援

DTMF

雙音多頻 (DTMF) 辨識是理解電話按下數字時所產生音調/聲音的程序。 接收端設備會監聽特定音調,並將其轉換為命令。 這些命令通常用於 IVR 情境中的選單導覽以表示使用者意圖;在某些情況下,也可用於擷取使用者需要透過電話鍵盤提供的重要資訊。

DTMF 事件及其對應音調

事件 音調
0
1
2
3
4
5
6 六個
7
8 八個
9
A A
B B
C C
D D
* 星號
#

一般使用案例

Recognize 動作可用於多種原因,以下是開發人員可在其應用程式中使用 Recognize 動作的一些範例。

透過自助式提示改善使用者體驗

  • 使用者可以控制通話 - 透過啟用輸入辨識,您可讓來電者在 IVR 選單中導覽並提供資訊,以協助解決其問題。
  • 收集使用者資訊 - 透過啟用輸入辨識,您的應用程式可向來電者收集輸入。 這些資訊可能包含帳戶號碼、信用卡資訊等。
  • 轉錄來電者回應 - 透過語音辨識,您可以收集使用者輸入並將音訊轉錄為文字,再進行分析以執行特定商務動作。

中斷音訊提示

使用者可以退出 IVR 選單並與真人專員通話 - 透過 DTMF 中斷,您的應用程式可允許使用者中斷 IVR 選單流程,並能與真人專員交談。

在通話中收集使用者輸入的範例架構

顯示 Recognize AI Action 範例架構的圖表。

在通話中收集使用者輸入的範例架構

識別動作

已知的限制

  • 不支援 In-band DTMF,請改用 RFC 2833 DTMF。
  • 文字轉換語音 (TTS) 的文字提示最多支援 4,000 個字元;如果您的提示超過此限制,我們建議在以文字轉換語音為基礎的播放動作中使用 SSML。
  • 啟用錄製時,會記錄 1:1 通話的語音輸入,但不會記錄在群組通話中。
  • 針對超過語音服務配額限制的案例,您可以遵循此處所述的步驟來要求提高此限制。

後續步驟