Configurar agentes de voz básicos

Note

As funcionalidades deste artigo são suportadas pela estrutura padrão, que utiliza as opções de faturação descritas em Licenciamento de agentes suportados pela estrutura padrão. Aprenda a aceder a funcionalidades padrão nos agentes e fluxos de agentes padrão do Access.

Este artigo descreve como configurar agentes básicos de resposta interativa de voz (IVR) para utilização em aplicações de Centro de Contacto Dynamics 365. Normalmente, agentes de voz básicos usam orquestração clássica. Saiba mais em Integrar um agente com voz no Centro de Contacto Dynamics 365.

Ativar voz básica

Um agente com capacidade de voz é diferente de um agente baseado em chat. O agente ativado por voz inclui tópicos específicos do sistema para gerir cenários de interação por voz. Um agente baseado em chat utiliza a modalidade Texto . Um agente habilitado por voz utiliza a modalidade de Fala e DTMF . As duas modalidades são mutuamente exclusivas.

  1. Vá à página de Definições do seu agente e selecione Voz.

  2. Selecione Ativar voz. Fazer com que a voz seja a modalidade padrão para criar e atualizar dentro dos tópicos é selecionada por defeito.

  3. Selecione Básico se planeia usar tópicos e orquestração clássica para o seu agente. Saiba mais em Escolha como controlar a conversa e Escolha como lidar com a fala.

Note

Selecione Voz em tempo real se planeia usar orquestração generativa para o seu agente.

Quando ativa Ativar Voz e Tornar a Voz a modalidade padrão para criar e atualizar dentro dos tópicos, o seu agente recebe as seguintes atualizações:

  • A capacidade de criar funcionalidades de voz ao mudar de Texto para Voz e DTMF.
  • Os tópicos do sistema de voz Deteção de Silêncio, Fala não reconhecida e Pressão desconhecida do teclado de discagem são adicionados automaticamente para lidar com cenários relacionados com a voz.
  • Aumente a precisão com os dados do agente (ativado por predefinição), o que melhora a precisão do reconhecimento de voz.
  • O fluxo de agente existente não é alterado (como o tópico Menu Principal para iniciar conversas com acionadores DTMF mapeados).

Important

  • A definição Ativar voz só altera as capacidades de autoria de voz, não a definição do canal. Ative o canal Telefonia para um agente com capacidade total de voz.
  • Além disso, definir Ativar voz num agente que não estava originalmente configurado para funcionalidades de voz significa que o agente não tem o tópico do Menu Principal (pré-visualização ). Tem de recriar esse tópico, se for necessário.
  • Se não conseguir ativar Ativar voz, verifique o ambiente Power Platform que aloja o seu agente e certifique-se de que Obter novas funcionalidades antecipadamente está desligado nesse ambiente. Para obter mais informações, consulte Não é possível ativar Otimizar para voz.
  • A definição Aumentar a precisão com dados do agente só funciona quando o agente com voz usa frases de gatilho. Se o agente estiver configurado para usar descrições de tópicos, não há qualquer efeito na precisão.

Desligue a otimização para voz

Desative Ativar voz na criação de agentes se não utilizar o canal Telefonia. Depois de desligar Ativar voz, vê as seguintes alterações:

  • Sem criação de agentes para funcionalidades de voz, como DTMF e intervenção.
  • A modalidade de texto está predefinida.
  • Nenhuma melhoria ao reconhecimento de voz, uma vez que não há reconhecimento de voz.
  • Não existem tópicos do sistema de voz nem tópico DTMF global.

    Note

    Alguns tópicos poderão reportar erros durante a publicação se ainda referenciarem o tópico DTMF (agora desativado).

  • Não há alterações no fluxo do agente nem na definição do canal, uma vez que desativar a otimização não remove o canal de Telefonia.
  • Ativar ou desligar Ativar voz só entra em vigor quando publicares o teu agente. Se o ativar ou desativar acidentalmente, e o agente alternar entre as modalidades, ainda vai a tempo de corrigir isso.

Important

Se os seus canais de Telefonia estiverem ativados, desativar a opção Ativar voz pode fazer com que o seu agente deixe de funcionar corretamente, já que todos os acionadores DTMF são desativados automaticamente.

Usar a voz como o modo de criação principal

Quando ativas Ativar voz, a opção Tornar voz a modalidade padrão para criar e atualizar dentro dos tópicos ativa-se automaticamente. Se desativares esta opção, certifica-te de selecionar a modalidade de Fala e DTMF em cada nó onde queres adicionar mensagens de voz.

Disponibilidade de mensagens

Utilizar a modalidade de texto ou voz pode afetar o seu canal de forma diferente.

Modalidade de texto Modalidade de fala Texto do agente e canal de voz
Mensagem disponível Mensagem vazia Mensagem disponível
Mensagem vazia Mensagem disponível Mensagem não disponível

Reconhecimento de voz automático personalizado

Agentes com voz para um domínio específico, como médico ou financeiro, podem encontrar utilizadores que utilizam termos financeiros ou jargão médico. Alguns termos e jargões são difíceis de o agente ativado por voz converter da fala em texto.

Note

A definição Aumentar a precisão com dados do agente só funciona quando o agente com voz usa frases de gatilho. Se o agente estiver configurado para usar descrições de tópicos, não há qualquer efeito na precisão.

Para garantir que a entrada de fala é reconhecida com precisão, melhore o reconhecimento de voz:

  1. Selecione Definições>Voz no seu agente.

  2. Selecione Aumentar a precisão com dados do agente para ativar as predefinições de reconhecimento de voz automáticas personalizadas do agente.

  3. Selecione Guardar para consolidar as alterações.

  4. Publique o seu agente para ver as novas alterações.

Referência de opções de voz ao nível do agente

Utilize as definições de Voz para configurar tempos de espera para várias funcionalidades relacionadas com voz.

Para fazer alterações às opções de tempo limite ao nível do agente:

  1. Vá à página de Definições do seu agente e selecione Voz.

  2. Revê as definições e faz as alterações que quiseres.

  3. Selecione Guardar para consolidar as alterações. As suas definições ajustadas tornam-se o padrão para os tópicos que cria neste agente.

Definições ao nível do agente

A tabela a seguir lista cada opção e a forma como se relaciona com as definições ao nível do nó.

Secção de nível de agente ativada por voz Setting Description Valor predefinido Sobreposição ao nível do nó
DTMF Tempo limite entre dígitos Tempo máximo em milissegundos permitido enquanto se espera pela próxima introdução da tecla DTMF. Aplica-se a entrada DTMF com vários dígitos apenas quando os utilizadores não atingem o comprimento máximo permitido para a entrada. 3.000 ms Nó de pergunta com propriedades de voz para Entrada DTMF de vários dígitos
DTMF Tempo limite de finalização Duração máxima em milissegundos para esperar por uma tecla de terminação DTMF. O limite aplica-se quando o utilizador atinge o comprimento máximo de entrada e não pressiona a tecla de cessação. Aplica-se apenas à entrada DTMF de vários dígitos.

Depois de o tempo limite expirar e a tecla DTMF de terminação não for recebida, o agente termina o reconhecimento e devolve o resultado obtido até esse momento.

Se definido como "continuar sem esperar", o agente não aguarda a tecla de terminação. O agente retorna imediatamente após o utilizador inserir o comprimento máximo.
2.000 ms Nó de pergunta com propriedades de voz para Entrada DTMF de vários dígitos
Deteção de silêncio Tempo limite para a deteção de silêncio Silêncio máximo permitido em milissegundos enquanto se espera a entrada do utilizador. O limite aplica-se quando o agente não deteta nenhuma entrada de utilizador. O padrão é sem tempo de silêncio. O agente espera indefinidamente pela entrada do utilizador.

A deteção de silêncio da voz mede o período após o fim da fala.
Sem tempo limite de silêncio Nó de pergunta com propriedades de voz para Entrada DTMF de vários dígitos

Tópico de sistema (propriedades do acionador de deteção de silêncio) para Configurar deteção de silêncio e tempos limite
Recolha de fala Tempo limite final de expressão O limite aplica-se quando o utilizador faz uma pausa durante ou após a fala. Se a pausa for superior ao tempo limite, o agente assume que o utilizador terminou de falar.

O valor máximo para o timeout no fim da enunciação é 3.000 ms. Qualquer valor acima de 3.000 ms reduz-se para 3.000 ms.
1.500 ms Nó de pergunta com propriedades de voz
Recolha de fala Tempo limite do reconhecimento de voz Determina quanto tempo o agente permite a intervenção do utilizador assim que este começa a falar. O valor padrão é 12.000 milissegundos (cerca de 12 segundos). Sem tempo limite de reconhecimento, o tempo é infinito. O agente reinicia a pergunta. Se não houver resposta, a voz está para além do Tempo limite de reconhecimento de voz. 12.000 ms Nó de pergunta com propriedades de voz
Latência das mensagens Atraso no envio da mensagem Determina quanto tempo o agente aguarda antes de apresentar a mensagem de latência após o início de um pedido de operação em segundo plano. O tempo é definido em milissegundos. 500 ms Propriedades do nó de ação para operação de longa duração
Latência das mensagens Tempo mínimo de reprodução A mensagem de latência é reproduzida por um período mínimo de tempo, mesmo que a operação de fundo seja concluída enquanto a mensagem está a ser reproduzida. O tempo é definido em milissegundos. 5.000 ms Propriedades do modo de ação para operação de longa duração
Sensibilidade da voz Sensitivity Controla como o sistema equilibra a deteção de voz e o ruído de fundo. Diminua a sensibilidade para ambientes ruidosos, espaços públicos e operações sem mãos. Aumente a sensibilidade para ambientes sossegados, utilizadores de fala suave ou deteção de comandos de voz. A predefinição é 0,5. 0.5 Não há substituições de configuração ao nível do nó para este controlo.

Note

  • Agentes com frases de acionamento longas e entidades de maior dimensão demoram mais tempo a ser publicados.
  • Se vários utilizadores publicarem o mesmo agente ao mesmo tempo, a sua ação de publicar pode ser bloqueada. Publique novamente o agente depois de os outros acabarem de o editar.

Saiba mais em Conceitos-chave - Publique e implemente o seu agente.

Ativar barge-in

Quando permite o barge-in, os utilizadores do seu agente podem interrompê-lo. Esta funcionalidade é útil quando o utilizador do agente não precisa de ouvir a mensagem completa. Por exemplo, os chamadores poderão já conhecer as opções do menu, porque as ouviram no passado. Com o barge-in ativado, o utilizador do agente pode introduzir a opção que quiser, mesmo que ainda não tenha terminado de listar todas as opções.

Quando desligar o barge-in

Desligue o barge-in para mensagens como:

  • Uma mensagem que atualizaste recentemente.
  • Uma mensagem de conformidade que não deve ser interrompida.
  • A primeira mensagem do agente, para garantir que os utilizadores do agente estão cientes de informações novas ou essenciais.

Specifications

  • A funcionalidade de interrupção suporta interrupções baseadas em DTMF e em voz por parte do utilizador do agente.

  • Podes controlar a entrada com cada mensagem num só lote. Coloque os nós barge-in-disabled em sequência antes de cada nó onde a interrupção é permitida. Caso contrário, o sistema é tratado barge-in-disabled como uma mensagem de permitir a entrada.

    Captura de ecrã dos posicionamentos de barge-in e barge-in-disabled em nós de mensagem.

    Quando uma fila de lote termina, a configuração automática de entrada de barge-in reinicia-se para o lote seguinte. A bandeira de entrada em cada mensagem subsequente controla-o. Pode colocar nós desabilitados de interrupção à medida que a sequência começa novamente.

Tip

Se nós Mensagem consecutivos forem seguidos por um nó Pergunta, as mensagens de voz para estes nós são definidas como um conjunto. Um processo começa com um nó de mensagem e termina no nó de questão, que espera pela entrada do utilizador.

Evite desativar o barge-in para mensagens longas, especialmente se esperar que os agentes interajam frequentemente com ele. Se o utilizador do agente já conhece as opções do menu, deixe-o encaminhar-se sozinho para onde pretende ir.

Configurar a interrupção

  1. Selecione um nó Mensagem ou Pergunta e defina a modalidade desejada para Fala & DTMF.

  2. Selecione os três pontos (...) do nó e depois selecione Propriedades.

    • Para os nós Mensagem, o painel Propriedades da atividade Enviar abre-se na lateral da área de criação.

      Selecione Permitir interrupções.

    • Para os nós de Pergunta , o painel Propriedades da pergunta abre-se e, em seguida, pode selecionar Voz.

      Nas propriedades de Voz , selecione Permitir interrupção.

  3. Guardar o tema.

Configurar a deteção de silêncio e os tempos limite

A deteção de silêncio permite-lhe configurar quanto tempo o agente espera pela entrada do utilizador e a ação que toma se o agente não receber qualquer entrada. A deteção de silêncio é mais útil na resposta a uma pergunta ao nível do nó ou quando o agente aguarda uma frase de ativação para iniciar um novo tópico.

Podes configurar os tempos de espera padrão para tópicos ao nível do agente.

Configure o comportamento de deteção de silêncio quando um agente espera por uma resposta a uma pergunta

Para substituir o comportamento predefinido de deteção de silêncio num nó Pergunta:

  1. Selecione os três pontos (...) do nó e depois selecione Propriedades. O painel Propriedades da pergunta abre-se.

  2. Selecionar Voz. O painel de propriedades de Voz aparece.

  3. Para o tempo limite da deteção de silêncio, selecione a opção que pretende:

    • Usar definição do agente: Usar a definição global para deteção de silêncio.
    • Desativar para este nó: Aguardar indefinidamente por uma resposta.
    • Personalize em milissegundos: Aguarde o tempo especificado antes de repetir a pergunta.
  4. Para Quantas novas solicitações em caso de silêncio, selecione o comportamento pretendido:

    • Repete até 2 vezes
    • Não repitas
    • Repete uma vez
  5. Opcionalmente, configure uma mensagem de reprompt.

  6. Para a ação de recurso, selecione o comportamento que deseja:

    • Desliga: Termina a conversa. É o comportamento padrão.
    • Escalar: Redirecione o utilizador para o tópico de sistema Escalar.
    • Definir variável como valor: defina a variável de saída como um valor e passe para o próximo nó. Introduza ou selecione o valor que pretende em Valor padrão da entidade.
    • Definir variável como vazia (sem valor): limpe a variável de saída e passe para o próximo nó. Pode usar um Nó de condição posteriormente para verificar se a variável possui um valor.
    • Redirecionar para um tema: Redirecionar o utilizador para o tema especificado.
  7. Opcionalmente, expanda Avançado e ajuste as seguintes definições:

    • Tempo limite para fim de enunciado: Quanto tempo o agente espera depois do usuário terminar de falar.
    • Timeout de reconhecimento de voz: Quanto tempo o agente concede ao utilizador assim que este começa a responder.

Configure o comportamento de deteção de silêncio quando um agente espera por uma frase de gatilho

Para configurar o comportamento de deteção de silêncio quando o seu agente espera por uma frase de gatilho:

  1. Vá para o tópico do sistema Deteção de silêncio.

  2. Selecione os três pontos () do nó Trigger. É apresentado o painel Propriedades de silêncio detetado.

  3. Selecione o comportamento que deseja:

    • Usar definição do agente: Usar a definição global para deteção de silêncio.
    • Desativar para este nó: Esperar indefinidamente por uma frase de ativação.
    • Personalize em milissegundos: Aguarde o tempo especificado antes de encerrar a conversa.

Adicionar uma mensagem de latência para operações de longa duração

Para operações de back-end longas, o seu agente pode enviar uma mensagem aos utilizadores para notificá-los sobre os processos mais longos. Os agentes num canal de mensagens também podem enviar uma mensagem de latência.

  • Reprodução de áudio de mensagens de latência: Continua a repetir-se até a operação terminar.
  • Mensagem de latência no chat: Enviada apenas uma vez quando a latência especificada é atingida.

Se quiser que o seu agente repita uma mensagem depois de ativar um fluxo do Power Automate:

  1. Aceda ao tópico que chama o seu fluxo do Power Automate.

  2. Selecione os três pontos (...) do nó Ação e depois selecione Propriedades. O painel Propriedades da ação abre-se.

  3. Selecione Enviar uma mensagem.

  4. Na secção Mensagem, introduza aquilo que quer que o agente diga. Use SSML para modificar o som da mensagem. O agente repete a mensagem até que o fluxo seja concluído.

  5. Opcionalmente, ajuste quanto tempo o agente deve esperar antes de repetir a mensagem e o tempo mínimo de reprodução da mensagem.

Configurar o encerramento de chamadas

Para configurar o seu agente para terminar a chamada e desligar, adicione um novo nó (+) e selecione Gestão de Tópicos>Terminar conversa.

Captura de ecrã de um novo menu de nó com a Gestão de tópicos e a opção Terminar conversa realçadas.

Detetar atendedores

Pode configurar o seu agente para detetar um atendedor automático e deixar uma mensagem para o utilizador do agente depois de a mensagem do utilizador do agente terminar. O tópico do sistema de Deteção de Secretária Eletrônica permite-lhe criar uma mensagem personalizada para cenários em que o seu agente encontra o correio de voz de um utilizador. No nó Message, defina a mensagem a deixar quando o agente detetar um atendedor de chamadas.

Captura de ecrã do tópico Atendedor de Chamadas Detetado, destacando o nó de mensagem.

Formatar a síntese de voz com SSML

Use a linguagem de marcação de síntese de voz (SSML) para alterar a forma como o agente soa quando lê mensagens em voz alta. Por exemplo, pode alterar o tom ou a frequência da linguagem falada, a velocidade e o volume.

SSML usa etiquetas para incluir o texto que deseja modificar, semelhante a HTML. Use as seguintes etiquetas no Copilot Studio:

Etiqueta SSML Description Ligação para a documentação do serviço de voz
<audio src="_URL to an audio file_"/> Adicione o URL a um ficheiro de áudio dentro da etiqueta. O ficheiro tem de estar acessível pelo utilizador do agente. Adicionar áudio gravado
<break /> Insira pausas ou interrupções entre palavras. Insira opções de interrupção na etiqueta. Adicionar uma interrupção
<emphasis> O texto que pretende modificar</emphasis> Adicione níveis de stress a palavras ou frases. Adicione opções de ênfase na etiqueta de abertura. Adicione a etiqueta de encerramento após o texto que pretende modificar. Ajustar opções de ênfase
<prosody> O texto que pretende modificar</prosody> Especifique as alterações de tom, contorno, alcance, taxa e volume. Adicione opções de prosódia na etiqueta de abertura. Adicione a etiqueta de encerramento após o texto que pretende modificar. Ajustar opções de prosódia
<lang xml:lang="xx-XX"> O texto que pretende modificar</lang> Ajuste o idioma de fala dentro da mesma mensagem ao usar uma voz neural multilingue. Ajustar os idiomas de fala

Note

Ao usar a <audio src="_URL to an audio file_"/> etiqueta, se armazenar a URL numa variável, codifique a URL antes de a inserir na tag áudio src SSML na mensagem. Use a função EncodeHTML Power Fx para codificar a URL ao atribuí-la a uma variável na ação de atribuição.

Captura de ecrã de uma mensagem de voz com etiquetas SSML adicionadas.

Encontrar e utilizar uma etiqueta

SSML usa etiquetas para incluir o texto que deseja modificar, como HTML.

Use as seguintes etiquetas no Copilot Studio:

  1. Selecione um nó de Mensagem ou de Pergunta. Altere o modo para Fala e DTMF.

  2. Selecione o menu Etiquetas SSML e selecione uma etiqueta.

    A caixa de mensagem é preenchida com a etiqueta. Se já tiver texto na caixa de mensagem, o código da etiqueta será anexado ao final da mensagem.

  3. Envolva o texto que pretende modificar com as etiquetas de abertura e encerramento. Pode combinar várias etiquetas e personalizar partes individuais da mensagem com etiquetas individuais.

Tip

Pode introduzir manualmente etiquetas SSML que não aparecem no menu auxiliar. Saiba mais em Melhorar a síntese com a Linguagem de Marcação de Síntese de Fala.

Transferir uma chamada para um representante ou número de telefone externo

Pode configurar o agente para transferir a chamada para um número de telefone externo. Os agentes do Copilot Studio suportam transferência cega para um número de telefone PSTN e para o número de roteamento direto.

Note

Também pode usar os X-headers SIP para gerir transferências de chamadas. Saiba mais em Configurar SIP X-headers para agentes ativados por voz.

Para transferir para um número de telefone externo:

  1. No tópico que pretende modificar, adicione um novo nó (+). No menu do nó, selecione Gestão de tópicos e, em seguida, Transferir a conversa.

  2. Em Tipo de transferência, selecione Transferência de número de telefone externo e introduza o número de transferência.

  3. (Opcionalmente) adicionar um cabeçalho de Informação Utilizador-a-Utilizador (UUI) do Protocolo de Iniciação de Sessão (SIP) à chamada telefónica.

    Este cabeçalho é uma sequência de pares key=value, sem espaços nem carateres especiais, apresentada para ser lida por sistemas externos.

    1. Selecione os três pontos (...) do nó e depois selecione Propriedades. O painel Transferir propriedades da conversa abre-se.

    2. Em Cabeçalho UUI SIP, introduza a informação que pretende enviar na transferência de chamada. As variáveis não são suportadas ao transferir para um número de telefone externo.

    Caution

    Apenas os primeiros 256 caracteres da cadeia são enviados. O cabeçalho apenas aceita números, letras, sinais de igual a (=) e pontos-e-vírgula (;). Todos os outros carateres, incluindo espaços, chavetas e parênteses, ou fórmulas, não são suportados e podem fazer com que a transferência falhe.

Tip

Inclua um + no número de telefone para indicar o código do país correspondente.

A transferência de saída com SIP UUI para o número de telefone de destino tem de usar o encaminhamento direto. Os números de telefone da Rede telefónica pública comutada (PSTN) não suportam transferências de cabeçalho SIP UUI.

Para transferir para um representante, consulte Acionadores explícitos.

Usar variáveis de voz

Os agentes do Copilot Studio suportam variáveis. Pode usar variáveis pré-definidas ou criar variáveis personalizadas.

Note

Um agente com voz no Copilot Studio suporta variáveis de contexto. Estas variáveis ajudam-no a integrar as conversas dos seus agentes com o Dynamics 365 Contact Center ao transferir uma chamada.

Para mais informações sobre variáveis de contexto em Dynamics 365 Contact Center, consulte Variables de contexto para bots Copilot Studio.

Esta integração suporta estes cenários com as seguintes variáveis quando transfere:

Variable Tipo Description
System.Activity.From.Name Cordão O ID do chamador do utilizador do agente
System.Activity.Recipient.Name Cordão O número usado para chamar ou ligar-se ao agente
System.Conversation.SipUuiHeaderValue Cordão Valor do cabeçalho SIP ao transferir através de um número de telefone de encaminhamento direto
System.Activity.UserInputType Cordão Se o utilizador do agente usou DTMF ou voz na conversa
System.Activity.InputDTMFKey Cordão A entrada DTMF em bruto do utilizador-agente
System.Conversation.OnlyAllowDTMF booleano A voz ignora a entrada de voz quando definida como true
System.Activity.SpeechRecognition.Confidence Número O valor de confiança (entre 0 e 1) do último evento de reconhecimento de voz
System.Activity.SpeechRecognition.MinimalFormattedText Cordão Resultados de reconhecimento de voz (como texto bruto) antes de Copilot Studio aplicar o seu modelo dedicado de compreensão linguagem natural

Note

Quando usar a variável System.Conversation.OnlyAllowDTMF definida como true, certifique-se de que utiliza a seguinte configuração:

  • Todos os nós de Mensagem que não esperam entrada do utilizador têm o barge-in desligado, ou são seguidos por nós de Pergunta com mapeamentos DTMF apropriados.
  • Evite enviar mensagens informativas entre nós Pergunta quando o modo exclusivamente DTMF estiver ativado globalmente.
  • Utilize um mapeamento de DTMF por pergunta em vez de uma configuração global exclusiva de DTMF para melhor controlo.

Mensagens informativas enviadas enquanto o modo apenas DTMF está ativado podem fazer com que a plataforma gere gramática DTMF vazia, levando a erros telefónicos. Por esta razão, é preferível usar um mapeamento DTMF por pergunta.