Configurar agentes de voz básicos

Note

Este artigo descreve recursos usados em agentes ou fluxos de agentes baseados no harness padrão.

Este artigo descreve como configurar agentes básicos de resposta de voz interativa (IVR) para uso em aplicativos do Dynamics 365 Contact Center. Normalmente, agentes de voz básicos usam orquestração clássica. Saiba mais em Integrar um agente habilitado para voz com o Dynamics 365 Contact Center.

Ligue a voz básica

Um agente habilitado para voz é diferente de um agente baseado em chat. O agente compatível com voz inclui tópicos específicos do sistema para lidar com cenários de voz. Um agente baseado em chat usa a modalidade Text . Um agente habilitado para voz usa a modalidade Speech &DTMF . As duas modalidades são mutuamente exclusivas.

  1. Vá até a página de Configurações do seu agente e selecione Voz.

  2. Selecione Habilitar voz. Fazer com que a voz seja a modalidade padrão para criar e atualizar dentro dos tópicos é selecionada por padrão.

  3. Selecione Básico se você planeja usar tópicos e orquestração clássica para seu agente. Saiba mais em Escolher como controlar a conversa e escolher como lidar com a fala.

Note

Selecione voz em tempo real se você planeja usar a orquestração generativa para seu agente.

Ao ativar Habilitar voz e tornar a voz a modalidade padrão para criar e atualizar em tópicos, o agente receberá as seguintes atualizações:

  • A capacidade de criar funcionalidades de voz ao alternar de texto para Voz & DTMF.
  • Os tópicos do sistema de voz Detecção de Silêncio, Fala não reconhecida e Tecla de discagem não reconhecida são automaticamente adicionados para lidar com cenários relacionados à fala.
  • Aumentar a precisão com os dados do agente (ativados por padrão), o que melhora a precisão do reconhecimento de fala.
  • O fluxo do agente existente não muda (como o tópico Menu Principal, usado para iniciar interações com gatilhos DTMF mapeados).

Important

  • A configuração Habilitar voz altera apenas os recursos de criação de voz, não a configuração do canal. Ative o canal de Telefonia para um agente com voz totalmente habilitada.
  • Além disso, habilitar voz em um agente que não foi originalmente configurado para recursos de voz significa que o agente não tem o tópico Menu Principal (versão prévia). Você deve recriar esse tópico, se necessário.
  • Se você não conseguir ativar o recurso de voz, verifique se o ambiente do Power Platform que hospeda seu agente está com o recebimento antecipado de novos recursos desativado. Para obter mais informações, consulte Não é possível ativar Otimizar para voz.
  • A configuração de aumento de precisão com dados do agente só funciona quando o agente com habilitação de voz usa frases de gatilho. Se o agente estiver configurado para usar descrições de tópico, não haverá efeito sobre a precisão.

Desligue a otimização para voz

Desative a opção Habilitar voz na criação do agente se não usar o canal de Telefonia. Depois de desativar Habilitar voz, você verá as seguintes alterações:

  • Não há criação de agentes para recursos de voz, como DTMF e interrupção da fala.
  • A modalidade padrão texto é definida.
  • Nenhuma melhora no reconhecimento de fala, uma vez que não há reconhecimento de fala.
  • Não há tópicos do sistema de voz nem tópico global de DTMF.

    Note

    Alguns tópicos podem apresentar erros ao publicar se ainda fizerem referência ao tópico DTMF (agora desativado).

  • Não há alteração no fluxo do agente e na configuração do canal, pois desativar a otimização não remove o canal de telefonia.
  • Ativar ou desativar a opção Habilitar voz não terá efeito até que você publique o seu agente. Se você ativá-lo ou desativá-lo acidentalmente e o agente alternar de modalidade, terá tempo para corrigir isso.

Important

Se seus canais de Telefonia estiverem habilitados, desabilitar a opção Habilitar voz poderá prejudicar seu agente, pois todos os gatilhos DTMF serão desabilitados automaticamente.

Use a voz como modo principal de criação

Quando você ativa a opção Habilitar voz, a opção Criar voz padrão para criar e atualizar dentro de tópicos é ativada automaticamente. Se você desativar essa opção, selecione a modalidade Fala & DTMF em cada nó onde deseja adicionar mensagens de voz.

Disponibilidade de mensagem

Usar a modalidade de texto ou de fala pode afetar seu canal de forma diferente.

Modalidade de texto Modalidade de fala Canal de texto e voz do agente
Mensagem disponível Mensagem vazia Mensagem disponível
Mensagem vazia Mensagem disponível Mensagem não disponível

Reconhecimento de fala automático personalizado

Agentes habilitados para voz para um domínio específico, como médico ou financeiro, podem encontrar usuários que usam termos financeiros ou jargões médicos. Alguns termos e jargões são difíceis para o agente ativado por voz converter de fala em texto.

Note

A configuração de aumento de precisão com dados do agente só funciona quando o agente com habilitação de voz usa frases de gatilho. Se o agente estiver configurado para usar descrições de tópico, não haverá efeito sobre a precisão.

Para garantir que a entrada de fala seja reconhecida com precisão, melhore o reconhecimento de fala:

  1. Selecione Configurações>Voz em seu agente.

  2. Selecione Aumentar a precisão com dados do agente para habilitar as configurações de reconhecimento de fala automático personalizadas do agente.

  3. Selecione Salvar para confirmar suas alterações.

  4. Publique seu agente para ver as novas alterações.

Referência de opções de voz no nível do agente

Use as configurações de voz para configurar os timeouts de vários recursos relacionados à voz.

Para fazer alterações nas opções de tempo limite no nível do agente:

  1. Vá até a página de Configurações do seu agente e selecione Voz.

  2. Revise as configurações e faça as mudanças que quiser.

  3. Selecione Salvar para confirmar suas alterações. Suas configurações ajustadas se tornam o padrão para os tópicos que você cria neste agente.

Configurações em nível de agente

A tabela a seguir lista cada opção e como ela se relaciona com as configurações de nível de nó.

Seção com suporte a voz no nível do agente Configurações Description Valor padrão Substituição no nível do nó
DTMF Tempo limite entre um dígito e outro Tempo máximo em milissegundos permitido enquanto aguarda a próxima entrada de chave DTMF. Aplica a entrada DTMF com vários dígitos somente quando os usuários não atingem o comprimento máximo de entrada. 3.000 ms Nó de pergunta com propriedades de voz para entrada DTMF de vários dígitos
DTMF Tempo limite de finalização Duração máxima em milissegundos para aguardar uma chave de terminação DTMF. O limite se aplica quando o usuário atinge o tamanho máximo de entrada e não pressiona a chave de término. Aplica-se somente à entrada DTMF de vários dígitos.

Após o tempo limite expirar e a tecla DTMF de término não ser recebida, o agente encerra o reconhecimento e retorna o resultado até esse ponto.

Se definido como "continuar sem esperar", o agente não aguarda a tecla de encerramento. O agente retorna logo após o usuário inserir o tamanho máximo.
2.000 ms Nó de pergunta com propriedades de voz para entrada DTMF de vários dígitos
Detecção de silêncio Tempo limite de detecção de silêncio Silêncio máximo em milissegundos permitido enquanto aguarda a entrada do usuário. O limite se aplica quando o agente não detecta nenhuma entrada do usuário. O padrão é sem tempo de silêncio. O agente espera indefinidamente pela entrada do usuário.

A detecção de silêncio para voz mede o período após o término da fala.
Nenhum tempo limite de silêncio Nó de pergunta com propriedades de voz para entrada DTMF de vários dígitos

Tópico do sistema (propriedades do acionador de detecção de silêncio) para Configurar a detecção de silêncio e limites de tempo
Coleta de fala Tempo limite de término do enunciado O limite se aplica quando o usuário pausa durante ou após a fala. Se a pausa for maior do que o limite de tempo, o agente presume que o usuário terminou de falar.

O valor máximo para o timeout no fim da enunciação é 3.000 ms. Qualquer valor acima de 3.000 ms é reduzido para 3.000 ms.
1.500 ms Nó de pergunta com propriedades de voz
Coleta de fala Tempo limite de reconhecimento de fala Determina por quanto tempo o agente aguarda a fala do usuário depois que o usuário começa a falar. O valor padrão é 12.000 milissegundos (cerca de 12 segundos). Sem tempo limite de reconhecimento significa tempo ilimitado. O agente reformula a pergunta. Se não houver resposta, a voz estará além do Tempo limite de reconhecimento de fala. 12.000 ms Nó de pergunta com propriedades de voz
Latência de mensagens Atraso no envio de mensagens Determina quanto tempo o agente espera antes de entregar a mensagem de latência após o início de uma solicitação de operação em segundo plano. O tempo é definido em milissegundos. 500 ms Propriedades do nó de ação para operação de longa duração
Latência de mensagens Tempo mínimo de reprodução A mensagem de latência será reproduzida por um período mínimo de tempo, mesmo se a operação em segundo plano for concluída enquanto a mensagem estiver sendo reproduzida. O tempo é definido em milissegundos. 5.000 ms Propriedades do modo de Ação para operação de execução prolongada
Sensibilidade à fala Sensitivity Controla como o sistema equilibra a detecção de fala e ruído de fundo. Reduza a sensibilidade para ambientes barulhentos, espaços públicos e uso sem as mãos. Aumente a sensibilidade para ambientes silenciosos, usuários de fala suave ou detecção de comandos de voz. A configuração padrão é 0,5. 0.5 Não há sobrescritas no nível do nó para este controle.

Note

  • Agentes com frases acionadoras longas e entidades maiores levam mais tempo para ser publicados.
  • Se vários usuários publicarem o mesmo agente ao mesmo tempo, sua ação de publicação pode ser bloqueada. Publique o agente novamente depois que outros terminarem de editá-lo.

Saiba mais em Principais conceitos – Publicar e implantar seu agente.

Ligue a entrada de barcaça

Quando você permite a entrada de entrada, seus usuários de agentes podem interromper seu agente. Esse recurso é útil quando o usuário do agente não precisa ouvir a mensagem inteira. Por exemplo, os chamadores podem já conhecer as opções do menu, porque as ouviram no passado. Com o barge-in ativado, o usuário do agente pode inserir a opção desejada, mesmo que o agente ainda não tenha terminado de listar todas as opções.

Quando desativar o barge-in

Desative a interrupção para mensagens como:

  • Uma mensagem que você atualizou recentemente.
  • Uma mensagem de conformidade que não deveria ser interrompida.
  • A primeira mensagem do agente, para garantir que os usuários do agente estejam cientes de informações novas ou essenciais.

Specifications

  • O Barge-in oferece suporte a interrupções baseadas em DTMF e em voz do usuário agente.

  • Você pode controlar a entrada com cada mensagem em um lote. Posicione os nós barge-in-disabled em sequência antes de cada nó onde a interrupção é permitida. Caso contrário, o sistema tratará barge-in-disabled como uma mensagem de entrada de permissão.

    Captura de tela das posições de barge-in e barge-in desativado nos nós de mensagem.

    Quando uma fila de processamento em lote é concluída, a configuração automática de intervenção é redefinida para o próximo lote. O sinalizador de interrupção em cada mensagem subsequente regula isso. Você poderá posicionar nós de interrupção desabilitada quando a sequência for iniciada novamente.

Dica

Se nós consecutivos de mensagem forem seguidos por um nó Questão, as mensagens de voz para esses nós serão agrupadas em um lote. Um processo começa com um nó de mensagem e para no nó de pergunta, que aguarda a entrada do usuário.

Evite desabilitar a interação para mensagens longas, especialmente se você espera que os usuários do agente interajam com frequência com o agente. Se o usuário do agente já conhece as opções do menu, permita que ele navegue sozinho até a opção desejada.

Configurar a interrupção por voz

  1. Selecione um nó de Mensagem ou Pergunta e defina a modalidade desejada como Speech & DTMF.

  2. Selecione os três pontos (...) para o nó e selecione Propriedades.

    • Em nós de Mensagem, o painel Enviar propriedades da atividade será aberto na lateral da tela de criação.

      Selecione Permitir interrupções.

    • Em nós de Pergunta, o painel Propriedades da pergunta será aberto. Selecione Voz.

      Nas propriedades de Voz, selecione Permitir interrupção.

  3. Salve o tópico.

Configurar a detecção de silêncio e tempos limite

A detecção de silêncio permite que você configure quanto tempo o agente aguarda a entrada do usuário e a ação que ele toma se o agente não receber nenhuma entrada. A detecção de silêncio é mais útil em resposta a uma pergunta no nível de nó ou quando o agente aguarda uma frase de ativação para iniciar um novo tópico.

Você pode configurar os tempos limite padrão dos tópicos no nível de agente.

Configure o comportamento de detecção de silêncio quando um agente espera uma resposta a uma pergunta

Para sobrescrever o comportamento padrão de detecção de silêncio para um nó Question:

  1. Selecione os três pontos (...) para o nó e selecione Propriedades. O painel Propriedades da pergunta será aberto.

  2. Selecione Voz. O painel de propriedades de Voz aparece.

  3. Para o tempo limite da detecção de silêncio, selecione a opção que você quer:

    • Use a configuração do agente: Use a configuração global para detecção de silêncio.
    • Desabilitar para este nó: Aguarda indefinidamente por uma resposta.
    • Personalize em milissegundos: Espere o tempo especificado antes de repetir a pergunta.
  4. Para Quantas novas solicitações em caso de silêncio, selecione o comportamento desejado:

    • Repita até 2 vezes
    • Não repita
    • Repita uma vez
  5. Opcionalmente, configure uma mensagem de nova solicitação.

  6. Para ação de contingência, selecione o comportamento desejado:

    • Encerrar chamada: Encerre a chamada. É o comportamento padrão.
    • Escalonar: redirecione o usuário para o tópico do sistema Escalonar.
    • Definir variável como valor: defina a variável de saída como um valor e então passe para o próximo nó. Insira ou selecione o valor que deseja em Valor padrão da entidade.
    • Definir variável como vazia (sem valor): limpe a variável de saída e vá para o próximo nó. Você pode usar um Nó de condição posteriormente para verificar se a variável tem um valor.
    • Redirecione para um tópico: Redirecione o usuário para o tópico especificado.
  7. Opcionalmente, expanda Avançado e ajuste as seguintes configurações:

    • Tempo limite de término do enunciado: quanto tempo o agente aguarda após o usuário terminar de falar.
    • Tempo limite de reconhecimento de fala: quanto tempo o agente dá ao usuário quando ele começa a responder.

Configure o comportamento de detecção de silêncio quando um agente espera por uma frase de gatilho

Para configurar o comportamento de detecção de silêncio quando seu agente espera por uma frase de gatilho:

  1. Vá para o tópico do sistema de detecção de silêncio .

  2. Selecione os três pontos (...) do nó Trigger . O painel Propriedades de silêncio detectado aparece.

  3. Selecione o comportamento que deseja:

    • Use a configuração do agente: Use a configuração global para detecção de silêncio.
    • Desativar para este nó: Aguarda indefinidamente uma frase de ativação.
    • Personalize em milissegundos: Espere o tempo especificado antes de encerrar a conversa.

Adicionar uma mensagem de latência para operações de execução prolongada

Para operações de back-end longas, seu agente pode enviar uma mensagem aos usuários para notificá-los sobre os processos mais longos. Os agentes em um canal de mensagens também podem enviar uma mensagem de latência.

  • Reprodução de áudio da mensagem de latência: Continua em loop até que a operação seja concluída.
  • Mensagem de latência no chat: Enviada apenas uma vez quando a latência especificada é atingida.

Se você quer que seu agente repita uma mensagem após acionar um fluxo do Power Automate:

  1. Vá até o tópico que chama seu fluxo do Power Automate.

  2. Selecione os três pontos (...) do nó Ação e então selecione Propriedades. O painel Propriedades da ação será aberto.

  3. Selecione Enviar uma mensagem.

  4. Na seção Mensagem, insira o que você deseja que o agente diga. Use SSML para modificar o som da mensagem. O agente repete a mensagem até que o fluxo seja concluído.

  5. Opcionalmente, ajuste quanto tempo o agente deve esperar antes de repetir a mensagem e o tempo mínimo de reprodução da mensagem.

Configurar o encerramento da chamada

Para configurar o agente para encerrar a chamada e finalizar a conversa, adicione um novo nó (+) e selecione Gerenciamento de tópicos>Encerrar conversa.

Captura de tela de um novo menu de nó com Gerenciamento de tópicos e Encerrar a conversa realçados.

Detectar secretárias eletrônicas

Você pode configurar seu agente para detectar um computador de resposta e deixar uma mensagem com o usuário do agente após a conclusão da mensagem do usuário do agente. O tópico do sistema de Detecção de Máquina de Resposta permite que você crie uma mensagem customizada para cenários quando o agente encontrar a caixa postal de um usuário. No nó Message, defina a mensagem que será deixada quando o agente encontrar uma secretária eletrônica.

Captura de tela do tópico Answering Machine Detected, realçando o nó da mensagem.

Formatar síntese de fala com SSML

Use a SSML (linguagem de marcação de síntese de fala) para alterar a forma como o agente soa quando lê mensagens em voz alta. Por exemplo, você pode alterar o tom ou a frequência das palavras faladas, a velocidade e o volume.

SSML usa marcas para delimitar o texto que você deseja modificar, semelhante ao HTML. Use as seguintes tags no Copilot Studio:

Marca SSML Description Link para a documentação do serviço de voz
<audio src="_URL to an audio file_"/> Adicione a URL de um arquivo de áudio na tag. O arquivo deve ser acessível para o usuário do agente. Adicionar áudio gravado
<break /> Insira pausas ou interrupções entre as palavras. Insira opções de quebra na tag. Adicionar um intervalo
<emphasis> Texto que você deseja modificar</emphasis> Adicione níveis de estresse às palavras ou frases. Adicione opções de ênfase na tag de abertura. Adicione a marca de fechamento após o texto que você deseja modificar. Ajustar opções de ênfase
<prosody> Texto que você deseja modificar</prosody> Especifique as alterações de tom, contorno, gama, ritmo e volume. Adicione opções de prosódia na tag de abertura. Adicione a marca de fechamento após o texto que você deseja modificar. Ajustar opções de prosódia
<lang xml:lang="xx-XX"> Texto que você deseja modificar</lang> Ajuste o idioma falado dentro da mesma mensagem ao usar uma voz neural multilíngue. Ajustar os idiomas falados

Note

Ao usar a tag <audio src="_URL to an audio file_"/>, se você armazenar a URL em uma variável, codifique a URL antes de inseri-la na tag SSML de src de áudio na mensagem. Use a função EncodeHTML Power Fx para codificar a URL ao atribuí-la a uma variável na ação de atribuição.

Captura de tela de uma mensagem de fala com tags SSML adicionadas.

Encontrar e usar uma tag

SSML usa marcas para delimitar o texto que você deseja modificar, como o HTML.

Use as seguintes tags no Copilot Studio:

  1. Selecione um nó de Mensagem ou Pergunta . Altere o modo para Fala &DTMF.

  2. Selecione o menu Marcas SSML e selecione uma marca.

    A caixa de mensagem é preenchida com a tag. Se já houver texto na caixa de mensagem, o código da tag será acrescentado ao final da sua mensagem.

  3. Envolva o texto que deseja modificar com as marcas de abertura e fechamento. Você pode combinar várias marcas e personalizar partes individuais da mensagem com marcas individuais.

Dica

Você também pode inserir manualmente as marcas SSML que não aparecem no menu auxiliar. Saiba mais em Melhorar a síntese com a Linguagem de Marcação de Síntese de Fala.

Transferir uma chamada para um representante ou número de telefone externo

Você pode configurar o agente para transferir a chamada para um número de telefone externo. Os agentes do Copilot Studio oferecem suporte à transferência sem consulta para um número de telefone da PSTN e para o número de roteamento direto.

Note

Você também pode usar cabeçalhos SIP X para lidar com transferências de chamadas. Saiba mais em Configurar cabeçalhos SIP X para agentes habilitados por voz.

Para transferir para um número de telefone externo:

  1. No tópico que você deseja modificar, adicione um novo nó (+). No menu do nó, selecione Gerenciamento de tópicos e selecione Transferir conversa.

  2. Em Tipo de transferência, selecione Transferência para número de telefone externo e insira o número de telefone.

  3. (Opcionalmente) adicione um cabeçalho de Informações de Usuário para Usuário (UUI) do Protocolo de Iniciação de Sessão (SIP) à chamada telefônica.

    Esse cabeçalho é uma cadeia de pares key=value, sem espaços ou caracteres especiais, exibida para leitura por sistemas externos.

    1. Selecione os três pontos (...) do nó e, em seguida, selecione Propriedades. O painel Propriedades da transferência da conversa é aberto.

    2. Em Cabeçalho SIP UUI, insira as informações que deseja enviar com a transferência da chamada. Não há suporte a variáveis durante a transferência para um número de telefone externo.

    Caution

    Apenas os primeiros 256 caracteres da string são enviados. O cabeçalho aceita somente números, letras, sinais de igualdade (=) e ponto e vírgula (;). Não há suporte a todos os outros caracteres, incluindo espaços, chaves e colchetes, ou fórmulas, e podem causar uma falha na transferência.

Dica

Inclua um + no número de telefone para o código do país correspondente.

A saída de transferência com SIP UUI para o número de telefone de destino deve usar roteamento direto. Os números de telefone da rede telefônica pública comutada (PSTN) não oferecem suporte a transferências do cabeçalho SIP UUI.

Para transferir para um representante, consulte Gatilhos explícitos.

Usar variáveis de voz

Os agentes do Copilot Studio suportam variáveis. Você pode usar variáveis predefinidas ou criar as personalizadas.

Note

Um agente habilitado para voz no Copilot Studio dá suporte a variáveis de contexto. Essas variáveis ajudam você a integrar suas conversas de agente com Dynamics 365 Contact Center ao transferir uma chamada.

Para obter mais informações sobre variáveis de contexto no Dynamics 365 Contact Center, consulte Context variáveis para bots do Copilot Studio.

Esta integração oferece suporte a estes cenários com as seguintes variáveis quando você transfere:

Variable Tipo Description
System.Activity.From.Name String O identificador de chamadas do usuário agente
System.Activity.Recipient.Name String O número usado para ligar ou conectar-se ao agente
System.Conversation.SipUuiHeaderValue String Valor do cabeçalho SIP ao transferir via um número de telefone de roteamento direto
System.Activity.UserInputType String Se o usuário agente usou DTMF ou voz na conversa
System.Activity.InputDTMFKey String A entrada DTMF bruta do usuário agente
System.Conversation.OnlyAllowDTMF booleano A voz ignora a entrada de fala quando definida como true
System.Activity.SpeechRecognition.Confidence Número O valor de confiança (entre 0 e 1) do último evento de reconhecimento de fala
System.Activity.SpeechRecognition.MinimalFormattedText String Resultados de reconhecimento de fala (como texto bruto) antes de o Copilot Studio aplicar seu modelo dedicado de reconhecimento vocal natural

Note

Ao usar a variável System.Conversation.OnlyAllowDTMF definida como true, certifique-se de usar a seguinte configuração:

  • Todos os nós de mensagem que não esperam por interação do usuário estão com barge-in desativado ou são seguidos por nós de pergunta com mapeamentos DTMF apropriados.
  • Evite enviar mensagens informativas no meio de nós Question quando o modo somente DTMF estiver ativado globalmente.
  • Use um mapeamento de DTMF por pergunta em vez de uma configuração global somente para DTMF para ter mais controle.

Mensagens informativas enviadas enquanto o modo somente DTMF está ativado podem fazer com que a plataforma gere gramática DTMF vazia, resultando em erros de telefonia. Por essa razão, é preferível usar um mapeamento DTMF por pergunta.