Testes em lote para prompts (versão prévia)

Note

Os recursos deste artigo são baseados no standard harness, que usa as opções de faturamento descritas em Licenciamento para agentes baseados no standard harness. Aprenda como acessar recursos padrão em agentes e fluxos de agentes padrão do Access.

[Este tópico faz parte da documentação de pré-lançamento e está sujeito a alterações.]

Os prompts permitem que você crie ferramentas de IA generativas personalizadas para automação de negócios e agentes. Garantir a precisão, a confiabilidade e a eficiência dessas ferramentas é fundamental. O teste em lote de prompts foi projetado para permitir que você valide e melhore os prompts usados nas ferramentas de IA em toda a plataforma.

Importante

Principais recursos do teste em lote

O teste em lote fornece uma abordagem sistemática para validar prompts em conjuntos de dados diversos. É possível:

  • Carregue ou gere conjuntos de dados de teste para avaliação abrangente.
  • Defina critérios de avaliação para julgar os resultados do teste.
  • Execute testes em lote para avaliar o comportamento do prompt em todo o conjunto de dados de teste.
  • Compare os resultados ao longo do tempo para garantir a melhoria contínua.
  • Examine e ajuste as avaliações automáticas para garantir o alinhamento com suas necessidades específicas.

Uma pontuação de precisão é calculada com base nos resultados do teste, oferecendo dados empíricos para confiar em suas ferramentas de IA.

Como usar o teste em lote

Use as etapas a seguir para configurar e executar testes em lote para seus prompts.

Definir os casos de teste

  1. Entre no Copilot Studio, Power Apps ou Power Automate.

  2. Acesse a lista de prompts:

    • No Copilot Studio, selecione Ferramentas e, em seguida, filtre por prompts.
    • Em Power Apps e Power Automate, selecione AI hub.
  3. Ao lado do nome do prompt, selecione os três pontos (...).

  4. Selecione o hub de teste (versão prévia).

    Veja um exemplo da tela Tools no Copilot Studio:

    Captura de tela do menu com a opção

    No Copilot Studio, o hub de teste se parece com a seguinte captura de tela:

    Captura de tela do hub de teste.

  5. Adicione seus casos de teste usando uma das opções disponíveis:

    • Upload: permite carregar casos de teste usando um arquivo csv. Se você quiser verificar o formato do arquivo que precisa carregar, selecione Baixar esquema de dados de teste.
    • Geração de IA: permite que você gere casos de teste usando IA com base em seu prompt.
    • Usar dados de atividade: permite que você extraia a atividade recente do prompt para ajudá-lo a começar.
    • Adicionar manualmente: permite que você crie casos de teste manualmente.

    Qualquer uma das opções ajuda você a criar uma lista de casos de teste que você pode executar:

    Captura de tela dos casos de teste carregados.

Definir critérios de avaliação

  1. Depois de criar os casos de teste, selecione Configurar critérios na seção de configuração à direita:

    Captura de tela da configuração de critérios de avaliação.

  2. Defina a pontuação de aprovação, que é a pontuação mínima necessária para que uma resposta seja aprovada.

  3. Escolha um dos seguintes critérios predefinidos:

    • Qualidade da resposta: testa respostas para clareza, ajuda e tom
    • Correspondências de resposta: testa respostas para palavras e significados específicos
    • Correção JSON: Testa se as respostas estão de acordo com seu esquema de dados

    Captura de tela dos critérios de avaliação.

    Esses critérios e a pontuação de aprovação determinam como as saídas de casos de teste são avaliadas durante o processo de avaliação.

Executar testes em lote

  1. Na tela dos casos de teste, selecione Executar tudo para executar a avaliação em todos os casos de teste ou selecione os casos de teste a serem executados e selecione Executar selecionados.

    Captura de tela dos testes a serem executados.

    O hub de teste avalia os resultados em relação aos critérios definidos, fornecendo insights sobre o desempenho do prompt.

  2. Depois que a avaliação dos casos de teste for feita, a tela de resultado será exibida:

    Captura de tela dos resultados dos testes.

  3. Para acessar as execuções de avaliação anteriores, selecione o nome do prompt na parte superior da tela no Copilot Studio ou selecione Executar histórico no Power Apps ou no Power Automate.

    Captura de tela do histórico de execuções.

  4. Para exibir detalhes, selecione a execução de avaliação.

O histórico de execução permite que você monitore e analise os resultados do teste ao longo do tempo, incluindo:

  • Acompanhe o progresso da pontuação de precisão em vários testes.
  • Compare os resultados de diferentes execuções para identificar tendências ou regressões.
  • Acesse detalhes sobre por que um determinado resultado de teste foi classificado como aprovado ou falhou, oferecendo mais informações para o diagnóstico.

Iterar na avaliação dos casos de teste e monitorar quaisquer mudanças significativas entre as execuções de avaliação.