Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Note
Este artigo descreve recursos usados em agentes ou fluxos de agente da plataforma do agente padrão.
[Este tópico faz parte da documentação de pré-lançamento e está sujeito a alterações.]
Os prompts permitem que você crie ferramentas de IA generativas personalizadas para automação de negócios e agentes. Garantir a precisão, a confiabilidade e a eficiência dessas ferramentas é fundamental. O teste em lote de prompts foi projetado para permitir que você valide e melhore os prompts usados nas ferramentas de IA em toda a plataforma.
Importante
- Esta é uma versão prévia do recurso pronta para produção.
- As versões prévias do recurso prontas para produção estão sujeitas aos termos de uso complementares.
- Os prompts são executados em modelos GPT alimentados por Serviço OpenAI do Azure.
- Essa funcionalidade pode ainda não estar disponível em sua região. Saiba mais na seção Prompts em Disponibilidade de funcionalidades por região ou ambiente do Governo dos EUA.
- Esse recurso pode estar sujeito a limites de uso ou limitação de capacidade.
Principais recursos do teste em lote
O teste em lote fornece uma abordagem sistemática para validar prompts em conjuntos de dados diversos. É possível:
- Carregue ou gere conjuntos de dados de teste para avaliação abrangente.
- Defina critérios de avaliação para julgar os resultados do teste.
- Execute testes em lote para avaliar o comportamento do prompt em todo o conjunto de dados de teste.
- Compare os resultados ao longo do tempo para garantir a melhoria contínua.
- Examine e ajuste as avaliações automáticas para garantir o alinhamento com suas necessidades específicas.
Uma pontuação de precisão é calculada com base nos resultados do teste, oferecendo dados empíricos para confiar em suas ferramentas de IA.
Como usar o teste em lote
Use as etapas a seguir para configurar e executar testes em lote para seus prompts.
Definir os casos de teste
Entre no Copilot Studio, Power Apps ou Power Automate.
Acesse a lista de prompts:
- No Copilot Studio, selecione Ferramentas e, em seguida, filtre por prompts.
- Em Power Apps e Power Automate, selecione AI hub.
Ao lado do nome do prompt, selecione os três pontos (...).
Selecione o hub de teste (versão prévia).
Veja um exemplo da tela Tools no Copilot Studio:
No Copilot Studio, o hub de teste se parece com a seguinte captura de tela:
Adicione seus casos de teste usando uma das opções disponíveis:
- Upload: permite carregar casos de teste usando um arquivo csv. Se você quiser verificar o formato do arquivo que precisa carregar, selecione Baixar esquema de dados de teste.
- Geração de IA: permite que você gere casos de teste usando IA com base em seu prompt.
- Usar dados de atividade: permite que você extraia a atividade recente do prompt para ajudá-lo a começar.
- Adicionar manualmente: permite que você crie casos de teste manualmente.
Qualquer uma das opções ajuda você a criar uma lista de casos de teste que você pode executar:
Definir critérios de avaliação
Depois de criar os casos de teste, selecione Configurar critérios na seção de configuração à direita:
Defina a pontuação de aprovação, que é a pontuação mínima necessária para que uma resposta seja aprovada.
Escolha um dos seguintes critérios predefinidos:
- Qualidade da resposta: testa respostas para clareza, ajuda e tom
- Correspondências de resposta: testa respostas para palavras e significados específicos
- Correção JSON: Testa se as respostas estão de acordo com seu esquema de dados
Esses critérios e a pontuação de aprovação determinam como as saídas de casos de teste são avaliadas durante o processo de avaliação.
Executar testes em lote
Na tela dos casos de teste, selecione Executar tudo para executar a avaliação em todos os casos de teste ou selecione os casos de teste a serem executados e selecione Executar selecionados.
O hub de teste avalia os resultados em relação aos critérios definidos, fornecendo insights sobre o desempenho do prompt.
Depois que a avaliação dos casos de teste for feita, a tela de resultado será exibida:
Para acessar as execuções de avaliação anteriores, selecione o nome do prompt na parte superior da tela no Copilot Studio ou selecione Executar histórico no Power Apps ou no Power Automate.
Para exibir detalhes, selecione a execução de avaliação.
O histórico de execução permite que você monitore e analise os resultados do teste ao longo do tempo, incluindo:
- Acompanhe o progresso da pontuação de precisão em vários testes.
- Compare os resultados de diferentes execuções para identificar tendências ou regressões.
- Acesse detalhes sobre por que um determinado resultado de teste foi classificado como aprovado ou falhou, oferecendo mais informações para o diagnóstico.
Itere a avaliação dos casos de teste e monitore eventuais alterações significativas entre as execuções de avaliação.