Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Note
Os recursos deste artigo são baseados no standard harness, que usa as opções de faturamento descritas em Licenciamento para agentes baseados no standard harness. Aprenda como acessar recursos padrão em agentes e fluxos de agentes padrão do Access.
[Este tópico faz parte da documentação de pré-lançamento e está sujeito a alterações.]
Os prompts permitem que você crie ferramentas de IA generativas personalizadas para automação de negócios e agentes. Garantir a precisão, a confiabilidade e a eficiência dessas ferramentas é fundamental. O teste em lote de prompts foi projetado para permitir que você valide e melhore os prompts usados nas ferramentas de IA em toda a plataforma.
Importante
- Esta é uma versão prévia do recurso pronta para produção.
- As versões preliminares prontas para produção estão sujeitas a termos de uso complementares.
- Os prompts são executados em modelos GPT alimentados por Serviço OpenAI do Azure.
- Essa funcionalidade pode ainda não estar disponível em sua região. Saiba mais na seção Prompts em Disponibilidade de funcionalidades por região ou ambiente do Governo dos EUA.
- Esse recurso pode estar sujeito a limites de uso ou limitação de capacidade.
Principais recursos do teste em lote
O teste em lote fornece uma abordagem sistemática para validar prompts em conjuntos de dados diversos. É possível:
- Carregue ou gere conjuntos de dados de teste para avaliação abrangente.
- Defina critérios de avaliação para julgar os resultados do teste.
- Execute testes em lote para avaliar o comportamento do prompt em todo o conjunto de dados de teste.
- Compare os resultados ao longo do tempo para garantir a melhoria contínua.
- Examine e ajuste as avaliações automáticas para garantir o alinhamento com suas necessidades específicas.
Uma pontuação de precisão é calculada com base nos resultados do teste, oferecendo dados empíricos para confiar em suas ferramentas de IA.
Como usar o teste em lote
Use as etapas a seguir para configurar e executar testes em lote para seus prompts.
Definir os casos de teste
Entre no Copilot Studio, Power Apps ou Power Automate.
Acesse a lista de prompts:
- No Copilot Studio, selecione Ferramentas e, em seguida, filtre por prompts.
- Em Power Apps e Power Automate, selecione AI hub.
Ao lado do nome do prompt, selecione os três pontos (...).
Selecione o hub de teste (versão prévia).
Veja um exemplo da tela Tools no Copilot Studio:
No Copilot Studio, o hub de teste se parece com a seguinte captura de tela:
Adicione seus casos de teste usando uma das opções disponíveis:
- Upload: permite carregar casos de teste usando um arquivo csv. Se você quiser verificar o formato do arquivo que precisa carregar, selecione Baixar esquema de dados de teste.
- Geração de IA: permite que você gere casos de teste usando IA com base em seu prompt.
- Usar dados de atividade: permite que você extraia a atividade recente do prompt para ajudá-lo a começar.
- Adicionar manualmente: permite que você crie casos de teste manualmente.
Qualquer uma das opções ajuda você a criar uma lista de casos de teste que você pode executar:
Definir critérios de avaliação
Depois de criar os casos de teste, selecione Configurar critérios na seção de configuração à direita:
Defina a pontuação de aprovação, que é a pontuação mínima necessária para que uma resposta seja aprovada.
Escolha um dos seguintes critérios predefinidos:
- Qualidade da resposta: testa respostas para clareza, ajuda e tom
- Correspondências de resposta: testa respostas para palavras e significados específicos
- Correção JSON: Testa se as respostas estão de acordo com seu esquema de dados
Esses critérios e a pontuação de aprovação determinam como as saídas de casos de teste são avaliadas durante o processo de avaliação.
Executar testes em lote
Na tela dos casos de teste, selecione Executar tudo para executar a avaliação em todos os casos de teste ou selecione os casos de teste a serem executados e selecione Executar selecionados.
O hub de teste avalia os resultados em relação aos critérios definidos, fornecendo insights sobre o desempenho do prompt.
Depois que a avaliação dos casos de teste for feita, a tela de resultado será exibida:
Para acessar as execuções de avaliação anteriores, selecione o nome do prompt na parte superior da tela no Copilot Studio ou selecione Executar histórico no Power Apps ou no Power Automate.
Para exibir detalhes, selecione a execução de avaliação.
O histórico de execução permite que você monitore e analise os resultados do teste ao longo do tempo, incluindo:
- Acompanhe o progresso da pontuação de precisão em vários testes.
- Compare os resultados de diferentes execuções para identificar tendências ou regressões.
- Acesse detalhes sobre por que um determinado resultado de teste foi classificado como aprovado ou falhou, oferecendo mais informações para o diagnóstico.
Iterar na avaliação dos casos de teste e monitorar quaisquer mudanças significativas entre as execuções de avaliação.