Avaliar uma solução RAG

Concluído

Dica

Consulte a guia Texto e imagens para obter mais detalhes!

Um aplicativo RAG é um pipeline, portanto, uma boa resposta por si só não prova que toda a solução funciona bem. A avaliação deve examinar as informações recuperadas e a resposta gerada a partir dela.

Avaliar recuperação

A avaliação de recuperação pergunta se o sistema de pesquisa retorna conteúdo de origem útil.

Diagrama da recuperação de contexto.

Para um conjunto de perguntas representativas, considere:

  • Relevância: as partes recuperadas abordam a questão?
  • Cobertura: Todas as informações são necessárias para uma resposta completa presente?
  • Classificação: Os resultados mais fortes estão à frente dos mais fracos?
  • Segurança e atualização: o conteúdo está autorizado para o usuário e ainda é atual?

Se as informações corretas não forem recuperadas, alterar o prompt de geração sozinho não resolverá o problema. Talvez seja necessário melhorar o conteúdo de origem, os limites de partes, os metadados, o processamento de consultas, a estratégia de pesquisa ou a classificação.

Avaliar geração

A avaliação de geração considera como o modelo usa o contexto recuperado.

Diagrama da geração de resposta.

As considerações para avaliar o conteúdo gerado incluem:

  • Aterramento: cada declaração é compatível com o conteúdo recuperado?
  • Relevância: a resposta responde diretamente à pergunta do usuário?
  • Integridade: a resposta inclui as informações importantes no contexto?
  • Qualidade da citação: as citações apontam para fontes que dão suporte às declarações associadas?
  • Incerteza apropriada: o aplicativo evita adivinhar quando o contexto é insuficiente?

Um conjunto de testes útil contém perguntas realistas, passagens de origem esperadas e critérios para respostas aceitáveis. Também deve incluir casos difíceis, como perguntas ambíguas, perguntas sem resposta nos dados, documentos desatualizados e tentativas de recuperar informações não autorizadas.

Balancear qualidade, latência e custo

Recuperar e processar mais partes pode melhorar a cobertura, mas também aumenta o tamanho do prompt, o tempo de resposta e o custo. Muito contexto pode até tornar mais difícil para o modelo se concentrar nas evidências mais relevantes. O design rag envolve, portanto, o balanceamento da qualidade da resposta com latência e custo.

Diagrama de critérios equilibrados.

O monitoramento do uso real pode revelar perguntas sem resposta, citações fracas, pesquisas lentas e alterações na qualidade do conteúdo. Use essas observações para melhorar o pipeline e reavalia-lo sempre que os dados, modelos, prompts ou configurações de recuperação forem alterados.