Avaliar uma solução RAG
Dica
Consulte a guia Texto e imagens para obter mais detalhes!
Um aplicativo RAG é um pipeline, portanto, uma boa resposta por si só não prova que toda a solução funciona bem. A avaliação deve examinar as informações recuperadas e a resposta gerada a partir dela.
Avaliar recuperação
A avaliação de recuperação pergunta se o sistema de pesquisa retorna conteúdo de origem útil.
Para um conjunto de perguntas representativas, considere:
- Relevância: as partes recuperadas abordam a questão?
- Cobertura: Todas as informações são necessárias para uma resposta completa presente?
- Classificação: Os resultados mais fortes estão à frente dos mais fracos?
- Segurança e atualização: o conteúdo está autorizado para o usuário e ainda é atual?
Se as informações corretas não forem recuperadas, alterar o prompt de geração sozinho não resolverá o problema. Talvez seja necessário melhorar o conteúdo de origem, os limites de partes, os metadados, o processamento de consultas, a estratégia de pesquisa ou a classificação.
Avaliar geração
A avaliação de geração considera como o modelo usa o contexto recuperado.
As considerações para avaliar o conteúdo gerado incluem:
- Aterramento: cada declaração é compatível com o conteúdo recuperado?
- Relevância: a resposta responde diretamente à pergunta do usuário?
- Integridade: a resposta inclui as informações importantes no contexto?
- Qualidade da citação: as citações apontam para fontes que dão suporte às declarações associadas?
- Incerteza apropriada: o aplicativo evita adivinhar quando o contexto é insuficiente?
Um conjunto de testes útil contém perguntas realistas, passagens de origem esperadas e critérios para respostas aceitáveis. Também deve incluir casos difíceis, como perguntas ambíguas, perguntas sem resposta nos dados, documentos desatualizados e tentativas de recuperar informações não autorizadas.
Balancear qualidade, latência e custo
Recuperar e processar mais partes pode melhorar a cobertura, mas também aumenta o tamanho do prompt, o tempo de resposta e o custo. Muito contexto pode até tornar mais difícil para o modelo se concentrar nas evidências mais relevantes. O design rag envolve, portanto, o balanceamento da qualidade da resposta com latência e custo.
O monitoramento do uso real pode revelar perguntas sem resposta, citações fracas, pesquisas lentas e alterações na qualidade do conteúdo. Use essas observações para melhorar o pipeline e reavalia-lo sempre que os dados, modelos, prompts ou configurações de recuperação forem alterados.