Evaluación de una solución RAG

Completado

Tip

Consulte la pestaña Texto e imágenes para obtener más detalles.

Una aplicación RAG es una canalización, por lo que una respuesta correcta por sí sola no demuestra que toda la solución funciona bien. La evaluación debe examinar tanto la información recuperada como la respuesta generada a partir de ella.

Evaluación de la recuperación

La evaluación de recuperación pregunta si el sistema de búsqueda devuelve contenido de origen útil.

Diagrama de recuperación de contexto.

Para un conjunto de preguntas representativas, tenga en cuenta lo siguiente:

  • Relevancia: ¿Los fragmentos recuperados abordan la pregunta?
  • Cobertura: ¿Se necesita toda la información necesaria para una respuesta completa?
  • Clasificación: ¿Los resultados más fuertes se colocan por delante de los más débiles?
  • Seguridad y actualización: ¿el contenido está autorizado para el usuario y sigue siendo actual?

Si no se recupera la información correcta, cambiar el mensaje de generación por sí solo no resolverá el problema. Es posible que tenga que mejorar el contenido de origen, los límites de fragmentos, los metadatos, el procesamiento de consultas, la estrategia de búsqueda o la clasificación.

Evaluación de la generación

La evaluación de generación considera cómo usa el modelo el contexto recuperado.

Diagrama de generación de respuestas.

Entre las consideraciones para evaluar el contenido generado se incluyen:

  • Base: ¿cada notificación es compatible con el contenido recuperado?
  • Relevancia: ¿La respuesta responde directamente a la pregunta del usuario?
  • Integridad: ¿La respuesta incluye la información importante en el contexto?
  • Calidad de la cita: ¿Las citas apuntan a orígenes que admiten las notificaciones asociadas?
  • Incertidumbre adecuada: ¿Evita la aplicación adivinar cuándo el contexto no es suficiente?

Un conjunto de pruebas útil contiene preguntas realistas, pasajes de origen esperados y criterios para respuestas aceptables. También debe incluir casos difíciles, como preguntas ambiguas, preguntas sin respuesta en los datos, documentos obsoletos e intentos de recuperar información no autorizada.

Equilibrar la calidad, la latencia y el costo

La recuperación y el procesamiento de más fragmentos pueden mejorar la cobertura, pero también aumenta el tamaño de la solicitud, el tiempo de respuesta y el costo. Demasiado contexto puede incluso dificultar que el modelo se centre en la evidencia más relevante. Por lo tanto, el diseño de RAG implica equilibrar la calidad de la respuesta con la latencia y el costo.

Diagrama de criterios equilibrados.

La supervisión del uso real puede revelar preguntas no respondidas, citas débiles, búsquedas lentas y cambios en la calidad del contenido. Use estas observaciones para mejorar la canalización y volver a evaluarla cada vez que cambien los datos, los modelos, las solicitudes o la configuración de recuperación.