Auswerten einer RAG-Lösung
Tip
Weitere Details finden Sie auf der Registerkarte "Text und Bilder ".
Eine RAG-Anwendung ist eine Pipeline, so dass eine gute Antwort allein nicht beweist, dass die gesamte Lösung gut funktioniert. Die Auswertung sollte sowohl die abgerufenen Informationen als auch die daraus generierte Antwort untersuchen.
Abrufen auswerten
Die Abrufauswertung fragt, ob das Suchsystem nützliche Quellinhalte zurückgibt.
Berücksichtigen Sie für eine Reihe von repräsentativen Fragen Folgendes:
- Relevanz: Adressiert die abgerufenen Blöcke die Frage?
- Abdeckung: Sind alle Informationen erforderlich, um eine vollständige Antwort zu beantworten?
- Ranking: Sind die stärksten Ergebnisse vor schwächeren platziert?
- Sicherheit und Aktualität: Ist der Inhalt für den Benutzer autorisiert und immer noch aktuell?
Wenn die richtigen Informationen nicht abgerufen werden, löst das Ändern der Generierungsaufforderung allein das Problem nicht. Möglicherweise müssen Sie Quellinhalte, Blockgrenzen, Metadaten, Abfrageverarbeitung, Suchstrategie oder Rangfolge verbessern.
Generierung auswerten
Die Bewertung der Generation berücksichtigt, wie das Modell abgerufenen Kontext verwendet.
Zu den Überlegungen zur Auswertung generierter Inhalte gehören:
- Grundgefühl: Wird jeder Anspruch von den abgerufenen Inhalten unterstützt?
- Relevanz: Beantwortet die Antwort direkt die Frage des Benutzers?
- Vollständigkeit: Enthält die Antwort die wichtigen Informationen im Kontext?
- Zitatqualität: Verweisen Zitate auf Quellen, die die zugehörigen Ansprüche unterstützen?
- Angemessene Unsicherheit: Vermeidet die Anwendung das Erraten, wenn der Kontext nicht ausreicht?
Ein nützlicher Testsatz enthält realistische Fragen, erwartete Quellpassagen und Kriterien für akzeptable Antworten. Sie sollte auch schwierige Fälle umfassen, z. B. mehrdeutige Fragen, Fragen ohne Antwort in den Daten, veraltete Dokumente und Versuche, nicht autorisierte Informationen abzurufen.
Ausgleich von Qualität, Latenz und Kosten
Durch das Abrufen und Verarbeiten von mehr Datenblöcken kann die Abdeckung verbessert werden, aber auch die Promptgröße, die Reaktionszeit und die Kosten werden erhöht. Zu viel Kontext kann es sogar erschweren, dass sich das Modell auf die relevantesten Beweise konzentrieren kann. Das RAG-Design umfasst daher einen Ausgleich der Antwortqualität mit Latenz und Kosten.
Die Überwachung der tatsächlichen Nutzung kann unbeantwortete Fragen, schwache Zitate, langsame Suchvorgänge und Änderungen der Inhaltsqualität zeigen. Verwenden Sie diese Beobachtungen, um die Pipeline zu verbessern und neu zu bewerten, wenn Daten, Modelle, Eingabeaufforderungen oder Abrufeinstellungen geändert werden.