Scorer und LLM-Judges

Scorer sind eine wichtige Komponente des MLflow GenAI-Evaluierungsframeworks. Sie bieten eine einheitliche Schnittstelle zum Definieren von Bewertungskriterien für Ihre Modelle, Agents und Anwendungen. Wie ihr Name schon sagt, bewerten Die Scorer, wie gut Ihre Anwendung basierend auf den Bewertungskriterien funktioniert hat. Hierbei kann es sich um einen Pass/Fail-, true/false-, numerischen Wert oder einen kategorisierten Wert handelt.

Sie können denselben Scorer für die Auswertung in der Entwicklung und Überwachung in der Produktion verwenden, um die Auswertung während des gesamten Anwendungslebenszyklus konsistent zu halten.

Wählen Sie den richtigen Scorertyp aus, je nachdem, wie viel Anpassung und Steuerung Sie benötigen. Jeder Ansatz baut auf dem vorherigen auf und fügt mehr Komplexität und Kontrolle hinzu.

Beginnen Sie mit integrierten Richtern für schnelle Auswertung. Entwickeln Sie, wenn sich Ihre Anforderungen ändern, benutzerdefinierte LLM-Judges für domänenspezifische Kriterien und erstellen Sie benutzerdefinierte, codebasierte Scorer für eine deterministische Geschäftslogik.

Ansatz Anpassungsebene Anwendungsfälle
Integrierte Richter Minimal (moderat für Richtlinienrichter) Versuchen Sie schnell die LLM-Auswertung mit integrierten Scorern wie Correctness und RetrievalGroundedness.
Integrierte Bewerter umfassen auch Richtlinien-Bewerter, integrierte Bewerter, die prüfen, ob Antworten benutzerdefinierte, in natürlicher Sprache formulierte Regeln erfüllen oder nicht, z. B. Stilrichtlinien oder Richtlinien zur Faktentreue.
Benutzerdefinierte Richter Alles Erstellen Sie voll angepasste LLM-Richter mit detaillierten Bewertungskriterien und Feedbackoptimierung.
In der Lage, numerische Werte, Kategorien oder boolesche Werte zurückzugeben.
Codebasierte Scorer Alles Programmgesteuerte und deterministische Scorer, die Dinge wie exakte Übereinstimmungen, Formatüberprüfung und Leistungsmetriken auswerten.
Scorer von Drittanbietern Alles Wenn Sie spezielle Metriken benötigen, die in Open-Source-Evaluierungsframeworks verfügbar sind.

Der folgende Screenshot zeigt die Ergebnisse des integrierten LLM-Richters Safety und eines benutzerdefinierten Scorers exact_match:

Beispielmetriken von Scorern

Funktionsweise von Scorern

Ein Scorer empfängt eine Ablaufverfolgung von evaluate() oder dem Überwachungsdienst. Anschließend wird Folgendes ausgeführt:

  1. Analysiert die trace, um bestimmte Felder und Daten zu extrahieren, die zur Bewertung der Qualität verwendet werden.
  2. Führt den Scorer aus, um die Qualitätsbewertung basierend auf den extrahierten Feldern und Daten durchzuführen.
  3. Gibt die Qualitätsbewertung als Feedback zurück, um sie an den trace anzuhängen.

Auswertung Spuren

Auswertungs-UI

LLMs als Richter

LLM-Judges sind eine Art von MLflow Scorer, die große Sprachmodelle zur Qualitätsbewertung verwenden.

Stellen Sie sich einen Richter als KI-Assistent vor, der sich auf die Qualitätsbewertung spezialisiert hat. Sie kann die Eingaben, Ausgaben und sogar den gesamten Ausführungsablauf auswerten, um auf der Grundlage der von Ihnen festgelegten Kriterien Bewertungen vorzunehmen. Beispielsweise kann ein Richter verstehen, dass give me healthy food options und food to keep me fit ähnliche Abfragen sind.

Hinweis

Richter sind eine Art von Scorer, die LLMs für die Bewertung verwenden. Verwenden Sie sie direkt mit mlflow.genai.evaluate() oder umschließen Sie sie in benutzerdefinierte Scorer für erweiterte Bewertungslogiken.

Integrierte LLM-Judges

MLflow bietet forschungsgestützte integrierte Bewerter für gängige Qualitätsdimensionen wie Relevanz, Sicherheit, Faktentreue und Korrektheit. Die vollständige Liste und detaillierte Anleitungen zu den einzelnen Richtern finden Sie in den integrierten LLM-Richtern.

Mehrteilige Judges

Für Unterhaltungs-KI-Systeme bietet MLflow auch integrierte Richter, die ganze Unterhaltungen statt einzelne Wendungen auswerten. Siehe Mehrteilige Judges.

Benutzerdefinierte LLM-Richter

Zusätzlich zu integrierten Richtern können Sie eigene Richter mit benutzerdefinierten Eingabeaufforderungen und Anweisungen erstellen.

Verwenden Sie benutzerdefinierte LLM-Richter, wenn Sie spezielle Auswertungsaufgaben definieren müssen, mehr Kontrolle über Noten oder Bewertungen benötigen (nicht nur Bestanden/Fehlschlagen), oder müssen Sie überprüfen, ob Ihr Agent geeignete Entscheidungen getroffen und Vorgänge ordnungsgemäß für Ihren spezifischen Anwendungsfall ausgeführt hat. Verwenden Sie Judge Alignment, um benutzerdefinierte LLM-Judges so zu trainieren, dass sie durch systematisches Feedback menschlichen Bewertungsstandards entsprechen.

Siehe "Benutzerdefinierte Richter".

Wählen Sie das LLM aus, das den Richter steuert

Standardmäßig verwendet jeder Richter ein vom Databricks gehostetes LLM , das zur Durchführung von GenAI-Qualitätsbewertungen entwickelt wurde. Sie können das Richtermodell ändern, indem Sie das model Argument in der Richterdefinition verwenden. Geben Sie das Modell im Format <provider>:/<model-name>an. Beispiel:

from mlflow.genai.scorers import Correctness

Correctness(model="databricks:/databricks-gpt-5-mini")

Informationen zu den Modellen, die die LLM-Richter unterstützen

  • LLM-Richter können Drittanbieterdienste verwenden, um Ihre KI-Anwendungen zu bewerten, einschließlich Azure OpenAI, betrieben von Microsoft.
  • Bei Azure OpenAI hat Databricks die Missbrauchsüberwachung deaktiviert, sodass keine Eingabeaufforderungen oder Antworten mit Azure OpenAI gespeichert werden.
  • Wenn die geoübergreifende Verarbeitung deaktiviert ist, verarbeiten LLM-Richter Inhalte im Databricks Geo des Arbeitsbereichs. Wenn kein berechtigtes In-Geo-Modell verfügbar ist, gibt der Richter einen Geoeinschränkungsfehler zurück. Wenn die regionsübergreifende Verarbeitung aktiviert ist, können LLM-Bewerter Inhalte in anderen geografischen Regionen verarbeiten.
  • Das Deaktivieren partnergestützter KI-Features verhindert, dass der LLM-Richter Partnermodelle aufruft. Sie können LLM-Richter weiterhin verwenden, indem Sie Ihr eigenes Modell bereitstellen.
  • LLM-Richter sollen Kunden helfen, ihre KI-Agenten/Anwendungen zu bewerten, und LLM-Beurteilungsergebnisse sollten nicht verwendet werden, um eine LLM zu trainieren, zu verbessern oder zu optimieren.

Richtergenauigkeit

Databricks verbessert die Judge-Qualität kontinuierlich durch:

  • Forschungsvalidierung gegen menschliches Expertenurteil
  • Metriknachverfolgung: Cohens Kappa, Genauigkeit, F1-Score
  • Vielfältige Tests auf akademischen und realen Datasets

Codebasierte Scorer

Benutzerdefinierte codebasierte Scorer bieten die ultimative Flexibilität, genau zu definieren, wie die Qualität Ihrer GenAI-Anwendung gemessen wird. Sie können Auswertungsmetriken definieren, die auf Ihren spezifischen Geschäftsanwendungsfall zugeschnitten sind, unabhängig davon, ob sie auf einfachen Heuristiken, erweiterten Logiken oder programmgesteuerten Auswertungen basieren.

Verwenden Sie benutzerdefinierte Scorer für die folgenden Szenarien:

  1. Definieren einer benutzerdefinierten heuristischen oder codebasierten Auswertungsmetrik.
  2. Anpassen der Art und Weise, wie die Daten aus der Ablaufverfolgung Ihrer App den integrierten LLM-Judges zugeordnet werden.
  3. Verwenden Ihres eigenen LLM (anstelle eines von Databricks gehosteten LLM-Judge) zur Auswertung.
  4. Alle anderen Anwendungsfälle, in denen Sie mehr Flexibilität und Kontrolle benötigen als mit benutzerdefinierten LLM-Judges möglich ist.

Siehe codebasierte Bewertungsfunktionen.