Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Scorer sind eine wichtige Komponente des MLflow GenAI-Evaluierungsframeworks. Sie bieten eine einheitliche Schnittstelle zum Definieren von Bewertungskriterien für Ihre Modelle, Agents und Anwendungen. Wie ihr Name schon sagt, bewerten Die Scorer, wie gut Ihre Anwendung basierend auf den Bewertungskriterien funktioniert hat. Hierbei kann es sich um einen Pass/Fail-, true/false-, numerischen Wert oder einen kategorisierten Wert handelt.
Sie können denselben Scorer für die Auswertung in der Entwicklung und Überwachung in der Produktion verwenden, um die Auswertung während des gesamten Anwendungslebenszyklus konsistent zu halten.
Wählen Sie den richtigen Scorertyp aus, je nachdem, wie viel Anpassung und Steuerung Sie benötigen. Jeder Ansatz baut auf dem vorherigen auf und fügt mehr Komplexität und Kontrolle hinzu.
Beginnen Sie mit integrierten Richtern für schnelle Auswertung. Entwickeln Sie, wenn sich Ihre Anforderungen ändern, benutzerdefinierte LLM-Judges für domänenspezifische Kriterien und erstellen Sie benutzerdefinierte, codebasierte Scorer für eine deterministische Geschäftslogik.
| Ansatz | Anpassungsebene | Anwendungsfälle |
|---|---|---|
| Integrierte Richter | Minimal (moderat für Richtlinienrichter) | Versuchen Sie schnell die LLM-Auswertung mit integrierten Scorern wie Correctness und RetrievalGroundedness.Integrierte Bewerter umfassen auch Richtlinien-Bewerter, integrierte Bewerter, die prüfen, ob Antworten benutzerdefinierte, in natürlicher Sprache formulierte Regeln erfüllen oder nicht, z. B. Stilrichtlinien oder Richtlinien zur Faktentreue. |
| Benutzerdefinierte Richter | Alles | Erstellen Sie voll angepasste LLM-Richter mit detaillierten Bewertungskriterien und Feedbackoptimierung. In der Lage, numerische Werte, Kategorien oder boolesche Werte zurückzugeben. |
| Codebasierte Scorer | Alles | Programmgesteuerte und deterministische Scorer, die Dinge wie exakte Übereinstimmungen, Formatüberprüfung und Leistungsmetriken auswerten. |
| Scorer von Drittanbietern | Alles | Wenn Sie spezielle Metriken benötigen, die in Open-Source-Evaluierungsframeworks verfügbar sind. |
Der folgende Screenshot zeigt die Ergebnisse des integrierten LLM-Richters Safety und eines benutzerdefinierten Scorers exact_match:
Funktionsweise von Scorern
Ein Scorer empfängt eine Ablaufverfolgung von evaluate() oder dem Überwachungsdienst. Anschließend wird Folgendes ausgeführt:
- Analysiert die
trace, um bestimmte Felder und Daten zu extrahieren, die zur Bewertung der Qualität verwendet werden. - Führt den Scorer aus, um die Qualitätsbewertung basierend auf den extrahierten Feldern und Daten durchzuführen.
- Gibt die Qualitätsbewertung als
Feedbackzurück, um sie an dentraceanzuhängen.
LLMs als Richter
LLM-Judges sind eine Art von MLflow Scorer, die große Sprachmodelle zur Qualitätsbewertung verwenden.
Stellen Sie sich einen Richter als KI-Assistent vor, der sich auf die Qualitätsbewertung spezialisiert hat. Sie kann die Eingaben, Ausgaben und sogar den gesamten Ausführungsablauf auswerten, um auf der Grundlage der von Ihnen festgelegten Kriterien Bewertungen vorzunehmen. Beispielsweise kann ein Richter verstehen, dass give me healthy food options und food to keep me fit ähnliche Abfragen sind.
Hinweis
Richter sind eine Art von Scorer, die LLMs für die Bewertung verwenden. Verwenden Sie sie direkt mit mlflow.genai.evaluate() oder umschließen Sie sie in benutzerdefinierte Scorer für erweiterte Bewertungslogiken.
Integrierte LLM-Judges
MLflow bietet forschungsgestützte integrierte Bewerter für gängige Qualitätsdimensionen wie Relevanz, Sicherheit, Faktentreue und Korrektheit. Die vollständige Liste und detaillierte Anleitungen zu den einzelnen Richtern finden Sie in den integrierten LLM-Richtern.
Mehrteilige Judges
Für Unterhaltungs-KI-Systeme bietet MLflow auch integrierte Richter, die ganze Unterhaltungen statt einzelne Wendungen auswerten. Siehe Mehrteilige Judges.
Benutzerdefinierte LLM-Richter
Zusätzlich zu integrierten Richtern können Sie eigene Richter mit benutzerdefinierten Eingabeaufforderungen und Anweisungen erstellen.
Verwenden Sie benutzerdefinierte LLM-Richter, wenn Sie spezielle Auswertungsaufgaben definieren müssen, mehr Kontrolle über Noten oder Bewertungen benötigen (nicht nur Bestanden/Fehlschlagen), oder müssen Sie überprüfen, ob Ihr Agent geeignete Entscheidungen getroffen und Vorgänge ordnungsgemäß für Ihren spezifischen Anwendungsfall ausgeführt hat. Verwenden Sie Judge Alignment, um benutzerdefinierte LLM-Judges so zu trainieren, dass sie durch systematisches Feedback menschlichen Bewertungsstandards entsprechen.
Siehe "Benutzerdefinierte Richter".
Wählen Sie das LLM aus, das den Richter steuert
Standardmäßig verwendet jeder Richter ein vom Databricks gehostetes LLM , das zur Durchführung von GenAI-Qualitätsbewertungen entwickelt wurde. Sie können das Richtermodell ändern, indem Sie das model Argument in der Richterdefinition verwenden. Geben Sie das Modell im Format <provider>:/<model-name>an. Beispiel:
from mlflow.genai.scorers import Correctness
Correctness(model="databricks:/databricks-gpt-5-mini")
Informationen zu den Modellen, die die LLM-Richter unterstützen
- LLM-Richter können Drittanbieterdienste verwenden, um Ihre KI-Anwendungen zu bewerten, einschließlich Azure OpenAI, betrieben von Microsoft.
- Bei Azure OpenAI hat Databricks die Missbrauchsüberwachung deaktiviert, sodass keine Eingabeaufforderungen oder Antworten mit Azure OpenAI gespeichert werden.
- Wenn die geoübergreifende Verarbeitung deaktiviert ist, verarbeiten LLM-Richter Inhalte im Databricks Geo des Arbeitsbereichs. Wenn kein berechtigtes In-Geo-Modell verfügbar ist, gibt der Richter einen Geoeinschränkungsfehler zurück. Wenn die regionsübergreifende Verarbeitung aktiviert ist, können LLM-Bewerter Inhalte in anderen geografischen Regionen verarbeiten.
- Das Deaktivieren partnergestützter KI-Features verhindert, dass der LLM-Richter Partnermodelle aufruft. Sie können LLM-Richter weiterhin verwenden, indem Sie Ihr eigenes Modell bereitstellen.
- LLM-Richter sollen Kunden helfen, ihre KI-Agenten/Anwendungen zu bewerten, und LLM-Beurteilungsergebnisse sollten nicht verwendet werden, um eine LLM zu trainieren, zu verbessern oder zu optimieren.
Richtergenauigkeit
Databricks verbessert die Judge-Qualität kontinuierlich durch:
- Forschungsvalidierung gegen menschliches Expertenurteil
- Metriknachverfolgung: Cohens Kappa, Genauigkeit, F1-Score
- Vielfältige Tests auf akademischen und realen Datasets
Codebasierte Scorer
Benutzerdefinierte codebasierte Scorer bieten die ultimative Flexibilität, genau zu definieren, wie die Qualität Ihrer GenAI-Anwendung gemessen wird. Sie können Auswertungsmetriken definieren, die auf Ihren spezifischen Geschäftsanwendungsfall zugeschnitten sind, unabhängig davon, ob sie auf einfachen Heuristiken, erweiterten Logiken oder programmgesteuerten Auswertungen basieren.
Verwenden Sie benutzerdefinierte Scorer für die folgenden Szenarien:
- Definieren einer benutzerdefinierten heuristischen oder codebasierten Auswertungsmetrik.
- Anpassen der Art und Weise, wie die Daten aus der Ablaufverfolgung Ihrer App den integrierten LLM-Judges zugeordnet werden.
- Verwenden Ihres eigenen LLM (anstelle eines von Databricks gehosteten LLM-Judge) zur Auswertung.
- Alle anderen Anwendungsfälle, in denen Sie mehr Flexibilität und Kontrolle benötigen als mit benutzerdefinierten LLM-Judges möglich ist.