Konfigurieren der Lernschleife von Personalizer

Wichtig

Ab dem 20. September 2023 können Sie keine neuen Personalizer-Ressourcen erstellen. Der Personalizer-Service wird am 25. August 2026 eingestellt. Wir empfehlen, zu dem Open-Source-Projekt microsoft/learning-loop zu migrieren.

Die Dienstkonfiguration umfasst die Art, wie der Dienst Belohnungen behandelt, wie oft der Dienst Untersuchungen durchführt, wie oft das Modell neu trainiert wird und wie viele Daten gespeichert werden.

Konfigurieren Sie die Lernschleife auf der Seite Configuration im Azure-Portal für diese Personalizer-Ressource.

Planen von Konfigurationsänderungen

Da einige Konfigurationsänderungen Ihr Modell zurücksetzen, sollten Sie Ihre Konfigurationsänderungen planen.

Wenn Sie planen, den Ausbildungsmodus zu verwenden, stellen Sie sicher, dass Sie Ihre Personalisierungskonfiguration überprüfen, bevor Sie in den Ausbildungsmodus wechseln.

Einstellungen, die das Zurücksetzen des Modells umfassen

Die folgenden Aktionen lösen ein erneutes Training des Modells unter Verwendung der bis zu den letzten zwei Tagen verfügbaren Daten aus.

  • Belohnung
  • Erkundung

Verwenden Sie zum Löschen aller Ihrer Daten die Seite Modell- und Lerneinstellungen.

Konfigurieren von Belohnungen für die Feedbackschleife

Konfigurieren Sie den Dienst für die Verwendung von Belohnungen in Ihrer Lernschleife. Änderungen an den folgenden Werten setzen das aktuelle Personalisierungsmodell zurück und trainieren es mit den Daten der letzten 2 Tage neu.

Konfigurieren der Belohnungswerte für die Feedbackschleife

Wert Zweck
Belohnungswartezeit Legt die Zeitspanne, während der die Personalisierung Werte für einen Rangfolgeaufruf sammelt werden, ab dem Zeitpunkt fest, zu dem der Rangfolgeaufruf erfolgt. Dieser Wert wird durch die Frage „Wie lange sollte die Personalisierung auf Belohnungsaufrufe warten?“ festgelegt. Jede Belohnung, die nach diesem Fenster eingeht, wird protokolliert, aber nicht zum Lernen verwendet.
Standardbelohnung Wenn während des Zeitfensters für das Warten auf die Belohnung kein Belohnungsaufruf bei der Personalisierung eingeht, weist die Personalisierung die Standardbelohnung zu. Standardmäßig und in den meisten Szenarien beträgt die Standardbelohnung 0 (null).
Belohnungsaggregation Wenn mehrere Belohnungen für den gleichen Rangfolge-API-Aufruf empfangen werden, wird diese Aggregationsmethode verwendet: sum oder earliest. „Earliest“ wählt das am frühesten empfangene Ergebnis aus, und der Rest wird verworfen. Dies ist nützlich, wenn Sie eine einzigartige Belohnung unter möglicherweise doppelten Aufrufen wünschen.

Wählen Sie nach dem Ändern dieser Werte unbedingt Speichern aus.

Konfigurieren der Erkundung, um die Anpassung der Lernschleife zu ermöglichen

Die Personalisierung kann neue Muster ermitteln und im Laufe der Zeit den Verhaltensänderungen der Benutzer durch Durchsuchen von Alternativen anpassen, anstatt die Vorhersage des trainierten Modells zu verwenden. Der Wert Erkundung bestimmt, wie viele Prozent der Ranganfragen durch Erkundung beantwortet werden.

Änderungen an diesem Wert führen dazu, dass das aktuelle Personalisierungsmodell zurückgesetzt und mit den Daten der letzten 2 Tage neu trainiert wird.

Der Wert „Erkundung“ bestimmt, wie viel Prozent der Rangfolgeaufrufe mit einem Durchsuchen beantwortet werden.

Wählen Sie nach dem Ändern dieses Werts unbedingt Speichern aus.

Konfigurieren der Häufigkeit der Modellaktualisierung für das Modelltraining

Die Häufigkeit der Modellaktualisierung legt fest, wie oft das Modell trainiert wird.

Häufigkeitseinstellung Zweck
1 Minute Eine Aktualisierungshäufigkeit von einer Minute ist nützlich beim Debuggen von Anwendungscode mit Personalizer, bei Demos sowie beim interaktiven Testen von Aspekten des maschinellen Lernens.
15 Minuten Eine hohe Modellaktualisierungshäufigkeit ist hilfreich, wenn Veränderungen beim Benutzerverhalten genau nachverfolgt werden sollen. Beispiele wären etwa Websites mit Livenachrichten, viralen Inhalten oder Livegeboten für Produkte. In solchen Szenarien kann beispielsweise eine Frequenz von 15 Minuten verwendet werden.
1 Stunde In den meisten Anwendungsfällen ist eine niedrigere Aktualisierungshäufigkeit sinnvoll.

„Model update frequency“ legt fest, wie oft ein neues Personalisierungsmodell neu trainiert wird.

Wählen Sie nach dem Ändern dieses Werts unbedingt Speichern aus.

Beibehaltung von Daten

Data retention period (Zeitraum für die Datenaufbewahrung) legt fest, wie viele Tage Personalizer Datenprotokolle aufbewahrt. Frühere Datenprotokolle sind zur Durchführung von Offlineauswertungen erforderlich, die verwendet werden, um die Effektivität der Personalisierung zu messen und die Lernrichtlinie zu optimieren.

Wählen Sie nach dem Ändern dieses Werts unbedingt Speichern aus.

Nächste Schritte

Informationen zum Verwalten Ihres Modells