Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Wichtig
Ab dem 20. September 2023 können Sie keine neuen Personalizer-Ressourcen erstellen. Der Personalizer-Service wird am 25. August 2026 eingestellt. Wir empfehlen, zu dem Open-Source-Projekt microsoft/learning-loop zu migrieren.
Die Dienstkonfiguration umfasst die Art, wie der Dienst Belohnungen behandelt, wie oft der Dienst Untersuchungen durchführt, wie oft das Modell neu trainiert wird und wie viele Daten gespeichert werden.
Konfigurieren Sie die Lernschleife auf der Seite Configuration im Azure-Portal für diese Personalizer-Ressource.
Planen von Konfigurationsänderungen
Da einige Konfigurationsänderungen Ihr Modell zurücksetzen, sollten Sie Ihre Konfigurationsänderungen planen.
Wenn Sie planen, den Ausbildungsmodus zu verwenden, stellen Sie sicher, dass Sie Ihre Personalisierungskonfiguration überprüfen, bevor Sie in den Ausbildungsmodus wechseln.
Einstellungen, die das Zurücksetzen des Modells umfassen
Die folgenden Aktionen lösen ein erneutes Training des Modells unter Verwendung der bis zu den letzten zwei Tagen verfügbaren Daten aus.
- Belohnung
- Erkundung
Verwenden Sie zum Löschen aller Ihrer Daten die Seite Modell- und Lerneinstellungen.
Konfigurieren von Belohnungen für die Feedbackschleife
Konfigurieren Sie den Dienst für die Verwendung von Belohnungen in Ihrer Lernschleife. Änderungen an den folgenden Werten setzen das aktuelle Personalisierungsmodell zurück und trainieren es mit den Daten der letzten 2 Tage neu.
| Wert | Zweck |
|---|---|
| Belohnungswartezeit | Legt die Zeitspanne, während der die Personalisierung Werte für einen Rangfolgeaufruf sammelt werden, ab dem Zeitpunkt fest, zu dem der Rangfolgeaufruf erfolgt. Dieser Wert wird durch die Frage „Wie lange sollte die Personalisierung auf Belohnungsaufrufe warten?“ festgelegt. Jede Belohnung, die nach diesem Fenster eingeht, wird protokolliert, aber nicht zum Lernen verwendet. |
| Standardbelohnung | Wenn während des Zeitfensters für das Warten auf die Belohnung kein Belohnungsaufruf bei der Personalisierung eingeht, weist die Personalisierung die Standardbelohnung zu. Standardmäßig und in den meisten Szenarien beträgt die Standardbelohnung 0 (null). |
| Belohnungsaggregation | Wenn mehrere Belohnungen für den gleichen Rangfolge-API-Aufruf empfangen werden, wird diese Aggregationsmethode verwendet: sum oder earliest. „Earliest“ wählt das am frühesten empfangene Ergebnis aus, und der Rest wird verworfen. Dies ist nützlich, wenn Sie eine einzigartige Belohnung unter möglicherweise doppelten Aufrufen wünschen. |
Wählen Sie nach dem Ändern dieser Werte unbedingt Speichern aus.
Konfigurieren der Erkundung, um die Anpassung der Lernschleife zu ermöglichen
Die Personalisierung kann neue Muster ermitteln und im Laufe der Zeit den Verhaltensänderungen der Benutzer durch Durchsuchen von Alternativen anpassen, anstatt die Vorhersage des trainierten Modells zu verwenden. Der Wert Erkundung bestimmt, wie viele Prozent der Ranganfragen durch Erkundung beantwortet werden.
Änderungen an diesem Wert führen dazu, dass das aktuelle Personalisierungsmodell zurückgesetzt und mit den Daten der letzten 2 Tage neu trainiert wird.
Wählen Sie nach dem Ändern dieses Werts unbedingt Speichern aus.
Konfigurieren der Häufigkeit der Modellaktualisierung für das Modelltraining
Die Häufigkeit der Modellaktualisierung legt fest, wie oft das Modell trainiert wird.
| Häufigkeitseinstellung | Zweck |
|---|---|
| 1 Minute | Eine Aktualisierungshäufigkeit von einer Minute ist nützlich beim Debuggen von Anwendungscode mit Personalizer, bei Demos sowie beim interaktiven Testen von Aspekten des maschinellen Lernens. |
| 15 Minuten | Eine hohe Modellaktualisierungshäufigkeit ist hilfreich, wenn Veränderungen beim Benutzerverhalten genau nachverfolgt werden sollen. Beispiele wären etwa Websites mit Livenachrichten, viralen Inhalten oder Livegeboten für Produkte. In solchen Szenarien kann beispielsweise eine Frequenz von 15 Minuten verwendet werden. |
| 1 Stunde | In den meisten Anwendungsfällen ist eine niedrigere Aktualisierungshäufigkeit sinnvoll. |
Wählen Sie nach dem Ändern dieses Werts unbedingt Speichern aus.
Beibehaltung von Daten
Data retention period (Zeitraum für die Datenaufbewahrung) legt fest, wie viele Tage Personalizer Datenprotokolle aufbewahrt. Frühere Datenprotokolle sind zur Durchführung von Offlineauswertungen erforderlich, die verwendet werden, um die Effektivität der Personalisierung zu messen und die Lernrichtlinie zu optimieren.
Wählen Sie nach dem Ändern dieses Werts unbedingt Speichern aus.