Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Important
Bu özellik Genel Önizleme aşamasındadır.
Ile air run gönderdiğiniz her iş yükü hem Databricks iş çalıştırması hem de MLflow çalıştırmasıdır:
- İş çalıştırması (çalışma alanındaki İşler ve İşlem Hatları sayfasında görünür), yürütmeye ilişkin şu bilgileri izler: durum, işlem kaynakları, yeniden denemeler ve sürücü çıkışı.
- MLflow çalıştırması; parametreler, metrikler, sistem metrikleri ve artefaktlar dâhil olmak üzere deneyi takip eder.
Bir gönderim, bir iş çalıştırma işlemi ve bir MLflow çalıştırması oluşturur. Yeniden deneme yeni bir MLflow çalıştırması oluşturur.
Denemeler ve çalıştırmalar
İki iş yükü YAML alanı, çalıştırmanın MLflow'da nasıl görüneceğini denetler:
experiment_name: my-training # Creates or appends to this MLflow experiment
mlflow_run_name: baseline-lr3e5 # Names the MLflow run for this submission
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
command: torchrun --nproc_per_node=8 train.py
max_retries: 2
-
experiment_name(Gerekli): Bu ada sahip bir MLflow deneyi mevcut değilse oluşturur veya mevcut deneye yeni bir çalıştırma ekler. Bir deneme birçok çalıştırma içerir. -
mlflow_run_name(İsteğe bağlı): Çalıştırma adını ayarlar. Atlanırsa, çalıştırma adı varsayılan olarak deneme adı (experiment_name) olur. -
max_retries(İsteğe bağlı): Her yeniden deneme denemesi, aynı denemedeki yeni bir MLflow çalıştırması olduğundan, denemeleri karşılaştırabilirsiniz. İlk gönderim ve yeniden denemeler tek bir iş çalıştırması kullanır.
İşler, MLflow ve önceki iş yükleri arasında gezinin
Üç yerden koşabilirsiniz:
- İşler: İşler çalıştırma sayfası çalıştırmalarınızı listeler ve her çalıştırma kendi MLflow çalıştırmasına ve denemesine bağlanır.
- MLflow: Denemeler sayfasında MLflow denemeleriniz listelenir.
-
Önceki iş yükleri:
air get run <job-run-id>çalıştırmanın işine, deneyine ve MLflow çalıştırmasına ait tıklanabilir bağlantıları yazdırır.air list runsönceki çalıştırmalarınızı listeler ve belirli bir çalıştırmayı bulmak için filtreleme yapmanıza olanak tanır.
air get run <job-run-id> # Links to the job, experiment, and MLflow run
air list runs # List previous runs; filter to find a specific run
Sistem ölçümleri
GPU, CPU ve bellek sistemi ölçümleri her çalıştırma için otomatik olarak yakalanır. Yapılandırma gerekmez. Bunları MLflow çalıştırmasının Sistem ölçümleri sekmesinde görüntüleyin.
Özel ölçümleri günlüğe kaydet
Platform, MLflow çalışmasını oluşturur ve kimliğini MLFLOW_RUN_ID ortam değişkeni üzerinden eğitim sürecinize iletir. Kendi parametrelerinizi, metriklerinizi ve artefaktlarınızı bu çalıştırmaya günlüğe kaydetmek için MLflow izleme API'sini kullanın.
Dağıtılmış (çok düğümlü) iş yüklerinde her düğüm aynı MLflow çalıştırmasını paylaşır. Her ölçümün bir kez kaydedilmesi için yalnızca rank-0 işleminden oturum açın:
import os
import mlflow
# Log from rank 0 only; all nodes share the same MLFLOW_RUN_ID.
if os.environ.get("RANK", "0") == "0":
with mlflow.start_run(run_id=os.environ["MLFLOW_RUN_ID"]):
mlflow.log_param("learning_rate", 3e-4)
for step, loss in enumerate(training_losses):
mlflow.log_metric("train_loss", loss, step=step)
Loglar ve artefaktlar
air logs ile çalıştırma günlüklerini akış olarak görüntüleyin veya indirin:
air logs <job-run-id> # Stream logs from node 0
air logs <job-run-id> --node 2 # Logs from a specific node
air logs <job-run-id> --download-to ./logs/ # Download instead of streaming
Kayıtlar, MLflow çalıştırmasında çıktı olarak da mevcuttur. Model denetim noktalarını kalıcı hale getirmek için bunları bir Unity Kataloğu birimine yazın. Kontrol noktası desenleri ve birimleri yönetmek için Deney izleme ve gözlemlenebilirlik bölümüne bkz.