Overview

Important

Bu özellik Genel Önizleme aşamasındadır.

AI Runtime, Databricks'te derin öğrenme iş yüklerine yönelik bir işlem teklifidir ve Databricks Sunucusuz için GPU desteği sunar. En sevdiğiniz çerçeveleri kullanarak özel modelleri eğitmek ve ince ayar yapmak ve en son verimlilik, performans ve kalite elde etmek için AI Çalışma Zamanı'nı kullanabilirsiniz. Sunucusuz işlemin Databricks mimarisine nasıl uyduğunu gösteren bir genel bakış için bkz. Sunucusuz çalışma alanı mimarisi.

Temel özellikler

AI Runtime, yönetilen GPU altyapısını derin öğrenme için oluşturulmuş bir çalışma zamanıyla birleştirir:

  • Tam olarak yönetilen GPU altyapısı: Sunucusuz, GPU'lara esnek erişim ve yönetecek küme yapılandırması, sürücü seçimi veya otomatik ölçeklendirme ilkeleri yoktur.
  • Derin öğrenme için ayrılmış bir çalışma zamanı: Bağımlılıklar üzerinde maksimum esneklik için en düşük Standart ortamı veya popüler ML çerçeveleriyle önceden yüklenmiş tam özellikli bir yapay zeka ortamı seçin.
  • Sorunsuz geliştirme, veri erişimi ve deneme izleme için not defterleri, işler, Unity Kataloğu ve MLflow arasında yerel olarak tümleştirilmiştir.

Donanım seçenekleri

Tüm AI Çalışma Zamanı hızlandırıcıları tek bir düğüm sağlar. Bu düğümdeki GPU sayısı hızlandırıcı türüne bağlıdır:

Hızlandırıcı Düğüm başına GPU sayısı GPU belleği En iyi kullanım alanları Dağıtılmış eğitim
1xA10 1 24 GB Küçükten orta düzeye ML ve klasik ML modelleri veya daha küçük dil modellerinde ince ayar yapma gibi derin öğrenme görevleri Desteklenmiyor (tek GPU)
1xH100 1 80 GB 1xA10'dan daha fazla GPU belleğine ihtiyaç duyan ancak orta boyutlu dil modellerinde ince ayar yapma gibi çok GPUlu dağıtılmış eğitim gerektirmeyen iş yükleri Desteklenmiyor (tek GPU)
8xH100 8 GPU başına 80 GB Büyük modellerde eğitim veya ince ayar yapma ya da gelişmiş derin öğrenme görevleri çalıştırma dahil olmak üzere büyük ölçekli yapay zeka iş yükleri @distributed dekoratörü gpus=8 ile kullanılarak desteklenir

İpucu

Sadece 8xH100 , çoklu GPU dağıtık eğitimi destekliyor. Tek GPU iş yükleri için, modelinizin GPU belleğine göre 1xA10 veya 1xH100 seçin.

Databricks, derin öğrenme, büyük ölçekli klasik iş yükleri veya GPU'lar içeren özel model eğitimi kullanım örnekleri için AI Runtime'ı önerir.

Örneğin:

  • LLM ince ayarı (LoRA, QLoRA, tam ince ayar)
  • Görüntü işleme (nesne algılama, görüntü sınıflandırma)
  • Derin öğrenme tabanlı öneri sistemleri
  • Pekiştirmeye dayalı öğrenme
  • Derin öğrenme tabanlı zaman serisi tahmini

Gereksinimler

Başlamadan önce, çalışma alanınızın şu gereksinimleri karşıladığından emin olun:

  • Aşağıdaki Azure tarafından desteklenen bölgelerden birinde bir çalışma alanı:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • AI Çalışma Zamanı önizlemesi, workspace admin ayarları üzerinden etkinleştirilmelidir. Manage Databricks önizlemelerine bakınız.

Limitations

Bir AI Çalışma Zamanı iş yükü planlarken aşağıdaki sınırlamaları aklınızda bulundurun:

  • AI Çalışma Zamanı yalnızca A10 ve H100 hızlandırıcılarını destekler.
  • AI Runtime, FedRAMP High veya DoD IL5 standartları için uyumluluk güvenlik profilini desteklemez.
  • Ortamlar panelini kullanarak bağımlılık ekleme, yapay zeka çalışma zamanı zamanlanmış işleri için desteklenmez. Bunun yerine not defterinizde kullanarak %pip install bağımlılıkları program aracılığıyla yükleyin.
  • AI Çalışma Zamanı'ndaki zamanlanmış işler için, not defterinizle ilişkilendirilmiş uyumsuz paket sürümleri için otomatik kurtarma davranışı desteklenmez.
  • AI Runtime bağlantı denemeleri, etkileşimli not defterlerinde 15 dakika sonra; not defteri işleri veya CLI işleri için ise 24 saat sonra sonlandırılır. Bağlantılı notebook oturumları ve notebook işleri iki güne kadar, CLI işleri ise 14 güne kadar çalıştırılabilir. Uzun süren model eğitim işleri için denetim noktası mekanizması uygulayın ve maksimum çalışma süresine ulaşıldığında işi yeniden başlatın.
  • AI Runtime, GPU kaynaklarına isteğe bağlı erişim sağlar. Bu, GPU'lara kolay ve esnek erişim sağlarken, bölgenizde kapasitenin kısıtlandığı veya kullanılamadığı dönemler olabilir.
  • AI Runtime, talebin yüksek olduğu anlarda belirli durumlarda bölgeler arası GPU'lardan yararlanıyor. Bu tür kullanımla ilişkili çıkış maliyetleri olabilir ve bölgeler arası ağ bağlantısı belirli zamanlarda sınırlı olabilir.

AI Runtime'a bağlanma

Not defterlerinden, SSH tüneli kullanan bir IDE terminalinden, zamanlanmış işlerden, Jobs API’den ve Bildirimsel Otomasyon Paketlerinden AI Runtime’a etkileşimli olarak bağlanabilirsiniz. Adım adım talimatlar için bkz. Bir defterden AI Çalışma Zamanına Bağlanın.

Ortamı ayarlama

AI Runtime, iki yönetilen Python ortamı sunar: minimal bir Standart ortam ve PyTorch ile Transformers gibi popüler ML çerçeveleri önceden yüklenmiş, tam özellikli bir Databricks AI ortamı. Ortam seçme, önbelleğe alma davranışı, özel modülleri içeri aktarma ve bilinen sınırlamalar hakkında ayrıntılı bilgi için bkz. Ortamınızı ayarlama.

İpucu

Bağımlılık yığınınız üzerinde tam kontrol için Standard ortamı seçin ya da PyTorch ve Transformers gibi yaygın çerçeveleri yüklemeyi atlamak için Databricks AI ortamını seçin.

Yapay zeka çalışma zamanına veri yükleme

Sorunsuz bir deneyim için yapay zeka çalışma zamanında veri erişiminin nasıl çalıştığını anlamak önemlidir. Ayrıntılar için bkz . Yapay zeka çalışma zamanına veri yükleme.

Dağıtılmış eğitim

AI Runtime, dizüstü bilgisayarınızın bağlı olduğu tek düğüm üzerinde birden çok GPU'yu kullanarak dağıtılmış eğitimi destekler. @distributed Python API’sindeki serverless_gpu dekoratörünü kullanarak, PyTorch DDP, FSDP veya DeepSpeed ile çoklu GPU iş yüklerini minimum yapılandırmayla başlatabilirsiniz. Ayrıntılar için bkz. Not defterlerinde dağıtılmış eğitim.

İpucu

İş yükünüzü tek bir GPU'da doğrulamadan önce dekoratör ile 8xH100'e@distributed ölçeklendirin.

Ray on AI için Çalışma Zamanı

AI Runtime, Ray Core, Ray Data, Ray Train ve Ray Tune dahil olmak üzere dağıtık GPU iş yükleri için Ray'i destekler. Sunucusuz GPU hesaplama üzerinde küme kurulumu olmadan tek ve çok düğümlü Ray işlerini çalıştırabilirsiniz. Detaylar ve örnekler için Ray on AI Runtime bölümüne bakınız.

Deneme izleme ve gözlemlenebilirlik

MLflow tümleştirmesi, günlükleri görüntüleme ve model kontrol noktası yönetimi için Deneme izleme ve gözlemlenebilirlik bölümüne bakın.

Eğitim iş yüklerini üretim ortamına taşıma

Kendi eğitim kodunuzu çalıştırmak, GPU ve CPU görevlerini birleştiren çok görevli işler oluşturmak, işlem hatlarını zamanlamak ve geliştirme ortamından üretim ortamına geçirmek için Bildirimsel Otomasyon Paketleri ile bir Yapay Zekâ Çalışma Zamanı iş yükü dağıtın. Bkz. Eğitim iş yüklerini üretime alma.

Derin öğrenme için Genie Code

Genie Code, AI Runtime'da derin öğrenme iş yüklerinin geliştirilmesine ve sorun gidermesine yardımcı olabilir. Dağıtık eğitim kodu üretebilir, ortam ve bağımlılık sorunlarını çözebilir ve GPU ile dağıtık iş yükü hatalarını araştırabilir. Bkz. Genie Code'u AI Runtime ile kullan.

Guides

Klasik iş yüklerinden, örneğin not defterlerinden geçiş ve sorun giderme için bkz. AI Runtime için kullanıcı kılavuzları.