Bildirim temelli Otomasyon Paketleri ile iş geliştirme

Bildirim temelli Otomasyon Paketleri (eski adıyla Databricks Varlık Paketleri), dağıtmak istediğiniz yapıtları ve çalıştırmak istediğiniz işler gibi Azure Databricks kaynaklarının ayarlarını içerir ve bunları program aracılığıyla doğrulamanızı, dağıtmanızı ve çalıştırmanızı sağlar. Bkz. Bildirim temelli Otomasyon Paketleri nelerdir?.

Bu sayfada, bir işi program aracılığıyla yönetmek için nasıl paket oluşturulacağı açıklanır. Bakınız Lakeflow İşleri. Paket, Python için bir not defteri ve çalıştırılacak işin tanımından oluşan Bildirim temelli Otomasyon Paketleri varsayılan paket şablonu kullanılarak oluşturulur. Ardından dağıtılan işi Azure Databricks çalışma alanınızda doğrular, dağıtır ve çalıştırırsınız.

İpucu

Paketlere taşımak istediğiniz Lakeflow İşleri kullanıcı arabirimi veya API kullanılarak oluşturulmuş mevcut işleriniz varsa, bunları bir paketin yapılandırma dosyalarında tanımlamanız gerekir. Databricks, önce aşağıdaki adımları kullanarak bir paket oluşturmanızı ve ardından paketin çalışıp çalışmadığını doğrulamanızı önerir. Daha sonra pakete ek iş tanımları, not defterleri ve diğer kaynaklar ekleyebilirsiniz. Bkz . Kullanıcı arabirimini kullanarak var olan bir iş tanımını alma.

Sıfırdan bir paket oluşturmak istiyorsanız bkz. El ile paket oluşturma.

Gereksinimler

  • Databricks CLI sürüm 0.218.0 veya üzeri. Yüklü Databricks CLI sürümünüzü denetlemek için komutunu databricks -vçalıştırın. Databricks CLI'yı yüklemek için bkz. Databricks CLI'yı yükleme veya güncelleştirme.
  • uv , testleri çalıştırmak ve bu projenin bağımlılıklarını bir IDE'den yüklemek için gereklidir.
  • Uzak Databricks çalışma alanında çalışma alanı dosyaları etkinleştirilmelidir. Bkz. Çalışma alanı dosyaları nedir?.
  • Mevcut bir katalog. Katalog oluşturmak için bkz. Katalog oluşturma.

1. Adım: Kimlik doğrulamayı ayarlama

İlk olarak, geliştirme makinenizdeki Databricks CLI ile Azure Databricks çalışma alanınız arasında kimlik doğrulamasını ayarlayın. Bu sayfada, OAuth kullanıcıdan makineye (U2M) kimlik doğrulamasını ve kimlik doğrulaması için adlı DEFAULT ilgili Azure Databricks yapılandırma profilini kullanmak istediğiniz varsayılır.

Not (dikkat)

U2M kimlik doğrulaması, bu adımları gerçek zamanlı olarak denemek için uygundur. Tam otomatik iş akışları için Databricks bunun yerine OAuth makineden makineye (M2M) kimlik doğrulamasını kullanmanızı önerir. OAuth ile Azure Databricks'e hizmet sorumlusu erişimi yetkilendirme başlığındaki M2M kimlik doğrulaması kurulum yönergelerine bakın.

  1. Her hedef çalışma alanı için aşağıdaki komutu çalıştırarak yerel olarak OAuth belirteci yönetimini başlatmak için Databricks CLI'sini kullanın.

    Aşağıdaki komutta, <workspace-url>'yi kendi Azure Databricks çalışma alanı başına URL'nizle değiştirin, örneğin https://adb-1234567890123456.7.azuredatabricks.net.

    databricks auth login --host <workspace-url>
    
  2. Databricks CLI, Azure Databricks yapılandırma profili olarak girdiğiniz bilgileri kaydetmenizi ister. Önerilen profil adını kabul etmek için basın Enter veya yeni veya mevcut bir profilin adını girin. Aynı ada sahip mevcut bir profil, girdiğiniz bilgilerle üzerine yazılır. Birden çok çalışma alanında kimlik doğrulama bağlamınızı hızla değiştirmek için profilleri kullanabilirsiniz.

    Mevcut profillerin listesini almak için, ayrı bir terminalde veya komut isteminde Databricks CLI'yı kullanarak komutunu databricks auth profilesçalıştırın. Belirli bir profilin mevcut ayarlarını görüntülemek için komutunu databricks auth env --profile <profile-name>çalıştırın.

  3. Web tarayıcınızda, Azure Databricks çalışma alanınızda oturum açmak için ekrandaki yönergeleri tamamlayın.

  4. Profilin geçerli OAuth belirteci değerini ve belirtecin yaklaşan süre sonu zaman damgasını görüntülemek için aşağıdaki komutlardan birini çalıştırın:

    • databricks auth token --host <workspace-url>
    • databricks auth token -p <profile-name>
    • databricks auth token --host <workspace-url> -p <profile-name>

    Aynı --host değere sahip birden çok profiliniz varsa Databricks CLI'sının --host doğru eşleşen OAuth belirteci bilgilerini bulmasına yardımcı olmak için ve -p seçeneklerini birlikte belirtmeniz gerekebilir.

2. Adım: Paketi başlatma

Varsayılan Python paket projesi şablonunu kullanarak bir paket başlatın.

  1. Yerel geliştirme makinenizde şablonun oluşturulan paketini içerecek bir dizine geçmek için terminalinizi veya komut isteminizi kullanın.

  2. Komutu çalıştırmak için Databricks CLI'yi bundle init kullanın:

    databricks bundle init
    
  3. Template to use için, default-python tuşuna basarak Enter varsayılan değerinde bırakın.

  4. için Unique name for this projectvarsayılan değerini my_projectbırakın veya farklı bir değer yazın ve tuşuna basın Enter. Bu, bu paket için kök dizinin adını belirler. Bu kök dizin, geçerli çalışma dizininizde oluşturulur.

  5. Include a job that runs a notebookiçin yes seçin ve Entertuşuna basın.

  6. Include an ETL pipelineiçin no seçin ve Entertuşuna basın.

  7. Include a stub (sample) Python packageiçin no seçin ve Entertuşuna basın.

  8. Use serverlessiçin yes seçin ve Entertuşuna basın. Bu, Databricks CLI'ya paketinizi sunucusuz işlemde çalışacak şekilde yapılandırmasını sağlar.

  9. Default catalog for any tables created by this project [hive_metastore] için var olan bir Unity Katalog kataloğunun adını girin.

  10. Use a personal schema for each user working on this project. için yes öğesini seçin.

3. Adım: Paketi keşfetme

Şablonun oluşturduğu dosyaları görüntülemek için yeni oluşturduğunuz paketin kök dizinine geçin. Belirli bir ilgi alanı olan dosyalar şunlardır:

  • databricks.yml: Bu dosya paketin programlı adını belirtir, paketin dosyalarına başvurular içerir, katalog ve şema değişkenlerini tanımlar ve hedef çalışma alanlarının ayarlarını belirtir.
  • resources/sample_job.job.yml: Bu dosya, varsayılan not defteri görevi dahil olmak üzere işin ayarlarını belirtir. İş ayarları hakkında bilgi için bkz. .
  • src/: Bu klasör işin kaynak dosyalarını içerir.
  • src/sample_notebook.ipynb: Bu not defteri örnek tabloyu okur.
  • tests/: Bu klasör örnek birim testleri içerir.
  • README.md: Bu dosya, bu paket şablonunu kullanmaya başlama ve kullanma hakkında ek bilgiler içerir.

İpucu

Hedef ayarlarla geçersiz kılma başlığında açıklanan teknikleri kullanarak paketlerde yeni iş kümelerinin ayarlarını tanımlayabilir, birleştirebilir ve geçersiz kılabilirsiniz.

4. Adım: Paket yapılandırmasını doğrulama

Şimdi paket yapılandırmasının geçerli olup olmadığını denetleyin.

  1. Kök dizinden Databricks CLI'sini bundle validate kullanarak şu komutu çalıştırın:

    databricks bundle validate
    
  2. Paket yapılandırmasının özeti döndürülürse doğrulama başarılı olur. Herhangi bir hata döndürülürse, hataları düzeltin ve bu adımı yineleyin.

5. Adım: Paketi uzak çalışma alanına dağıtma

Ardından, işi uzak Azure Databricks çalışma alanınıza dağıtın ve çalışma alanınızdaki işi doğrulayın.

  1. Şu komutu çalıştırmak için paket kökünden Databricks CLI'sini bundle deploy kullanın:

    databricks bundle deploy --target dev
    
  2. Not defterinin dağıtıldığını onaylayın:

    1. Azure Databricks çalışma alanınızın kenar çubuğunda Çalışma Alanı'ya tıklayın.
    2. Users ><your-username>> .bundle ><project-name>> dev > files > src klasörüne tıklayın. Not defteri bu klasörde olmalıdır.
  3. İşin oluşturulup oluşturulmadığını denetleyin:

    1. Azure Databricks çalışma alanınızın kenar çubuğunda İşler ve İşlem Hatları'na tıklayın.
    2. İsteğe bağlı olarak İşler ve Bana ait filtrelerini seçin.
    3. [dev <your-username>] sample_joböğesine tıklayın.
    4. Görevler sekmesine tıklayın. Bir notebook_task olmalı.

Bu adımdan sonra paketinizde herhangi bir değişiklik yaparsanız, paket yapılandırmanızın hala geçerli olup olmadığını denetlemek için 4-5 arası adımları yineleyip projeyi yeniden dağıtmanız gerekir.

6. Adım: Dağıtılan işi çalıştırma

Şimdi komut satırından çalışma alanınızda işin çalıştırılmasını başlatın.

  1. Kök dizinden Databricks CLI'sini bundle run kullanarak şu komutu çalıştırın:

    databricks bundle run --target dev sample_job
    
  2. Terminalinizde görünen değerini Run URL kopyalayın ve bu değeri web tarayıcınıza yapıştırarak Azure Databricks çalışma alanınızı açın. Bkz. Bildirim temelli Otomasyon Paketleri ile oluşturulan bir işi görüntüleme ve çalıştırma

  3. Azure Databricks çalışma alanınızda, iş görevi başarıyla tamamlandıktan ve yeşil başlık çubuğu gösterildikten sonra, sonuçları görmek için iş görevine tıklayın.

Bu adımdan sonra paketinizde herhangi bir değişiklik yaparsanız, paket yapılandırmanızın hala geçerli olup olmadığını denetlemek, projeyi yeniden dağıtmak ve yeniden dağıtılan projeyi çalıştırmak için 4-6 arası adımları yinelemelisiniz.

7. Adım: Testleri çalıştırma

Son olarak, testleri yerel olarak çalıştırmak için kullanın pytest :

uv run pytest

8. Adım: Temizleme

Bu adımda, dağıtılan not defterini ve işi çalışma alanınızdan silersiniz.

  1. Kök dizinden Databricks CLI'sini bundle destroy kullanarak şu komutu çalıştırın:

    databricks bundle destroy --target dev
    
  2. Kalıcı olarak tüm çalışma alanı dosyalarını ve dizinlerini silmek istediğinizde, yazın y ve basın Enter.

  3. Paketi geliştirme makinenizden de silmek istiyorsanız, artık yerel proje dizinini silebilirsiniz.