İşlem hatları için klasik işlem yapılandırma

İşlem ilkelerini, örnek türlerini ve küme ayarlarını denetlemek için Lakeflow işlem hatları için klasik işlem yapılandırın. JSON şeması başvurusu için clusters başvurusundaki tanıma bakın.

Databricks, yeni boru hatları için sunucusuz öneriyor. Belirli örnek türleri, özel hesaplama politikaları, init betikleri, kümede kurulu harici bir JDBC sürücüsü veya sunucusuz bir bölge dışındaki bir çalışma alanı gerektiğinde klasik hesaplamayı seçin. Bkz . Sunucusuz işlem hattı yapılandırma.

Klasik işlem üzerinde çalışan bir işlem hattı oluşturmak için, kullanıcıların önce kısıtlamasız oluşturma izni veya işlem ilkesine erişim olmak üzere klasik işlem dağıtma iznine sahip olması gerekir. Sunucusuz işlem hatları işlem oluşturma izinleri gerektirmez. Varsayılan olarak, tüm çalışma alanı kullanıcıları sunucusuz işlem hatlarını kullanabilir.

Klasik ve sunucusuz hesaplamanın yan yana karşılaştırması ve hangi özelliklerin desteklediği için Pipelines için Sunucusuz vs. klasik hesaplama sayfasına bakınız.

Uyarı

İşlem hattı çalışma zamanı işlem hattı işleminin yaşam döngüsünü yönettiğinden ve Databricks Runtime'ın özel bir sürümünü çalıştırdığından, spark sürümü veya küme adları gibi işlem hattı yapılandırmasında bazı işlem ayarlarını el ile ayarlayamazsınız. Bkz. Kullanıcı tarafından ayarlanamaz küme öznitelikleri.

Boru hattınız için hesaplama seçin

Lakeflow Pipelines Düzenleyicisi'nden işlem hattınız için klasik işlem yapılandırmak için:

  1. Ayarlar'a tıklayın.
  2. İşlem hattı ayarlarının İşlem bölümünde Kalem simgesine tıklayın. Düzenleyin.
  3. Eğer işaretliyse Sunucusuz seçeneğinin işaretini kaldırın.
  4. İşlem ayarlarında başka değişiklikler yapın ve Kaydet'e tıklayın.

Bu işlem hattınızı klasik işlem kullanacak şekilde yapılandırarak işlem ayarlarını aşağıda açıklandığı gibi düzenlemenizi sağlar.

Lakeflow Pipelines Düzenleyicisi hakkında daha fazla bilgi için bkz. Lakeflow Pipelines Düzenleyicisi ile ETL işlem hatlarını geliştirme ve hatalarını ayıklama.

İşlem ilkesi seçme

Çalışma alanı yöneticileri, kullanıcılara işlem hatları için klasik işlem kaynaklarına erişim sağlamak üzere işlem ilkelerini yapılandırabilir. İşlem ilkeleri isteğe bağlıdır. Gerekli işlem ayrıcalıklarınızın eksik olup olmadığını çalışma alanı yöneticinize danışın. Bkz. Lakeflow işlem hatlarında sınırları tanımlama işlem.

İşlem Hatları API'sini kullanırken, işlem ilkesi varsayılan değerlerinin doğru şekilde uygulanmasını sağlamak amacıyla, "apply_policy_default_values": true tanımında clusters ayarlayın.

{
  "clusters": [
    {
      "label": "default",
      "policy_id": "<policy-id>",
      "apply_policy_default_values": true
    }
  ]
}

İşlem etiketlerini yapılandırma

İşlem hattınızın klasik işlem kaynaklarına özel etiketler ekleyebilirsiniz. Etiketler, kuruluşunuzdaki çeşitli gruplar tarafından kullanılan işlem kaynaklarının maliyetini izlemenize olanak sağlar. Databricks bu etiketleri bulut kaynaklarına ve kullanım sistemi tablolarında kaydedilen kullanım günlüklerine uygular. Küme etiketleri kullanıcı arabirimi ayarını kullanarak veya işlem hattınızın JSON yapılandırmasını düzenleyerek etiketler ekleyebilirsiniz.

İşlem hattını çalıştırmak için örnek türlerini seçme

varsayılan olarak işlem hattı, sürücüsü ve çalışan düğümleri için örnek türlerini seçer. İsteğe bağlı olarak örnek türlerini yapılandırabilirsiniz. Örneğin, işlem hattı performansını geliştirmek veya işlem hattınızı çalıştırırken bellek sorunlarını gidermek için örnek türlerini seçin.

Lakeflow Pipelines Düzenleyicisi'nde işlem hattı oluştururken veya düzenlerken örnek türlerini yapılandırmak için:

  1. Ayarlar düğmesine tıklayın.
  2. İşlem hattı ayarlarının İşlem bölümünde Kalem simgesine tıklayın..
  3. Gelişmiş ayarlar bölümünde, işlem hattı için Çalışan türü ve Sürücü türü örnek türlerini seçin.

Güncelleştirme ve bakım kümeleri için ayrı ayarlar yapılandırma

Her bildirim temelli işlem hattının iki ilişkili işlem kaynağı vardır: işlem hattı güncelleştirmelerini işleyen bir güncelleştirme kümesi ve günlük bakım görevlerini ( tahmine dayalı iyileştirme dahil) çalıştıran bir bakım kümesi. varsayılan olarak, işlem yapılandırmalarınız bu kümelerin her ikisine de uygulanır. Her iki küme için de aynı ayarların kullanılması, bir depolama konumu için veri erişim kimlik bilgileri gibi gerekli yapılandırmaların bakım kümesine uygulanmasını sağlayarak bakım çalıştırmalarının güvenilirliğini artırır.

Ayarları iki kümeden yalnızca birine uygulamak için alanı ayar JSON nesnesine ekleyin label . Alan için label üç olası değer vardır:

  • maintenance: Ayarı yalnızca bakım kümesine uygular.
  • updates: Ayarı yalnızca güncelleştirme kümesine uygular.
  • default: Ayarı hem güncelleştirme hem de bakım kümelerine uygular. Bu label alan atlanırsa, varsayılan değerdir.

Çakışan bir ayar varsa veya updates etiketini içeren ayar maintenance etiketle default tanımlanan ayarı geçersiz kılar.

Uyarı

Günlük bakım kümesi yalnızca belirli durumlarda kullanılır:

  • Hive metastore'da depolanan işlem hatları.
  • Sunucusuz işlem hizmet şartlarını kabul etmeyen çalışma alanlarındaki işlem hatları. Koşulları kabul etme konusunda yardıma ihtiyacınız varsa Databricks temsilcinize başvurun.

Örnek: Güncelleştirme kümesi için bir ayar tanımlama

Aşağıdaki örnek, yalnızca küme yapılandırmasına eklenen bir Spark yapılandırma parametresini updates tanımlar:

{
  "clusters": [
    {
      "label": "default",
      "autoscale": {
        "min_workers": 1,
        "max_workers": 5,
        "mode": "ENHANCED"
      }
    },
    {
      "label": "updates",
      "spark_conf": {
        "key": "value"
      }
    }
  ]
}

Uyarı

Klasik işlemde maliyeti kontrol etmek için, gelişmiş otomatik ölçeklendirmeyi ("mode": "ENHANCED") etkinleştirin ve tepe yüküne göre boyutlandırılmış sabit bir çalışan sayısı kullanmak yerine, iş yükünüze uygun gerçekçi min_workers ve max_workers sınırları belirleyin. Bkz. Otomatik ölçeklendirme ile Lakeflow işlem hattı kümesi kullanımını iyileştirme.

Örnek: Güncelleştirme kümesi için örnek türlerini yapılandırma

Kümeye maintenance gereksiz kaynaklar atanmasını önlemek için, bu örnek etiketi kullanarak updates yalnızca updates küme için örnek türlerini ayarlar.

{
  "clusters": [
    {
      "label": "updates",
      "node_type_id": "Standard_D12_v2",
      "driver_node_type_id": "Standard_D3_v2",
      "...": "..."
    }
  ]
}

Hesaplama sonlandırmayı geciktirme

Küme kapatma davranışını denetlemek için işlem hattı yapılandırmasındaki ayarı kullanın pipelines.clusterShutdown.delay . Aşağıdaki örnekte pipelines.clusterShutdown.delay değeri 60 saniye olarak ayarlanır:

{
  "configuration": {
    "pipelines.clusterShutdown.delay": "60s"
  }
}

için pipelines.clusterShutdown.delay varsayılan değer güncelleştirme çalıştırma davranışına bağlıdır: 0 seconds otomatik yeniden deneme ve yeniden başlatma davranışını kullanan güncelleştirmeler ve 2 hours hızlı başlangıç, hata ayıklama odaklı davranış kullanan geçici güncelleştirmeler için.

Uyarı

İşlem hattı işlem kaynakları kullanılmadığında otomatik olarak kapandığından, autotermination_minutes ayarlayan bir işlem ilkesi kullanamazsınız. Bu bir hatayla sonuçlanır.

Tek düğüm hesaplama oluşturma

Tek düğüm işlem, hem ana hem de çalışan işlevi gören bir sürücü düğümüne sahiptir. Bu, az miktarda veri kullanan veya dağıtılmayan iş yüklerine yöneliktir.

Tek düğümlü bir işlem yapmak için num_workers değerini 0 olarak ayarlayın. Örneğin:

{
  "clusters": [
    {
      "num_workers": 0
    }
  ]
}