İşlem hattı özellikleri referansı

İşlem hattı JSON yapılandırma ayarları ve tablo özellikleri için başvuru. Bu özellikleri ve yapılandırmaları kullanma hakkında daha fazla ayrıntı için aşağıdaki makalelere bakın:

Lakeflow işlem hatları yapılandırması ve Apache Spark™ Bildirimli İşlem Hatları

Lakeflow işlem hatları Apache Spark™ Bildirimli İşlem Hatları (SDP) üzerinde oluşturulur. İşlem hattı yapılandırması büyük ölçüde SDP proje belirtiminin üst kümesidir. SDP ve Lakeflow işlem hatları arasındaki özellik kullanımı farklılıklarına dikkat edilir. Lakeflow işlem hatlarının ve SDP'nin paylaştığı özelliklerin karşılaştırması için bkz. Apache Spark Bildirimli İşlem Hatları.

İşlem hattı yapılandırmaları

  • id

    Tür: string

    Bu boru hattı için küresel olarak benzersiz bir tanımlayıcı. Tanımlayıcı sistem tarafından atanır ve değiştirilemez.

    Yalnızca Lakeflow işlem hatları. SDP işlem hattı tanımlayıcısı atamaz

  • name

    Tür: string

    Bu işlem hattı için kullanıcı dostu bir ad. Ad, kullanıcı arabirimindeki işlem hattı işlerini tanımlamak için kullanılabilir.

    SDP'de gerekli name alan olarak kullanılabilir

  • configuration

    Tür: object

    İşlem hattını çalıştıran kümenin Spark yapılandırmasına eklenecek isteğe bağlı ayarlar listesi. Bu ayarlar işlem hattı çalışma zamanı tarafından okunur ve Spark yapılandırması aracılığıyla işlem hattı sorguları tarafından kullanılabilir.

    Öğeler key:value çiftleri olarak biçimlendirilmelidir.

    SDP'de şu şekilde kullanılabilir: configuration

  • parameters

    Tür: object

    Important

    Bu özellik Beta sürümündedir. Çalışma alanı yöneticileri Bu özelliğe erişimi Önizlemeler sayfasından denetleyebilir. Bkz. Azure Databricks önizlemelerini yönetme.

    İşlem hattı kaynak kodunun adlandırılmış parametre söz dizimi kullanarak başvurabileceği isteğe bağlı anahtar-değer çiftleri eşlemesi (örneğin, :source_catalog). Aynı işlem hattı kaynak kodunu, kaynağı düzenlemeden ortamlar veya veri kümeleri arasında yeniden kullanmak için parametreleri kullanın.

    Tuşlar alfasayısal karakterler, alt çizgi (_), kısa çizgi (-) ve nokta (.) içerebilir. Değerler her zaman dizedir.

    Bir güncelleştirme başlatırken, bir işteki işlem hattı görevinde veya gönderilen iş parametreleriyle bu varsayılanları geçersiz kılabilirsiniz. İşlem hattı parametrelerine yalnızca SQL kaynak kodundan başvurulabilir. Bkz İşlem hatlarıyla parametre kullanımı.

    Yalnızca Lakeflow işlem hatları

  • libraries

    Tür: array of objects

    Kodu ve gerekli artefaktları içeren işlem hattı kod dosyaları dizisi.

    SDP'de olarak librarieskullanılabilir, kod dosyası nesneleri dizisi yerine kaynak dosya glob desenlerinin listesi olarak belirtilir

  • clusters

    Tür: array of objects

    Kümelerin işlem hattını çalıştırması için bir özellikler dizisi.

    Bu belirtilmezse, işlem hatları işlem hattı için varsayılan küme yapılandırmasını otomatik olarak seçer.

    Yalnızca Lakeflow işlem hatları. SDP işlemi yönetmiyor

  • development

    Tür: boolean

    İşlem hattının development veya production modunda çalıştırılıp çalıştırılmayacağını gösteren bir bayrak.

    Varsayılan değer şudur: false.

    Yalnızca Lakeflow işlem hatları

  • notifications

    Tür: array of objects

    Bir işlem hattı güncellemesi tamamlandığında, yeniden denenebilir bir hatayla başarısız olduğunda, yeniden denenemeyen bir hatayla başarısız olduğunda veya bir akış başarısız olduğunda gönderilecek e-posta bildirimleri için isteğe bağlı bir özellikler dizisi.

    Yalnızca Lakeflow işlem hatları

  • continuous

    Tür: boolean

    İşlem hattının sürekli çalıştırılıp çalıştırılmayacağını gösteren bir bayrak.

    Varsayılan değer şudur: false.

    Yalnızca Lakeflow işlem hatları

  • catalog

    Tür: string

    İşlem hattı için tüm veri kümelerinin ve meta verilerin yayımlandığı işlem hattı için varsayılan kataloğun adı. Bu değerin ayarlanması işlem hattı için Unity Kataloğu'nu etkinleştirir.

    Ayarlanmamışsa, işlem hattı storage'da belirtilen konumu kullanarak eski Hive meta veri deposuna yayımlar.

    Eski yayımlama modunda, geçerli işlem hattındaki tüm veri kümelerinin yayımlandığı hedef şemayı içeren kataloğu belirtir. LIVE şeması (eski) sayfasına bakın.

    SDP'de şu şekilde kullanılabilir: catalog

  • schema

    Tür: string

    İşlem hattı için tüm veri kümelerinin ve meta verilerin varsayılan olarak yayımlandığı işlem hattı için varsayılan şemanın adı. Bkz. Hedef kataloğu ve şemayı ayarlama.

    SDP'de olarak databasekullanılabilir ve diğer adı da kabul eder schema

  • target (eski)

    Tür: string

    Geçerli işlem hattında tanımlanan tüm veri kümelerinin yayımlandığı hedef şemanın adı.

    target yerine schema ayarlandığında işlem hattı eski yayımlama modunu kullanacak şekilde yapılandırılır. LIVE şeması (eski) sayfasına bakın.

    Yalnızca Lakeflow işlem hatları

  • storage (eski)

    Tür: string

    DBFS veya bulut depolamada işlem hattı yürütmesi için gereken çıktı verilerinin ve meta verilerin depolandığı bir konum. Tablolar ve meta veriler bu konumun alt dizinlerinde depolanır.

    storage Ayar belirtilmediğinde, sistem varsayılan olarak içindeki dbfs:/pipelines/bir konuma ayarlanır.

    Bir işlem hattı oluşturulduktan sonra storage ayarı değiştirilemez.

    Gerekli storage alan olarak SDP'de kullanılabilir. Lakeflow işlem hatlarında eski storage bir ayardır

  • channel

    Tür: string

    Kullanılacak işlem hattı çalışma zamanının sürümü. Desteklenen değerler şunlardır:

    • çalışma zamanı sürümünde yapılacak değişikliklerle işlem hattınızı test etmek için preview.
    • current, geçerli çalışma zamanı sürümünü kullanmak için.

    channel alanı isteğe bağlıdır. Varsayılan değer şudur: current. Databricks, üretim iş yükleri için geçerli çalışma zamanı sürümünün kullanılmasını önerir.

    Yalnızca Lakeflow işlem hatları

  • edition

    Yaz string

    İşlem hattını çalıştırmak için ürün sürümü. Bu ayar, işlem hattınızın gereksinimlerine göre en iyi ürün sürümünü seçmenize olanak tanır:

    • CORE akış alma iş yüklerini çalıştırmak için.
    • PRO, akış veri alımı ve değişiklik veri yakalama (CDC) iş yüklerini çalıştırmak için kullanılır.
    • ADVANCED akış alma iş yüklerini, CDC iş yüklerini ve veri kalitesi kısıtlamalarının uygulanmasını gerektiren iş yüklerini çalıştırmak için.

    edition alanı isteğe bağlıdır. Varsayılan değer şudur: ADVANCED.

    Yalnızca Lakeflow işlem hatları

  • photon

    Tür: boolean

    İşlem hattını çalıştırmak için Photon nedir? seçeneğinin kullanılıp kullanılmayacağını belirten bir bayrak. Photon, Azure Databricks yüksek performanslı Spark altyapısıdır. Foton özellikli işlem hatları, Photon olmayan işlem hatlarından farklı bir ücretle faturalandırılır.

    photon alanı isteğe bağlıdır. Varsayılan değer şudur: false.

    Yalnızca Lakeflow işlem hatları

  • serverless

    Tür: boolean

    İşlem hattının sunucusuz işlem kullanıp kullanmadığını gösteren bir bayrak. Bkz . Sunucusuz işlem hattı yapılandırma.

    Yalnızca Lakeflow işlem hatları

  • event_log

    Tür: object

    İşlem hattının olay günlüğü hedefi için, olay günlüğünü bir Unity Kataloğu tablosunda yayımlayan , catalogve schema alanlarına sahip namebir nesne olarak yapılandırma. Bkz. İşlem hattı olay günlüğü.

    Yalnızca Lakeflow işlem hatları

  • tags

    Tür: object

    İşlem hattı için kullanıcı tanımlı etiketlerin isteğe bağlı haritası. En fazla 25 etiket eklenebilir.

    Yalnızca Lakeflow işlem hatları

  • budget_policy_id

    Tür: string

    Bu işlem hattına uygulanacak sunucusuz bütçe ilkesinin kimliği, maliyet izleme için sunucusuz kullanımı ilişkilendirmek için kullanılır. Bu alan JSON veya YAML yapılandırmasında yalnızca açıkça bir ilke ayarladığınızda görünür. Ayarlanmamışsa, Azure Databricks varsayılan ilkeyi otomatik olarak çözümler. Çözümlenen ilke işlem hattı ayarları kullanıcı arabiriminde gösterilir, ancak JSON veya YAML yapılandırmasına yazılmaz.

    Yalnızca Lakeflow işlem hatları

  • root_path

    Tür: string

    İşlem hattının kök yolu. Bu dizin ayarlandığında, Python kaynak dosyaları yürütülürken bu dizine eklenirsys.path, böylece modüller buna göre içeri aktarılabilir.

    Yalnızca Lakeflow işlem hatları

  • environment

    Tür: object

    İşlem hattı için Python bağımlılıkları yüklemek için kullanılan ortam belirtimi.

    Yalnızca Lakeflow işlem hatları

  • pipelines.maxFlowRetryAttempts

    Tür: int

    İşlem hattı güncelleştirmesi sırasında yeniden denenebilir bir hata oluşursa, işlem hattı güncelleştirmesinde başarısız olmadan önce bir akışı yeniden denemenin en fazla sayısı budur.

    Bir güncelleştirmenin tamamının durdurulamaması için yeniden denenebilir hatalara eğilimli tek bir akışta yeniden denemeleri sınırlamak için bunu kullanın.

    Varsayılan: İki yeniden deneme denemesi. Yeniden denenebilir bir hata oluştuğunda, işlem hattı çalışma zamanı akışı özgün deneme dahil olmak üzere üç kez çalıştırmayı dener.

    Yalnızca Lakeflow işlem hatları

  • pipelines.numUpdateRetryAttempts

    Tür: int

    Güncelleştirme sırasında yeniden denenebilir bir hata oluşursa, bu, güncelleştirmeyi kalıcı olarak başarısız olmadan önce yeniden deneme sayısı üst sınırıdır. Yeniden deneme tam güncelleştirme olarak çalıştırılır.

    Bir güncelleştirmenin tamamında yeniden denemeleri sınırlamak için bunu kullanın, böylece takılmış güncelleştirme süresiz olarak yeniden denemek yerine kalıcı olarak başarısız olur.

    Bu parametre yalnızca otomatik yeniden deneme ve yeniden başlatma davranışı kullanan işlem hatları için geçerlidir. Geçici güncelleştirmelerin düzenleyiciden çalıştırılması veya bir Validate güncelleştirme çalıştırdığınızda yeniden denemeler yapılmaz.

    Varsayılan:

    • Tetiklenen işlem hatları için beş tanesi.
    • Sürekli boru hatları için sınırsız.

    Yalnızca Lakeflow işlem hatları

İşlem hattı tablosu özellikleri

Delta Lake tarafından desteklenen tablo özelliklerine ek olarak, aşağıdaki tablo özelliklerini ayarlayabilirsiniz.

  • pipelines.autoOptimize.zOrderCols

    Varsayılan: Yok

    Bu tabloyu sıralamak için virgülle ayrılmış sütun adlarının listesini içeren isteğe bağlı bir dize. Örneğin, pipelines.autoOptimize.zOrderCols = "year,month"

    Databricks, işlem hattı tablolarındaki veri düzenini iyileştirmek için Z sırası yerine sıvı kümelemesi önerir. Databricks'in kümeleme sütunlarını otomatik olarak seçmesine ve sürdürmesine izin vermek için (CLUSTER BY AUTO Python) kullanın cluster_by_auto=True . Bkz Tablolar için sıvı kümeleme kullanma.

    Yalnızca Lakeflow işlem hatları

  • pipelines.reset.allowed

    Varsayılan: true

    Bu tablo için tam yenilemeye izin verilip verilmeyeceğini denetler.

    SDP'de şu şekilde kullanılabilir: pipelines.reset.allowed

  • pipelines.autoOptimize.managed

    Varsayılan: true

    Bu tablonun otomatik olarak zamanlanmış iyileştirmesini etkinleştirir veya devre dışı bırakır.

    Tahmine dayalı iyileştirme tarafından yönetilen işlem hatları için bu özellik kullanılmaz.

    Yalnızca Lakeflow işlem hatları

Boru hatlarını tetikleme aralığı

İşlem hattının tamamı için veya veri kümesi bildiriminin bir parçası olarak işlem hattı tetikleyici aralığı belirtebilirsiniz. Bkz. Sürekli işlem hatları için tetikleyici aralığını ayarlama.

  • pipelines.trigger.interval

    Varsayılan değer akış türünü temel alır:

    • Akış sorguları için beş saniye.
    • Tüm giriş verileri Delta kaynaklarından geldiğinde tam sorgular için bir dakika.
    • Delta olmayan bazı veri kaynaklarıyla ilgili sorguların tamamlanması on dakika sürebilir.

    Değer, bir sayı ve zaman birimidir. Geçerli zaman birimleri şunlardır:

    • second, seconds
    • minute, minutes
    • hour, hours
    • day, days

    Değeri tanımlarken tekil veya çoğul birimi kullanabilirsiniz, örneğin:

    • {"pipelines.trigger.interval" : "1 hour"}
    • {"pipelines.trigger.interval" : "10 seconds"}
    • {"pipelines.trigger.interval" : "30 second"}
    • {"pipelines.trigger.interval" : "1 minute"}
    • {"pipelines.trigger.interval" : "10 minutes"}
    • {"pipelines.trigger.interval" : "10 minute"}

    Yalnızca Lakeflow işlem hatları

Kullanıcı tarafından ayarlanamaz küme öznitelikleri

İşlem hatları küme yaşam döngülerini yönettiğinden, birçok küme ayarı sistem tarafından ayarlanır ve kullanıcılar tarafından işlem hattı yapılandırmasında veya işlem hattı tarafından kullanılan bir küme ilkesinde el ile yapılandırılamaz. Aşağıdaki tabloda bu ayarlar ve bunların neden el ile ayarlanamadığı listelenir.

Yalnızca Lakeflow işlem hatları. SDP işlemi yönetmediğinden bu küme öznitelikleri geçerli değildir

  • cluster_name

    SDP, işlem hattı güncelleştirmelerini çalıştırmak için kullanılan kümelerin adlarını ayarlar. Bu adlar geçersiz kılınamaz.

  • data_security_mode

    access_mode

    Bu değerler sistem tarafından otomatik olarak ayarlanır.

  • spark_version

    SDP kümeleri, Databricks Runtime'ın en son özellikleri içerecek şekilde sürekli güncelleştirilen özel bir sürümünde çalışır. Spark sürümü Databricks Runtime sürümüyle birlikte gelir ve geçersiz kılınamaz.

  • autotermination_minutes

    SDP küme otomatik sonlandırma ve yeniden kullanma mantığını yönettiğinden, küme otomatik sonlandırma süresi geçersiz kılınamaz.

  • runtime_engine

    İşlem hattınız için Photon'ı etkinleştirerek bu alanı denetleyebilirsiniz ancak bu değeri doğrudan ayarlayamazsınız.

  • effective_spark_version

    Bu değer sistem tarafından otomatik olarak ayarlanır.

  • cluster_source

    Bu alan sistem tarafından ayarlanır ve salt okunurdur.

  • docker_image

    Küme yaşam döngüsünü SDP yönettiğinden, işlem hattı kümeleriyle özel bir kapsayıcı kullanamazsınız.

  • workload_type

    Bu değer sistem tarafından ayarlanır ve geçersiz kılınamaz.

Kaynak ve sorgu seçenekleri

Bazı veri alma ve işleme davranışları, işlem hattı özellikleri yerine veri kaynağında veya sorguda yapılandırılır. Bunlar şema evrimi, şema ipuçları ve çıkarım, alım hızı sınırları ve dosya filtrelemeyi içerir. Bunları yapılandırmak için read_files ve Otomatik Yükleyici seçeneklerini kullanın. ile from_jsonşema evrimi için bkz. İşlem hatlarında kullanarak from_json şemayı çıkarsama ve geliştirme.