Fabric Runtime 2.0 (GA)

Fabric Runtime, Fabric ekosisteminde sorunsuz entegrasyon sağlar ve Apache Spark tarafından desteklenen veri mühendisliği ve veri bilimi projeleri için sağlam bir ortam sunar.

Bu makale, Microsoft Fabric'te büyük veri hesaplamaları için tasarlanmış en yeni genel çalışma zamanı olan Fabric Runtime 2.0'ı tanıtmaktadır. Bu sürümü ölçeklenebilir analiz ve gelişmiş iş yükleri için önemli bir adım haline getiren temel özellikleri ve bileşenleri vurgular.

Fabric Runtime 2.0, veri işleme özelliklerinizi geliştirmek için tasarlanmış aşağıdaki bileşenleri ve yükseltmeleri içerir:

  • Apache Spark 4.1
  • İşletim Sistemi: Azure Linux 3.0 (Mariner 3.0)
  • Java: 21
  • Scala: 2.13
  • Python: 3.13
  • Delta Gölü: 4.2
  • R: 4.5.2

Önemli

Fabric ekibi, Fabric Runtime 2.0 için bir güncelleme yayınlıyor. Bu güncellemenin bir parçası olarak, Python yükseltmesi, python ve tekerlek kütüphanelerine sahip çevre öğeleri kullanan müşteriler için son derece belirleyici bir değişiklik getiriyor. Müşteriler, notebook veya Spark iş tanımı (SJD) çalıştırıldığında iki hata mesajından birini görür:

  • Hata: uyarı: 1 kullanımdan kaldırma uyarısı (2.13.0'dan beri); ayrıntılar için :setting -deprecation veya :replay -deprecation seçeneğini etkinleştirin Kaynak: SparkCoreService.
  • "LibraryManagementError": "Temel Spark Python ortamına bir yükseltme tespit edildi. Lütfen ortamı yeniden yayınlayın.|UserError"

Gerekli eylemler

Ortamınızı (kütüphaneler dahil) yeniden yayınlayın. Bunu yapmak için tüm kütüphaneleri kaldırın, Çevre'yi yayınlayın, tüm kütüphaneleri tekrar ekleyin ve bir kez daha yayınlayın. Bu süreç, güncellenmiş Python çalışma zamanını kullanarak ortamı yeniden oluşturur ve sorunu çözer.

İpucu

Fabric Runtime 2.0, daha fazla maliyet olmadan performansı önemli ölçüde geliştirebilen Yerel Yürütme Altyapısı desteği içerir. Tüm işlerin ve not defterlerinin gelişmiş performans özelliklerini otomatik olarak devralması için yerel yürütme altyapısını ortam düzeyinde etkinleştirebilirsiniz.

Çalışma Zamanı 2.0'i etkinleştirme

Çalışma zamanı 2.0'i çalışma alanı düzeyinde veya ortam öğesi düzeyinde etkinleştirebilirsiniz. Çalışma alanınızdaki tüm Spark iş yükleri için varsayılan olarak Çalışma Zamanı 2.0'ı uygulamak için çalışma alanı ayarını kullanın. Alternatif olarak, çalışma alanı varsayılanını geçersiz kılan belirli not defterleriyle veya Spark iş tanımlarıyla kullanmak üzere Çalışma Zamanı 2.0 ile bir ortam öğesi oluşturun.

Çalışma Alanı ayarlarında Çalışma Zamanı 2.0'ı etkinleştirme

Çalışma Zamanı 2.0'ı tüm çalışma alanınız için varsayılan olarak ayarlamak için:

  1. Fabric çalışma alanınızdaki Çalışma Alanı ayarları sayfasına gidin.

    Çalışma alanı ayarları için çalışma zamanı sürümünün seçileceği yeri gösteren ekran görüntüsü.

  2. Veri Mühendisliği/Bilim sekmesini ve ardından Spark ayarları'nı seçin.

  3. Ortam sekmesini seçin.

  4. Runtime sürüm açılır menüsünden 2.0'ı (Spark 4.1, Delta 4.2) seçin ve değişikliklerinizi kaydedin.

  5. Çalışma zamanı 2.0, çalışma alanınız için varsayılan çalışma zamanı olarak ayarlanır.

Ortam öğesinde Çalışma Zamanı 2.0'i etkinleştirme

Çalışma Zamanı 2.0'ı belirli not defterleriyle veya Spark iş tanımlarıyla kullanmak için:

  1. Yeni bir Ortam öğesi oluşturun veya var olan bir öğeyi açın.

  2. Runtime açılır menüsünden 2.0 (Spark 4.1, Delta 4.2) seçin, değişikliklerinizi kaydet ve Yayımla.

    Ortam öğesi için çalışma zamanı sürümünün seçileceği yeri gösteren ekran görüntüsü.

  3. Sonra, bu Çevre öğesini Notebook veya Spark İş Tanımı ile kullanın.

Artık Fabric Runtime 2.0'da tanıtılan en yeni iyileştirmeler ve işlevlerle (Spark 4.1 ve Delta Lake 4.2) çalışmaya başlayabilirsiniz.

Uyarı

Runtime 2.0 genel olarak mevcut ve üretim kullanımına hazır olsa da, henüz varsayılan çalışma zamanı değil. Mevcut varsayılan çalışma zamanına güvenen müşterilere iş yüklerini doğrulamak ve geçiş planlamak için ekstra zaman vermek için, açıkça Runtime 2.0'a geçmeleri gerekir. Plan, Runtime 2.0'ı kullanıcı deneyiminde varsayılan çalışma zamanı seçimi ve Eylül 2026'nın sonlarında yeni çalışma alanları ile ortam öğeleri için varsayılan çalışma zamanı haline getirmek. Bu aşamalı yaklaşım, müşterilerin Runtime 2.0'ı kendi hızlarında benimsemelerine ve onaylamalarına yardımcı olurken, öngörülebilir bir geçiş zaman çizelgesinden faydalanır.

İpucu

Güncel bilgiler, değişikliklerin ayrıntılı bir listesi ve Fabric çalışma zamanlarına yönelik belirli sürüm notları için Spark Çalışma Zamanları Yayınları ve Güncellemeleri'ne göz atın ve abone olun.

Önemli noktalar

Performans ve yürütme altyapısı geliştirmeleri

Fabric Runtime 2.0, açık kaynak Spark üzerinde önemli performans geliştirmeleri sağlayan Yerel Yürütme Altyapısı'nı içerir. Motor işleyici, kod değişikliğine gerek kalmadan lakehouse altyapısındaki Spark sorgularını hızlandırmak için vektörleştirilmiş işleme kullanır.

Çalışma Zamanı 2.0'daki temel performans özellikleri:

  • Altı kata kadar daha hızlı: Karşılaştırmalar, TPC-DS iş yüklerinde açık kaynak Spark ile karşılaştırıldığında altı kata kadar daha hızlı performans gösterir.
  • Vektörleştirilmiş CSV ayrıştırma: Yerel yürütme altyapısı, CSV alımını ve sorgu iş yüklerini hızlandıran vektörleştirilmiş bir CSV ayrıştırıcısı içerir. Gelecekteki güncelleştirmeler için vektörleştirilmiş JSON ayrıştırma ve Spark Yapılandırılmış Akış desteği planlanıyor.

Yerel yürütme altyapısını etkinleştirmek için bkz. Doku Veri Mühendisliği için yerel yürütme altyapısı.

Apache Spark 4.1

Apache Spark 4.0 , 4.x serisinin ilk sürümü olarak önemli bir kilometre taşını işaret etti ve canlı açık kaynak topluluğunun kolektif çalışmasını içeriyordu. Fabric Runtime 2.0 artık Apache Spark 4.1 üzerinde çalıştırılır ve bu da temel üzerinde ek geliştirmeler sağlar.

Bu sürümde Spark SQL, DEĞIŞKEN veri türü desteği, SQL kullanıcı tanımlı işlevler, oturum değişkenleri, kanal söz dizimi ve dize harmanlaması gibi SQL iş yükleri için ifade ve çok yönlülüğü artırmak üzere tasarlanmış güçlü yeni özelliklerle önemli ölçüde zenginleştirilmiştir. PySpark'in hem işlevsel genişliğini hem de genel geliştirici deneyimini iyileştirmeye yönelik sürekli bağlılığı, yerleşik bir çizim API'si, yeni bir Python Veri Kaynağı API'si, Python UDTF'ler için destek ve PySpark UDF'leri için birleşik profil oluşturmanın yanı sıra birçok başka geliştirme getiriyor. Yapılandırılmış Akış, özellikle daha esnek durum yönetimi için Rastgele Durum API'sinin v2 ve daha kolay hata ayıklama için Durum Veri Kaynağı'nın kullanıma sunulması gibi daha fazla denetim ve hata ayıklama kolaylığı sağlayan temel eklemelerle gelişir.

Tam listeyi ve ayrıntılı değişiklikleri buradan de kontrol edebilirsiniz:

Uyarı

Spark 4.x'te SparkR kullanım dışıdır ve gelecekteki bir sürümde kaldırılabilir.

Delta Gölü 4.2

Delta Lake 4.2, önceki Delta Lake sürümlerinin üzerine inşa ederek Delta Lake'i formatlar arasında birlikte çalışabilir, daha kolay ve daha performanslı hale getirme taahhüdünü sürdürüyor. Açık data lakehouse'ların geleceği için güçlü yeni özellikler, performans iyileştirmeleri ve temel iyileştirmeler içerir.

Delta Lake 3.3, 4.0, 4.1 ve 4.2 ile getirilen tam liste ve detaylı değişiklikler için bakınız:

Veri düzeni ve iyileştirme

Çalışma zamanı 2.0, Delta tabloları için veri düzeni ve iyileştirme özelliklerini destekler:

  • Z sıralama: Filtrelenmiş sorgular için sorgu performansını geliştirmek için Delta tablo dosyalarındaki verileri belirtilen sütunlara göre düzenleyin.
  • Sıvı Kümelemesi: El ile bakım yapmadan veri düzenini otomatik olarak en iyi duruma getiren esnek bir kümeleme yaklaşımı.
  • Paralel Delta anlık görüntüsü yükleme: Yerel yürütme altyapısı Delta tablosu anlık görüntülerini paralel olarak yükleyerek büyük tablolar için sorgu başlatma süresini kısaltır.

Önemli

Delta Lake 4.2'ye özgü özellikler deneyseldir ve yalnızca Defterler ve Spark İş Tanımları gibi Spark deneyimlerinde çalışır. Birden çok Microsoft Fabric iş yükünde aynı Delta Lake tablolarını kullanmanız gerekiyorsa bu özellikleri etkinleştirmeyin. Tüm Microsoft Fabric deneyimlerinde hangi protokol sürümlerinin ve özelliklerinin uyumlu olduğu hakkında daha fazla bilgi edinmek için Delta Lake tablo formatı birlikte çalışabilirliğine bakınız.

Çalışma Zamanı 2.0'da işlem yönetimi

Çalışma zamanı 2.0 aşağıdaki işlem yönetimi özelliklerini destekler:

  • Kaynak profilleri: Spark oturumları için önceden tanımlanmış kaynak ayırmalarını iş yükü gereksinimlerini karşılayacak ve maliyetleri denetleyecek şekilde yapılandırın.
  • Özel canlı havuzlar (önizleme):Oturum başlatma süresini azaltan ayrılmış, önceden ısıtılmış Spark havuzları oluşturun. Özel canlı havuzlar, Çalışma Zamanı 2.0 iş yükleri için önizlemede kullanılabilir.

Sınırlamalar ve notlar

  • Delta Lake 4.x'e özgü özellikler deneyseldir ve yalnızca not defterleri ve Spark iş tanımları gibi Spark deneyimlerinde çalışır. Birden çok Fabric iş yükünde aynı Delta Lake tablolarını kullanmanız gerekiyorsa, bu özellikleri etkinleştirmeyin. Daha fazla bilgi için bkz . Delta Lake tablo biçimi birlikte çalışabilirliği.
  • Fabric Spark için VS Code uzantısı, not defteri ve Spark iş tanımı geliştirme için Çalışma Zamanı 2.0'ı destekler.