Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Azure SQL Veritabanı dışındaki her kaynak için Mevcut bölümlemeyi kullan seçeneğini seçili tutmanız önerilir. Diğer tüm kaynak sistemlerden okurken, veri akışları verilerin boyutuna göre verileri otomatik olarak eşit olarak bölümler. Yaklaşık her 128 MB veri için yeni bir bölüm oluşturulur. Veri boyutunuz arttıkça bölüm sayısı artar.
Spark verileri okuduktan sonra yapılan özel bölümlemeler, veri akışı performansınızı olumsuz etkiler. Veriler okumada eşit olarak bölümlendiğinden, önce verilerinizin şeklini ve kardinalitesini anlamadığınız sürece önerilmez.
Uyarı
Okuma hızları, kaynak sisteminizin aktarım hızıyla sınırlanabilir.
Azure SQL Veritabanı kaynakları
Azure SQL Veritabanı'nın 'Kaynak' bölümleme adlı benzersiz bir bölümleme seçeneği vardır. Kaynak bölümlemenin etkinleştirilmesi, kaynak sistemde paralel bağlantıları etkinleştirerek Azure SQL Veritabanı'ndan okuma sürelerinizi iyileştirebilir. Bölüm sayısını ve verilerinizin nasıl bölümleneceğini belirtin. Yüksek kardinaliteye sahip bir bölüm sütunu kullanın. Kaynak tablonuzun bölümleme düzeniyle eşleşen bir sorgu da girebilirsiniz.
İpucu
Kaynak bölümleme için SQL Server'ın G/Ç'sinde performans sorunu vardır. Çok fazla bölüm eklemek kaynak veritabanınızı doyurabilir. Bu seçenek kullanıldığında genellikle dört veya beş bölüm idealdir.
Yalıtım düzeyi
Azure SQL kaynak sistemindeki okumanın yalıtım düzeyi performansı etkiler. 'Okunmamış' seçildiğinde en hızlı performans sağlanır ve herhangi bir veritabanı kilidini önler. SQL Yalıtım düzeyleri hakkında daha fazla bilgi edinmek için bkz. Yalıtım düzeylerini anlama.
Sorgu kullanarak okuma
Azure SQL Veritabanı'ndan tablo veya SQL sorgusu kullanarak okuyabilirsiniz. SQL sorgusu yürütüyorsanız, dönüştürmenin başlayabilmesi için önce sorgunun tamamlanması gerekir. SQL Sorguları daha hızlı yürütülebilecek işlemleri göndermek ve SELECT, WHERE ve JOIN deyimleri gibi bir SQL Server'dan okunan veri miktarını azaltmak için yararlı olabilir. İşlemleri aşağı doğru iterken, veriler veri akışına girmeden önce köken ve dönüşümlerin performansını izleme özelliğini kaybedersiniz.
Azure Synapse Analytics kaynakları
Azure Synapse Analytics kullanırken, kaynak seçeneklerde Hazırlamayı etkinleştir adlı bir ayar bulunur. Bu, Staging kullanarak Synapse'den okuma yapmaya olanak tanır ve CETAS ile COPY komutu gibi en yüksek performanslı toplu yükleme kabiliyetlerini kullanarak okuma performansını büyük ölçüde artırır. Etkinleştirmek, Staging veri akışı etkinlik ayarlarında bir Azure Blob Depolama veya Azure Data Lake Storage 2. Nesil geçici konum belirtmenizi gerektirir.
Dosya tabanlı kaynaklar
Parquet ve sınırlandırılmış metin karşılaştırması
Veri akışları çeşitli dosya türlerini desteklese de, en uygun okuma ve yazma süreleri için Spark yerel Parquet biçimi önerilir.
Bir grup dosyada aynı veri akışını yürütüyorsanız, joker karakterli yolları kullanarak veya dosya listesinden okuyarak bir klasörden okumanızı tavsiye ederiz. Tek bir veri akışı etkinlik çalıştırması, tüm dosyalarınızı toplu olarak işleyebilir. Bu ayarları yapılandırma hakkında daha fazla bilgi, Azure Blob Depolama bağlayıcısı belgelerinin Kaynak dönüştürme bölümünde bulunabilir.
Mümkünse, veri akışlarını bir dizi dosya üzerinde çalıştırmak için For-Each etkinliğini kullanmaktan kaçının. Bu, for-each'in her yinelemesinde genellikle gerekli olmayan ve maliyetli olabilen yeni bir Spark kümesi başlatılmasına neden olur.
Satır içi veri kümeleri ile paylaşılan veri kümeleri karşılaştırması
ADF ve Synapse veri kümeleri, fabrikalarınızda ve çalışma alanlarınızda paylaşılan kaynaklardır. Ancak, sınırlandırılmış metin ve JSON kaynakları içeren çok sayıda kaynak klasör ve dosyayı okurken, Projeksiyon sekmesi altındaki Şema Seçenekleri iletişim kutusundan "Kullanıcı tarafından yansıtılan şema" seçeneğini ayarlayarak veri akışı dosya bulma performansınızı geliştirebilirsiniz. Bu seçenek, ADF'nin varsayılan şema otomatik bulmasını kapatır ve dosya bulma performansını büyük ölçüde artırır. Bu seçeneği ayarlamadan önce, ADF'nin projeksiyon için mevcut bir şeması olması için projeksiyonu içeri aktardığından emin olun. Bu seçenek şema kayması ile çalışmaz.
İlgili içerik
- Veri akışı performansına genel bakış
- Lavaboları optimize etme
- Dönüştürmeleri iyileştirme
- İşlem hatlarında veri akışlarını kullanma
Performansla ilgili diğer Veri Akışı makalelerine bakın: