Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Microsoft Fabric, veri ve analiz iş yüklerini verimli bir şekilde işlemek için kapsamlı bir araç paketine sahiptir. Birçok seçenek mevcut olduğunda, toplu işlem, işlem hattı ve gerçek zamanlı akış yetenekleri dahil, özel ihtiyaçlarınız için doğru aracı seçmek zor olabilir. Bu karar kılavuzu, doğru stratejiyi seçmenize yardımcı olacak bir yol haritası sağlar.
Microsoft Fabric'te doğru veri tümleştirme hizmetini seçmek için şu soruları göz önünde bulundurun:
Birincil hedefiniz nedir? Verileri almak, dönüştürmek, çoğaltmak, veri taşımayı yönetmek veya gerçek zamanlı olarak veri akışı yapmak ve üzerinde işlem yapmak mı istiyorsunuz?
Teknik beceri seviyeniz nedir? Kod içermeyen veya düşük kodlu çözümleri mi tercih ediyorsunuz yoksa kodla rahatça çalışıyor musunuz?
Ne tür bir veri iş yüküyle çalışıyorsunuz? Toplu, toplu, artımlı, sürekli akış mı yoksa gerçek zamanlıya yakın mı?
Ne tür bir veri dönüşümüne ihtiyacınız var? Basit dönüşümler mi yoksa karmaşık dönüşümler mi yapıyorsunuz?
Kopyalama işi, Kopyalama etkinliği ve Veri Akışı 2. Nesil genelinde desteklenen bağlayıcıların listesi için bağlayıcıya genel bakış bölümüne bakın. Desteklenen Olay Akışı kaynaklarının listesi için kaynak listesine bakın.
Veri taşıma stratejileri
| Yansıtma | İşi Kopyala | Kopyalama Etkinliği (İşlem Hattı) | Olay Akışları | |
|---|---|---|---|---|
| Kullanım Örneği | Veri Replikasyonu | Veri Alımı ve Çoğaltma | Veri Alımı | Akış Veri Alımı ve İşleme |
| Amiral Gemisi Senaryoları | Anahtar teslimi kurulumu ile neredeyse gerçek zamanlı eşitleme. Replication | Artımlı Kopyalama / Çoğaltma (su işareti + Yerel CDC), Data Lake / Depolama Veri Geçişi, Madalyon Alımı, Kullanıma açık çok tablolu kopya. | Data Lake / Depolama Veri Geçişi, Medallion Veri Alımı, İşlem hattı ifadeleri ve kontrol tabloları aracılığıyla artımlı kopyalama (yalnızca watermark) | Artımlı işleme, olay odaklı ve gerçek zamanlı yapay zeka uygulamaları |
| Kaynak | 6' den fazla bağlayıcı | 50'den fazla bağlayıcı | 50'den fazla bağlayıcı | 25'den fazla kaynak |
| Varış Yeri | Yansıtılmış veritabanı (Fabric OneLake'te salt okunur Delta tablosu olarak depolanır) | 40'ın üzeri bağlayıcı | 40'ın üzeri bağlayıcı | 4'den fazla hedef |
| Gelen Verilerin Türü | Neredeyse Gerçek Zamanlı | Batch / Artımlı Kopyalama (su işareti tabanlı ve veri yakalamayı değiştir) / Gerçek zamanlıya yakın | Batch / Toplu / El ile Filigran tabanlı artımlı kopya | Gerçek zamanlı akış verileri, Veri Yakalamayı/Akışları Değiştirme |
| Persona | İş Analisti, Veritabanı Yöneticisi | İş Analisti, Veri Tümleştiricisi, Veri Mühendisi | Veri Tümleştiricisi, İş Analisti, Veri Mühendisi | Veri Mühendisi & Tümleştirici, Veri Analisti |
| Beceri Kümesi | Hiç kimse | ETL, SQL | ETL, SQL | ETL, SQL, KQL |
| Kodlama Düzeyi | Kod yok | Kod yok / Düşük kod | Kod yok / Düşük kod | Kod yok / Düşük kod |
| Dönüştürme Desteği | Hiç kimse | Low | Low | Orta (akış analizi) |
Diğer ayrıntılar için bkz. veri taşıma stratejisi.
Düzenleme stratejileri
| Ardışık düzen | Apache Airflow İşi | |
|---|---|---|
| Kullanım Örneği | Düşük Kod Düzenleme | Kod Öncelikli Düzenleme |
| Amiral Gemisi Senaryoları | Bir görevi gerçekleştirmek için çeşitli etkinliklerin mantıksal gruplandırması. | Python Code-Centric Yazma |
| Kaynak | Tüm Doku uyumlu kaynaklar (seçili işlem hattı etkinliklerine bağlı olarak) | 100'den fazla bağlayıcı |
| Varış Yeri | Tüm Doku uyumlu kaynaklar (seçili işlem hattı etkinliklerine bağlı olarak) | 100'den fazla bağlayıcı |
| Gelen Verilerin Türü | Tüm türler | Tüm türler |
| Persona | Veri Tümleştiricisi, İş Analisti, Veri Mühendisi | Apache Airflow Kullanıcıları |
| Beceri Kümesi | ETL, SQL, Spark (Scala, Py, SQL, R) | Piton |
| Kodlama Düzeyi | Kod yok / Düşük kod | Kod öncelikli |
| Dönüştürme Desteği | Hiç kimse | Hiç kimse |
Dönüşüm stratejileri
| Dizüstü | Veri Akışı 2. Nesil | Olay Akışları | |
|---|---|---|---|
| Kullanım Örneği | Kod öncelikli Veri Hazırlığı / Dönüştürme | Kodsuz Veri Hazırlama / Dönüştürme | Kodsuz Dönüştürme / SQL Tabanlı Stream Analytics |
| Amiral Gemisi Senaryoları | Karmaşık Dönüşümler | Dönüştürme ve Profil Oluşturma | Akış İşleme ve Analiz |
| Kaynak | 100'den fazla Spark Kitaplığı | 170'den fazla yerleşik bağlayıcı + Özel SDK | 25'den fazla kaynak |
| Varış Yeri | 100'den fazla Spark Kitaplığı | 7'den fazla bağlayıcı | 4'den fazla hedef |
| Gelen Verilerin Türü | Tüm türler | Tüm türler | Tüm Türler dahil. JSON, AVRO, CSV, XML, TXT vb. |
| Persona | Veri Bilimcisi, Geliştirici | Veri Mühendisi, Veri Tümleştiricisi, İş Analisti | Veri Mühendisi ve Analist |
| Beceri Kümesi | Spark (Scala, Py, SQL, R) | ETL, M, SQL | SQL, KQL |
| Kodlama Düzeyi | Kod öncelikli | Kod yok / Düşük kod | Kod yok / Düşük kod |
| Dönüştürme Desteği | High | Yüksek (400'den fazla etkinlik) | Orta |
Scenarios
Microsoft Fabric'te hangi veri tümleştirme stratejisini kullanacağınızı seçmenize yardımcı olması için bu senaryoları gözden geçirin.
1. Senaryo
Hanna bir finansal hizmetler şirketinin veritabanı yöneticisi. Kuruluşun ticari uygulamalarını destekleyen birden çok kritik SQL Server veritabanını yönetir. İşletmenin mevzuat raporlaması ve risk analizi için bu işlem verilerine neredeyse gerçek zamanlı erişime ihtiyacı vardır. Ancak Hanna'nın üretim sistemlerinin performansını etkilemekten kaçınması gerekiyor.
Hanna'nın zorluğu analiz ekiplerine operasyonel veritabanlarında ek yük oluşturmadan up-togüncel veriler sağlamaktır. Karmaşık ETL işlem hatları oluşturmak veya veri taşıma işlemlerini yönetmek istemiyor. Veri hacimleri önemlidir ve işletmenin kaynak sistemlerde gerçekleşen işlemleri izleyen dakikalar içinde analiz için kullanılabilir verilere ihtiyacı vardır.
Hanna seçenekleri gözden geçirin ve ideal çözüm olarak Yansıtma'yı seçer. Yansıtma ile sql server veritabanlarından Microsoft Fabric'e neredeyse gerçek zamanlı veri çoğaltmasını minimum yapılandırmayla ayarlayabilir. Yansıtılan veriler OneLake'de Delta tabloları olarak kullanılabilir hale gelir ve kaynak sistem performansını etkilemeden aşağı akış analizini etkinleştirir. Yansıtma, ihtiyaç duyduğu anahtar teslimi kurulumu sağlar ve iş sürekliliğini sağlarken veri çoğaltmanın karmaşıklığını otomatik olarak yönetir.
2. Senaryo
Charlie bir perakende şirketinde veri analistidir. Birden çok bölgesel veritabanındaki satış verilerini merkezi bir veri ambarı içinde birleştirmekten sorumludur. Şirket farklı saat dilimlerinde çalışır ve her bölgenin veritabanı stok ve satış işlemlerini izlemek için değişiklik verilerini yakalama (CDC) kullanır. Charlie'nin, geçmiş verilerin ilk tam yükünü işleyebilen ve ardından CDC'yi temel alan artımlı güncelleştirmelere geçebilen bir çözüme ihtiyacı var.
Charlie, çeşitli bölgesel SQL Server örneklerinden birden çok tablo seçmesine, ilk toplu geçişi gerçekleştirmesine ve ardından CDC tabanlı artımlı yükler aracılığıyla up-totarih verilerini otomatik olarak tutmasına olanak tanıyan kod içermeyen, sihirbaz temelli bir yaklaşım istiyor. Çözümün hem eklemeleri hem de güncelleştirmeleri işlemesi ve el ile müdahale olmadan değişiklikleri hedefle birleştirmesi gerekir.
Charlie seçenekleri değerlendirir ve tercih ettiği yaklaşım olarak İşi Kopyala'yı seçer. Kopyalama İşi, ihtiyacı olan çok tablolu seçim özelliğini sağlar, hem filigran tabanlı hem de yerel CDC artımlı kopyalamayı destekler ve sezgisel bir sihirbaz arabirimi sunar. İlk çalıştırma işlevi, kod yazmadan veri çoğaltma işleminin tamamını yapılandırmasına olanak tanır ve CDC özellikli tabloların otomatik olarak algılanması kurulum işlemini basitleştirir.
Senaryo 3
Rukmina, bir üretim şirketinde veri mühendisidir. Büyük hacimli geçmiş üretim verilerini şirket içi Oracle veritabanından yeni bir Doku Ambarı'na geçirmesi gerekiyor. Geçiş, milyonlarca kaydı olan yüzlerce tabloyu kopyalamayı içerir ve bronz, gümüş ve altın katmanlı bir madalyon mimari uygulaması gerekir. Rukmina, SQL deneyimine sahiptir ancak mümkün olduğunda düşük kodlu çözümleri tercih eder.
Proje, ham verileri bronz katmana kopyalamasını, ardından veriler madalyon katmanlarında ilerledikçe veri türü dönüştürmeleri ve sütun eşlemesi gibi basit dönüştürmeler uygulamasını gerektirir. Rukmina'nın çözümün yüksek veri hacimlerini verimli bir şekilde işleyebileceğinden ve devam eden işlemler için artımlı olarak çalışacak şekilde zamanlanabilir olduğundan emin olması gerekir. Proje katılımcıları, işletme büyüdükçe gigabaytlardan petabaytlara kadar ölçeklenebilen bir çözüm istiyor.
Rukmina, kullanılabilir seçenekleri inceler ve İşlem Hatlarında Kopyalama Etkinliği'ni seçer. Bu yaklaşım, büyük veri hacimleri için gereken ölçeklenebilirliği sağlarken, sürükle ve bırak arabirimini tercih eder. Kopyalama Etkinliği, çeşitli kaynak sistemler için ihtiyaç duyduğu 50'den fazla bağlayıcıyı destekler ve işlem hattı çerçevesi, madalyon katmanları arasındaki hareketi düzenlemesine olanak tanır. Kopyalama etkinliğiyle petabayt ölçeğindeki işlemler için gereken performansı korurken hem geçmiş hem de artımlı veri yenileme desenleri uygulayabilir.
Senaryo 4
Julian, güçlü SQL becerilerine sahip bir iş analistidir. Birden çok adım içeren karmaşık bir veri işleme iş akışını düzenlemesi gerekiyor: çeşitli sistemlerden veri ayıklama, veri kalitesi denetimleri çalıştırma, dönüştürmeler gerçekleştirme, verileri birden çok hedefe yükleme ve paydaşlara bildirim gönderme. İş akışının bir zamanlamaya göre çalışması ve farklı etkinlikler arasındaki bağımlılıkları işlemesi gerekir.
Julian'ın kuruluşu Azure hizmetlerinin ve şirket içi sistemlerin bir karışımını kullanır ve iş akışı hem veri taşıma hem de düzenleme mantığı gerektirir. Saklı yordamları çalıştırma, web API'lerini çağırma, dosyaları taşıma ve diğer işlem hatlarını yürütme gibi etkinlikleri koordine etmesi gerekiyor. Julian, SQL ve temel betik oluşturma konusunda rahat olsa da, bu karmaşık iş akışlarını oluşturmak ve sürdürmek için görsel ve düşük kodlu bir yaklaşımı tercih ediyor.
Julian seçenekleri değerlendirir ve gereksinimleri için en uygun olan İşlem Hatları'nı seçer. İşlem hatları, karmaşık düzenleme iş akışları oluşturmak için ihtiyaç duyduğu görsel tuval ve sürükle ve bırak etkinliklerini sağlar. Çözüm, etkinliklerin mantıksal gruplandırma, bağımlılık yönetimi ve zamanlama özelliklerini destekler. 50'den fazla bağlayıcı ve çeşitli etkinlik türleri (kopyalama, arama, saklı yordam, web vb.) ile işlem hatları, tercih ettiği düşük kod yaklaşımını korurken çeşitli görevleri koordine etme esnekliği sağlar.
Senaryo 5
Darshan, kapsamlı Python deneyimine sahip bir veri bilimcisidir. Makine öğrenmesi modellerini, özel algoritmaları ve çeşitli dış API'leri tümleştiren karmaşık veri işleme iş akışları oluşturması ve bakımını yapması gerekiyor. Kuruluşunun veri bilimi ekibi kod öncelikli yaklaşımları tercih ediyor ve özel kitaplıklar ve gelişmiş düzenleme desenleri de dahil olmak üzere mevcut Python uzmanlığından yararlanmak istiyor.
Darshan'ın Python tabanlı yönlendirilmiş ansiklik grafikleri (DAG) destekleyen, görevler arasındaki karmaşık bağımlılıkları işleyebilen ve ekibin mevcut DevOps işlemleriyle tümleşen bir çözüme ihtiyacı vardır. İş akışları birden çok kaynaktan veri alımı, özellik mühendisliği, model eğitimi, toplu puanlama ve tam Python programlama esnekliği gerektiren özel iş mantığı içerir. Ekip, Apache Airflow'un ekosistemine değer verir ve mevcut iş akışlarıyla uyumluluğu korumak ister.
Darshan seçenekleri gözden geçirin ve ideal çözüm olarak Apache Airflow İşleri'ni seçer. Bu kod öncelikli yaklaşım, ekibinin gelişmiş veri işleme iş akışları oluştururken Python uzmanlığını kullanmasına olanak tanır. Apache Airflow İşleri tanıdıkları DAG tabanlı düzenleme sağlar, Airflow ekosistemi aracılığıyla 100'den fazla bağlayıcıyı destekler ve Python kullanarak özel iş mantığı uygulamalarına olanak tanır. Yönetilen hizmet yaklaşımı, Apache Airflow'un esnekliğini ve gücünü korurken altyapı sorunlarını ortadan kaldırır.
Senaryo 6
René bir araştırma üniversitesinde veri bilimcisidir. Birden çok biçim ve kaynakta depolanan büyük veri kümelerinde karmaşık veri analizi ve dönüştürme görevleri gerçekleştirmesi gerekiyor. Çalışmaları arasında istatistiksel analiz, makine öğrenmesi modeli geliştirme ve dağıtılmış bilgi işlemin tüm gücünü gerektiren özel veri işleme algoritmaları yer alır.
René CSV dosyaları, JSON belgeleri, Parquet dosyaları ve gerçek zamanlı akışlar gibi yapılandırılmış ve yapılandırılmamış verilerle çalışır. Analizi, birden çok büyük veri kümesindeki birleştirmeler, toplamalar, istatistiksel hesaplamalar ve Python ve Scala'da uygulanan özel algoritmalar gibi karmaşık dönüşümler gerektirir. Araştırma aşamalarında etkileşimli olarak çalışabilmesi ve ardından üretim iş yükleri için kodunu kullanıma hazır hale getirmesi için esnekliğe ihtiyacı var.
René, seçeneklerini değerlendirir ve birincil aracı olarak Notebooks'u seçer. Not defterleri, Spark'ın dağıtılmış bilgi işlem özelliklerine tam erişimle ihtiyaç duyduğu kod öncelikli ortamı sağlar. Yüzlerce Spark kitaplığıyla çalışabilir, birden çok dil (Python, Scala, SQL, R) kullanarak karmaşık dönüşümler uygulayabilir ve veri keşfi için etkileşimli geliştirme ortamını kullanabilir. Not defteri arabirimi, büyük ölçekli veri işleme gereksinimleri için gereken yüksek performanslı işlemi sağlarken kod, görselleştirme ve belgeleri birleştirmesine olanak tanır.
Senaryo 7
Ako, bir sağlık kuruluşunda iş analistidir. Temiz, iş için hazır veri kümeleri oluşturmak için veritabanları, web hizmetleri ve dosya sistemleri dahil olmak üzere birden çok kaynaktan verileri tümleştirmesi gerekiyor. Excel ve Power BI'daki çalışmalarından Power Query konusunda kapsamlı deneyime sahip olan Ako, veri hazırlama görevleri için görsel, kod içermeyen arabirimleri tercih ediyor.
Ako'nun sorumlulukları arasında sağlık verilerinin temizlenmesi, iş kurallarının uygulanması, veri kalitesinin doğrulanması ve mevzuat raporlama sistemlerine beslenen standartlaştırılmış veri kümeleri oluşturulması yer alır. Veri kaynakları hasta yönetim sistemleri, laboratuvar bilgi sistemleri ve dış API hizmetlerini içerir. Veri profili oluşturma, yinelenen kaldırma, tıbbi kodların standartlaştırılması ve iş mantığına göre hesaplanan alanların oluşturulması gibi karmaşık dönüşümler gerçekleştirmesi gerekiyor.
Ako, mevcut seçenekleri inceler ve tercih ettiği çözüm olarak Dataflow 2. Nesil'i seçer. Dataflow 2. Nesil, diğer Microsoft araçlarından tanıdığı tanıdık Power Query deneyimini sunarken, gelişmiş performans ve özellikler sunar. 170'den fazla yerleşik bağlayıcı ile tüm farklı veri kaynaklarına bağlanabilir, görsel arabirim aracılığıyla 300'den fazla dönüştürme işlevi uygulayabilir ve veri kalitesini sağlamak için veri profili oluşturma araçlarından yararlanabilir. Kod içermeyen yaklaşım, teknik uygulama ayrıntıları yerine iş mantığına odaklanmasını sağlar.
Senaryo 8
Ash, bir telekom şirketinde ürün yöneticisidir. Hizmet düzeyi sözleşmelerinin (SLA) karşılandığından emin olmak için ekibinin arama birimleri, bekleme süreleri ve aracı performansı gibi müşteri destek ölçümlerini gerçek zamanlı olarak izlemesi gerekiyor. Veriler CRM, çağrı merkezi günlükleri ve aracı atama veritabanları dahil olmak üzere birden çok işletim sisteminden gelir.
Ash gerçek zamanlı panolar oluşturmak ve eşikler ihlal edildiğinde (örneğin bekleme süreleri SLA sınırlarını aştığında) otomatik iş akışlarını tetiklemeyi ister. Ayrıca karmaşık ETL işlem hatları oluşturmaktan veya altyapıyı yönetmekten kaçınmak istiyor.
Ash seçeneklerini değerlendirir ve Fabric Eventstreams'i seçer. Eventstreams ile akış bağlayıcılarını kullanarak birden çok kaynaktan veri alabilir, basit dönüştürmeler uygulayabilir ve olayları Eventhouse ve Data Activator gibi hedeflere yönlendirebilir. Saniyeler içinde güncelleştirilen uyarılar ve panolar ayarlayarak ekibinin operasyonel sorunlara hızlı bir şekilde yanıt vermesini sağlar.
Doku Olay Akışları ve Real-Time Intelligence, Ash'in mevcut sistemleri kesintiye uğratmadan olay odaklı uygulamalar derlemesi için gereken düşük gecikme süreli, düşük kodlu deneyimi sağlar.
Get started
Hangi hizmeti kullanacağınızı anladığınıza göre, Microsoft Fabric'te veri tümleştirme çözümlerinizi oluşturmaya başlayabilirsiniz.