Microsoft Fabric'te verileri hazırlama ve dönüştürme

Microsoft Fabric'e veri aldıktan sonra genellikle analizden önce verileri temizlemeniz, şekillendirmeniz ve zenginleştirmeniz gerekir. Amacınız bir göl evinde seçilmiş tabloları veya bir veri ambarında modele hazır verileri hazırlamak olsun, Fabric hem az kodlu hem de kod odaklı dönüştürme seçenekleri sağlar.

Bu makalede görsel, düşük kodlu veri hazırlama için Dataflow 2. Nesil'in nasıl kullanılacağı ve gelişmiş, kod temelli dönüştürmeler için not defterlerinin ve kullanıcı verileri işlevlerinin nasıl kullanılacağı açıklanmaktadır. Rol, beceri kümesi ve iş yükü gereksinimlerinize en uygun yaklaşımı seçin.

Veri Akışı 2. Nesil ile verileri dönüştürme

Düşük kodlu veri hazırlama için Veri Akışı 2. Nesil'i kullanın. Veri Akışı 2. Nesil, Excel ve Power BI'da kullanılan teknolojinin aynısı olan tanıdık Power Query deneyimini kullanır.

Power Query arabirimiyle görsel, adım adım iş akışı aracılığıyla filtreler uygulayabilir, sütun türetebilir, verileri toplayabilir, sorguları birleştirebilir ve diğer dönüştürmeleri gerçekleştirebilirsiniz. Fabric platformunda, Dataflow Gen2, tek başına bir ETL süreci olarak veya "pipeline" içinde bir etkinlik olarak yürütülebilir.

Örneğin, ham satış verilerini bir Lakehouse'a aldıktan sonra, yinelenenleri kaldırmak, sütun adlarını standartlaştırmak, iş kuralları uygulamak ve temizlenmiş sonuçları Lakehouse'un Altın katmanındaki kapsamlı tablolara veya Veri Ambarı'na yazmak için bir veri akışı kullanabilirsiniz.

Veri Akışı 2. Nesil, Doku kapasitesini kullanarak bulutta çalışır ve özel kod gerektirmeden büyük veri kümelerine ve karmaşık dönüşümlere ölçeklendirilmesini sağlar. Veri analistleri ve IŞ zekası geliştiricileri verileri bağımsız olarak hazırlarken, Fabric'in birleşik depolama temelinin bir parçası olarak Lakehouse veya Warehouse tablolarına çıkış yazmaya devam edebilir.

Not defterleri ve kullanıcı veri işlevleriyle öncelikli kod hazırlığı

Kod içeren gelişmiş dönüştürme senaryoları için Veri Mühendisliği deneyiminde not defterlerini, Spark işlerini ve kullanıcı verileri işlevlerini kullanın.

Fabric defteri, Fabric portalında Jupyter tarzı bir ortam sağlar. OneLake'de depolanan verilerle çalışmak için Python, T-SQL veya Scala gibi dillerde kod yazabilirsiniz.

Not defterleri karmaşık dönüştürmeler, özel algoritmalar, veri bilimi iş akışları ve dış kitaplıklarla tümleştirme için çok uygundur. Örneğin, bir göl evinden Spark DataFrame'e ham JSON veya Parquet dosyaları yükleyebilir, bunları diğer veri kümeleriyle birleştirebilir, pencerelenmiş toplamalar uygulayabilir, verileri zenginleştirebilir ve sonuçları OneLake'te Delta tabloları olarak kaydedebilirsiniz.

Not defterleri, aynı çalışma alanında yer alan göl evleri ve depolarla doğrudan tümleşir. İşlemler Doku güvenlik bağlamında çalıştırıldığından ek kimlik bilgisi yapılandırması olmadan verileri okuyabilir ve yazabilirsiniz. Ayrıca Data Factory işlem hatlarındaki not defteri etkinliğini kullanarak not defterlerini düzenleyebilir ve zamanlayabilirsiniz.

Doku kullanıcı verileri işlevleri , Doku'da yeniden kullanılabilir Python mantığını kapsüllemenizi sağlar. Gelişmiş iş kuralları uygulamak, dış hizmetleri çağırmak veya modüler dönüşüm bileşenleri oluşturmak için bunları kullanabilirsiniz. Kullanıcı veri işlevleri PyPI kitaplıklarını destekler, Doku veri kaynaklarına bağlanabilir ve dış tümleştirme için REST uç noktalarını kullanıma açabilir. Bu özellikler, bunları yeniden kullanılabilir, idare edilen dönüştürme mantığı gerektiren kurumsal senaryolar için uygun hale getirir.

Not Defterlerinden, İşlem Hatlarından, Etkinleştirici kurallarından ve Power BI raporlarında Translytical görev akışlarının bir parçası olarak Kullanıcı Verileri İşlevleri'ni çağırabilirsiniz.