Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
İşlevsel bağımlılıklar, tablodaki sütunlar arasındaki ilişkilerdir ve bir sütundaki değerler başka bir sütundaki değerleri belirler. Bu bağımlılıkları anlamak, verilerinizdeki desenleri ve ilişkileri ortaya çıkarmanıza yardımcı olabilir. Bu anlayış özellik mühendisliği, veri temizleme ve model oluşturma görevlerine yardımcı olabilir. İşlevsel bağımlılıklar, aksini tespit etmek zor olabilecek veri kalitesi sorunlarını bulmanıza ve düzeltmenize yardımcı olan etkili bir sabit değer görevi görür.
Bu makalede, şu amaçlarla anlamsal bağlantı kullanırsınız:
- FabricDataFrame sütunları arasındaki bağımlılıkları bulma
- Bağımlılıkları görselleştirin
- Veri kalitesi sorunlarını belirleme
- Veri kalitesi sorunlarını görselleştirme
- Veri kümesindeki sütunlar arasında işlevsel kısıtlamaları zorunlu kılma
Önkoşullar
Microsoft Fabric aboneliği alın. Alternatif olarak ücretsiz Microsoft Fabric deneme sürümüne kaydolabilirsiniz.
Microsoft Fabric'te oturum açın.
Giriş sayfanızın sol alt köşesindeki deneyim değiştiriciyi kullanarak Fabric'e geçin.
- Microsoft Fabric'de bulunan Veri Bilimi deneyimine gidin.
- Kod kopyalayıp hücrelere yapıştırmak için yeni bir not defteri oluşturun.
- Spark 3.4 ve üzeri sürümlerde, Fabric kullanıldığında Semantic link varsayılan çalışma zamanında kullanılabilir ve ayrıca yüklemenize gerek yoktur. Spark 3.3 veya üzerini kullanıyorsanız veya Anlam Bağlantısı'nın en son sürümüne güncelleştirmek istiyorsanız komutunu çalıştırabilirsiniz:
python %pip install -U semantic-link - Not defterinize bir Lakehouse ekleyin.
Semantik bağlantı varsayılan Doku çalışma zamanında kullanılabilir. Anlam bağlantısının en son sürümüne güncelleştirmek için şu komutu çalıştırın:
%pip install -U semantic-link
Verilerdeki işlevsel bağımlılıkları bulma
SemPy find_dependencies işlevi, FabricDataFrame sütunları arasındaki işlevsel bağımlılıkları algılar. İşlev, yaklaşık işlevsel bağımlılıkları bulmak için koşullu entropi üzerinde bir eşik kullanır ve burada düşük koşullu entropi sütunlar arasındaki güçlü bağımlılığı gösterir. İşlevi find_dependencies daha seçici hale getirmek için koşullu entropi üzerinde daha düşük bir eşik ayarlayın. Düşük eşik, yalnızca daha güçlü bağımlılıkların algılandığını gösterir.
Bu Python kod parçacığı, find_dependencies nasıl kullanılacağını gösterir:
from sempy.fabric import FabricDataFrame
from sempy.dependencies import plot_dependency_metadata
import pandas as pd
df = FabricDataFrame(pd.read_csv("your_data.csv"))
deps = df.find_dependencies()
İşlev, find_dependencies sütunlar arasında algılanan bağımlılıklara sahip bir FabricDataFrame döndürür.
Liste, 1:1 eşlemesi olan sütunları temsil eder. İşlev, potansiyel bağımlılıkları budamak amacıyla geçişli kenarları da kaldırır.
Seçeneğini belirttiğinizde dropna=True işlev, her iki sütunda da NaN değeri olan satırları değerlendirmeden kaldırır. Bu eleme, aşağıdaki örnekte gösterildiği gibi geçişsiz bağımlılıklara neden olabilir:
| A | B | C |
|---|---|---|
| 1 | 1 | 1 |
| 1 | 1 | 1 |
| 1 | NaN | 9 |
| 2 | NaN | 2 |
| 2 | 2 | 2 |
Bazı durumlarda bağımlılık zinciri, aşağıdaki örnekte gösterildiği gibi seçeneği belirttiğinizde dropna=True döngüler oluşturabilir:
| A | B | C |
|---|---|---|
| 1 | 1 | NaN |
| 2 | 1 | NaN |
| NaN | 1 | 1 |
| NaN | 2 | 1 |
| 1 | NaN | 1 |
| 1 | NaN | 2 |
Verilerdeki bağımlılıkları görselleştirme
find_dependencies kullanarak bir veri kümesinde işlevsel bağımlılıkları bulduktan sonra, bu bağımlılıkları plot_dependency_metadata işlevini kullanarak görselleştirebilirsiniz. Bu işlev, elde edilen FabricDataFrame değerini alır find_dependencies ve sütunlar ve sütun grupları arasındaki bağımlılıkların görsel bir gösterimini oluşturur.
Bu Python kod parçacığı, plot_dependencies nasıl kullanılacağını gösterir:
from sempy.fabric import FabricDataFrame
from sempy.dependencies import plot_dependency_metadata
from sempy.samples import download_synthea
import pandas as pd
download_synthea(which='small')
df = FabricDataFrame(pd.read_csv("synthea/csv/providers.csv"))
deps = df.find_dependencies()
plot_dependency_metadata(deps)
İşlev, plot_dependency_metadata 1:1 sütun gruplandırmalarını gösteren bir görselleştirme oluşturur. Tek bir gruba ait sütunlar tek bir hücreye yerleştirilir. İşlev uygun aday bulamazsa boş bir FabricDataFrame döndürür.
Veri kalitesi sorunlarını belirleme
Veri kalitesi sorunları, eksik değerler, tutarsızlıklar veya tutarsızlıklar gibi birçok biçime sahip olabilir. Veriler üzerinde oluşturulan herhangi bir analiz veya modelin güvenilirliğini ve geçerliliğini sağlamak için bu sorunları belirlemek ve çözmek önemlidir. Veri kalitesi sorunlarını algılamanın bir yolu, veri kümesindeki sütunlar arasındaki işlevsel bağımlılıkların ihlallerini incelemektir.
işlevi, list_dependency_violations veri kümesi sütunları arasındaki işlevsel bağımlılıkların ihlallerini bulmanıza yardımcı olabilir. Belirleyici bir sütun ve bağımlı bir sütun sağladığınızda işlev, işlevsel bağımlılığı ihlal eden değerleri ve bunların ilgili oluşumlarının sayısını gösterir. Bu bilgiler, yaklaşık bağımlılıkları incelemenize ve veri kalitesi sorunlarını belirlemenize yardımcı olabilir.
Aşağıdaki kod parçacığı işlevin list_dependency_violations nasıl kullanılacağını gösterir:
from sempy.fabric import FabricDataFrame
from sempy.samples import download_synthea
import pandas as pd
download_synthea(which='small')
df = FabricDataFrame(pd.read_csv("synthea/csv/providers.csv"))
violations = df.list_dependency_violations(determinant_col="ZIP", dependent_col="CITY")
Bu örnekte işlev, ZIP (determinant) ve CITY (bağımlı) sütunları arasında işlevsel bir bağımlılık olduğunu varsayar. Veri kümesinde veri kalitesi sorunları varsa (örneğin, aynı POSTA Kodu birden çok şehre atanmışsa) işlev verileri şu sorunlarla birlikte çıkış olarak oluşturur:
| Zip | ŞEHİR | sayı |
|---|---|---|
| 12345 | Boston | 2 |
| 12345 | Seattle | 1 |
Bu çıkış, iki farklı şehrin (Boston ve Seattle) aynı POSTA Kodu değerine (12345) sahip olduğunu gösterir. Bu sonuç, veri kümesinde bir veri kalitesi sorunu olduğunu gösterir.
list_dependency_violations işlevi eksik değerleri işleyebilen, ihlal eden değerlerle eşlenen değerleri gösterebilen, döndürülen ihlal sayısını sınırlayan ve sonuçları sayıya veya belirleyici sütuna göre sıralayabilecek daha fazla seçenek sağlar.
Çıktı, list_dependency_violations veri kümesi veri kalitesi sorunlarını belirlemenize yardımcı olabilir. Ancak, belirlenen sorunları çözmek için en uygun eylem seyrini belirlemek için sonuçları dikkatlice incelemeli ve verilerinizin bağlamını göz önünde bulundurmalısınız. Bu yaklaşım, analiz veya modelinizin güvenilirliğini ve geçerliliğini sağlamak için daha fazla veri temizleme, doğrulama veya araştırma içerebilir.
Veri kalitesi sorunlarını görselleştirme
Veri kalitesi sorunları, bu veriler üzerinde oluşturulan tüm analiz veya modellerin güvenilirliğine ve geçerliliğine zarar verebilir. Sonuçlarınızın doğruluğundan emin olmak için bu sorunları tanımlamak ve çözmek önemlidir. Veri kalitesi sorunlarını algılamak için veri kümesindeki sütunlar arasındaki işlevsel bağımlılıkların ihlallerini inceleyin. Bu ihlalleri görselleştirmek sorunları daha net gösterebilir ve bunları daha etkili bir şekilde çözmenize yardımcı olabilir.
işlevi, plot_dependency_violations bir veri kümesindeki sütunlar arasındaki işlevsel bağımlılıkların ihlallerini görselleştirmeye yardımcı olabilir. Belirleyici bir sütun ve bağımlı bir sütun göz önünde bulundurulduğunda, bu işlev veri kalitesi sorunlarının doğasını ve kapsamını daha kolay anlamak için ihlal eden değerleri grafik biçiminde gösterir.
Bu kod parçacığı, plot_dependency_violations işlevinin nasıl kullanılacağını gösterir:
from sempy.fabric import FabricDataFrame
from sempy.samples import download_synthea
import pandas as pd
download_synthea(which='small')
df = FabricDataFrame(pd.read_csv("synthea/csv/providers.csv"))
df.plot_dependency_violations(determinant_col="ZIP", dependent_col="CITY")
Bu örnekte işlev, ZIP (determinant) ve CITY (bağımlı) sütunları arasında var olan bir işlevsel bağımlılığı varsayar. Veri kümesinde veri kalitesi sorunları varsa (örneğin, aynı posta kodu birden çok şehre atanmışsa) işlev ihlal eden değerlerin grafiğini oluşturur.
plot_dependency_violations işlevi eksik değerleri işleyebilen, ihlal eden değerlerle eşlenen değerleri gösterebilen, döndürülen ihlal sayısını sınırlayan ve sonuçları sayıya veya belirleyici sütuna göre sıralayabilecek daha fazla seçenek sağlar.
işlevi, plot_dependency_violations veri kümesi veri kalitesi sorunlarını tanımlamaya yardımcı olabilecek bir görselleştirme oluşturur. Ancak, belirlenen sorunları çözmek için en uygun eylem seyrini belirlemek için sonuçları dikkatlice incelemeli ve verilerinizin bağlamını göz önünde bulundurmalısınız. Bu yaklaşım, analiz veya modelinizin güvenilirliğini ve geçerliliğini sağlamak için daha fazla veri temizleme, doğrulama veya araştırma içerebilir.
İşlevsel kısıtlamaları zorunlu kılma
Veri kümesi üzerinde oluşturulan analiz veya modellerin güvenilirliğini ve geçerliliğini sağlamak için veri kalitesi çok önemlidir. Veri kümesindeki sütunlar arasında işlevsel kısıtlamaların uygulanması, veri kalitesinin artırılmasına yardımcı olabilir. İşlevsel kısıtlamalar, sütunlar arasındaki ilişkilerin doğruluk ve tutarlılığa sahip olmasını sağlar ve bu da daha doğru analiz veya model sonuçlarına yol açabilir.
İşlev, drop_dependency_violations bir veri kümesindeki sütunlar arasında işlevsel kısıtlamalar uygular. Belirli bir kısıtlamayı ihlal eden satırları kaldırır. Belirleyici bir sütun ve bağımlı sütun göz önüne alındığında, bu işlev iki sütun arasındaki işlevsel kısıtlamaya uymayan değerlere sahip satırları kaldırır.
Bu kod parçacığı, drop_dependency_violations işlevinin nasıl kullanılacağını gösterir:
from sempy.fabric import FabricDataFrame
from sempy.samples import download_synthea
import pandas as pd
download_synthea(which='small')
df = FabricDataFrame(pd.read_csv("synthea/csv/providers.csv"))
cleaned_df = df.drop_dependency_violations(determinant_col="ZIP", dependent_col="CITY")
Bu örnekte işlev, ZIP (determinant) ve CITY (bağımlı) sütunları arasında işlevsel bir kısıtlama uygular. Determinantın her değeri için işlev bağımlı sütunun en yaygın değerini seçer ve diğer değerlerle birlikte tüm satırları bırakır. Örneğin, bu veri kümesi verildiğinde, CITY=Seattle olan satır çıkarılır ve ZIP -> CITY işlevsel bağımlılığı çıktıda geçerlidir:
| Zip | ŞEHİR |
|---|---|
| 12345 | Seattle |
| 12345 | Boston |
| 12345 | Boston |
| 98765 | Baltimore |
| 00000 | San Francisco |
drop_dependency_violations işlevi, çıktı ayrıntı düzeyini denetlemek için verbose seçeneğini sunar. ayarını verbose=1yaparak bırakılan satır sayısını görebilirsiniz. Değer verbose=2 , bırakılan satırların tüm satır içeriğini gösterir.
İşlev, drop_dependency_violations veri kümenizdeki sütunlar arasında işlevsel kısıtlamalar uygulayabilir ve bu da veri kalitesini artırmaya yardımcı olabilir ve analiz veya modelinizde daha doğru sonuçlara yol açabilir. Ancak, değerli bilgileri yanlışlıkla veri kümenizden kaldırmadığınızdan emin olmak için verilerinizin bağlamını ve uygulamayı seçtiğiniz işlevsel kısıtlamaları dikkatle göz önünde bulundurun.