Karar Ağacı Modelleri için Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği)

Şunlar için geçerlidir: SQL Server 2019 ve önceki Analysis Services Azure Analysis Services Fabric/Power BI Premium

Önemli

Veri madenciliği SQL Server 2017 Analysis Services'da kullanım dışı bırakıldı ve artık SQL Server 2022 Analysis Services'da sonlandırıldı. Kullanım dışı bırakılan ve kullanımdan kaldırılan özellikler için belgeler güncelleştirilmez. Daha fazla bilgi edinmek için bkz. Analysis Services eski sürüm uyumluluğu.

Bu konu başlığında, Microsoft Karar Ağaçları algoritmasını kullanan modellere özgü araştırma modeli içeriği açıklanmaktadır. Tüm model türleri için madencilik modeli içeriğinin genel açıklaması için bkz . Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği). Microsoft Karar Ağaçları algoritmasının çok farklı işlevlere sahip modeller oluşturabilen bir karma algoritma olduğunu unutmayın: karar ağacı ilişkilendirmeleri, kuralları ve hatta doğrusal regresyonu temsil edebilir. Ağacın yapısı temelde aynıdır, ancak bilgileri nasıl yorumladığınız modeli oluşturduğunuz amaca bağlıdır.

Karar Ağaçları Modelinin Yapısını Anlama

Karar ağaçları modeli, modeli ve meta verilerini temsil eden tek bir üst düğüme sahiptir. Üst düğümün altında, seçtiğiniz tahmin edilebilir öznitelikleri temsil eden bağımsız ağaçlar bulunur. Örneğin, müşterilerin bir şey satın alıp almayacağını tahmin etmek ve cinsiyet ve gelir için girişler sağlamak üzere karar ağacı modelinizi ayarlarsanız model, satın alma özniteliği için tek bir ağaç oluşturur ve bu ağaçta cinsiyet ve gelirle ilgili koşullara göre bölünen birçok dal bulunur.

Ancak, müşteri ödülleri programına katılım için ayrı bir tahmin edilebilir öznitelik eklerseniz, algoritma üst düğüm altında iki ayrı ağaç oluşturur. Bir ağaç satın alma analizini, başka bir ağaç ise müşteri ödülleri programının analizini içerir. İlişkilendirme modeli oluşturmak için Karar Ağaçları algoritmasını kullanırsanız, algoritma tahmin edilen her ürün için ayrı bir ağaç oluşturur ve ağaç, hedef özniteliğin seçilmesine katkıda bulunan diğer tüm ürün birleşimlerini içerir.

Uyarı

Modeliniz birden çok ağaç içeriyorsa, Microsoft Ağaç Görüntüleyicisi'nde aynı anda yalnızca bir ağacı görüntüleyebilirsiniz. Ancak , Genel İçerik Ağacı Görüntüleyicisi'nde , aynı modeldeki tüm ağaçlar aynı anda görüntülenir.

karar ağacı için model içeriğinin yapısı

Her tahmin edilebilir özniteliğin ağacı, seçtiğiniz giriş sütunlarının bu öngörülebilir özniteliğin sonucunu nasıl etkilediğini açıklayan bilgiler içerir. Her ağaç, tahmin edilebilir özniteliği içeren bir düğüm (NODE_TYPE = 9) ve ardından giriş özniteliklerini temsil eden bir dizi düğüm (NODE_TYPE = 10) tarafından yönetilir. Öznitelik, ya olay düzeyinde bir sütuna ya da iç içe tablo sütunlarının değerlerine karşılık gelir ve bunlar genellikle iç içe tablonun Anahtar sütunundaki değerlerdir.

İç ve yaprak düğümler bölme koşullarını temsil eder. Bir ağaç aynı öznitelikte birden çok kez bölünebilir. Örneğin , TM_DecisionTree modeli [Yıllık Gelir] ve [Çocuk Sayısı] olarak bölünebilir ve sonra yeniden [Yıllık Gelir] değerini ağaçtan aşağı doğru bölebilir.

Microsoft Karar Ağaçları algoritması, ağacın tamamında veya bir bölümünde doğrusal regresyonlar da içerebilir. Modelleme yaptığınız öznitelik sürekli bir sayısal veri türüyse, öznitelikler arasındaki ilişkinin doğrusal olarak modellenebileceği her yerde model bir regresyon ağacı düğümü (NODE_TYPE = 25) oluşturabilir. Bu durumda düğüm bir regresyon formülü içerir.

Ancak, tahmin edilebilir özniteliğin ayrık değerleri varsa veya sayısal değerler demetlenmiş veya ayrık hale getirilmişse model her zaman bir sınıflandırma ağacı oluşturur (NODE_TYPE =2). Sınıflandırma ağacı, özniteliğin her değeri için birden çok dal veya iç ağaç düğümüne (NODE_TYPE =3) sahip olabilir. Ancak bölme, özniteliğin her değeri üzerinde olmak zorunda değildir.

Microsoft Karar Ağaçları algoritması, girdi olarak sürekli veri türlerine izin vermez; bu nedenle, herhangi bir sütun sürekli sayısal veri türüne sahipse, değerler ayrık hale getirilir. Algoritma, tüm sürekli öznitelikler için bölme noktasında kendi ayrıştırma işlemini gerçekleştirir.

Uyarı

SQL Server Analysis Services sürekli öznitelikleri demetleme için otomatik olarak bir yöntem seçer; ancak, girişlerdeki sürekli değerlerin nasıl ayrık hale getirilebileceğini denetlemek için, madencilik yapısı sütununun içerik türünü Ayrıklaştırıldı olarak ayarlayabilir ve ardından veya DiscretizationBucketCount özelliğini ayarlayabilirsinizDiscretizationMethod.

Top

Karar Ağaçları Modeli için Model İçeriği

Bu bölümde, yalnızca karar ağacı modelleri için özel ilgi düzeyine sahip madencilik modeli içeriğindeki sütunlara ilişkin ayrıntılar ve örnekler sağlanır. Şema satır kümesindeki genel amaçlı sütunlar ve madencilik modeli terminolojisinin açıklamaları hakkında bilgi için bkz . Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği).

Model Kataloğu
Modelin depolandığı veritabanının adı.

MODEL_NAME
Modelin adı.

ÖZNİTELİK_ADI
Bu düğüme karşılık gelen özniteliğin adı.

NODE_NAME
NODE_UNIQUE_NAME her zaman aynı olur.

NODE_UNIQUE_NAME
Model içindeki düğüm için benzersiz bir tanımlayıcı. Bu değer değiştirilemez.

Karar ağacı modelleri için benzersiz adlar, tüm algoritmalar için geçerli olmayan aşağıdaki kuralı izler:

Belirli bir düğümün alt düğümlerinin tümü aynı onaltılık ön eke ve ardından üst düğüm içindeki alt düğümün sırasını temsil eden başka bir onaltılık sayıya sahip olur. Yol çıkarabilmek için ön ekleri kullanabilirsiniz.

DÜĞÜM_TİPİ
Karar ağacı modellerinde aşağıdaki düğüm türleri oluşturulur:

Düğüm Türü Description
1 (Model) Model için kök düğüm.
2 (Ağaç) Modeldeki sınıflandırma ağaçları için ana düğüm. "Tümü" olarak etiketlendi.
3 (İç) Bir sınıflandırma ağacında veya regresyon ağacında bulunan iç dalın başı.
4 (Dağıtım) Sınıflandırma ağacı veya regresyon ağacı içinde bulunan yaprak düğüm.
25 (Regresyon ağacı) Model içindeki regresyon ağacının ana düğümü. "Tümü" olarak etiketlenmiştir.

NODE_CAPTION
Gösterim amacıyla dostça bir ad.

Model oluşturduğunuzda, NODE_UNIQUE_NAME değeri otomatik olarak resim yazısı olarak kullanılır. Ancak, program aracılığıyla veya görüntüleyiciyi kullanarak kümenin görünen adını güncelleştirmek için NODE_CAPTION değerini değiştirebilirsiniz. Resim yazısı model tarafından otomatik olarak oluşturulur. Resim yazısının içeriği modelin türüne ve düğüm türüne bağlıdır.

Karar ağaçları modelinde, NODE_CAPTION ve NODE_DESCRIPTION, ağaçtaki düzeye bağlı olarak farklı bilgilere sahiptir. Daha fazla bilgi ve örnek için bkz . Node Caption ve Node Description.

ÇOCUKLAR_CARDINALITY
Düğümün tahmini alt öğe (çocuk) sayısı.

Üst düğüm Modellenen tahmin edilebilir özniteliklerin sayısını gösterir. Her tahmin edilebilir öznitelik için bir ağaç oluşturulur.

Ağaç düğümü Her ağacın Tümü düğümü, hedef öznitelik için kaç değer kullanıldığını bildirir.

  • Hedef öznitelik ayrıksa, değer , Eksik durum için ayrı değerlerin sayısına artı 1'e eşit olur.

  • Tahmin edilebilir öznitelik sürekli ise, değer size sürekli özniteliği modellemek için kaç demet kullanıldığını bildirir.

Yaprak düğümler Her zaman 0.

PARENT_BENZERSİZ_AD
Düğümün üst öğesinin benzersiz adı. Kök düzeyindeki tüm düğümler için NULL döndürülür.

DÜĞÜM_AÇIKLAMASI
Düğümün açıklaması.

Karar ağaçları modelinde, NODE_CAPTION ve NODE_DESCRIPTION, ağaçtaki düzeye bağlı olarak farklı bilgilere sahiptir.

Daha fazla bilgi ve örnek için bkz . Node Caption ve Node Description.

NODE_RULE
Geçerli düğüme, doğrudan üst düğümünden gelen yolu açıklayan kuralın XML tanımı.

Daha fazla bilgi ve örnek için bkz. Düğüm Kuralı ve Marjinal Kural.

Marjinal_Kural
Modelin üst düğümünden geçerli düğüme giden yolu açıklayan kuralın XML açıklaması.

Daha fazla bilgi için bkz . Düğüm Kuralı ve Marjinal Kural.

DÜĞÜM_OLASILIĞI
Bu düğümle ilişkili olasılık.

Daha fazla bilgi için bkz. Olasılık.

Marjinal Olasılık
Ebeveyn düğümden düğüme ulaşma olasılığı.

Daha fazla bilgi için bkz. Olasılık.

DÜĞÜM_DAĞILIMI
Düğümün olasılık histogramını içeren tablo. Bu tablodaki bilgiler, tahmin edilebilir özniteliğin sürekli veya ayrık bir değişken olmasına bağlı olarak farklılık gösterir.

Model kök düğümü Bu tablo boş.

(Tümü) düğümü Modelin bir bütün olarak özetini içerir.

İç düğüm Yaprak düğümleri için toplu istatistikler içerir.

Yaprak düğüm Geçerli yaprak düğüme giden yoldaki tüm koşullar göz önüne alındığında tahmin edilen sonuçlar için destek ve olasılık içerir.

Regresyon düğümü Girişlerle öngörülebilir öznitelik arasındaki ilişkiyi temsil eden regresyon formülünü içerir.

Daha fazla bilgi için bkz. Ayrık Öznitelikler için Düğüm Dağıtımı ve Sürekli Öznitelikler için Düğüm Dağıtımı.

NODE_SUPPORT
Bu düğümü destekleyen vaka sayısı.

MSOLAP_MODEL_COLUMN
Tahmin edilebilir özniteliği içeren sütunu gösterir.

MSOLAP_NODE_SCORE
Düğümle ilişkilendirilmiş bir puanı ekrana görüntüler. Daha fazla bilgi için Düğüm Puanı bölümüne bakın.

MSOLAP_NODE_SHORT_CAPTION
Görüntüleme amacıyla kullanılan etiket.

Açıklamalar

Karar ağaçları modelinin, Bir Naive Bayes veya sinir ağı modelinde bulunan marjinal istatistik düğümünden farklı olarak, modelin tamamı için istatistikleri depolayan ayrı bir düğümü yoktur. Bunun yerine model, her tahmin edilebilir öznitelik için ayrı bir ağaç oluşturur ve ağacın üst kısmında bir (Tümü) düğümü bulunur. Her ağaç diğerlerinden bağımsızdır. Modeliniz yalnızca bir öngörülebilir öznitelik içeriyorsa, yalnızca bir ağaç ve dolayısıyla yalnızca bir (Tümü) düğümü vardır.

Çıkış özniteliğini temsil eden her ağaç ayrıca bölmeleri temsil eden iç dallara (NODE_TYPE = 3) bölünür. Bu ağaçlardan her biri hedef özniteliğin dağılımıyla ilgili istatistikler içerir. Buna ek olarak, her yaprak düğüm (NODE_TYPE = 4), giriş özniteliklerini ve değerlerini açıklayan istatistikleri ve her bir öznitelik-değer çiftini destekleyen vaka sayısını içerir. Bu nedenle, bir karar ağacının herhangi bir dalında, kaynak verileri sorgulamak zorunda kalmadan olasılıkları veya veri dağılımını kolayca görüntüleyebilirsiniz. Her ağaç düzeyi, mutlaka hemen alt düğümlerinin toplamını temsil eder.

Bu istatistikleri alma örnekleri için bkz. Karar Ağaçları Modeli Sorgu Örnekleri.

Top

Karar Ağacı Yapısı Örneği

Karar ağacının nasıl çalıştığını anlamak için AdventureWorks bisiklet alıcı senaryosu gibi bir örneği göz önünde bulundurun. Tahmin edilebilir özniteliğin müşteri satın alma işlemleri olduğunu varsayarsak, karar ağaçları algoritması sağladığınız tüm girişler arasında bisiklet satın alma olasılığı olan müşterileri ve bisiklet satın alma olasılığı düşük olan müşterileri en etkili şekilde algılayan bir veri sütununu bulmaya çalışır. Örneğin model, Satın alma davranışının en iyi göstergesinin Yaş olduğunu bulabilir. Özellikle, 30 yaşın üzerindeki müşterilerin bir bisiklet satın alma olasılığı çok yüksektir ve diğer tüm müşterilerin satın alma olasılığı düşüktür. Bu senaryoda model Age özniteliğinde bir bölme oluşturur. Bu, ağacın biri 30 yaşın üzerindeki müşterileri, diğeri de 30 yaşın altındaki müşterileri içeren iki dala ayrıldığı anlamına gelir. Yeni dallar model yapısında iki yeni iç ağaç (NODE_TYPE = 3) olarak temsil edilir.

Her dal için model, farklı müşteriler için kullanılacak ek öznitelikleri aramaya devam eder. Verilerde müşteri alt grupları oluşturmaya devam etmek için yeterli kanıt yoksa model ağacı oluşturmayı durdurur. Model ayrıca bölünmenin ne kadar iyi olduğuna bakılmaksızın ya da değer null veya eksikse veya düğümdeki durum sayısı devam etmek için çok küçük olduğunda ağacı oluşturmaya son verir. Ağacın büyümesini erken durdurarak modelin belirli bir veri kümesine çok yakın bir şekilde eğitilmesini engellersiniz.

Her iç ağaç düğümü, geçerli sınıflandırma sonuçlarına göre sonuçların dökümünü sağlayan yaprak düğümler içerir. Örneğin, Yaş >= 30 ve Cinsiyet = Erkek'i temsil eden bir iç düğüme sahip olabilirsiniz. Bu grubun düğümü, bu kategorideki kaç müşterinin bir şey satın aldığı veya satın almadığını gösterir. Örneğin, sınıflandırma aşağıdaki ağaç bölmelerini içerebilir:

İç mekan ağacı Split
Yaş >= 30 Yaş >= 30 ve Cinsiyet = Erkek
Yaş >= 30 ve Cinsiyet = Kadın
Yaş < 30 Yaş < 30 ve Cinsiyet = Erkek
Yaş < 30 ve Cinsiyet = Kadın

Tahmin için bir karar ağacı modeli kullandığınızda, model argümanlar olarak sağladığınız öznitelikleri alır ve özniteliklerin yolunu ağacın aşağısına doğru izler. Genel olarak, tüm tahminler bir sayfaya gider ve iç düğümler yalnızca sınıflandırma için kullanılır.

Yaprak düğüm daima NODE_TYPE olarak 4 (Dağıtım) değerine sahiptir ve sağladığınız öznitelikler dikkate alındığında her sonucun (satın alma veya satın almama) olasılığını belirten bir histogram içerir. Örneğin, 60 yaşın üzerinde bir erkek olan yeni bir müşteri için tahminde bulunursanız model ilgili düğümü (Yaş > 30 ve Cinsiyet = Erkek) arar ve belirttiğiniz sonucun olasılığını döndürür. Bu olasılıklar düğümün NODE_DISTRIBUTION tablosunda depolanır.

Tahmin edilebilir öznitelik sürekli bir sayıysa, algoritma tahmin edilebilir öznitelik ile girişler arasındaki ilişkiyi modelleyen bir regresyon formülü oluşturmaya çalışır.

Top

Düğüm Başlığı ve Düğüm Açıklaması

Karar ağacı modelinde düğüm resim yazısı ve düğüm açıklaması benzer bilgiler içerir. Ancak, düğüm açıklaması daha eksiksizdir ve yaprak düğümlere yaklaştıkça daha fazla bilgi içerir. Hem düğüm resim yazısı hem de düğüm açıklaması yerelleştirilmiş dizelerdir.

Köşe yazısı Description
Belirli bir düğümü üst düğüme göre ayıran özniteliği görüntüler. Düğüm başlığı, bölme koşuluna göre popülasyonun bir alt segmentini tanımlar. Örneğin, bölme [Yaş] üzerindeyse ve üç yönlü bir bölmeyse, üç alt düğüm için düğüm açıklamalı alt yazıları "[Yaş] < 40", "40 <= [Yaş] < 50", "[Yaş] >= 50" olabilir.
NODE_DESCRIPTION Model üst düğümünden başlayarak bu düğümü diğer düğümlerden ayıran özniteliklerin tam listesini içerir. Örneğin, Ürün adı = Apple ve Renk = Kırmızı.

Top

Düğüm Kuralı ve Marjinal Kural

NODE_RULE ve MARGINAL_RULE sütunları, NODE_CAPTION ve NODE_DESCRIPTION sütunlarıyla aynı bilgileri içerir, ancak bilgileri XML parçaları olarak temsil eder. Düğüm kuralı, tam yolun XML sürümüdür, marjinal kural ise en son bölmeyi gösterir.

XML parçası tarafından temsil edilen öznitelik basit veya karmaşık olabilir. Basit bir öznitelik, model sütununun adını ve özniteliğin değerini içerir. Model sütunu iç içe bir tablo içeriyorsa, iç içe tablo özniteliği tablo adının, anahtar değerinin ve özniteliğinin birleştirilmiş bir sonucu olarak temsil edilir.

Uyarı

SQL Server SQL Server Analysis Services, iç içe tablo kullanımını destekleyen uzantılarla BIRLIKTE PMML standardının 2.0 sürümünü destekler. Verileriniz iç içe tablolar içeriyorsa ve modelin PMML sürümünü oluşturuyorsanız, modeldeki koşullarını içeren tüm öğeler uzantı olarak işaretlenir.

Top

Ayrık Öznitelikler için Düğüm Dağıtımı

Karar ağaçları modelinde, NODE_DISTRIBUTION tablosu yararlı istatistikler içerir. Ancak istatistiklerin türü, ağacın ayrık veya sürekli bir özniteliği tahmin edip etmediğine bağlıdır. Bu bölümde, ayrık öznitelikler için düğüm dağıtım istatistiklerinin anlamı açıklanmaktadır.

Öznitelik Adı ve Öznitelik Değeri

Sınıflandırma ağacında öznitelik adı her zaman tahmin edilebilir sütunun adını içerir. Bu değer size ağacın tahminlerini bildirir. Tek bir ağaç her zaman tek bir öngörülebilir özniteliği temsil ettiğinden, bu değer ağaç genelinde yinelenir.

Ayrık bir veri türü için öznitelik değeri alanı, tahmin edilebilir sütunun olası değerlerini ve Eksik değerini listeler.

Support

Her bir düğümün destek değeri, bu düğümde kaç vaka bulunduğunu belirtir. (Tümü) düzeyinde, modeli eğitmek için kullanılan vakaların tam sayısını görebilmelisiniz. Ağaçtaki her bölme için destek değeri, ağacın bu düğümüne gruplandırılan vakaların sayısıdır. Yaprak düğümlerdeki vakaların toplamı, mutlaka ağacın ana düğümündeki vakaların sayısına eşittir.

Sürekli öznitelikleri temsil eden düğümler için verilerde null değerlerin varlığı bazı uygun olmayan sonuçlara yol açabilir. Örneğin, m servis talepleri varsa, ortalama bir değer sum(tüm servis talepleri)/n olarak hesaplanır; burada n, m'den küçük bir sayıdır ve m-n eksik değerleri olan servis taleplerinin sayısını gösterir. Destek ayrıca n olarak da temsil edilir.

Olasılık

Her düğümle ilişkili olasılık, veri kümesinin tamamında herhangi bir durumun bu düğümde olma olasılığını bildirir. Olasılık puanları hem ağaç için bir bütün olarak hem de anında bölme için hesaplanır.

Örneğin, aşağıdaki tabloda 100 vaka ile çok basit bir model gösterilmektedir.

İç mekan ağacı Servis Talepleri Yaprak düğüm Servis Talepleri Üst düğüme göre olasılık Üst düğüme göre olasılık
Yaş >= 30 60 Yaş >= 30 ve Cinsiyet = Erkek 50 50/60 = .83 50/100 = .5
Yaş >= 30 ve Cinsiyet = Kadın 10 10/60 = .16 10/100 = .10
Yaş < 30 40 Yaş < 30 ve Cinsiyet = Erkek 30 30/40 = .75 30/100 = .30
Yaş < 30 ve Cinsiyet = Kadın 10 10/40 = .25 10/100 = .10

Olası eksik değerleri hesaba katma amacıyla tüm modellerde küçük bir ayarlama yapılır. Sürekli öznitelikler için her değer veya değer aralığı bir durum (örneğin, Yaş 30, Yaş <= 30 ve Yaş >30) olarak temsil edilir ve olasılıklar şu şekilde hesaplanır: durum var (değer = 1), başka bir durum var (değer = 0), durum Eksik. Olasılıkların eksik değerleri temsil etmek üzere nasıl ayarlandığı hakkında daha fazla bilgi için bkz. Eksik Değerler (Analysis Services - Veri Madenciliği).

Her düğümün olasılıkları neredeyse doğrudan dağıtımdan aşağıdaki gibi hesaplanır:

Olasılık = (durum için destek + önceki durum için destek) / (düğüm desteği + önceki düğüm desteği)

SQL Server Analysis Services, üst düğümden alt düğüme giden yolun güçlü bir çıkarıma işaret edip etmediğini belirlemek üzere depolanan olasılığı önceki olasılıkla karşılaştırmak için her düğüm için olasılıkları kullanır.

Tahminler yaparken, olasılıkları düzeltmek için dağılımın olasılığı düğümün olasılığıyla dengelenmelidir. Örneğin, ağaçtaki bir bölme vakaları 9000/1000 oranında ayırırsa, ağaç oldukça dengesizdir. Sonuç olarak, küçük daldan gelen bir tahmin, birçok durum içeren bir daldan gelen tahminle aynı ağırlığı taşımamalıdır.

Fark

Varyans, bir örnekteki dağılım değerlerinin beklenen dağılıma göre nasıl olduğunu gösteren bir ölçüdür. Ayrık değerler için varyans tanıma göre 0'dır.

Sürekli değerler için varyansın nasıl hesaplandığı hakkında bilgi için, bkz Doğrusal Regresyon Modelleri için Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği).

Değer Türü

Değer türü sütunu, NODE_DISTRIBUTION tablosundaki diğer sütunlarda sağlanan sayısal değerin anlamı hakkında bilgi sağlar. İç içe tablolardan belirli satırları almak için sorgularda değer türünü kullanabilirsiniz. Örnekler için bkz. Karar Ağaçları Modeli Sorgu Örnekleri.

Numaralandırmadaki MiningValueType türlerden sınıflandırma ağaçlarında aşağıdakiler kullanılır.

Değer türü Description
1 (Eksik) Eksik değerlerle ilgili bir sayıyı, olasılığı veya diğer istatistikleri gösterir.
4 (Ayrık) Ayrık veya ayrıklaştırılmış bir değerle ilgili olan sayıyı, olasılığı veya diğer istatistikleri gösterir.

Model sürekli tahmin edilebilir bir öznitelik içeriyorsa, ağaç regresyon formüllerine özgü değer türleri de içerebilir. Regresyon ağaçlarında kullanılan değer türlerinin listesi için bkz . Doğrusal Regresyon Modelleri için Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği).

Düğüm Puanı

Düğüm puanı, ağacın her düzeyinde biraz farklılık gösteren bilgileri temsil eder. Genel olarak puan, koşula göre bölünerek bölme işleminin ne kadar iyi yapıldığını belirten sayısal bir değerdir. Değer, daha yüksek bir değerin daha iyi olduğu bir çift olarak temsil edilir.

Tanım gereği, model düğümü ve tüm yaprak düğümler 0 düğüm puanına sahiptir.

Her ağacın üstünü temsil eden (Tümü) düğümü için MSOLAP_NODE_SCORE sütunu tüm ağaçtaki en iyi bölme puanını içerir.

Diğer tüm ağaç düğümleri için (yaprak düğümler hariç), her düğümün puanı, geçerli düğüm için en iyi bölme puanından üst düğümün bölme puanının çıkarılmasıyla elde edilen değeri temsil eder. Genellikle, bir ebeveyn düğümün bölme puanı, alt düğümlerinden herhangi birindeki bölme puanından daha iyi olmalıdır. Bunun nedeni, bir karar ağacı modelinin en önemli öznitelikleri önce ideal olarak bölmesidir.

Uyarı

Hem sürekli hem de ayrı tahmin edilebilir özniteliklere sahip bir karar ağacı modeli oluşturursanız, her ağaç türünü temsil eden (Tümü) düğümlerinde tamamen farklı puanlar görürsünüz. Her model bağımsız olarak değerlendirilmelidir ve puanlama regresyonu için kullanılan yöntemler puanlama sınıflandırması için kullanılan yöntemlerden tamamen farklıdır. Düğüm puanı değerleri karşılaştırılamaz.

Top

Karar Ağacı Modeli İçinde Regresyon Düğümleri

Karar ağaçları modeli sürekli sayısal verilerle tahmin edilebilir bir öznitelik içeriyorsa, Microsoft Karar Ağaçları algoritması verilerde tahmin edilen durumla giriş değişkenleri arasındaki ilişkinin doğrusal olduğu alanları bulmaya çalışır. Algoritma doğrusal ilişki bulmada başarılı olursa, doğrusal regresyonu temsil eden özel bir ağaç (NODE_TYPE = 25) oluşturur. Bu regresyon ağacı düğümleri, ayrık değerleri temsil eden düğümlerden daha karmaşıktır.

Genel olarak, bir regresyon, sürekli bağımlı (öngörülebilir değişken) içindeki değişiklikleri girişlerdeki değişikliklerin bir işlevi olarak eşler. Bağımlı değişkenin sürekli girişleri varsa ve giriş ile tahmin edilen değer arasındaki ilişki çizgi grafı olarak hesaplanacak kadar kararlıysa, regresyon düğümü bir formül içerir.

Ancak, giriş ve tahmin edilen değer arasındaki ilişki doğrusal değilse, bunun yerine standart bir karar ağacı gibi bir bölme oluşturulur. Örneğin, A'nın tahmin edilebilir öznitelik olduğunu ve B ve C'nin girişler olduğunu ve burada C'nin sürekli bir değer türü olduğunu varsayalım. A ile C arasındaki ilişki verilerin bazı bölümlerinde oldukça kararlı, ancak diğerlerinde kararsızsa algoritma, verilerin farklı alanlarını temsil eden bölmeler oluşturur.

Bölme koşulu Sonuç düğümde
n < 5 ise İlişki denklem 1 olarak ifade edilebilir
5 ile 10 arasında n ise Denklem yok
n > 10 ise İlişki denklem 2 olarak ifade edilebilir

Regresyon düğümleri hakkında daha fazla bilgi için Doğrusal Regresyon Modelleri için Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği)'ne bakın.

Ayrıca Bkz.

Madencilik Modeli İçeriği (Analysis Services - Veri Madenciliği)
Veri Madenciliği Modeli Görüntüleyicileri
Veri Madenciliği Sorguları
Microsoft Karar Ağaçları Algoritması