Obsah modelu dolování (Analysis Services – Dolování dat)

Platí pro: SQL Server 2019 a starší služby Analysis Services Azure Analysis Services Fabric/ Power BI Premium

Důležité

Dolování dat bylo v SQL Serveru 2017 Analysis Services zastaralé a nyní ukončeno ve službě SQL Server 2022 Analysis Services. Dokumentace se neaktualizuje pro zastaralé a ukončené funkce. Další informace najdete v tématu Zpětná kompatibilita služby Analysis Services.

Poté, co navrhnete a zpracujete model těžby pomocí dat z podkladové struktury dolování, je tento model dokončen a obsahuje obsah modelu těžby. Tento obsah můžete použít k předpovědím nebo analýze dat.

Obsah modelu dolování zahrnuje metadata o modelu, statistiky o datech a vzory zjištěné algoritmem dolování. V závislosti na použitém algoritmu může obsah modelu zahrnovat regresní vzorce, definice pravidel a sad položek nebo váhy a další statistiky.

Bez ohledu na použitý algoritmus se obsah modelu dolování prezentuje ve standardní struktuře. Strukturu můžete procházet v prohlížeči stromu obecného obsahu Společnosti Microsoft, který je součástí nástrojů SQL Server Data Tools, a pak přepnout na jeden z vlastních prohlížečů, abyste viděli, jak se informace interpretují a zobrazují graficky pro každý typ modelu. Dotazy na obsah modelu dolování můžete vytvořit také pomocí libovolného klienta, který podporuje sadu řádků schématu MINING_MODEL_CONTENT. Další informace naleznete v tématu Úlohy dotazů dolování dat a postupy.

Tato část popisuje základní strukturu obsahu poskytovaného pro všechny typy modelů dolování. Popisuje typy uzlů, které jsou společné pro veškerý obsah modelu dolování, a poskytuje pokyny k interpretaci informací.

Struktura obsahu modelu dolování

Uzly v obsahu modelu

Obsah modelu dolování podle typu algoritmu

Nástroje pro zobrazení obsahu modelu dolování

Nástroje pro dotazování obsahu modelu dolování

Struktura obsahu modelu dolování

Obsah každého modelu se prezentuje jako řada uzlů. Uzel je objekt v modelu dolování, který obsahuje metadata a informace o části modelu. Uzly jsou uspořádány v hierarchii. Přesné uspořádání uzlů v hierarchii a význam hierarchie závisí na použitém algoritmu. Pokud například vytvoříte model rozhodovacích stromů, může model obsahovat více stromů, všechny propojené s kořenem modelu; Pokud vytvoříte model neurální sítě, může model obsahovat jednu nebo více sítí a uzel statistiky.

První uzel v každém modelu se nazývá kořenový uzel nebo nadřazený uzel modelu . Každý model má kořenový uzel (NODE_TYPE = 1). Kořenový uzel obvykle obsahuje určitá metadata o modelu a počet podřízených uzlů, ale málo dalších informací o vzorech zjištěných modelem.

V závislosti na tom, který algoritmus jste použili k vytvoření modelu, má kořenový uzel různý počet podřízených uzlů. Podřízené uzly mají různé významy a obsahují jiný obsah v závislosti na algoritmu a hloubkě a složitosti dat.

Uzly v obsahu modelu dolování

V modelu dolování je uzel kontejner pro obecné účely, který uchovává informace o všech modelech nebo jeho části. Struktura každého uzlu je vždy stejná a obsahuje sloupce definované sadou řádků schématu dolování dat.

Každý uzel obsahuje metadata o uzlu, včetně identifikátoru, který je jedinečný v rámci každého modelu, ID nadřazeného uzlu a počtu podřízených uzlů, které uzel obsahuje. Metadata identifikují model, do kterého uzel patří, a katalog databází, ve kterém je daný model uložený. Další obsah poskytnutý v uzlu se liší v závislosti na typu algoritmu, který jste použili k vytvoření modelu, a může zahrnovat následující:

  • Počet případů v trénovacích datech, které podporují konkrétní predikovanou hodnotu

  • Statistika, jako je střední hodnota, směrodatná odchylka nebo rozptyl.

  • Koeficienty a vzorce

  • Definice pravidel a laterálních ukazatelů

  • Fragmenty XML, které popisují část modelu.

Seznam typů uzlů pro dolování obsahu

Následující tabulka uvádí různé typy uzlů, které jsou výstupem v modelech dolování dat. Vzhledem k tomu, že každý algoritmus zpracovává informace odlišně, každý model generuje pouze několik konkrétních druhů uzlů. Pokud změníte algoritmus, může se změnit typ uzlů. Pokud model znovu zpracujete, obsah každého uzlu se může změnit.

Poznámka:

Pokud používáte jinou službu dolování dat nebo pokud vytváříte vlastní algoritmy modulů plug-in, mohou být k dispozici další vlastní typy uzlů.

NODE_TYPE ID Popisek uzlu Obsah uzlu
1 Model Metadatový uzel a uzel kořenového obsahu Platí pro všechny typy modelů.
2 Tree Kořenový uzel klasifikačního stromu Platí pro modely rozhodovacího stromu.
3 Interiér Vnitřní rozdělený uzel ve stromu Platí pro modely rozhodovacího stromu.
4 Distribuce Terminálový uzel stromu Platí pro modely rozhodovacího stromu.
5 Cluster Cluster zjištěný algoritmem Platí pro clusteringové modely a sekvenční clusteringové modely.
6 Neznámý Neznámý typ uzlu
7 Množina položek Sada položek byla zjištěna algoritmem. Platí pro modely přidružení nebo sekvenční clusteringové modely.
8 Pravidlo asociace Pravidlo přidružení zjištěné algoritmem Platí pro modely přidružení nebo sekvenční clusteringové modely.
9 AtributPředvídatelný Předvídatelný atribut. Platí pro všechny typy modelů.
10 InputAttribute Vstupní atribut. Platí pro rozhodovací stromy a modely Naïve Bayes.
11 InputAttributeState Statistiky o stavech vstupního atributu Platí pro rozhodovací stromy a modely Naïve Bayes.
13 Sekvence Horní uzel komponenty modelu Markov v sekvenčním clusteru Platí pro sekvenční clusteringové modely.
14 Transition Markovova přechodová matice. Platí pro sekvenční clusteringové modely.
15 Časové řady Nekořenový uzel časově řazeného stromu. Platí pouze pro modely časových řad.
16 TsTree Kořenový uzel stromu časových řad, který odpovídá předvídatelné časové řadě. Platí pro modely časových řad a pouze v případě, že byl model vytvořen pomocí parametru MIXED.
17 NNetSubnetwork Jedna podsítě. Platí pro modely neurálních sítí.
18 NNetInputLayer Skupina, která obsahuje uzly vstupní vrstvy Platí pro modely neurálních sítí.
19 NNetHiddenLayer Skupiny obsahující uzly, které popisují skrytou vrstvu. Platí pro modely neurálních sítí.
21 NNetOutputLayer Skupiny, které obsahují uzly výstupní vrstvy. Platí pro modely neurálních sítí.
21 NNetInputNode Uzel ve vstupní vrstvě, která odpovídá vstupnímu atributu s odpovídajícími stavy. Platí pro modely neurálních sítí.
22 NNetHiddenNode Uzel ve skryté vrstvě Platí pro modely neurálních sítí.
23 NNetOutputNode Uzel ve výstupní vrstvě Tento uzel obvykle odpovídá výstupnímu atributu a odpovídajícím stavům. Platí pro modely neurálních sítí.
dvacet čtyři NNetMarginalNode Okrajové statistiky o tréninkové sadě. Platí pro modely neurálních sítí.
25 RegressionTreeRoot Kořen regresního stromu. Platí pro modely lineární regrese a pro modely rozhodovacích stromů, které obsahují spojité vstupní atributy.
26 NaiveBayesMarginalStatNode Mezní statistika o trénovací sadě. Platí pro modely Naïve Bayes.
27 ArimaRoot Kořenový uzel modelu ARIMA Platí pouze pro modely časových řad, které používají algoritmus ARIMA.
28 ArimaPeriodicStructure Pravidelná struktura v modelu ARIMA. Platí pouze pro modely časových řad, které používají algoritmus ARIMA.
29 ArimaAutoRegressive Autoregresní koeficient pro jeden termín v modelu ARIMA.

Platí pouze pro modely časových řad, které používají algoritmus ARIMA.
30 ArimaMovingAverage Klouzavý průměrový koeficient pro jediný termín v modelu ARIMA. Platí pouze pro modely časových řad, které používají algoritmus ARIMA.
1 000 CustomBase Výchozí bod pro vlastní typy uzlů Vlastní typy uzlů musí být celá čísla větší než tato konstanta. Platí pro modely vytvořené pomocí vlastních algoritmů plug-in.

ID uzlu, název, titulek a popis

Kořenový uzel libovolného modelu má vždy jedinečné ID (NODE_UNIQUE_NAME) 0. Všechna ID uzlů jsou automaticky přiřazena službou Analysis Services a nelze je upravit.

Kořenový uzel pro každý model obsahuje také některá základní metadata o modelu. Tato metadata zahrnují databázi služby Analysis Services, ve které je model uložený (MODEL_CATALOG), schéma (MODEL_SCHEMA) a název modelu (MODEL_NAME). Tyto informace se ale opakují ve všech uzlech modelu, takže pro získání těchto metadat nemusíte dotazovat kořenový uzel.

Kromě názvu použitého jako jedinečný identifikátor má každý uzel název (NODE_NAME). Tento název je automaticky vytvořen algoritmem pro účely zobrazení a nelze ho upravit.

Poznámka:

Algoritmus Microsoft Clustering umožňuje uživatelům přiřazovat popisné názvy ke každému clusteru. Tyto popisné názvy se však neuchovávají na serveru a pokud model znovu zpracujete, algoritmus vygeneruje nové názvy clusterů.

Popis atitulek pro každý uzel se automaticky vygeneruje algoritmem a slouží jako popisky, které vám pomůžou pochopit obsah uzlu. Text vygenerovaný pro každé pole závisí na typu modelu. V některých případech může název, titulek a popis obsahovat přesně stejný řetězec, ale v některých modelech může popis obsahovat další informace. Podrobnosti o implementaci najdete v tématu o jednotlivých typech modelu.

Poznámka:

Server Analysis Services podporuje přejmenování uzlů pouze v případě, že vytváříte modely pomocí vlastního algoritmu modulu plug-in, který implementuje přejmenování. Pokud chcete povolit přejmenování, musíte při vytváření algoritmu plug-in přepsat metody.

Nadřazené uzly, podřízené uzly a kardinalita uzlu

Vztah mezi nadřazenými a podřízenými uzly ve stromové struktuře je určen hodnotou sloupce PARENT_UNIQUE_NAME. Tato hodnota je uložena v podřízeném uzlu a udává ID nadřazeného uzlu. Příklady použití těchto informací:

  • PARENT_UNIQUE_NAME, která má hodnotu NULL, znamená, že uzel je horním uzlem modelu.

  • Pokud je hodnota PARENT_UNIQUE_NAME 0, musí být uzel přímým následníkem horního uzlu v modelu. Důvodem je to, že ID kořenového uzlu je vždy 0.

  • Pomocí funkcí v dotazu DMX (Data Mining Extensions) můžete najít potomky nebo nadřazené prvky určitého uzlu. Další informace o používání funkcí v dotazech naleznete v tématu Dotazy dolování dat.

Kardinalita se vztahuje k počtu položek v sadě. V kontextu procesního modelu dolování dat kardinalita udává počet podřízených položek v konkrétním uzlu. Pokud má například model rozhodovacího stromu uzel pro [Roční příjem] a tento uzel má dva podřízené uzly, jeden pro podmínku [Roční příjem] = Vysoký a druhý pro podmínku [Roční příjem] = Nízký, hodnota CHILDREN_CARDINALITY pro uzel [Roční příjem] je 2.

Poznámka:

Ve službě SQL Server Analysis Services se při výpočtu kardinality uzlu počítají pouze bezprostřední podřízené uzly. Pokud ale vytvoříte vlastní algoritmus modulu plug-in, můžete přetížit CHILDREN_CARDINALITY, aby se kardinalita spočítala odlišně. To může být užitečné, například pokud chcete spočítat celkový počet potomků, nejen bezprostřední děti.

I když se kardinalita počítá stejným způsobem pro všechny modely, způsob interpretace nebo použití hodnoty kardinality se liší v závislosti na typu modelu. Například kardinalita horního uzlu v modelu clusteringu udává celkový počet nalezených clusterů. V jiných typech modelů může kardinalita vždy mít nastavenou hodnotu v závislosti na typu uzlu. Další informace o tom, jak interpretovat kardinalitu, najdete v tématu o jednotlivých typech modelu.

Poznámka:

Některé modely, například modely vytvořené algoritmem Microsoft Neuural Network, navíc obsahují speciální typ uzlu, který poskytuje popisné statistiky o trénovacích datech pro celý model. Podle definice tyto uzly nikdy nemají podřízené uzly.

Distribuce uzlů

Sloupec NODE_DISTRIBUTION obsahuje vnořenou tabulku, která v mnoha uzlech poskytuje důležité a podrobné informace o vzorech zjištěných algoritmem. Přesné statistiky uvedené v této tabulce se mění v závislosti na typu modelu, umístění uzlu ve stromu a zda je předvídatelný atribut souvislou číselnou hodnotou nebo diskrétní hodnotou; Mohou však zahrnovat minimální a maximální hodnoty atributu, váhy přiřazené k hodnotám, počet případů v uzlu, koeficienty používané ve vzorci regrese a statistické míry, jako jsou směrodatná odchylka a rozptyl. Další informace o tom, jak interpretovat distribuci uzlů, najdete v tématu o konkrétním typu modelu, se kterým pracujete.

Poznámka:

Tabulka NODE_DISTRIBUTION může být v závislosti na typu uzlu prázdná. Například některé uzly slouží pouze k uspořádání kolekce podřízených uzlů a jedná se o podřízené uzly, které obsahují podrobné statistiky.

Vnořená tabulka, NODE_DISTRIBUTION, vždy obsahuje následující sloupce. Obsah jednotlivých sloupců se liší v závislosti na typu modelu. Další informace o konkrétních typech modelů naleznete v tématu Obsah modelu dolování podle typu algoritmu.

ATTRIBUTE_NAME
Obsah se liší podle algoritmu. Může to být název sloupce, například předvídatelný atribut, pravidlo, sada položek nebo interní informace pro algoritmus, například součást vzorce.

Tento sloupec může obsahovat také dvojici atribut-hodnota.

ATTRIBUTE_VALUE
Hodnota atributu pojmenovaného v ATTRIBUTE_NAME

Pokud je název atributu sloupec, pak v nejjednodušším případě ATTRIBUTE_VALUE obsahuje jednu z diskrétních hodnot pro daný sloupec.

V závislosti na tom, jak algoritmus zpracovává hodnoty, může ATTRIBUTE_VALUE také obsahovat příznak, který vám řekne, jestli existuje hodnota atributu (Existující), nebo jestli je hodnota null (Chybí).

Pokud je například váš model nastavený tak, aby našel zákazníky, kteří zakoupili konkrétní položku alespoň jednou, může sloupec ATTRIBUTE_NAME obsahovat dvojici hodnot atributů, která definuje položku zájmu, například Model = 'Water bottle'a sloupec ATTRIBUTE_VALUE by obsahoval pouze klíčové slovo Existující nebo Chybějící.

PODPORA
Počet případů, které mají tento pár atribut-hodnota nebo které obsahují tuto sadu položek nebo pravidlo.

Obecně platí, že hodnota podpory pro každý uzel udává, kolik případů v trénovací sadě je součástí aktuálního uzlu. Ve většině typů modelů podpora představuje přesný počet případů. Hodnoty podpory jsou užitečné, protože můžete zobrazit distribuci dat v rámci trénovacích případů, aniž byste museli dotazovat trénovací data. Server Analysis Services používá také tyto uložené hodnoty k výpočtu uložené pravděpodobnosti a předchozí pravděpodobnosti k určení, zda je odvození silné nebo slabé.

Například ve stromu klasifikace hodnota podpory označuje počet případů, které mají popsanou kombinaci atributů.

V rozhodovacím stromu se součet podpory na každé úrovni rovná podpoře jejího nadřazeného uzlu. Pokud je například model obsahující 1200 případů rovnoměrně rozdělen podle pohlaví, a poté rovnoměrně rozdělen třemi úrovněmi příjmu: nízký, střední a vysoký, podřízené uzly uzlu (2), což jsou uzly (4), (5) a (6), vždy dohromady dávají stejný počet případů jako uzel (2).

ID uzlu a atributy uzlu Počet podpory
(1) Kořen modelu 1200
(2) Pohlaví = Muž

(3) Pohlaví = Žena
600

600
(4) Pohlaví = Muž a příjem = Vysoký

(5) Pohlaví = muž a příjem = střední

(6) Pohlaví: muž a příjem: nízká
200

200

200
(7) Pohlaví = Žena a příjem = Vysoký

(8) Pohlaví = Žena a příjem = Střední

(9) Pohlaví = Žena a příjem = Nízká
200

200

200

U modelu clusteringu může být číslo podpory vážené, aby zahrnovalo pravděpodobnosti, že patří do více clusterů. Výchozí metodou clusteringu je členství ve více clusterech. V tomto případě, protože každý případ nemusí nutně patřit do jednoho a pouze jednoho klastru, součet podpory v rámci všech klastrů nemusí činit 100 %.

PRAVDĚPODOBNOST
Určuje pravděpodobnost pro tento konkrétní uzel v rámci celého modelu.

Pravděpodobnost obecně představuje podporu pro tuto konkrétní hodnotu rozdělenou celkovým počtem případů v uzlu (NODE_SUPPORT).

Pravděpodobnost je však upravena mírně tak, aby eliminovala předsudky způsobené chybějícími hodnotami v datech.

Pokud jsou například aktuální hodnoty pro [Total Children] "Jedna" a "Dva", chcete se vyhnout vytvoření modelu, který předpovídá, že není možné mít žádné děti nebo mít tři děti. Aby se zajistilo, že chybějící hodnoty jsou nedostupné, ale ne nemožné, algoritmus vždy přidá 1 k počtu skutečných hodnot pro libovolný atribut.

Příklad:

Pravděpodobnost [Celkový počet dětí = Jedno] = [Počet případů, kde Celkový počet dětí = Jedno] + 1/[Počet všech případů] + 3

Pravděpodobnost [Celkový počet dětí = Dvě]= [Počet případů, kdy Celkový počet dětí = Dvě] +1/[Počet všech případů] +3

Poznámka:

Úprava hodnoty 3 se vypočítá přidáním 1 k celkovému počtu existujících hodnot n.

Po úpravě se pravděpodobnosti všech hodnot stále sčítají na 1. Pravděpodobnost hodnoty bez dat (v tomto příkladu [Total Children = 'Zero', 'Three', or some other value]) začíná na velmi nízké nenulové úrovni a sčítá pomalu s tím, jak se přidávají další případy.

ODCHYLKA
Určuje odchylku hodnot v uzlu. Podle definice je rozptyl vždy 0 pro diskrétní hodnoty. Pokud model podporuje spojité hodnoty, vypočítá se rozptyl jako σ (sigma), pomocí jmenovatele n nebo počtu případů v uzlu.

Obecně se používají dvě definice, které představují směrodatnou odchylku (StDev). Jedna metoda pro výpočet směrodatné odchylky bere v úvahu předsudky a jiná metoda vypočítá směrodatnou odchylku bez použití předsudků. Obecně algoritmy Microsoftu pro dolování dat nepoužívají při výpočtu směrodatné odchylky žádnou zaujatost.

Hodnota, která se zobrazí v tabulce NODE_DISTRIBUTION, je skutečná hodnota pro všechny diskrétní a diskretizované atributy a průměr pro souvislé hodnoty.

VALUE_TYPE
Určuje datový typ hodnoty nebo atributu a použití hodnoty. Některé typy hodnot se vztahují pouze na určité typy modelů:

VALUE_TYPE ID Popisek hodnoty Název typu hodnoty
1 Nepřítomný Označuje, že data případu neobsahují hodnotu pro tento atribut. Chybějící stav se vypočítá odděleně od atributů, které mají hodnoty.
2 Existující Označuje, že data případu obsahují hodnotu pro tento atribut.
3 Nepřetržité Označuje, že hodnota atributu je souvislá číselná hodnota, a proto může být reprezentována střední hodnotou spolu s rozptylem a směrodatnou odchylkou.
4 Diskrétní Označuje hodnotu, číselnou nebo textovou hodnotu, která je považována za diskrétní.

Poznámka Diskrétní hodnoty mohou také chybět; při provádění výpočtů se ale zpracovávají odlišně. Informace najdete v tématu Chybějící hodnoty (Analysis Services – Dolování dat).
5 Diskretizováno Označuje, že atribut obsahuje číselné hodnoty, které byly diskretizovány. Hodnota bude formátovaný řetězec, který popisuje kontejnery diskretizace.
6 Existující Označuje, že atribut má souvislé číselné hodnoty a že hodnoty byly zadány v datech, vs. hodnoty, které chybí nebo jsou odvozeny.
7 Koeficient Označuje číselnou hodnotu, která představuje koeficient.

Koeficient je hodnota, která se použije při výpočtu hodnoty závislé proměnné. Pokud například model vytvoří regresní vzorec, který predikuje příjem na základě věku, použije se koeficient ve vzorci, který spojuje věk s příjmem.
8 Získání skóre Označuje číselnou hodnotu, která představuje získání skóre pro atribut.
9 Statistika Označuje číselnou hodnotu, která představuje statistiku pro regresor.
10 Jedinečný název uzlu Označuje, že hodnota by neměla být zpracována jako číselná nebo řetězcová, ale jako jedinečný identifikátor jiného uzlu obsahu v modelu.

V modelu neurální sítě například ID poskytují ukazatele z uzlů ve výstupní vrstvě na uzly ve skryté vrstvě a z uzlů ve skryté vrstvě na uzly ve skryté vrstvě až po uzly ve vstupní vrstvě.
11 Zachytit Označuje číselnou hodnotu, která představuje průsečík ve vzorci regrese.
12 Periodicita Označuje, že hodnota označuje pravidelnou strukturu v modelu.

Platí pouze pro modely časových řad, které obsahují model ARIMA.

Poznámka: Algoritmus Microsoft Time Series automaticky zjišťuje pravidelné struktury na základě trénovacích dat. V důsledku toho můžou periodické hodnoty v konečném modelu zahrnovat hodnoty periodicity, které jste při vytváření modelu nezadali jako parametr.
13 Autoregresivní řád Označuje, že hodnota představuje počet autoregresivní řady.

Platí pro modely časových řad, které používají algoritmus ARIMA.
14 Pořadí klouzavých průměrů Představuje hodnotu, která představuje počet klouzavých průměrů v řadě.

Platí pro modely časových řad, které používají algoritmus ARIMA.
15 Pořadí rozdílů Označuje, že hodnota představuje hodnotu, která označuje, kolikrát je řada diferencovaná.

Platí pro modely časových řad, které používají algoritmus ARIMA.
16 logický Představuje logický typ.
17 Other Představuje vlastní hodnotu definovanou algoritmem.
18 Předem vykreslený řetězec Představuje vlastní hodnotu, kterou algoritmus vykresluje jako řetězec. Objektový model neaplikoval žádné formátování.

Typy hodnot jsou odvozeny z ADMOMD.NET výčtu. Další informace naleznete v tématu Microsoft.AnalysisServices.AdomdServer.MiningValueType.

Skóre uzlu

Význam skóre uzlu se liší v závislosti na typu modelu a může být specifický i pro typ uzlu. Informace o tom, jak se NODE_SCORE počítá pro každý typ modelu a uzlu, naleznete v tématu Obsah modelu dolování podle typu algoritmu.

Pravděpodobnost uzlu a mezní pravděpodobnost

Sada řádků schématu modelu dolování zahrnuje sloupce NODE_PROBABILITY a MARGINAL_PROBABILITY pro všechny typy modelů. Tyto sloupce obsahují hodnoty pouze v uzlech, kde je hodnota pravděpodobnosti smysluplná. Například kořenový uzel modelu nikdy neobsahuje skóre pravděpodobnosti.

V těchto uzlech, které poskytují skóre pravděpodobnosti, pravděpodobnost uzlu a mezní pravděpodobnosti představují různé výpočty.

  • Mezní pravděpodobnost je pravděpodobnost dosažení uzlu z nadřazeného objektu.

  • Pravděpodobnost uzlu je pravděpodobnost dosažení uzlu z kořene.

  • Pravděpodobnost uzlu je vždy menší nebo rovna mezní pravděpodobnosti.

Například pokud je populace všech zákazníků v rozhodovacím stromu rovnoměrně rozdělena podle pohlaví (a žádné hodnoty nechybí), pravděpodobnost podřízených uzlů by měla být 0,5. Předpokládejme však, že každý uzel pro pohlaví je rozdělen stejně podle úrovní příjmu- Vysoká, Střední a Nízká. V tomto případě by skóre MARGINAL_PROBABILITY pro každý podřízený uzel mělo být vždy 0,33, ale hodnota NODE_PROBABILTY bude součinem všech pravděpodobností, které vedou k tomuto uzlu, a proto vždy menší než hodnota MARGINAL_PROBABILITY.

Úroveň uzlu/atributu a hodnoty Mezní pravděpodobnost Pravděpodobnost uzlu
Kořen modelu

Všichni cíloví zákazníci
1 1
Cílení zákazníků podle pohlaví .5 .5
Cílení zákazníků podle pohlaví a opětovné rozdělení třemi způsoby podle příjmů .33 .5 * .33 = .165

Pravidlo uzlu a okrajové pravidlo

Sada řádků schématu modelu dolování obsahuje také sloupce NODE_RULE a MARGINAL_RULE pro všechny typy modelů. Tyto sloupce obsahují fragmenty XML, které lze použít k serializaci modelu nebo k reprezentaci některé části struktury modelu. Tyto sloupce můžou být pro některé uzly prázdné, pokud by hodnota byla nesmyslná.

Jsou k dispozici dva druhy pravidel XML, podobně jako dva druhy hodnot pravděpodobnosti. Fragment XML v MARGINAL_RULE definuje atribut a hodnotu aktuálního uzlu, zatímco fragment XML v NODE_RULE popisuje cestu k aktuálnímu uzlu z kořenového adresáře modelu.

Obsah modelu dolování podle typu algoritmu

Každý algoritmus ukládá různé typy informací jako součást schématu obsahu. Například algoritmus clusteringu Microsoft generuje mnoho podřízených uzlů, z nichž každý představuje možný cluster. Každý uzel clusteru obsahuje pravidla, která popisují charakteristiky sdílené položkami v clusteru. Naproti tomu algoritmus lineární regrese společnosti Microsoft neobsahuje žádné podřízené uzly; nadřazený uzel modelu obsahuje rovnici, která popisuje lineární vztah zjištěný analýzou.

Následující tabulka obsahuje odkazy na témata pro každý typ algoritmu.

  • Témata týkající se obsahu modelu: Vysvětlete význam každého typu uzlu pro každý typ algoritmu a poskytněte pokyny, které uzly mají největší zájem o konkrétní typ modelu.

  • Témata týkající se dotazů: Uveďte příklady dotazů na konkrétní typ modelu a pokyny k interpretaci výsledků.

Typ algoritmu nebo modelu Obsah modelu Dotazování modelů dolování
Modely pravidel přidružení Obsah asociačních modelů pro dolování dat (Analysis Services – Dolování dat) Příklady dotazů modelu přidružení
Modely clusteringu Obsah modelu dolování pro modely rozhodovacího stromu (Analysis Services – Dolování dat) Příklady dotazů modelu clusteringu
Model rozhodovacích stromů Obsah modelu dolování pro modely rozhodovacího stromu (Analysis Services – Dolování dat) Příklady dotazů modelu rozhodovacích stromů
Lineární regresní modely Obsah modelu dolování pro lineární regresní modely (Analysis Services – Dolování dat) Příklady dotazů modelu lineární regrese
Logistické regresní modely Obsah modelu dolování pro logistické regresní modely (Analysis Services – Dolování dat) Příklady dotazů modelu lineární regrese
Naivní Bayesovy modely Obsah modelu dolování pro modely Naive Bayes (Analysis Services – Dolování dat) Příklady dotazů modelu Naive Bayes
Modely neurálních sítí Obsah modelu dolování pro neurální síťové modely (Analysis Services – Dolování dat) Příklady dotazů modelu neurální sítě
Shlukování sekvencí Obsah modelu dolování pro sekvenční clusteringové modely (Analysis Services – Dolování dat) Příklady dotazů modelu sekvenčního clusteringu
Modely časových řad Obsah těžebního modelu pro modely časových řad (Analysis Services – Dolování dat) Příklady dotazů modelu time series

Nástroje pro zobrazení obsahu modelu dolování

Při procházení nebo prozkoumání modelu v SQL Server Data Tools můžete zobrazit informace v Prohlížeči obecného obsahu Microsoft, který je k dispozici v nástrojích SQL Server Data Tools i v SQL Server Management Studiu.

Microsoft Generic Content Viewer zobrazí sloupce, pravidla, vlastnosti, atributy, uzly a další obsah z modelu pomocí stejných informací, které jsou k dispozici v sadě řádků schématu obsahu modelu dolování. Sada řádků schématu obsahu je obecná architektura pro prezentaci podrobných informací o obsahu modelu dolování dat. Obsah modelu můžete zobrazit v jakémkoli klientovi, který podporuje hierarchické sady řádků. Prohlížeč v nástrojích SQL Server Data Tools zobrazí tyto informace v prohlížeči tabulek HTML, který představuje všechny modely v konzistentním formátu, což usnadňuje pochopení struktury modelů, které vytvoříte. Další informace naleznete v tématu Procházení modelu pomocí Prohlížeče obecného stromu obsahu společnosti Microsoft.

Nástroje pro dotazování obsahu modelu dolování

Pokud chcete načíst obsah modelu dolování, musíte vytvořit dotaz na model dolování dat.

Nejjednodušší způsob, jak vytvořit dotaz na obsah, je spustit následující příkaz DMX v aplikaci SQL Server Management Studio:

SELECT * FROM [<mining model name>].CONTENT  

Další informace naleznete v tématu Dotazy dolování dat.

Obsah modelu dolování můžete také dotazovat pomocí sad řádků schématu dolování dat. Sada řádků schématu je standardní struktura, kterou klienti používají ke zjišťování, procházení a dotazování informací o dolování struktur a modelů. Sady řádků schématu můžete dotazovat pomocí příkazů XMLA, Transact-SQL nebo DMX.

V SQL Serveru 2017 můžete také získat přístup k informacím v sadách řádků schématu dolování dat otevřením připojení k instanci služby SQL Server Analysis Services a dotazováním systémových tabulek. Další informace naleznete v tématu Data Mining Schema Rowsets (SSAs).

Viz také

Microsoft Generic Content Tree Viewer (Dolování dat)
Algoritmy dolování dat (Analysis Services – Dolování dat)