Bányászati modell tartalma (Analysis Services – Adatbányászat)

A következőkre vonatkozik: SQL Server 2019 és korábbi Analysis Services Azure Analysis Services Fabric/Power BI Premium

Fontos

Az adatbányászat elavult az SQL Server 2017 Analysis Servicesben, és megszűnt az SQL Server 2022 Analysis Servicesben. Az elavult és megszűnt funkciók dokumentációja nem frissül. További információkért tekintse meg az Analysis Services visszamenőleges kompatibilitását.

Miután megtervezett és feldolgozott egy bányászati modellt a mögöttes bányászati struktúra adataival, a bányászati modell elkészült, és a bányászati modell tartalmát tartalmazza. Ezzel a tartalommal előrejelzéseket készíthet, vagy elemezheti az adatokat.

A bányászati modell tartalma magában foglalja a modell metaadatait, az adatok statisztikáit és a bányászati algoritmus által felderített mintákat. A használt algoritmustól függően a modell tartalma tartalmazhat regressziós képleteket, szabályok és elemek definícióit, illetve súlyokat és egyéb statisztikákat.

A használt algoritmustól függetlenül a bányászati modell tartalma szabványos struktúrában jelenik meg. Az SQL Server Data Toolsban található Microsoft Generic Content Tree Viewerben tallózhat a struktúrában, majd válthat az egyik egyéni megtekintőre, hogy lássa, hogyan értelmezi és jeleníti meg grafikusan az információkat az egyes modelltípusokhoz. A bányászati modell tartalmának lekérdezését is létrehozhatja a MINING_MODEL_CONTENT sémasorkészletet támogató ügyfél használatával. További információ: Adatbányászati lekérdezési feladatok és útmutatók.

Ez a szakasz a különféle bányászati modellekhez biztosított tartalom alapvető szerkezetét ismerteti. Ismerteti az összes bányászati modell tartalmának gyakori csomóponttípusait, és útmutatást nyújt az információk értelmezéséhez.

A bányászati modell tartalmának szerkezete

Csomópontok a modell tartalmában

Bányászati modell tartalma algoritmustípus szerint

A bányászati modell tartalmának megtekintésére szolgáló eszközök

Eszközök a bányászati modell tartalmának lekérdezéséhez

A bányászati modell tartalmának szerkezete

Az egyes modellek tartalma csomópontok sorozataként jelenik meg. A csomópont egy olyan objektum egy bányászati modellben, amely metaadatokat és információkat tartalmaz a modell egy részére vonatkozóan. A csomópontok hierarchiában vannak elrendezve. A hierarchiában lévő csomópontok pontos elrendezése és a hierarchia jelentése a használt algoritmustól függ. Ha például döntési fákat hoz létre, a modell több fát is tartalmazhat, amelyek mindegyike a modell gyökeréhez csatlakozik; neurális hálózati modell létrehozásakor a modell tartalmazhat egy vagy több hálózatot, valamint egy statisztikai csomópontot.

Az egyes modellek első csomópontja a gyökércsomópont, vagy a modell szülőcsomópontja . Minden modell rendelkezik gyökércsomópont (NODE_TYPE = 1). A gyökércsomópont általában tartalmaz néhány metaadatot a modellről és a gyermekcsomópontok számát, de kevés további információt a modell által észlelt mintákról.

A modell létrehozásához használt algoritmustól függően a gyökércsomópont különböző számú gyermekcsomópontot használ. A gyermekcsomópontok különböző jelentéssel rendelkeznek, és az algoritmustól, valamint az adatok mélységétől és összetettségétől függően különböző tartalmakat tartalmaznak.

Csomópontok a bányászati modell tartalmában

A bányászati modellekben a csomópontok olyan általános célú tárolók, amelyek a modell egészéről vagy egy részéről tárolnak információkat. Az egyes csomópontok struktúrája mindig ugyanaz, és tartalmazza az adatbányászati sémasorkészlet által meghatározott oszlopokat.

Minden csomópont metaadatokat tartalmaz a csomópontról, beleértve az egyes modelleken belül egyedi azonosítót, a szülőcsomópont azonosítóját és a csomópont gyermekcsomópontjainak számát. A metaadatok azonosítják azt a modellt, amelyhez a csomópont tartozik, és azt az adatbáziskatalógust, amelyben az adott modell található. A csomópontban megadott további tartalom a modell létrehozásához használt algoritmus típusától függően eltérő lehet, és az alábbiakat is tartalmazhatja:

  • Az adott előrejelzett értéket támogató betanítási adatokban szereplő esetek száma.

  • Statisztikai adatok, például középérték, szórás vagy variancia.

  • Együtthatók és képletek.

  • Szabályok és oldalirányú mutatók meghatározása.

  • A modell egy részét leíró XML-töredékek.

A bányászati tartalomcsomópontok típusainak listája

Az alábbi táblázat az adatbányászati modellekben kimeneti csomópontok különböző típusait sorolja fel. Mivel minden algoritmus eltérően dolgozza fel az információkat, minden modell csak néhány adott csomóponttípust hoz létre. Ha módosítja az algoritmust, a csomópontok típusa megváltozhat. Emellett, ha újra feldolgozta a modellt, az egyes csomópontok tartalma megváltozhat.

Megjegyzés:

Ha másik adatbányászati szolgáltatást használ, vagy ha saját beépülő modulalgoritmusokat hoz létre, további egyéni csomóponttípusok is elérhetők lehetnek.

NODE_TYPE azonosító Csomópontcímke Csomópont tartalma
1 Model Metaadatok és a gyökértartalom csomópontja. Minden modelltípusra vonatkozik.
2 Tree Besorolási fa gyökércsomópontja. Döntési fa modellekre vonatkozik.
3 Belső Egy fa belső elágazási csomópontja. Döntési fa modellekre vonatkozik.
4 Disztribúció Egy fa terminálcsomópontja. Döntési fa-modellekre vonatkozik.
5 Klászter Az algoritmus által észlelt klaszter. A fürtözési modellekre és a sorrendi fürtözési modellekre vonatkozik.
6 Ismeretlen Ismeretlen csomóponttípus.
7 ItemSet Az algoritmus által észlelt elemek. Társítási modellekre vagy sorozat-klaszterezési modellekre vonatkozik.
8 Asszociációs Szabály Az algoritmus által észlelt társítási szabály. Társítási modellekre vagy szekvencia-klaszterezési modellekre vonatkozik.
9 KiszámíthatóAttribútum Kiszámítható attribútum. Minden modelltípusra vonatkozik.
10 InputAttribute Bemeneti attribútum. A döntési fákra és a Naiv Bayes-modellekre vonatkozik.
11 InputAttributeState Statisztikai adatok egy bemeneti attribútum állapotáról. A döntési fákra és a Naiv Bayes-modellekre vonatkozik.
13 Szekvencia A sorozatfürt Markov-modellösszetevőjének legfelső csomópontja. A sorozatfürtmodellekre vonatkozik.
14 Transition Markov-áttűnési mátrix. A sorozatfürtmodellekre vonatkozik.
15 TimeSeries Idősorfa nem gyökércsomópontja. Csak idősorozat-modellekre vonatkozik.
16 TsTree Egy kiszámítható idősornak megfelelő idősorfa gyökércsomópontja. Az idősorozat-modellekre vonatkozik, és csak akkor, ha a modell a MIXED paraméterrel lett létrehozva.
17 NNetSubnetwork Egy alhálózat. Neurális hálózati modellekre vonatkozik.
18 NNetInputLayer A bemeneti réteg csomópontjait tartalmazó csoport. Neurális hálózati modellekre vonatkozik.
19 NNetHiddenLayer A rejtett réteget leíró csomópontokat tartalmazó csoportok. Neurális hálózati modellekre vonatkozik.
21 NNetOutputLayer A kimeneti réteg csomópontjait tartalmazó csoportok. Neurális hálózati modellekre vonatkozik.
21 NNetInputNode A bemeneti réteg azon csomópontja, amely megfelel egy bemeneti attribútumnak a megfelelő állapotokkal. Neurális hálózati modellekre vonatkozik.
22 NNetHiddenNode Csomópont a rejtett rétegben. Neurális hálózati modellekre vonatkozik.
23 NNetOutputNode Csomópont a kimeneti rétegben. Ez a csomópont általában egy kimeneti attribútumnak és a megfelelő állapotnak felel meg. Neurális hálózati modellekre vonatkozik.
24 NNetMarginalNode A betanítási csoport marginális statisztikái. Neurális hálózati modellekre vonatkozik.
25 RegressziósfaGyökér Regressziós fa gyökere. A lineáris regressziós modellekre és a folyamatos bemeneti attribútumokat tartalmazó döntési fák modelljeire vonatkozik.
26 NaiveBayesMarginalStatNode A tanítási halmaz marginális statisztikái. A Naïve Bayes-modellekre vonatkozik.
27 ArimaRoot Egy ARIMA-modell gyökércsomópontja. Csak azokra az idősorozat-modellekre vonatkozik, amelyek az ARIMA algoritmust használják.
28 ArimaPeriodicStructure Rendszeres struktúra egy ARIMA-modellben. Csak azokra az idősorozat-modellekre vonatkozik, amelyek az ARIMA algoritmust használják.
29 ArimaAutoRegressive Autoregresszív együttható egyetlen kifejezéshez egy ARIMA-modellben.

Csak azokra az idősorozat-modellekre vonatkozik, amelyek az ARIMA algoritmust használják.
30 ArimaMovingAverage Az átlagos együttható áthelyezése egyetlen kifejezésre egy ARIMA-modellben. Csak azokra az idősorozat-modellekre vonatkozik, amelyek az ARIMA algoritmust használják.
1000 CustomBase Kezdőpont egyéni csomóponttípusokhoz. Az egyéni csomóponttípusoknak ennél az állandónál nagyobb értékű egész számoknak kell lenniük. Egyéni beépülő modul algoritmusok használatával létrehozott modellekre vonatkozik.

Csomópont azonosítója, neve, felirata és leírása

Minden modell gyökércsomópontja mindig 0 egyedi azonosítóval (NODE_UNIQUE_NAME) rendelkezik. Az Analysis Services minden csomópontazonosítót automatikusan hozzárendel, és nem módosítható.

Az egyes modellek gyökércsomópontja is tartalmaz néhány alapvető metaadatot a modellről. Ez a metaadatok tartalmazzák az Analysis Services-adatbázist, amelyben a modell tárolódik (MODEL_CATALOG), a sémát (MODEL_SCHEMA) és a modell nevét (MODEL_NAME). Ez az információ azonban a modell összes csomópontjában ismétlődik, ezért nem kell lekérdeznie a gyökércsomópontot a metaadatok lekéréséhez.

Az egyedi azonosítóként használt név mellett minden csomópontnak van egy neve (NODE_NAME). Ezt a nevet az algoritmus automatikusan létrehozza megjelenítési célokra, és nem szerkeszthető.

Megjegyzés:

A Microsoft Clustering algoritmus lehetővé teszi a felhasználók számára, hogy barátságos neveket rendeljenek az egyes fürtökhöz. Azonban ezek a barátságos nevek nem maradnak meg a kiszolgálón, és ha újrafeldolgozza a modellt, az algoritmus új fürtneveket fog létrehozni.

Az egyes csomópontok feliratát és leírását az algoritmus automatikusan létrehozza, és címkékként szolgál a csomópont tartalmának megértéséhez. Az egyes mezőkhöz létrehozott szöveg a modell típusától függ. Bizonyos esetekben a név, a felirat és a leírás pontosan ugyanazt a sztringet tartalmazhatja, de egyes modellekben a leírás további információkat is tartalmazhat. Az implementáció részleteiért tekintse meg az egyes modelltípusokkal kapcsolatos témakört.

Megjegyzés:

Az Analysis Services-kiszolgáló csak akkor támogatja a csomópontok átnevezését, ha az átnevezést megvalósító egyéni beépülő modul algoritmussal hoz létre modelleket. Az átnevezés engedélyezéséhez felül kell írnia a metódusokat, amikor a beépülő modul algoritmusát létrehozza.

Csomópont szülők, csomóponti gyermekek és csomópont kardinalitás

A faszerkezet szülő- és gyermekcsomópontjai közötti kapcsolatot a PARENT_UNIQUE_NAME oszlop értéke határozza meg. Ezt az értéket a gyermekcsomópont tárolja, és megadja a szülőcsomópont azonosítóját. Néhány példa az információk felhasználási módjára:

  • A NULL értékű PARENT_UNIQUE_NAME azt jelenti, hogy a csomópont a modell legfelső csomópontja.

  • Ha a PARENT_UNIQUE_NAME értéke 0, a csomópontnak a modell legfelső csomópontjának közvetlen leszármazottjának kell lennie. Ennek az az oka, hogy a gyökércsomópont azonosítója mindig 0.

  • Az adatbányászati bővítmények (DMX) lekérdezésében függvényeket használhat egy adott csomópont leszármazottainak vagy szüleinek megkereséséhez. További információ a függvények lekérdezésekben való használatáról: Adatbányászati lekérdezések.

A számosság a halmaz elemeinek számát jelenti. A feldolgozott bányászati modell kontextusában a számosság azt jelzi, hogy hány gyermek van egy adott csomóponton. Ha például egy döntési famodellnek van egy csomópontja az [Éves jövedelem] számára, és ennek a csomópontnak két gyermekcsomópontja van: az egyik az [Éves jövedelem] = Magas feltétellel, a másik az [Éves jövedelem] = Alacsony feltétellel, akkor az [Éves jövedelem] csomóponthoz tartozó CHILDREN_CARDINALITY értéke 2 lenne.

Megjegyzés:

Az SQL Server Analysis Servicesben a rendszer csak a közvetlen gyermekcsomópontokat számítja ki egy csomópont számosságának kiszámításakor. Ha azonban egyéni bővítmény algoritmust hoz létre, újradefiniálhatja a CHILDREN_CARDINALITY-t, hogy másként számolja a számosságot. Ez hasznos lehet például, ha a leszármazottak teljes számát szeretné megszámolni, nem csak a közvetlen gyermekeket.

Bár a számosság minden modell esetében ugyanúgy van megszámolva, a számosságérték értelmezése és használata a modell típusától függően eltérő. Egy fürtözési modellben például a legfelső csomópont számossága jelzi a talált fürtök teljes számát. Más modellek esetében a számosság mindig a csomópont típusától függően meghatározott értékkel rendelkezhet. A számosság értelmezéséről további információt az egyes modelltípusokról szóló témakörben talál.

Megjegyzés:

Egyes modellek, például a Microsoft Neural Network-algoritmus által létrehozott modellek egy speciális csomóponttípust is tartalmaznak, amely leíró statisztikákat biztosít a teljes modell betanítási adatairól. Ezek a csomópontok definíció szerint soha nem rendelkeznek gyermekcsomópontokkal.

Csomópontok eloszlása

A NODE_DISTRIBUTION oszlop egy beágyazott táblát tartalmaz, amely számos csomópontban fontos és részletes információkat nyújt az algoritmus által felderített mintákról. A táblázatban megadott pontos statisztikák a modell típusától, a csomópont fában elfoglalt helyétől és attól függően változnak, hogy a kiszámítható attribútum folyamatos numerikus érték vagy különálló érték-e; tartalmazhatják azonban az attribútumok minimális és maximális értékeit, az értékekhez rendelt súlyokat, a csomópontokban lévő esetek számát, a regressziós képletekben használt együtthatókat, valamint statisztikai mértékeket, például szórást és varianciát. A csomópontok eloszlásának értelmezéséről további információt a használt modelltípus témakörében talál.

Megjegyzés:

A NODE_DISTRIBUTION tábla a csomópont típusától függően üres lehet. Például egyes csomópontok csak gyermekcsomópontok gyűjteményének rendszerezésére szolgálnak, és a részletes statisztikákat a gyermekcsomópontok tartalmazzák.

A beágyazott táblázat (NODE_DISTRIBUTION) mindig a következő oszlopokat tartalmazza. Az egyes oszlopok tartalma a modell típusától függően változik. Az egyes modelltípusokkal kapcsolatos további információkért lásd: Mining Model Content by Algorithm Type.

ATTRIBUTE_NAME
A tartalom algoritmusonként változik. Lehet egy oszlop neve, például egy kiszámítható attribútum, egy szabály, egy elemkészlet vagy egy, az algoritmuson belüli információ, például egy képlet része.

Ez az oszlop attribútum-érték párokat is tartalmazhat.

ATTRIBUTE_VALUE
A ATTRIBUTE_NAME nevű attribútum értéke.

Ha az attribútum neve oszlop, akkor a legegyszerűbb esetben a ATTRIBUTE_VALUE az adott oszlop egyik különálló értékét tartalmazza.

Attól függően, hogy az algoritmus hogyan dolgozza fel az értékeket, a ATTRIBUTE_VALUE tartalmazhat egy jelölőt is, amely jelzi, hogy létezik-e érték az attribútumhoz (Meglévő), vagy az érték null (Hiányzó).

Ha például a modell úgy van beállítva, hogy megkeresse azokat az ügyfeleket, akik legalább egyszer vásároltak egy adott elemet, a ATTRIBUTE_NAME oszlop tartalmazhatja az attribútum-érték párot, amely meghatározza a fontos elemet, például Model = 'Water bottle', és a ATTRIBUTE_VALUE oszlop csak a Meglévő vagy a Hiányzó kulcsszót tartalmazza.

TÁMOGATÁS
Azoknak az eseteknek a száma, amelyekben ez az attribútum-érték pár található, vagy amelyek tartalmazzák ezt az elemkészletet vagy szabályt.

Általánosságban elmondható, hogy az egyes csomópontok esetében a támogatási érték azt jelzi, hogy a betanítási csoportban hány eset szerepel az aktuális csomópontban. A legtöbb modelltípus esetében a támogatás az esetek pontos számát jelöli. A támogatási értékek azért hasznosak, mert a betanítási eseteken belül megtekintheti az adatok eloszlását anélkül, hogy le kellene kérdeznie a betanítási adatokat. Az Analysis Services-kiszolgáló ezeket a tárolt értékeket is felhasználja a tárolt valószínűség és a korábbi valószínűség kiszámításához annak meghatározásához, hogy a következtetés erős vagy gyenge-e.

Egy besorolási fában például a támogatási érték az attribútumok leírt kombinációjával rendelkező esetek számát jelzi.

A döntési fában minden szinten a támasz összege megegyezik a szülőcsomópont támaszának összegével. Például, ha egy 1200 esetet tartalmazó modell egyenlően oszlik meg nemek szerint, majd egyenlően tovább oszlik az alacsony, közepes és magas jövedelem három értéke alapján, akkor a 2. csomópont gyermekcsomópontjai, amelyek a 4., 5. és 6. csomópontok, mindig ugyanannyi esetet tartalmaznak együttesen, mint a 2. csomópont.

Csomópontazonosító és csomópontattribútumok Támogatás száma
(1) Modellgyökér 1200
(2) Nem = Férfi

(3) Nem = Nő
600

600
(4) Nem = Férfi és Jövedelem = Magas

(5) Nem = Férfi és Jövedelem = Közepes

(6) Nem = Férfi és Jövedelem = Alacsony
200

200

200
(7) Nem = Nő és Jövedelem = Magas

(8) Nem = Nő és Jövedelem = Közepes

(9) Nem = Nő és Jövedelem = Alacsony
200

200

200

Egy fürtözési modell esetén a támogatás mértéke súlyozható, hogy figyelembe vegye a több fürthöz tartozás valószínűségét. A többszörös fürttagság az alapértelmezett fürtözési módszer. Ebben a forgatókönyvben, mivel minden eset nem feltétlenül egy és csak egy fürthöz tartozik, előfordulhat, hogy ezekben a modellekben a támogatás nem feltétlenül 100%-ot tesz ki az összes fürtben.

VALÓSZÍNŰSÉGE
Az adott csomópont valószínűségét jelzi a teljes modellen belül.

A valószínűség általában a csomóponton belüli esetek teljes számával (NODE_SUPPORT) osztva támogatja ezt az értéket.

A valószínűség azonban kissé módosul, hogy kiküszöbölje az adatok hiányzó értékei által okozott torzítást.

Ha például az [Összes gyermek] aktuális értéke "Egy" és "Kettő", akkor el szeretné kerülni, hogy olyan modellt hozzon létre, amely azt jelzi előre, hogy lehetetlen, hogy ne legyen gyermekük, vagy hogy három gyermekük legyen. Annak érdekében, hogy a hiányzó értékek valószínűtlenek legyenek, de nem lehetetlenek, az algoritmus mindig hozzáad 1-et az attribútumok tényleges értékeinek számához.

Példa:

[Összes gyermek = Egy] = [Azon esetek száma, ahol az összes gyermek = Egy] + 1/[Az összes eset száma] + 3

[Összes gyermek = Kettő]= [Azon esetek száma, ahol a gyermekek száma = Kettő] +1/[Az összes eset száma] +3

Megjegyzés:

A 3-at úgy számítjuk ki, hogy hozzáadunk 1-et a meglévő értékek teljes számához, n.

A kiigazítás után az összes érték valószínűsége továbbra is 1-et ad. Az adatok nélküli érték valószínűsége (ebben a példában [Total Children = 'Zero', 'Three', vagy valami más érték]) nagyon alacsony, nem nulla szinten kezdődik, és lassan emelkedik a további esetek hozzáadásakor.

VARIANCIA
A csomóponton belüli értékek varianciáját jelzi. Definíció szerint a variancia mindig 0 a különálló értékek esetében. Ha a modell támogatja a folyamatos értékeket, a varianciát a rendszer σ (szigma) értékként számítja ki az n nevezővel vagy a csomópontban lévő esetek számával.

A szórás (StDev) ábrázolására általában két definíció használható. A szórás kiszámításának egyik módszere figyelembe veszi az torzításokat, egy másik módszer pedig torzítás nélkül számítja ki a szórást. A Microsoft adatbányászati algoritmusai általában nem használnak torzításokat a szórás kiszámításakor.

A NODE_DISTRIBUTION táblában megjelenő érték az összes különálló és diszkrét attribútum tényleges értéke, valamint a folyamatos értékek középértéke.

VALUE_TYPE
Az érték vagy attribútum adattípusát és az érték használatát jelzi. Bizonyos értéktípusok csak bizonyos modelltípusokra vonatkoznak:

VALUE_TYPE azonosító Értékfelirat Értéktípus neve
1 Hiányzó elem Azt jelzi, hogy az eset adatai nem tartalmaztak értéket ehhez az attribútumhoz. A hiányzó állapot kiszámítása külön történik az értékekkel rendelkező attribútumoktól.
2 Meglévő Jelzi, hogy az eset adatai értéket tartalmaznak ehhez az attribútumhoz.
3 Folyamatos Azt jelzi, hogy az attribútum értéke folyamatos numerikus érték, ezért középérték, varianciával és szórással együtt ábrázolható.
4 Diszkrét Olyan értéket jelöl, amelyet diszkrét számként vagy szövegként kezelnek.

Megjegyzés A különálló értékek is hiányoznak; számításkor azonban másképpen kezeli őket. További információ: Hiányzó értékek (Analysis Services – Adatbányászat).
5 Diszkretizált Azt jelzi, hogy az attribútum diszkrét számértékeket tartalmaz. Az érték egy formázott karaktersorozat lesz, amely a diszkretizációs kategóriákat írja le.
6 Meglévő Azt jelzi, hogy az attribútum folyamatos numerikus értékekkel rendelkezik, és hogy az adatokban megadott értékek vannak megadva, szemben a hiányzó vagy a kikövetkeztetett értékekkel.
7 Együttható Olyan numerikus értéket jelöl, amely együtthatót jelöl.

Az együttható a függő változó értékének kiszámításakor alkalmazott érték. Ha például a modell létrehoz egy regressziós képletet, amely az életkor alapján előrejelzi a jövedelmet, akkor az együtthatót az életkor és a jövedelem összefüggésében használja a rendszer.
8 Pontszám-nyereség Olyan numerikus értéket jelöl, amely egy attribútum pontszám-nyereségét jelöli.
9 statisztika Olyan numerikus értéket jelöl, amely egy regresszor statisztikáit jelöli.
10 Csomópont egyedi neve Azt jelzi, hogy az értéket nem numerikus vagy sztringként, hanem egy modell egy másik tartalomcsomópontjának egyedi azonosítójaként kell kezelni.

Például egy neurális hálózati modellben az azonosítók a kimeneti réteg csomópontjaitól a rejtett réteg csomópontjaiig, a rejtett réteg csomópontjaitól a bemeneti réteg csomópontjaiig mutatót biztosítanak.
11 Feltartóztat Egy regressziós képletben szereplő metszéspontot jelképező numerikus értéket jelöl.
12 Időszakosság Azt jelzi, hogy az érték egy modell periodikus szerkezetét jelöli.

Csak az ARIMA-modellt tartalmazó idősorozat-modellekre vonatkozik.

Megjegyzés: A Microsoft Time Series algoritmus automatikusan észleli a betanítási adatokon alapuló periodikus struktúrákat. Ennek eredményeképpen a végső modellben a periodikus értékek közé tartozhatnak azok a perioditásértékek, amelyeket nem adott meg paraméterként a modell létrehozásakor.
13 Autoregresszív sorrend Azt jelzi, hogy az érték az autoregresszív adatsorok számát jelöli.

Az ARIMA algoritmust használó idősorozat-modellekre vonatkozik.
14 Átlagos sorrend áthelyezése Olyan értéket jelöl, amely egy adatsor mozgó átlagainak számát jelöli.

Az ARIMA algoritmust használó idősorozat-modellekre vonatkozik.
15 Különbség sorrendje Azt jelzi, hogy az érték egy olyan értéket jelöl, amely azt jelzi, hogy az adatsor hányszor van megkülönböztetve.

Az ARIMA algoritmust használó idősorozat-modellekre vonatkozik.
16 logikai A logikai típust jelöl.
17 Other Az algoritmus által definiált egyéni értéket jelöli.
18 Előre renderelt karakterlánc Olyan egyéni értéket jelöl, amelyet az algoritmus sztringként jelenít meg. Az objektummodell nem alkalmazott formázást.

Az értéktípusok a ADMOMD.NET enumerálásból származnak. További információ: Microsoft.AnalysisServices.AdomdServer.MiningValueType.

Csomópont pontszáma

A csomópont pontszámának jelentése a modell típusától függően eltérő, és a csomóponttípusra is jellemző lehet. Az egyes modellek és csomóponttípusok NODE_SCORE kiszámításának módjáról további információt a Mining Model Content by Algorithm Type (Modelltartalom algoritmustípus szerint) című témakörben talál.

Csomópont valószínűsége és marginális valószínűsége

A bányászati modell sémasorkészlete tartalmazza az összes modelltípushoz tartozó NODE_PROBABILITY és MARGINAL_PROBABILITY oszlopokat. Ezek az oszlopok csak olyan csomópontokban tartalmaznak értékeket, ahol a valószínűségi érték jelentőséggel bír. Egy modell gyökércsomópontja például soha nem tartalmaz valószínűségi pontszámot.

Azokban a csomópontokban, amelyek a valószínűségi pontszámokat adják meg, a csomópontok valószínűsége és a marginális valószínűségek különböző számításokat képviselnek.

  • A marginális valószínűség a csomópont szülőtől való elérésének valószínűsége.

  • A csomópont valószínűsége annak a valószínűsége, hogy a csomópontot a gyökérről éri el.

  • A csomópont valószínűsége mindig kisebb vagy egyenlő a marginális valószínűségnél.

Ha például a döntési fában szereplő összes ügyfél populációja egyenlően oszlik meg a nemek szerint (és nem hiányoznak értékek), a gyermekcsomópontok valószínűségének 0,5-nek kell lennie. Tegyük fel azonban, hogy a nemek csomópontjai egyenlően vannak elosztva a magas, közepes és alacsony jövedelmi szinttel. Ebben az esetben az egyes gyermekcsomópontok MARGINAL_PROBABILITY pontszámának mindig .33-nak kell lennie, de a NODE_PROBABILTY érték az adott csomóponthoz vezető összes valószínűség szorzata lesz, így mindig kisebb, mint a MARGINAL_PROBABILITY érték.

Csomópont/attribútum és érték szintje Marginális valószínűség Csomópont valószínűsége
Modell-gyökér

Minden megcélzott ügyfél
1 1
Megcélzott ügyfelek nemek szerint felosztva .5 .5
A megcélzott ügyfelek nemek szerint oszlanak el, és három módon osztják fel ismét a bevétel alapján .33 .5 * .33 = .165

Csomópontszabály és marginális szabály

A bányászati modell sémasorkészlete az összes modelltípushoz NODE_RULE és MARGINAL_RULE oszlopokat is tartalmazza. Ezek az oszlopok OLYAN XML-töredékeket tartalmaznak, amelyek a modell szerializálására vagy a modellstruktúra egy részének megjelenítésére használhatók. Ezek az oszlopok egyes csomópontok esetében üresek lehetnek, ha egy érték értelmetlen lenne.

Kétféle XML-szabály van megadva, hasonlóan a két valószínűségi értékhez. A MARGINAL_RULE XML-töredéke az aktuális csomópont attribútumát és értékét határozza meg, míg a NODE_RULE XML-töredéke a modellgyökérből írja le az aktuális csomópont elérési útját.

Bányászati modell tartalma algoritmustípus szerint

Minden algoritmus különböző típusú információkat tárol a tartalomséma részeként. A Microsoft Klaszterezési algoritmus például számos alcsomópontot hoz létre, amelyek mindegyike egy lehetséges klasztert reprezentál. Minden fürtcsomópont olyan szabályokat tartalmaz, amelyek a fürt elemei által megosztott jellemzőket írják le. Ezzel szemben a Microsoft lineáris regressziós algoritmusa nem tartalmaz gyermekcsomópontokat; ehelyett a modell szülőcsomópontja az elemzés által felderített lineáris kapcsolatot leíró egyenletet tartalmazza.

Az alábbi táblázat hivatkozásokat tartalmaz az egyes algoritmustípusok témaköreihez.

  • Modelltartalom témakörei: Ismertesse az egyes algoritmustípusokhoz tartozó csomóponttípusok jelentését, és adjon útmutatást arról, hogy mely csomópontok érdeklik leginkább az adott modelltípust.

  • Lekérdezési témakörök: Adjon példákat egy adott modelltípussal kapcsolatos lekérdezésekre, és útmutatást adjon az eredmények értelmezéséhez.

Algoritmus vagy modell típusa Modell tartalma Bányászati modellek lekérdezése
Társításszabály-modellek Bányászati modelltartalom társítási modellekhez (Analysis Services – Adatbányászat) Társításmodell lekérdezési példái
Fürtözési modellek Bányászati modellek tartalma döntési famodellekhez (Analysis Services – Adatbányászat) Példák a fürtözési modell lekérdezési példáira
Döntési fák modellje Bányászati modelltartalom döntési fa modellekhez (Analysis Services – Adatbányászat) Döntési fák modell lekérdezési példái
Lineáris regressziós modellek Bányászati modell tartalma lineáris regressziós modellekhez (Analysis Services – Adatbányászat) Lineáris regressziós modell lekérdezési példái
Logisztikai regressziós modellek Bányászati modell tartalma logisztikai regressziós modellekhez (Analysis Services – Adatbányászat) Lineáris regressziós modell lekérdezési példái
Naiv Bayes-modellek Bányászati modell tartalma Naive Bayes-modellekhez (Analysis Services – Adatbányászat) Naive Bayes-modell lekérdezési példái
Neurális hálózati modellek Bányászati modell tartalma neurális hálózati modellekhez (Analysis Services – Adatbányászat) Neurális hálózati modell lekérdezési példái
Szekvencia fürtözés Szekvencia Klaszterezési Modellek Bányászati Modell Tartalma (Adatbányászati Szolgáltatások - Adatbányászat) Sorrendfürtezési modell lekérdezési példái
Idősorozat-modellek Bányászati modellek tartalma idősor modellekhez (Analysis Services – Adatbányászat) Példák az idősormodell lekérdezési példáira

A bányászati modell tartalmának megtekintésére szolgáló eszközök

Amikor az SQL Server Data Toolsban böngész vagy felfedez egy modellt, az információkat a Microsoft Általános tartalomfa megjelenítőjében tekintheti meg, amely az SQL Server Data Tools és az SQL Server Management Studio szolgáltatásban is elérhető.

A Microsoft Általános tartalommegjelenítő a modell oszlopait, szabályait, tulajdonságait, attribútumait, csomópontjait és egyéb tartalmait jeleníti meg a bányászati modell tartalomséma-sorhalmazában elérhető információkkal. A tartalomsémasorkészlet általános keretrendszer az adatbányászati modell tartalmával kapcsolatos részletes információk bemutatásához. A modell tartalmát bármely olyan ügyfélben megtekintheti, amely támogatja a hierarchikus sorhalmazokat. Az SQL Server Data Tools megjelenítője ezt az információt egy HTML-táblamegjelenítőben jeleníti meg, amely az összes modellt egységes formátumban jeleníti meg, így könnyebben megérthető a létrehozott modellek struktúrája. További információért lásd: Modell böngészése a Microsoft általános tartalomfa megjelenítő segítségével.

Eszközök a bányászati modell tartalmának lekérdezéséhez

A bányászati modell tartalmának lekéréséhez létre kell hoznia egy lekérdezést az adatbányászati modellen.

A tartalom-lekérdezések létrehozásának legegyszerűbb módja a következő DMX-utasítás végrehajtása az SQL Server Management Studióban:

SELECT * FROM [<mining model name>].CONTENT  

További információ: Adatbányászati lekérdezések.

A bányászati modell tartalmát az adatbányászati sémasorkészletek használatával is lekérdezheti. A sémasorkészlet egy szabványos struktúra, amelyet az ügyfelek a bányászati struktúrák és modellek információinak felderítésére, tallózására és lekérdezésére használnak. A sémasorkészleteket XMLA, Transact-SQL vagy DMX utasításokkal kérdezheti le.

Az SQL Server 2017-ben az adatbányászati sémasorkészletek információihoz is hozzáférhet, ha kapcsolatot nyit az SQL Server Analysis Services-példányhoz, és lekérdezi a rendszertáblákat. További információ: Adatbányászati sémasorkészletek (SSA-k).

Lásd még:

Microsoft Általános Tartalomfa Néző (Adatbányászat)
Adatbányászati algoritmusok (Analysis Services – Adatbányászat)