Adatbányászati algoritmusok (Analysis Services – Adatbányászat)

A következőkre vonatkozik: SQL Server 2019 és korábbi Analysis Services Azure Analysis Services Fabric/Power BI Premium

Fontos

Az adatbányászat elavult az SQL Server 2017 Analysis Servicesben, és megszűnt az SQL Server 2022 Analysis Servicesben. Az elavult és megszűnt funkciók dokumentációja nem frissül. További információkért tekintse meg az Analysis Services visszamenőleges kompatibilitását.

Az algoritmus az adatbányászatban (vagy a gépi tanulásban) egy heurisztikákból és számításokból álló készlet, amely modellt hoz létre az adatokból. Modell létrehozásához az algoritmus először elemzi a megadott adatokat, és konkrét mintázatokat vagy trendeket keres. Az algoritmus ennek az elemzésnek az eredményeit számos iterációban használja a bányászati modell létrehozásához szükséges optimális paraméterek megtalálásához. Ezeket a paramétereket ezután a rendszer a teljes adatkészletre alkalmazza a végrehajtható minták és a részletes statisztikák kinyeréséhez.

Az algoritmus által az adatokból létrehozott bányászati modell különböző formákat ölthet, például:

  • Egy fürtkészlet, amely leírja, hogyan állnak összefüggésben az adathalmazban lévő esetek.

  • Egy döntési fa, amely előrejelzi az eredményt, és leírja, hogy a különböző feltételek hogyan befolyásolják ezt az eredményt.

  • Egy matematikai modell, amely előrejelzést ad az értékesítésről.

  • Egy olyan szabálykészlet, amely leírja, hogy a termékek hogyan csoportosíthatók egy tranzakcióban, valamint a termékek közös vásárlásának valószínűsége.

Az SQL Server Data Mining által biztosított algoritmusok a legnépszerűbb, jól kutatott módszerek az adatokból származó minták származtatására. Például a K-közép algoritmus az egyik legrégebbi fürtözési algoritmus, és széles körben elérhető különböző eszközökben, valamint többféle implementációval és lehetőséggel. Az SQL Server Data Mining-ben használt K-eszközök fürtözésének konkrét implementációját azonban a Microsoft Research fejlesztette ki, majd az SQL Server Analysis Services teljesítményére optimalizálta. A Microsoft adatbányászati algoritmusai széles körben testre szabhatók, és teljes mértékben programozhatók a megadott API-k használatával. Emellett automatizálhatja a modellek létrehozását, betanítását és újratanítását az integrációs szolgáltatások adatbányászati összetevőinek használatával.

Használhat olyan külső algoritmusokat is, amelyek megfelelnek az OLE DB for Data Mining specifikációjának, vagy létrehozhat olyan egyéni algoritmusokat, amelyek regisztrálhatók szolgáltatásként, majd használhatók az SQL Server Adatbányászati keretrendszerben.

A megfelelő algoritmus kiválasztása

Egy adott elemzési feladathoz használni kívánt legjobb algoritmus kiválasztása kihívást jelenthet. Bár különböző algoritmusokkal hajthatja végre ugyanazt az üzleti feladatot, az egyes algoritmusok eltérő eredményt adnak, és egyes algoritmusok több típusú eredményt is létrehozhatnak. A Microsoft Decision Trees algoritmust például nem csak előrejelzésre használhatja, hanem az adathalmaz oszlopainak számának csökkentésére is, mivel a döntési fa azonosíthatja azokat az oszlopokat, amelyek nem befolyásolják a végső bányászati modellt.

Algoritmus kiválasztása típus szerint

Az SQL Server Data Mining a következő algoritmustípusokat tartalmazza:

  • A besorolási algoritmusok egy vagy több különálló változót jeleznek előre az adathalmaz többi attribútuma alapján.

  • A regressziós algoritmusok egy vagy több folyamatos numerikus változót, például nyereséget vagy veszteséget jeleznek előre az adathalmaz egyéb attribútumai alapján.

  • A szegmentálási algoritmusok hasonló tulajdonságokkal rendelkező elemek csoportjaira vagy fürtöire osztják az adatokat.

  • A társítás algoritmusai korrelációkat keresnek az adathalmaz különböző attribútumai között. Az ilyen típusú algoritmusok leggyakoribb alkalmazása a társítás szabályainak létrehozása, amelyek felhasználhatók a piaci kosár elemzésében.

  • A sorozatelemzési algoritmusok az adatok gyakori sorozatait vagy epizódjait összegzik, például egy webhely kattintásainak sorozatát vagy a gép karbantartását megelőző naplóesemények sorozatát.

Nincs azonban ok arra, hogy a megoldásokban egyetlen algoritmusra korlátozódjon. A tapasztalt elemzők néha egy algoritmust használnak a leghatékonyabb bemenetek (azaz változók) meghatározására, majd egy másik algoritmust alkalmaznak egy adott eredmény előrejelzésére az adatok alapján. Az SQL Server adatbányászata lehetővé teszi, hogy több modellt hozzon létre egyetlen bányászati struktúrára, így egyetlen adatbányászati megoldáson belül használhat fürtözési algoritmust, döntési fákat és naiv Bayes-modellt, hogy különböző nézeteket kapjon az adatokról. Több algoritmust is használhat egyetlen megoldáson belül külön feladatok végrehajtásához: például a regresszióval pénzügyi előrejelzéseket szerezhet be, és neurális hálózati algoritmussal elemezheti az előrejelzéseket befolyásoló tényezőket.

Algoritmus kiválasztása feladat szerint

Egy adott tevékenységhez használható algoritmus kiválasztásához az alábbi táblázat javaslatokat nyújt azokra a tevékenységekre, amelyekhez az egyes algoritmusokat hagyományosan használják.

Példák tevékenységekre Használandó Microsoft-algoritmusok
Diszkrét attribútum előrejelzése:

Jelölje meg a potenciális vevők listájában szereplő ügyfeleket jó vagy rossz kilátásként.

Számítsa ki annak valószínűségét, hogy egy kiszolgáló a következő 6 hónapon belül sikertelen lesz.

Kategorizálja a betegek eredményeit, és vizsgálja meg a kapcsolódó tényezőket.
Microsoft Decision Trees algoritmus

Microsoft Naive Bayes-algoritmus

Microsoft-fürtözési algoritmus

Microsoft Neurális hálózati algoritmus
Folyamatos attribútum előrejelzése:

Előrejelzés a jövő évi értékesítésről.

A korábbi történelmi és szezonális trendek alapján előrejelezheti a látogatókat.

Hozzon létre egy kockázati pontszámot adott demográfiai adatok alapján.
Microsoft Decision Trees algoritmus

Microsoft Time Series Algoritmus

Microsoft Lineáris regressziós algoritmus
Sorozat előrejelzése:

Clickstream-elemzést végezhet egy vállalat webhelyéről.

Elemezze a kiszolgálóhibához vezető tényezőket.

A járóbeteg-látogatások során végzett tevékenységek sorozatainak rögzítése és elemzése a gyakori tevékenységekhez kapcsolódó ajánlott eljárások kialakításához.
Microsoft Sequence Clustering Algorithm
Gyakori elemek csoportjainak megkeresése a tranzakciókban:

A termékelhelyezés meghatározásához használjon piaci kosárelemzést.

További termékeket javasolhat az ügyfélnek vásárlásra.

Az esemény látogatóinak felmérési adatainak elemzése, a jövőbeli tevékenységek megtervezése érdekében annak megkeresése, hogy mely tevékenységek vagy standok voltak korrelálva.
Microsoft-társítás algoritmusa

Microsoft Decision Trees algoritmus
Hasonló elemek csoportjainak keresése:

Hozzon létre betegkockázati profilcsoportokat olyan attribútumok alapján, mint a demográfiai adatok és a viselkedés.

Felhasználók elemzése böngészéssel és vásárlási mintákkal.

Azonosítsa a hasonló használati jellemzőkkel rendelkező kiszolgálókat.
Microsoft-fürtözési algoritmus

Microsoft Sequence Clustering Algorithm

Az alábbi szakasz az SQL Server Data Mining szolgáltatásban biztosított adatbányászati algoritmusok képzési erőforrásaira mutató hivatkozásokat tartalmaz:

Téma Leírás
Adatbányászati modell által használt algoritmus meghatározása A bányászati modell létrehozásához használt paraméterek lekérdezése
Egyéni Plug-In-algoritmus létrehozása Beépülő modul algoritmusai
Modell megismerése algoritmusspecifikus megjelenítő használatával Adatbányászati modell megjelenítői
Modell tartalmának megtekintése általános táblázatformátum használatával Modell tallózása a Microsoft Általános tartalomfa megjelenítőjével
Megtudhatja, hogyan állíthatja be az adatokat, és hogyan hozhat létre modelleket algoritmusokkal Bányászati struktúrák (Analysis Services – Adatbányászat)

Bányászati modellek (Analysis Services – Adatbányászat)

Lásd még:

Adatbányászati eszközök