VYTVOŘENÍ TĚŽEBNÍHO MODELU (DMX)

platí pro: Analytické služby SQL Serveru

Vytváří jak nový model těžby, tak těžební strukturu v databázi. Model můžete vytvořit buď definováním nového modelu ve výroku, nebo použitím Predictive Model Markup Language (PMML). Tato druhá možnost je určena pouze pro pokročilé uživatele.

Těžební struktura je pojmenována přidáním "_structure" k názvu modelu, což zajišťuje, že název struktury je jedinečný od názvu modelu.

Pro vytvoření těžebního modelu pro existující těžební strukturu použijte příkaz ALTER MINING STRUCTURE (DMX).

Syntax

  
CREATE [SESSION] MINING MODEL <model>  
(  
    [(<column definition list>)]  
)  
USING <algorithm> [(<parameter list>)] [WITH DRILLTHROUGH]  
CREATE MINING MODEL <model> FROM PMML <xml string>  

Arguments

model
Unikátní název pro model.

Seznam definic sloupců
Seznam definic sloupců oddělený čárkou.

algoritmus
Název algoritmu pro dolování dat, jak jej definuje současný poskytovatel.

Note

Seznam algoritmů podporovaných současným poskytovatelem lze získat pomocí DMSCHEMA_MINING_SERVICES Rowset. Pro zobrazení algoritmů podporovaných v aktuální instanci Analysis Services viz Vlastnosti dolování dat.

Seznam parametrů
Optional. Seznam parametrů definovaných poskytovatelem algoritmu oddělený čárkami.

XML řetězec
(Pouze pro pokročilé použití.) Model kódovaný XML (PMML). Řetězec musí být uzavřen v uvozovkách (').

Klauzule SESSION vám umožní vytvořit těžební model, který je automaticky odstraněn ze serveru, když se spojení uzavře nebo relace vyprší. Modely dolování SESSION jsou užitečné, protože nevyžadují, aby uživatel byl správcem databáze, a využívají diskové místo pouze po dobu, kdy je připojení otevřené.

Klauzule WITH DRILLTHROUGH umožňuje vrtání skrz v novém těžebním modelu. Drillthrough lze zapnout pouze při vytvoření modelu. U některých typů modelů je pro prohlížení modelu v uživatelském prohlížeči potřeba drillthrough. Drillthrough není potřeba pro predikci ani pro prohlížení modelu pomocí Microsoft Generic Content Tree Viewer.

Příkaz CREATE MINING MODEL vytváří nový těžební model, který je založen na seznamu sloupcových definic, algoritmu a seznamu parametrů algoritmu.

Seznam definic sloupců

Strukturu modelu, který používá seznam definic sloupců, definujete tak, že pro každý sloupec zahrnete následující informace:

  • Název (povinný)

  • Typ dat (povinný)

  • Distribution

  • Seznam modelových vlajek

  • Typ obsahu (povinný)

  • Požadavek na predikci, který algoritmu určuje předpověď tohoto sloupce, označený klauzulí PREDICT nebo PREDICT_ONLY

  • Vztah k atributovému sloupci (povinný pouze pokud se vztahuje), indikovaný klauzulí RELATED TO

Pro definici sloupců použijte následující syntaxi k definování jednoho sloupce:

<column name>    <data type>    [<Distribution>]    [<Modeling Flags>]    <Content Type>    [<prediction>]    [<column relationship>]   

Pro definici sloupců použijte následující syntaxi pro definici sloupců, abyste definovali vnořený sloupec:

<column name>    TABLE    [<prediction>] ( <non-table column definition list> )  

Kromě modelování příznaků můžete použít maximálně jednu klauzuli z určité skupiny k definování sloupce. Můžete definovat více modelovacích příznaků pro sloupec.

Pro seznam datových typů, typů obsahu, rozdělení sloupců a modelovacích příznaků, které můžete použít k definování sloupce, viz následující témata:

Můžete přidat klauzuli k tvrzení, která popisuje vztah mezi dvěma sloupci. Analytické služby podporují použití následující <klauzule o vztahu> sloupců.

SOUVISEJÍCÍ S
Tato forma označuje hodnotovou hierarchii. Cílem sloupce RELATED TO může být klíčový sloupec v vnořené tabulce, sloupec s diskrétními hodnotami v řádku případů nebo jiný sloupec s klauzulí RELATED TO, která indikuje hlubší hierarchii.

Použijte predikční klauzuli k popisu, jak se predikční sloupec používá. Následující tabulka popisuje dvě možné klauzule.

<Predikční klauzule> Description
PŘEDPOVÍDAT Tento sloupec lze předpovědět modelem a může být dodán ve vstupních případech k předpovědi hodnoty dalších předvídatelných sloupců.
PREDICT_ONLY Tento sloupec lze předpovědět modelem, ale jeho hodnoty nelze použít ve vstupních případech k předpovědi hodnoty ostatních předvídatelných sloupců.

Seznam definic parametrů

Seznam parametrů můžete použít k úpravě výkonu a funkčnosti těžebního modelu. Syntaxe seznamu parametrů je následující:

[<parameter> = <value>, <parameter> = <value>,...]  

Pro seznam parametrů spojených s každým algoritmem viz Data Mining Algorithms (Analysis Services - Data Mining).

Remarks

Pokud chcete vytvořit model s vestavěnou testovací datovou sadou, měli byste použít příkaz CREATE MINING STRUCTURE následovaný příkazem ALTER MINING STRUCTURE. Nicméně ne všechny typy modelů podporují datovou sadu holdout. Další informace naleznete v tématu CREATE MINING STRUCTURE (DMX).

Pro návod, jak vytvořit těžební model pomocí příkazu CREATEMODEL, viz Time Series Prediction DMX Tutorial.

Příklad Naivního Bayese

Následující příklad využívá algoritmus Microsoft Naive Bayes k vytvoření nového těžebního modelu. Sloupec Kupující kola je definován jako předvídatelný atribut.

CREATE MINING MODEL [NBSample]  
(  
    CustomerKey LONG KEY,   
    Gender TEXT DISCRETE,  
    [Number Cars Owned] LONG DISCRETE,  
    [Bike Buyer] LONG DISCRETE PREDICT  
)  
USING Microsoft_Naive_Bayes  

Příklad asociačního modelu

Následující příklad využívá algoritmus Microsoft Association k vytvoření nového těžebního modelu. Tvrzení využívá možnost vnořit tabulku do definice modelu pomocí sloupce tabulky. Model je modifikován pomocí parametrů MINIMUM_PROBABILITY a MINIMUM_SUPPORT .

CREATE MINING MODEL MyAssociationModel (  
    OrderNumber TEXT KEY,  
    [Products] TABLE PREDICT (  
        [Model] TEXT KEY  
    )  
)  
USING Microsoft_Association_Rules (Minimum_Probability = 0.1, MINIMUM_SUPPORT = 0.01)  

Příklad sekvenčního shlukování

Následující příklad využívá algoritmus Microsoft Sequence Clustering k vytvoření nového těžebního modelu. K definování modelu se používají dva klíče. Sloupec OrderNumber se používá jako klíč case a specifikuje jednotlivé objednávky. Sloupec LineNumber se používá jako vnořený klíč tabulky a určuje pořadí, v jakém byly položky přidávány do objednávky.

CREATE MINING MODEL BuyingSequence (  
    [Order Number] TEXT KEY,  
    [Products] TABLE   
     (  
        [Line Number] LONG KEY SEQUENCE,  
        [Model] TEXT DISCRETE PREDICT  
    )  
)  
USING Microsoft_Sequence_Clustering  

Příklad časových řad

Následující příklad využívá algoritmus Microsoft Times Series k vytvoření nového těžebního modelu pomocí algoritmu ARTxp. ReportingDate je klíčový sloupec pro časovou řadu a ModelRegion je klíčový sloupec pro datovou řadu. V tomto příkladu se předpokládá, že periodicita dat je každých 12 měsíců. Proto je parametr PERIODICITY_HINT nastaven na 12.

Note

Parametr PERIODICITY_HINT musíte zadat pomocí závorkových znaků. Navíc, protože hodnota je řetězec, musí být uzavřena v uvozovkách: "{<numeric value>}".

CREATE MINING MODEL SalesForecast (  
        ReportingDate DATE KEY TIME,  
        ModelRegion TEXT KEY,  
        Amount LONG CONTINUOUS PREDICT,  
        Quantity LONG CONTINUOUS PREDICT  
)  
USING Microsoft_Time_Series (PERIODICITY_HINT = '{12}', FORECAST_METHOD = 'ARTXP')