STWÓRZ STRUKTURĘ GÓRNICZĄ (DMX)

Dotyczy: usług SQL Server Analysis Services

Tworzy nową strukturę kopania w bazie danych i opcjonalnie definiuje partycje treningowe i testowe. Po utworzeniu struktury górniczej możesz użyć instrukcji ALTER MINING STRUCTURE (DMX), aby dodać modele do tej struktury.

Syntax

  
CREATE [SESSION] MINING STRUCTURE <structure>  
(  
    [(<column definition list>)]  
)  
[WITH HOLDOUT (<holdout-specifier> [OR <holdout-specifier>])]  
[REPEATABLE(<holdout seed>)]  
<holdout-specifier>::=  <holdout-maxpercent> PERCENT | <holdout-maxcases> CASES  

Arguments

struktura
Unikalna nazwa dla tej konstrukcji.

Lista definicji kolumn
Lista definicji kolumn oddzielonych przecinkami.

holdout-maxpercent
Liczba całkowita od 1 do 100, która wskazuje procent danych przeznaczonych do testowania.

Holdout-maxcases
Liczba całkowita wskazująca maksymalną liczbę przypadków do testowania.

Jeśli wartość podania dla maksymalnych przypadków jest większa niż liczba przypadków wejściowych, wszystkie przypadki wejściowe są wykorzystywane do testowania i zostanie wywołane ostrzeżenie.

Note

Jeśli podana jest zarówno procentowa, jak i maksymalna liczba przypadków, stosuje się mniejsze z dwóch limitów.

Seed holdout
Liczba całkowita używana jako seed do rozpoczęcia partycjonowania danych.

Jeśli ustawione na 0, hash ID struktury górniczej jest używany jako ziarno.

Note

Powinieneś określić seed, jeśli chcesz mieć pewność, że partycja może zostać odtworzona.

Domyślne: POWTARZALNY(0)

Remarks

Strukturę kopania definiujesz, określając listę kolumn, opcjonalnie określając hierarchiczne relacje między kolumnami, a następnie opcjonalnie dzieląc strukturę na zbiory danych treningowych i testowych.

Opcjonalne słowo kluczowe SESSION wskazuje, że struktura jest tymczasowa, z której możesz korzystać tylko przez czas trwania bieżącej sesji. Po zakończeniu sesji struktura oraz wszelkie modele oparte na niej zostaną usunięte. Aby stworzyć tymczasowe struktury i modele do wydobycia, najpierw musisz ustawić właściwość bazy danych, AllowSessionMiningModels. Aby uzyskać więcej informacji, zobacz Właściwości wyszukiwania danych.

Lista definicji kolumn

Strukturę kopalniową definiujesz, uwzględniając następujące informacje dla każdej kolumny w liście definicji kolumn:

  • Nazwa (obowiązkowa)

  • Typ danych (obowiązkowy)

  • Distribution

  • Lista flag modelarskich

  • Typ treści (obowiązkowy)

  • Związek z kolumną atrybutu (obowiązkowy tylko jeśli ma zastosowanie), wskazywany przez klauzulę RELATED TO

Użyj następującej składni do listy definicji kolumn, aby zdefiniować pojedynczą kolumnę:

<column name>    <data type>    [<Distribution>]    [<Modeling Flags>]    <Content Type>    [<column relationship>]  

Użyj następującej składni listy definicji kolumn, aby zdefiniować zagnieżdżoną kolumnę tabeli:

<column name>    TABLE    ( <column definition list> )  

Aby uzyskać listę typów danych, typów treści, rozkładów kolumn oraz flag modelowania, których możesz użyć do zdefiniowania kolumny struktury, zobacz następujące tematy:

Możesz zdefiniować wiele flag modelowania dla kolumny. Jednak możesz mieć tylko jeden typ treści i jeden typ danych dla kolumny.

Relacje kolumnowe

Możesz dodać klauzulę do dowolnego opisu definicji kolumn, aby opisać relację między dwiema kolumnami. Usługi analizy wspierają użycie następującej klauzuli relacji> kolumn.<

POWIĄZANE Z
Wskazuje hierarchię wartości. Celem kolumny RELATED TO może być kolumna klucza w zagnieżdżonej tabeli, kolumna o wartości dyskretnej w wierszu przypadku lub inna kolumna z klauzulą RELATED TO, która wskazuje na głębszą hierarchię.

Parametry zawieszenia

Gdy określasz parametry holdout, tworzysz partycję danych strukturalnych. Kwota, którą określasz dla holdout, jest zarezerwowana na testy, a pozostałe dane wykorzystywane są do treningu. Domyślnie, jeśli tworzysz strukturę kopania za pomocą SQL Server Data Tools (SSDT), tworzy się dla Ciebie partycję holdout, która zawiera 30 procent danych testowych i 70 procent danych treningowych. Aby uzyskać więcej informacji, zobacz Trenowanie i testowanie zestawów danych.

Jeśli tworzysz strukturę wydobycia za pomocą Data Mining Extensions (DMX), musisz ręcznie określić, że zostanie utworzona partycja holdout.

Note

Oświadczenie ALTER MINING STRUCTURE nie wspiera wstrzymywania się.

Możesz określić do trzech parametrów wstrzymywania się. Jeśli określisz zarówno maksymalną liczbę przypadków wstrzymania, jak i procent zatrzymania, procent spraw jest zarezerwowany do osiągnięcia maksymalnego limitu. Określasz procent holdoutów jako liczbę całkowitą, po której następuje słowo kluczowe PERCENT , a maksymalną liczbę przypadków jako liczbę całkowitą, a następnie słowo kluczowe CASES . Warunki można łączyć w dowolnej kolejności, jak pokazano na poniższych przykładach:

WITH HOLDOUT (20 PERCENT)   
WITH HOLDOUT (2000 CASES)   
WITH HOLDOUT (20 PERCENT OR 2000 CASES)   
WITH HOLDOUT (2000 CASES OR 20 PERCENT)  

Seed, który wytrzymuje, kontroluje punkt początkowy procesu, który losowo przypisuje przypadki do zbiorów danych treningowych lub testowych. Ustawiając seed holdout, możesz mieć pewność, że partycja może być powtórzona. Jeśli nie określisz seedu holdout, Analysis Services używa nazwy struktury wydobycia do jego utworzenia. Jeśli zmienisz nazwę struktury, wartość seed się zmieni. Parametr seedu dla holdoutu może być używany z jednym lub oboma pozostałymi parametrami holdout.

Note

Ponieważ informacje o partycji są buforowane razem z danymi treningowymi, aby użyć holdout, musisz upewnić się, że właściwość CacheMode w strukturze kopalnia jest ustawiona na KeepTrainingData. Jest to domyślne ustawienie w Analysis Services dla nowych struktur kopalniczych. Zmiana właściwości CacheMode na ClearTrainingCases na istniejącej strukturze wydobycia zawierającej partycję holdout nie wpłynie na żadne modele wydobycia, które zostały przetworzone. Jednak jeśli MiningStructureCacheMode nie jest ustawiony na KeepTrainingData, parametry holdout nie będą miały wpływu. Oznacza to, że wszystkie dane źródłowe będą wykorzystywane do treningu i nie będzie dostępny żaden zestaw testowy. Definicja partycji jest buforowana wraz ze strukturą; Jeśli wyczyścisz pamięć podręczną przypadków treningowych, usuniesz też pamięć podręczną danych testowych oraz definicję zestawu holdout.

Examples

Poniższe przykłady pokazują, jak stworzyć strukturę górniczą z utrzymaniem za pomocą DMX.

Przykład 1: Dodawanie struktury bez zbioru treningowego

Poniższy przykład tworzy nową strukturę wydobycia wywołaną bez New Mailing tworzenia powiązanych modeli wydobycia i bez użycia holdout. Aby dowiedzieć się, jak dodać model górnictwa do struktury, zobacz ALTER MINING STRUCTURE (DMX).

CREATE MINING STRUCTURE [New Mailing]  
(  
    CustomerKey LONG KEY,   
    Gender TEXT DISCRETE,  
    [Number Cars Owned] LONG DISCRETE,  
    [Bike Buyer] LONG DISCRETE   
)  

Przykład 2: Określenie procentu holdoutów i seed

Następującą klauzulę można dodać po liście definicji kolumn, aby zdefiniować zbiór danych, który może być użyty do testowania wszystkich modeli wydobycia związanych ze strukturą górniczą. To sformułowanie tworzy zestaw testowy stanowiący 25 procent wszystkich przypadków wejściowych, bez ograniczenia maksymalnej liczby przypadków. 5000 jest używane jako seed do utworzenia partycji. Gdy określasz seed, te same przypadki będą wybierane do zestawu testowego za każdym razem, gdy przetwarzasz strukturę kopalnia, o ile dane bazowe się nie zmienią.

CREATE MINING STRUCTURE [New Mailing]  
(  
    CustomerKey LONG KEY,   
    Gender TEXT DISCRETE,  
    [Number Cars Owned] LONG DISCRETE,  
    [Bike Buyer] LONG DISCRETE   
)   
WITH HOLDOUT(25 PERCENT) REPEATABLE(5000)  

Przykład 3: Określenie procentu wytrzymywania i maksymalnej liczby przypadków

Poniższy zapis utworzy zbiór testowy, który zawiera albo 25 procent wszystkich przypadków wejściowych, albo 2000 przypadków, w zależności od tego, co jest mniejsze. Ponieważ jako zasiono jest określone 0, do stworzenia zasiona, które służy do rozpoczęcia próbkowania przypadków wejściowych, używa się nazwy struktury kopalnia.

CREATE MINING STRUCTURE [New Mailing]  
(  
    CustomerKey LONG KEY,   
    Gender TEXT DISCRETE,  
    [Number Cars Owned] LONG DISCRETE,  
    [Bike Buyer] LONG DISCRETE   
)   
WITH HOLDOUT(25 PERCENT OR 2000 CASES) REPEATABLE(0)