Příznaky modelování (dolování dat)

Platí pro: SQL Server 2019 a starší služby Analysis Services Azure Analysis Services Fabric/ Power BI Premium

Důležité

Dolování dat bylo v SQL Serveru 2017 Analysis Services zastaralé a nyní ukončeno ve službě SQL Server 2022 Analysis Services. Dokumentace se neaktualizuje pro zastaralé a ukončené funkce. Další informace najdete v tématu Zpětná kompatibilita služby Analysis Services.

V SQL Server Analytické služby SQL Serveru poskytují příznaky modelování algoritmu dolování dat více informací o datech v tabulce případů. Algoritmus tyto informace používá k vytvoření přesnějšího modelu dolování dat.

Některé příznaky modelování definujete na úrovni struktury dolování dat a jiné na úrovni sloupce modelu dolování dat. Například použijte příznak modelování NOT NULL se sloupci struktury dolování. Algoritmus, který použijete k vytvoření modelu, určuje, které další příznaky modelování můžete definovat ve sloupcích modelu dolování.

Poznámka:

Moduly plug-in třetích stran můžou zahrnovat příznaky modelování nad rámec těch, které Analytické služby SQL Serveru definují.

Seznam modelových vlajek

Analytické služby SQL Serveru podporuje následující příznaky modelování. Informace o příznakech, které konkrétní algoritmy podporují, najdete v technických referenčních informacích pro algoritmus, který vytváří model.

NOT NULL
Určuje, že sloupec atributu nemůže obsahovat hodnoty null. Během trénování modelu Analytické služby SQL Serveru vrátí chybu, pokud v tomto sloupci narazí na hodnotu null.

MODEL_EXISTENCE_ONLY
Považuje sloupec za dva stavy: Chybějící a Existující. Pokud je hodnota NULL, algoritmus ji považuje za Chybějící. Příznak MODEL_EXISTENCE_ONLY se vztahuje na předvídatelný atribut a většina algoritmů příznak podporuje.

Když nastavíte příznak MODEL_EXISTENCE_ONLY na Hodnotu True, model představuje hodnoty pouze se dvěma stavy: Chybějící a Existující. To kombinuje všechny nechybějící stavy do jediné hodnoty Existing.

Typické použití tohoto příznaku modelování by bylo v atributech, pro které má stav NULL implicitní význam, a explicitní hodnota stavu NOT NULL nemusí být tak důležitá jako skutečnost, že sloupec má libovolnou hodnotu. Například může mít sloupec [DateContractSigned] hodnotu NULL, pokud nebyla smlouva nikdy podepsána, a není NULL, pokud byla smlouva podepsána. Proto pokud je účelem modelu předpovědět, zda bude smlouva podepsána, můžete pomocí příznaku MODEL_EXISTENCE_ONLY ignorovat přesnou hodnotu data v případech NOT NULL a rozlišovat pouze mezi případy, kdy kontrakt chybí nebo existující.

Poznámka:

Chybějící je zvláštní stav používaný algoritmem a liší se od textové hodnoty Chybějící ve sloupci. Další informace najdete v tématu Chybějící hodnoty (Analysis Services – Dolování dat).

REGRESOR
Příznak REGRESSOR označuje sloupec jako kandidátní regresor při zpracování. Tento příznak použijte pouze u sloupce modelu dolování, který má průběžný číselný datový typ. Další informace naleznete v tématu Použití příznaku modelování REGRESSOR.

Zobrazení a změna příznaků modelování

Zobrazí příznaky modelování pro sloupec dolovací struktury nebo sloupec modelu ve vlastnostech struktury nebo modelu v Návrháři dolování dat.

Pokud chcete zkontrolovat příznaky modelování pro aktuální strukturu dolování, zadejte dotaz na sadu řádků schématu dolování dat. Následující dotaz vrátí příznaky pouze pro sloupce typu structure.

SELECT COLUMN_NAME, MODELING_FLAG  
FROM $system.DMSCHEMA_MINING_STRUCTURE_COLUMNS  
WHERE STRUCTURE_NAME = '<structure name>'  

Příznaky modelování používané v modelu můžete přidat nebo změnit pomocí Návrháře dolování dat a upravit vlastnosti přidružených sloupců. Tyto změny vyžadují opětovné zpracování struktury nebo modelu.

Zadejte příznaky modelování v nové struktuře dolování nebo modelu pomocí skriptů DMX, AMO nebo XMLA. DMX nemůže změnit příznaky modelování v existujícím modelu nebo struktuře dolování. Místo toho vytvořte model dolování s ALTER MINING STRUCTURE ... ADD MINING MODEL.

Použití příznaku modelu REGRESSOR

Když nastavíte REGRESSOR příznak modelování u sloupce, označíte, že sloupec obsahuje potenciální regresory. Algoritmus určuje, které regresory model používá, a vyřadí všechny, které nemodelují predikovaný atribut.

Při vytváření modelu pomocí průvodce dolováním dat se všechny průběžné vstupní sloupce označí jako možné regresory. Proto i když ve sloupci explicitně nenastavíte příznak REGRESSOR, může se sloupec použít jako regresor v modelu.

Regresory, které byly ve zpracovaném modelu skutečně použity, můžete určit provedením dotazu na sadu řádků schématu pro model dolování, jak je znázorněno v následujícím příkladu:

SELECT COLUMN_NAME, MODELING_FLAG  
FROM $system.DMSCHEMA_MINING_COLUMNS  
WHERE MODEL_NAME = '<model name>'  

Poznámka Jakmile změníte typ obsahu sloupce dolování z průběžného na diskrétní, ručně změňte příznak sloupce a znovu zpracujte model.

Regresory v modelech lineární regrese

Modely lineární regrese jsou založené na algoritmu Microsoft Decision Trees. I když nepoužíváte algoritmus lineární regrese Microsoft, může jakýkoli model rozhodovacího stromu obsahovat strom nebo uzly, které představují regresi u spojitého atributu.

Proto v těchto modelech nemusíte zadávat, že průběžný sloupec představuje regresor. Algoritmus rozhodovacích stromů Microsoft rozděluje datovou sadu do oblastí smysluplnými vzory, i když ve sloupci nenastavíte příznak REGRESSOR. Rozdíl je v tom, že když nastavíte příznak modelování, algoritmus se pokusí najít regresní rovnice následující formy tak, aby odpovídal vzorům v uzlech stromu.

a*C1 + b*C2 + ...

Algoritmus vypočítá součet reziduí. Pokud je odchylka příliš velká, algoritmus vynutí rozdělení ve stromu.

Předpokládejme například, že predikujete chování zákazníků při nákupu pomocí příjmu jako atributu a nastavíte příznak modelování REGRESSOR ve sloupci. Algoritmus se nejprve pokusí přizpůsobit hodnoty příjmů standardnímu regresnímu vzorci. Pokud je odchylka příliš velká, algoritmus vzorec opustí a rozdělí strom na jiný atribut. Algoritmus se pak pokusí přizpůsobit regresor příjmů v každé větvi.

Pomocí parametru FORCE_REGRESSOR vyžadovat, aby algoritmus používal konkrétní regresor. Tento parametr podporují rozhodovací stromy a algoritmy lineární regrese.

Pomocí těchto odkazů se dozvíte více o modelovacích příznacích.

Task Téma
Úprava příznaků modelování v Návrháři pro dolování dat Zobrazení nebo změna příznaků modelování (dolování dat)
Zadejte nápovědu pro algoritmus, který doporučí pravděpodobné regresory. Určení sloupce, který se má použít jako regresor v modelu
Podívejte se na příznaky modelování podporované konkrétními algoritmy (v části Příznaky modelování pro každé referenční téma algoritmů). Algoritmy dolování dat (Analysis Services – Dolování dat)
Přečtěte si další informace o sloupcích struktury dolování a o vlastnostech, které na nich můžete nastavit. Sloupce struktury dolování
Seznamte se se sloupci těžebního modelu a příznaky modelování, které můžete použít na úrovni modelu. Sloupce modelu dolování
Viz syntaxe pro práci s příznaky modelování v příkazech DMX. Příznaky modelování (DMX)
Informace o chybějících hodnotách a o tom, jak s nimi pracovat Chybějící hodnoty (Analysis Services – Dolování dat)
Informace o správě modelů a struktur a nastavení vlastností využití Přesouvání objektů dolování dat