Příklady dotazů modelu lineární regrese

Platí pro: SQL Server 2019 a starší služby Analysis Services Azure Analysis Services Fabric/ Power BI Premium

Důležité

Dolování dat bylo v SQL Serveru 2017 Analysis Services zastaralé a nyní ukončeno ve službě SQL Server 2022 Analysis Services. Dokumentace se neaktualizuje pro zastaralé a ukončené funkce. Další informace najdete v tématu Zpětná kompatibilita služby Analysis Services.

Když vytváříte dotaz na model dolování dat, můžete vytvořit dotaz na obsah, který poskytuje podrobnosti o vzorech zjištěných při analýze, nebo můžete vytvořit prediktivní dotaz, který pomocí vzorů v modelu vytváří předpovědi pro nová data. Dotaz na obsah může například poskytnout další podrobnosti o regresním vzorci, zatímco prediktivní dotaz vám může říct, jestli nový datový bod odpovídá modelu. Metadata o modelu můžete také načíst pomocí dotazu.

Tato část vysvětluje, jak vytvářet dotazy pro modely založené na algoritmu lineární regrese Microsoftu.

Poznámka:

Vzhledem k tomu, že lineární regrese vychází ze speciálního případu algoritmu Rozhodovací stromy Microsoftu, existuje mnoho podobností a některé modely rozhodovacího stromu, které používají spojité předvídatelné atributy, můžou obsahovat regresní vzorce. Další informace naleznete v tématu Technické reference k algoritmu Rozhodovací stromy Společnosti Microsoft.

Dotazy na obsah

Určení parametrů používaných pro model pomocí sady řádků schématu dolování dat

Použití DMX k vrácení regresního vzorce pro model

Vrácení pouze koeficientu pro model

Dotazy predikce

Predikce příjmu pomocí jednoúčelového dotazu

Použití prediktivních funkcí s regresním modelem

Vyhledání informací o modelu lineární regrese

Struktura modelu lineární regrese je velmi jednoduchá: model dolování představuje data jako jeden uzel, který definuje regresní vzorec. Další informace naleznete v tématu Obsah těžení modelu pro logistické regresní modely (Analysis Services - Data Mining).

Zpět na začátek

Ukázkový dotaz 1: Určení parametrů používaných pro model pomocí sady řádků schématu dolování dat

Dotazováním sady řádků schématu dolování dat najdete metadata o modelu. To může zahrnovat dobu, kdy byl model vytvořen, dobu, kdy byl model naposledy zpracován, název těžební struktury, na níž je model založen, a název sloupce určeného jako předvídatelný atribut. Můžete také vrátit parametry, které se použily při prvním vytvoření modelu.

SELECT MINING_PARAMETERS   
FROM $system.DMSCHEMA_MINING_MODELS  
WHERE MODEL_NAME = 'TM_PredictIncome'  

Ukázkové výsledky:

PARAMETRY TĚŽBY
COMPLEXITY_PENALTY=0,9,

MAXIMUM_INPUT_ATTRIBUTES=255,

MAXIMUM_OUTPUT_ATTRIBUTES=255,

MINIMUM_SUPPORT=10,

SCORE_METHOD=4,

SPLIT_METHOD=3,

FORCE_REGRESSOR=

Poznámka:

Nastavení parametru "FORCE_REGRESSOR = označuje, že aktuální hodnota parametru FORCE_REGRESSOR má hodnotu null.

Zpět na začátek

Ukázkový dotaz 2: Načtení vzorce regrese pro model

Následující dotaz vrátí obsah modelu dolování dat pro lineární regresní model vytvořený pomocí stejného datového zdroje Targeted Mailing, který byl použit v kurzu Základní dolování dat. Tento model předpovídá příjmy zákazníků na základě věku.

Dotaz vrátí obsah uzlu, který obsahuje regresní vzorec. Každá proměnná a koeficient jsou uloženy v samostatném řádku vnořené tabulky NODE_DISTRIBUTION. Pokud chcete zobrazit úplný regresní vzorec, použijte prohlížeč Microsoft Tree Viewer, klikněte na uzel (Vše) a otevřete legendu dolování.

SELECT FLATTENED NODE_DISTRIBUTION as t  
FROM LR_PredictIncome.CONTENT  

Poznámka:

Pokud odkazujete na jednotlivé sloupce vnořené tabulky pomocí dotazu, jako je SELECT <column name> from NODE_DISTRIBUTION, některé sloupce, například SUPPORT nebo PRAVDĚPODOBNOST, musí být uzavřeny v hranatých závorkách, aby bylo možné je odlišit od vyhrazených klíčových slov stejného názvu.

Očekávané výsledky:

t.ATTRIBUTE_NAME t.ATTRIBUTE_VALUE t.SUPPORT t.PRAVDĚPODOBNOST t.VARIANCE t.VALUETYPE
Roční příjem Nepřítomný 0 0.000457142857142857 0 1
Roční příjem 57220.8876687257 17484 0.999542857142857 1041275619.52776 3
Věk 471.687717702463 0 0 126.969442359327 7
Věk 234.680904692439 0 0 0 8
Věk 45.4269617936399 0 0 126.969442359327 9
35793.5477381267 0 0 1012968919.28372 11

Ve srovnání Mining Legend regresní vzorec vypadá takto:

Yearly Income = 57,220.919 + 471.688 * (Age - 45.427)

Vidíte, že v legendě těžby jsou některá čísla zaokrouhlená; tabulka NODE_DISTRIBUTION a legenda dolování však v podstatě obsahují stejné hodnoty.

Hodnoty ve sloupci VALUETYPE vám říkají, jaký druh informací je obsažen v každém řádku, což je užitečné, pokud výsledky zpracováváte programově. Následující tabulka ukazuje typy hodnot, které jsou výstupem vzorce lineární regrese.

VALUETYPE
1 (Chybí)
3 (nepřetržitý)
7 (koeficient)
8 (Získání skóre)
9 (statistika)
7 (koeficient)
8 (Získání skóre)
9 (statistika)
11 (průsečík)

Další informace o významu jednotlivých typů hodnot pro regresní modely naleznete v tématu Obsah modelu těžby pro lineární regresní modely (Analysis Services - Data Mining).

Zpět na začátek

Ukázkový dotaz 3: Vrácení pouze koeficientu pro model

Pomocí výčtu VALUETYPE můžete vrátit pouze koeficient pro regresní rovnici, jak je znázorněno v následujícím dotazu:

SELECT FLATTENED MODEL_NAME,  
    (SELECT ATTRIBUTE_VALUE, VALUETYPE  
     FROM NODE_DISTRIBUTION  
     WHERE VALUETYPE = 11)   
AS t  
FROM LR_PredictIncome.CONTENT  

Tento dotaz vrátí dva řádky, jeden z obsahu modelu dolování a řádek z vnořené tabulky, která obsahuje koeficient. Sloupec ATTRIBUTE_NAME zde není zahrnutý, protože je vždy prázdný pro koeficient.

MODEL_NAME t.ATTRIBUTE_VALUE t.VALUETYPE
LR_PredictIncome
LR_PredictIncome 35793.5477381267 11

Zpět na začátek

Vytváření předpovědí z lineárního regresního modelu

Pomocí karty Předpověď v Návrháři dolování dat můžete vytvářet prediktivní dotazy na modely lineární regrese. Tvůrce prediktivních dotazů je k dispozici v nástroji SQL Server Management Studio i SQL Server Data Tools.

Poznámka:

Dotazy na regresní modely můžete také vytvářet pomocí doplňků pro dolování dat SQL Serveru 2005 (9.x) pro Excel nebo doplňky sql Serveru 2008 pro dolování dat pro Excel. I když doplňky pro dolování dat pro Excel nevytvařují regresní modely, můžete procházet a dotazovat jakýkoli model dolování, který je uložený v instanci služby SQL Server Analysis Services.

Zpět na začátek

Ukázkový dotaz 4: Předpověď příjmů pomocí jednoúčelového dotazu

Nejjednodušší způsob, jak vytvořit jeden dotaz na regresní model, je pomocí dialogového okna Zadání dotazu Singleton . Můžete například vytvořit následující dotaz DMX tak, že vyberete příslušný regresní model, zvolíte Singleton Query a zadáte 20 jako hodnotu Age.

SELECT [LR_PredictIncome].[Yearly Income]  
From   [LR_PredictIncome]  
NATURAL PREDICTION JOIN  
(SELECT 20 AS [Age]) AS t  

Ukázkové výsledky:

Roční příjem
45227.302092176

Zpět na začátek

Ukázkový dotaz 5: Použití prediktivních funkcí s regresním modelem

Mnoho standardních prediktivních funkcí můžete použít s lineárními regresními modely. Následující příklad ukazuje, jak přidat některé popisné statistiky do výsledků prediktivního dotazu. Z těchto výsledků vidíte, že existuje značná odchylka od průměru pro tento model.

SELECT  
  ([LR_PredictIncome].[Yearly Income]) as [PredIncome],  
  (PredictStdev([LR_PredictIncome].[Yearly Income])) as [StDev1]  
From  
  [LR_PredictIncome]  
NATURAL PREDICTION JOIN  
(SELECT 20 AS [Age]) AS t  

Ukázkové výsledky:

Roční příjem StDev1
45227.302092176 31827.1726561396

Zpět na začátek

Seznam prediktivních funkcí

Všechny algoritmy Microsoftu podporují společnou sadu funkcí. Algoritmus lineární regrese Společnosti Microsoft však podporuje další funkce uvedené v následující tabulce.

Prediktivní funkce Usage
IsDescendant (DMX) Určuje, zda je jeden uzel podřízeným jiným uzlem v modelu.
IsInNode (DMX) Určuje, zda zadaný uzel obsahuje aktuální případ.
PredictHistogram (DMX) Vrátí predikovanou hodnotu nebo sadu hodnot pro zadaný sloupec.
PredictNodeId (DMX) Vrátí Node_ID pro každý případ.
PredictStdev (DMX) Vrátí směrodatnou odchylku předpovězené hodnoty.
PredictSupport (DMX) Vrátí hodnotu podpory pro zadaný stav.
PredictVariance (DMX) Vrátí odchylku zadaného sloupce.

Seznam funkcí, které jsou společné pro všechny algoritmy Microsoftu, naleznete v tématu Algoritmy dolování dat (Analysis Services - Data Mining). Další informace o tom, jak tyto funkce používat, naleznete v tématu Data Mining Extensions (DMX) – referenční informace k funkcím.

Viz také

Microsoft Linear Regression Algorithm
Dotazy na dolování dat
Technické reference k algoritmu lineární regrese společnosti Microsoft
Obsah modelu dolování pro lineární regresní modely (Analysis Services – Dolování dat)