Přizpůsobení modelů a struktury dolování

Platí pro: SQL Server 2019 a starší služby Analysis Services Azure Analysis Services Fabric/ Power BI Premium

Důležité

Dolování dat bylo v SQL Serveru 2017 Analysis Services zastaralé a nyní ukončeno ve službě SQL Server 2022 Analysis Services. Dokumentace se neaktualizuje pro zastaralé a ukončené funkce. Další informace najdete v tématu Zpětná kompatibilita služby Analysis Services.

Jakmile vyberete algoritmus, který vyhovuje vašim obchodním potřebám, můžete model dolování přizpůsobit následujícími způsoby, aby se potenciálně zlepšily výsledky.

  • Použijte různé sloupce dat v modelu nebo změňte způsob použití, typ obsahu nebo metodu diskretizace sloupců.

  • Vytvořte filtry pro model dolování, abyste omezili data použitá při trénování modelu.

  • Změňte algoritmus použitý k analýze dat.

  • Nastavte parametry algoritmu pro řízení prahových hodnot, dělení stromu a dalších důležitých podmínek.

Toto téma popisuje tyto možnosti.

Změna dat používaných modelem

Rozhodnutí, která provedete ohledně toho, které sloupce dat se mají použít v modelu, a jak tato data používat a zpracovávat, výrazně ovlivňují výsledky analýzy. Následující témata obsahují informace, které vám pomůžou porozumět těmto možnostem.

Použití výběru funkcí

Většina algoritmů dolování dat ve službě SQL Server Analysis Services používá proces označovaný jako výběr funkcí k výběru pouze nejužitečnějších atributů pro přidání modelu. Snížení počtu sloupců a atributů může zlepšit výkon a kvalitu modelu. Dostupné metody výběru funkcí se liší v závislosti na zvoleném algoritmu.

Výběr funkcí (dolování dat)

Změna využití

Můžete změnit sloupce zahrnuté do modelu dolování a způsob použití jednotlivých sloupců. Pokud výsledky, které očekáváte, nedostanete, měli byste například uvést sloupce, které jste použili jako vstup, a zeptat se sami sebe, jestli jsou sloupce dobrou volbou, a jestli je možné něco udělat, abyste zlepšili zpracování dat, mezi které patří:

  • Identifikace kategorických proměnných, které byly omylem označeny jako čísla.

  • Přidáním kategorií sbalíte počet atributů a usnadníte hledání korelací.

  • Změna způsobu třídění nebo diskretizace čísel.

  • Odebrání sloupců s velkým množstvím jedinečných hodnot nebo sloupců, které skutečně odkazují na data, a nejsou užitečné pro analýzu, jako jsou adresy nebo prostřední názvy.

Nemusíte fyzicky odebírat sloupce z datové struktury dolování; sloupec můžete označit příznakem Ignorovat. Sloupec se odstraní z modelu dolování, ale může být stále používán jinými modely dolování ve struktuře nebo odkazovan v dotazu přímého přístupu.

Vytváření aliasů pro sloupce modelu

Když služba SQL Server Analysis Services vytvoří model dolování, používá stejné názvy sloupců, které jsou ve struktuře dolování. Alias můžete přidat do libovolného sloupce v modelu dolování. To může usnadnit pochopení obsahu nebo využití sloupců nebo zkrácení názvu pro usnadnění vytváření dotazů. Aliasy jsou užitečné také v případech, kdy chcete vytvořit kopii sloupce a pojmenovat ji něco popisného.

Alias vytvoříte úpravou vlastnosti Name sloupce modelu dolování. Služba SQL Server Analysis Services bude nadále používat původní název jako ID sloupce a nová hodnota, kterou zadáte pro Název , se stane aliasem sloupce a zobrazí se v mřížce v závorkách vedle použití sloupce.

aliasy na sloupcích modelu dolování

Obrázek znázorňuje související modely, které mají více kopií sloupce ve struktuře dolování, a všechny souvisejí s příjmem. Každá kopie sloupce struktury byla diskretizována jiným způsobem. Modely v diagramu každý používá jiný sloupec z dolovací struktury; pro snadnější porovnání sloupců mezi modely však byl sloupec v každém modelu přejmenován na [Příjem].

Přidání filtrů

Do modelu dolování můžete přidat filtr. Filtr je sada podmínek WHERE, které omezují data v modelových případech na určitou podmnožinu. Filtr se používá při trénování modelu a volitelně se dá použít při testování modelu nebo vytváření grafů přesnosti.

Přidáním filtrů můžete znovu používat dolovací struktury a vytvářet modely založené na velmi různých podmnožinách dat. Nebo můžete jednoduše použít filtry k odstranění určitých řádků a zlepšení kvality analýzy.

Další informace naleznete v tématu Filtry pro modely dolování (Analysis Services - Data Mining).

Změna algoritmu

I když nové modely, které přidáte do struktury dolování, sdílejí stejnou datovou sadu, můžete získat různé výsledky pomocí jiného algoritmu (pokud je data podporují) nebo změnou parametrů algoritmu. Můžete také nastavit příznaky modelování.

Volba algoritmu určuje, jaký druh výsledků získáte. Obecné informace o tom, jak určitý algoritmus funguje, nebo obchodní scénáře, ve kterých byste mohli využít konkrétní algoritmus, najdete v tématu Algoritmy dolování dat (Analysis Services – Dolování dat).

Podívejte se na technické referenční téma pro každý algoritmus popis požadavků a omezení a podrobné informace o přizpůsobeních, která každý algoritmus podporuje.

Přizpůsobení parametrů algoritmu

Každý algoritmus podporuje parametry, které můžete použít k přizpůsobení chování algoritmu a doladění výsledků modelu. Popis použití jednotlivých parametrů najdete v následujících tématech:

Téma pro každý typ algoritmu obsahuje také prediktivní funkce, které lze použít s modely založenými na tomto algoritmu.

Název vlastnosti Vztahuje se na
AUTOMATICKÉ_DETEKOVÁNÍ_PERIODICITY Technické reference k algoritmu Microsoft Time Series
CLUSTER_COUNT Technické informace o algoritmech clusteringu Microsoftu

Technické informace o algoritmu clusteringu Microsoft Sequence
CLUSTER_SEED Technické informace o algoritmech clusteringu Microsoftu
CLUSTERING_METHOD Technické informace o algoritmech clusteringu Microsoftu
PENALIZACE_SLOŽITOSTI Technické reference k algoritmu Rozhodovací stromy Microsoftu

Technické reference k algoritmu Microsoft Time Series
FORCE_REGRESSOR Technické reference k algoritmu Rozhodovací stromy Microsoftu

Technické reference k algoritmu lineární regrese společnosti Microsoft

Modelování příznaků (dolování dat)
FORECAST_METHOD Technické reference k algoritmu Microsoft Time Series
HIDDEN_NODE_RATIO Technické referenční informace k algoritmu neurální sítě od Microsoftu
POČET_HISTORICKÝCH_MODELŮ Technické reference k algoritmu Microsoft Time Series
HISTORICAL_MODEL_GAP Technické reference k algoritmu Microsoft Time Series
PERCENTO_PRO_ODLOŽENÍ Technické reference k algoritmu logistické regrese microsoftu

Technické referenční informace k algoritmu neurální sítě od Microsoftu

Poznámka: Tento parametr se liší od procentuální hodnoty blokování, která se vztahuje na dolování struktury.
HOLDOUT_SEED Technické reference k algoritmu logistické regrese microsoftu

Technické referenční informace k algoritmu neurální sítě od Microsoftu

Poznámka: Tento parametr se liší od počáteční hodnoty blokování, která se vztahuje na dolování struktury.
Citlivost na nestabilitu Technické reference k algoritmu Microsoft Time Series
MAXIMUM_INPUT_ATTRIBUTES Technické informace o algoritmech clusteringu Microsoftu

Technické reference k algoritmu Rozhodovací stromy Microsoftu

Technické reference k algoritmu lineární regrese společnosti Microsoft

Technické reference k algoritmu Microsoft Naive Bayes

Technické referenční informace k algoritmu neurální sítě od Microsoftu

Technické reference k algoritmu logistické regrese microsoftu
MAXIMUM_ITEMSET_COUNT Technické referenční informace k algoritmu přidružení Microsoftu
MAXIMÁLNÍ_VELIKOST_POLOŽKOVÉ_SADY Technické referenční informace k algoritmu přidružení Microsoftu
MAXIMUM_OUTPUT_ATTRIBUTES Technické reference k algoritmu Rozhodovací stromy Microsoftu

Technické reference k algoritmu lineární regrese společnosti Microsoft

Technické reference k algoritmu logistické regrese microsoftu

Technické reference k algoritmu Microsoft Naive Bayes

Technické referenční informace k algoritmu neurální sítě od Microsoftu
MAXIMUM_SEQUENCE_STATES Technické informace o algoritmu clusteringu Microsoft Sequence
MAXIMÁLNÍ_HODNOTA_SÉRIE Technické reference k algoritmu Microsoft Time Series
MAXIMUM_STATES Technické informace o algoritmech clusteringu Microsoftu

Technické referenční informace k algoritmu neurální sítě od Microsoftu

Technické informace o algoritmu clusteringu Microsoft Sequence
MAXIMÁLNÍ PODPORA Technické referenční informace k algoritmu přidružení Microsoftu
MINIMÁLNÍ_DŮLEŽITOST Technické referenční informace k algoritmu přidružení Microsoftu
MINIMÁLNÍ_VELIKOST_POLOŽKOVÉ_SADY Technické referenční informace k algoritmu přidružení Microsoftu
MINIMUM_DEPENDENCY_PROBABILITY Technické reference k algoritmu Microsoft Naive Bayes
MINIMUM_PROBABILITY Technické referenční informace k algoritmu přidružení Microsoftu
Minimální_hodnota_série Technické reference k algoritmu Microsoft Time Series
MINIMUM_SUPPORT Technické referenční informace k algoritmu přidružení Microsoftu

Technické informace o algoritmech clusteringu Microsoftu

Technické reference k algoritmu Rozhodovací stromy Microsoftu

Technické informace o algoritmu clusteringu Microsoft Sequence

Technické reference k algoritmu Microsoft Time Series
MISSING_VALUE_SUBSTITUTION Technické reference k algoritmu Microsoft Time Series
MODELLING_CARDINALITY Technické informace o algoritmech clusteringu Microsoftu
PERIODICITY_HINT Technické reference k algoritmu Microsoft Time Series
PREDICTION_SMOOTHING Technické reference k algoritmu Microsoft Time Series
SAMPLE_SIZE Technické informace o algoritmech clusteringu Microsoftu

Technické reference k algoritmu logistické regrese microsoftu

Technické referenční informace k algoritmu neurální sítě od Microsoftu
SCORE_METHOD Technické reference k algoritmu Rozhodovací stromy Microsoftu
SPLIT_METHOD Technické reference k algoritmu Rozhodovací stromy Microsoftu
STOPPING_TOLERANCE Technické informace o algoritmech clusteringu Microsoftu

Viz také

Algoritmy dolování dat (Analysis Services – Dolování dat)
Fyzická architektura (Analysis Services – Dolování dat)