Utwórz relacyjną strukturę eksploracji

Dotyczy: SQL Server 2019 i starsze usługi Analysis Services Azure Analysis Services Fabric/Power BI Premium

Ważne

Funkcja wyszukiwania danych została uznana za przestarzałą w usługach SQL Server 2017 Analysis Services i została zakończona w usługach SQL Server 2022 Analysis Services. Dokumentacja nie jest aktualizowana dla przestarzałych i wycofanych funkcji. Aby dowiedzieć się więcej, zobacz zgodność z poprzednimi wersjami usług Analysis Services.

Większość modeli wyszukiwania danych jest oparta na relacyjnych źródłach danych. Podczas tworzenia relacyjnego modelu eksploracji danych można zestawiać dane ad hoc oraz trenować i aktualizować model bez konieczności tworzenia kostki.

Struktura wyszukiwania relacyjnego może pobierać dane z różnych źródeł. Dane pierwotne można przechowywać w tabelach, plikach lub systemach relacyjnych baz danych, o ile dane można zdefiniować jako część widoku źródła danych. Na przykład możesz użyć relacyjnej struktury wyszukiwania, jeśli dane są w Excel, magazynie danych SQL Server lub SQL Server bazie danych raportowania lub w zewnętrznych źródłach, do których uzyskujesz dostęp za pośrednictwem dostawców OLE DB lub ODBC.

Ten artykuł zawiera omówienie sposobu tworzenia relacyjnej struktury wyszukiwania danych za pomocą Kreatora wyszukiwania danych.

Requirements

Omówienie procesu

Uruchom Kreatora wyszukiwania danych, klikając prawym przyciskiem myszy węzeł Struktury wyszukiwania w Eksplorator rozwiązań i wybierając polecenie Dodaj nową strukturę wyszukiwania. Kreator poprowadzi Cię przez następujące kroki, aby utworzyć strukturę dla nowego modelu eksploracji danych relacyjnych:

  1. Wybierz metodę definicji: wybierz typ źródła danych i wybierz pozycję Z relacyjnej bazy danych lub magazynu danych.

  2. Utwórz strukturę wyszukiwania danych: określ, czy utworzyć tylko strukturę, czy strukturę z modelem wyszukiwania.

    Wybierz również odpowiedni algorytm dla początkowego modelu. Aby uzyskać wskazówki dotyczące tego, który algorytm jest najlepszy w przypadku niektórych zadań, zobacz Algorytmy wyszukiwania danych (Analysis Services — Wyszukiwanie danych).

  3. Wybierz widok Źródła danych: wybierz widok źródeł danych do użycia podczas trenowania modelu. Widok źródła danych może również zawierać dane używane do testowania lub niepowiązanych danych. Możesz wybrać dane, które są rzeczywiście używane w strukturze i w modelu. Filtry można również zastosować do danych później.

  4. Określ typy tabel: wybierz tabelę zawierającą przypadki używane do analizy. W przypadku niektórych zbiorów danych, zwłaszcza używanych do tworzenia modeli koszykowych, można również dołączyć powiązaną tabelę, która posłuży jako tabela zagnieżdżona.

    Dla każdej tabeli określ klucz, aby algorytm wiedział, jak zidentyfikować unikatowy rekord i powiązane rekordy w przypadku dodania zagnieżdżonej tabeli.

    Aby uzyskać więcej informacji, zobacz Kolumny struktury wydobywczej.

  5. Określ dane szkoleniowe: wybierz tabelę przypadku, czyli tabelę zawierającą najważniejsze dane do analizy.

    W przypadku niektórych zestawów danych, zwłaszcza tych używanych w modelach koszyków rynkowych, można również dołączyć powiązaną tabelę. Wartości w tej zagnieżdżonej tabeli są traktowane jako wiele wartości powiązanych z pojedynczym wierszem lub przypadkiem w tabeli głównej.

  6. Określ zawartość kolumn i typy danych: dla każdej kolumny używanej w strukturze wybierz zarówno typ danych , jak i typ zawartości.

    Kreator automatycznie wykrywa możliwe typy danych, ale nie musisz używać typu danych, który zaleca. Na przykład jeśli dane zawierają liczby, mogą reprezentować dane podzielone na kategorie. Kolumny określone jako klucze są automatycznie przypisywane prawidłowego typu danych dla danego typu modelu. Aby uzyskać więcej informacji, zobacz Kolumny modelu eksploracji i Typy danych (Eksploracja danych).

    Typ zawartości wybrany dla każdej kolumny używanej w modelu informuje algorytm o sposobie przetwarzania danych.

    Na przykład możesz zdecydować się na dyskretyzowanie liczb zamiast używać wartości ciągłych. Możesz również poprosić algorytm o automatyczne wykrycie najlepszego typu zawartości dla kolumny. Aby uzyskać więcej informacji, zobacz Typy zawartości (wyszukiwanie danych).

  7. Tworzenie zestawu testów: określ ilość danych, które mają zostać odłożone do użycia podczas testowania modelu. Jeśli Twoje dane pozwalają na wykorzystanie wielu modeli, dobrym pomysłem jest utworzenie wydzielonego zbioru danych testowych, aby wszystkie modele można było testować na tych samych danych.

    Aby uzyskać więcej informacji, zobacz Testowanie i walidacja (wyszukiwanie danych).

  8. Kończenie pracy Kreatora: nazwij nową strukturę górnictwa i skojarzony model górnictwa, a następnie zapisz strukturę i model.

    Możesz również ustawić kilka ważnych opcji, w zależności od typu modelu. Na przykład możesz włączyć przeglądanie szczegółowe w strukturze.

    W tym momencie struktura eksploracji danych i jej model to jedynie metadane. Musisz przetworzyć je oba, aby uzyskać wyniki.

Jak wybrać dane relacyjne

Struktury wyszukiwania relacyjnego można opierać na dowolnych danych dostępnych za pośrednictwem źródła danych OLE DB. Jeśli dane źródłowe są w wielu tabelach, użyj widoku źródła danych, aby zebrać tabele i kolumny potrzebne w jednym miejscu.

Jeśli tabele zawierają relacje jeden do wielu, na przykład chcesz przeanalizować wiele rekordów zakupu dla każdego klienta, dodaj obie tabele. Następnie użyj jednej tabeli jako tabeli przypadków i połącz dane po wielu stronach relacji jako zagnieżdżonej tabeli.

Dane w strukturze eksploracji pochodzą z istniejącego widoku źródła danych. Dane można modyfikować zgodnie z potrzebami w widoku źródła danych, dodając relacje lub kolumny pochodne, które mogą nie być obecne w podstawowych danych relacyjnych. Można również utworzyć nazwane obliczenia lub agregacje w widoku źródła danych. Te funkcje są przydatne, jeśli nie masz kontroli nad rozmieszczeniem danych w źródle danych lub jeśli chcesz eksperymentować z różnymi agregacjami danych dla modeli.

Nie musisz używać wszystkich dostępnych danych. Wybierz i wybierz kolumny do uwzględnienia w strukturze górniczej. Wszystkie modele oparte na tej strukturze mogą używać tych kolumn lub można oznaczyć niektóre kolumny jako Ignoruj dla określonego modelu. Możesz pozwolić użytkownikom modelu wyszukiwania danych na przechodzenie do szczegółów wyników modelu wyszukiwania, aby zobaczyć kolumny struktury wyszukiwania, które nie zostały uwzględnione w samym modelu wyszukiwania.

Jak określić typ zawartości i typ danych

Typ danych przypomina typy danych określone w SQL Server lub innych interfejsach aplikacji: daty i godziny, liczby różnych rozmiarów, wartości logicznych, tekstu i innych dyskretnych danych.

Typy zawartości są ważne w przypadku wyszukiwania danych i mają wpływ na wynik analizy. Typ zawartości informuje algorytm, co należy zrobić z danymi. Czy na przykład należy traktować liczby w skali ciągłej, czy też je binować? Ile istnieje potencjalnych wartości i czy każda wartość jest odrębna? Jeśli wartość jest kluczem, czy klucz wskazuje wartość daty/godziny, sekwencji lub innego rodzaju klucza?

Wybór typu danych może ograniczyć wybór typów zawartości. Na przykład nie można rozdysretizować wartości nieliczbowych. Jeśli nie widzisz żądanego typu zawartości, wybierz pozycję Wstecz , aby powrócić do strony typu danych i spróbuj użyć innego typu danych.

Nie martw się zbytnio o wybór odpowiedniego typu zawartości. Można łatwo utworzyć nowy model i zmienić w jego obrębie typ zawartości, o ile nowy typ zawartości jest obsługiwany przez typ danych ustawiony w strukturze eksploracji. Często zdarza się również tworzenie wielu modeli przy użyciu różnych typów zawartości— eksperymentu lub spełnienia wymagań innego algorytmu.

Jeśli na przykład dane zawierają kolumnę dochodu, możesz utworzyć dwa różne modele przy użyciu algorytmu Drzewa decyzyjne firmy Microsoft i skonfigurować kolumnę alternatywnie jako liczby ciągłe lub zakresy dyskretne. Jeśli jednak model został dodany przy użyciu algorytmu Microsoft Naiwnego Bayesa, trzeba będzie zmienić kolumnę tylko na zdyretyzowane wartości, ponieważ ten algorytm nie obsługuje liczb ciągłych.

Dlaczego i jak podzielić dane na zestawy treningowe i testowe

Na końcu kreatora musisz zdecydować, czy podzielić dane na zestawy trenowania i testowania. Możliwość aprowizacji losowo próbkowanej części danych na potrzeby testowania jest bardzo wygodna, ponieważ gwarantuje, że spójny zestaw danych testowych jest dostępny dla wszystkich modeli skojarzonych z nową strukturą.

Ważne

Ta opcja nie jest dostępna dla wszystkich typów modeli. Na przykład, jeśli tworzysz model prognozowania, nie możesz użyć metody holdout, ponieważ algorytm szeregów czasowych wymaga, aby w danych nie było luk. Aby uzyskać listę typów modeli obsługujących zestawy danych walidacyjnych, zobacz Training and Testing Data Sets.

Aby utworzyć zbiór walidacyjny, określ, jaki procent danych chcesz wykorzystać na potrzeby testowania. Wszystkie pozostałe dane są używane do trenowania. Opcjonalnie można ustawić maksymalną liczbę przypadków do testowania lub wartość początkową do użycia podczas uruchamiania procesu wyboru losowego.

Definicja wydzielonego zestawu testowego jest przechowywana wraz ze strukturą eksploracji danych, więc za każdym razem, gdy tworzysz nowy model na podstawie tej struktury, zestaw danych testowych jest dostępny do oceny dokładności modelu. Jeśli usuniesz pamięć podręczną struktury wyszukiwania, zostaną również usunięte informacje o przypadkach używanych do trenowania lub testowania.

Dlaczego i jak włączyć przechodzenie do szczegółów

Prawie na końcu kreatora jest opcja włączenia przeglądania szczegółowego. Łatwo przegapić tę ważną opcję. Przeglądanie szczegółowe umożliwia wyświetlanie danych źródłowych w strukturze wyszukiwania przez wykonywanie zapytań względem modelu wyszukiwania.

Ta funkcja jest przydatna do wyświetlania szczegółów. Jeśli na przykład wyświetlasz wyniki modelu klastrowania, możesz zobaczyć klientów, którzy znajdują się w określonym klastrze. Korzystając z przeglądania szczegółowego, można wyświetlić szczegóły, takie jak informacje kontaktowe.

Ważne

Aby użyć analizy szczegółowej, należy ją włączyć podczas tworzenia struktury danych. Funkcję drążenia dla modeli można włączyć później przez ustawienie właściwości modelu, ale struktury eksploracji danych wymagają ustawienia tej opcji na samym początku. Aby uzyskać więcej informacji, zobacz Zapytania przeglądania szczegółowego (Wyszukiwanie Danych).

Zobacz także

Projektant wyszukiwania danych
Kreator wyszukiwania danych (Analysis Services — eksploracja danych)
Właściwości modelu eksploracji danych
Właściwości struktury wydobywania danych i kolumn struktury
Zadania i instrukcje dotyczące struktury eksploracji danych