Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Na tej stronie opisano sposób używania Databricks Data Classification w Unity Catalog do automatycznego klasyfikowania i oznaczania poufnych danych.
W przypadku nowych klasyfikatorów, zmian w zachowaniu klasyfikacji oraz innych aktualizacji, zobacz notatki do wydania Klasyfikacja danych.
Wykazy danych mogą mieć ogromną ilość danych, często zawierających znane i nieznane dane poufne. Kluczowe jest, aby zespoły ds. danych rozumiały, jaki rodzaj wrażliwych danych znajduje się w każdej tabeli, aby mogły zarówno zarządzać, jak i demokratyzować dostęp do tych danych.
Aby rozwiązać ten problem, klasyfikacja danych usługi Databricks używa agenta do automatycznego klasyfikowania i tagowania tabel w katalogu. Dzięki temu można odnajdywać poufne dane i stosować kontrole zarządzania nad wynikami przy użyciu narzędzi, takich jak kontrola dostępu oparta na atrybutach w Katalogu Unity. Aby uzyskać listę obsługiwanych tagów, zobacz Obsługiwane tagi klasyfikacji.
Korzystając z tej funkcji, możesz:
- Klasyfikowanie danych: Silnik używa systemu agentowej sztucznej inteligencji do automatycznego klasyfikowania i oznaczania dowolnych tabel w katalogu Unity.
- Optymalizowanie kosztów dzięki inteligentnemu skanowaniu: System inteligentnie określa, kiedy skanować dane, wykorzystując katalog Unity i silnik analizy danych. Oznacza to, że skanowanie jest przyrostowe i zoptymalizowane, aby zapewnić klasyfikację wszystkich nowych danych bez potrzeby ręcznej konfiguracji.
- Przeglądanie i ochrona poufnych danych: wyświetlane wyniki ułatwiają wyświetlanie wyników klasyfikacji i ochronę poufnych danych przez tagowanie i tworzenie zasad kontroli dostępu dla każdej klasy.
Administratorzy kont i magazynu metadanych mogą monitorować zakres klasyfikacji, na przykład odsetek tabel, w których wykryto dane wrażliwe, na stronie Dane w Governance Hub.
Ważne
Klasyfikacja danych usługi Databricks używa domyślnego magazynu do przechowywania wyników klasyfikacji. Nie są naliczane opłaty za magazyn.
Klasyfikacja danych usługi Databricks używa dużego modelu językowego (LLM), aby pomóc w klasyfikacji.
Wymagania
- Obszar roboczy musi mieć włączone zasoby obliczeniowe bezserwerowe (domyślnie włączone w obszarach roboczych z Unity Catalog).
- Aby umożliwić klasyfikację danych, musisz posiadać katalog lub mieć
MANAGEdo niego uprawnienia. - Aby włączyć automatyczne tagowanie dla wykazu, musisz mieć
USE CATALOGw wykazie,APPLY TAGw wykazie iASSIGNw zastosowanym tagu. - Aby zobaczyć wyniki klasyfikacji w interfejsie użytkownika, musisz mieć albo:
-
MANAGEna katalogu, lub -
READ METADATAna katalogu, lub -
USE CATALOG,USE SCHEMA, orazSELECTw katalogu.
-
- Aby wyświetlić przykładowe wartości skojarzone z wykrywaniami, musisz mieć
SELECTw tabeli System wyników.
Uwaga / Notatka
Domyślnie tylko administratorzy kont mają uprawnienia MANAGE i ASSIGN do tagów zarządzanych przez system klasyfikacji danych. Administratorzy konta mogą udzielać MANAGE i ASSIGN dla poszczególnych tagów podlegających innym użytkownikom, jednostkom usługi lub grupom. Zobacz Zarządzanie uprawnieniami do zarządzanych tagów.
Używanie klasyfikacji danych
Klasyfikację danych dla wielu katalogów można włączyć jednocześnie na stronie wyników lub skonfigurować poszczególne wykazy z bardziej szczegółową kontrolą na poziomie schematu.
Włączanie wielu wykazów
- Na stronie Wyniki klasyfikacji danych kliknij pozycję Konfiguruj.
- Wybierz wykazy, które chcesz włączyć, lub wybierz wszystkie dostępne wykazy w obszarze roboczym.
- Kliknij przycisk Włącz.
Włączenie wszystkich dostępnych wykazów nie powoduje automatycznego włączenia przyszłych katalogów. Aby sklasyfikować nowy wykaz, wróć do okna dialogowego Konfigurowanie i włącz go.
Włącz pojedynczy katalog z wyborem schematu
Aby kontrolować, które schematy w wykazie są skanowane:
Przejdź do katalogu i kliknij kartę Szczegóły .
Obok pozycji Klasyfikacja danych kliknij przycisk Włącz .
Zostanie wyświetlone okno dialogowe Klasyfikacja danych . Użyj menu rozwijanego Zakres schematu , aby wybrać schematy do skanowania:
- Wszystkie wybrane i przyszłe schematy (ustawienie domyślne): automatycznie skanuje istniejące schematy i wszelkie nowe schematy utworzone w przyszłości. Wyczyść pole wyboru obok istniejącego schematu, który chcesz wykluczyć ze skanowania.
- Tylko wybrane schematy: skanuje tylko wybrane schematy. Nowe schematy nie są skanowane do momentu dodania ich do listy.
Możesz również wybrać zasady użycia.
Kliknij Zapisz.
Spowoduje to utworzenie zadania w tle, które przyrostowo skanuje wszystkie tabele w wykazie lub wybranych schematach.
Aparat klasyfikacji opiera się na inteligentnym skanowaniu w celu określenia, kiedy należy skanować tabelę. Nowe tabele i kolumny w wykazie są zwykle skanowane w ciągu 24 godzin od utworzenia.
Ręcznie wywołaj pełne skanowanie
Po wstępnym skanowaniu możesz ręcznie uruchomić pełne skanowanie w dowolnym momencie. Pełne skanowanie ponownie ocenia każdą tabelę w schematach i katalogach, w których klasyfikacja danych jest włączona. Nie skanuje schematów, które wykluczyłeś lub nie wybrałeś. Skanowanie przypisuje wszelkie nowo skonfigurowane klasy do istniejących i nowych danych oraz generuje koszty obliczeniowe podobne do kosztów początkowego skanowania.
Aby wywołać pełne skanowanie katalogu:
Przejdź do katalogu i kliknij kartę Szczegóły .
Obok Klasyfikacji Danych kliknij Zobacz wyniki , aby otworzyć interfejs Klasyfikacji Danych.
Domyślnie katalog jest wybierany jako zakres. Kliknij Uruchom pełne skanowanie.
Klasyfikuj widoki
Ważne
Ta funkcja jest dostępna w wersji beta. Aby z niego korzystać, administrator przestrzeni roboczej musi włączyć skanowanie Analizy Klasyfikacji Danych na stronie Podglądów . Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.
Domyślnie klasyfikacja danych skanuje tabele, tabele strumieniowe oraz zmaterializowane widoki. Gdy skanowanie widoków jest włączone, klasyfikacja danych skanuje także kolumny zwykłych widoków Katalogu Unity i klasyfikuje w nich wrażliwe dane, używając tych samych detektorów i klas, które stosuje do tabel.
Zobacz wyniki klasyfikacji obok wyników tabeli, zarówno na stronie Klasyfikacji Danych, jak i w tabeli systemu wyników.
Włącz skanowanie widoku
Gdy administrator przestrzeni roboczej włączy wersję zapoznawczą, podczas następnego zaplanowanego skanowania zostaną uwzględnione widoki we wszystkich katalogach z włączoną klasyfikacją danych w tej przestrzeni roboczej.
Uwaga / Notatka
Włączanie skanowania widoków zwiększa koszt klasyfikacji danych, ponieważ widoki są skanowane oprócz tabel. Wielkość wzrostu zależy od liczby wyświetleń w katalogach oraz ich rozmiaru i złożoności. Databricks zaleca włączenie skanowania widoku najpierw w przestrzeni roboczej z mniejszymi katalogami, aby obserwować wpływ kosztów przed szerszym wdrożeniem. Zobacz koszty klasyfikacji danych.
Zobacz ograniczenia skanowania
- Domyślnie nie stosuje się tagów klasyfikacji do kolumn widoku. W przeciwieństwie do tabel widoki są objęte klasyfikacją, ale ich kolumny nie są oznaczane tagiem
class.*, ponieważ tag klasyfikacyjny zastosowany do widoku może kolidować z istniejącą zasadą maskowania kolumn lub filtrowania wierszy i sprawić, że wykonywanie zapytań do widoku będzie niemożliwe. Jeśli ABAC on Views (Beta) jest włączony, obsługiwane jest automatyczne tagowanie kolumn widoku. W każdym przypadku pełne wyniki klasyfikacji pojawiają się na stronie wyników oraz w tabeli systemu wyników. - Widoki z definicjami niebezpiecznymi nie są skanowane. Widoki, których definicje wykorzystują niebezpieczne operacje, takie jak starsze funkcje użytkownika zdefiniowane przez metastore Hive,
reflect(), orazjava_method(), nie są skanowane. Są raportowane wraz ze statusemUNSUPPORTED_VIEW_DEFINITION. - Widoki metryczne nie są skanowane.Widoki metryczne są wyłączone ze skanowania widoków i nie pojawiają się w wynikach klasyfikacji widoków.
Wyświetlanie wyników klasyfikacji
Aby wyświetlić wyniki klasyfikacji, kliknij pozycję Wyświetl wyniki obok ustawienia Klasyfikacja danych .
Spowoduje to otwarcie interfejsu użytkownika klasyfikacji danych dla katalogu. Aby wyświetlić wyniki klasyfikacji, wymagany jest bezserwerowy magazyn SQL Warehouse.
Zagregowane wyniki można również wyświetlić we wszystkich sklasyfikowanych katalogach w magazynie metadanych przy użyciu selektora wykazu w lewym górnym rogu. Wybierz pozycję Wszystkie wykazy z menu rozwijanego.
Użyj filtra ram zgodności , aby ograniczyć wyniki do klasyfikacji związanych z konkretnym systemem zgodności.
Dla każdego typu klasyfikacji tabela zawiera następujące elementy:
- Wykryte kolumny: liczba kolumn, w których wykryto klasyfikację.
- Automatyczne tagowanie: stan tagowania dla tej klasyfikacji — aktywny lub nieaktywny. W widoku magazynu metadanych stan Częściowo aktywne wskazuje, że tagowanie jest włączone w niektórych, ale nie we wszystkich katalogach.
- Ramy zgodności: Ramy zgodności związane z klasyfikacją. Szczegółowe informacje o klasyfikacjach uwzględnionych w poszczególnych strukturach można znaleźć w artykule Informacje o strukturach zgodności.
- Dostęp użytkowników do niezamaskowanych danych (ostatnie 7 dni): Odsetek użytkowników, którzy uzyskali dostęp do niezamaskowanych danych o tej klasyfikacji w ciągu ostatnich 7 dni. Umożliwia to ocenę ujawnienia poufnych danych w całej organizacji.
Przejrzyj wykrycia
Aby przejrzeć wyniki dla określonego typu klasyfikacji, kliknij pozycję Przejrzyj w najbardziej prawej kolumnie. Pojawi się panel z dwiema zakładkami:
- Wykryte kolumny: wyświetla kolumny, w których wykryto tag klasyfikacji z dużą ufnością, uporządkowane według najnowszego wykrywania. Zawiera również wykres Wykrywanie w czasie i listę wykrytych kolumn z przykładowymi wartościami. Kliknij dowolny słupek na wykresie, aby wyświetlić określone wykrycia dla tej daty. Przykładowe wartości są wyświetlane tylko wtedy, gdy masz wymagane uprawnienia do wyświetlania wyników klasyfikacji.
- Dostęp użytkowników: wyświetla listę wszystkich użytkowników, którzy uzyskiwali dostęp do kolumn za pomocą tego tagu klasyfikacji, pokazując ich adres e-mail i nazwę użytkownika oraz informację o tym, czy mają zamaskowany, czy niemaskowany dostęp. Pokazuje również wszystkie zasady kontroli dostępu opartej na atrybutach (ABAC) przypisane do tego tagu klasyfikacji. Podczas wyświetlania wyników dla pojedynczego wykazu można utworzyć nową politykę ABAC bezpośrednio w panelu.
Jeśli jakiekolwiek wykryte kolumny są nieprawidłowe, możesz kliknąć ikonę Wyklucz po prawej stronie wpisu. Zobacz Wyklucz wykrycia.
Włączanie automatycznego tagowania
Jeśli zidentyfikowane kolumny są zgodne z oczekiwaniami, możesz włączyć automatyczne tagowanie dla tagu klasyfikacji. Po włączeniu automatycznego tagowania wszystkie istniejące i przyszłe wykrycia tej klasyfikacji są oznaczane.
Automatyczne tagowanie można skonfigurować na dwóch poziomach:
- Poziom magazynu metadanych: Można włączyć lub wyłączyć we wszystkich katalogach jednocześnie. Musisz być administratorem magazynu metadanych i mieć uprawnienia do stosowania tagu, który jest stosowany.
-
Poziom katalogu: Włącz lub wyłącz tylko dla bieżącego katalogu. Ustawienia na poziomie wykazu mają pierwszeństwo przed ustawieniem na poziomie magazynu metadanych. Musisz mieć
USE CATALOGorazAPPLY TAGw katalogu, aASSIGNna tagu, który jest stosowany.
Na poziomie wykazu automatyczne tagowanie ma trzy stany:
- Ustawienie domyślne (dziedziczone): katalog dziedziczy ustawienie tagowania z poziomu magazynu metadanych.
- Aktywne: tagowanie jest jawnie włączone dla tego wykazu, niezależnie od ustawienia na poziomie magazynu metadanych.
- Nieaktywne: Oznaczanie jest wyraźnie wyłączone dla tego katalogu, niezależnie od ustawienia na poziomie metaskładnicy.
Po wyłączeniu tagowania nie są stosowane żadne przyszłe tagi, ale istniejące tagi nie są usuwane.
Uwaga / Notatka
Po włączeniu automatycznego tagowania, tagi nie są natychmiast uzupełniane. Zostaną one wypełnione w następnym skanowaniu, co powinno nastąpić w ciągu 24 godzin. Kolejne klasyfikacje zostaną oznaczone natychmiast.
Wyklucz wykrycia
Ważne
Wykluczenia wykrywania i ich użycie w celu zwiększenia dokładności przyszłej klasyfikacji są w wersji beta.
Na panelu przeglądu można wykluczyć poszczególne wykrycia kolumn. Pomijanie wykrycia
- Usuwa z tej kolumny dowolny istniejący tag klasyfikacji.
- Zapobiega przyszłym skanowaniom ponownemu stosowaniu tagu do tej kolumny.
- Zawiera opinie, które zwiększają dokładność przyszłych wyników klasyfikacji.
Aby wykluczyć wykrywanie, kliknij ikonę Wyklucz dla odpowiedniej kolumny w panelu przeglądu. Aby ponownie dołączyć wykrywanie, kliknij ponownie ikonę.
Tabela systemu wyników
Klasyfikacja danych tworzy tabelę systemową o nazwie system.data_classification.results do przechowywania wyników, które domyślnie są dostępne tylko dla administratora konta. Administrator konta może udostępnić tę tabelę. Tabela jest dostępna tylko wtedy, gdy używasz bezserwerowych obliczeń. Aby uzyskać szczegółowe informacje na temat tej tabeli, zobacz Dokumentacja tabeli systemu klasyfikacji danych.
Ważne
Tabela system.data_classification.results wyników zawiera wszystkie wyniki klasyfikacji w całym magazynie metadanych i zawiera przykładowe wartości z tabel w każdym wykazie. Tę tabelę należy udostępnić tylko użytkownikom uprzywilejowanym, aby wyświetlić wyniki klasyfikacji dla całego magazynu metadanych, w tym przykładowe wartości.
Użytkownicy z dostępem SELECT do tej tabeli mogą również zobaczyć przykładowe wartości skojarzone z wykryciami na stronie wyników klasyfikacji danych.
Skonfiguruj kontrole zarządzania na podstawie wyników klasyfikacji danych
Maskuj poufne dane przy użyciu zasad ABAC
Usługa Databricks zaleca używanie kontroli dostępu opartej na atrybutach w Unity Catalog w celu utworzenia kontroli zarządzania na podstawie wyników klasyfikacji danych.
Aby utworzyć zasady na stronie wyników klasyfikacji danych, kliknij pozycję Przejrzyj tag klasyfikacji, otwórz kartę Dostęp użytkowników i kliknij pozycję Nowe zasady. Formularz zasad jest wstępnie wypełniony w celu maskowania kolumn z przeglądanym tagiem klasyfikacji. Aby zamaskować dane, określ dowolną funkcję maskowania zarejestrowaną w katalogu Unity i kliknij przycisk Zapisz.
Można również utworzyć zasady, które obejmują wiele tagów klasyfikacji, zmieniając kolumnę Whenna spełnia warunek i podając wiele tagów.
Aby na przykład utworzyć politykę o nazwie "Poufne", która maskuje każdą nazwę, adres e-mail lub numer telefonu, ustaw warunek spełnia wartośćhas_tag("class.name") OR has_tag("class.email_address") OR has_tag("class.phone_number").
Odnajdywanie i usuwanie danych zgodnie z RODO
W tym przykładzie notesie pokazano, jak można użyć klasyfikacji danych, aby ułatwić odnajdywanie i usuwanie danych w celu zapewnienia zgodności z RODO.
Odnajdywanie i usuwanie RODO przy użyciu notesu klasyfikacji danych
Jak obsługiwać niepoprawne tagi
Jeśli klasyfikacja jest nieprawidłowa, wyklucz detekcję z panelu przeglądowego. Wykluczenie wykrywania powoduje usunięcie tagu, uniemożliwia jego ponowne zastosowania i poprawia dokładność przyszłych skanowań. Zobacz Wyklucz wykrycia.
Błędy skanowania
Jeśli podczas skanowania wystąpią jakiekolwiek błędy, w prawym górnym rogu tabeli wyników pojawi się przycisk Błędy .
Kliknij przycisk, aby wyświetlić tabele, które zakończyły się niepowodzeniem skanowania i skojarzonymi komunikatami o błędach.
Domyślnie błędy, które wystąpiły dla poszczególnych tabel, są pomijane i ponawiane następnego dnia.
Wyświetlanie wydatków dotyczących klasyfikacji danych
Aby dowiedzieć się, jak jest rozliczana klasyfikacja danych, zobacz stronę cennika. Możesz wyświetlić wydatki związane z klasyfikacją danych, uruchamiając zapytanie lub wyświetlając pulpit nawigacyjny użycia.
Uwaga / Notatka
Początkowe skanowanie jest bardziej kosztowne niż kolejne skanowania w tym samym wykazie, ponieważ te skanowania są przyrostowe i zwykle wiążą się z niższymi kosztami.
Wyświetl użycie z tabeli systemowej system.billing.usage
Możesz wykonać zapytanie dotyczące wydatków na klasyfikację danych z witryny system.billing.usage. Pola created_by i catalog_id mogą służyć opcjonalnie do podziału kosztów:
-
created_by: Uwzględnij, aby zobaczyć koszty poniesione przez użytkownika, który zainicjował użycie. -
catalog_id: Uwzględnij, aby wyświetlić koszty według katalogu. Identyfikator katalogu jest wyświetlany w tabelisystem.data_classification.results.
Przykładowe zapytanie z ostatnich 30 dni:
SELECT
usage_date,
identity_metadata.created_by,
usage_metadata.catalog_id,
SUM(usage_quantity) AS dbus
FROM
system.billing.usage
WHERE
usage_date >= DATE_SUB(CURRENT_DATE(), 30)
AND billing_origin_product = 'DATA_CLASSIFICATION'
GROUP BY
usage_date,
created_by,
catalog_id
ORDER BY
usage_date DESC,
created_by;
Aby obliczyć całkowity koszt w dolarach, dokonaj połączenia z system.billing.list_prices. Poniższe przykładowe zapytanie używa nazwanego parametru :add_on_rate jako mnożnika w cenie katalogowej. Ustaw ją na 1, aby użyć ceny katalogowej bezpośrednio, lub wartość mniejszą niż 1 w celu odzwierciedlenia wynegocjowanego rabatu (na przykład 0.9 dla rabatu 10%).
Przykładowe zapytanie dotyczące łącznego kosztu dolara w ciągu ostatnich 30 dni:
SELECT
u.usage_date,
SUM(u.usage_quantity * lp.pricing.effective_list.default) * :add_on_rate
AS `Data Classification Dollar Cost`
FROM system.billing.usage AS u
JOIN system.billing.list_prices AS lp
ON lp.sku_name = u.sku_name
WHERE
u.billing_origin_product = 'DATA_CLASSIFICATION'
AND u.usage_end_time >= lp.price_start_time
AND (lp.price_end_time IS NULL OR u.usage_end_time < lp.price_end_time)
AND u.usage_date >= DATE_ADD(CURRENT_DATE(), -30)
GROUP BY
u.usage_date
ORDER BY
u.usage_date DESC;
Wyświetlanie użycia z pulpitu nawigacyjnego
Jeśli masz już skonfigurowany pulpit nawigacyjny użycia w obszarze roboczym, możesz go użyć do filtrowania użycia, wybierając pozycję Źródło rozliczeń Project z etykietą "Klasyfikacja danych". Jeśli nie masz skonfigurowanego pulpitu kontrolnego użycia, możesz go zaimportować i zastosować to samo filtrowanie. Aby uzyskać szczegółowe informacje, zobacz Panele użycia.
Obsługiwane tagi klasyfikacji
Aby uzyskać pełną listę obsługiwanych tagów zorganizowanych według tagów globalnych, tagów regionalnych i struktur zgodności (PII, PCI DSS, RODO, HIPAA, GLBA, DPDPA i PIPEDA), zobacz Obsługiwane tagi klasyfikacji.
Ograniczenia
- Skanowanie widoków w usłudze Unity Catalog jest dostępne w wersji beta; zobacz Klasyfikowanie widoków. Wyświetlenia metryczne i widoki z definicjami niebezpiecznymi nie są skanowane.