Classificação de dados

Esta página descreve como usar a Classificação de Dados do Databricks no Catálogo do Unity para classificar e marcar automaticamente dados confidenciais em seu catálogo.

Para novos classificadores, mudanças no comportamento de classificação e outras atualizações, consulte as notas de atualização da Classificação de Dados.

Os catálogos de dados podem ter uma grande quantidade de dados, geralmente contendo dados confidenciais conhecidos e desconhecidos. É fundamental que as equipes de dados entendam que tipo de dados confidenciais existem em cada tabela para que possam governar e democratizar o acesso a esses dados.

Para resolver esse problema, a Classificação de Dados do Databricks usa um agente para classificar e marcar tabelas automaticamente em seu catálogo. Isso permite que você descubra dados confidenciais e aplique controles de governança sobre os resultados, usando ferramentas como o controle de acesso baseado em atributos no Catálogo do Unity. Para obter uma lista de marcas com suporte, consulte marcas de classificação com suporte.

Usando esse recurso, você pode:

  • Classificar dados: o mecanismo usa um sistema de IA agente para classificar e marcar automaticamente todas as tabelas no Catálogo do Unity.
  • Otimizar o custo por meio da verificação inteligente: o sistema determina de forma inteligente quando verificar seus dados aproveitando o Catálogo do Unity e o Mecanismo de Inteligência de Dados. Isso significa que a verificação é incremental e otimizada para garantir que todos os novos dados sejam classificados sem configuração manual.
  • Examinar e proteger dados confidenciais: a exibição de resultados ajuda você a exibir resultados de classificação e proteger dados confidenciais marcando e criando políticas de controle de acesso para cada classe.

Os administradores de conta e metastore podem monitorar a cobertura de classificação, como o percentual de tabelas com detecções de dados confidenciais, na página Dados no Hub de Governança.

Importante

A Classificação de Dados do Databricks usa o armazenamento padrão para armazenar resultados de classificação. Você não é cobrado pelo armazenamento.

A Classificação de Dados do Databricks usa um LLM (modelo de linguagem grande) para ajudar na classificação.

Requisitos

  • Seu workspace deve ter a computação sem servidor disponível (habilitada por padrão em workspaces com o Catálogo do Unity).
  • Para habilitar a classificação de dados, você deve possuir o catálogo ou ter o MANAGE privilégio sobre ele.
  • Para ativar o tagueamento automático para um catálogo, você deve ter USE CATALOG no catálogo, APPLY TAG no catálogo e ASSIGN na tag que está sendo aplicada.
  • Para visualizar os resultados de classificação na interface, você deve ter um:
    • MANAGE no catálogo ou
    • READ METADATA no catálogo ou
    • USE CATALOG, USE SCHEMA, e SELECT no catálogo.
  • Para ver os valores de exemplo associados às detecções, você deve ter SELECT na tabela do sistema de resultados.

Observação

Por padrão, somente os administradores de conta possuem permissões MANAGE e ASSIGN para marcas governadas pelo sistema de classificação de dados. Administradores da conta podem conceder MANAGE e ASSIGN para marcas individuais governadas, destinadas a outros usuários, entidades de serviço ou grupos. Consulte Gerenciar permissões em tags gerenciadas.

Usar a classificação de dados

Você pode habilitar a classificação de dados para vários catálogos ao mesmo tempo na página de resultados ou configurar catálogos individuais com controle de nível de esquema mais granular.

Habilitar vários catálogos

  1. Na página de resultados da Classificação de Dados, clique em Configurar.
  2. Selecione os catálogos que você deseja habilitar ou selecione todos os catálogos disponíveis no workspace.
  3. Clique em Habilitar.

Habilitar todos os catálogos disponíveis não habilita automaticamente catálogos futuros. Para classificar um novo catálogo, retorne à caixa de diálogo Configurar e habilite-o.

Habilitar um único catálogo com seleção de esquema

Para controlar quais esquemas em um catálogo são verificados:

  1. Navegue até o catálogo e clique na guia Detalhes .

    Guia Detalhes da página do catálogo no Explorador de Catálogo.

  2. Ao lado da Classificação de Dados, clique no botão Habilitar .

  3. A caixa de diálogo Classificação de Dados é exibida. Use o menu suspenso Escopo do esquema para escolher quais esquemas verificar:

    • Todos os esquemas selecionados e futuros (padrão): verifica automaticamente os esquemas existentes e quaisquer novos esquemas criados no futuro. Desmarque a caixa de seleção ao lado de qualquer esquema existente que você deseja excluir da verificação.
    • Somente esquemas selecionados: verifica apenas os esquemas selecionados. Novos esquemas não são verificados até você adicioná-los à lista.

    Você também pode selecionar uma política de uso.

    Modal de configurações para Classificação de Dados.

  4. Clique em Salvar.

Isso cria um trabalho em segundo plano que examina incrementalmente todas as tabelas no catálogo ou esquemas selecionados.

O motor de classificação depende do scanner inteligente para determinar quando examinar uma tabela. As novas tabelas e colunas em um catálogo normalmente são verificadas dentro de 24 horas após a criação.

Acione manualmente uma varredura completa

Após a varredura inicial, você pode acionar manualmente uma varredura completa a qualquer momento. Uma varredura completa reavalia todas as tabelas nos esquemas e catálogos onde a classificação de dados está habilitada. Ele não escaneia esquemas que você excluiu ou não selecionou. A varredura aplica quaisquer classes recém-configuradas aos seus dados existentes e novos, e gera custos computacionais semelhantes à varredura inicial.

Para iniciar uma verificação completa de um catálogo:

  1. Navegue até o catálogo e clique na guia Detalhes .

  2. Ao lado de Classificação de Dados, clique em Ver resultados para abrir a Interface de Classificação de Dados.

  3. Por padrão, o catálogo é selecionado como escopo. Clique em Iniciar varredura completa.

    Acionar o botão de varredura completa na Interface de Classificação de Dados

Classificar opiniões

Importante

Esse recurso está em Beta. Para utilizar isso, o administrador do workspace deve ativar a Verificação de Visualização de Classificação de Dados na página Visualizações. Consulte Gerenciar visualizações do Azure Databricks.

Por padrão, a Classificação de Dados escaneia tabelas, tabelas de streaming e visualizações materializadas. Quando a varredura de visualização está ativada, a Classificação de Dados também escaneia as colunas das visualizações regulares do Catálogo Unity e classifica dados sensíveis nelas, usando os mesmos detectores e classes que aplica às tabelas.

Os resultados da classificação aparecem ao lado dos resultados da sua tabela, tanto na página de resultados de Classificação de Dados quanto na tabela do sistema de resultados.

Habilitar a varredura da exibição

Após um administrador do workspace ativar a prévia, todos os catálogos com Classificação de Dados ativada no workspace incluem visualizações na próxima varredura agendada.

Observação

Ativar a varredura de visualizações aumenta o custo de Classificação de Dados, pois as visualizações são escaneadas além das suas tabelas. O tamanho do aumento depende de quantas visualizações seus catálogos têm e de quão grandes e complexas elas são. A Databricks recomenda habilitar a verificação de visualizações primeiro em um workspace com catálogos menores, para observar o impacto nos custos antes de habilitá-la de forma mais ampla. Veja Ver custos da classificação de dados.

Ver limitações de varredura

  • Tags de classificação não são aplicadas por padrão às colunas de visualização. Ao contrário das tabelas, as vistas são classificadas, mas suas colunas não são marcadas com class.*, porque uma tag de classificação em uma visualização pode entrar em conflito com uma política existente de máscara de coluna ou filtro de linha e tornar a visualização não consultável. Se o ABAC on Views (Beta) estiver ativado, a marcação automática das colunas de visualização é suportada. Em qualquer dos casos, você recebe os resultados completos da classificação na página de resultados e na tabela do sistema de resultados.
  • Visões com definições inseguras não são escaneadas. Visões cujas definições utilizam operações inseguras, como funções legadas definidas pelo usuário do Metastore Hive, reflect(), e java_method(), não são escaneadas. Eles são reportados com o status UNSUPPORTED_VIEW_DEFINITION.
  • Visualizações métricas não são varreadas.Visualizações métricas são excluídas da varredura de visualização e não aparecem nos resultados de classificação de visualizações.

Exibir resultados de classificação

Para exibir os resultados da classificação, clique em Exibir resultados ao lado da configuração de Classificação de Dados .

Botão Exibir resultados para Classificação de Dados.

Isso abre a UI de classificação de dados para o catálogo. Para exibir os resultados da classificação, é necessário um SQL Warehouse sem servidor.

Você também pode exibir resultados agregados em todos os catálogos classificados no metastore usando o seletor de catálogo no canto superior esquerdo. Escolha Todos os catálogos no menu suspenso.

Use o filtro do framework de conformidade para limitar os resultados a classificações associadas a um framework específico de conformidade.

Para cada tipo de classificação, a tabela mostra:

  • Colunas detectadas: o número de colunas em que a classificação foi detectada.
  • Marcação automática: o status de marcação para essa classificação – Ativo ou Inativo. No modo de exibição metastore, um status de Parcialmente Ativo indica que a marcação está habilitada em alguns, mas não em todos os catálogos.
  • Estrutura de conformidade: As estruturas de conformidade associadas à classificação. Para detalhes sobre as classificações incluídas em cada estrutura, veja Referência do quadro de conformidade.
  • Acesso de usuários sem mascaramento (últimos 7 dias): A porcentagem de usuários que acessaram dados sem mascaramento dessa classificação nos últimos 7 dias. Use isso para avaliar a exposição de dados confidenciais em toda a sua organização.

Página de resultados mostrando a tabela de classes detectadas.

Examinar detecções

Para examinar os resultados de um tipo de classificação específico, clique em Examinar na coluna mais à direita. Um painel é exibido com duas guias:

  • Colunas Detectadas: exibe as colunas em que a tag de classificação foi detectada com alta confiança, ordenada pela detecção mais recente primeiro. Também inclui um gráfico de detecções ao longo do tempo e uma lista de colunas detectadas com valores de exemplo. Clique em qualquer barra no gráfico para ver as detecções específicas para essa data. Os valores de exemplo serão exibidos somente se você tiver as permissões necessárias para exibir os resultados da classificação.
  • Acesso do Usuário: Lista todos os usuários que acessaram colunas com essa marca de classificação, mostrando seu email e nome de usuário, juntamente com se eles têm acesso mascarado ou desmascarado. Também mostra todas as políticas de ABAC (controle de acesso baseado em atributo) atribuídas a essa marca de classificação. Ao exibir os resultados de um único catálogo, você pode criar uma nova política ABAC diretamente do painel.

Resultados mostrando colunas com classificações detectadas.

Se as colunas detectadas estiverem incorretas, você poderá clicar no ícone Excluir à direita da entrada. Consulte Excluir detecções.

Habilitar marcação automática

Se as colunas identificadas corresponderem às suas expectativas, você poderá habilitar a marcação automática para a etiqueta de classificação. Quando a marcação automática está habilitada, todas as detecções existentes e futuras dessa classificação são marcadas.

Você pode configurar a marcação automática em dois níveis:

  • Nível do Metastore: habilitar ou desabilitar em todos os catálogos ao mesmo tempo. Você deve ser um administrador do metastore e ter ASSIGN na tag que está sendo aplicada.
  • Nível de catálogo: habilitar ou desabilitar somente para o catálogo atual. As configurações no nível do catálogo têm precedência sobre a configuração no nível do metastore. Você deve ter USE CATALOG e APPLY TAG no catálogo, e ASSIGN na tag que está sendo aplicada.

No nível do catálogo, a marcação automática tem três estados:

  • Padrão (herdado): o catálogo herda a configuração de marcação do nível do metastore.
  • Ativo: a marcação está explicitamente habilitada para este catálogo, independentemente da configuração no nível do metastore.
  • Inativo: o tagueamento está desabilitado explicitamente para este catálogo, independentemente da configuração no nível do metastore.

Quando você desabilitar a marcação, nenhuma marca futura é aplicada, mas as marcas existentes não são removidas.

Observação

Quando você habilita a marcação automática, as marcas não são preenchidas novamente imediatamente. Eles serão preenchidos na próxima verificação, o que deve entrar em vigor em até 24 horas. As classificações subsequentes serão etiquetadas imediatamente.

Excluir detecções

Importante

As exclusões de detecção e seu uso para melhorar a precisão de classificação futura estão em Beta.

No painel de revisão, você pode excluir detecções de colunas individuais. Excluindo uma detecção:

  • Remova qualquer etiqueta de classificação existente dessa coluna.
  • Impede que verificações futuras reapliquem a marca a essa mesma coluna.
  • Fornece comentários que melhoram a precisão dos resultados de classificação futuros.

Para excluir uma detecção, clique no ícone Excluir da coluna correspondente no painel de revisão. Para incluir novamente a detecção, clique no ícone novamente.

Excluindo uma coluna individual da detecção.

A tabela do sistema de resultados

A classificação de dados cria uma tabela do sistema nomeada system.data_classification.results para armazenar resultados que, por padrão, são acessíveis apenas para o administrador da conta. O administrador da conta pode compartilhar essa tabela. A tabela só é acessível quando você usa computação sem servidor. Para obter detalhes sobre essa tabela, consulte a referência da tabela do sistema de classificação de dados.

Importante

A tabela system.data_classification.results de resultados contém todos os resultados de classificação em todo o metastore e inclui valores de exemplo de tabelas em cada catálogo. Você só deve compartilhar essa tabela com usuários com privilégios para ver os resultados de classificação em todo o metastore, incluindo valores de exemplo.

Os usuários com SELECT acesso a essa tabela também podem ver valores de exemplo associados a detecções na página de resultados da Classificação de Dados.

Configurar controles de governança com base nos resultados da classificação de dados

Mascarar dados confidenciais usando uma política ABAC

O Databricks recomenda usar o controle de acesso baseado em atributo no Catálogo do Unity para criar controles de governança com base nos resultados de classificação de dados.

Para criar uma política na página de resultados da Classificação de Dados, clique em Examinar uma marca de classificação, abra a guia Acesso do Usuário e clique em Nova política. O formulário da política é preenchido previamente para ocultar colunas com a marca de classificação que está sendo revisada. Para mascarar os dados, especifique qualquer função de mascaramento registrada no Catálogo do Unity e clique em Salvar.

Você também pode criar uma política que abrange várias tags de classificação, alterando quando a coluna para encontra a condição e fornecendo várias tags.

Por exemplo, para criar uma política chamada "Confidencial" que mascara qualquer nome, email ou número de telefone, defina que a atende à condição como has_tag("class.name") OR has_tag("class.email_address") OR has_tag("class.phone_number").

Descoberta e exclusão do GDPR

Este notebook de exemplo mostra como você pode usar a classificação de dados para ajudar na descoberta e exclusão de dados para conformidade com o RGPD.

Descoberta e exclusão de RGPD usando o notebook de classificação de dados

Obter laptop

Como lidar com etiquetas incorretas

Se uma classificação estiver incorreta, exclua a detecção do painel de revisão. Excluir uma detecção remove a marca, impede que ela seja reaplicada e melhora a precisão de verificações futuras. Consulte Excluir detecções.

Erros de escaneamento

Se ocorrerem erros durante a verificação, um botão Erros aparecerá no canto superior direito da tabela de resultados.

Página resultados com o botão Erros no canto superior direito da tabela.

Clique no botão para exibir as tabelas que falharam na verificação e nas mensagens de erro associadas.

Erros de varredura da tabela de classificação de dados.

Por padrão, as falhas que ocorreram para tabelas individuais são puladas e tentadas novamente no dia seguinte.

Exibir despesas de Classificação de Dados

Para entender como a Classificação de Dados é cobrada, consulte a página de preços. Você pode exibir despesas relacionadas à Classificação de Dados executando uma consulta ou exibindo o painel de uso.

Observação

A verificação inicial é mais dispendiosa do que as verificações subsequentes no mesmo catálogo, pois essas verificações são incrementais e normalmente incorrem em custos mais baixos.

Exibir o uso da tabela do sistema system.billing.usage

Você pode consultar as despesas de Classificação de Dados de system.billing.usage. Os campos created_by e catalog_id podem ser usados opcionalmente para dividir os custos:

  • created_by: inclua para visualizar os custos por usuário que iniciou o uso.
  • catalog_id: inclua para ver os custos por catálogo. A ID do catálogo é mostrada na system.data_classification.results tabela.

Exemplo de consulta para os últimos 30 dias:

SELECT
   usage_date,
   identity_metadata.created_by,
   usage_metadata.catalog_id,
   SUM(usage_quantity) AS dbus
FROM
   system.billing.usage
WHERE
   usage_date >= DATE_SUB(CURRENT_DATE(), 30)
  AND billing_origin_product = 'DATA_CLASSIFICATION'
GROUP BY
   usage_date,
   created_by,
   catalog_id
ORDER BY
   usage_date DESC,
   created_by;

Para calcular o custo total em dólares, combine com system.billing.list_prices. A consulta de exemplo a seguir usa um parâmetro nomeado :add_on_rate como multiplicador do preço de lista. Defina-o para 1 usar o preço de lista diretamente ou para um valor menor do que 1 para refletir um desconto negociado (por exemplo, 0.9 para um desconto de 10%).

Exemplo de consulta para o custo total do dólar nos últimos 30 dias:

SELECT
  u.usage_date,
  SUM(u.usage_quantity * lp.pricing.effective_list.default) * :add_on_rate
    AS `Data Classification Dollar Cost`
FROM system.billing.usage AS u
JOIN system.billing.list_prices AS lp
  ON lp.sku_name = u.sku_name
WHERE
  u.billing_origin_product = 'DATA_CLASSIFICATION'
  AND u.usage_end_time >= lp.price_start_time
  AND (lp.price_end_time IS NULL OR u.usage_end_time < lp.price_end_time)
  AND u.usage_date >= DATE_ADD(CURRENT_DATE(), -30)
GROUP BY
  u.usage_date
ORDER BY
  u.usage_date DESC;

Exibição do uso no painel de controle de uso

Se você já tiver um painel de uso configurado em seu workspace, poderá usá-lo para filtrar o uso selecionando o Projeto de Origem da Cobrança rotulado como "Classificação de Dados". Se você não tiver um painel de uso configurado, poderá importar um e aplicar a mesma filtragem. Para obter detalhes, consulte Dashboards de uso.

Etiquetas de classificação suportadas

Para obter uma lista completa de marcas com suporte organizadas por marcas globais, marcas regionais e estruturas de conformidade (PII, PCI DSS, GDPR, HIPAA, GLBA, DPDPA e PIPEDA), consulte marcas de classificação com suporte.

Limitações