Comece com classificadores treináveis

Um classificador treinável do Microsoft Purview é uma ferramenta que você pode treinar para reconhecer vários tipos de conteúdo, fornecendo amostras para avaliação. Depois de treinado, você pode usá-lo para identificar itens para aplicação de rótulos de confidencialidade do Office, políticas de conformidade de comunicações e políticas de rótulos de retenção.

A implementação de um classificador treinável personalizado requer duas etapas:

  1. Forneça dois conjuntos de dados de amostra (selecionados por humanos).
    1. Um conjunto que contém somente os itens que pertencem à categoria.
    2. Um conjunto que contém somente os itens que não pertencem à categoria.
  2. Teste a capacidade do classificador de detectar correspondências.

Este artigo explica como criar e testar um classificador personalizado.

Para obter mais informações sobre os diferentes tipos de classificadores, consulte Saiba mais sobre classificadores treináveis.

Importante

A Conformidade de Comunicações do Microsoft Purview dá suporte apenas ao uso dos classificadores treináveis fornecidos pela Microsoft. Não há suporte para classificadores treináveis personalizados.

Pré-requisitos

Licenciamento

Para obter informações sobre licenciamento, consulte

Permissões

Para usar classificadores nos seguintes cenários, você precisa das seguintes permissões:

Cenário Permissões de função necessárias
Política de rótulo de retenção Gerenciamento de registros
Gerenciamento de retenção
Política do rótulo de confidencialidade Administrador de Segurança
Administrador de Conformidade
Administrador de Dados de Conformidade
Política de conformidade de comunicações Administrador de Gerenciamento de Risco Interno
Administrador de Revisão de Supervisão

Importante

Por padrão, somente o usuário que cria um classificador personalizado pode treiná-lo e revisar as previsões feitas por esse classificador.

Prepare-se para um classificador treinável personalizado

Antes de criar um classificador treinável personalizado, é útil entender o que está envolvido.

Fluxo de trabalho geral

Para obter mais informações sobre o fluxo de trabalho geral de criação de classificadores treináveis personalizados, consulte o fluxo de processo para criar classificadores treináveis personalizados.

Conteúdo de semeadura

Para garantir que seu classificador treinável possa identificar de forma independente e precisa que um item pertence a uma determinada categoria de conteúdo, você deve apresentá-lo com muitos exemplos do tipo de conteúdo que está na categoria. Essa alimentação de amostras para o classificador treinável é conhecida como semeadura. Um humano deve selecionar o conteúdo da semente, e esse conteúdo deve incluir dois conjuntos de dados: um conjunto contém apenas itens que representam fortemente o conteúdo que o classificador foi projetado para detectar (amostras positivas) e um segundo conjunto contém itens que claramente não pertencem (amostras negativas).

Você precisa de pelo menos 50 amostras positivas (até 500) e pelo menos 150 amostras negativas (até 1.500) para treinar um classificador. Quanto mais amostras você fornecer, mais precisas serão as previsões feitas pelo classificador. O classificador treinável processa até 2.000 exemplos criados mais recentemente (por carimbo de data/hora de criação de arquivo).

Dica

Para obter melhores resultados, tenha pelo menos 200 itens em seu conjunto de amostras de teste que inclua pelo menos 50 exemplos positivos e pelo menos 150 exemplos negativos.

Como criar um classificador treinável

Na visualização: O processo a seguir automatiza o teste de classificadores treináveis e reduz o fluxo de trabalho de criação de 12 dias para dois dias. Em alguns casos, o processo pode levar apenas algumas horas.

  1. Colete entre 50 e 500 itens de conteúdo de semente que representem fortemente os dados que você deseja que o classificador identifique positivamente como estando na categoria. Para obter uma lista de tipos de arquivo com suporte, consulte Extensões de nome de arquivo rastreadas padrão e tipos de arquivo analisados no Servidor do SharePoint.

    Observação

    Ao propagar conteúdo para treinamento ou testar classificadores treináveis personalizados, há suporte apenas para arquivos baseados em texto. Não é possível usar arquivos de imagem ou PDFs somente de imagem.

  2. Colete um segundo conjunto de conteúdo de sementes (de 150 a 1.500 itens) que represente dados que não pertencem à categoria.

  3. Coloque o conteúdo inicial positivo e negativo em pastas separadas do SharePoint. Use um site de Comunicação ou outro tipo de site do SharePoint, mas não um tipo de pasta do Teams ou uma pasta do OneDrive. Cada pasta deve ser dedicada a conter apenas o conteúdo da semente. Anote o URL do site, da biblioteca e da pasta de cada conjunto.

    Dica

    Se você criar um novo site e pasta do SharePoint para seus dados de semente, aguarde pelo menos uma hora para que esse local seja indexado antes de criar o classificador treinável que usa esses dados de semente.

  4. Entre no portal do Microsoft Purview com acesso à função de administrador de conformidade ou administrador de segurança e navegue até Prevenção> contra perda dedados Classificação>de dados.

Importante

A conta que você usa deve ter acesso às pastas de conteúdo de propagação no SharePoint.

  1. Selecione a guia Classificadores treináveis .

  2. Selecione Criar classificador treinável.

  3. Adicione a fonte de seus exemplos positivos : selecione o site, a biblioteca e a URL da pasta do SharePoint para o conteúdo de semente que o classificador deve detectar e escolha Avançar.

  4. Adicione a origem de seus exemplos negativos : selecione o site, a biblioteca e a URL da pasta do SharePoint para o conteúdo de semente que o classificador deve ignorar e escolha Avançar.

  5. Examine as configurações e selecione Criar classificador treinável.

  6. Dentro de 24 horas ou menos, o classificador treinável processa os dados de semente e cria um modelo de previsão. O status do classificador estará Em andamento enquanto processa os dados iniciais. Quando o classificador termina de processar os dados de semente, as alterações de status para Treinamento são concluídas e os itens foram testados.

  7. Quando o treinamento for concluído e os itens forem testados (automaticamente), publique o classificador escolhendo Publicar para uso.

Depois de publicar seu classificador, ele estará disponível como uma condição no Office rotulagem automática com rótulos de confidencialidade, aplicação automática de política de rótulo de retenção com base em uma condição e em Conformidade de comunicação.

Testar o classificador

Depois que o classificador treinável processar amostras positivas e negativas suficientes para criar um modelo de previsão, teste as previsões que ele faz. Ao testar o classificador, você verifica se suas previsões estão corretas. Depois que o classificador processar todos os dados, você poderá examinar os resultados para verificar se cada previsão está correta, incorreta ou incerta. A Microsoft usa esses comentários agregados para melhorar o modelo de previsão.

Confira também