Ulteriori informazioni sui tipi di informazioni riservate

L'identificazione e la classificazione degli elementi sensibili sotto il controllo dell'organizzazione è il primo passaggio della disciplina Information Protection. Microsoft Purview offre tre modi per identificare gli elementi in modo che possano essere classificati:

  • Manualmente, dagli utenti
  • tramite il riconoscimento automatico dei modelli, come con i tipi di informazioni sensibili
  • Tramite l'apprendimento automatico

I tipi di informazioni sensibili (SIT) sono classificatori basati su modelli. Rilevano informazioni sensibili come numeri di previdenza sociale, di carta di credito o di conto bancario per identificare gli elementi sensibili. Vedi Tipo di informazioni sensibili Definizioni di entità per un elenco completo di tutti i SIT.

Microsoft fornisce un gran numero di SIT preconfigurati oppure è possibile crearne uno personalizzato.

Licenze

La licenza E5 è necessaria per utilizzare i SIT per la scansione delle credenziali. Per un elenco di tutti i SIT per la scansione delle credenziali, vedere Tutti i tipi di informazioni sensibili per le credenziali. Questo SIT contiene tutti i SIT per l'analisi delle credenziali disponibili nel portale. Ogni membro di questo SIT è un SIT per la scansione delle credenziali e può essere usato come autonomo. Per un elenco di molti SIT creati da Microsoft, vedere Definizioni di entità del tipo di informazioni sensibili.

I tipi di informazioni sensibili sono usati in

Categorie di tipi di informazioni sensibili

Tipi di informazioni sensibili predefiniti

Microsoft ha creato questi SIT e vengono visualizzati nel portale Purview per impostazione predefinita. Questi SIT non possono essere modificati, ma è possibile usarli come modelli copiandoli per creare tipi di informazioni sensibili personalizzati. Per un elenco completo di tutti i SIT, vedi Definizioni delle entità di tipo di informazioni riservate .

Tipi di informazioni sensibili dell'entità con nome

I SIT delle entità denominate vengono visualizzati anche nel portale Purview per impostazione predefinita. Rilevano nomi di persone, indirizzi fisici e termini e condizioni mediche. Non possono essere modificati o copiati. Per altre informazioni, vedi Informazioni sulle entità denominate.

I SIT delle entità denominate sono di due tipi:

non in bundle

Questi SIT di entità denominate hanno uno scopo più ristretto, ad esempio un singolo paese o area geografica o una singola classe di termini. Usarli quando è necessario un criterio di prevenzione della perdita dei dati (DLP) con un ambito di rilevamento più ristretto. Vedi Esempi di SIT di entità denominate.

in bundle

I SIT di entità denominate in bundle rilevano tutte le possibili corrispondenze in una classe, ad esempio Tutti gli indirizzi fisici. Usarli come criteri generali nei criteri di prevenzione della perdita dei dati per il rilevamento di elementi sensibili. Vedi Esempi di SIT di entità denominate.

Consiglio

Se si vuole usare un SIT in bundle in un criterio DLP degli endpoint, è necessario abilitare l'analisi e la protezione avanzate della classificazione. Questo requisito è specifico per la combinazione di criteri SITS in bundle e endpoint DLP.

Tipi di informazioni sensibili personalizzati

Se i tipi di informazioni sensibili preconfigurati non soddisfano le proprie esigenze, è possibile creare tipi di informazioni riservate personalizzati definiti completamente oppure copiare uno di quelli predefiniti e modificarlo. Per ulteriori informazioni, vedere

Creare un tipo personalizzato di informazioni sensibili nel portale di Microsoft Purview.

I dati corrispondono esattamente ai tipi di informazioni sensibili

Tutti i SIT basati su EDM (Exact Data Match) vengono creati da zero. Viene usato per rilevare elementi con valori esatti, definiti in un database di informazioni riservate. Per altre informazioni, vedere Informazioni sui tipi di informazioni riservate basate sulla corrispondenza esatta dei dati.

Parti fondamentali di un tipo di informazione riservata

Ogni entità SIT (sensitive information type) è costituita dai campi seguenti:

  • Nome: Indica come viene indicato il tipo di informazioni sensibili.
  • Descrizione: Spiegazione di ciò che cerca il tipo di informazione sensibile.
  • Modello: Definisce ciò che rileva un SIT. È costituito dai seguenti componenti: elemento primario, elementi di supporto, livello di confidenza e prossimità.

La tabella seguente descrive ogni componente dei modelli usati nella definizione dei tipi di informazioni sensibili.

Componente del motivo Descrizione
Elemento primario L'elemento principale che il tipo di informazioni sensibili cerca. Può essere un'espressione regolare con o senza una convalida del checksum, un elenco di parole chiave, un dizionario di parole chiave o una funzione. Ognuno di questi tipi di elementi può essere selezionato dall'elenco dei SIT esistenti o può essere definito in modo personalizzato da un utente con autorizzazioni di amministratore. Una volta definito, un elemento viene visualizzato nell'elenco degli elementi esistenti, insieme a quelli incorporati.
Elemento portante Un elemento che funge da prova corroborante. Se inclusi, gli elementi di supporto aiutano ad aumentare il livello di confidenza rispetto all'accuratezza delle corrispondenze rilevate. Ad esempio, se l'elemento primario è definito come SSN (composto da nove cifre) e la parola chiave Numero di previdenza sociale (SSN) viene utilizzata come elemento di supporto quando si trova in prossimità di SSN, la certezza che il SSN valore rilevato sia veramente un numero di previdenza sociale è maggiore rispetto a quando la parola chiave Numero di previdenza sociale (SSN) non è presente.

Un elemento di supporto può essere un'espressione regolare (con o senza una convalida del checksum), un elenco di parole chiave o un dizionario di parole chiave.
Livello di sicurezza Esistono tre livelli di confidenza per le corrispondenze rilevate: alta, media e bassa. Il livello di confidenza riflette la quantità di prove a sostegno rilevate insieme all'elemento primario. Maggiore è il numero di prove a sostegno contenute in un elemento rilevato, maggiore è la probabilità che un elemento corrispondente contenga le informazioni sensibili che stai cercando. Per altre informazioni sui livelli di confidenza, vedere il video incluso più avanti in questo articolo.
Prossimità Specifica la vicinanza di un elemento di supporto a un elemento primario, in termini di numero di caratteri tra di essi.

Informazioni sulla prossimità

Il diagramma seguente illustra il funzionamento del rilevamento delle corrispondenze in relazione alla prossimità. In questo esempio l'elemento primario è il SSN campo e la definizione SIT richiede che ogni istanza di un SSN valore si trovi in prossimità di almeno uno degli elementi seguenti:

  • AccountNumber
  • Name
  • DateOfBirth

Nel diagramma vediamo che i dati controllati includono tre diverse istanze del SSN campo: SSN1, SSN2, SSN3e SSN4.

Diagramma delle prove corroborative e della finestra di prossimità .

Per capire come funziona la prossimità, iniziamo dando un'occhiata ad alcuni criteri di rilevamento campione. Qui, vogliamo rilevare numeri di previdenza sociale a nove cifre. I criteri di rilevamento richiedono che un'espressione regolare di nove cifre (elemento primario) si trovi insieme a prove a supporto (tra i AccountNumbercampi, Name, e DateOfBirth ) che appaiono entro 250 caratteri (la prossimità).

Come illustrato nel diagramma, solo gli elementi SSN1 primari soddisfano SSN4 i criteri di rilevamento descritti. Contenuto della sezione:

  • Nel caso di SSN1, il AccountNumber valore rientra nella finestra di prossimità specificata di 250 caratteri, quindi viene rilevata una corrispondenza.
  • In entrambi i casi di SSN2 e SSN3, nessuno degli elementi di supporto si trova entro 250 caratteri dall'elemento primario, quindi tali valori non vengono rilevati come corrispondenza. Tuttavia, esaminando la finestra di prossimità nel SSN2 diagramma, ci si potrebbe chiedere: perché non c'è una corrispondenza per SSN2? La finestra di prossimità non SSN2 si estende fino all'elemento Name ? Questa è una buona domanda. La risposta è: non proprio. Anche se la finestra di prossimità si estende fino alName valore, non include l'intero valore, quindi il motivo non corrisponde.
  • Infine, nel caso di , ci sono due elementi di supporto all'interno della finestra di SSN4prossimità, entrambi Name e DateOfBirth, quindi anche questo modello corrisponde.

Questo breve video spiega di più sui livelli di confidenza.

Esempio di tipo di informazioni sensibili

Numero di carta di identità (DNI) argentino

Formato

Otto cifre separate da spazi

Criterio

Otto cifre

  • Due cifre
  • un punto
  • tre cifre
  • un punto
  • tre cifre
Checksum

No

Definizione

Un criterio DLP ha una confidenza media di aver rilevato questo tipo di informazioni sensibili se, entro una prossimità di 250 caratteri:

  • L'espressione regolare trova Regex_argentina_national_id contenuto che corrisponde al modello.
  • Viene trovata una parola chiave Keyword_argentina_national_id.
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
   <Pattern confidenceLevel="75">
      <IdMatch idRef="Regex_argentina_national_id"/>
      <Match idRef="Keyword_argentina_national_id"/>
  </Pattern>
</Entity>
Parole chiave
Keyword_argentina_national_id
  • Argentina - Numero di identità nazionale
  • Identità
  • Carta d'identità nazionale
  • DNI
  • Registro nazionale delle persone (NIC)
  • Documento Nacional de Identidad
  • Registro Nacional de las Personas
  • Identidad
  • Identificación

Altre informazioni sui livelli di confidenza

In una definizione di entità di tipo di informazioni riservate, il livello di confidenza riflette la quantità di prove a supporto rilevate oltre all'elemento primario. Maggiore è il numero di prove a sostegno contenute in un elemento, maggiore è la probabilità che un elemento corrispondente contenga le informazioni sensibili che stai cercando. Ad esempio, le corrispondenze con un alto livello di confidenza contengono più prove a sostegno in prossimità dell'elemento primario, mentre le corrispondenze con un basso livello di confidenza conterrebbero poca o nessuna prova a supporto nelle immediate vicinanze.

Un livello di confidenza elevato restituisce il minor numero di falsi positivi, ma potrebbe produrre più falsi negativi. Livelli di confidenza bassi o medi restituiscono più falsi positivi ma pochi o zero falsi negativi.

  • bassa confidenza: gli elementi corrispondenti contengono il minor numero di falsi negativi, ma il maggior numero di falsi positivi. L'attendibilità bassa restituisce tutte le corrispondenze con l'affidabilità bassa, media e alta. Il livello di confidenza basso ha un valore di 65.
  • Affidabilità media: gli elementi corrispondenti contengono un numero medio di falsi positivi e falsi negativi. L'attendibilità media restituisce tutte le corrispondenze con confidenza media e alta. Il livello di confidenza medio ha un valore di 75.
  • Alta confidenza: gli elementi corrispondenti contengono il minor numero di falsi positivi ma il maggior numero di falsi negativi. L'alta confidenza restituisce solo corrispondenze ad alta confidenza e ha un valore di 85.

È consigliabile usare modelli con alto livello di confidenza con conteggi bassi, ad esempio da cinque a 10, e modelli a bassa confidenza con conteggi più alti, ad esempio 20 o più.

Nota

Se sono stati definiti criteri esistenti o tipi di informazioni sensibili (SIT) usando livelli di attendibilità basati su numeri (noti anche come accuratezza), verranno automaticamente mappati ai tre livelli di attendibilità distinti; Bassa confidenza, media confidenza e alta confidenza, nell'interfaccia utente di Security @ Compliance Center.

  • Tutti i criteri con accuratezza minima o modelli SIT personalizzati con livelli di confidenza compresi tra 76 e 100 verranno mappati all'alta confidenza.
  • Tutti i criteri con accuratezza minima o modelli SIT personalizzati con livelli di confidenza compresi tra 66 e 75 verranno mappati a confidenza media.
  • Tutti i criteri con accuratezza minima o i modelli SIT personalizzati con livelli di confidenza minori o uguali a 65 verranno mappati a bassa confidenza.

Creazione dei tipi di informazioni sensibili personalizzati

È possibile scegliere tra diverse opzioni per creare tipi di informazioni sensibili personalizzati.

Ottimizzazione dei classificatori addestrabili

La prevenzione della perdita dei dati degli endpoint classifica i file in base a tutti i tipi di informazioni riservate disponibili nel tenant, inclusi i tipi di informazioni sensibili personalizzati, indipendentemente dal loro utilizzo in qualsiasi criterio di prevenzione della perdita dei dati. Ciò può causare un traffico di classificazione eccessivo se i tipi di informazioni sensibili non sono ottimizzati correttamente e finiscono per corrispondere a molti file. È consigliabile ottimizzare tutti i tipi di informazioni riservate personalizzate. A tale scopo, rimuovere i tipi di informazioni riservate inutilizzati e riprogettare i SIT se corrispondono alla maggior parte dei file nell'organizzazione. Per indicazioni sull'utilizzo delle convalide SIT Regex per ottimizzare i SIT, vedere: Tipo di informazioni riservate Convalide REGEX e controllo aggiuntivo

Supporto del set di caratteri a doppio byte

Livelli di confidenza migliorati sono disponibili per l'uso immediato all'interno dei servizi di Prevenzione della perdita dei dati Microsoft Purview, protezione delle informazioni, conformità delle comunicazioni, gestione del ciclo di vita dei dati e gestione dei record.

  • Information Protection ora supporta il set di caratteri a doppio byte per le lingue seguenti:
  • Cinese (semplificato)
  • Cinese (tradizionale)
  • Coreano
  • Giapponese

Il supporto è disponibile per i tipi di informazioni sensibili. Per ulteriori informazioni, vedere Supporto della protezione delle informazioni per le note di rilascio dei set di caratteri a byte doppio.

Supporto per set di caratteri a byte singolo

Per rilevare modelli contenenti caratteri cinesi/giapponesi e caratteri a byte singolo o per rilevare modelli contenenti caratteri cinesi/giapponesi e inglesi, definire due varianti della parola chiave o dell'espressione regolare.

Ad esempio, per rilevare una parola chiave come "机密的document", usare due varianti della parola chiave: una con uno spazio tra il testo giapponese e quello inglese e un'altra senza spazio tra il testo giapponese e quello inglese. Quindi, le parole chiave da aggiungere nel SIT devono essere "机密的 document" e "机密的document". Analogamente, per rilevare la frase "東京オリンピック2020", devono essere usate due varianti: "東京オリンピック 2020" e "東京オリンピック2020".

Oltre ai caratteri cinese/giapponese/a doppio byte, se l'elenco di parole chiave/frasi contiene anche parole non cinesi/giapponesi (ad esempio, solo in inglese), è necessario creare due dizionari/elenchi di parole chiave. Uno per le parole chiave contenenti caratteri cinese/giapponese/a doppio byte e un altro per le parole chiave solo in inglese. Ad esempio, se si vuole creare un dizionario/elenco di parole chiave con tre frasi "Altamente riservato", "機密性が高い" e "机密的document", è necessario creare due elenchi di parole chiave.

  • Estremamente riservato
  • 機密性が高い, 机密的document e 机密的 document Durante la creazione di un'espressione regolare usando un trattino a byte doppio o un punto a byte doppio, assicurati di eseguire l'escape di entrambi i caratteri come faresti con un trattino o un punto in un'espressione regolare. Ecco un esempio di regex di riferimento: (?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}

È consigliabile usare la corrispondenza di stringa invece della corrispondenza di parole in un elenco di parole chiave.

Differenze di rilevamento tra i carichi di lavoro

Lo stesso tipo di informazioni sensibili può produrre risultati diversi a seconda della posizione in cui viene valutato il contenuto, ad esempio la posta elettronica in transito (Exchange), i file inattivi (SharePoint e OneDrive) e i file nei dispositivi gestiti (Endpoint DLP). La prevenzione della perdita dei dati degli endpoint classifica i file in base a tutti i tipi di informazioni sensibili disponibili nel tenant e l'uso di un SIT in bundle in un criterio DLP degli endpoint richiede la scansione e la protezione della classificazione avanzata.

Prima di affidarsi a un SIT personalizzato in produzione, testarlo e convalidare il rilevamento in ogni carico di lavoro in cui si intende usarlo, ad esempio una regola del flusso di posta, un criterio di SharePoint o OneDrive e un criterio endpoint. Il rilevamento può anche essere influenzato dai limiti di estrazione dei contenuti, come la dimensione massima del file e il numero di caratteri scansionati; vedere Considerazioni sulla piattaforma DLP.

Tipo di informazioni sensibili di test

È possibile testare SIT caricando un file di esempio. I risultati del test mostrano il numero di corrispondenze per ogni livello di confidenza. È possibile testare SIT predefiniti, SIT personalizzati, classificatori sottoponibili a training e corrispondenza esatta dei dati.

Testare il tipo di informazioni sensibili predefinite e personalizzate

Testare la corrispondenza esatta dei dati con il tipo di informazioni riservate.

Per testare un tenant SIT personalizzato o predefinito, è necessario che al tenant sia aggiunta almeno una licenza di Exchange Online. In caso contrario, l'opzione Test SIT sarà disattivata quando viene selezionato un SIT qualsiasi.

Fornire feedback sull'accuratezza della corrispondenza/non corrispondenza nei tipi di informazioni sensibili

È possibile visualizzare il numero di corrispondenze di un SIT in Tipi di informazioni sensibili ed Esplora contenuto. Puoi anche fornire un feedback sul fatto che un elemento sia effettivamente una corrispondenza o meno usando il meccanismo di feedback Corrispondenza, non corrispondenza e usare tale feedback per ottimizzare i SIT. Per altre informazioni, vedere Aumentare l'accuratezza del classificatore.

Per ulteriori informazioni

Per informazioni su come usare i tipi di informazioni riservate per rispettare le normative sulla privacy dei dati, vedere Distribuire la protezione delle informazioni per le normative sulla privacy dei dati con Microsoft 365 (aka.ms/m365dataprivacy).