Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
L'identificazione e la classificazione degli elementi sensibili sotto il controllo dell'organizzazione è il primo passaggio della disciplina Information Protection. Microsoft Purview offre tre modi per identificare gli elementi in modo che possano essere classificati:
- Manualmente, dagli utenti
- tramite il riconoscimento automatico dei modelli, come con i tipi di informazioni sensibili
- Tramite l'apprendimento automatico
I tipi di informazioni sensibili (SIT) sono classificatori basati su modelli. Rilevano informazioni sensibili come numeri di previdenza sociale, di carta di credito o di conto bancario per identificare gli elementi sensibili. Vedi Tipo di informazioni sensibili Definizioni di entità per un elenco completo di tutti i SIT.
Microsoft fornisce un gran numero di SIT preconfigurati oppure è possibile crearne uno personalizzato.
Licenze
La licenza E5 è necessaria per utilizzare i SIT per la scansione delle credenziali. Per un elenco di tutti i SIT per la scansione delle credenziali, vedere Tutti i tipi di informazioni sensibili per le credenziali. Questo SIT contiene tutti i SIT per l'analisi delle credenziali disponibili nel portale. Ogni membro di questo SIT è un SIT per la scansione delle credenziali e può essere usato come autonomo. Per un elenco di molti SIT creati da Microsoft, vedere Definizioni di entità del tipo di informazioni sensibili.
I tipi di informazioni sensibili sono usati in
- Prevenzione della perdita dei dati di Microsoft Purview Criteri di Microsoft Purview
- Etichette di riservatezza
- Etichette di conservazione
- Gestione dei rischi Insider
- Conformità delle comunicazioni
- Criteri di etichetta automatica
- Microsoft Priva
Categorie di tipi di informazioni sensibili
Tipi di informazioni sensibili predefiniti
Microsoft ha creato questi SIT e vengono visualizzati nel portale Purview per impostazione predefinita. Questi SIT non possono essere modificati, ma è possibile usarli come modelli copiandoli per creare tipi di informazioni sensibili personalizzati. Per un elenco completo di tutti i SIT, vedi Definizioni delle entità di tipo di informazioni riservate .
Tipi di informazioni sensibili dell'entità con nome
I SIT delle entità denominate vengono visualizzati anche nel portale Purview per impostazione predefinita. Rilevano nomi di persone, indirizzi fisici e termini e condizioni mediche. Non possono essere modificati o copiati. Per altre informazioni, vedi Informazioni sulle entità denominate.
I SIT delle entità denominate sono di due tipi:
non in bundle
Questi SIT di entità denominate hanno uno scopo più ristretto, ad esempio un singolo paese o area geografica o una singola classe di termini. Usarli quando è necessario un criterio di prevenzione della perdita dei dati (DLP) con un ambito di rilevamento più ristretto. Vedi Esempi di SIT di entità denominate.
in bundle
I SIT di entità denominate in bundle rilevano tutte le possibili corrispondenze in una classe, ad esempio Tutti gli indirizzi fisici. Usarli come criteri generali nei criteri di prevenzione della perdita dei dati per il rilevamento di elementi sensibili. Vedi Esempi di SIT di entità denominate.
Consiglio
Se si vuole usare un SIT in bundle in un criterio DLP degli endpoint, è necessario abilitare l'analisi e la protezione avanzate della classificazione. Questo requisito è specifico per la combinazione di criteri SITS in bundle e endpoint DLP.
Tipi di informazioni sensibili personalizzati
Se i tipi di informazioni sensibili preconfigurati non soddisfano le proprie esigenze, è possibile creare tipi di informazioni riservate personalizzati definiti completamente oppure copiare uno di quelli predefiniti e modificarlo. Per ulteriori informazioni, vedere
Creare un tipo personalizzato di informazioni sensibili nel portale di Microsoft Purview.
I dati corrispondono esattamente ai tipi di informazioni sensibili
Tutti i SIT basati su EDM (Exact Data Match) vengono creati da zero. Viene usato per rilevare elementi con valori esatti, definiti in un database di informazioni riservate. Per altre informazioni, vedere Informazioni sui tipi di informazioni riservate basate sulla corrispondenza esatta dei dati.
Parti fondamentali di un tipo di informazione riservata
Ogni entità SIT (sensitive information type) è costituita dai campi seguenti:
- Nome: Indica come viene indicato il tipo di informazioni sensibili.
- Descrizione: Spiegazione di ciò che cerca il tipo di informazione sensibile.
- Modello: Definisce ciò che rileva un SIT. È costituito dai seguenti componenti: elemento primario, elementi di supporto, livello di confidenza e prossimità.
La tabella seguente descrive ogni componente dei modelli usati nella definizione dei tipi di informazioni sensibili.
| Componente del motivo | Descrizione |
|---|---|
| Elemento primario | L'elemento principale che il tipo di informazioni sensibili cerca. Può essere un'espressione regolare con o senza una convalida del checksum, un elenco di parole chiave, un dizionario di parole chiave o una funzione. Ognuno di questi tipi di elementi può essere selezionato dall'elenco dei SIT esistenti o può essere definito in modo personalizzato da un utente con autorizzazioni di amministratore. Una volta definito, un elemento viene visualizzato nell'elenco degli elementi esistenti, insieme a quelli incorporati. |
| Elemento portante | Un elemento che funge da prova corroborante. Se inclusi, gli elementi di supporto aiutano ad aumentare il livello di confidenza rispetto all'accuratezza delle corrispondenze rilevate. Ad esempio, se l'elemento primario è definito come SSN (composto da nove cifre) e la parola chiave Numero di previdenza sociale (SSN) viene utilizzata come elemento di supporto quando si trova in prossimità di SSN, la certezza che il SSN valore rilevato sia veramente un numero di previdenza sociale è maggiore rispetto a quando la parola chiave Numero di previdenza sociale (SSN) non è presente. Un elemento di supporto può essere un'espressione regolare (con o senza una convalida del checksum), un elenco di parole chiave o un dizionario di parole chiave. |
| Livello di sicurezza | Esistono tre livelli di confidenza per le corrispondenze rilevate: alta, media e bassa. Il livello di confidenza riflette la quantità di prove a sostegno rilevate insieme all'elemento primario. Maggiore è il numero di prove a sostegno contenute in un elemento rilevato, maggiore è la probabilità che un elemento corrispondente contenga le informazioni sensibili che stai cercando. Per altre informazioni sui livelli di confidenza, vedere il video incluso più avanti in questo articolo. |
| Prossimità | Specifica la vicinanza di un elemento di supporto a un elemento primario, in termini di numero di caratteri tra di essi. |
Informazioni sulla prossimità
Il diagramma seguente illustra il funzionamento del rilevamento delle corrispondenze in relazione alla prossimità. In questo esempio l'elemento primario è il SSN campo e la definizione SIT richiede che ogni istanza di un SSN valore si trovi in prossimità di almeno uno degli elementi seguenti:
-
AccountNumber -
Name DateOfBirth
Nel diagramma vediamo che i dati controllati includono tre diverse istanze del SSN campo: SSN1, SSN2, SSN3e SSN4.
Per capire come funziona la prossimità, iniziamo dando un'occhiata ad alcuni criteri di rilevamento campione. Qui, vogliamo rilevare numeri di previdenza sociale a nove cifre. I criteri di rilevamento richiedono che un'espressione regolare di nove cifre (elemento primario) si trovi insieme a prove a supporto (tra i AccountNumbercampi, Name, e DateOfBirth ) che appaiono entro 250 caratteri (la prossimità).
Come illustrato nel diagramma, solo gli elementi SSN1 primari soddisfano SSN4 i criteri di rilevamento descritti. Contenuto della sezione:
- Nel caso di
SSN1, ilAccountNumbervalore rientra nella finestra di prossimità specificata di 250 caratteri, quindi viene rilevata una corrispondenza. - In entrambi i casi di
SSN2eSSN3, nessuno degli elementi di supporto si trova entro 250 caratteri dall'elemento primario, quindi tali valori non vengono rilevati come corrispondenza. Tuttavia, esaminando la finestra di prossimità nelSSN2diagramma, ci si potrebbe chiedere: perché non c'è una corrispondenza perSSN2? La finestra di prossimità nonSSN2si estende fino all'elementoName? Questa è una buona domanda. La risposta è: non proprio. Anche se la finestra di prossimità si estende fino alNamevalore, non include l'intero valore, quindi il motivo non corrisponde. - Infine, nel caso di , ci sono due elementi di supporto all'interno della finestra di
SSN4prossimità, entrambiNameeDateOfBirth, quindi anche questo modello corrisponde.
Questo breve video spiega di più sui livelli di confidenza.
Esempio di tipo di informazioni sensibili
Numero di carta di identità (DNI) argentino
Formato
Otto cifre separate da spazi
Criterio
Otto cifre
- Due cifre
- un punto
- tre cifre
- un punto
- tre cifre
Checksum
No
Definizione
Un criterio DLP ha una confidenza media di aver rilevato questo tipo di informazioni sensibili se, entro una prossimità di 250 caratteri:
- L'espressione regolare trova Regex_argentina_national_id contenuto che corrisponde al modello.
- Viene trovata una parola chiave Keyword_argentina_national_id.
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
<Pattern confidenceLevel="75">
<IdMatch idRef="Regex_argentina_national_id"/>
<Match idRef="Keyword_argentina_national_id"/>
</Pattern>
</Entity>
Parole chiave
Keyword_argentina_national_id
- Argentina - Numero di identità nazionale
- Identità
- Carta d'identità nazionale
- DNI
- Registro nazionale delle persone (NIC)
- Documento Nacional de Identidad
- Registro Nacional de las Personas
- Identidad
- Identificación
Altre informazioni sui livelli di confidenza
In una definizione di entità di tipo di informazioni riservate, il livello di confidenza riflette la quantità di prove a supporto rilevate oltre all'elemento primario. Maggiore è il numero di prove a sostegno contenute in un elemento, maggiore è la probabilità che un elemento corrispondente contenga le informazioni sensibili che stai cercando. Ad esempio, le corrispondenze con un alto livello di confidenza contengono più prove a sostegno in prossimità dell'elemento primario, mentre le corrispondenze con un basso livello di confidenza conterrebbero poca o nessuna prova a supporto nelle immediate vicinanze.
Un livello di confidenza elevato restituisce il minor numero di falsi positivi, ma potrebbe produrre più falsi negativi. Livelli di confidenza bassi o medi restituiscono più falsi positivi ma pochi o zero falsi negativi.
- bassa confidenza: gli elementi corrispondenti contengono il minor numero di falsi negativi, ma il maggior numero di falsi positivi. L'attendibilità bassa restituisce tutte le corrispondenze con l'affidabilità bassa, media e alta. Il livello di confidenza basso ha un valore di 65.
- Affidabilità media: gli elementi corrispondenti contengono un numero medio di falsi positivi e falsi negativi. L'attendibilità media restituisce tutte le corrispondenze con confidenza media e alta. Il livello di confidenza medio ha un valore di 75.
- Alta confidenza: gli elementi corrispondenti contengono il minor numero di falsi positivi ma il maggior numero di falsi negativi. L'alta confidenza restituisce solo corrispondenze ad alta confidenza e ha un valore di 85.
È consigliabile usare modelli con alto livello di confidenza con conteggi bassi, ad esempio da cinque a 10, e modelli a bassa confidenza con conteggi più alti, ad esempio 20 o più.
Nota
Se sono stati definiti criteri esistenti o tipi di informazioni sensibili (SIT) usando livelli di attendibilità basati su numeri (noti anche come accuratezza), verranno automaticamente mappati ai tre livelli di attendibilità distinti; Bassa confidenza, media confidenza e alta confidenza, nell'interfaccia utente di Security @ Compliance Center.
- Tutti i criteri con accuratezza minima o modelli SIT personalizzati con livelli di confidenza compresi tra 76 e 100 verranno mappati all'alta confidenza.
- Tutti i criteri con accuratezza minima o modelli SIT personalizzati con livelli di confidenza compresi tra 66 e 75 verranno mappati a confidenza media.
- Tutti i criteri con accuratezza minima o i modelli SIT personalizzati con livelli di confidenza minori o uguali a 65 verranno mappati a bassa confidenza.
Creazione dei tipi di informazioni sensibili personalizzati
È possibile scegliere tra diverse opzioni per creare tipi di informazioni sensibili personalizzati.
Usare l'interfaccia utente : è possibile configurare un tipo personalizzato di informazioni riservate usando l'interfaccia utente del portale Purview. Con questo metodo, è possibile usare espressioni regolari, parole chiave e dizionari di parole chiave. Per saperne di più, vedere Creare un tipo di informazioni sensibili personalizzato.
Usare EDM : è possibile configurare tipi personalizzati di informazioni riservate usando la classificazione basata su EDM (Exact Data Match). Questo metodo consente di creare un tipo di informazioni sensibili dinamico usando un database protetto che è possibile aggiornare periodicamente. Vedere Informazioni sulla corrispondenza esatta dei dati in base sui tipi di informazioni sensibili.
Usare PowerShell : è possibile configurare tipi personalizzati di informazioni riservate usando PowerShell. Anche se questo metodo è più complesso rispetto all'utilizzo dell'interfaccia utente, offre più opzioni di configurazione. Vedere Creare un tipo personalizzato di informazioni sensibili in PowerShell per la sicurezza & la conformità.
Ottimizzazione dei classificatori addestrabili
La prevenzione della perdita dei dati degli endpoint classifica i file in base a tutti i tipi di informazioni riservate disponibili nel tenant, inclusi i tipi di informazioni sensibili personalizzati, indipendentemente dal loro utilizzo in qualsiasi criterio di prevenzione della perdita dei dati. Ciò può causare un traffico di classificazione eccessivo se i tipi di informazioni sensibili non sono ottimizzati correttamente e finiscono per corrispondere a molti file. È consigliabile ottimizzare tutti i tipi di informazioni riservate personalizzate. A tale scopo, rimuovere i tipi di informazioni riservate inutilizzati e riprogettare i SIT se corrispondono alla maggior parte dei file nell'organizzazione. Per indicazioni sull'utilizzo delle convalide SIT Regex per ottimizzare i SIT, vedere: Tipo di informazioni riservate Convalide REGEX e controllo aggiuntivo
Supporto del set di caratteri a doppio byte
Livelli di confidenza migliorati sono disponibili per l'uso immediato all'interno dei servizi di Prevenzione della perdita dei dati Microsoft Purview, protezione delle informazioni, conformità delle comunicazioni, gestione del ciclo di vita dei dati e gestione dei record.
- Information Protection ora supporta il set di caratteri a doppio byte per le lingue seguenti:
- Cinese (semplificato)
- Cinese (tradizionale)
- Coreano
- Giapponese
Il supporto è disponibile per i tipi di informazioni sensibili. Per ulteriori informazioni, vedere Supporto della protezione delle informazioni per le note di rilascio dei set di caratteri a byte doppio.
Supporto per set di caratteri a byte singolo
Per rilevare modelli contenenti caratteri cinesi/giapponesi e caratteri a byte singolo o per rilevare modelli contenenti caratteri cinesi/giapponesi e inglesi, definire due varianti della parola chiave o dell'espressione regolare.
Ad esempio, per rilevare una parola chiave come "机密的document", usare due varianti della parola chiave: una con uno spazio tra il testo giapponese e quello inglese e un'altra senza spazio tra il testo giapponese e quello inglese. Quindi, le parole chiave da aggiungere nel SIT devono essere "机密的 document" e "机密的document". Analogamente, per rilevare la frase "東京オリンピック2020", devono essere usate due varianti: "東京オリンピック 2020" e "東京オリンピック2020".
Oltre ai caratteri cinese/giapponese/a doppio byte, se l'elenco di parole chiave/frasi contiene anche parole non cinesi/giapponesi (ad esempio, solo in inglese), è necessario creare due dizionari/elenchi di parole chiave. Uno per le parole chiave contenenti caratteri cinese/giapponese/a doppio byte e un altro per le parole chiave solo in inglese. Ad esempio, se si vuole creare un dizionario/elenco di parole chiave con tre frasi "Altamente riservato", "機密性が高い" e "机密的document", è necessario creare due elenchi di parole chiave.
- Estremamente riservato
- 機密性が高い, 机密的document e 机密的 document Durante la creazione di un'espressione regolare usando un trattino a byte doppio o un punto a byte doppio, assicurati di eseguire l'escape di entrambi i caratteri come faresti con un trattino o un punto in un'espressione regolare. Ecco un esempio di regex di riferimento:
(?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}
È consigliabile usare la corrispondenza di stringa invece della corrispondenza di parole in un elenco di parole chiave.
Differenze di rilevamento tra i carichi di lavoro
Lo stesso tipo di informazioni sensibili può produrre risultati diversi a seconda della posizione in cui viene valutato il contenuto, ad esempio la posta elettronica in transito (Exchange), i file inattivi (SharePoint e OneDrive) e i file nei dispositivi gestiti (Endpoint DLP). La prevenzione della perdita dei dati degli endpoint classifica i file in base a tutti i tipi di informazioni sensibili disponibili nel tenant e l'uso di un SIT in bundle in un criterio DLP degli endpoint richiede la scansione e la protezione della classificazione avanzata.
Prima di affidarsi a un SIT personalizzato in produzione, testarlo e convalidare il rilevamento in ogni carico di lavoro in cui si intende usarlo, ad esempio una regola del flusso di posta, un criterio di SharePoint o OneDrive e un criterio endpoint. Il rilevamento può anche essere influenzato dai limiti di estrazione dei contenuti, come la dimensione massima del file e il numero di caratteri scansionati; vedere Considerazioni sulla piattaforma DLP.
Tipo di informazioni sensibili di test
È possibile testare SIT caricando un file di esempio. I risultati del test mostrano il numero di corrispondenze per ogni livello di confidenza. È possibile testare SIT predefiniti, SIT personalizzati, classificatori sottoponibili a training e corrispondenza esatta dei dati.
Testare il tipo di informazioni sensibili predefinite e personalizzate
Testare la corrispondenza esatta dei dati con il tipo di informazioni riservate.
Per testare un tenant SIT personalizzato o predefinito, è necessario che al tenant sia aggiunta almeno una licenza di Exchange Online. In caso contrario, l'opzione Test SIT sarà disattivata quando viene selezionato un SIT qualsiasi.
Fornire feedback sull'accuratezza della corrispondenza/non corrispondenza nei tipi di informazioni sensibili
È possibile visualizzare il numero di corrispondenze di un SIT in Tipi di informazioni sensibili ed Esplora contenuto. Puoi anche fornire un feedback sul fatto che un elemento sia effettivamente una corrispondenza o meno usando il meccanismo di feedback Corrispondenza, non corrispondenza e usare tale feedback per ottimizzare i SIT. Per altre informazioni, vedere Aumentare l'accuratezza del classificatore.
Per ulteriori informazioni
- Definizioni delle entità tipo di informazioni sensibili
- Creare una tipologia personalizzata di informazioni riservate
- Creare un tipo personalizzato di informazioni sensibili in PowerShell
Per informazioni su come usare i tipi di informazioni riservate per rispettare le normative sulla privacy dei dati, vedere Distribuire la protezione delle informazioni per le normative sulla privacy dei dati con Microsoft 365 (aka.ms/m365dataprivacy).