En savoir plus sur les types d’informations sensibles

L’identification et la classification des éléments sensibles qui sont sous le contrôle de votre organisation constituent la première étape de la discipline Information Protection. Microsoft Purview propose trois façons d’identifier les éléments afin qu’ils puissent être classés :

  • manuellement, par les utilisateurs
  • Via la reconnaissance automatique des formes, comme pour les types d’informations sensibles
  • Via Machine Learning

Les types d’informations sensibles (SIT) sont des classifieurs basés sur des modèles. Ils détectent les informations sensibles telles que les numéros de sécurité sociale, de carte de crédit ou de compte bancaire pour identifier les éléments sensibles.

Microsoft fournit un grand nombre de SIT préconfigurés ou vous pouvez créer vos propres SIT.

Licences

Une licence E5 est requise pour utiliser des SIT d’analyse d’informations d’identification. Pour obtenir la liste de tous les SIT d’analyse d’informations d’identification, consultez Tous les types d’informations sensibles d’informations d’identification. Ce SIT contient tous les SIT d’analyse d’informations d’identification disponibles dans le portail. Chaque membre de ce SIT est un SIT de numérisation d’informations d’identification et peut être utilisé de manière autonome. Pour obtenir la liste des nombreux SIT créés par Microsoft, consultez Définitions d’entité de type informations sensibles.

Les types d’informations sensibles sont utilisés dans

Catégories de types d’informations sensibles

Types d’informations sensibles intégrés

Microsoft a créé ces SIT et ils apparaissent dans le portail Purview par défaut. Ces SIT ne peuvent pas être modifiées, mais vous pouvez les utiliser comme modèles en les copiant pour créer des types d’informations sensibles personnalisés. Consultez Définitions d’entité de type informations sensibles pour obtenir la liste complète de tous les SIT.

Types d’informations sensibles des entités nommées

Les SIT d’entité nommée apparaissent également dans le portail Purview par défaut. Ils détectent les noms des personnes, les adresses physiques et les conditions générales médicales. Elles ne peuvent pas être modifiées ou copiées. Pour plus d’informations, consultez En savoir plus sur les entités nommées.

Les SIT d’entité nommée sont de deux types :

dégroupé

Ces SIT d’entité nommées ont un objectif plus étroit, tel qu’un seul pays ou une seule région, ou une seule classe de termes. Utilisez-les lorsque vous avez besoin d’une stratégie de protection contre la perte de données (DLP) avec une étendue de détection plus étroite. Voir Exemples de SIT d’entité nommée.

groupé

Les SIT d’entité nommée groupées détectent toutes les correspondances possibles dans une classe, telles que Toutes les adresses physiques. Utilisez-les comme critères généraux dans vos stratégies DLP pour la détection des éléments sensibles. Voir Exemples de SIT d’entité nommée.

Conseil

Vous devez activer l’analyse et la protection de la classification avancéesi vous souhaitez utiliser un SIT groupé dans une stratégie DLP de point de terminaison. Cette exigence est spécifique à la combinaison de stratégies SITS groupées et de protection contre la perte de données de point de terminaison.

Types d’informations sensibles personnalisés

Si les types d’informations sensibles préconfigurés ne répondent pas à vos besoins, vous pouvez créer vos propres types d’informations sensibles personnalisés que vous définissez entièrement ou copier l’un des types intégrés et le modifier. Pour plus d'informations, consultez

Créez un type d’informations sensibles personnalisé dans le portail Microsoft Purview.

Correspondance exacte des données types d’informations sensibles

Toutes les SIT basées sur la correspondance exacte des données (EDM) sont créées à partir de zéro. Ils permettent de détecter des éléments qui ont des valeurs exactes, lesquelles sont définies dans une base de données d’informations sensibles. Pour plus d’informations, consultez En savoir plus sur les types d’informations sensibles basés sur la correspondance exacte des données.

Éléments fondamentaux d’un type d’informations sensibles

Chaque entité de type d’informations sensibles (SIT) se compose des champs suivants :

  • Nom : Indique comment le type d’informations sensibles est mentionné.
  • Descriptif : Explication de ce que recherche le type d’informations sensibles.
  • Motif : Définit ce qu’un SIT détecte. Il se compose des éléments suivants : élément principal, éléments de soutien, niveau de confiance et proximité.

Le tableau suivant décrit chaque composant des modèles utilisés dans la définition des types d’informations sensibles.

Composant de modèle Description
Élément primaire Élément principal que le type d’informations sensibles recherche. Il peut s’agir d’une expression régulière avec ou sans validation de somme de contrôle, d’une liste de mots clés, d’un dictionnaire de mots clés ou d’une fonction. Chacun de ces types d’éléments peut être sélectionné dans la liste des SIT existants ou peut être défini par un utilisateur disposant d’autorisations d’administrateur. Une fois qu’un élément est défini, il apparaît dans la liste des éléments existants, avec ceux qui sont intégrés.
Élément de prise en charge Un élément qui agit comme une preuve corroborante. Lorsqu’ils sont inclus, les éléments de support aident à augmenter le niveau de confiance en ce qui concerne la précision des correspondances détectées. Par exemple, si l’élément principal est défini comme SSN (composé de neuf chiffres) et que le mot clé Social Security Number (SSN) est utilisé comme élément de support lorsqu’il se trouve à proximité de SSN, la confiance que le détecté est vraiment un numéro de sécurité sociale est plus élevée que si le SSN mot clé Social Security Number (SSN) n’est pas présent.

Un élément de prise en charge peut être une expression régulière (avec ou sans validation de somme de contrôle), une liste de mots clés ou un dictionnaire de mots clés.
Niveau de confiance Il existe trois niveaux de confiance en ce qui concerne les correspondances détectées : élevé, moyen et faible. Le niveau de confiance reflète la quantité de preuves à l’appui détectées avec l’élément principal. Plus un élément détecté contient de preuves à l’appui, plus le degré de confiance dans le fait qu’un élément correspondant contient les informations sensibles que vous recherchez est fiable. Pour plus d’informations sur les niveaux de confiance, voir la vidéo incluse plus loin dans cet article.
Proximité Spécifie la proximité d’un élément de support par rapport à un élément principal, en termes de nombre de caractères entre eux.

Comprendre la proximité

Le diagramme suivant montre comment fonctionne la détection de correspondance en ce qui concerne la proximité. Dans cet exemple, l’élément principal est le SSN champ et la définition SIT exige que chaque instance d’une SSN valeur se trouve à proximité spécifiée d’au moins un des éléments suivants :

  • AccountNumber
  • Name
  • DateOfBirth

Dans le diagramme, nous voyons que les données vérifiées incluent trois instances différentes du SSN champ : SSN1, SSN2, SSN3, et SSN4.

Diagramme des preuves corroborantes et fenêtre de proximité .

Pour comprendre comment fonctionne la proximité, commençons par examiner quelques exemples de critères de détection. Ici, nous voulions détecter des numéros de sécurité sociale à neuf chiffres. Les critères de détection exigent qu’une expression régulière à neuf chiffres (élément primaire) soit trouvée conjointement avec des preuves à l’appui (parmi les champs , Nameet DateOfBirth ) qui apparaissent dans les AccountNumber250 caractères (proximité).

Comme illustré dans le diagramme, seuls les éléments SSN1 primaires répondent SSN4 aux critères de détection décrits. Voyons cela plus en détail.

  • Dans le cas de SSN1, la valeur se trouve dans la fenêtre de proximité spécifiée de 250 caractères, de sorte qu’une AccountNumber correspondance est détectée.
  • Dans les deux cas de SSN2 et SSN3, aucun des éléments de prise en charge ne se trouve à moins de 250 caractères de l’élément principal, de sorte que ces valeurs ne sont pas détectées comme une correspondance. Toutefois, lorsque vous examinez la fenêtre de proximité pour SSN2 dans le diagramme, vous pouvez vous demander : Pourquoi n’y a-t-il pas de correspondance pour SSN2? La SSN2 fenêtre de proximité ne s’étend-elle pas à l’élément Name ? C’est une bonne question. La réponse est : pas tout à fait. Bien que la fenêtre de proximité s’étende dans la Name valeur, elle n’inclut pas la valeur entière , de sorte que le modèle ne correspond pas.
  • Enfin, dans le cas de , il y a deux éléments de soutien dans la fenêtre de SSN4proximité, les deux Name et DateOfBirth, donc ce motif correspond également.

Apprenez-en davantage sur les niveaux de confiance dans cette courte vidéo.

Exemple de type d’informations sensibles

Numéro d’identité nationale (DNI) en Argentine

Format

Huit chiffres séparés par des points

Modèle

Huit chiffres :

  • deux chiffres
  • a point
  • trois chiffres
  • a point
  • trois chiffres
Somme de contrôle

Non

Définition

Une stratégie DLP a un niveau de confiance moyen dans la détection de ce type d’informations sensibles si, à une distance de 250 caractères :

  • L’expression régulière Regex_argentina_national_id trouve un contenu qui correspond au modèle.
  • Un mot clé figurant dans la liste Keyword_argentina_national_id est trouvé.
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
   <Pattern confidenceLevel="75">
      <IdMatch idRef="Regex_argentina_national_id"/>
      <Match idRef="Keyword_argentina_national_id"/>
  </Pattern>
</Entity>
Mots-clés
Keyword_argentina_national_id
  • Argentina National Identity number
  • Identité
  • Carte d’identité nationale d’identification
  • DNI
  • Registre national des personnes (NIC)
  • Documento Nacional de Identidad
  • Registro Nacional de las Personas
  • IDENTIDAD
  • Identificación

En savoir plus sur les niveaux de confiance

Dans une définition d’entité de type informations sensibles, le niveau de confiance reflète la quantité de preuves à l’appui détectées en plus de l’élément principal. Plus un élément contient de preuves à l’appui, plus le degré de confiance dans le fait qu’un élément correspondant contient les informations sensibles que vous recherchez est fiable. Par exemple, les appariements avec un niveau de confiance élevé contiennent plus d’éléments de preuve à l’appui à proximité de l’élément principal, tandis que les appariements avec un faible niveau de confiance contiendraient peu ou pas d’éléments de preuve à l’appui à proximité.

Un niveau de confiance élevé renvoie le moins de faux positifs, mais peut entraîner un plus grand nombre de faux négatifs. Les niveaux de confiance faibles ou moyens renvoient plus de faux positifs, mais peu ou pas de faux négatifs.

  • faible niveau de confiance : les éléments correspondants contiennent le moins de faux négatifs, mais le plus de faux positifs. Un niveau de confiance faible renvoie toutes les correspondances de niveau de confiance faible, moyen et élevé. Le faible niveau de confiance a une valeur de 65.
  • Confiance moyenne : Les éléments correspondants contiennent un nombre moyen de faux positifs et de faux négatifs. Un niveau de confiance moyen renvoie toutes les correspondances de niveau de confiance moyen et élevé. Le niveau de confiance moyen a une valeur de 75.
  • niveau de confiance élevé : les éléments correspondants contiennent le moins de faux positifs, mais le plus de faux négatifs. Le niveau de confiance élevé renvoie uniquement des correspondances à niveau de confiance élevé et a une valeur de 85.

Vous devriez utiliser des modèles à haut niveau de confiance avec de faibles comptes, disons cinq à 10, et des modèles à faible confiance avec des nombres plus élevés, disons 20 ou plus.

Remarque

Si vous avez des stratégies existantes ou des types d’informations sensibles (SIT) personnalisés définis à l’aide de niveaux de confiance basés sur des nombres (également appelés précision), ils sont automatiquement mappés aux trois niveaux de confiance discrets ; Confiance faible, moyenne et élevée dans l’interface utilisateur Security @ Compliance Center.

  • Toutes les politiques avec une précision minimale ou des modèles SIT personnalisés avec des niveaux de confiance compris entre 76 et 100 seront mappées à un niveau de confiance élevé.
  • Toutes les politiques avec une précision minimale ou des modèles SIT personnalisés avec des niveaux de confiance compris entre 66 et 75 seront mappées au niveau de confiance moyen.
  • Toutes les stratégies avec une précision minimale ou des modèles SIT personnalisés avec des niveaux de confiance inférieurs ou égaux à 65 seront mappées à un niveau de confiance faible.

Création de types d’informations sensibles personnalisés

Vous pouvez choisir parmi plusieurs options pour créer des types d’informations sensibles personnalisés.

Réglage des classifieurs pouvant être formés

Le point de terminaison DLP classe les fichiers en fonction de tous les types d’informations sensibles disponibles dans le client, y compris les types d’informations sensibles personnalisés, indépendamment de leur utilisation dans les stratégies DLP. Cela peut entraîner un trafic de classification excessif si les types d’informations sensibles ne sont pas bien réglés et finissent par correspondre à de nombreux fichiers. Vous devez optimiser tous les types d’informations sensibles personnalisées. Pour ce faire, supprimez les types d’informations sensibles inutilisés et repensez les SIT s’ils correspondent à la plupart des fichiers de votre organisation. Pour obtenir des instructions sur l’utilisation des validateurs SIT Regex pour régler les SIT, consultez : Validateurs REGEX de type d’informations sensibles et case activée supplémentaire

Prise en charge du jeu de caractères codés sur deux octets

Des niveaux de confiance améliorés sont disponibles pour une utilisation immédiate dans les services Protection contre la perte de données Microsoft Purview, la protection des informations, la conformité des communications, la gestion du cycle de vie des données et la gestion des enregistrements.

  • Information Protection prend désormais en charge les langues de jeu de caractères codés sur deux octets pour :
  • Chinois (simplifié)
  • Chinois (traditionnel)
  • Korean
  • Japanese

Cette prise en charge est disponible pour les types d’informations sensibles. Pour plus d’informations, voir Support pour la protection des informations concernant les jeux de caractères codés sur deux octets Notes de publication.

Prise en charge du jeu de caractères codés sur un octet

Pour détecter les modèles contenant des caractères chinois/japonais et des caractères d’octet unique ou pour détecter les modèles contenant du chinois/le japonais et l’anglais, définissez deux variantes du mot clé ou de regex.

Par exemple, pour détecter un mot clé tel que « 机密的document », utilisez deux variantes du mot clé ; l’un avec un espace entre le texte japonais et anglais et l’autre sans espace entre le texte japonais et l’anglais. Par conséquent, les mots clés à ajouter dans le SIT doivent être « 机密的 document » et « 机密的document ». De la même façon, pour détecter une expression « 東京オリンピック2020 », deux variantes doivent être utilisées : « 東京オリンピック 2020 » et « 東京オリンピック2020 ».

En plus des caractères chinois/japonais/codés sur deux octets, si la liste des mots clés/expressions contient également des mots non chinois/japonais (par instance, en anglais uniquement), vous devez créer deux listes de dictionnaires/mots clés. L’une pour les mots clés contenant des caractères chinois/japonais/codés sur deux octets et l’autre pour les mots clés en anglais uniquement. Par exemple, si vous souhaitez créer une liste / dictionnaire de mots clés avec trois expressions « Hautement confidentiel », « 機密性が高い » et « 机密的document », vous devez créer deux listes de mots clés.

  • Extrêmement confidentiel
  • 機密性が高い, 机密的document et 机密的 document Lors de la création d’une expression régulière à l’aide d’un trait d’union codé sur deux octets ou d’un point codé sur deux octets, veillez à échapper les deux caractères comme vous le feriez pour un trait d’union ou un point dans une expression régulière. Voici un exemple d’expression régulière pour référence : (?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}

Nous vous recommandons d’utiliser une correspondance de chaîne au lieu de correspondance de mot dans une liste de mots clés.

Différences de détection entre les charges de travail

Un même type d’informations sensibles peut produire des résultats différents selon l’endroit où le contenu est évalué – par exemple, courrier en transit (Exchange), fichiers au repos (SharePoint et OneDrive) et fichiers sur des appareils gérés (Endpoint DLP). La protection contre la perte de données de point de terminaison classe les fichiers par rapport à tous les types d’informations sensibles disponibles dans le client, et l’utilisation d’un SIT groupé dans une stratégie DLP de point de terminaison nécessite une analyse et une protection de classification avancées.

Avant de vous appuyer sur un SIT personnalisé en production, testez-le et validez la détection pour chaque charge de travail où vous envisagez de l’utiliser (par exemple, une règle de flux de courrier, une stratégie SharePoint ou OneDrive et une stratégie de point de terminaison). La détection peut également être affectée par les limites d’extraction de contenu telles que la taille maximale du fichier et le nombre de caractères analysés ; voir Considérations relatives à la plateforme DLP.

Tester le type d’informations sensibles

Vous pouvez tester le SIT en téléchargeant un fichier d’exemple. Les résultats des tests indiquent le nombre de correspondances pour chaque niveau de confiance. Vous pouvez tester des SIT intégrés, des SIT personnalisés, des classifieurs pouvant être formés et des correspondances de données exactes.

Test du type d’informations sensibles intégré et personnalisé

Testez la correspondance exacte des données sensibles.

Pour tester un client SIT personnalisé ou par défaut, au moins une licence Exchange Online doit avoir été ajoutée au client. Sinon, l’option Test SIT est grisée lorsqu’un SIT est sélectionné.

Fournir des commentaires sur la précision de correspondance ou non dans les types d’informations sensibles

Vous pouvez afficher le nombre de correspondances d’un SIT dans Types d’informations sensibles et Explorateur de contenu. Vous pouvez également indiquer si un élément correspond réellement ou non à l’aide du mécanisme de commentaires Match, Not a Match et utiliser ces commentaires pour régler vos SITs. Pour plus d’informations, consultez Augmenter la précision du classifieur.

Pour plus d’informations

Pour savoir comment utiliser des types d’informations sensibles pour vous conformer aux réglementations sur la confidentialité des données, consultez Déployer la protection des informations pour les réglementations sur la confidentialité des données avec Microsoft 365 (aka.ms/m365dataprivacy).