识别和分类受组织控制的敏感项目是信息保护学科的第一步。 Microsoft Purview 提供了三种识别项目的方法,以便对其进行分类:
- 由用户手动执行
- 与敏感信息类型一样,通过自动模式识别
- 通过 机器学习
敏感信息类型 (SIT) 是基于模式的分类器。 它们检测敏感信息(如社会保障、信用卡或银行帐号)以识别敏感项,有关所有 SIT 的完整列表,请参阅敏感信息类型实体定义。
Microsoft 提供了大量预配置的 SIT,或者你可以创建自己的 SIT。
授权
需要 E5 许可证才能使用凭据扫描 SIT。 有关所有凭据扫描 SIT 的列表,请参阅 所有凭据敏感信息类型。 此 SIT 包含门户中提供的所有凭据扫描 SIT。 此 SIT 的每个成员都是凭据扫描 SIT,可用作独立设备。 有关许多 Microsoft 创建的 SIT 的列表,请参阅 敏感信息类型实体定义。
敏感信息类型用于
敏感信息类型的类别
内置敏感信息类型
Microsoft 创建了这些 SIT,它们默认显示在 Purview 门户中。 无法编辑这些 SIT,但可以通过复制它们来创建自定义敏感信息类型,从而将它们用作模板。 有关所有 SIT 的完整列表,请参阅敏感 信息类型实体定义 。
命名实体敏感信息类型
默认情况下,命名实体 SIT 也会显示在 Purview 门户中。 它们检测人名、实际地址以及医疗条款和条件。 无法编辑或复制它们。 有关详细信息,请参阅 了解命名实体。
命名实体 SIT 有两种类型:
未捆绑
这些命名实体 SIT 的关注范围较窄,例如单个国家或地区或单一类术语。 当需要具有更窄检测范围的数据丢失防护 (DLP) 策略时,请使用它们。 请参阅 命名实体 SIT 的示例。
捆绑
捆绑的命名实体 SIT 检测类中的所有可能匹配项,例如 “所有物理地址”。 在 DLP 策略中将它们用作检测敏感项的广泛条件。 请参阅 命名实体 SIT 的示例。
提示
如果想要在终结点 DLP 策略中使用捆绑的 SIT,则必须启用 高级分类扫描和保护。 此要求特定于捆绑的 SITS 和终结点 DLP 策略的组合。
自定义敏感信息类型
如果预配置的敏感信息类型无法满足你的需求,可以创建完全定义的自己的自定义敏感信息类型,也可以复制其中一个内置信息类型并对其进行修改。 有关详细信息,请参阅
在 Microsoft Purview 门户中创建自定义敏感信息类型。
精确数据匹配敏感信息类型
所有精确数据匹配 (基于 EDM) 的 SIT 都是从头开始创建的。 您可以使用它们来检测具有在敏感信息数据库中定义的精确值的项。 有关详细信息,请参阅 了解基于精确数据匹配的敏感信息类型。
敏感信息类型的基本部分
每个敏感信息类型 (SIT) 实体都包含以下字段:
- 名称: 指示如何引用敏感信息类型。
- 描述: 对敏感信息类型要查找的内容的说明。
- 模式: 定义 SIT 检测到的内容。 它由以下组件组成:主要元素、支持元素、置信度和邻近度。
下表介绍了用于定义敏感信息类型的模式的每个组件。
| 图案组件 | 说明 |
|---|---|
| 主要元素 | 敏感信息类型要查找的主要元素。 它可以是带有或不带有校验和验证的正则表达式、关键字 (keyword) 列表、关键字 (keyword) 字典或函数。每种类型的元素都可以从现有 SIT 列表中选择,也可以由具有管理员权限的用户自定义定义。 定义元素后,它将与内置元素一起出现在现有元素列表中。 |
| 支撑元件 | 充当佐证的元素。 当包含时,支撑元素有助于提高对检测到的匹配准确性的置信度。 例如,如果主要元素定义为SSN由 9 位数字) 组成的 (,并且 关键字 (keyword) 社会安全号码 (SSN) 被用作支持元素,则在附近SSN发现时,检测到的确实SSN是社会安全号码的置信度高于社会安全号码 (SSN) 关键字 (keyword) 不存在的置信度。 支持元素可以是正则表达式 (,带或不带校验和验证) 、关键字 (keyword) 列表或关键字 (keyword) 字典。 |
| 可信度 | 关于检测到的匹配,有三个置信度级别:高、中和低。 置信度反映了与主要元素一起检测到的支持证据的数量。 检测到的项目包含的支持证据越多,匹配项目包含你正在寻找的敏感信息的置信度就越高。 有关置信度的详细信息,请参阅本文后面包含的视频。 |
| 邻近度 | 指定支撑元素与主元素之间的接近程度(以它们之间的字符数为单位)。 |
了解邻近度
下图显示了匹配检测在邻近度方面的工作原理。 在此示例中,主要元素是 SSN 字段,SIT 定义要求值的 SSN 每个实例都必须与以下元素中的至少一个指定邻近:
-
AccountNumber -
Name DateOfBirth
在图中,我们看到被检查的数据包括该 SSN 字段的三个不同实例: SSN1、、 SSN2、 SSN3和 SSN4。
为了了解邻近度的工作原理,让我们先看一些示例检测标准。 在这里,我们想要检测九位数的社会安全号码。 检测条件要求主要元素) 的 9 位正则表达式 (与在邻近) (250 个字符以内) 字段 (的支持AccountNumberNameDateOfBirth证据一起找到。
如图所示,只有主要元素 SSN1 符合 SSN4 描述的检测标准。 让我们进一步了解一下。
- 对于
SSN1,该AccountNumber值位于指定的邻近窗口(包含 250 个字符)内,因此检测到匹配项。 - 在 和 的情况下
SSN2SSN3,支持元素均不出现在主要元素的 250 个字符内,因此这些值不会被检测为匹配项。 但是,当你查看图中的邻近度窗口SSN2时,你可能会问: 为什么没有匹配SSN2项?邻近窗口不是SSN2延伸到元素吗Name? 这是个好问题。 答案是: 不完全是。 虽然邻近窗口扩展到值中Name,但它不包括整个值,因此模式不匹配。 - 最后,在 的情况下
SSN4,邻近窗口中有两个支持元素,BothName和DateOfBirth,因此此模式也匹配。
在此简短视频中详细了解置信度。
敏感信息类型示例
阿根廷国家/地区身份证 (DNI) 号
格式
八个数字,用点分隔
模式
八个数字:
- 两位数
- 句点
- 三位数
- 句点
- 三位数
校验和
否
定义
如果 DLP 策略在 250 个字符的邻近范围内检测到此类敏感信息具有中等置信度:
- 正则表达式 Regex_argentina_national_id 找到与该模式匹配的内容。
- 找到 Keyword_argentina_national_id 中的一个关键字。
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
<Pattern confidenceLevel="75">
<IdMatch idRef="Regex_argentina_national_id"/>
<Match idRef="Keyword_argentina_national_id"/>
</Pattern>
</Entity>
关键字
Keyword_argentina_national_id
- Argentina National Identity number
- 标识
- 身份证 国民身份证
- DNI
- 国家人事登记处 (NIC)
- Documento Nacional de Identidad
- Registro Nacional de las Personas
- Identidad
- Identificación
有关置信度级别的详细信息
在敏感信息类型实体定义中, 置信度反映 除了主要元素之外还检测到的支持证据的数量。 项包含的支持证据越多,匹配项包含你正在查找的敏感信息的置信度就越高。 例如,置信度高的匹配在靠近主要元素的地方包含更多的支持证据,而置信度低的匹配在邻近处几乎没有支持证据。
高置信度级别返回的误报最少,但可能会导致更多的误报。 低置信度或中置信度会返回更多的误报,但很少或零个误报。
- 低置信度:匹配的项包含最少的误报,但包含最多的误报。 低置信度返回所有低置信度、中置信度和高置信度匹配项。 低置信度的值为 65。
- 中等可信度:匹配的项包含平均数的误报和误报。 中置信度返回所有中置信度和高置信度匹配项。 中等置信水平的值为 75。
- 高置信度:匹配的项包含最少的误报,但最多的误报。 高置信度仅返回高置信度匹配项,值为 85。
应将高置信度模式用于低计数(例如 5 到 10),使用具有较高计数(例如 20 或更多)的低置信度模式。
注意
如果现有策略或自定义敏感信息类型 (SIT) 使用基于数字的置信度 (也称为 准确性) 定义),则它们将自动映射到三个离散的置信度;低置信度、中置信度和高置信度。
- 所有具有最低准确性或置信度介于 76 到 100 之间的自定义 SIT 模式的策略都将映射到高置信度。
- 置信度介于 66 到 75 之间的所有具有最低准确性或自定义 SIT 模式的策略都将映射到中等置信度。
- 具有最低准确性或置信度小于或等于 65 的自定义 SIT 模式的所有策略都将映射到低置信度。
创建自定义敏感信息类型
可以从多个选项中进行选择,以创建自定义敏感信息类型。
使用 UI - 可以使用 Purview 门户 UI 设置自定义敏感信息类型。 通过此方法,你可以使用正则表达式、关键字和关键字字典。 若要了解详细信息,请参阅创建自定义敏感信息类型。
使用 EDM - 可以使用精确数据匹配 (基于 EDM) 的分类来设置自定义敏感信息类型。 通过此方法,你可以使用可定期刷新的安全数据库创建动态敏感信息类型。 请参阅 了解基于精确数据匹配的敏感信息类型。
使用 PowerShell - 可以使用 PowerShell 设置自定义敏感信息类型。 尽管此方法比使用 UI 更复杂,但你可以拥有更多的配置选项。 请参阅在安全 & 合规性 PowerShell 中创建自定义敏感信息类型。
优化可训练分类器
终结点 DLP 根据租户中可用的所有敏感信息类型(包括自定义敏感信息类型)对文件进行分类,而不考虑其在任何 DLP 策略中的使用情况。 如果敏感信息类型未很好地调整并最终匹配许多文件,则可能会导致过多的分类流量。 应优化所有自定义敏感信息类型。 为此,请删除未使用的敏感信息类型,并重新设计 SIT(如果它们与组织中的大多数文件匹配)。 有关利用 SIT 正则表达式验证程序优化 SIT 的指南,请参阅: 敏感信息类型 正则表达式验证程序和其他检查
双字节字符集支持
改进的置信度可在 Microsoft Purview 数据丢失防护服务、信息保护、通信合规性、数据生命周期管理和记录管理中立即使用。
- 信息保护现在支持用于以下情况的双字节字符集语言:
- 简体中文
- 繁体中文
- 韩语
- 日语
此支持适用于敏感信息类型。 有关详细信息,请参阅 对双字节字符集的信息保护支持发行说明。
单字节字符集支持
若要检测含有中文/日文字符和单字节字符的模式,或检测含有中文/日文和英文的模式,则需要定义两个变体的关键词或词组。
例如,若要检测像“机密的文件”这样的关键词,则要使用该关键词的两个变体; 一个是在日语和英语文本之间有空格,另一个是在日语和英语文本之间没有空格。 因此,在 SIT 中要添加的关键词应该是“机密的 文档”和“机密的文档”。 同样,若要检测短语 "東京オリンピック2020",则应该使用两个变体;“東京オリンピック 2020”和“東京オリンピック2020”。
除了中文/日文/双字节字符外,如果关键字/短语列表还包含非中文/日语单词,例如仅英语) (,您应该创建两个词典/关键字 (keyword) 列表。 一个用于包含中文/日语/双字节字符的关键字,另一个用于仅包含英文的关键字。 例如,如果要创建一个包含三个短语“高度机密”、“機密性が高い”和“机密的文档”关键字 (keyword) 词典/列表,则应创建两个关键字 (keyword) 列表。
- Highly confidential
- 機密性が高い, 机密的document and 机密的 document 使用双字节连字符或双字节句点创建正则表达式时,请确保像转义正则表达式中的连字符或句点一样对这两个字符进行转义。 下面是一个示例正则表达式供参考:
(?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}
建议在关键字 (keyword) 列表中使用字符串匹配而不是单词匹配。
跨工作负载的检测差异
相同的敏感信息类型可能会产生不同的结果,具体取决于内容评估的位置,例如,Exchange) (传输中的电子邮件、SharePoint 和 OneDrive) (的静态文件以及 (终结点 DLP) 的托管设备上的文件。 终结点 DLP 根据租户中可用的 所有 敏感信息类型对文件进行分类,并且在终结点 DLP 策略中使用捆绑的 SIT 需要 高级分类扫描和保护。
在生产环境中依赖自定义 SIT 之前,请在计划使用它的每个工作负载中 对其进行测试 并验证检测,例如邮件流规则、SharePoint 或 OneDrive 策略以及终结点策略。 检测还可能受到内容提取限制的影响,例如最大文件大小和扫描的字符数;请参阅 DLP 平台注意事项。
测试敏感信息类型
可以通过上传示例文件来测试 SIT。 测试结果显示每个置信水平的匹配数。 可以测试内置 SIT、自定义 SIT、可训练分类器和精确数据匹配。
若要测试任何自定义或默认 SIT 租户,必须至少向租户添加一个 Exchange Online 许可证。 否则,在选择任何 SIT 时,“测试 SIT”选项将灰显。
在敏感信息类型中提供匹配/不匹配准确性反馈
可以在 “敏感信息类型 ”和 “内容资源管理器”中查看 SIT 的匹配项数。 还可以使用 “匹配而 非匹配 ”反馈机制提供有关项目是否实际匹配的反馈,并使用该反馈来优化 SIT。 有关详细信息,请参阅 提高分类器准确性。
更多信息
若要了解如何使用敏感信息类型来遵守数据隐私法规,请参阅 使用 Microsoft 365 (aka.ms/m365dataprivacy) 部署适用于数据隐私法规的信息保护 。