Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Идентификация и классификация конфиденциальных элементов, находящихся под контролем вашей организации, является первым шагом в дисциплине Information Protection. Microsoft Purview предоставляет три способа идентификации элементов для их классификации:
- вручную, пользователями
- с помощью автоматического распознавания образов, как и для типов конфиденциальной информации
- с помощью машинного обучения
Типы конфиденциальной информации (SIT) представляют собой классификаторы на основе шаблонов. Они обнаруживают конфиденциальную информацию, такую как номера социального страхования, кредитных карт или банковских счетов, чтобы идентифицировать конфиденциальные элементы. Полный список всех SIT см. в разделе Определения сущностей типа конфиденциальной информации.
Майкрософт предоставляет большое количество предварительно настроенных SIT, или вы можете создать свои собственные.
Лицензирование
Для использования SIT сканирования учетных данных требуется лицензия E5. Список всех SIT, проверяющих учетные данные, см. в разделе "Все типы конфиденциальной информации учетных данных". Этот SIT содержит все SIT для сканирования учетных данных, доступные на портале. Каждый член этой SIT является SIT для сканирования учетных данных и может использоваться как автономный. Список множества SIT, созданных корпорацией Майкрософт, см. в разделе Определения объектов типа конфиденциальной информации.
Типы конфиденциальной информации используются в
- Политики защиты от потери данных Microsoft Purview Защита от потери данных Microsoft Purview
- Метки конфиденциальности
- Метки хранения
- Управление внутренними рисками
- Соответствие требованиям к обмену данными
- Политики автоматического применения меток
- Microsoft Priva
Категории типов конфиденциальной информации
Встроенные типы конфиденциальной информации
Корпорация Майкрософт создала эти SIT, и они отображаются на портале Purview по умолчанию. Эти SIT нельзя редактировать, но их можно использовать как шаблоны, скопировав их для создания пользовательских типов конфиденциальной информации. Полный список всех SIT см. в разделе Определения сущностей типа конфиденциальной информации .
Типы конфиденциальной информации именованных сущностей
SIT именованных сущностей также по умолчанию отображаются на портале Purview. Они определяют имена людей, физические адреса и медицинские условия. Их нельзя редактировать или копировать. Дополнительные сведения см. в статье Сведения об именованных сущностях.
SIT именованных сущностей бывают двух типов:
не объединено
Эти SIT именованных сущностей имеют более узкую направленность, например одну страну или регион либо один класс терминов. Используйте их, если вам нужна политика защиты от потери данных (DLP) с более узкой областью обнаружения. См. примеры SIT именованных сущностей.
в комплекте
Набор именованных объектов SIT обнаруживает все возможные совпадения в классе, например все физические адреса. Используйте их в качестве общих критериев в политиках защиты от потери данных для обнаружения конфиденциальных элементов. См. примеры SIT именованных сущностей.
Совет
Если вы хотите использовать пакетный SIT в политике защиты от потери данных в конечной точке, необходимо включить расширенное классификационное сканирование и защиту. Это требование относится к сочетанию связанных политик SITS и защиты от потери данных в конечной точке.
Пользовательские типы конфиденциальной информации
Если предварительно настроенные типы конфиденциальной информации не соответствуют вашим потребностям, вы можете создать собственные настраиваемые типы конфиденциальной информации, которые вы полностью определите, или скопировать один из встроенных типов и изменить его. Дополнительные сведения см. в разделе
Создайте настраиваемый тип конфиденциальной информации на портале Microsoft Purview.
Точные данные соответствуют типам конфиденциальной информации
Все SIT на основе точного совпадения данных (EDM) создаются с нуля. Они используются для обнаружения элементов с точными значениями, которые вы определяете в базе данных конфиденциальной информации. Дополнительные сведения см. в разделе "Узнайте о типах конфиденциальной информации на основе точного совпадения данных".
Основные компоненты типа конфиденциальной информации
Каждый объект типа конфиденциальной информации (SIT) состоит из следующих полей:
- Имя: Указывает, как ссылается на тип конфиденциальной информации.
- Описание: Объяснение того, что ищет этот тип конфиденциальной информации.
- Выкройка: Определяет, что обнаруживает SIT. Он состоит из следующих компонентов: первичный элемент, вспомогательные элементы, уровень достоверности и близость.
В следующей таблице описаны все компоненты шаблонов, используемых при определении типов конфиденциальной информации.
| Компонент узора | Описание |
|---|---|
| Первичный элемент | Основной элемент, который ищет тип конфиденциальной информации. Это может быть регулярное выражение с проверкой контрольной суммы или без нее, список ключевых слов, словарь ключевых слов или функция. Каждый из этих типов элементов может быть либо выбран из списка существующих SIT, либо может быть определен пользователем с правами администратора. После определения элемента он появляется в списке существующих элементов наряду с теми, которые встроены. |
| Опорный элемент | Элемент, который выступает в качестве подтверждающего доказательства. При включении вспомогательные элементы помогают повысить уровень достоверности в отношении точности обнаруженных совпадений. Например, если основной элемент определен как SSN (состоящий из девяти цифр), а ключевое слово номер социального страхования (SSN) используется в качестве вспомогательного элемента при обнаружении в непосредственной близости от SSN, уверенность в том, что обнаруженный SSN номер действительно является номером социального страхования, выше, чем если бы ключевое слово номера социального страхования (SSN) не присутствовал. Вспомогательным элементом может быть регулярное выражение (с проверкой контрольной суммы или без нее), список ключевых слов или словарь ключевых слов. |
| Уровень вероятности | Существует три уровня достоверности в отношении обнаруженных совпадений: высокий, средний и низкий. Уровень достоверности отражает количество подтверждающих доказательств, обнаруженных вместе с основным элементом. Чем больше подтверждающих доказательств содержит обнаруженный элемент, тем выше вероятность того, что найденный элемент содержит конфиденциальные сведения, которые вы ищете. Дополнительные сведения об уровнях достоверности см. в видео, добавленном далее в этой статье. |
| Компонент ранжирования с учетом расположения | Указывает, насколько близко опорный элемент находится к основному элементу с точки зрения количества символов между ними. |
Знакомство с близостью
На следующей схеме показано, как определяется соответствие применительно к близкому контакту. В данном примере основным элементом является SSN поле, и определение SIT требует, чтобы каждый экземпляр SSN значения находился в указанной близости по крайней мере от одного из следующих элементов:
-
AccountNumber -
Name DateOfBirth
На схеме мы видим, что проверяемые данные включают три разных экземпляра поля: SSN1, , SSN3SSN2, и SSN4.SSN
Чтобы понять, как работает близость, давайте начнем с рассмотрения некоторых критериев обнаружения. Здесь мы хотели обнаружить девятизначные номера социального страхования. Критерии обнаружения требуют, чтобы девятизначное регулярное выражение (первичный элемент) находилось в сочетании с подтверждающим свидетельством (среди AccountNumber, Nameи DateOfBirth полей), которое встречается в пределах 250 символов ( близость).
Как показано на схеме, только первичные элементы SSN1 и SSN4 соответствуют описанным критериям обнаружения. Давайте рассмотрим это подробнее.
- В случае ,
SSN1AccountNumberзначение находится в пределах указанного окна близости в 250 символов, поэтому обнаружено совпадение. - В обоих случаях
SSN2иSSN3, ни один из вспомогательных элементов не находится в пределах 250 символов от первичного элемента, поэтому эти значения не определяются как совпадения. Однако, глядя на окно близости наSSN2схеме, вы можете спросить: почему нет совпадения дляSSN2? Разве бесконтактноеSSN2окно не распространяется на элемент?NameЭто хороший вопрос. Ответ: не совсем. Хотя окно близости расширяется доNameзначения, оно не включает все значение, поэтому шаблон не совпадает. - Наконец, в случае
SSN4, в окне близости есть два поддерживающих элемента, обаNameиDateOfBirth, так что этот шаблон также соответствует.
Узнайте больше об уровнях доверия в этом коротком видео.
Пример типа конфиденциальной информации
Номер внутреннего удостоверения личности для Аргентины (DNI)
Формат
Восемь цифр, разделенных точками.
Шаблон
Восемь цифр:
- две цифры
- точка
- три цифры
- точка
- три цифры
Контрольная сумма
Нет
Определение
Политика защиты от потери данных имеет средний уровень достоверности обнаружения этого типа конфиденциальной информации в радиусе 250 символов:
- регулярное выражение Regex_argentina_national_id находит содержимое, которое соответствует шаблону;
- находится ключевое слово из Keyword_argentina_national_id.
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
<Pattern confidenceLevel="75">
<IdMatch idRef="Regex_argentina_national_id"/>
<Match idRef="Keyword_argentina_national_id"/>
</Pattern>
</Entity>
Ключевые слова
Keyword_argentina_national_id
- Argentina National Identity number
- Удостоверение
- Удостоверение личности Национальное удостоверение личности
- Директор национальной разведки
- Национальный реестр лиц (NIC)
- Documento Nacional de Identidad
- Registro Nacional de las Personas
- Идентидад
- Identificación
Подробнее об уровнях достоверности
В определении сущности типа конфиденциальной информации уровень достоверности отражает количество подтверждающих доказательств, обнаруженных в дополнение к основному элементу. Чем больше подтверждающих доказательств содержит элемент, тем выше вероятность того, что найденный элемент содержит конфиденциальные сведения, которые вы ищете. Например, совпадения с высоким уровнем достоверности содержат больше подтверждающих доказательств в непосредственной близости от основного элемента, тогда как совпадения с низким уровнем достоверности будут содержать мало подтверждающих доказательств или вообще не содержать подтверждающих доказательств в непосредственной близости.
Высокий уровень достоверности возвращает наименьшее количество ложноположительных результатов, но может привести к большему количеству ложноотрицательных результатов. Низкие или средние уровни достоверности возвращают больше ложноположительных результатов, но мало ложноотрицательных.
- низкая достоверность: совпадающие элементы содержат наименьшее количество ложноотрицательных, но больше всего ложноположительных. При низком уровне доверия возвращаются все совпадения с низким, средним и высоким уровнем доверия. Низкий уровень достоверности имеет значение 65.
- средняя достоверность: совпадающие элементы содержат среднее количество ложноположительных и ложноотрицательных результатов. При использовании средней достоверности возвращаются все совпадения со средней и высокой степенью достоверности. Средний уровень достоверности имеет значение 75.
- высокая достоверность: совпадающие элементы содержат наименьшее количество ложноположительных, но больше всего ложноотрицательных. Функция "Высокая достоверность" возвращает только совпадения с высокой степенью достоверности и имеет значение 85.
Следует использовать шаблоны с высоким уровнем достоверности с малым числом, скажем, от 5 до 10, и шаблоны с низким доверием с большим числом, скажем, 20 и более.
Примечание.
Если у вас есть существующие политики или настраиваемые типы конфиденциальной информации (SIT), определенные с помощью числовых уровней достоверности (также называемых точностью), они автоматически сопоставляются с тремя дискретными уровнями достоверности. низкий уровень доверия, средний уровень доверия и высокий уровень доверия в пользовательском интерфейсе центра безопасности @ Compliance.
- Все политики с минимальной точностью или пользовательские шаблоны SIT с уровнями достоверности от 76 до 100 будут сопоставлены с высоким доверительным уровнем.
- Все политики с минимальной точностью или пользовательские шаблоны SIT с уровнями достоверности от 66 до 75 будут сопоставлены со средними доверительными данными.
- Все политики с минимальной точностью или настраиваемые шаблоны SIT с уровнями достоверности меньше или равными 65 будут сопоставлены с низким доверием.
Создание пользовательских типов конфиденциальной информации
Можно выбрать один из нескольких вариантов создания пользовательских типов конфиденциальной информации.
Используйте пользовательский интерфейс. Вы можете настроить пользовательский тип конфиденциальной информации с помощью пользовательского интерфейса портала Purview. В этом методе можно использовать регулярные выражения, ключевые слова и словари ключевых слов. Дополнительные сведения см. в статье Создание пользовательского типа конфиденциальной информации.
Использование EDM — вы можете настроить пользовательские типы конфиденциальной информации, используя классификацию на основе точного совпадения данных (EDM). Этот метод позволяет создать динамический тип конфиденциальной информации с помощью защищенной базы данных, которую можно периодически обновлять. См. раздел "Сведения о точном совпадении данных на основе типов конфиденциальной информации".
Используйте PowerShell — вы можете настроить пользовательские типы конфиденциальной информации с помощью PowerShell. Хотя этот метод сложнее, чем использование пользовательского интерфейса, он предоставляет дополнительные параметры конфигурации. См. статью Создание пользовательского типа конфиденциальной информации в Security & Compliance PowerShell.
Настройка обучаемых классификаторов
Защита от потери данных в конечной точке классифицирует файлы на основе всех типов конфиденциальной информации, доступных в клиенте, включая пользовательские типы конфиденциальной информации, независимо от их использования в любых политиках защиты от потери данных. Это может привести к чрезмерному трафику классификации, если типы конфиденциальной информации недостаточно настроены и в конечном итоге совпадают со многими файлами. Следует оптимизировать все пользовательские типы конфиденциальной информации. Для этого удалите неиспользуемые типы конфиденциальной информации и измените дизайн SIT, если они соответствуют большинству файлов в вашей организации. Рекомендации по использованию валидаторов SIT Regex для настройки SIT см. в разделе: Тип конфиденциальной информации Валидаторы REGEX и дополнительная проверка
Поддержка двухбайтовых наборов знаков
Улучшенные уровни достоверности доступны для немедленного использования в службах защиты от потери данных Microsoft Purview, защите информации, соответствии требованиям связи, управлении жизненным циклом данных и управлении записями.
- Information Protection теперь поддерживает двухбайтовые языки наборов знаков для:
- Китайский (упрощенное письмо)
- Китайский (традиционное письмо)
- Корейский
- Японский
Эта поддержка доступна для конфиденциальных типов информации. Дополнительные сведения см. в разделе Поддержка защиты информации для двухбайтовых наборов символов Заметки о выпуске.
Поддержка набора однобайтовых символов
Для выявления шаблонов, содержащих символы китайского или японского языков и однобайтовые символы, или шаблонов, содержащих элементы китайского/японского и английского языков, определите два варианта ключевого слова или регулярного выражения.
Например, для выявления такого ключевого слова, как "机密的document", используйте два варианта ключевого слова: один с пробелом между японским и английским текстом, а другой без пробела между японским и английским текстом. Поэтому в SIT следует добавить ключевые слова "机密的 document" и "机密的document". Аналогично, для выявления фразы "東京オリンピック2020" следует использовать два варианта: "東京オリンピック 2020" и "東京オリンピック2020".
Если наряду с китайскими/японскими/двухбайтовыми символами, в списке ключевых слов/фраз также есть некитайские/японские слова (например, только на английском языке), вам следует создать два словаря / списка ключевых слов. Одна для ключевых слов, содержащих китайские/японские/двухбайтовые символы, а другая для ключевых слов только на английском языке. Например, если вы хотите создать словарь/список ключевых слов с тремя фразами «Строго конфиденциально», «機密性が高い» и «机密的document», вам следует создать два списка ключевых слов.
- Строго конфиденциально
- 機密性が高い, 机密的document и 机密的 document При создании регулярного выражения с использованием двухбайтового дефиса или двухбайтовой точки обязательно экранируйте оба символа так же, как вы экранируете дефис или точку в регулярном выражении. Ниже приведен пример регулярного выражения для справки:
(?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}
Мы рекомендуем использовать соответствие строки вместо совпадения слов в списке ключевых слов.
Различия в обнаружении между рабочими нагрузками
Один и тот же тип конфиденциальной информации может давать разные результаты в зависимости от того, где оценивается содержимое, например электронная почта при передаче (Exchange), неактивные файлы (SharePoint и OneDrive) и файлы на управляемых устройствах (Endpoint DLP). Защита от потери данных в конечной точке классифицирует файлы по всем типам конфиденциальной информации, доступным в клиенте, а использование связанного SIT в политике защиты от потери данных в конечной точке требует расширенного сканирования и защиты от классификации.
Прежде чем использовать настраиваемый SIT в рабочей среде, протестируйте его и проверьте обнаружение в каждой рабочей нагрузке, где вы собираетесь его использовать, например, правило потока обработки почты, политику SharePoint или OneDrive и политику конечных точек. На обнаружение также могут влиять ограничения на извлечение содержимого, такие как максимальный размер файла и количество сканируемых символов; см. рекомендации по платформе защиты от потери данных.
Тестирование типа конфиденциальной информации
Вы можете протестировать SIT, отправив образец файла. В результатах теста будет показано количество совпадений для каждого уровня достоверности. Вы можете тестировать встроенные SIT, пользовательские SIT, обучаемые классификаторы и точное совпадение данных.
Тестирование встроенного и пользовательского типа конфиденциальной информации
Проверить, точно ли данные соответствуют типу конфиденциальной информации.
Чтобы протестировать любой пользовательский клиент или клиент SIT по умолчанию, в клиент должна быть добавлена хотя бы одна лицензия Exchange Online. В противном случае параметр Test SIT будет недоступен при выборе любого SIT.
Предоставление отзывов о точности соответствий/несовпадений для типов конфиденциальной информации
Количество совпадений SIT можно просмотреть в разделе "Типы конфиденциальной информации " и "Обозреватель содержимого". Вы также можете отправлять отзывы о том, действительно ли элемент совпадает или нет, с помощью механизма обратной связи " Соответствовать, а не соответствовать " и использовать эту обратную связь для настройки своих SIT. Дополнительные сведения см. в разделе Повышение точности классификатора.
Дополнительные сведения
- Определения объектов типа конфиденциальной информации
- Создание пользовательского типа конфиденциальных данных
- Создание пользовательского типа конфиденциальной информации в PowerShell
Сведения об использовании типов конфиденциальной информации для соблюдения правил конфиденциальности данных см. в статье "Развертывание защиты информации для соблюдения нормативных требований о конфиденциальности данных в Microsoft 365 (aka.ms/m365dataprivacy").