중요한 정보 유형에 대해 자세히 알아보기

organization의 제어 하에 있는 중요한 항목을 식별하고 분류하는 것은 Information Protection 분야의 첫 번째 단계입니다. Microsoft Purview는 분류할 수 있도록 항목을 식별하는 세 가지 방법을 제공합니다.

  • 사용자가 직접
  • 중요한 정보 유형과 마찬가지로 자동 패턴 인식을 통해
  • 기계 학습을 통해

SIT(중요한 정보 유형)는 패턴 기반 분류자입니다. 주민 등록, 신용 카드 또는 은행 계좌 번호와 같은 중요한 정보를 감지하여 중요한 항목을 식별합니다. 모든 SIT의 전체 목록은 중요한 정보 유형 엔터티 정의를 참조하세요.

Microsoft는 미리 구성된 많은 SIT를 제공하거나 직접 만들 수 있습니다.

라이선싱

자격 증명 검사 SIT를 사용하려면 E5 라이선스가 필요합니다. 모든 자격 증명 검사 SIT 목록은 모든 자격 증명 중요한 정보 유형을 참조하세요. 이 SIT에는 포털에서 사용할 수 있는 모든 자격 증명 검사 SIT가 포함되어 있습니다. 이 SIT의 각 멤버는 자격 증명 검색 SIT이며 독립 실행형으로 사용할 수 있습니다. Microsoft에서 만든 여러 SIT 목록은 중요한 정보 유형 엔터티 정의를 참조하세요.

중요한 정보 유형은

중요한 정보 유형의 범주

기본 제공 중요한 정보 유형

Microsoft에서 이러한 SIT를 만들었으며 기본적으로 Purview 포털에 표시됩니다. 이러한 SIT는 편집할 수 없지만 사용자 지정 중요한 정보 유형을 만들기 위해 복사하여 템플릿으로 사용할 수 있습니다. 모든 SIT의 전체 목록은 중요한 정보 형식 엔터티 정의 를 참조하세요.

명명된 엔터티 중요한 정보 유형

명명된 엔터티 SIT는 기본적으로 Purview 포털에도 표시됩니다. 사용자 이름, 실제 주소 및 의료 약관을 검색합니다. 편집하거나 복사할 수 없습니다. 자세한 내용은 명명된 엔터티에 대한 자세한 내용을 참조하세요.

명명된 엔터티 SIT는 다음 두 가지 유형으로 제공됩니다.

번들 해제

이러한 명명된 엔터티 SIT는 단일 국가 또는 지역 또는 단일 용어 클래스와 같이 초점이 좁습니다. 검색 scope가 좁은 DLP(데이터 손실 방지) 정책이 필요한 경우 사용합니다. 명명된 엔터티 SIT 예제를 참조하세요.

번들

번들 명명된 엔터티 SIT는 모든 실제 주소와 같이 클래스에서 가능한 모든 일치 항목을 검색합니다. 중요한 항목을 검색하기 위한 DLP 정책에서 광범위한 기준으로 사용합니다. 명명된 엔터티 SIT 예제를 참조하세요.

엔드포인트 DLP 정책에서 번들 SIT를 사용하려면 고급 분류 검사 및 보호를 사용하도록 설정해야 합니다. 이 요구 사항은 번들로 제공되는 SITS 및 엔드포인트 DLP 정책의 조합에만 적용됩니다.

사용자 지정 중요한 정보 유형

미리 구성된 중요한 정보 유형이 요구 사항을 충족하지 않는 경우 완전히 정의하는 사용자 지정 중요한 정보 유형을 만들거나 기본 제공 정보 유형 중 하나를 복사하여 수정할 수 있습니다. 자세한 내용은 다음을 참조하십시오.

Microsoft Purview 포털에서 사용자 지정 중요한 정보 유형을 만듭니다.

정확한 데이터 일치 중요한 정보 유형

모든 정확한 데이터 일치(EDM) 기반 SIT는 처음부터 새로 만들어집니다. 중요한 정보 데이터베이스에서 정의하는 정확한 값이 있는 항목을 검색하는 데 사용합니다. 자세한 내용은 정확한 데이터 일치 기반 중요한 정보 유형에 대한 자세한 내용을 참조하세요.

중요한 정보 유형의 기본 부분

모든 SIT(중요한 정보 유형) 엔터티는 다음 필드로 구성됩니다.

  • 이름: 중요한 정보 유형을 참조하는 방법을 나타냅니다.
  • 설명: 중요한 정보 유형이 찾는 항목에 대한 설명입니다.
  • 패턴: SIT가 감지하는 항목을 정의합니다. 기본 요소, 지원 요소, 신뢰 수준, 근접성 구성 요소로 구성됩니다.

다음 표에서는 중요한 정보 유형을 정의하는 데 사용되는 패턴의 각 구성 요소에 대해 설명합니다.

패턴 구성 요소 설명
기본 요소 중요한 정보 유형이 찾는 기본 요소입니다. 체크섬 유효성 검사가 있거나 없는 정규식, 키워드(keyword) 목록, 키워드(keyword) 사전 또는 함수일 수 있습니다. 이러한 각 유형의 요소는 기존 SIT 목록에서 선택하거나 관리자 권한이 있는 사용자가 사용자 지정할 수 있습니다. 요소가 정의되면 기본 제공되는 요소와 함께 기존 요소 목록에 나타납니다.
지원 요소 확증적인 증거로 작용하는 요소. 포함된 경우 지원 요소는 검색된 일치 항목의 정확도와 관련하여 신뢰 수준을 높이는 데 도움이 됩니다. 예를 들어 기본 요소가 (9자리 숫자로 구성됨)로 SSN 정의되고 SSN(키워드(keyword)이 근처에서 SSN발견될 때 지원 요소로 사용되는 경우 감지된 항목 SSN 이 실제로 사회 보장 번호라는 신뢰도는 SSN(사회 보장 번호) 키워드(keyword)이 없는 경우보다 높습니다.

지원 요소는 정규식(체크섬 유효성 검사 포함 또는 미포함), 키워드(keyword) 목록 또는 키워드(keyword) 사전일 수 있습니다.
신뢰 수준 검색된 일치 항목에 대한 신뢰 수준은 높음, 보통, 낮음의 세 가지입니다. 신뢰 수준은 기본 요소와 함께 탐지된 증빙 증거의 양을 반영합니다. 검색된 항목에 포함된 증빙 증거가 많을수록 일치하는 항목에 찾고 있는 중요한 정보가 포함되어 있다는 신뢰도가 높아집니다. 신뢰 수준에 대한 자세한 내용은 이 문서의 뒷부분에 포함된 비디오를 참조하세요.
근접 지원 요소가 기본 요소에 얼마나 가까운지를 문자 수로 지정합니다.

근접 이해

다음 다이어그램은 근접성과 관련하여 일치 검색이 작동하는 방식을 보여줍니다. 이 예제에서 기본 요소는 필드이며 SSN SIT 정의에 따르면 값의 SSN 각 instance는 다음 요소 중 하나 이상에 대해 지정된 근접 내에 있어야 합니다.

  • AccountNumber
  • Name
  • DateOfBirth

다이어그램을 보면 검사 중인 데이터에 , , , , 및 SSN4필드의 SSNSSN1세 가지 인스턴스가 포함되어 있음을 알 수 있습니다. SSN3SSN2

확증 및 근접 창의 다이어그램 .

근접성이 작동하는 방식을 이해하기 위해 먼저 몇 가지 샘플 검색 기준을 살펴보겠습니다. 여기에서 9자리 사회 보장 번호를 감지하고 싶었습니다. 탐지 기준을 사용하려면 9자리 정규식(기본 요소)이 250자 이내(근접) 내에 나타나는 지원 증거(, NameDateOfBirth , 및 필드 중AccountNumber)와 함께 발견되어야 합니다.

다이어그램에 나와 있듯이 기본 요소 SSN1SSN4 만 설명된 검색 조건을 충족합니다. 자세히 살펴보겠습니다.

  • SSN1AccountNumber 경우 값은 지정된 근접 범위(250자) 내에 있으므로 일치하는 항목이 검색됩니다.
  • SSN3SSN2 경우 모두 기본 요소의 250자 이내에는 지원 요소가 없으므로 해당 값은 일치하는 것으로 검색되지 않습니다. 그러나 다이어그램에서 의 SSN2 근접 창을 보면 다음과 같은 질문을 할 수 있습니다 . SSN2 근접 창이 SSN2 요소로 Name 확장되지 않나요? 좋은 질문입니다. 대답 은 다음과 같습니다. 근접 창이 값 으로Name 확장되지만 전체 값을 포함하지는 않으므로 패턴이 일치하지 않습니다.
  • 마지막으로 SSN4의 경우 근접 창 내에 두 가지 지원 요소( NameDateOfBirth)가 있으므로 이 패턴도 일치합니다.

이 짧은 비디오에서 신뢰 수준에 대해 자세히 알아보세요.

중요한 정보 유형 예제

아르헨티나 국가 ID(DNI) 번호

형식

마침표로 구분된 8자리 숫자

패턴

8자리 숫자:

  • 두 자리 숫자
  • 마침표
  • 세 자리 숫자
  • 마침표
  • 세 자리 숫자
체크섬

아니요

정의

DLP 정책은 다음과 같은 경우 이러한 유형의 중요한 정보를 검색했다는 중간 신뢰도를 갖습니다.

  • 정규식 Regex_argentina_national_id는 패턴과 일치하는 콘텐츠를 찾습니다.
  • Keyword_argentina_national_id에서 키워드(keyword)이 발견되었습니다.
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
   <Pattern confidenceLevel="75">
      <IdMatch idRef="Regex_argentina_national_id"/>
      <Match idRef="Keyword_argentina_national_id"/>
  </Pattern>
</Entity>
키워드
Keyword_argentina_national_id
  • Argentina National Identity number
  • ID
  • 신분증: 주민등록증
  • DNI
  • NIC(National Registry of Persons)
  • Documento Nacional de Identidad
  • Registro Nacional de las Personas
  • Identidad
  • Identificación

신뢰 수준에 대한 자세한 정보

중요한 정보 유형 엔터티 정의에서 신뢰 수준 은 기본 요소 외에 탐지된 증빙 증거의 양을 반영합니다. 항목에 포함된 증빙 증거가 많을수록 일치하는 항목에 찾고 있는 중요한 정보가 포함되어 있다는 신뢰도가 높아집니다. 예를 들어 신뢰도가 높은 일치 항목은 기본 요소와 근접한 곳에 더 많은 지원 증거를 포함하는 반면, 신뢰 수준이 낮은 일치 항목에는 근접한 곳에 있는 지원 증거가 거의 또는 전혀 포함되지 않습니다.

신뢰 수준이 높을수록 가양성은 가장 적게 반환되지만 더 많은 가탐이 발생할 수 있습니다. 낮거나 중간 신뢰 수준은 더 많은 가양성을 반환하지만 거의 또는 0의 가음성 결과를 반환합니다.

  • 낮은 신뢰도: 일치하는 항목에 가장 적은 수의 가양성이 포함되지만 가장 많은 가양성이 포함됩니다. 낮은 신뢰도는 낮음, 중간 및 높은 신뢰도 일치 항목을 모두 반환합니다. 낮은 신뢰 수준의 값은 65입니다.
  • 중간 신뢰도: 일치하는 항목에는 평균 수의 가양성 및 거짓 부정이 포함됩니다. 중간 신뢰도는 모든 보통 및 높은 신뢰도 일치를 반환합니다. 중간 신뢰 수준의 값은 75입니다.
  • 높은 신뢰도: 일치하는 항목에 가양성이 가장 적지만 거짓 부정이 가장 많이 포함됩니다. 높은 신뢰도는 높은 신뢰도 일치만을 반환하며 값은 85입니다.

5에서 10개와 같이 낮은 신뢰도 수준 패턴과 20개 이상과 같이 높은 신뢰도 수준 패턴을 사용해야 합니다.

참고

숫자 기반 신뢰 수준( 정확도라고도 함)을 사용하여 정의한 기존 정책 또는 사용자 지정 SIT(중요한 정보 유형)가 있는 경우 자동으로 세 가지 개별 신뢰 수준에 매핑됩니다. 낮은 신뢰도, 중간 신뢰도 및 높은 신뢰도는 보안 @ 준수 센터 UI 전반에서 제공합니다.

  • 최소 정확도가 있는 모든 정책 또는 신뢰도 수준이 76에서 100 사이인 사용자 지정 SIT 패턴은 높은 신뢰도로 매핑됩니다.
  • 신뢰 수준이 66에서 75 사이인 최소 정확도 또는 사용자 지정 SIT 패턴이 있는 모든 정책은 중간 신뢰도로 매핑됩니다.
  • 신뢰 수준이 65보다 작거나 같은 최소 정확도 또는 사용자 지정 SIT 패턴이 있는 모든 정책은 낮은 신뢰도로 매핑됩니다.

사용자 지정 중요한 정보 유형 만들기

여러 옵션 중에서 선택하여 사용자 지정 중요한 정보 유형을 만들 수 있습니다.

  • UI 사용 - Purview 포털 UI를 사용하여 사용자 지정 중요한 정보 유형을 설정할 수 있습니다. 이 방법을 사용하면 정규식, 키워드 및 키워드 사전을 사용할 수 있습니다. 자세한 내용은 사용자 지정 중요한 정보 유형 만들기을 참조하십시오.

  • EDM 사용 - EDM(정확한 데이터 일치) 기반 분류를 사용하여 사용자 지정 중요한 정보 유형을 설정할 수 있습니다. 이 방법을 사용하면 주기적으로 새로 고칠 수 있는 보안 데이터베이스를 사용하여 동적인 중요한 정보 유형을 만들 수 있습니다. 정확한 데이터 일치 기반 중요한 정보 유형에 대해 알아보기를 참조하세요.

  • PowerShell 사용 - PowerShell을 사용하여 사용자 지정 중요한 정보 유형을 설정할 수 있습니다. 이 방법은 UI를 사용하는 것보다 복잡하지만 더 다양한 구성 옵션이 있습니다. 보안 & 규정 준수 PowerShell에서 사용자 지정 중요한 정보 유형 만들기를 참조하세요.

학습 가능한 분류자 조정

끝점 DLP는 DLP 정책에서의 사용률에 관계없이 사용자 지정 중요한 정보 유형을 포함하여 테넌트에서 사용할 수 있는 모든 중요한 정보 유형을 기반으로 파일을 분류합니다. 이로 인해 중요한 정보 형식이 제대로 조정되지 않고 많은 파일과 일치하게 되는 경우 과도한 분류 트래픽이 발생할 수 있습니다. 모든 사용자 지정 중요 정보 유형을 최적화해야 합니다. 이렇게 하려면 사용되지 않는 중요한 정보 유형을 제거하고 organization에 있는 대부분의 파일과 일치하는 경우 SIT를 다시 설계합니다. SIT Regex 유효성 검사기를 활용하여 SIT를 조정하는 방법에 대한 지침은 다음을 참조하세요. 중요한 정보 유형 REGEX 유효성 검사기 및 추가 검사

더블 바이트 문자 집합 지원

향상된 신뢰 수준은 Microsoft Purview 데이터 손실 방지 서비스, 정보 보호, 통신 규정 준수, 데이터 수명 주기 관리 및 레코드 관리 내에서 즉시 사용할 수 있습니다.

  • 이제 Information Protection에서 다음에 대해 더블 바이트 문자 집합 언어를 지원합니다.
  • 중국어(간체)
  • 중국어(번체)
  • 한국어
  • 일본어

이 지원은 중요한 정보 유형에 대해 사용할 수 있습니다. 자세한 내용은 더블 바이트 문자 집합 릴리스 정보에 대한 Information Protection 지원을 참조하십시오.

단일 바이트 문자 집합 지원

중국어/일본어 문자와 단일 바이트 문자가 포함된 패턴을 검색하거나 중국어/일본어 및 영어가 포함된 패턴을 검색하려면 키워드 또는 regex의 두 가지 변형을 정의합니다.

예를 들어 "机密的document"와 같은 키워드를 검색하려면 해당 키워드의 두 변형을 사용합니다. 일본어와 영어 텍스트 사이에 공백이 있고 일본어 텍스트와 영어 텍스트 사이에 공백이 없는 다른 텍스트가 있습니다. 따라서 SIT에 추가할 키워드는 "机密的 document" 및 "机密的document"여야 합니다. 마찬가지로 "東京オリンピック2020"라는 구를 검색하려면 두 가지 변형("東京オリンピック 2020" 및 "東京オリンピック2020")을 사용해야 합니다.

중국어/일본어/더블바이트 문자와 함께 키워드/구 목록에 중국어/일본어 이외의 단어도 포함된 경우(instance의 경우 영어만 해당) 두 개의 사전/키워드(keyword) 목록을 만들어야 합니다. 하나는 중국어/일본어/더블바이트 문자를 포함하는 키워드용이고 다른 하나는 영어 전용 키워드용입니다. 예를 들어 "극비", "機密性が高い", "机密的문서"의 세 구가 포함된 키워드(keyword) 사전/목록을 만들려면 두 개의 키워드(keyword) 목록을 만들어야 합니다.

  • 극비
  • 機密性が高い, 机密的document and 机密的document 더블바이트 하이픈이나 더블바이트 마침표를 사용하여 정규식을 만드는 경우, 정규식에서 하이픈이나 마침표를 이스케이프하는 것처럼 두 문자를 모두 이스케이프해야 합니다. 다음은 참조용 샘플 정규식입니다. (?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}

키워드(keyword) 목록에서 단어 일치 대신 문자열 일치를 사용하는 것이 좋습니다.

워크로드 간 감지 차이

동일한 중요한 정보 유형이 콘텐츠를 평가하는 위치에 따라 다른 결과를 생성할 수 있습니다. 예를 들어 전송 중인 이메일(Exchange), 미사용 파일(SharePoint 및 OneDrive) 및 관리되는 장치의 파일(엔드포인트 DLP). 엔드포인트 DLP는 테넌트에서 사용할 수 있는 모든 중요한 정보 유형에 대해 파일을 분류하며 엔드포인트 DLP 정책에서 번들 SIT를 사용하려면 고급 분류 검사 및 보호가 필요합니다.

프로덕션에서 사용자 지정 SIT를 사용하기 전에 메일 흐름 규칙, SharePoint 또는 OneDrive 정책 및 엔드포인트 정책과 같이 사용하려는 각 워크로드에서 이를 테스트하고 검색 의 유효성을 검사합니다. 검색은 최대 파일 크기 및 스캔한 문자 수와 같은 콘텐츠 추출 제한의 영향을 받을 수도 있습니다. DLP 플랫폼 고려사항을 참조하세요.

중요한 정보 유형 테스트

샘플 파일을 업로드하여 SIT를 테스트할 수 있습니다. 테스트 결과는 각 신뢰 수준에 대한 일치 항목 수를 보여줍니다. 기본 제공 SIT, 사용자 지정 SIT, 학습 가능한 분류자 및 정확한 데이터 일치를 테스트할 수 있습니다.

기본 제공 및 사용자 지정 중요한 정보 유형 테스트

정확한 데이터가 중요한 정보 유형과 일치하는지 테스트합니다.

사용자 지정 또는 기본 SIT 테넌트를 테스트하려면 테넌트에 하나 이상의 Exchange Online 라이선스가 추가되어야 합니다. 그렇지 않으면 SIT를 선택하면 테스트 SIT 옵션이 회색으로 표시됩니다.

중요한 정보 유형에서 일치/일치하지 않는 정확도 피드백 제공

중요한 정보 유형콘텐츠 탐색기에서 SIT의 일치 항목을 볼 수 있습니다. 또한 일치가 아닌일치 피드백 메커니즘을 사용하여 항목이 실제로 일치하는지 여부에 대한 피드백을 제공하고 해당 피드백을 사용하여 SIT를 조정할 수 있습니다. 자세한 내용은 분류기 정확도 향상을 참조하세요.

추가 정보

중요한 정보 유형을 사용하여 데이터 개인 정보 보호 규정을 준수하는 방법을 알아보려면 Microsoft 365(aka.ms/m365dataprivacy)를 사용하여 데이터 개인 정보 보호 규정에 대한 정보 보호 배포 를 참조하세요.