了解敏感性資訊類型

識別及分類組織控制下的敏感性項目,是資訊保護領域中的第一個步驟。 Microsoft Purview 提供三種識別項目的方法,以便對其進行分類:

  • 手動、由使用者
  • 如同敏感資訊類型,透過自動模式識別
  • 透過 機器學習

敏感資訊類型 (SIT) 是模式分類器。 他們會偵測社會安全、信用卡或銀行帳號等敏感性資訊,以識別敏感性項目,請參閱 敏感性資訊類型實體定義以 取得所有 SIT 的完整清單。

Microsoft 提供大量預先設定的 SIT,您也可以自行建立。

授權

使用認證掃描 SIT 需要 E5 授權。 如需所有認證掃描 SIT 的清單,請參閱 所有認證敏感資訊類型。 此 SIT 包含入口網站中可用的所有認證掃描 SIT。 此 SIT 的每個成員都是認證掃描 SIT,並且可以獨立使用。 如需許多 Microsoft 建立的 SIT 的清單,請參閱 敏感資訊類型實體定義

敏感資訊類型用於

敏感資訊類型的類別

內建敏感資訊類型

Microsoft 已建立這些 SIT,且預設會顯示在 Purview 入口網站中。 無法編輯這些 SIT,但您可以複製它們以建立自訂敏感資訊類型,以作為範本使用。 請參閱所有 SIT 完整清單的 敏感資訊類型實體定義

具名實體敏感資訊類型

根據預設,具名實體 SIT 也會顯示在 Purview 入口網站中。 它們檢測人名、實際地址以及醫療條款和條件。 它們無法編輯或複製。 如需詳細資訊,請參閱 瞭解具名實體

具名實體 SIT 有兩種類型:

未搭售

這些具名實體 SIT 具有較窄的焦點,例如單一國家/地區或單一類別的字詞。 當您需要具有較窄偵測範圍的資料外洩防護 (DLP) 原則時,請使用它們。 請參閱, 具名實體 SIT 的範例

搭售

搭售的具名實體 SIT 會偵測類別中所有可能的相符項目,例如 [所有實體位址]。 在 DLP 原則中使用這些原則做為偵測敏感性項目的廣泛準則。 請參閱, 具名實體 SIT 的範例

提示

如果您想要在端點 DLP 原則中使用搭售的 SIT,則必須啟用 進階分類掃描和保護。 此需求是特定於搭售的 SITS 與端點 DLP 原則的組合。

自訂敏感性資訊類型

如果預先設定的敏感性資訊類型不符合您的需求,您可以建立完全定義的自訂敏感性資訊類型,也可以複製其中一個內建資訊類型並加以修改。 如需詳細資訊,請參閱

在 Microsoft Purview 入口網站中建立自訂敏感資訊類型

完全符合敏感資訊類型

所有完全符合 (EDM) 型 SIT 的確切資料都是從頭開始建立。 您可以使用它們來偵測具有您在敏感性資訊資料庫中定義的確切值的項目。 如需詳細資訊,請參閱 瞭解以完全資料比對為基礎的敏感性資訊類型

敏感資訊類型的基本部分

SIT) 實體 (每個敏感性資訊類型都包含下列欄位:

  • 名稱: 指出敏感性資訊類型的參照方式。
  • 描述: 說明敏感性資訊類型正在尋找的內容。
  • 模式: 定義 SIT 偵測的內容。 它由下列元件組成:主要元素、支援元素、信賴等級和鄰近性。

下表說明定義敏感資訊類型時所使用的模式每個元件。

圖樣元件 描述
主要元素 敏感資訊類型要尋找的主要元素。 它可以是具有或不具有總和檢查碼驗證的 規則運算式關鍵字清單關鍵字字典函數。每種類型的元素都可以從現有的 SIT 清單中選取,也可以由具有系統管理員權限的使用者自訂定義。 定義元素後,它會顯示在現有元素清單中,以及內建元素。
支撐元素 可做為佐證的元素。 包含時,支援元素有助於提高相對於偵測到的相符項目準確性的信賴度。 例如,如果主要元素定義為SSN由九位數) 組成的 (,而在附近SSN找到關鍵字 [社會安全號碼] ([SSN) ] 時,會使用關鍵字 [社會安全號碼] [SSN ] 做為支援元素,其信賴度SSN會高於社會安全號碼 (SSN 關鍵字不存在時) 。

支援元素可以是規則運算式 (,包含或不含總和檢查碼驗證) 、關鍵字清單或關鍵字字典。
信賴等級 偵測到的相符項目有三個信賴等級: 高、中和低。 信賴等級會反映與主要元素一起偵測到多少支持證據。 偵測到的項目包含的支援證據越多,相符項目包含您要尋找的敏感性資訊的信賴度就越高。 如需信賴等級的詳細資訊,請參閱本文稍後包含的影片。
鄰近 根據支撐元素與主要元素之間的字元數,指定支撐元素與主要元素之間的接近程度。

了解鄰近性

下圖顯示比對偵測在鄰近性方面的運作方式。 在此範例中,主要元素是 SSN 欄位,而 SIT 定義要求值的 SSN 每一個執行個體都必須位於至少下列其中一個元素的指定鄰近範圍內:

  • AccountNumber
  • Name
  • DateOfBirth

在圖表中,我們看到被檢查的資料包含欄位的SSN三個不同執行個體:SSN1、、 SSN2SSN3SSN4

佐證和鄰近視窗的圖表

要了解鄰近性的工作原理,讓我們先來看看一些示例檢測標準。 在這裡,他們想要檢測九位數的社會安全號碼。 偵測準則要求主要元素 (九位數的規則運算式) ,並搭配 、 和NameDateOfBirth欄位 (,在鄰近) (250 個字元以內的欄位) 中找到AccountNumber

如圖所示,只有主要元素 SSN1SSN4 符合描述的檢測標準。 接下來讓我們詳細探討。

  • 如果是 SSN1AccountNumber 該值位於 250 個字元的指定鄰近視窗內,因此會偵測到相符項目。
  • 在 和 SSN3SSN2兩種情況下,所有支援元素都不會出現在主要元素的 250 個字元內,因此不會將這些值偵測為相符項目。 但是,當您查看圖表中的 的 SSN2 近接視窗時,您可能會問: 為什麼沒有相 SSN2符項目 ?近接視窗不會 SSN2 延伸至元素嗎 Name 這是個好問題。 答案是: 不完全是。 雖然近接視窗延伸至值,Name但不包括整個值,因此模式不相符。
  • 最後,在 SSN4的情況下,鄰近視窗中有兩個支援元素,即 NameDateOfBirth和 ,因此此模式也相符。

在這段短片中深入了解信賴等級。

敏感資訊類型範例

阿根廷國民身分證 (DNI) 號碼

格式

以句號分隔的八位數

模式

八位數:

  • 兩位數
  • 期間
  • 三位數
  • 期間
  • 三位數
總和檢查碼

定義

如果在 250 個字元的附近範圍內,DLP 原則具有偵測到此類敏感性資訊的中等信賴度:

  • 規則運算式Regex_argentina_national_id尋找符合模式的內容。
  • 找到 Keyword_argentina_national_id 中的關鍵字。
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
   <Pattern confidenceLevel="75">
      <IdMatch idRef="Regex_argentina_national_id"/>
      <Match idRef="Keyword_argentina_national_id"/>
  </Pattern>
</Entity>
關鍵字
Keyword_argentina_national_id
  • 阿根廷國民身分證號碼
  • 身分識別
  • 身分證件:國民身分證
  • DNI
  • 國家人事登記處 (NIC)
  • Documento Nacional de Identidad
  • Registro Nacional de las Personas
  • Identidad
  • Identificación

深入了解信賴等級

在敏感資訊類型實體定義中, 信賴等級 會反映除了主要元素之外偵測到多少支援證據。 項目包含的支援證據越多,相符項目包含您要尋找之敏感性資訊的信賴度就越高。 例如,具有高置信度的比對在接近主要元素時包含更多支持證據,而具有低置信度的比對在接近時幾乎不包含支持證據。

信賴等級越高,傳回的誤判最少,但可能會導致更多的誤報。 低或中信賴等級會傳回較多的誤報,但很少有到零的誤報。

  • 低信賴度:相符項目包含最少的誤判,但最多的誤判。 低信賴度會傳回所有低、中和高信賴度相符項目。 低信賴等級的值為 65。
  • 中等信賴度:相符的項目包含誤判和誤報的平均數目。 [中等信賴度] 會傳回所有中信賴度和高信賴度相符項目。 中等信賴等級的值為 75。
  • 高信賴度:相符項目包含最少的誤判,但最多的誤報。 [高信心] 只會傳回高信賴度相符項目,且值為 85。

您應該使用具有低計數的高信賴度模式 (例如 5 到 10),以及具有較高計數 (例如 20 或更多) 的低信賴度模式。

注意事項

如果您有現有的原則或自訂機密資訊類型 (SIT) 使用數字型信賴等級 (也稱為 精確度) 來定義,它們會自動對應至三個離散的信賴等級;低信賴度、中信賴度和高信賴度,會跨越安全性 @ 合規性中心 UI。

  • 所有具有最低準確度或信賴等級介於 76 到 100 之間的自訂 SIT 模式的原則,都會對應為高信賴度。
  • 信賴等級介於 66 到 75 之間的所有具有最低準確度或自訂 SIT 模式的原則,都會對應至中等信賴度。
  • 所有具有最低準確度的原則,或信賴等級小於或等於 65 的自訂 SIT 模式,都會對應至低信賴度。

建立自訂敏感性資訊類型

您可以從數個選項中進行選擇,以建立自訂敏感資訊類型。

調整可訓練分類器

端點 DLP 會根據租用戶中所有可用的敏感資訊類型來分類檔案,包括自訂敏感資訊類型,無論其在任何 DLP 原則中的使用情況如何。 如果敏感性資訊類型未適當調整,而且最終會符合許多檔案,這可能會導致過多的分類流量。 您應該最佳化所有自訂敏感資訊類型。 若要這麼做,請移除未使用的敏感性資訊類型,如果 SIT 與貴組織中的大部分檔案相符,請重新設計 SIT。 如需利用 SIT Regex 驗證程式來調整 SIT 的指導方針,請參閱: 敏感資訊類型 REGEX 驗證程式和其他檢查

支援雙位元組字元集

增強的信賴等級可在 Microsoft Purview 資料外洩防護服務、資訊保護、通訊合規性、資料生命週期管理和記錄管理中立即使用。

  • 資訊保護現在支援適用的雙位元組字元集語言:
  • 中文 (簡體)
  • 中文 (繁體)
  • 韓文
  • 日文

這項支援適用於敏感性資訊類型。 如需詳細資訊,請參閱 雙位元組字元集的資訊保護支援版本資訊

單一位元組字元集支援

若要偵測包含中文/日文字元和單一位元組字元的模式,或偵測包含中文/日文和英文的模式,請定義關鍵字或 RegEx 的兩個變體。

例如,若要偵測關鍵字 ,例如「机密的document」,請使用關鍵字的兩個變體;一個在日文和英文文字之間具有空格,另一個在日文和英文文字之間沒有空格。 因此,要新增到 SIT 中的關鍵字應該是「机密的 document」和「机密的document」。 同樣地,若要偵測片語「東京オリンピック2020」,應該使用兩個變體;「東京オリンピック 2020」和「東京オリンピック2020」。

除了中文/日文/雙位元字元外,如果關鍵字/短語清單還包含非中文/日文單字,例如只有英文) (,您應該建立兩個字典/關鍵字清單。 一個用於包含中文/日文/雙位元字元的關鍵字,另一個用於僅限英文的關鍵字。 例如,如果您想建立一個包含「高度機密」、「機密性が高い」和「机密的文件」三個片語的關鍵字字典/清單,您應該建立兩個關鍵字清單。

  • Highly confidential
  • 機密性が高い, 机密的document and 机密的 document 使用雙位元組句點建立 RegEx 時,請務必像逸出 RegEx 中的連字號或句點一樣,同時逸出這兩個字元。 以下是範例 RegEx 供參考: (?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}

建議您在關鍵字清單中使用字串比對而非字詞比對。

工作負載之間的偵測差異

相同的敏感性資訊類型可能會根據評估內容的位置而產生不同的結果,例如,Exchange) 傳輸 (電子郵件、SharePoint 和 OneDrive) (待用檔案,以及端點 DLP) (受管理裝置上的檔案。 端點 DLP 會針對租用戶中 所有 可用的機密資訊類型分類檔案,在端點 DLP 原則中使用搭售的 SIT 需要 進階分類掃描和保護

在生產環境中依賴自訂 SIT 之前,請先 您想要使用它的每個工作負載中測試並驗證偵測,例如郵件流程規則、SharePoint 或 OneDrive 原則,以及端點原則。 偵測也會受到內容擷取限制的影響,例如檔案大小上限和掃描的字元數;請參閱 DLP 平台考量。

測試敏感資訊類型

您可以上傳範例檔案來測試 SIT。 測試結果會顯示每個信賴等級的相符數目。 您可以測試內建 SIT、自訂 SIT、可訓練分類器和精確資料比對。

測試內建和自訂敏感資訊類型

測試完全符合敏感性資訊類型的資料。

若要測試任何自訂或預設 SIT 租用戶,必須至少將一個 Exchange Online 授權新增至租用戶。 否則,選取任何 SIT 時,[測試 SIT] 選項會呈現灰色。

在敏感性資訊類型中提供符合/不相符精確度意見反應

您可以在 [敏感性資訊類型 ] 和 [內容總管] 中檢視 SIT 的相符項目數。 您也可以使用 [相符]、[ 不相符 ] 意見反應機制來提供項目是否實際相符的意見反應,並使用該意見反應來調整您的 SIT。 如需詳細資訊,請參閱 提高分類器精確度

如需進一步資訊

若要瞭解如何使用敏感性資訊類型來遵守資料隱私權法規,請參閱 使用 Microsoft 365 (aka.ms/m365dataprivacy) 部署資料隱私權法規的資訊保護