建立關鍵字字典

Microsoft Purview 可以識別、監控並保護你的敏感物品。 識別敏感性項目有時需要尋找關鍵字,特別是在識別一般內容 (例如醫療保健相關通訊),或是不適當或偏激的言語。 雖然你可以在 建立自訂敏感資訊類型時建立關鍵字清單,但關鍵字清單的大小有限,若你在 PowerShell 中建立自訂敏感資訊類型,則需要修改 XML 來建立或編輯它們。

相較之下,關鍵字字典提供更簡單的關鍵字管理,且規模更大,支援字典中最多 1 MB 的詞彙 (壓縮後的) 。 此外,關鍵字字典可以支援任何語言。 壓縮後的租用戶限制也是 1 MB。 壓縮後的限制為 1 MB,意味著同一租戶中所有字典合併後,字元數可接近一百萬個字元。

關鍵字字典限制

你可以建立關鍵字字典,但每個租戶壓縮後) 總大小限制為 1MB (。 要知道你的租戶中有多少個關鍵字字典,請 連接安全 & 合規 PowerShell ,然後執行這個 PowerShell 腳本:

$rawFile = $env:TEMP + "\rule.xml"

$kd = Get-DlpKeywordDictionary
$ruleCollections = Get-DlpSensitiveInformationTypeRulePackage
[System.IO.File]::WriteAllBytes((Resolve-Path $rawFile), $ruleCollections.SerializedClassificationRuleCollection)
$UnicodeEncoding = New-Object System.Text.UnicodeEncoding
$FileContent = [System.IO.File]::ReadAllText((Resolve-Path $rawFile), $unicodeEncoding)

if($kd.Count -gt 0)
{
$count = 0
$entities = $FileContent -split "Entity id"
for($j=1;$j -lt $entities.Count;$j++)
{
for($i=0;$i -lt $kd.Count;$i++)
{
$Matches = Select-String -InputObject $entities[$j] -Pattern $kd[$i].Identity -AllMatches
$count = $Matches.Matches.Count + $count
if($Matches.Matches.Count -gt 0) {break}
}
}

Write-Output "Total Keyword Dictionary SIT:"
$count
}
else
{
$Matches = Select-String -InputObject $FileContent -Pattern $kd.Identity -AllMatches
Write-Output "Total Keyword Dictionary SIT:"
$Matches.Matches.Count
}

Remove-Item $rawFile

建立關鍵字字典的基本步驟

最常見的做法是將關鍵字彙整成檔案,例如 .csv 或 .txt 清單。 你可以在建立或編輯時將字典檔案上傳到 SIT,或是透過 PowerShell cmdlet 匯入。 或者,你也可以從現有的關鍵字字典開始。 最後,你可以在 「新增關鍵字字典 」對話框中手動輸入關鍵字。 當你建立關鍵字字典時,你遵循相同的核心步驟:

使用 Microsoft Purview 入口網站建立關鍵字字典

請使用以下步驟來建立或匯入自訂字典的關鍵字:

  1. 登入 Microsoft Purview 入口網站資訊保護>分類>敏感資訊類型

  2. 選擇 + 建立敏感資訊類型,然後輸入你的敏感資訊類型名稱和描述。 選擇 [下一步]

  3. 「定義此敏感資訊類型 模式」頁面,選擇 + 建立模式

  4. 新模式 視窗中,選擇 信心等級

  5. 選擇 新增主要元素 並選擇 關鍵字字典

  6. 「新增關鍵字字典 」的跳躍功能中,你可以:

    1. 上傳 TXTCSV 格式的字典檔案。
    2. 從現有字典中選擇
    3. 或是手動輸入關鍵字並命名,建立新的字典。
  7. 新模式 視窗中的 字元接近度中,指定必須偵測到任何支援元素) 字元數量 (距離。 主要元素與輔助元素越接近,偵測到的內容就越可能是你所尋找的。

  8. 加入你想使用的 輔助元素 ,以提升偵測目標的準確度。

  9. 新增任何 額外檢查 ,然後選擇 建立

  10. 選擇 「下一步 」以繼續建立你的敏感資訊類型。 完成後,選擇 完成

使用 PowerShell 從檔案建立關鍵字字典

通常當你需要建立大型字典時,是為了能使用檔案中的關鍵字,或是從其他來源匯出的清單。 此程序會建立包含疾病清單的關鍵字字典,供外部電子郵件篩檢。 首先,你需要 連接 Security & Compliance PowerShell

  1. 將你的關鍵字複製到文字檔,並確保每個關鍵字都放在獨立行中。

  2. 用 Unicode 編碼儲存文字檔。 在記事本中,切換到 >「另存為>編碼>Unicode」。

  3. 執行下列 Cmdlet 將檔案讀成變數:

    $fileData = [System.IO.File]::ReadAllBytes('<filename>')
    
  4. 執行下列 Cmdlet 來建立字典:

    New-DlpKeywordDictionary -Name <name> -Description <description> -FileData $fileData
    

使用自訂敏感資訊類型和 DLP 原則中的關鍵字字典

關鍵字字典可做為自訂敏感性資訊類型的符合需求一部分,或做為敏感性資訊類型本身。 兩者都需要你 用 PowerShell 建立一個自訂的敏感資訊類型。 請依照 PowerShell 建立自訂敏感資訊類型 中的指示,建立敏感資訊類型。 一旦你拿到 XML,就需要從 XML 中取得 GUID 識別碼才能使用關鍵字字典。

<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" patternsProximity="300" recommendedConfidence="75">
    <Pattern confidenceLevel="75">
        <IdMatch idRef=". . ."/>
    </Pattern>
</Entity>

若要取得字典的身分識別,請執行下列命令,然後複製 Identity 屬性值:

Get-DlpKeywordDictionary -Name "Diseases"

此命令的輸出看起來像這樣:

RunspaceId : 138e55e7-ea1e-4f7a-b824-79f2c4252255
Identity : 8d2d44b0-91f4-41f2-94e0-21c1c5b5fc9f
Name : Diseases
Description : Names of diseases and injuries from ICD-10-CM lexicon
KeywordDictionary : aarskog's syndrome, abandonment, abasia, abderhalden-kaufmann-lignac, abdominalgia, abduction contracture, abetalipo proteinemia, abiotrophy, ablatio, ablation, ablepharia,abocclusion, abolition, aborter, abortion, abortus, aboulomania, abrami's disease, abramo
IsValid : True
ObjectState : Unchanged

身份 值貼到你自訂敏感資訊類型的 XML 中,作為 idRef。 接著,上傳 XML 檔案。 您的字典現在會出現在您的敏感資訊類型清單中,您可以在保單中直接使用,指定需要匹配的關鍵字數量。

<Entity id="11bb11bb-cc22-dd33-ee44-55ff55ff55ff" patternsProximity="300" recommendedConfidence="85">
      <Pattern confidenceLevel="85">
        <IdMatch idRef="8d2d44b0-91f4-41f2-94e0-21c1c5b5fc9f" />
      </Pattern>
    </Entity>
    <LocalizedStrings>
      <Resource idRef="11bb11bb-cc22-dd33-ee44-55ff55ff55ff">
        <Name default="true" langcode="en-us">Diseases</Name>
        <Description default="true" langcode="en-us">Detects various diseases</Description>
      </Resource>
    </LocalizedStrings>

注意事項

Microsoft 365 資訊保護支援下列雙位元組字元集語言:

  • 中文 (簡體)
  • 中文 (繁體)
  • 韓文
  • 日文

這項支援適用於敏感性資訊類型。 如需詳細資訊,請參閱資訊保護支援雙位元組字元集的版本資訊 (預覽版)

提示

若要偵測包含中文/日文字元和單一位元組字元的模式,或偵測包含中文/日文和英文的模式,請定義關鍵字或 RegEx 的兩個變體。

  • 例如,若要偵測關鍵字 ,例如「机密的document」,請使用關鍵字的兩個變體;一個在日文和英文文字之間具有空格,另一個在日文和英文文字之間沒有空格。 因此,要新增到 SIT 中的關鍵字應該是「机密的 document」和「机密的document」。 同樣地,若要偵測片語「東京オリンピック2020」,應該使用兩個變體;「東京オリンピック 2020」和「東京オリンピック2020」。

除了中文/日文/雙位元組字元外,如果關鍵字/片語清單中也包含非中文/日文單字, (例如獨立的英文單字) ,你應該建立兩個字典/關鍵字清單。 一個是包含中文/日文/雙位元組字元的關鍵字,另一個是英文單字。

  • 舉例來說,如果你想建立一個包含三個詞組「高度機密」、「機密性が高い」和「機密的文件」的關鍵字字典/清單,你應該建立兩個關鍵字清單。
    1. Highly confidential
    2. 機密性が高い、机密的document 和机密的 document

使用雙位元組連字號或雙位元組字元來建立 RegEx 時,請務必逸出這兩個字元,就像一個字元會逸出 RegEx 中的連字號或空格一樣。 這裡有一個範例正則表達式供參考:

  • (?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}

我們建議您在關鍵字清單中使用字串比對,而不是文字比對。