Microsoft Purview 可以識別、監控並保護你的敏感物品。 識別敏感性項目有時需要尋找關鍵字,特別是在識別一般內容 (例如醫療保健相關通訊),或是不適當或偏激的言語。 雖然你可以在 建立自訂敏感資訊類型時建立關鍵字清單,但關鍵字清單的大小有限,若你在 PowerShell 中建立自訂敏感資訊類型,則需要修改 XML 來建立或編輯它們。
相較之下,關鍵字字典提供更簡單的關鍵字管理,且規模更大,支援字典中最多 1 MB 的詞彙 (壓縮後的) 。 此外,關鍵字字典可以支援任何語言。 壓縮後的租用戶限制也是 1 MB。 壓縮後的限制為 1 MB,意味著同一租戶中所有字典合併後,字元數可接近一百萬個字元。
關鍵字字典限制
你可以建立關鍵字字典,但每個租戶壓縮後) 總大小限制為 1MB (。 要知道你的租戶中有多少個關鍵字字典,請 連接安全 & 合規 PowerShell ,然後執行這個 PowerShell 腳本:
$rawFile = $env:TEMP + "\rule.xml"
$kd = Get-DlpKeywordDictionary
$ruleCollections = Get-DlpSensitiveInformationTypeRulePackage
[System.IO.File]::WriteAllBytes((Resolve-Path $rawFile), $ruleCollections.SerializedClassificationRuleCollection)
$UnicodeEncoding = New-Object System.Text.UnicodeEncoding
$FileContent = [System.IO.File]::ReadAllText((Resolve-Path $rawFile), $unicodeEncoding)
if($kd.Count -gt 0)
{
$count = 0
$entities = $FileContent -split "Entity id"
for($j=1;$j -lt $entities.Count;$j++)
{
for($i=0;$i -lt $kd.Count;$i++)
{
$Matches = Select-String -InputObject $entities[$j] -Pattern $kd[$i].Identity -AllMatches
$count = $Matches.Matches.Count + $count
if($Matches.Matches.Count -gt 0) {break}
}
}
Write-Output "Total Keyword Dictionary SIT:"
$count
}
else
{
$Matches = Select-String -InputObject $FileContent -Pattern $kd.Identity -AllMatches
Write-Output "Total Keyword Dictionary SIT:"
$Matches.Matches.Count
}
Remove-Item $rawFile
建立關鍵字字典的基本步驟
最常見的做法是將關鍵字彙整成檔案,例如 .csv 或 .txt 清單。 你可以在建立或編輯時將字典檔案上傳到 SIT,或是透過 PowerShell cmdlet 匯入。 或者,你也可以從現有的關鍵字字典開始。 最後,你可以在 「新增關鍵字字典 」對話框中手動輸入關鍵字。 當你建立關鍵字字典時,你遵循相同的核心步驟:
使用 Microsoft Purview 入口網站建立關鍵字字典
請使用以下步驟來建立或匯入自訂字典的關鍵字:
登入 Microsoft Purview 入口網站資訊保護>分類器>敏感資訊類型。
選擇 + 建立敏感資訊類型,然後輸入你的敏感資訊類型名稱和描述。 選擇 [下一步]。
在 「定義此敏感資訊類型 模式」頁面,選擇 + 建立模式。
在 新模式 視窗中,選擇 信心等級。
選擇 新增主要元素 並選擇 關鍵字字典。
在 「新增關鍵字字典 」的跳躍功能中,你可以:
- 上傳 TXT 或 CSV 格式的字典檔案。
- 從現有字典中選擇。
- 或是手動輸入關鍵字並命名,建立新的字典。
在 新模式 視窗中的 字元接近度中,指定必須偵測到任何支援元素) 字元數量 (距離。 主要元素與輔助元素越接近,偵測到的內容就越可能是你所尋找的。
加入你想使用的 輔助元素 ,以提升偵測目標的準確度。
新增任何 額外檢查 ,然後選擇 建立。
選擇 「下一步 」以繼續建立你的敏感資訊類型。 完成後,選擇 完成。
使用 PowerShell 從檔案建立關鍵字字典
通常當你需要建立大型字典時,是為了能使用檔案中的關鍵字,或是從其他來源匯出的清單。 此程序會建立包含疾病清單的關鍵字字典,供外部電子郵件篩檢。 首先,你需要 連接 Security & Compliance PowerShell。
將你的關鍵字複製到文字檔,並確保每個關鍵字都放在獨立行中。
用 Unicode 編碼儲存文字檔。 在記事本中,切換到 >「另存為>編碼>Unicode」。
執行下列 Cmdlet 將檔案讀成變數:
$fileData = [System.IO.File]::ReadAllBytes('<filename>')執行下列 Cmdlet 來建立字典:
New-DlpKeywordDictionary -Name <name> -Description <description> -FileData $fileData
使用自訂敏感資訊類型和 DLP 原則中的關鍵字字典
關鍵字字典可做為自訂敏感性資訊類型的符合需求一部分,或做為敏感性資訊類型本身。 兩者都需要你 用 PowerShell 建立一個自訂的敏感資訊類型。 請依照 PowerShell 建立自訂敏感資訊類型 中的指示,建立敏感資訊類型。 一旦你拿到 XML,就需要從 XML 中取得 GUID 識別碼才能使用關鍵字字典。
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" patternsProximity="300" recommendedConfidence="75">
<Pattern confidenceLevel="75">
<IdMatch idRef=". . ."/>
</Pattern>
</Entity>
若要取得字典的身分識別,請執行下列命令,然後複製 Identity 屬性值:
Get-DlpKeywordDictionary -Name "Diseases"
此命令的輸出看起來像這樣:
RunspaceId : 138e55e7-ea1e-4f7a-b824-79f2c4252255
Identity : 8d2d44b0-91f4-41f2-94e0-21c1c5b5fc9f
Name : Diseases
Description : Names of diseases and injuries from ICD-10-CM lexicon
KeywordDictionary : aarskog's syndrome, abandonment, abasia, abderhalden-kaufmann-lignac, abdominalgia, abduction contracture, abetalipo
proteinemia, abiotrophy, ablatio, ablation, ablepharia,abocclusion, abolition, aborter, abortion, abortus, aboulomania,
abrami's disease, abramo
IsValid : True
ObjectState : Unchanged
將 身份 值貼到你自訂敏感資訊類型的 XML 中,作為 idRef。 接著,上傳 XML 檔案。 您的字典現在會出現在您的敏感資訊類型清單中,您可以在保單中直接使用,指定需要匹配的關鍵字數量。
<Entity id="11bb11bb-cc22-dd33-ee44-55ff55ff55ff" patternsProximity="300" recommendedConfidence="85">
<Pattern confidenceLevel="85">
<IdMatch idRef="8d2d44b0-91f4-41f2-94e0-21c1c5b5fc9f" />
</Pattern>
</Entity>
<LocalizedStrings>
<Resource idRef="11bb11bb-cc22-dd33-ee44-55ff55ff55ff">
<Name default="true" langcode="en-us">Diseases</Name>
<Description default="true" langcode="en-us">Detects various diseases</Description>
</Resource>
</LocalizedStrings>
注意事項
Microsoft 365 資訊保護支援下列雙位元組字元集語言:
- 中文 (簡體)
- 中文 (繁體)
- 韓文
- 日文
這項支援適用於敏感性資訊類型。 如需詳細資訊,請參閱資訊保護支援雙位元組字元集的版本資訊 (預覽版)。
提示
若要偵測包含中文/日文字元和單一位元組字元的模式,或偵測包含中文/日文和英文的模式,請定義關鍵字或 RegEx 的兩個變體。
- 例如,若要偵測關鍵字 ,例如「机密的document」,請使用關鍵字的兩個變體;一個在日文和英文文字之間具有空格,另一個在日文和英文文字之間沒有空格。 因此,要新增到 SIT 中的關鍵字應該是「机密的 document」和「机密的document」。 同樣地,若要偵測片語「東京オリンピック2020」,應該使用兩個變體;「東京オリンピック 2020」和「東京オリンピック2020」。
除了中文/日文/雙位元組字元外,如果關鍵字/片語清單中也包含非中文/日文單字, (例如獨立的英文單字) ,你應該建立兩個字典/關鍵字清單。 一個是包含中文/日文/雙位元組字元的關鍵字,另一個是英文單字。
- 舉例來說,如果你想建立一個包含三個詞組「高度機密」、「機密性が高い」和「機密的文件」的關鍵字字典/清單,你應該建立兩個關鍵字清單。
- Highly confidential
- 機密性が高い、机密的document 和机密的 document
使用雙位元組連字號或雙位元組字元來建立 RegEx 時,請務必逸出這兩個字元,就像一個字元會逸出 RegEx 中的連字號或空格一樣。 這裡有一個範例正則表達式供參考:
(?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}
我們建議您在關鍵字清單中使用字串比對,而不是文字比對。