文本相似性

適用於:匯出數據行計算數據表量值視覺計算

回傳浮點相關性分數,顯示欄位中文字與搜尋字串的匹配度。

Syntax

TEXTSIMILARITY(<within_text_column>, <search_text>[, <match_mode>])

Parameters

字詞 Definition
within_text_column 一欄包含要搜尋的文字值。 欄位必須有 String 資料型態。
search_text 一個定義搜尋條件的文字串。
match_mode (可選)要用的配對行為。 支援值為 TEXTMATCHING、 FUZZYMATCHING、 PHRASEMATCHING和 。 預設值為 TEXTMATCHING。

返回值

浮點詞彙相關性分數。 在同一次評估中,分數越高表示匹配越強,0 表示不配對。

分數是一個不透明的排名值,而非百分比、機率或正規化相似度指標。 僅在相同搜尋情境內比較分數。

分數無法保證在不同查詢執行、搜尋字串、欄位、篩選上下文、資料來源或儲存模式、索引內容或世代,或執行計畫間都能比較或穩定。 這些因素即使文字值未變,也可能改變評分語料庫或評分實作。

比賽模式

Mode 行為
TEXTMATCHING 分詞化 search_text 並評分與任何搜尋標記相符的文字。
FUZZYMATCHING 在小編輯距離內,評分與搜尋標記相似的標記。 此模式支援容錯字匹配。
PHRASEMATCHING 當分析的代幣並排且以指定順序出現時,分數會顯示文字。 標點符號不會影響標記序列。

備註

  • 搜尋不區分大小寫。
  • 該功能根據模型文化應用語言特定的詞幹與終止詞移除。 例如,詞幹提取允許搜尋 以 run 匹配 running、 runs和 runner。 停止字移除會忽略常見的填充詞,如 the、 and、 ofin、 。
  • 每欄的排序並不控制分析器語言。 模特兒文化掌控著它。 在 Power BI 桌面版中,選擇檔案>選項與設定>選項>目前檔案>區域設定>模型語言以設定模型語言。 如需詳細資訊,請參閱 FORMAT。
  • 支持的模範文化包括:
    • 英文 (en)
    • 法語 (fr)
    • 德語 (de)
    • 西班牙語(es)
    • 葡萄牙文 (pt)
    • 俄語(ru)
    • 阿拉伯語(ar)
    • 土耳其文(tr)
    • 丹麥文(da)
    • 荷蘭文 (nl)
    • 芬蘭文 (fi)
    • 希臘文(el)
    • 匈牙利文 (hu)
    • 義大利語(it)
    • 挪威語 (no, nb, , 和 nn)
    • 羅馬尼亞文(ro)
    • 瑞典語 (sv)
    • 泰米爾語(ta)
  • 對於無支持的培養,則 TEXTSIMILARITY 使用通用的小寫分詞器,不使用詞幹或停止字移除。
  • 不支援重音摺疊。 例如,café 不符合 cafe。
  • 該函數需要在 上 within_text_column有持久的全文索引。 它支援匯入、雙重和直接湖儲存模式。 其他儲存模式則會回傳錯誤訊息。
  • 函數會逐列評估。 在計算欄位使用非常大的表格前,先用具代表性的工作負載測試效能。
  • 當你需要布林匹配結果而非相關性分數時,請使用 TEXTCONTAINS 。

範例

回傳最相關的列

以下查詢會回傳五個相關性分數 great refrigerator最高的評論:

EVALUATE
TOPN (
    5,
    FactReviews,
    TEXTSIMILARITY ( FactReviews[Text], "great refrigerator" ), DESC
)
範例測試 Score
This is a great refrigerator, keeps everything cold and quiet. 3.42
Fantastic fridge! Great cooling performance and very spacious. 2.98
Our old refrigerator broke and this new one works great. 2.54
Refrigerator is decent, not great but gets the job done. 1.72
The refrigerator section is large, freezer is okay. 1.10

濾波器與秩列

以下查詢將結果限制為符合 refrigerator的評論,並依其相關 great refrigerator性排序:

EVALUATE
TOPN (
    5,
    FILTER (
        FactReviews,
        TEXTCONTAINS ( FactReviews[Text], "refrigerator" )
    ),
    TEXTSIMILARITY ( FactReviews[Text], "great refrigerator" ), DESC
)

TEXTCONTAINS 並獨立 TEXTSIMILARITY 執行。 用 TEXTCONTAINS 篩選列並不會改變計算 TEXTSIMILARITY 分數的索引範圍。

範例測試 Score
This is a great refrigerator - quiet, spacious, and keeps food fresh. 3.42
Fantastic fridge. Cooling performance is excellent and build quality is great. 3.01
Our old refrigerator died, but this new one works great and runs silently. 2.67
The refrigerator section is huge. Would be great if the freezer were larger. 1.94
Solid refrigerator. Not the best, but overall a great value for the price. 1.65

顯示相關性分數

以下查詢將每個產品描述的相關性分數加入結果:

EVALUATE
ADDCOLUMNS (
    Products,
    "Relevance score", TEXTSIMILARITY ( Products[Description], "wireless bluetooth" )
)
範例測試 Score
Wireless headphones with Bluetooth 2.35
Wired headphones 0