SIMILARIDADE TEXTUAL

Aplica-se a:Coluna calculadaTabela calculadaMedidaCálculo visual

Devolve uma pontuação de relevância em ponto flutuante que indica quão forte o texto numa coluna corresponde a uma cadeia de pesquisa.

Syntax

TEXTSIMILARITY(<within_text_column>, <search_text>[, <match_mode>])

Parameters

Term Definition
within_text_column Uma coluna que contém os valores de texto a pesquisar. A coluna deve ter o tipo de dado String.
search_text Uma cadeia de texto que define a condição de pesquisa.
match_mode (Opcional) O comportamento de correspondência a usar. Os valores suportados são TEXTMATCHING, FUZZYMATCHINGe PHRASEMATCHING. A predefinição é TEXTMATCHING.

Valor de retorno

Uma pontuação de relevância em ponto flutuante. Pontuações mais altas indicam maior relevância, e 0 indica que não há correspondência.

Compare as pontuações apenas entre os resultados da mesma pesquisa com a mesma coluna. As pontuações não são comparáveis entre diferentes cadeias de pesquisa ou colunas.

Modos de correspondência

Mode Comportamento
TEXTMATCHING Tokeniza search_text e pontua o texto que corresponde a qualquer token de pesquisa.
FUZZYMATCHING Pontua tokens semelhantes a tokens de pesquisa dentro de uma pequena distância de edição. Este modo suporta correspondência tolerante a erros tipográficos.
PHRASEMATCHING As pontuações escrevem quando os tokens analisados aparecem lado a lado e na ordem especificada. A pontuação não afeta a sequência de tokens.

Remarks

  • A pesquisa não diferencia maiúsculas de minúsculas.
  • A função aplica stemming específico da língua e remoção de palavras paradas com base na cultura modelo. Por exemplo, o stemming permite que uma pesquisa por run corresponda runninga , runs, e runner. A remoção de palavras finais ignora palavras de enchimento comuns como the, and, of, e in.
  • A colação por coluna não controla a linguagem do analisador. A cultura do modelo controla-o. No Power BI Desktop, selecioneOpções e Opçõesde Ficheiro>>Opções>de Ficheiro Atual>Configuração> RegionalLinguagem do Modelo para definir a linguagem do modelo. Para obter mais informações, veja FORMAT.
  • As culturas modelo suportadas são:
    • Inglês (en)
    • Francês (fr)
    • Alemão (de)
    • Espanhol (es)
    • Português (pt)
    • Russo (ru)
    • Árabe (ar)
    • Turco (tr)
    • Dinamarquês (da)
    • Neerlandês (nl)
    • Finlandês (fi)
    • Grego (el)
    • Húngaro (hu)
    • Italiano (it)
    • Norueguês (no, nb, e nn)
    • Romeno (ro)
    • Sueco (sv)
    • Tâmil (ta)
  • Para culturas não suportadas, TEXTSIMILARITY usa um tokenizador genérico em minúsculas sem remoção de stemming ou palavra de parada.
  • A dobra de destaque não é suportada. Por exemplo, café não corresponde a cafe.
  • A função requer um índice de texto completo persistente em within_text_column. É suportado para os modos de armazenamento Importação, Dual e Direct Lake. Outros modos de armazenamento devolvem um erro.
  • A função é avaliada linha a linha. Antes de o usar numa coluna calculada sobre uma tabela muito grande, teste o desempenho com uma carga de trabalho representativa.
  • Use o TEXTCONTAINS quando precisar de um resultado de correspondência booleana em vez de uma pontuação de relevância.

Examples

Devolve as linhas mais relevantes

A seguinte consulta devolve as cinco avaliações com as pontuações de relevância mais altas para great refrigerator:

EVALUATE
TOPN (
    5,
    FactReviews,
    TEXTSIMILARITY ( FactReviews[Text], "great refrigerator" ), DESC
)
Texto de exemplo Score
This is a great refrigerator, keeps everything cold and quiet. 3.42
Fantastic fridge! Great cooling performance and very spacious. 2.98
Our old refrigerator broke and this new one works great. 2.54
Refrigerator is decent, not great but gets the job done. 1.72
The refrigerator section is large, freezer is okay. 1.10

Linhas de filtro e de classificação

A consulta seguinte restringe o resultado a revisões que correspondam refrigeratora , e depois classifica-as pela sua relevância para great refrigerator:

EVALUATE
TOPN (
    5,
    FILTER (
        FactReviews,
        TEXTCONTAINS ( FactReviews[Text], "refrigerator" )
    ),
    TEXTSIMILARITY ( FactReviews[Text], "great refrigerator" ), DESC
)

TEXTCONTAINS e TEXTSIMILARITY executar de forma independente. Filtrar linhas com TEXTCONTAINS não altera o âmbito do índice usado para calcular TEXTSIMILARITY as pontuações.

Texto de exemplo Score
This is a great refrigerator - quiet, spacious, and keeps food fresh. 3.42
Fantastic fridge. Cooling performance is excellent and build quality is great. 3.01
Our old refrigerator died, but this new one works great and runs silently. 2,67
The refrigerator section is huge. Would be great if the freezer were larger. 1.94
Solid refrigerator. Not the best, but overall a great value for the price. 1.65

Mostrar pontuações de relevância

A consulta seguinte adiciona a pontuação de relevância para cada descrição de produto ao resultado:

EVALUATE
ADDCOLUMNS (
    Products,
    "Relevance score", TEXTSIMILARITY ( Products[Description], "wireless bluetooth" )
)
Texto de exemplo Score
Wireless headphones with Bluetooth 2.35
Wired headphones 0