TEXTSIMILARITY

aplica-se a:coluna calculadatabela calculadamedidacálculo visual

Retorna uma pontuação de relevância de ponto flutuante que indica o quão fortemente o texto em uma coluna corresponde a uma cadeia de caracteres de pesquisa.

Syntax

TEXTSIMILARITY(<within_text_column>, <search_text>[, <match_mode>])

Parameters

Prazo Definition
within_text_column Uma coluna que contém os valores de texto a serem pesquisados. A coluna deve ter o tipo de dados String.
search_text Uma cadeia de caracteres de texto que define a condição de pesquisa.
match_mode (Opcional) O comportamento de correspondência a ser usado. Os valores com suporte são TEXTMATCHING, FUZZYMATCHINGe PHRASEMATCHING. O padrão é TEXTMATCHING.

Valor de devolução

Uma pontuação de relevância lexical de ponto flutuante. Em uma avaliação, uma pontuação mais alta indica uma correspondência mais forte e 0 não indica nenhuma correspondência.

A pontuação é um valor de classificação opaco, não uma porcentagem, uma probabilidade ou uma medida de similaridade normalizada. Compare as pontuações somente no mesmo contexto de pesquisa.

Não há garantia de que as pontuações sejam comparáveis ou estáveis em execuções de consulta separadas, cadeias de caracteres de pesquisa, colunas, contextos de filtro, fontes de dados ou modos de armazenamento, conteúdo de índice ou gerações ou planos de execução. Esses fatores podem alterar o corpus de pontuação ou a implementação de pontuação mesmo quando os valores de texto visíveis não são alterados.

Modos de partida

Modo Behavior
TEXTMATCHING Tokeniza search_text e pontua texto que corresponde a qualquer token de pesquisa.
FUZZYMATCHING Pontua tokens semelhantes aos tokens de pesquisa em uma pequena distância de edição. Esse modo dá suporte à correspondência tolerante a erros de digitação.
PHRASEMATCHING Pontua o texto quando os tokens analisados aparecem um ao lado do outro e na ordem especificada. A pontuação não afeta a sequência de tokens.

Observações

  • A pesquisa diferencia maiúsculas de minúsculas.
  • A função aplica a remoção de palavras irrelevantes e específicas do idioma com base na cultura do modelo. Por exemplo, o lematização permite que uma pesquisa run corresponda runningrunnere runs. A remoção de palavras irrelevantes ignora palavras de preenchimento comuns, como the, ande ofin.
  • A ordenação por coluna não controla a linguagem do analisador. A cultura do modelo controla-o. No Power BI Desktop, selecione Opções de Arquivo>e configurações Opções>> Dearquivo atual,idioma de modelode configurações> regionais do arquivo > para definir o idioma do modelo. Para obter mais informações, consulte FORMAT.
  • As culturas de modelo com suporte são:
    • Inglês (en)
    • Francês (fr)
    • Alemão (de)
    • Espanhol (es)
    • Português (pt)
    • Russo (ru)
    • Árabe (ar)
    • Turco (tr)
    • Dinamarquês (da)
    • Holandês (nl)
    • Finlandês (fi)
    • Grego (el)
    • Húngaro (hu)
    • Italiano (it)
    • Norueguês (noenbnn)
    • Romeno (ro)
    • Sueco (sv)
    • Tâmil (ta)
  • Para culturas sem suporte, TEXTSIMILARITY usa um tokenizador minúsculo genérico sem interrupção ou remoção de palavras irrelevantes.
  • Não há suporte para dobragem de ênfase. Por exemplo, café não corresponde a cafe.
  • A função requer um índice de texto completo persistente em within_text_column. Há suporte para os modos de armazenamento Importar, Dual e Direct Lake. Outros modos de armazenamento retornam um erro.
  • A função é avaliada linha por linha. Antes de usá-lo em uma coluna calculada em uma tabela muito grande, teste o desempenho com uma carga de trabalho representativa.
  • Use TEXTCONTAINS quando precisar de um resultado de correspondência booliana em vez de uma pontuação de relevância.

Examples

Retornar as linhas mais relevantes

A consulta a seguir retorna as cinco revisões com as pontuações de maior relevância para great refrigerator:

EVALUATE
TOPN (
    5,
    FactReviews,
    TEXTSIMILARITY ( FactReviews[Text], "great refrigerator" ), DESC
)
Texto do exemplo Pontuação
This is a great refrigerator, keeps everything cold and quiet. 3.42
Fantastic fridge! Great cooling performance and very spacious. 2.98
Our old refrigerator broke and this new one works great. 2.54
Refrigerator is decent, not great but gets the job done. 1.72
The refrigerator section is large, freezer is okay. 1.10

Filtrar e classificar linhas

A consulta a seguir restringe o resultado a revisões que correspondem refrigeratore, em seguida, as classifica por sua relevância como great refrigerator:

EVALUATE
TOPN (
    5,
    FILTER (
        FactReviews,
        TEXTCONTAINS ( FactReviews[Text], "refrigerator" )
    ),
    TEXTSIMILARITY ( FactReviews[Text], "great refrigerator" ), DESC
)

TEXTCONTAINS e TEXTSIMILARITY execute de forma independente. Filtrar linhas com TEXTCONTAINS não altera o escopo de índice usado para calcular TEXTSIMILARITY pontuações.

Texto do exemplo Pontuação
This is a great refrigerator - quiet, spacious, and keeps food fresh. 3.42
Fantastic fridge. Cooling performance is excellent and build quality is great. 3,01
Our old refrigerator died, but this new one works great and runs silently. 2,67
The refrigerator section is huge. Would be great if the freezer were larger. 1.94
Solid refrigerator. Not the best, but overall a great value for the price. 1.65

Exibir pontuações de relevância

A consulta a seguir adiciona a pontuação de relevância para cada descrição do produto ao resultado:

EVALUATE
ADDCOLUMNS (
    Products,
    "Relevance score", TEXTSIMILARITY ( Products[Description], "wireless bluetooth" )
)
Texto do exemplo Pontuação
Wireless headphones with Bluetooth 2.35
Wired headphones 0