Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Область применения:SQL Server
Статистический семантический поиск извлекает и индексирует статистически значимые ключевые фразы из неструктурированных документов, хранящихся в базах данных SQL Server. Затем используются эти ключевые фразы для выявления похожих или связанных документов.
Обзор
Семантический поиск расширяет полнотекстовый поиск, сопоставляя значение документа, а не точные слова. Распространённые сценарии использования включают автоматическое извлечение тегов, обнаружение связанного контента и иерархическую навигацию по схожему контенту. Например, вы можете запросить индекс ключевых фраз для построения таксономии корпуса документов или запросить индекс сходства документа, чтобы найти резюме, соответствующие описанию вакансии.
Следующие примеры демонстрируют три Transact-SQL функции набора строк, которые вы используете для запроса семантических индексов и получения результатов в виде структурированных данных.
Поиск ключевых фраз в документе
Следующий запрос получает ключевые фразы, которые были определены в образце документа. Результаты представлены в порядке убывания оценки, определяющей статистическую значимость каждой ключевой фразы.
Этот запрос вызывает функцию semantickeyphrasetable.
SET @Title = 'Sample Document.docx';
SELECT @DocID = DocumentID
FROM Documents
WHERE DocumentTitle = @Title;
SELECT @Title AS Title,
keyphrase,
score
FROM SEMANTICKEYPHRASETABLE (Documents, *, @DocID)
ORDER BY score DESC;
Поиск похожих или связанных документов
Следующий запрос возвращает документы, которые были определены как схожие с образцом документа или связанные. Он возвращает результаты в порядке убывания показателя, обозначающего схожесть двух документов.
Этот запрос вызывает функцию semanticsimilaritytable.
SET @Title = 'Sample Document.docx';
SELECT @DocID = DocumentID
FROM Documents
WHERE DocumentTitle = @Title;
SELECT @Title AS SourceTitle,
DocumentTitle AS MatchedTitle,
DocumentID,
score
FROM SEMANTICSIMILARITYTABLE (Documents, *, @DocID)
INNER JOIN Documents
ON DocumentID = matched_document_key
ORDER BY score DESC;
Найдите ключевые фразы, которые делают документы похожими или связанными
Следующий запрос возвращает ключевые фразы, которые делают два документа схожими или связанными. Он возвращает результаты в порядке убывания показателя, обозначающего вес каждой ключевой фразы.
Этот запрос вызывает функцию semanticsimilaritydetailstable.
SET @SourceTitle = 'first.docx';
SET @MatchedTitle = 'second.docx';
SELECT @SourceDocID = DocumentID
FROM Documents
WHERE DocumentTitle = @SourceTitle;
SELECT @MatchedDocID = DocumentID
FROM Documents
WHERE DocumentTitle = @MatchedTitle;
SELECT @SourceTitle AS SourceTitle,
@MatchedTitle AS MatchedTitle,
keyphrase,
score
FROM SEMANTICSIMILARITYDETAILSTABLE (
Documents, DocumentContent, @SourceDocID, DocumentContent, @MatchedDocID
)
ORDER BY score DESC;
Хранение документов в SQL Server
Прежде чем индексировать документы с помощью семантического поиска, храните их в ядро СУБД.
Функция FileTable в SQL Server хранит неструктурированные файлы и документы в базе данных, чтобы вы могли обрабатывать их вместе со структурированными данными в Transact-SQL операциях на основе множества.
Для получения дополнительной информации о функции FileTable см. раздел FileTables. Для получения информации о функции FILESTREAM, которая является ещё одним вариантом хранения документов в базе данных, см. FILESTREAM.
Связанные задачи
| Статья | Description |
|---|---|
| Установка и настройка семантического поиска | Описывает компоненты, необходимые для статистического семантического поиска, и способы их установки и проверки. |
| Включите семантический поиск по таблицам и столбцам | Описывает способ включения или отключения статистического семантического индексирования в выбранных столбцах, содержащих документы или текст. |
| Поиск ключевых фраз в документах с помощью семантического поиска | Описывает способ поиска ключевых фраз в документах или текстовых столбцах, настроенных для статистического семантического индексирования. |
| Найдите похожие и связанные документы с помощью семантического поиска | Описывает процесс поиска схожих или связанных документов или текстовых значений и сведений об их сходстве или связи в столбцах, настроенных для статистического семантического индексирования. |
| Управление и мониторинг семантического поиска | Описывается процесс семантического индексирования и задачи, связанные с наблюдением за индексами и управлением ими. |