Indexes - Create
建立新的搜尋索引。
POST {endpoint}/indexes?api-version=2026-04-01
URI 參數
| 名稱 | 位於 | 必要 | 類型 | Description |
|---|---|---|---|---|
|
endpoint
|
path | True |
string (uri) |
搜尋服務的端點 URL。 |
|
api-version
|
query | True |
string minLength: 1 |
用於此作業的 API 版本。 |
要求標頭
| 名稱 | 必要 | 類型 | Description |
|---|---|---|---|
| Accept |
接受標頭。 |
||
| x-ms-client-request-id |
string (uuid) |
一個不透明、全域唯一、由客戶端產生的請求字串識別碼。 |
要求本文
| 名稱 | 必要 | 類型 | Description |
|---|---|---|---|
| fields | True |
索引的欄位。 |
|
| name | True |
string |
索引的名稱。 |
| @odata.etag |
string |
索引的 ETag。 |
|
| analyzers | LexicalAnalyzer[]: |
索引的分析器。 |
|
| charFilters | CharFilter[]: |
索引的字元篩選。 |
|
| corsOptions |
控制索引之跨原始來源資源分享 (CORS) 的選項。 |
||
| defaultScoringProfile |
string |
如果在查詢中未指定評分配置檔,則為要使用的評分配置檔名稱。 如果未設定此屬性,而且查詢中未指定任何評分配置檔,則會使用預設評分 (tf-idf)。 |
|
| description |
string |
索引的描述。 |
|
| encryptionKey |
您在 Azure Key Vault 中建立的加密金鑰描述。 當你想完全確保沒有人,甚至連 Microsoft 都無法解密你的資料時,這個金鑰用來為你的資料提供額外的靜態加密層級。 加密數據之後,一律會保持加密狀態。 搜尋服務會忽略嘗試將此屬性設定為 Null。 如果您想要輪替加密金鑰,您可以視需要變更此屬性;您的數據不會受到影響。 使用客戶管理的金鑰加密不適用於免費搜尋服務,而且僅適用於 2019 年 1 月 1 日或之後建立的付費服務。 |
||
| normalizers | LexicalNormalizer[]: |
索引的正規化程式。 |
|
| scoringProfiles |
索引的評分配置檔。 |
||
| semantic |
定義影響語意功能的搜尋索引參數。 |
||
| similarity | SimilarityAlgorithm: |
評分和排名符合搜尋查詢的檔時所要使用的相似度演算法類型。 相似度演算法只能在索引建立時定義,而且無法在現有索引上修改。 如果為 null,則會使用 ClassicSimilarity 演算法。 |
|
| suggesters |
索引的建議工具。 |
||
| tokenFilters |
TokenFilter[]:
|
索引的令牌篩選。 |
|
| tokenizers | LexicalTokenizer[]: |
索引的Tokenizers。 |
|
| vectorSearch |
包含與向量搜尋相關的組態選項。 |
回應
| 名稱 | 類型 | Description |
|---|---|---|
| 201 Created |
要求已成功,因此已建立新的資源。 |
|
| Other Status Codes |
未預期的錯誤回應。 |
安全性
api-key
類型:
apiKey
位於:
header
OAuth2Auth
類型:
oauth2
Flow:
implicit
授權 URL:
https://login.microsoftonline.com/common/oauth2/v2.0/authorize
範圍
| 名稱 | Description |
|---|---|
| https://search.azure.com/.default |
範例
SearchServiceCreateIndex
範例要求
POST https://exampleservice.search.windows.net/indexes?api-version=2026-04-01
{
"name": "temp-example-index",
"description": "description",
"fields": [
{
"name": "id",
"type": "Edm.String",
"key": true,
"sortable": true
},
{
"name": "vector1",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 20,
"vectorSearchProfile": "config1"
},
{
"name": "vector1b",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 10,
"vectorSearchProfile": "config2"
},
{
"name": "vector2",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 5,
"vectorSearchProfile": "config3"
},
{
"name": "vector3",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 5,
"vectorSearchProfile": "config3"
},
{
"name": "vector22",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 10,
"vectorSearchProfile": "config2"
},
{
"name": "vector4",
"type": "Collection(Edm.Single)",
"retrievable": true,
"searchable": true,
"dimensions": 32,
"vectorSearchProfile": "config4"
},
{
"name": "name",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "en.lucene"
},
{
"name": "description",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "standard.lucene"
},
{
"name": "category",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "en.lucene"
},
{
"name": "ownerId",
"type": "Edm.String",
"retrievable": true,
"searchable": true,
"filterable": true,
"sortable": true,
"facetable": true,
"analyzer": "en.lucene"
},
{
"name": "price",
"type": "Edm.Double",
"retrievable": true,
"filterable": true,
"sortable": true,
"facetable": true
}
],
"scoringProfiles": [
{
"name": "stringFieldBoost",
"text": {
"weights": {
"name": 3,
"description": 1,
"category": 2,
"ownerId": 1
}
},
"functions": [
{
"tag": {
"tagsParameter": "categoryTag"
},
"type": "tag",
"fieldName": "category",
"boost": 2
}
]
}
],
"defaultScoringProfile": "stringFieldBoost",
"corsOptions": {
"allowedOrigins": [
"https://www.example.com/foo"
],
"maxAgeInSeconds": 10
},
"suggesters": [
{
"name": "sg",
"searchMode": "analyzingInfixMatching",
"sourceFields": [
"category",
"ownerId"
]
}
],
"analyzers": [
{
"tokenizer": "standard_v2",
"tokenFilters": [
"common_grams"
],
"charFilters": [
"html_strip"
],
"@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
"name": "tagsAnalyzer"
}
],
"tokenizers": [
{
"maxTokenLength": 100,
"@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
"name": "my_tokenizer"
}
],
"tokenFilters": [
{
"preserveOriginal": false,
"@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
"name": "my_tokenFilter"
}
],
"charFilters": [
{
"mappings": [
".=>,",
"_=>-"
],
"@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
"name": "my_mapping"
}
],
"normalizers": [
{
"tokenFilters": [
"my_tokenFilter"
],
"charFilters": [
"my_mapping"
],
"@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
"name": "my_normalizer"
}
],
"similarity": {
"k1": 10,
"b": 0.1,
"@odata.type": "#Microsoft.Azure.Search.BM25Similarity"
},
"semantic": {
"defaultConfiguration": "testconfig",
"configurations": [
{
"name": "testconfig",
"prioritizedFields": {
"titleField": {
"fieldName": "category"
},
"prioritizedContentFields": [
{
"fieldName": "description"
}
],
"prioritizedKeywordsFields": [
{
"fieldName": "ownerId"
}
]
},
"rankingOrder": "BoostedRerankerScore"
}
]
},
"vectorSearch": {
"profiles": [
{
"name": "config1",
"algorithm": "cosine",
"vectorizer": "openai",
"compression": "mySQ8"
},
{
"name": "config2",
"algorithm": "euclidean",
"vectorizer": "custom-web-api",
"compression": "mySQ8"
},
{
"name": "config3",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQC"
},
{
"name": "config4",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQWithoutOriginals"
}
],
"algorithms": [
{
"hnswParameters": {
"metric": "cosine"
},
"name": "cosine",
"kind": "hnsw"
},
{
"hnswParameters": {
"metric": "euclidean"
},
"name": "euclidean",
"kind": "hnsw"
},
{
"hnswParameters": {
"metric": "dotProduct"
},
"name": "dotProduct",
"kind": "hnsw"
}
],
"vectorizers": [
{
"azureOpenAIParameters": {
"resourceUri": "https://test-sample.openai.azure.com/",
"deploymentId": "model",
"apiKey": "api-key",
"modelName": "text-embedding-3-large"
},
"name": "openai",
"kind": "azureOpenAI"
},
{
"customWebApiParameters": {
"uri": "https://my-custom-endpoint.org/",
"httpHeaders": {
"header1": "value1",
"header2": "value2"
},
"httpMethod": "POST",
"timeout": "PT1M",
"authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
"authIdentity": {
"@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
}
},
"name": "custom-web-api",
"kind": "customWebApi"
},
{
"amlParameters": {
"uri": "https://my-custom-endpoint.org/",
"resourceId": "aml resource id",
"timeout": "PT1M",
"region": "aml region",
"modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
},
"name": "aml",
"kind": "aml"
},
{
"amlParameters": {
"uri": "https://my-custom-endpoint.org/",
"resourceId": "aml resource id",
"timeout": "PT1M",
"region": "aml region",
"modelName": "Cohere-embed-v4"
},
"name": "aml-cohere",
"kind": "aml"
}
],
"compressions": [
{
"scalarQuantizationParameters": {
"quantizedDataType": "int8"
},
"name": "mySQ8",
"kind": "scalarQuantization",
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
},
"truncationDimension": 2
},
{
"name": "myBQC",
"kind": "binaryQuantization",
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
},
"truncationDimension": 2
},
{
"name": "myBQWithoutOriginals",
"kind": "binaryQuantization",
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "discardOriginals"
},
"truncationDimension": 2
}
]
},
"@odata.etag": "0x1234568AE7E58A1"
}
範例回覆
{
"@odata.etag": "0x1234568AE7E58A1",
"name": "temp-example-index",
"description": "description",
"defaultScoringProfile": "stringFieldBoost",
"fields": [
{
"name": "id",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": true,
"synonymMaps": []
},
{
"name": "vector1",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 20,
"vectorSearchProfile": "config1",
"synonymMaps": []
},
{
"name": "vector1b",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 10,
"vectorSearchProfile": "config2",
"synonymMaps": []
},
{
"name": "vector2",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 5,
"vectorSearchProfile": "config3",
"synonymMaps": []
},
{
"name": "vector3",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 5,
"vectorSearchProfile": "config3",
"synonymMaps": []
},
{
"name": "vector22",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 10,
"vectorSearchProfile": "config2",
"synonymMaps": []
},
{
"name": "vector4",
"type": "Collection(Edm.Single)",
"searchable": true,
"filterable": false,
"retrievable": true,
"stored": true,
"sortable": false,
"facetable": false,
"key": false,
"dimensions": 32,
"vectorSearchProfile": "config4",
"synonymMaps": []
},
{
"name": "name",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "description",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "standard.lucene",
"synonymMaps": []
},
{
"name": "category",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "ownerId",
"type": "Edm.String",
"searchable": true,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"analyzer": "en.lucene",
"synonymMaps": []
},
{
"name": "price",
"type": "Edm.Double",
"searchable": false,
"filterable": true,
"retrievable": true,
"stored": true,
"sortable": true,
"facetable": true,
"key": false,
"synonymMaps": []
}
],
"scoringProfiles": [
{
"name": "stringFieldBoost",
"functionAggregation": "sum",
"text": {
"weights": {
"name": 3,
"description": 1,
"category": 2,
"ownerId": 1
}
},
"functions": [
{
"fieldName": "category",
"interpolation": "linear",
"type": "tag",
"boost": 2,
"tag": {
"tagsParameter": "categoryTag"
}
}
]
}
],
"corsOptions": {
"allowedOrigins": [
"https://www.example.com/foo"
],
"maxAgeInSeconds": 10
},
"suggesters": [
{
"name": "sg",
"searchMode": "analyzingInfixMatching",
"sourceFields": [
"category",
"ownerId"
]
}
],
"analyzers": [
{
"@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
"name": "tagsAnalyzer",
"tokenizer": "standard_v2",
"tokenFilters": [
"common_grams"
],
"charFilters": [
"html_strip"
]
}
],
"normalizers": [
{
"@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
"name": "my_normalizer",
"tokenFilters": [
"my_tokenFilter"
],
"charFilters": [
"my_mapping"
]
}
],
"tokenizers": [
{
"@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
"name": "my_tokenizer",
"maxTokenLength": 100
}
],
"tokenFilters": [
{
"@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
"name": "my_tokenFilter",
"preserveOriginal": false
}
],
"charFilters": [
{
"@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
"name": "my_mapping",
"mappings": [
".=>,",
"_=>-"
]
}
],
"similarity": {
"@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
"k1": 10,
"b": 0.1
},
"semantic": {
"defaultConfiguration": "testconfig",
"configurations": [
{
"name": "testconfig",
"rankingOrder": "BoostedRerankerScore",
"prioritizedFields": {
"titleField": {
"fieldName": "category"
},
"prioritizedContentFields": [
{
"fieldName": "description"
}
],
"prioritizedKeywordsFields": [
{
"fieldName": "ownerId"
}
]
}
}
]
},
"vectorSearch": {
"algorithms": [
{
"name": "cosine",
"kind": "hnsw",
"hnswParameters": {
"metric": "cosine",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
},
{
"name": "euclidean",
"kind": "hnsw",
"hnswParameters": {
"metric": "euclidean",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
},
{
"name": "dotProduct",
"kind": "hnsw",
"hnswParameters": {
"metric": "dotProduct",
"m": 4,
"efConstruction": 400,
"efSearch": 500
}
}
],
"profiles": [
{
"name": "config1",
"algorithm": "cosine",
"vectorizer": "openai",
"compression": "mySQ8"
},
{
"name": "config2",
"algorithm": "euclidean",
"vectorizer": "custom-web-api",
"compression": "mySQ8"
},
{
"name": "config3",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQC"
},
{
"name": "config4",
"algorithm": "dotProduct",
"vectorizer": "custom-web-api",
"compression": "myBQWithoutOriginals"
}
],
"vectorizers": [
{
"name": "openai",
"kind": "azureOpenAI",
"azureOpenAIParameters": {
"resourceUri": "https://test-sample.openai.azure.com",
"deploymentId": "model",
"apiKey": "api-key",
"modelName": "text-embedding-3-large"
}
},
{
"name": "custom-web-api",
"kind": "customWebApi",
"customWebApiParameters": {
"httpMethod": "POST",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
"httpHeaders": {
"header1": "value1",
"header2": "value2"
},
"authIdentity": {
"@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
}
}
},
{
"name": "aml",
"kind": "aml",
"amlParameters": {
"resourceId": "aml resource id",
"region": "aml region",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
}
},
{
"name": "aml-cohere",
"kind": "aml",
"amlParameters": {
"resourceId": "aml resource id",
"region": "aml region",
"uri": "https://my-custom-endpoint.org/",
"timeout": "PT1M",
"modelName": "Cohere-embed-v4"
}
}
],
"compressions": [
{
"name": "mySQ8",
"kind": "scalarQuantization",
"truncationDimension": 2,
"scalarQuantizationParameters": {
"quantizedDataType": "int8"
},
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
}
},
{
"name": "myBQC",
"kind": "binaryQuantization",
"truncationDimension": 2,
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "preserveOriginals"
}
},
{
"name": "myBQWithoutOriginals",
"kind": "binaryQuantization",
"truncationDimension": 2,
"rescoringOptions": {
"enableRescoring": true,
"defaultOversampling": 10,
"rescoreStorageMethod": "discardOriginals"
}
}
]
}
}
定義
| 名稱 | Description |
|---|---|
| Accept |
接受標頭。 |
|
AIFoundry |
這是 Azure AI Foundry 目錄中將命名的嵌入模型名稱。 |
| AMLParameters |
指定連接到 AML 向量化工具的屬性。 |
| AMLVectorizer |
指定透過 Azure AI Foundry 模型目錄部署的 Azure Machine Learning 端點,用於產生查詢字串的向量嵌入。 |
|
Ascii |
如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Azure |
將呼叫的 Azure Open AI 模型名稱。 |
|
Azure |
指定用來向量化查詢字串的 Azure OpenAI 資源。 |
|
Azure |
指定連線到 Azure OpenAI 資源的參數。 |
|
Binary |
包含二進位量化壓縮方法在編製索引和查詢期間所使用的組態選項。 |
|
BM25Similarity |
根據 Okapi BM25 相似度演算法的排名函式。 BM25 是類似TF-IDF的演算法,包括長度正規化(由'b' 參數控制)以及詞彙頻率飽和度(由 'k1' 參數控制)。 |
|
Char |
定義搜尋引擎支援的所有字元篩選器的名稱。 |
|
Cjk |
形成從標準Tokenizer產生的CJK詞彙 bigram。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Cjk |
CjkBigramTokenFilter 可以忽略的腳本。 |
|
Classic |
舊版相似度演算法,其使用 TF-IDF 的 Lucene TFIDFSimilarity 實作。 這種 TF-IDF 變化引進靜態文件長度正規化,以及協調因只部分符合搜尋查詢的檔而受懲罰的因素。 |
|
Classic |
適用於處理大部分歐洲語言檔的文法型Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Common |
建立經常出現詞彙的雙詞組,並在建立索引時使用。 仍會編製單個字詞的索引,並與雙字母組重疊。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Cors |
定義選項,以控制索引的跨原始來源資源分享 (CORS)。 |
|
Custom |
可讓您控制將文字轉換成可編製索引/可搜尋令牌的程式。 它是使用者定義的組態,由單一預先定義的Tokenizer和一或多個篩選所組成。 Tokenizer 負責將文字分成令牌,以及修改 Tokenizer 所發出的令牌的篩選條件。 |
|
Custom |
可讓您設定可篩選、可排序和多面向字段的正規化,依預設會以嚴格的比對運作。 這是由至少一或多個篩選所組成的使用者定義組態,可修改所儲存的令牌。 |
|
Dictionary |
分解在許多日耳曼語系中找到的複合字。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Distance |
定義根據地理位置距離提升分數的函式。 |
|
Distance |
提供距離評分函式的參數值。 |
|
Edge |
從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Edge |
指定應從輸入的哪一側產生 n-gram。 |
|
Edge |
從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Edge |
將邊緣的輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Elision |
移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Error |
資源管理錯誤附加資訊。 |
|
Error |
錯誤詳細資料。 |
|
Error |
所有 Azure Resource Manager API 的常見錯誤回應,用於回傳失敗操作的錯誤細節。 (這也遵循 OData 錯誤回應格式。)。 |
|
Exhaustive |
包含查詢期間所使用完整 KNN 演算法的特定組態選項,這會在整個向量索引上執行暴力密碼破解搜尋。 |
|
Exhaustive |
包含完整 KNN 演算法特有的參數。 |
|
Freshness |
定義函式,根據日期時間欄位的值來提升分數。 |
|
Freshness |
提供更新評分函式的參數值。 |
|
Hnsw |
包含索引和查詢期間使用的 HNSW 近似最近鄰演算法特有的組態選項。 HNSW 演算法在搜尋速度和準確性之間提供了可調整的權衡。 |
|
Hnsw |
包含 HNSW 演算法特定的參數。 |
|
Keep |
令牌篩選條件,只保留包含指定單字清單中的文字標記。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Keyword |
將字詞標示為關鍵字。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Keyword |
以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Keyword |
以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Length |
移除太長或太短的文字。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Lexical |
定義搜尋引擎支援的所有文字分析器的名稱。 |
|
Lexical |
定義搜尋引擎支援的所有文字正規化程式的名稱。 |
|
Lexical |
定義搜尋引擎支援的所有標記器的名稱。 |
|
Limit |
限制索引過程中的標記數量。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Lucene |
標準 Apache Lucene 分析器;由標準 Tokenizer、小寫篩選和停止篩選所組成。 |
|
Lucene |
在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Lucene |
在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Magnitude |
定義函式,根據數值欄位的大小來提升分數。 |
|
Magnitude |
提供量級評分函式的參數值。 |
|
Mapping |
套用對應選項所定義的對應的字元篩選。 比對採用貪婪演算法 (由指定點上最長的模式比對勝出) 替換字串可以是空字串。 此字元篩選器是使用 Apache Lucene 實作。 |
|
Microsoft |
使用語言特有的規則來分割文字,並將字組縮減到其基本形式。 |
|
Microsoft |
使用語言特有的規則分割文字。 |
|
Microsoft |
列出 Microsoft 語言詞幹分詞器所支援的語言。 |
|
Microsoft |
列出 Microsoft 語言分詞器所支援的語言。 |
|
NGram |
產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
NGram |
產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
NGram |
將輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Path |
路徑類階層的 Token 化工具。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Pattern |
透過規則運算式模式彈性地將文字分割成字詞。 此分析器是使用 Apache Lucene 實作的。 |
|
Pattern |
使用 Java regex 來發出多個令牌 - 一個或多個模式中每個擷取群組各一個。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Pattern |
字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此字元篩選器是使用 Apache Lucene 實作。 |
|
Pattern |
字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Pattern |
使用 regex 模式比對來建構不同令牌的 Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Phonetic |
識別要與 PhoneticTokenFilter 搭配使用的語音編碼器類型。 |
|
Phonetic |
建立拼音相符的標記。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Ranking |
代表用於文件排序順序的分數。 |
|
Rescoring |
包含重新記錄的選項。 |
|
Scalar |
包含索引編製和查詢期間所使用純量量化壓縮方法的特定組態選項。 |
|
Scalar |
包含純量量化特有的參數。 |
|
Scoring |
定義用來合併評分設定檔中所有評分函數結果的彙總函數。 |
|
Scoring |
定義用來在一系列文件中插補分數提升的函數。 |
|
Scoring |
定義影響搜尋查詢評分之搜尋索引的參數。 |
|
Search |
表示索引定義中的欄位,描述欄位的名稱、數據類型和搜尋行為。 |
|
Search |
定義搜尋索引中欄位的資料類型。 |
|
Search |
表示搜尋索引定義,描述索引的欄位和搜尋行為。 |
|
Search |
清除資料源的識別屬性。 |
|
Search |
指定要使用之數據源的身分識別。 |
|
Search |
Azure Key Vault 中客戶管理的加密密鑰。 您建立和管理的金鑰可用來加密或解密靜態資料,例如索引和同義字對映。 |
|
Search |
定義建議 API 應如何套用至索引中的欄位群組。 |
|
Semantic |
定義在語意功能內容中使用的特定組態。 |
|
Semantic |
做為語意組態一部分的欄位。 |
|
Semantic |
描述要用於語意排名、標題、醒目提示和答案的標題、內容和關鍵詞欄位。 |
|
Semantic |
定義影響語意功能的搜尋索引參數。 |
|
Shingle |
將標記組合建立為單一標記。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Snowball |
使用 Snowball 產生的字幹分析器來幹詞的篩選。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Snowball |
要用於 Snowball 權杖篩選器的語言。 |
|
Stemmer |
提供使用自定義字典型字幹分析覆寫其他字幹篩選的功能。 任何字典字幹字詞都會標示為關鍵詞,因此它們不會在鏈結中加上字幹分析器。 必須放在任何詞幹分析篩選器之前。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html |
|
Stemmer |
語言特定字幹分析篩選器。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters |
|
Stemmer |
用於詞幹計算器權杖篩選器的語言。 |
|
Stop |
將文字分割為非字母;套用小寫和停用字詞標記篩選。 此分析器是使用 Apache Lucene 實作的。 |
|
Stopwords |
識別語言特定停用字詞的預先定義清單。 |
|
Stopwords |
從語彙基元資料流移除停用字詞。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html |
|
Synonym |
比對令牌數據流中的單字或多字同義字。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Tag |
定義函式,此函式會使用符合指定標籤清單的字串值來提升檔的分數。 |
|
Tag |
提供標記評分函式的參數值。 |
|
Text |
定義索引欄位的加權,比對應該在搜尋查詢中提升評分。 |
|
Token |
代表權杖過濾器可以操作的字元類別。 |
|
Token |
定義搜尋引擎支援的所有權杖篩選器的名稱。 |
|
Truncate |
將字詞截斷為特定長度。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Uax |
將 URL 和電子郵件標記化為一個標記。 這個 Tokenizer 是使用 Apache Lucene 實作。 |
|
Unique |
篩選出與前一個字元相同文字的字元。 此令牌篩選器是使用 Apache Lucene 實作。 |
|
Vector |
解譯向量欄位內容的編碼格式。 |
|
Vector |
包含與向量搜尋相關的組態選項。 |
|
Vector |
用於索引和查詢的演算法。 |
|
Vector |
用於向量比較的相似性指標。 建議選擇與內嵌模型訓練時相同的相似度指標。 |
|
Vector |
用於索引和查詢的壓縮方法。 |
|
Vector |
壓縮向量值的量化資料類型。 |
|
Vector |
定義要與向量搜尋搭配使用的組態組合。 |
|
Vector |
查詢期間要使用的向量化方法。 |
|
Web |
指定使用者定義的向量化程式,以產生查詢字串的向量內嵌。 外部向量化工具的整合是使用技能集的自定義 Web API 介面來達成。 |
|
Web |
指定連接到使用者定義向量化工具的屬性。 |
|
Word |
將字組分割成部分字組,並對部分字組群組執行選擇性的轉換。 此令牌篩選器是使用 Apache Lucene 實作。 |
Accept
接受標頭。
| 值 | Description |
|---|---|
| application/json;odata.metadata=minimal |
AIFoundryModelCatalogName
這是 Azure AI Foundry 目錄中將命名的嵌入模型名稱。
| 值 | Description |
|---|---|
| OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32 |
OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32 |
| OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336 |
OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336 |
| Facebook-DinoV2-Image-Embeddings-ViT-Base |
Facebook-DinoV2-圖像嵌入-ViT-Base |
| Facebook-DinoV2-Image-Embeddings-ViT-Giant |
Facebook-DinoV2-圖像嵌入-ViT-Giant |
| Cohere-embed-v3-english |
Cohere-embed-v3-english |
| Cohere-embed-v3-multilingual |
Cohere-embed-v3-multilingual |
| Cohere-embed-v4 |
Cohere embed v4 模型,用於從文本和圖像生成嵌入。 |
AMLParameters
指定連接到 AML 向量化工具的屬性。
| 名稱 | 類型 | Description |
|---|---|---|
| key |
string |
(金鑰驗證的必要專案)AML 服務的金鑰。 |
| modelName |
來自 Azure AI Foundry 目錄的嵌入模型名稱,部署於所提供端點。 |
|
| region |
string |
(令牌驗證的選擇性)。 AML 服務所部署的區域。 |
| resourceId |
string |
(令牌驗證的必要專案)。 AML 服務的 Azure Resource Manager 資源 ID。 格式應該是 subscriptions/{guid}/resourceGroups/{resource-group-name}/Microsoft。MachineLearningServices/workspaces/{workspace-name}/services/{service_name}. |
| timeout |
string (duration) |
(選擇性) 指定時,表示進行 API 呼叫的 http 用戶端逾時。 |
| uri |
string (uri) |
( 不需要驗證或金鑰驗證 )將傳送 JSON 承載之 AML 服務的評分 URI。 只允許 HTTPs URI 配置。 |
AMLVectorizer
指定透過 Azure AI Foundry 模型目錄部署的 Azure Machine Learning 端點,用於產生查詢字串的向量嵌入。
| 名稱 | 類型 | Description |
|---|---|---|
| amlParameters |
指定 AML 向量化工具的屬性。 |
|
| kind |
string:
aml |
向量搜尋向量器類型。 |
| name |
string |
要與這個特定向量化方法產生關聯的名稱。 |
AsciiFoldingTokenFilter
如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| preserveOriginal |
boolean |
False |
值,指出是否要保留原始令牌。 預設值為 false。 |
AzureOpenAIModelName
將呼叫的 Azure Open AI 模型名稱。
| 值 | Description |
|---|---|
| text-embedding-ada-002 |
TextEmbeddingAda002 模型。 |
| text-embedding-3-large |
TextEmbedding3Large 模型。 |
| text-embedding-3-small |
TextEmbedding3小型模型。 |
| gpt-5-mini |
Gpt5Mini 型號。 |
| gpt-5-nano |
Gpt5Nano 模型。 |
| gpt-5.4-mini |
Gpt54Mini 型號。 |
| gpt-5.4-nano |
Gpt54Nano 模型。 |
AzureOpenAIVectorizer
指定用來向量化查詢字串的 Azure OpenAI 資源。
| 名稱 | 類型 | Description |
|---|---|---|
| azureOpenAIParameters |
包含 Azure OpenAI 內嵌向量化的特定參數。 |
|
| kind |
string:
azure |
向量搜尋向量器類型。 |
| name |
string |
要與這個特定向量化方法產生關聯的名稱。 |
AzureOpenAIVectorizerParameters
指定連線到 Azure OpenAI 資源的參數。
| 名稱 | 類型 | Description |
|---|---|---|
| apiKey |
string |
所指定 Azure OpenAI 資源的 API 金鑰。 |
| authIdentity | SearchIndexerDataIdentity: |
用於輸出連線的使用者指派受控識別。 |
| deploymentId |
string |
指定資源上 Azure OpenAI 模型部署的識別碼。 |
| modelName |
在提供的 deploymentId 路徑上部署的內嵌模型名稱。 |
|
| resourceUri |
string (uri) |
Azure OpenAI 資源的資源 URI。 |
BinaryQuantizationCompression
包含二進位量化壓縮方法在編製索引和查詢期間所使用的組態選項。
| 名稱 | 類型 | Description |
|---|---|---|
| kind |
string:
binary |
向量搜尋壓縮的類型。 |
| name |
string |
要與此特定組態產生關聯的名稱。 |
| rescoringOptions |
包含重新記錄的選項。 |
|
| truncationDimension |
integer (int32) |
要截斷向量的維度數目。 截斷向量可減少向量的大小,以及搜尋期間需要傳輸的數據量。 這可以節省記憶體成本,並降低搜尋效能,以犧牲召回率。 它只應該用於內嵌使用 Matryoshka 表示法學習 (MRL) 定型的內嵌,例如 OpenAI 文字內嵌-3-large(小型)。 默認值為 null,這表示不會截斷。 |
BM25SimilarityAlgorithm
根據 Okapi BM25 相似度演算法的排名函式。 BM25 是類似TF-IDF的演算法,包括長度正規化(由'b' 參數控制)以及詞彙頻率飽和度(由 'k1' 參數控制)。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| b |
number (double) |
此屬性會控制檔的長度如何影響相關性分數。 根據預設,會使用 0.75 的值。 值為 0.0 表示不會套用任何長度正規化,而值為 1.0 表示分數會完全由文件的長度正規化。 |
| k1 |
number (double) |
此屬性會控制每個相符字詞的字詞頻率與文件查詢組最終相關性分數之間的縮放函數。 根據預設,會使用1.2的值。 值為 0.0 表示分數不會隨著詞彙頻率增加而調整。 |
CharFilterName
定義搜尋引擎支援的所有字元篩選器的名稱。
| 值 | Description |
|---|---|
| html_strip |
嘗試去除 HTML 建構的字元篩選。 請參閱 https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html |
CjkBigramTokenFilter
形成從標準Tokenizer產生的CJK詞彙 bigram。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| ignoreScripts |
要忽略的腳本。 |
||
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| outputUnigrams |
boolean |
False |
值,指出是否要同時輸出 unigram 和 bigrams (如果為 true),或只是 bigrams (如果為 false)。 預設值為 false。 |
CjkBigramTokenFilterScripts
CjkBigramTokenFilter 可以忽略的腳本。
| 值 | Description |
|---|---|
| han |
在形成中日韓術語的二元組時忽略漢文字。 |
| hiragana |
在形成 CJK 術語的二元組時忽略平假名腳本。 |
| katakana |
在形成 CJK 術語的二元組時忽略片假名腳本。 |
| hangul |
在形成 CJK 術語的二元組時忽略韓文文字。 |
ClassicSimilarityAlgorithm
舊版相似度演算法,其使用 TF-IDF 的 Lucene TFIDFSimilarity 實作。 這種 TF-IDF 變化引進靜態文件長度正規化,以及協調因只部分符合搜尋查詢的檔而受懲罰的因素。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
ClassicTokenizer
適用於處理大部分歐洲語言檔的文法型Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
CommonGramTokenFilter
建立經常出現詞彙的雙詞組,並在建立索引時使用。 仍會編製單個字詞的索引,並與雙字母組重疊。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| commonWords |
string[] |
一組通用字組。 |
|
| ignoreCase |
boolean |
False |
值,指出一般字組比對是否不區分大小寫。 預設值為 false。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| queryMode |
boolean |
False |
值,指出令牌篩選是否處於查詢模式。 在查詢模式中時,令牌篩選會產生 bigrams,然後移除通用單字和單一字詞,後面接著一般單字。 預設值為 false。 |
CorsOptions
定義選項,以控制索引的跨原始來源資源分享 (CORS)。
| 名稱 | 類型 | Description |
|---|---|---|
| allowedOrigins |
string[] |
JavaScript 程式碼將從中獲得索引存取權的來源清單。 可以包含 {protocol}://{fully-qualified-domain-name}[:{port#}] 形式的主機清單,或單一 '*' 以允許所有來源 (不建議)。 |
| maxAgeInSeconds |
integer (int64) |
瀏覽器應快取 CORS 預檢回應的持續時間。 預設為 5 分鐘。 |
CustomAnalyzer
可讓您控制將文字轉換成可編製索引/可搜尋令牌的程式。 它是使用者定義的組態,由單一預先定義的Tokenizer和一或多個篩選所組成。 Tokenizer 負責將文字分成令牌,以及修改 Tokenizer 所發出的令牌的篩選條件。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| charFilters |
在分詞器處理輸入文字之前,用來準備輸入文字的字元篩選器清單。 例如,它們可以替換某些字元或符號。 過濾器會依其列出的順序執行。 |
|
| name |
string |
分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
| tokenFilters |
權杖篩選器清單,用來篩選或修改權杖化器所產生的權杖。 例如,您可以指定小寫篩選器,將所有字元轉換成小寫。 過濾器會依其列出的順序執行。 |
|
| tokenizer |
用來將連續文字分割成一系列標記的標記器的名稱,例如將句子分成單字。 |
CustomNormalizer
可讓您設定可篩選、可排序和多面向字段的正規化,依預設會以嚴格的比對運作。 這是由至少一或多個篩選所組成的使用者定義組態,可修改所儲存的令牌。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| charFilters |
用於在處理輸入文字之前準備輸入文字的字元篩選器清單。 例如,它們可以替換某些字元或符號。 過濾器會依其列出的順序執行。 |
|
| name |
string |
char 篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
| tokenFilters |
用來篩選或修改輸入權杖的權杖篩選器清單。 例如,您可以指定小寫篩選器,將所有字元轉換成小寫。 過濾器會依其列出的順序執行。 |
DictionaryDecompounderTokenFilter
分解在許多日耳曼語系中找到的複合字。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxSubwordSize |
integer (int32) maximum: 300 |
15 |
子字詞大小上限。 只輸出比這個短的子字。 預設值為 15。 最大值為300。 |
| minSubwordSize |
integer (int32) maximum: 300 |
2 |
最小子字大小。 輸出的子字詞長度只會超過這個。 預設為 2。 最大值為300。 |
| minWordSize |
integer (int32) maximum: 300 |
5 |
字型大小下限。 只有比處理此時間更長的字組。 預設值為 5。 最大值為300。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| onlyLongestMatch |
boolean |
False |
值,指出是否只將最長相符的子字詞新增至輸出。 預設值為 false。 |
| wordList |
string[] |
要比對的字組清單。 |
DistanceScoringFunction
定義根據地理位置距離提升分數的函式。
| 名稱 | 類型 | Description |
|---|---|---|
| boost |
number (double) |
原始分數的乘數。 必須是不等於 1.0 的正數。 |
| distance |
距離計分函式的參數值。 |
|
| fieldName |
string |
做為評分函式輸入的功能變數名稱。 |
| interpolation |
值,指出如何跨檔分數插補提升;預設為 “Linear”。 |
|
| type |
string:
distance |
評分功能類型。 |
DistanceScoringParameters
提供距離評分函式的參數值。
| 名稱 | 類型 | Description |
|---|---|---|
| boostingDistance |
number (double) |
與提升範圍結束的參考位置的距離(以公里為單位)。 |
| referencePointParameter |
string |
在搜尋查詢中傳遞的參數名稱,以指定參考位置。 |
EdgeNGramTokenFilter
從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxGram |
integer (int32) |
2 |
n-gram 長度上限。 預設為 2。 |
| minGram |
integer (int32) |
1 |
最小 n-gram 長度。 預設 為 1。 必須小於 maxGram的值。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| side | front |
指定應從輸入的哪一端產生 n-gram。 預設值為「front」。 |
EdgeNGramTokenFilterSide
指定應從輸入的哪一側產生 n-gram。
| 值 | Description |
|---|---|
| front |
指定應該從輸入的前面產生 n-gram。 |
| back |
指定應該從輸入的背面產生 n-gram。 |
EdgeNGramTokenFilterV2
從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
n-gram 長度上限。 預設為 2。 最大值為300。 |
| minGram |
integer (int32) maximum: 300 |
1 |
最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| side | front |
指定應從輸入的哪一端產生 n-gram。 預設值為「front」。 |
EdgeNGramTokenizer
將邊緣的輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
n-gram 長度上限。 預設為 2。 最大值為300。 |
| minGram |
integer (int32) maximum: 300 |
1 |
最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| tokenChars |
要保留在令牌中的字元類別。 |
ElisionTokenFilter
移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| articles |
string[] |
要移除的發行項集。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
ErrorAdditionalInfo
資源管理錯誤附加資訊。
| 名稱 | 類型 | Description |
|---|---|---|
| info |
附加資訊。 |
|
| type |
string |
其他資訊類型。 |
ErrorDetail
錯誤詳細資料。
| 名稱 | 類型 | Description |
|---|---|---|
| additionalInfo |
錯誤附加資訊。 |
|
| code |
string |
錯誤碼。 |
| details |
錯誤詳情 |
|
| message |
string |
錯誤訊息。 |
| target |
string |
錯誤目標。 |
ErrorResponse
所有 Azure Resource Manager API 的常見錯誤回應,用於回傳失敗操作的錯誤細節。 (這也遵循 OData 錯誤回應格式。)。
| 名稱 | 類型 | Description |
|---|---|---|
| error |
錯誤物件。 |
ExhaustiveKnnAlgorithmConfiguration
包含查詢期間所使用完整 KNN 演算法的特定組態選項,這會在整個向量索引上執行暴力密碼破解搜尋。
| 名稱 | 類型 | Description |
|---|---|---|
| exhaustiveKnnParameters |
包含完整 KNN 演算法特有的參數。 |
|
| kind |
string:
exhaustive |
向量搜尋演算法配置類型。 |
| name |
string |
要與此特定組態產生關聯的名稱。 |
ExhaustiveKnnParameters
包含完整 KNN 演算法特有的參數。
| 名稱 | 類型 | Description |
|---|---|---|
| metric |
用於向量比較的相似性指標。 |
FreshnessScoringFunction
定義函式,根據日期時間欄位的值來提升分數。
| 名稱 | 類型 | Description |
|---|---|---|
| boost |
number (double) |
原始分數的乘數。 必須是不等於 1.0 的正數。 |
| fieldName |
string |
做為評分函式輸入的功能變數名稱。 |
| freshness |
Freshness 評分函式的參數值。 |
|
| interpolation |
值,指出如何跨檔分數插補提升;預設為 “Linear”。 |
|
| type |
string:
freshness |
評分功能類型。 |
FreshnessScoringParameters
提供更新評分函式的參數值。
| 名稱 | 類型 | Description |
|---|---|---|
| boostingDuration |
string (duration) |
特定文件的加強推廣將停止的到期期間。 |
HnswAlgorithmConfiguration
包含索引和查詢期間使用的 HNSW 近似最近鄰演算法特有的組態選項。 HNSW 演算法在搜尋速度和準確性之間提供了可調整的權衡。
| 名稱 | 類型 | Description |
|---|---|---|
| hnswParameters |
包含 HNSW 演算法特有的參數。 |
|
| kind |
string:
hnsw |
向量搜尋演算法配置類型。 |
| name |
string |
要與此特定組態產生關聯的名稱。 |
HnswParameters
包含 HNSW 演算法特定的參數。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| efConstruction |
integer (int32) minimum: 100maximum: 1000 |
400 |
包含最近鄰居的動態清單大小,在索引時間期間使用。 增加此參數可能會改善索引品質,但代價是索引時間增加。 在某個時刻,增加該參數會導致收益遞減。 |
| efSearch |
integer (int32) minimum: 100maximum: 1000 |
500 |
包含最近鄰接項的動態清單大小,在搜尋期間使用。 增加此參數可能會改善搜尋結果,但會降低搜尋速度。 在某個時刻,增加該參數會導致收益遞減。 |
| m |
integer (int32) minimum: 4maximum: 10 |
4 |
在建構期間為每個新元素建立的雙向連結數目。 增加此參數值可能會改善召回率,並減少具有高內在維度的資料集的擷取時間,但代價是記憶體耗用量增加和索引時間延長。 |
| metric |
用於向量比較的相似性指標。 |
KeepTokenFilter
令牌篩選條件,只保留包含指定單字清單中的文字標記。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| keepWords |
string[] |
要保留的字組清單。 |
|
| keepWordsCase |
boolean |
False |
值,指出是否先小寫所有單字。 預設值為 false。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
KeywordMarkerTokenFilter
將字詞標示為關鍵字。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| ignoreCase |
boolean |
False |
值,指出是否忽略大小寫。 如果為 true,則所有單字都會先轉換成小寫。 預設值為 false。 |
| keywords |
string[] |
要標示為關鍵詞的字組清單。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
KeywordTokenizer
以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| bufferSize |
integer (int32) |
256 |
讀取緩衝區大小 (以位元組為單位)。 預設值為 256。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
KeywordTokenizerV2
以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxTokenLength |
integer (int32) maximum: 300 |
256 |
令牌長度上限。 預設值為 256。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
LengthTokenFilter
移除太長或太短的文字。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| max |
integer (int32) maximum: 300 |
300 |
字元的最大長度。 預設值和最大值為 300。 |
| min |
integer (int32) maximum: 300 |
0 |
字元的最小長度。 預設值為 0。 最大值為300。 必須小於 max的值。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
LexicalAnalyzerName
定義搜尋引擎支援的所有文字分析器的名稱。
| 值 | Description |
|---|---|
| ar.microsoft |
Microsoft 阿拉伯語分析器。 |
| ar.lucene |
阿拉伯語的 Lucene 分析儀。 |
| hy.lucene |
亞美尼亞語的 Lucene 分析儀。 |
| bn.microsoft |
Microsoft 分析器用於孟加拉語。 |
| eu.lucene |
巴斯克語的 Lucene 分析儀。 |
| bg.microsoft |
Microsoft Analyzer for Bulgarian. |
| bg.lucene |
保加利亞語的 Lucene 分析儀。 |
| ca.microsoft |
Microsoft analyzer for Catalan. |
| ca.lucene |
加泰羅尼亞語的 Lucene 分析儀。 |
| zh-Hans.microsoft |
Microsoft Analyzer for 中文(簡體)。 |
| zh-Hans.lucene |
Lucene 中文分析儀(簡體)。 |
| zh-Hant.microsoft |
Microsoft 分析器(繁體)版。 |
| zh-Hant.lucene |
Lucene 中文分析儀(繁體)。 |
| hr.microsoft |
Microsoft analyzer for Croatian。 |
| cs.microsoft |
Microsoft analyzer for Czech. |
| cs.lucene |
捷克語的 Lucene 分析儀。 |
| da.microsoft |
Microsoft 分析器用於丹麥語。 |
| da.lucene |
丹麥語的 Lucene 分析儀。 |
| nl.microsoft |
Microsoft analyzer for Dutch. |
| nl.lucene |
荷蘭語的 Lucene 分析儀。 |
| en.microsoft |
Microsoft 英文分析儀。 |
| en.lucene |
英語的 Lucene 分析儀。 |
| et.microsoft |
Microsoft 分析器用於愛沙尼亞語。 |
| fi.microsoft |
Microsoft 分析器用於芬蘭語。 |
| fi.lucene |
芬蘭語的 Lucene 分析儀。 |
| fr.microsoft |
Microsoft analyzer for French. |
| fr.lucene |
法語的 Lucene 分析儀。 |
| gl.lucene |
加利西亞的 Lucene 分析儀。 |
| de.microsoft |
Microsoft Analyzer for German。 |
| de.lucene |
德語 Lucene 分析儀。 |
| el.microsoft |
Microsoft analyzer for Greek. |
| el.lucene |
希臘語的 Lucene 分析儀。 |
| gu.microsoft |
Microsoft analyzer for Gujarati. |
| he.microsoft |
Microsoft 希伯來語分析器。 |
| hi.microsoft |
Microsoft Analyzer for Hindi。 |
| hi.lucene |
印地語的 Lucene 分析儀。 |
| hu.microsoft |
Microsoft analyzer for Hungarian。 |
| hu.lucene |
匈牙利語的 Lucene 分析儀。 |
| is.microsoft |
Microsoft 冰島語分析器。 |
| id.microsoft |
Microsoft analyzer for Indonesian (Bahasa). |
| id.lucene |
印尼語 Lucene 分析儀。 |
| ga.lucene |
愛爾蘭的 Lucene 分析儀。 |
| it.microsoft |
Microsoft analyzer for Italian. |
| it.lucene |
意大利語的 Lucene 分析儀。 |
| ja.microsoft |
Microsoft 日文分析器。 |
| ja.lucene |
日語 Lucene 分析儀。 |
| kn.microsoft |
Microsoft analyzer for Kannada. |
| ko.microsoft |
Microsoft 韓文分析器。 |
| ko.lucene |
韓語 Lucene 分析儀。 |
| lv.microsoft |
Microsoft analyzer for Latvian. |
| lv.lucene |
拉脫維亞語的 Lucene 分析儀。 |
| lt.microsoft |
Microsoft analyzer for Lithuanian。 |
| ml.microsoft |
Microsoft 分析器 for Malayalam. |
| ms.microsoft |
Microsoft analyzer for Malay (Latin)。 |
| mr.microsoft |
Microsoft 馬拉地語分析器。 |
| nb.microsoft |
Microsoft analyzer for Norwegian (BokmÃll). |
| no.lucene |
挪威語的 Lucene 分析儀。 |
| fa.lucene |
波斯語的 Lucene 分析儀。 |
| pl.microsoft |
Microsoft 波蘭語分析器。 |
| pl.lucene |
用於波蘭語的 Lucene 分析儀。 |
| pt-BR.microsoft |
Microsoft analyzer for Portuguese (Brazil). |
| pt-BR.lucene |
葡萄牙語(巴西)的 Lucene 分析儀。 |
| pt-PT.microsoft |
Microsoft analyzer for Portuguese (Portugal). |
| pt-PT.lucene |
葡萄牙語的 Lucene 分析儀(葡萄牙)。 |
| pa.microsoft |
Microsoft analyzer for Punjabi. |
| ro.microsoft |
Microsoft analyzer for Romanian。 |
| ro.lucene |
羅馬尼亞語的 Lucene 分析儀。 |
| ru.microsoft |
Microsoft 分析器用於俄文。 |
| ru.lucene |
俄語 Lucene 分析儀。 |
| sr-cyrillic.microsoft |
Microsoft analyzer for Serbian (Cyrillic). |
| sr-latin.microsoft |
Microsoft analyzer for Servian (Latin)。 |
| sk.microsoft |
Microsoft analyzer for Slovak. |
| sl.microsoft |
Microsoft analyzer for Slovenian. |
| es.microsoft |
Microsoft 西班牙語分析器。 |
| es.lucene |
西班牙語的 Lucene 分析儀。 |
| sv.microsoft |
Microsoft 分析器用於瑞典語。 |
| sv.lucene |
瑞典語 Lucene 分析儀。 |
| ta.microsoft |
Microsoft 分析器用於泰米爾語。 |
| te.microsoft |
Microsoft analyzer for Telugu. |
| th.microsoft |
Microsoft analyzer for Thai. |
| th.lucene |
泰語 Lucene 分析儀。 |
| tr.microsoft |
Microsoft analyzer for Turkish. |
| tr.lucene |
土耳其語的 Lucene 分析儀。 |
| uk.microsoft |
Microsoft analyzer for Ukrainian. |
| ur.microsoft |
Microsoft analyzer for Urdu. |
| vi.microsoft |
Microsoft 越南語分析儀。 |
| standard.lucene |
標準 Lucene 分析儀。 |
| standardasciifolding.lucene |
標準 ASCII 折疊 Lucene 分析儀。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers |
| keyword |
將欄位的整個內容視為單一語彙基元。 這適用於郵遞區號、標識元和某些產品名稱等數據。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html |
| pattern |
透過規則運算式模式彈性地將文字分割成字詞。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html |
| simple |
在非字母的位置分割文字,並將其轉換成小寫。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html |
| stop |
將文字分割為非字母;套用小寫和停用字詞標記篩選。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html |
| whitespace |
使用空白分詞器的分析器。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html |
LexicalNormalizerName
定義搜尋引擎支援的所有文字正規化程式的名稱。
| 值 | Description |
|---|---|
| asciifolding |
如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html |
| elision |
移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html |
| lowercase |
將權杖文字正規化為小寫。 請參閱 https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html |
| standard |
標準歸一化器,由小寫和 asciifolding 組成。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html |
| uppercase |
將權杖文字正規化為大寫。 請參閱 https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html |
LexicalTokenizerName
定義搜尋引擎支援的所有標記器的名稱。
LimitTokenFilter
限制索引過程中的標記數量。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| consumeAllTokens |
boolean |
False |
值,指出是否必須取用輸入中的所有令牌,即使達到 maxTokenCount 也一樣。 預設值為 false。 |
| maxTokenCount |
integer (int32) |
1 |
要產生的令牌數目上限。 預設 為 1。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
LuceneStandardAnalyzer
標準 Apache Lucene 分析器;由標準 Tokenizer、小寫篩選和停止篩選所組成。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。 |
| name |
string |
分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| stopwords |
string[] |
停用字詞清單。 |
LuceneStandardTokenizer
在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxTokenLength |
integer (int32) |
255 |
令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
LuceneStandardTokenizerV2
在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
MagnitudeScoringFunction
定義函式,根據數值欄位的大小來提升分數。
| 名稱 | 類型 | Description |
|---|---|---|
| boost |
number (double) |
原始分數的乘數。 必須是不等於 1.0 的正數。 |
| fieldName |
string |
做為評分函式輸入的功能變數名稱。 |
| interpolation |
值,指出如何跨檔分數插補提升;預設為 “Linear”。 |
|
| magnitude |
大小計分函式的參數值。 |
|
| type |
string:
magnitude |
評分功能類型。 |
MagnitudeScoringParameters
提供量級評分函式的參數值。
| 名稱 | 類型 | Description |
|---|---|---|
| boostingRangeEnd |
number (double) |
加強推廣結束的欄位值。 |
| boostingRangeStart |
number (double) |
開始加強推廣的欄位值。 |
| constantBoostBeyondRange |
boolean |
一個值,指出是否要對超出範圍結束值的欄位值套用常數提升;預設值為 false。 |
MappingCharFilter
套用對應選項所定義的對應的字元篩選。 比對採用貪婪演算法 (由指定點上最長的模式比對勝出) 替換字串可以是空字串。 此字元篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| mappings |
string[] |
下列格式的對應清單:“a=>b” (所有出現的字元 “a” 都會取代為字元 “b”。 |
| name |
string |
char 篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
MicrosoftLanguageStemmingTokenizer
使用語言特有的規則來分割文字,並將字組縮減到其基本形式。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| isSearchTokenizer |
boolean |
False |
值,指出如何使用Tokenizer。 如果使用 做為搜尋Tokenizer,請將 設定為 true,如果做為索引標記化工具,則設定為 false。 預設值為 false。 |
| language |
要使用的語言。 預設值為英文。 |
||
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
令牌長度上限。 超過長度上限的標記會進行分割。 可用的語彙基元長度上限是 300 個字元。 超過 300 個字元的令牌會先分割成長度為 300 的令牌,然後每個令牌都會根據設定的令牌長度上限來分割。 預設值為 255。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
MicrosoftLanguageTokenizer
使用語言特有的規則分割文字。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| isSearchTokenizer |
boolean |
False |
值,指出如何使用Tokenizer。 如果使用 做為搜尋Tokenizer,請將 設定為 true,如果做為索引標記化工具,則設定為 false。 預設值為 false。 |
| language |
要使用的語言。 預設值為英文。 |
||
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
令牌長度上限。 超過長度上限的標記會進行分割。 可用的語彙基元長度上限是 300 個字元。 超過 300 個字元的令牌會先分割成長度為 300 的令牌,然後每個令牌都會根據設定的令牌長度上限來分割。 預設值為 255。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
MicrosoftStemmingTokenizerLanguage
列出 Microsoft 語言詞幹分詞器所支援的語言。
| 值 | Description |
|---|---|
| arabic |
選擇 Microsoft 的詞幹標記器以支援阿拉伯語。 |
| bangla |
選擇 Microsoft 的詞幹分詞器以支援孟加拉語。 |
| bulgarian |
選擇 Microsoft 的詞幹分詞器以取得保加利亞語。 |
| catalan |
選擇 Microsoft 的 Catalan 幹標記器。 |
| croatian |
選擇 Microsoft 的詞幹符號器以支援克羅埃西亞語。 |
| czech |
選擇 Microsoft 的 Stemming Tokenizer for Czech。 |
| danish |
選擇 Microsoft 的詞幹標記器以取得丹麥語。 |
| dutch |
選擇 Microsoft 的 Stemming Tokenizer for Dutch。 |
| english |
選擇 Microsoft 的詞幹分詞器來支援英文。 |
| estonian |
選擇 Microsoft 詞幹符號器以支援愛沙尼亞語。 |
| finnish |
選擇 Microsoft 詞幹標記器以取得芬蘭語。 |
| french |
選擇 Microsoft 詞幹分詞器以支援法語。 |
| german |
選擇 Microsoft 的詞幹分詞器以支援德語。 |
| greek |
選擇 Microsoft 詞幹標記器以取得希臘語。 |
| gujarati |
選擇 Microsoft 詞幹標記器 for Gujarati。 |
| hebrew |
選擇 Microsoft 的希伯來語詞幹標記器。 |
| hindi |
選擇 Microsoft 的印地語詞幹標記器。 |
| hungarian |
選擇 Microsoft 詞幹分詞器以支援匈牙利語。 |
| icelandic |
選擇 Microsoft 的詞幹標記器以支援冰島語。 |
| indonesian |
選擇印尼語的 Microsoft 詞幹標記器。 |
| italian |
選擇 Microsoft 詞幹標記器以取得義大利語。 |
| kannada |
選擇 Microsoft 幹幹標記器 for Kannada。 |
| latvian |
選擇 Microsoft 詞幹標記器 for Latvian。 |
| lithuanian |
選擇立陶宛語的 Microsoft 詞幹標記器。 |
| malay |
選擇 Microsoft 詞幹標記器以支援馬來語。 |
| malayalam |
選擇 Microsoft 詞幹標記器以支援馬拉雅拉姆語。 |
| marathi |
選擇 Microsoft 的詞幹標記器以支援馬拉地語。 |
| norwegianBokmaal |
Selects the Microsoft stemming tokenizer for Norwegian (Bokmã¥l). |
| polish |
選擇 Microsoft 的詞幹標記器以取得波蘭語。 |
| portuguese |
選擇 Microsoft 詞幹符號器以支援葡萄牙語。 |
| portugueseBrazilian |
Selects the Microsoft stemming tokenizer for Portuguese (Brazil)。 |
| punjabi |
選擇 Microsoft 幹幹標記器 for Punjabi。 |
| romanian |
選擇 Microsoft 詞幹標記器以支援羅馬尼亞語。 |
| russian |
選擇 Microsoft 詞幹標記器以取得俄文。 |
| serbianCyrillic |
Selects the Microsoft stemming tokenizer for Serbian(西里爾字母)。 |
| serbianLatin |
選擇 Microsoft 詞幹標記器用於塞爾維亞語(拉丁語)。 |
| slovak |
選擇 Microsoft 詞幹標記器 for Slovak。 |
| slovenian |
選擇 Microsoft 的詞幹標記器以支援斯洛維尼亞語。 |
| spanish |
選擇 Microsoft 詞幹標記器以支援西班牙語。 |
| swedish |
選擇 Microsoft 的詞幹標記器以支援瑞典語。 |
| tamil |
選擇 Microsoft 的 Tamil 詞幹標記器。 |
| telugu |
選擇 Microsoft 的 Telugu stemming tokenizer。 |
| turkish |
選擇 Microsoft 幹幹標記器以支援土耳其語。 |
| ukrainian |
選擇 Microsoft 詞幹 Tokenizer for Ukrainian。 |
| urdu |
選擇 Microsoft 的詞幹符號器以支援烏爾都語。 |
MicrosoftTokenizerLanguage
列出 Microsoft 語言分詞器所支援的語言。
| 值 | Description |
|---|---|
| bangla |
選擇 Microsoft 的 Bengla 標記器。 |
| bulgarian |
選擇 Microsoft 的保加利亞語標記器。 |
| catalan |
選擇 Microsoft 的 Catalan 標記器。 |
| chineseSimplified |
選擇 Microsoft 的中文(簡體)標記器。 |
| chineseTraditional |
選擇 Microsoft 的中文(繁體)標記器。 |
| croatian |
選擇 Microsoft 克羅埃西亞語的標記器。 |
| czech |
選擇捷克語的 Microsoft 標記器。 |
| danish |
選擇丹麥語的 Microsoft 標記器。 |
| dutch |
選擇 Microsoft 的 Dutch 標記器。 |
| english |
選擇 Microsoft 的英文標記器。 |
| french |
選擇 Microsoft 法語標記器。 |
| german |
選擇 Microsoft 德語標記器。 |
| greek |
選擇 Microsoft 的希臘語標記器。 |
| gujarati |
選擇 Microsoft 的古吉拉特語標記器。 |
| hindi |
選擇 Microsoft 印地語標記器。 |
| icelandic |
選擇 Microsoft 的冰島語標記器。 |
| indonesian |
選擇印尼語的 Microsoft 標記器。 |
| italian |
選擇 Microsoft 的義大利語標記器。 |
| japanese |
選擇 Microsoft 日語標記器。 |
| kannada |
選擇 Microsoft 的 Kannada 標記器。 |
| korean |
選擇 Microsoft 的韓文分詞器。 |
| malay |
選擇 Microsoft 馬來語的標記器。 |
| malayalam |
選擇 Microsoft 馬拉雅拉姆語的標記器。 |
| marathi |
選擇 Microsoft 馬拉地語的標記器。 |
| norwegianBokmaal |
Selects the Microsoft tokenizer for Norwegian (Bokmål). |
| polish |
選擇 Microsoft 的 Polish 分詞器。 |
| portuguese |
選擇 Microsoft 的葡萄牙語標記器。 |
| portugueseBrazilian |
Selects the Microsoft tokenizer for Portuguese (Brazil)。 |
| punjabi |
選擇 Microsoft 的 Punjabi 標記器。 |
| romanian |
選擇羅馬尼亞語的 Microsoft 標記器。 |
| russian |
選擇 Microsoft 的 Tokenizer 作為俄文。 |
| serbianCyrillic |
選擇 Microsoft 的 Serbian 代幣化器(西里爾字母)。 |
| serbianLatin |
選擇 Microsoft 的塞爾維亞語(拉丁語)標記器。 |
| slovenian |
選擇 Microsoft 的 Slovenian 標記器。 |
| spanish |
選擇 Microsoft 西班牙語標記器。 |
| swedish |
選擇瑞典語的 Microsoft 標記器。 |
| tamil |
選擇 Microsoft 的 Tamil 代幣化器。 |
| telugu |
選擇 Microsoft 的泰盧固語標記器。 |
| thai |
選擇 Microsoft 的 Thai 標記器。 |
| ukrainian |
選擇 Microsoft 的烏克蘭語標記器。 |
| urdu |
選擇 Microsoft 的烏爾都語標記器。 |
| vietnamese |
選擇 Microsoft 的越南語標記器。 |
NGramTokenFilter
產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxGram |
integer (int32) |
2 |
n-gram 長度上限。 預設為 2。 |
| minGram |
integer (int32) |
1 |
最小 n-gram 長度。 預設 為 1。 必須小於 maxGram的值。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
NGramTokenFilterV2
產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
n-gram 長度上限。 預設為 2。 最大值為300。 |
| minGram |
integer (int32) maximum: 300 |
1 |
最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
NGramTokenizer
將輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxGram |
integer (int32) maximum: 300 |
2 |
n-gram 長度上限。 預設為 2。 最大值為300。 |
| minGram |
integer (int32) maximum: 300 |
1 |
最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| tokenChars |
要保留在令牌中的字元類別。 |
PathHierarchyTokenizerV2
路徑類階層的 Token 化工具。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| delimiter |
string maxLength: 1 |
/ |
要使用的分隔符。 預設值為 “/”。 |
| maxTokenLength |
integer (int32) maximum: 300 |
300 |
令牌長度上限。 預設值和最大值為 300。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| replacement |
string maxLength: 1 |
/ |
值,如果設定,則會取代分隔符。 預設值為 “/”。 |
| reverse |
boolean |
False |
值,指出是否要以反向順序產生令牌。 預設值為 false。 |
| skip |
integer (int32) |
0 |
要略過的初始令牌數目。 預設值為 0。 |
PatternAnalyzer
透過規則運算式模式彈性地將文字分割成字詞。 此分析器是使用 Apache Lucene 實作的。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| flags |
string |
正規表達式旗標,以 '|' 分隔的 RegexFlags 值字串指定。 |
|
| lowercase |
boolean |
True |
指出字詞是否應該小寫的值。 預設值是「true」。 |
| name |
string |
分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| pattern |
string |
\W+ |
比對權杖分隔符號的正規表示式模式。 預設值是符合一或多個非單字字元的運算式。 |
| stopwords |
string[] |
停用字詞清單。 |
PatternCaptureTokenFilter
使用 Java regex 來發出多個令牌 - 一個或多個模式中每個擷取群組各一個。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| patterns |
string[] |
要與每個令牌相符的模式清單。 |
|
| preserveOriginal |
boolean |
True |
值,指出是否要傳回原始令牌,即使其中一個模式相符也一樣。 預設值是「true」。 |
PatternReplaceCharFilter
字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此字元篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| name |
string |
char 篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
| pattern |
string |
正則表達式模式。 |
| replacement |
string |
取代文字。 |
PatternReplaceTokenFilter
字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
| pattern |
string |
正則表達式模式。 |
| replacement |
string |
取代文字。 |
PatternTokenizer
使用 regex 模式比對來建構不同令牌的 Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| flags |
string |
正規表達式旗標,以 '|' 分隔的 RegexFlags 值字串指定。 |
|
| group |
integer (int32) |
-1 |
正則運算式模式中比對群組的從零開始的序數,要擷取到權杖中。 如果您想要使用整個模式將輸入分割成記號,而不論相符的群組為何,請使用 -1。 預設值為 -1。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| pattern |
string |
\W+ |
比對權杖分隔符號的正規表示式模式。 預設值是符合一或多個非單字字元的運算式。 |
PhoneticEncoder
識別要與 PhoneticTokenFilter 搭配使用的語音編碼器類型。
| 值 | Description |
|---|---|
| metaphone |
將權杖編碼為 Metaphone 值。 |
| doubleMetaphone |
將記號編碼為雙元音值。 |
| soundex |
將權杖編碼為 Soundex 值。 |
| refinedSoundex |
將權杖編碼為精簡的 Soundex 值。 |
| caverphone1 |
將權杖編碼為 Caverphone 1.0 值。 |
| caverphone2 |
將權杖編碼為 Caverphone 2.0 值。 |
| cologne |
將記號編碼為科隆語音值。 |
| nysiis |
將代幣編碼為 NYSIIS 值。 |
| koelnerPhonetik |
使用 Kölner Phonetik 算法對令牌進行編碼。 |
| haasePhonetik |
使用 Kölner Phonetik 算法的 Haase 細化對標記進行編碼。 |
| beiderMorse |
將權杖編碼為 Beider-Morse 值。 |
PhoneticTokenFilter
建立拼音相符的標記。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| encoder | metaphone |
要使用的語音編碼器。 預設值為 「metaphone」。。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| replace |
boolean |
True |
值,指出編碼令牌是否應該取代原始令牌。 如果為 false,編碼的令牌會新增為同義字。 預設值是「true」。 |
RankingOrder
代表用於文件排序順序的分數。
| 值 | Description |
|---|---|
| BoostedRerankerScore |
將排序順序設定為 BoostedRerankerScore |
| RerankerScore |
將排序順序設定為 ReRankerScore |
RescoringOptions
包含重新記錄的選項。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| defaultOversampling |
number (double) |
默認過度取樣因數。 過取樣會擷取一組更大的潛在文件,以抵消量化所造成的解析度損失。 這會增加將在全精度向量上重新評分的結果集。 最小值為 1,表示沒有過度取樣(1 倍)。 只有在 'enableRescoring' 為 true 時,才能設定此參數。 較高的值會犧牲延遲來改善召回率。 |
|
| enableRescoring |
boolean |
True |
如果設為 true,則在對壓縮向量進行初始搜尋之後,會使用全精確度向量重新計算相似性分數。 這會以犧牲延遲為代價來改善召回率。 |
| rescoreStorageMethod |
enum:
|
preserveOriginals |
控制原始向量的儲存方法。 此設定是不可變的。 |
ScalarQuantizationCompression
包含索引編製和查詢期間所使用純量量化壓縮方法的特定組態選項。
| 名稱 | 類型 | Description |
|---|---|---|
| kind |
string:
scalar |
向量搜尋壓縮的類型。 |
| name |
string |
要與此特定組態產生關聯的名稱。 |
| rescoringOptions |
包含重新記錄的選項。 |
|
| scalarQuantizationParameters |
包含純量量化特有的參數。 |
|
| truncationDimension |
integer (int32) |
要截斷向量的維度數目。 截斷向量可減少向量的大小,以及搜尋期間需要傳輸的數據量。 這可以節省記憶體成本,並降低搜尋效能,以犧牲召回率。 它只應該用於內嵌使用 Matryoshka 表示法學習 (MRL) 定型的內嵌,例如 OpenAI 文字內嵌-3-large(小型)。 默認值為 null,這表示不會截斷。 |
ScalarQuantizationParameters
包含純量量化特有的參數。
| 名稱 | 類型 | Description |
|---|---|---|
| quantizedDataType |
壓縮向量值的量化資料類型。 |
ScoringFunctionAggregation
定義用來合併評分設定檔中所有評分函數結果的彙總函數。
| 值 | Description |
|---|---|
| sum |
通過所有評分函數結果的總和來提高分數。 |
| average |
通過所有評分函數結果的平均值來提高分數。 |
| minimum |
將分數提高到所有評分函數結果的最小值。 |
| maximum |
將分數提高到所有評分函數結果的最大值。 |
| firstMatching |
使用評分設定檔中第一個適用的評分函數來提升分數。 |
| product |
通過所有評分函數結果的乘積來提高分數。 |
ScoringFunctionInterpolation
定義用來在一系列文件中插補分數提升的函數。
| 值 | Description |
|---|---|
| linear |
將分數線性遞減。 這是評分函數的預設插補。 |
| constant |
通過恆定係數提高分數。 |
| quadratic |
將分數提高二次方遞減的量。 分數越高,提升會緩慢減少,而分數越低,就會越快。 標籤評分函數不允許使用此插補選項。 |
| logarithmic |
將分數提高對數遞減的量。 分數越高,提升會迅速減少,而隨著分數的下降,提升會越慢。 標籤評分函數不允許使用此插補選項。 |
ScoringProfile
定義影響搜尋查詢評分之搜尋索引的參數。
| 名稱 | 類型 | Description |
|---|---|---|
| functionAggregation |
指出如何組合個別評分函式結果的值。 預設為「總和」。 如果沒有評分函數,則忽略。 |
|
| functions | ScoringFunction[]: |
影響文件評分的函數集合。 |
| name |
string |
評分設定檔的名稱。 |
| text |
根據特定索引欄位中的文字相符來提升評分的參數。 |
SearchField
表示索引定義中的欄位,描述欄位的名稱、數據類型和搜尋行為。
| 名稱 | 類型 | Description |
|---|---|---|
| analyzer |
要用於欄位的分析器名稱。 此選項只能與可搜尋的字段搭配使用,而且無法與 searchAnalyzer 或 indexAnalyzer 一起設定。 選擇分析器之後,就無法變更欄位。 對於複雜欄位,必須為 Null。 |
|
| dimensions |
integer (int32) minimum: 2maximum: 4096 |
向量欄位的維度。 |
| facetable |
boolean |
值,指出是否要在Facet查詢中參考欄位。 通常用於搜尋結果的呈現方式,其中包括依類別排序的點閱數 (例如,搜尋數位相機,然後依照品牌、百萬像素、價格等項目來查看點閱數)。 對於複雜欄位,此屬性必須為 Null。 類型為 Edm.GeographyPoint 或 Collection(Edm.GeographyPoint) 的欄位不可多面向。 所有其他簡單欄位的預設值為 true。 |
| fields |
如果這是類型為 Edm.ComplexType 或 Collection(Edm.ComplexType) 的欄位,則為子欄位清單。 對於簡單欄位,必須為 Null 或空白。 |
|
| filterable |
boolean |
值,指出是否要在$filter查詢中參考欄位。 filterable 與可搜尋的字串處理方式不同。 可篩選的 Edm.String 或 Collection(Edm.String) 類型的字段不會進行斷詞,因此比較僅適用於完全相符專案。 例如,如果您將這類字段 f 設定為 「sunny day」,$filter=f eq 'sunny' 將找不到相符專案,但$filter=f eq 'sunny day' 將會。 對於複雜欄位,此屬性必須為 Null。 簡單欄位的預設值為 true,複雜欄位的預設值為 null。 |
| indexAnalyzer |
用於欄位索引編製時間的分析器名稱。 此選項只能與可搜尋的欄位搭配使用。 它必須與 searchAnalyzer 一起設定,且無法與分析器選項一起設定。 此屬性無法設定為語言分析器的名稱;如果您需要語言分析器,請改用分析器屬性。 選擇分析器之後,就無法變更欄位。 對於複雜欄位,必須為 Null。 |
|
| key |
boolean |
值,指出欄位是否唯一識別索引中的檔。 每個索引中只有一個最上層字段必須選擇為索引鍵欄位,而且必須是Edm.String類型。 索引鍵欄位可以用來直接查閱文件,並更新或刪除特定文件。 簡單欄位的預設值為 false,複雜欄位的預設值為 null。 |
| name |
string |
欄位的名稱,在索引或父字段的 fields 集合中必須是唯一的。 |
| normalizer |
要用於欄位的正規化程式名稱。 此選項只能用於已啟用可篩選、可排序或可多面的欄位。 選擇正規化器之後,就無法針對欄位變更它。 對於複雜欄位,必須為 Null。 |
|
| retrievable |
boolean |
值,指出是否可以在搜尋結果中傳回欄位。 如果您想要使用欄位(例如 margin)做為篩選、排序或評分機制,但不想讓使用者看到字段,則可以停用此選項。 對於索引鍵欄位,此屬性必須為 true,對於複雜欄位,此屬性必須為 null。 這個屬性可以在現有的欄位上變更。 啟用此屬性不會造成索引記憶體需求增加。 簡單欄位的預設值為 true,向量欄位的預設值為 false,複雜欄位的預設值為 null。 |
| searchAnalyzer |
在搜尋時用於欄位的分析器名稱。 此選項只能與可搜尋的欄位搭配使用。 它必須與 indexAnalyzer 一起設定,而且不能與 analyzer 選項一起設定。 此屬性無法設定為語言分析器的名稱;如果您需要語言分析器,請改用分析器屬性。 您可以在現有的欄位更新此分析器。 對於複雜欄位,必須為 Null。 |
|
| searchable |
boolean |
值,指出欄位是否可供全文搜索。 這表示它會在編製索引期間進行斷詞分析。 如果您將可搜尋的字段設定為「晴天」之類的值,則內部會分割成個別標記「陽光明媚」和「日」。 這樣就能針對這些字詞進行全文檢索搜尋。 默認可搜尋類型為 Edm.String 或 Collection(Edm.String) 的欄位。 對於其他非字串資料類型的簡單欄位,此屬性必須為 false,對於複雜欄位,此屬性必須為 null。 注意:可搜尋的欄位會耗用索引中的額外空間,以容納全文搜索之域值的其他標記化版本。 如果您想要在索引中節省空間,而且不需要在搜尋中包含字段,請將 [可搜尋] 設定為 false。 |
| sortable |
boolean |
值,指出是否要在$orderby運算式中參考字段。 根據預設,搜尋引擎會依分數排序結果,但在許多情況下,使用者會想要依檔中的欄位排序。 只有在單一值時,才能排序簡單字段(在父檔範圍中有單一值)。 簡單集合欄位無法排序,因為它們是多重值。 複雜集合的簡單子欄位也是多重值,因此無法排序。 不論其為直接父欄位或上階欄位,都是如此,這就是複雜集合。 複雜欄位無法排序,且這類欄位的 sortable 屬性必須為 Null。 對於單值簡單欄位,可排序的預設值為 true,對於多值簡單欄位為 false,對於複雜欄位為 null。 |
| stored |
boolean |
不可變的值,指出欄位是否會個別保存在要在搜尋結果中傳回的磁碟上。 如果您不打算在搜尋回應中傳回字段內容,以節省記憶體額外負荷,則可以停用此選項。 這隻能在索引建立期間設定,而且只能在向量字段設定。 現有欄位無法變更此屬性,或針對新欄位設定為 false。 如果此屬性設定為 false,則屬性 'retrievable' 也必須設定為 false。 對於索引鍵欄位、新字段和非向量欄位,此屬性必須為 true 或 unset,而且複雜欄位必須為 Null。 停用此屬性會減少索引記憶體需求。 向量欄位的預設值為 true。 |
| synonymMaps |
string[] |
要與此欄位建立關聯的同義字對應名稱清單。 此選項只能與可搜尋的欄位搭配使用。 目前只支援每個欄位一個同義字對應。 將同義字對應指派給欄位可確保將該欄位設為目標的查詢字詞會使用同義字對應中的規則在查詢時展開。 這個屬性可以在現有的欄位上變更。 對於複雜欄位,必須為 Null 或空白集合。 |
| type |
欄位的數據類型。 |
|
| vectorEncoding |
用來解譯欄位內容的編碼格式。 |
|
| vectorSearchProfile |
string |
向量搜尋配置檔的名稱,指定搜尋向量字段時要使用的演算法和向量化程式。 |
SearchFieldDataType
定義搜尋索引中欄位的資料類型。
| 值 | Description |
|---|---|
| Edm.String |
表示欄位包含字串。 |
| Edm.Int32 |
表示欄位包含32位帶正負號的整數。 |
| Edm.Int64 |
表示欄位包含 64 位帶正負號的整數。 |
| Edm.Double |
表示欄位包含 IEEE 雙精確度浮點數。 |
| Edm.Boolean |
表示欄位包含布爾值 (true 或 false)。 |
| Edm.DateTimeOffset |
表示欄位包含日期/時間值,包括時區資訊。 |
| Edm.GeographyPoint |
表示欄位在經度和緯度方面包含地理位置。 |
| Edm.ComplexType |
表示欄位包含一或多個複雜物件,而該物件接著具有其他類型的子字段。 |
| Edm.Single |
表示欄位包含單精度浮點數。 只有在搭配 Collection(Edm.Single) 使用時才有效。 |
| Edm.Half |
表示欄位包含半精確度浮點數。 只有在搭配 Collection(Edm.Half) 使用時才有效。 |
| Edm.Int16 |
表示欄位包含16位帶正負號的整數。 只有在搭配 Collection(Edm.Int16) 使用時才有效。 |
| Edm.SByte |
表示欄位包含 8 位帶正負號的整數。 只有在搭配 Collection(Edm.SByte) 使用時才有效。 |
| Edm.Byte |
表示欄位包含 8 位無符號整數。 只有在搭配 Collection(Edm.Byte) 使用時才有效。 |
SearchIndex
表示搜尋索引定義,描述索引的欄位和搜尋行為。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.etag |
string |
索引的 ETag。 |
| analyzers | LexicalAnalyzer[]: |
索引的分析器。 |
| charFilters | CharFilter[]: |
索引的字元篩選。 |
| corsOptions |
控制索引之跨原始來源資源分享 (CORS) 的選項。 |
|
| defaultScoringProfile |
string |
如果在查詢中未指定評分配置檔,則為要使用的評分配置檔名稱。 如果未設定此屬性,而且查詢中未指定任何評分配置檔,則會使用預設評分 (tf-idf)。 |
| description |
string |
索引的描述。 |
| encryptionKey |
您在 Azure Key Vault 中建立的加密金鑰描述。 當你想完全確保沒有人,甚至連 Microsoft 都無法解密你的資料時,這個金鑰用來為你的資料提供額外的靜態加密層級。 加密數據之後,一律會保持加密狀態。 搜尋服務會忽略嘗試將此屬性設定為 Null。 如果您想要輪替加密金鑰,您可以視需要變更此屬性;您的數據不會受到影響。 使用客戶管理的金鑰加密不適用於免費搜尋服務,而且僅適用於 2019 年 1 月 1 日或之後建立的付費服務。 |
|
| fields |
索引的欄位。 |
|
| name |
string |
索引的名稱。 |
| normalizers | LexicalNormalizer[]: |
索引的正規化程式。 |
| scoringProfiles |
索引的評分配置檔。 |
|
| semantic |
定義影響語意功能的搜尋索引參數。 |
|
| similarity | SimilarityAlgorithm: |
評分和排名符合搜尋查詢的檔時所要使用的相似度演算法類型。 相似度演算法只能在索引建立時定義,而且無法在現有索引上修改。 如果為 null,則會使用 ClassicSimilarity 演算法。 |
| suggesters |
索引的建議工具。 |
|
| tokenFilters |
TokenFilter[]:
|
索引的令牌篩選。 |
| tokenizers | LexicalTokenizer[]: |
索引的Tokenizers。 |
| vectorSearch |
包含與向量搜尋相關的組態選項。 |
SearchIndexerDataNoneIdentity
清除資料源的識別屬性。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
指定身分類型的 URI 片段。 |
SearchIndexerDataUserAssignedIdentity
指定要使用之數據源的身分識別。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
指定身分類型的 URI 片段。 |
| userAssignedIdentity |
string |
使用者指派受控識別的完整 Azure 資源標識符,通常格式為 “/subscriptions/12345678-1234-1234-1234-1234567890ab/resourceGroups/rg/providers/Microsoft.ManagedIdentity/userAssignedIdentities/myId”。 |
SearchResourceEncryptionKey
Azure Key Vault 中客戶管理的加密密鑰。 您建立和管理的金鑰可用來加密或解密靜態資料,例如索引和同義字對映。
| 名稱 | 類型 | Description |
|---|---|---|
| accessCredentials.applicationId |
string |
AAD 應用程式識別碼,已將待用數據加密時要使用的 Azure Key Vault 所需訪問許可權授與。 應用程式標識碼不應與 AAD 應用程式的物件標識元混淆。 |
| accessCredentials.applicationSecret |
string |
指定 AAD 應用程式的驗證金鑰。 |
| identity | SearchIndexerDataIdentity: |
要用於此加密金鑰的明確受控識別。 如果未指定,且存取認證屬性為 Null,則會使用系統指派的受控識別。 更新資源時,如果未指定明確識別,則會維持不變。 如果指定了 「none」 ,則會清除此屬性的值。 |
| keyVaultKeyName |
string |
要用來加密待用數據的 Azure Key Vault 金鑰名稱。 |
| keyVaultKeyVersion |
string |
要用來加密待用數據的 Azure Key Vault 金鑰版本。 |
| keyVaultUri |
string |
Azure Key Vault 的 URI,也稱為 DNS 名稱,其中包含用來加密待用數據的密鑰。 範例 URI 可能會 |
SearchSuggester
定義建議 API 應如何套用至索引中的欄位群組。
| 名稱 | 類型 | Description |
|---|---|---|
| name |
string |
建議者的名稱。 |
| searchMode |
enum:
analyzing |
指出建議者功能的值。 |
| sourceFields |
string[] |
建議器所套用的欄位名稱清單。 每個欄位都必須是可搜尋的。 |
SemanticConfiguration
定義在語意功能內容中使用的特定組態。
| 名稱 | 類型 | Description |
|---|---|---|
| name |
string |
語意組態的名稱。 |
| prioritizedFields |
描述要用於語意排名、標題、醒目提示和答案的標題、內容和關鍵詞欄位。 至少必須設定三個子屬性的其中一個(titleField、優先順序為KeywordsFields 和優先順序的ContentFields)。 |
|
| rankingOrder |
指定要用於搜尋結果排序順序的分數類型。 |
SemanticField
做為語意組態一部分的欄位。
| 名稱 | 類型 | Description |
|---|---|---|
| fieldName |
string |
檔案名稱 |
SemanticPrioritizedFields
描述要用於語意排名、標題、醒目提示和答案的標題、內容和關鍵詞欄位。
| 名稱 | 類型 | Description |
|---|---|---|
| prioritizedContentFields |
定義要用於語意排名、標題、重點和答案的內容欄位。 為了獲得最佳結果,所選欄位應包含自然語言形式的文字。 陣列中欄位的順序代表其優先順序。 如果內容很長,優先順序較低的欄位可能會被截斷。 |
|
| prioritizedKeywordsFields |
定義要用於語意排名、標題、亮點和答案的關鍵字欄位。 為了獲得最佳結果,所選欄位應包含關鍵字清單。 陣列中欄位的順序代表其優先順序。 如果內容很長,優先順序較低的欄位可能會被截斷。 |
|
| titleField |
定義要用於語意排名、標題、醒目提示和答案的標題欄位。 如果您的索引中沒有標題欄位,請將此欄位留空。 |
SemanticSearch
定義影響語意功能的搜尋索引參數。
| 名稱 | 類型 | Description |
|---|---|---|
| configurations |
索引的語意組態。 |
|
| defaultConfiguration |
string |
可讓您在索引中設定預設語意組態的名稱,讓每次都能選擇性地將其作為查詢參數傳遞。 |
ShingleTokenFilter
將標記組合建立為單一標記。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| filterToken |
string |
_ |
要針對沒有標記之每個位置插入的字串。 默認值為底線 (“_” )。 |
| maxShingleSize |
integer (int32) minimum: 2 |
2 |
閃亮大小上限。 預設值和最小值為 2。 |
| minShingleSize |
integer (int32) minimum: 2 |
2 |
最小閃亮大小。 預設值和最小值為 2。 必須小於 maxShingleSize的值。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| outputUnigrams |
boolean |
True |
值,指出輸出數據流是否會包含輸入標記 (unigrams) 以及隨機顯示。 預設值是「true」。 |
| outputUnigramsIfNoShingles |
boolean |
False |
值,指出是否要輸出單格,當沒有顯示任何擷取子時。 當 outputUnigrams 設定為 false 時,這個屬性會優先。 預設值為 false。 |
| tokenSeparator |
string |
聯結相鄰標記以形成閃亮時所使用的字串。 預設值為單一空格 (“ ” )。 |
SnowballTokenFilter
使用 Snowball 產生的字幹分析器來幹詞的篩選。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| language |
要使用的語言。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
SnowballTokenFilterLanguage
要用於 Snowball 權杖篩選器的語言。
| 值 | Description |
|---|---|
| armenian |
選取亞美尼亞語的 Lucene Snowball 詞幹標記器。 |
| basque |
選取巴斯克語的 Lucene Snowball 詞幹標記器。 |
| catalan |
選取加泰隆尼亞語的 Lucene Snowball 詞幹標記器。 |
| danish |
選取丹麥文的 Lucene Snowball 詞幹標記器。 |
| dutch |
選取 Dutch 的 Lucene Snowball 詞幹標記器。 |
| english |
選取英文的 Lucene Snowball 詞幹標記器。 |
| finnish |
選取芬蘭文的 Lucene Snowball 詞幹標記器。 |
| french |
選取法文的 Lucene Snowball 詞幹標記器。 |
| german |
選取德文的 Lucene Snowball 詞幹標記器。 |
| german2 |
選取使用德語變體演算法的 Lucene Snowball 詞幹記號器。 |
| hungarian |
選取匈牙利文的 Lucene Snowball 詞幹標記器。 |
| italian |
選取義大利文的 Lucene Snowball 詞幹標記器。 |
| kp |
選取使用 Kraaij-Pohlmann 詞幹分析演算法的荷蘭語的 Lucene Snowball 詞幹記詞器。 |
| lovins |
選取使用 Lovins 詞幹提取演算法的英文 Lucene Snowball 詞幹記詞器。 |
| norwegian |
選取挪威文的 Lucene Snowball 詞幹記號器。 |
| porter |
選取使用 Porter 詞幹提取演算法的英文 Lucene Snowball 詞幹記詞器。 |
| portuguese |
選取葡萄牙文的 Lucene Snowball 詞幹標記器。 |
| romanian |
選取羅馬尼亞文的 Lucene Snowball 詞幹標記器。 |
| russian |
選取俄語的 Lucene Snowball 詞幹標記器。 |
| spanish |
選取西班牙文的 Lucene Snowball 詞幹標記器。 |
| swedish |
選取瑞典文的 Lucene Snowball 詞幹標記器。 |
| turkish |
選取土耳其文的 Lucene Snowball 詞幹標記器。 |
StemmerOverrideTokenFilter
提供使用自定義字典型字幹分析覆寫其他字幹篩選的功能。 任何字典字幹字詞都會標示為關鍵詞,因此它們不會在鏈結中加上字幹分析器。 必須放在任何詞幹分析篩選器之前。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
| rules |
string[] |
下列格式的字幹規則清單:「word => stem」,例如:「ran => run」。。 |
StemmerTokenFilter
語言特定字幹分析篩選器。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| language |
要使用的語言。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
StemmerTokenFilterLanguage
用於詞幹計算器權杖篩選器的語言。
| 值 | Description |
|---|---|
| arabic |
選取阿拉伯文的 Lucene 詞幹標記器。 |
| armenian |
選取亞美尼亞文的 Lucene 詞幹標記器。 |
| basque |
選取巴斯克語的 Lucene 詞幹標記器。 |
| brazilian |
選取葡萄牙文 (巴西) 的 Lucene 詞幹標記器。 |
| bulgarian |
選取保加利亞文的 Lucene 詞幹標記器。 |
| catalan |
選取加泰隆尼亞語的 Lucene 詞幹標記器。 |
| czech |
選取捷克文的 Lucene 詞幹記號器。 |
| danish |
選取丹麥文的 Lucene 詞幹標記器。 |
| dutch |
選取荷蘭語的 Lucene 詞幹記號器。 |
| dutchKp |
選取使用 Kraaij-Pohlmann 詞幹分析演算法的荷蘭語的 Lucene 詞幹記號化記號器。 |
| english |
選取英文的 Lucene 詞幹標記器。 |
| lightEnglish |
選取執行淺色詞幹的英文 Lucene 詞幹標記器。 |
| minimalEnglish |
選取執行最小詞幹處理的英文 Lucene 詞幹記詞器。 |
| possessiveEnglish |
選取英文的 Lucene 詞幹標記器,以移除單字中的尾端所有格。 |
| porter2 |
選取使用 Porter2 詞幹轉換演算法的英文 Lucene 詞幹標記器。 |
| lovins |
選取使用 Lovins 詞幹提取演算法的英文 Lucene 詞幹標記器。 |
| finnish |
選取芬蘭文的 Lucene 詞幹標記器。 |
| lightFinnish |
選取執行輕詞幹的芬蘭文的 Lucene 詞幹記號器。 |
| french |
選取法文的 Lucene 詞幹標記器。 |
| lightFrench |
選取執行輕型詞幹的法語的 Lucene 詞幹標記器。 |
| minimalFrench |
選取法文的 Lucene 詞幹記詞器,以執行最小的詞幹處理。 |
| galician |
選取 Galician 的 Lucene 詞幹標記器。 |
| minimalGalician |
為加利西亞語選擇執行最小詞幹的 Lucene 詞幹標記器。 |
| german |
選取德文的 Lucene 詞幹記號器。 |
| german2 |
選取使用德文變體演算法的 Lucene 詞幹記號化記號器。 |
| lightGerman |
為執行輕型詞幹提取的德文選取 Lucene 詞幹標記器。 |
| minimalGerman |
為德文選取執行最小詞幹處理的 Lucene 詞幹標記器。 |
| greek |
選取希臘文的 Lucene 詞幹標記器。 |
| hindi |
選取印地文的 Lucene 詞幹標記器。 |
| hungarian |
選取匈牙利文的 Lucene 詞幹標記器。 |
| lightHungarian |
選取執行輕型詞幹的匈牙利文的 Lucene 詞幹標記器。 |
| indonesian |
選取印尼文的Lucene詞幹記號器。 |
| irish |
選取愛爾蘭文的 Lucene 詞幹記號器。 |
| italian |
選取義大利文的 Lucene 詞幹標記器。 |
| lightItalian |
選取義大利語的 Lucene 詞幹標記器,以執行輕型詞幹處理。 |
| sorani |
選取 Sorani 的 Lucene 詞幹標記器。 |
| latvian |
選取拉脫維亞文的 Lucene 詞幹標記器。 |
| norwegian |
選擇挪威語(Bokmıl)的Lucene詞幹標記器。 |
| lightNorwegian |
選擇挪威語(Bokmıl)的Lucene詞幹標記器,該詞有輕度詞幹處理。 |
| minimalNorwegian |
選擇挪威語(Bokmãll)的Lucene詞幹符號器,該詞幹極少。 |
| lightNynorsk |
選取挪威語 (Nynorsk) 的 Lucene 詞幹標記器,以執行光詞幹處理。 |
| minimalNynorsk |
選取挪威文 (Nynorsk) 的 Lucene 詞幹標記器,以執行最少的詞幹處理。 |
| portuguese |
選取葡萄牙文的 Lucene 詞幹標記器。 |
| lightPortuguese |
為葡萄牙語選擇執行輕型詞幹的 Lucene 詞幹記號器。 |
| minimalPortuguese |
為葡萄牙語選擇執行最小詞幹的 Lucene 詞幹標記器。 |
| portugueseRslp |
選取使用 RSLP 詞幹分析演算法的葡萄牙文的 Lucene 詞幹記號化詞器。 |
| romanian |
選取羅馬尼亞文的 Lucene 詞幹記號器。 |
| russian |
選取俄語的 Lucene 詞幹標記器。 |
| lightRussian |
選取俄語的 Lucene 詞幹標記器,以執行輕型詞幹處理。 |
| spanish |
選取西班牙文的 Lucene 詞幹標記器。 |
| lightSpanish |
選取西班牙文的 Lucene 詞幹標記器,以執行輕色詞幹處理。 |
| swedish |
選取瑞典文的 Lucene 詞幹標記器。 |
| lightSwedish |
選取瑞典文的 Lucene 詞幹標記器,以執行輕型詞幹。 |
| turkish |
選取土耳其文的 Lucene 詞幹標記器。 |
StopAnalyzer
將文字分割為非字母;套用小寫和停用字詞標記篩選。 此分析器是使用 Apache Lucene 實作的。
| 名稱 | 類型 | Description |
|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
| name |
string |
分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
| stopwords |
string[] |
停用字詞清單。 |
StopwordsList
識別語言特定停用字詞的預先定義清單。
| 值 | Description |
|---|---|
| arabic |
選取阿拉伯文的停用字詞清單。 |
| armenian |
選取亞美尼亞文的停用詞清單。 |
| basque |
選取巴斯克語的停用詞清單。 |
| brazilian |
選取葡萄牙文 (巴西) 的停用字詞清單。 |
| bulgarian |
選取保加利亞文的停用詞清單。 |
| catalan |
選取加泰隆尼亞語的停用詞清單。 |
| czech |
選取捷克文的停用字詞清單。 |
| danish |
選取丹麥文的停用詞清單。 |
| dutch |
選取荷蘭語的停用字詞清單。 |
| english |
選取英文的停用詞清單。 |
| finnish |
選取芬蘭文的停用詞清單。 |
| french |
選取法文的停用詞清單。 |
| galician |
選取 Galician 的停用字詞清單。 |
| german |
選取德文的停用字詞清單。 |
| greek |
選取希臘文的停用字詞清單。 |
| hindi |
選取印地文的停用詞清單。 |
| hungarian |
選取匈牙利文的停用詞清單。 |
| indonesian |
選取印尼文的停用詞清單。 |
| irish |
選取愛爾蘭語的停用詞清單。 |
| italian |
選取義大利文的停用字詞清單。 |
| latvian |
選取拉脫維亞文的停用詞清單。 |
| norwegian |
選取挪威文的停用詞清單。 |
| persian |
選取波斯文的停用字詞清單。 |
| portuguese |
選取葡萄牙文的停用詞清單。 |
| romanian |
選取羅馬尼亞文的停用字詞清單。 |
| russian |
選取俄語的停用字詞清單。 |
| sorani |
選取 Sorani 的停用詞清單。 |
| spanish |
選取西班牙文的停用字詞清單。 |
| swedish |
選取瑞典文的停用詞清單。 |
| thai |
選取泰文的停用詞清單。 |
| turkish |
選取土耳其語的停用字詞清單。 |
StopwordsTokenFilter
從語彙基元資料流移除停用字詞。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| ignoreCase |
boolean |
False |
值,指出是否忽略大小寫。 如果為 true,則所有單字都會先轉換成小寫。 預設值為 false。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| removeTrailing |
boolean |
True |
值,指出是否要忽略最後一個搜尋字詞是否為停用字詞。 預設值是「true」。 |
| stopwords |
string[] |
停用字詞清單。 無法同時設定此屬性和停用字詞清單屬性。 |
|
| stopwordsList | english |
要使用的停用字詞預先定義清單。 無法同時設定這個屬性和 stopwords 屬性。 預設值為英文。 |
SynonymTokenFilter
比對令牌數據流中的單字或多字同義字。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| expand |
boolean |
True |
值,指出同義字清單中的所有字組(如果未使用 => 表示法),是否會彼此對應。 如果為 true,則同義字清單中的所有字組(如果未使用 => 表示法),則會彼此對應。 下列清單:不可思議、難以置信、神話般的、驚人的相當於:不可思議、難以置信、不可思議、神奇 => 不可思議、不可思議、神話般的、驚人的。 如果為 false,下列清單:令人難以置信的,令人難以置信的,神話般的,驚人的將相當於:令人難以置信的,令人難以置信的,令人難以置信的,神話般的,驚人的 => 令人難以置信的。 預設值是「true」。 |
| ignoreCase |
boolean |
False |
值,指出是否要折疊輸入大小寫以進行比對。 預設值為 false。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| synonyms |
string[] |
下列兩種格式之一的同義字清單:1。 不可思議,難以置信,神話般的 => 驚人的 - 所有字詞在 => 符號左邊的所有字詞都將取代為其右側的所有字詞:2. 不可思議,難以置信,神話般的,驚人的 - 逗號分隔的對等字清單。 設定 expand 選項來變更此清單的解譯方式。 |
TagScoringFunction
定義函式,此函式會使用符合指定標籤清單的字串值來提升檔的分數。
| 名稱 | 類型 | Description |
|---|---|---|
| boost |
number (double) |
原始分數的乘數。 必須是不等於 1.0 的正數。 |
| fieldName |
string |
做為評分函式輸入的功能變數名稱。 |
| interpolation |
值,指出如何跨檔分數插補提升;預設為 “Linear”。 |
|
| tag |
標記評分函式的參數值。 |
|
| type |
string:
tag |
評分功能類型。 |
TagScoringParameters
提供標記評分函式的參數值。
| 名稱 | 類型 | Description |
|---|---|---|
| tagsParameter |
string |
在搜尋查詢中傳遞的參數名稱,以指定要與目標欄位比較的標籤清單。 |
TextWeights
定義索引欄位的加權,比對應該在搜尋查詢中提升評分。
| 名稱 | 類型 | Description |
|---|---|---|
| weights |
object |
每個欄位權重的字典,可提升文件評分。 索引鍵是欄位名稱,值是每個欄位的權重。 |
TokenCharacterKind
代表權杖過濾器可以操作的字元類別。
| 值 | Description |
|---|---|
| letter |
將字母保存在令牌中。 |
| digit |
在權杖中保留數字。 |
| whitespace |
在權杖中保留空格。 |
| punctuation |
在標記中保留標點符號。 |
| symbol |
將符號保留在令牌中。 |
TokenFilterName
定義搜尋引擎支援的所有權杖篩選器的名稱。
TruncateTokenFilter
將字詞截斷為特定長度。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| length |
integer (int32) maximum: 300 |
300 |
將截斷字詞的長度。 預設值和最大值為 300。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
UaxUrlEmailTokenizer
將 URL 和電子郵件標記化為一個標記。 這個 Tokenizer 是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| maxTokenLength |
integer (int32) maximum: 300 |
255 |
令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。 |
| name |
string |
Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
UniqueTokenFilter
篩選出與前一個字元相同文字的字元。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| onlyOnSamePosition |
boolean |
False |
值,指出是否只移除相同位置的重複專案。 預設值為 false。 |
VectorEncodingFormat
解譯向量欄位內容的編碼格式。
| 值 | Description |
|---|---|
| packedBit |
編碼格式,表示封裝成較寬數據類型的位。 |
VectorSearch
包含與向量搜尋相關的組態選項。
| 名稱 | 類型 | Description |
|---|---|---|
| algorithms | VectorSearchAlgorithmConfiguration[]: |
包含索引或查詢期間所使用演算法的特定組態選項。 |
| compressions | VectorSearchCompression[]: |
包含在編製索引或查詢期間所使用之壓縮方法的特定組態選項。 |
| profiles |
定義要與向量搜尋搭配使用的組態組合。 |
|
| vectorizers | VectorSearchVectorizer[]: |
包含如何向量化文字向量查詢的組態選項。 |
VectorSearchAlgorithmKind
用於索引和查詢的演算法。
| 值 | Description |
|---|---|
| hnsw |
HNSW (階層式導覽小型世界),一種近似近鄰演算法。 |
| exhaustiveKnn |
將執行暴力密碼破解搜尋的詳盡 KNN 演算法。 |
VectorSearchAlgorithmMetric
用於向量比較的相似性指標。 建議選擇與內嵌模型訓練時相同的相似度指標。
| 值 | Description |
|---|---|
| cosine |
測量向量之間的角度,以量化其相似性,忽略大小。 角度越小,相似度越近。 |
| euclidean |
計算多維度空間中向量之間的直線距離。 距離越小,相似度越近。 |
| dotProduct |
計算專案明智產品的總和,以量測對齊和大小相似度。 愈大愈積極,相似度愈近。 |
| hamming |
僅適用於位封裝的二進位數據類型。 藉由計算二元向量中的不同位置,來判斷不同的差異。 差異越少,相似性越接近。 |
VectorSearchCompressionKind
用於索引和查詢的壓縮方法。
| 值 | Description |
|---|---|
| scalarQuantization |
純量量化,這是一種壓縮方法。 在純量量化中,原始向量值會透過離散化和表示向量的每個元件,使用縮減的量化值集來壓縮成較窄的類型,藉此減少整體數據大小。 |
| binaryQuantization |
二元量化,這是一種壓縮方法。 在二進位量化中,原始向量值會藉由離散化並代表使用二進位值來表示向量的每個元件,藉此壓縮為較窄的二進位類型,藉此減少整體數據大小。 |
VectorSearchCompressionTarget
壓縮向量值的量化資料類型。
| 值 | Description |
|---|---|
| int8 |
8 位帶正負號的整數。 |
VectorSearchProfile
定義要與向量搜尋搭配使用的組態組合。
| 名稱 | 類型 | Description |
|---|---|---|
| algorithm |
string |
指定演算法和選用參數的向量搜尋演算法組態名稱。 |
| compression |
string |
指定壓縮方法及選用參數的壓縮方法配置名稱。 |
| name |
string |
要與此特定向量搜尋設定檔相關聯的名稱。 |
| vectorizer |
string |
設定為與向量搜尋搭配使用的向量化名稱。 |
VectorSearchVectorizerKind
查詢期間要使用的向量化方法。
| 值 | Description |
|---|---|
| azureOpenAI |
在查詢時使用 Azure OpenAI 資源產生內嵌。 |
| customWebApi |
在查詢時使用自定義 Web 端點產生內嵌。 |
| aiServicesVision |
使用 Azure AI 服務視覺向量化 API,在查詢時產生影像或文字輸入的內嵌。 |
| aml |
在查詢時使用透過 Azure AI Foundry 模型目錄部署的 Azure Machine Learning 端點產生內嵌。 |
WebApiVectorizer
指定使用者定義的向量化程式,以產生查詢字串的向量內嵌。 外部向量化工具的整合是使用技能集的自定義 Web API 介面來達成。
| 名稱 | 類型 | Description |
|---|---|---|
| customWebApiParameters |
指定使用者定義向量化程式的屬性。 |
|
| kind |
string:
custom |
向量搜尋向量器類型。 |
| name |
string |
要與這個特定向量化方法產生關聯的名稱。 |
WebApiVectorizerParameters
指定連接到使用者定義向量化工具的屬性。
| 名稱 | 類型 | Description |
|---|---|---|
| authIdentity | SearchIndexerDataIdentity: |
用於輸出連線的使用者指派受控識別。 如果提供 authResourceId 且未指定,則會使用系統指派的受控識別。 在索引器更新時,如果未指定身分識別,該值會維持不變。 如果設定為 “none”,則會清除此屬性的值。 |
| authResourceId |
string |
適用於連接 Azure 函式或其他提供轉換的外部程式碼的自訂端點。 當函式或應用程式向 Azure Active Directory 註冊時,此值應該是為該函式或應用程式所建立的應用程式識別碼。 指定時,向量化會使用搜尋服務的受控識別碼 (系統或使用者指派) 和函式或應用程式的存取權杖連線到函式或應用程式,並使用此值作為建立存取權杖範圍的資源識別碼。 |
| httpHeaders |
object |
提出 HTTP 要求所需的標頭。 |
| httpMethod |
string |
HTTP 要求的方法。 |
| timeout |
string (duration) |
要求的所需逾時。 預設值為 30 秒。 |
| uri |
string (uri) |
提供向量化器的 Web API 的 URI。 |
WordDelimiterTokenFilter
將字組分割成部分字組,並對部分字組群組執行選擇性的轉換。 此令牌篩選器是使用 Apache Lucene 實作。
| 名稱 | 類型 | 預設值 | Description |
|---|---|---|---|
| @odata.type |
string:
#Microsoft. |
衍生型別的歧視性。 |
|
| catenateAll |
boolean |
False |
值,指出是否會將所有子字詞部分都加大。 例如,如果此值設定為 true,“Azure-Search-1” 會變成 “AzureSearch1”。 預設值為 false。 |
| catenateNumbers |
boolean |
False |
值,指出是否將分隔數目部分的最大執行次數。 例如,如果此值設定為 true,“1-2” 會變成 “12”。 預設值為 false。 |
| catenateWords |
boolean |
False |
值,指出文字部分的最大執行是否會被限制。 例如,如果此設定為 true,“Azure-Search” 會變成 “AzureSearch”。 預設值為 false。 |
| generateNumberParts |
boolean |
True |
值,指出是否要產生數位子字詞。 預設值是「true」。 |
| generateWordParts |
boolean |
True |
值,指出是否要產生部分字組。 如果設定,則會導致產生部分文字;例如,“AzureSearch” 會變成 “Azure” “Search”。 預設值是「true」。 |
| name |
string |
令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。 |
|
| preserveOriginal |
boolean |
False |
值,指出是否會保留原始字組並新增至子字詞清單。 預設值為 false。 |
| protectedWords |
string[] |
要防止分隔的令牌清單。 |
|
| splitOnCaseChange |
boolean |
True |
值,指出是否要在caseChange上分割單字。 例如,如果此值設定為 true,“AzureSearch” 會變成 “Azure” “Search”。 預設值是「true」。 |
| splitOnNumerics |
boolean |
True |
值,指出是否要在數位上分割。 例如,如果此值設定為 true,“Azure1Search” 會變成 “Azure” “1” “Search”。 預設值是「true」。 |
| stemEnglishPossessive |
boolean |
True |
值,指出是否要移除每個子字詞的尾端 「s」。。 預設值是「true」。 |