Indexes - Create

建立新的搜尋索引。

POST {endpoint}/indexes?api-version=2026-04-01

URI 參數

名稱 位於 必要 類型 Description
endpoint
path True

string (uri)

搜尋服務的端點 URL。

api-version
query True

string

minLength: 1

用於此作業的 API 版本。

要求標頭

名稱 必要 類型 Description
Accept

Accept

接受標頭。

x-ms-client-request-id

string (uuid)

一個不透明、全域唯一、由客戶端產生的請求字串識別碼。

要求本文

名稱 必要 類型 Description
fields True

SearchField[]

索引的欄位。

name True

string

索引的名稱。

@odata.etag

string

索引的 ETag。

analyzers LexicalAnalyzer[]:

索引的分析器。

charFilters CharFilter[]:

索引的字元篩選。

corsOptions

CorsOptions

控制索引之跨原始來源資源分享 (CORS) 的選項。

defaultScoringProfile

string

如果在查詢中未指定評分配置檔,則為要使用的評分配置檔名稱。 如果未設定此屬性,而且查詢中未指定任何評分配置檔,則會使用預設評分 (tf-idf)。

description

string

索引的描述。

encryptionKey

SearchResourceEncryptionKey

您在 Azure Key Vault 中建立的加密金鑰描述。 當你想完全確保沒有人,甚至連 Microsoft 都無法解密你的資料時,這個金鑰用來為你的資料提供額外的靜態加密層級。 加密數據之後,一律會保持加密狀態。 搜尋服務會忽略嘗試將此屬性設定為 Null。 如果您想要輪替加密金鑰,您可以視需要變更此屬性;您的數據不會受到影響。 使用客戶管理的金鑰加密不適用於免費搜尋服務,而且僅適用於 2019 年 1 月 1 日或之後建立的付費服務。

normalizers LexicalNormalizer[]:

CustomNormalizer[]

索引的正規化程式。

scoringProfiles

ScoringProfile[]

索引的評分配置檔。

semantic

SemanticSearch

定義影響語意功能的搜尋索引參數。

similarity SimilarityAlgorithm:

評分和排名符合搜尋查詢的檔時所要使用的相似度演算法類型。 相似度演算法只能在索引建立時定義,而且無法在現有索引上修改。 如果為 null,則會使用 ClassicSimilarity 演算法。

suggesters

SearchSuggester[]

索引的建議工具。

tokenFilters TokenFilter[]:

索引的令牌篩選。

tokenizers LexicalTokenizer[]:

索引的Tokenizers。

vectorSearch

VectorSearch

包含與向量搜尋相關的組態選項。

回應

名稱 類型 Description
201 Created

SearchIndex

要求已成功,因此已建立新的資源。

Other Status Codes

ErrorResponse

未預期的錯誤回應。

安全性

api-key

類型: apiKey
位於: header

OAuth2Auth

類型: oauth2
Flow: implicit
授權 URL: https://login.microsoftonline.com/common/oauth2/v2.0/authorize

範圍

名稱 Description
https://search.azure.com/.default

範例

SearchServiceCreateIndex

範例要求

POST https://exampleservice.search.windows.net/indexes?api-version=2026-04-01


{
  "name": "temp-example-index",
  "description": "description",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "key": true,
      "sortable": true
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 20,
      "vectorSearchProfile": "config1"
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 10,
      "vectorSearchProfile": "config2"
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 5,
      "vectorSearchProfile": "config3"
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 5,
      "vectorSearchProfile": "config3"
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 10,
      "vectorSearchProfile": "config2"
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 32,
      "vectorSearchProfile": "config4"
    },
    {
      "name": "name",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "description",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "standard.lucene"
    },
    {
      "name": "category",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "retrievable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "tag": {
            "tagsParameter": "categoryTag"
          },
          "type": "tag",
          "fieldName": "category",
          "boost": 2
        }
      ]
    }
  ],
  "defaultScoringProfile": "stringFieldBoost",
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ],
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer"
    }
  ],
  "tokenizers": [
    {
      "maxTokenLength": 100,
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer"
    }
  ],
  "tokenFilters": [
    {
      "preserveOriginal": false,
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter"
    }
  ],
  "charFilters": [
    {
      "mappings": [
        ".=>,",
        "_=>-"
      ],
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping"
    }
  ],
  "normalizers": [
    {
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ],
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer"
    }
  ],
  "similarity": {
    "k1": 10,
    "b": 0.1,
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity"
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        },
        "rankingOrder": "BoostedRerankerScore"
      }
    ]
  },
  "vectorSearch": {
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "algorithms": [
      {
        "hnswParameters": {
          "metric": "cosine"
        },
        "name": "cosine",
        "kind": "hnsw"
      },
      {
        "hnswParameters": {
          "metric": "euclidean"
        },
        "name": "euclidean",
        "kind": "hnsw"
      },
      {
        "hnswParameters": {
          "metric": "dotProduct"
        },
        "name": "dotProduct",
        "kind": "hnsw"
      }
    ],
    "vectorizers": [
      {
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com/",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        },
        "name": "openai",
        "kind": "azureOpenAI"
      },
      {
        "customWebApiParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "httpMethod": "POST",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        },
        "name": "custom-web-api",
        "kind": "customWebApi"
      },
      {
        "amlParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "resourceId": "aml resource id",
          "timeout": "PT1M",
          "region": "aml region",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        },
        "name": "aml",
        "kind": "aml"
      },
      {
        "amlParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "resourceId": "aml resource id",
          "timeout": "PT1M",
          "region": "aml region",
          "modelName": "Cohere-embed-v4"
        },
        "name": "aml-cohere",
        "kind": "aml"
      }
    ],
    "compressions": [
      {
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        },
        "truncationDimension": 2
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        },
        "truncationDimension": 2
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        },
        "truncationDimension": 2
      }
    ]
  },
  "@odata.etag": "0x1234568AE7E58A1"
}

範例回覆

{
  "@odata.etag": "0x1234568AE7E58A1",
  "name": "temp-example-index",
  "description": "description",
  "defaultScoringProfile": "stringFieldBoost",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": true,
      "synonymMaps": []
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 20,
      "vectorSearchProfile": "config1",
      "synonymMaps": []
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 32,
      "vectorSearchProfile": "config4",
      "synonymMaps": []
    },
    {
      "name": "name",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "description",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "standard.lucene",
      "synonymMaps": []
    },
    {
      "name": "category",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "searchable": false,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "synonymMaps": []
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "functionAggregation": "sum",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "fieldName": "category",
          "interpolation": "linear",
          "type": "tag",
          "boost": 2,
          "tag": {
            "tagsParameter": "categoryTag"
          }
        }
      ]
    }
  ],
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer",
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ]
    }
  ],
  "normalizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer",
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ]
    }
  ],
  "tokenizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer",
      "maxTokenLength": 100
    }
  ],
  "tokenFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter",
      "preserveOriginal": false
    }
  ],
  "charFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping",
      "mappings": [
        ".=>,",
        "_=>-"
      ]
    }
  ],
  "similarity": {
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
    "k1": 10,
    "b": 0.1
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "rankingOrder": "BoostedRerankerScore",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        }
      }
    ]
  },
  "vectorSearch": {
    "algorithms": [
      {
        "name": "cosine",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "cosine",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "euclidean",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "euclidean",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "dotProduct",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "dotProduct",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      }
    ],
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "vectorizers": [
      {
        "name": "openai",
        "kind": "azureOpenAI",
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        }
      },
      {
        "name": "custom-web-api",
        "kind": "customWebApi",
        "customWebApiParameters": {
          "httpMethod": "POST",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        }
      },
      {
        "name": "aml",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        }
      },
      {
        "name": "aml-cohere",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "Cohere-embed-v4"
        }
      }
    ],
    "compressions": [
      {
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "truncationDimension": 2,
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        }
      }
    ]
  }
}

定義

名稱 Description
Accept

接受標頭。

AIFoundryModelCatalogName

這是 Azure AI Foundry 目錄中將命名的嵌入模型名稱。

AMLParameters

指定連接到 AML 向量化工具的屬性。

AMLVectorizer

指定透過 Azure AI Foundry 模型目錄部署的 Azure Machine Learning 端點,用於產生查詢字串的向量嵌入。

AsciiFoldingTokenFilter

如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 此令牌篩選器是使用 Apache Lucene 實作。

AzureOpenAIModelName

將呼叫的 Azure Open AI 模型名稱。

AzureOpenAIVectorizer

指定用來向量化查詢字串的 Azure OpenAI 資源。

AzureOpenAIVectorizerParameters

指定連線到 Azure OpenAI 資源的參數。

BinaryQuantizationCompression

包含二進位量化壓縮方法在編製索引和查詢期間所使用的組態選項。

BM25SimilarityAlgorithm

根據 Okapi BM25 相似度演算法的排名函式。 BM25 是類似TF-IDF的演算法,包括長度正規化(由'b' 參數控制)以及詞彙頻率飽和度(由 'k1' 參數控制)。

CharFilterName

定義搜尋引擎支援的所有字元篩選器的名稱。

CjkBigramTokenFilter

形成從標準Tokenizer產生的CJK詞彙 bigram。 此令牌篩選器是使用 Apache Lucene 實作。

CjkBigramTokenFilterScripts

CjkBigramTokenFilter 可以忽略的腳本。

ClassicSimilarityAlgorithm

舊版相似度演算法,其使用 TF-IDF 的 Lucene TFIDFSimilarity 實作。 這種 TF-IDF 變化引進靜態文件長度正規化,以及協調因只部分符合搜尋查詢的檔而受懲罰的因素。

ClassicTokenizer

適用於處理大部分歐洲語言檔的文法型Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。

CommonGramTokenFilter

建立經常出現詞彙的雙詞組,並在建立索引時使用。 仍會編製單個字詞的索引,並與雙字母組重疊。 此令牌篩選器是使用 Apache Lucene 實作。

CorsOptions

定義選項,以控制索引的跨原始來源資源分享 (CORS)。

CustomAnalyzer

可讓您控制將文字轉換成可編製索引/可搜尋令牌的程式。 它是使用者定義的組態,由單一預先定義的Tokenizer和一或多個篩選所組成。 Tokenizer 負責將文字分成令牌,以及修改 Tokenizer 所發出的令牌的篩選條件。

CustomNormalizer

可讓您設定可篩選、可排序和多面向字段的正規化,依預設會以嚴格的比對運作。 這是由至少一或多個篩選所組成的使用者定義組態,可修改所儲存的令牌。

DictionaryDecompounderTokenFilter

分解在許多日耳曼語系中找到的複合字。 此令牌篩選器是使用 Apache Lucene 實作。

DistanceScoringFunction

定義根據地理位置距離提升分數的函式。

DistanceScoringParameters

提供距離評分函式的參數值。

EdgeNGramTokenFilter

從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

EdgeNGramTokenFilterSide

指定應從輸入的哪一側產生 n-gram。

EdgeNGramTokenFilterV2

從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

EdgeNGramTokenizer

將邊緣的輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。

ElisionTokenFilter

移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 此令牌篩選器是使用 Apache Lucene 實作。

ErrorAdditionalInfo

資源管理錯誤附加資訊。

ErrorDetail

錯誤詳細資料。

ErrorResponse

所有 Azure Resource Manager API 的常見錯誤回應,用於回傳失敗操作的錯誤細節。 (這也遵循 OData 錯誤回應格式。)。

ExhaustiveKnnAlgorithmConfiguration

包含查詢期間所使用完整 KNN 演算法的特定組態選項,這會在整個向量索引上執行暴力密碼破解搜尋。

ExhaustiveKnnParameters

包含完整 KNN 演算法特有的參數。

FreshnessScoringFunction

定義函式,根據日期時間欄位的值來提升分數。

FreshnessScoringParameters

提供更新評分函式的參數值。

HnswAlgorithmConfiguration

包含索引和查詢期間使用的 HNSW 近似最近鄰演算法特有的組態選項。 HNSW 演算法在搜尋速度和準確性之間提供了可調整的權衡。

HnswParameters

包含 HNSW 演算法特定的參數。

KeepTokenFilter

令牌篩選條件,只保留包含指定單字清單中的文字標記。 此令牌篩選器是使用 Apache Lucene 實作。

KeywordMarkerTokenFilter

將字詞標示為關鍵字。 此令牌篩選器是使用 Apache Lucene 實作。

KeywordTokenizer

以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。

KeywordTokenizerV2

以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。

LengthTokenFilter

移除太長或太短的文字。 此令牌篩選器是使用 Apache Lucene 實作。

LexicalAnalyzerName

定義搜尋引擎支援的所有文字分析器的名稱。

LexicalNormalizerName

定義搜尋引擎支援的所有文字正規化程式的名稱。

LexicalTokenizerName

定義搜尋引擎支援的所有標記器的名稱。

LimitTokenFilter

限制索引過程中的標記數量。 此令牌篩選器是使用 Apache Lucene 實作。

LuceneStandardAnalyzer

標準 Apache Lucene 分析器;由標準 Tokenizer、小寫篩選和停止篩選所組成。

LuceneStandardTokenizer

在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。

LuceneStandardTokenizerV2

在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。

MagnitudeScoringFunction

定義函式,根據數值欄位的大小來提升分數。

MagnitudeScoringParameters

提供量級評分函式的參數值。

MappingCharFilter

套用對應選項所定義的對應的字元篩選。 比對採用貪婪演算法 (由指定點上最長的模式比對勝出) 替換字串可以是空字串。 此字元篩選器是使用 Apache Lucene 實作。

MicrosoftLanguageStemmingTokenizer

使用語言特有的規則來分割文字,並將字組縮減到其基本形式。

MicrosoftLanguageTokenizer

使用語言特有的規則分割文字。

MicrosoftStemmingTokenizerLanguage

列出 Microsoft 語言詞幹分詞器所支援的語言。

MicrosoftTokenizerLanguage

列出 Microsoft 語言分詞器所支援的語言。

NGramTokenFilter

產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

NGramTokenFilterV2

產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

NGramTokenizer

將輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。

PathHierarchyTokenizerV2

路徑類階層的 Token 化工具。 這個 Tokenizer 是使用 Apache Lucene 實作。

PatternAnalyzer

透過規則運算式模式彈性地將文字分割成字詞。 此分析器是使用 Apache Lucene 實作的。

PatternCaptureTokenFilter

使用 Java regex 來發出多個令牌 - 一個或多個模式中每個擷取群組各一個。 此令牌篩選器是使用 Apache Lucene 實作。

PatternReplaceCharFilter

字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此字元篩選器是使用 Apache Lucene 實作。

PatternReplaceTokenFilter

字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此令牌篩選器是使用 Apache Lucene 實作。

PatternTokenizer

使用 regex 模式比對來建構不同令牌的 Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。

PhoneticEncoder

識別要與 PhoneticTokenFilter 搭配使用的語音編碼器類型。

PhoneticTokenFilter

建立拼音相符的標記。 此令牌篩選器是使用 Apache Lucene 實作。

RankingOrder

代表用於文件排序順序的分數。

RescoringOptions

包含重新記錄的選項。

ScalarQuantizationCompression

包含索引編製和查詢期間所使用純量量化壓縮方法的特定組態選項。

ScalarQuantizationParameters

包含純量量化特有的參數。

ScoringFunctionAggregation

定義用來合併評分設定檔中所有評分函數結果的彙總函數。

ScoringFunctionInterpolation

定義用來在一系列文件中插補分數提升的函數。

ScoringProfile

定義影響搜尋查詢評分之搜尋索引的參數。

SearchField

表示索引定義中的欄位,描述欄位的名稱、數據類型和搜尋行為。

SearchFieldDataType

定義搜尋索引中欄位的資料類型。

SearchIndex

表示搜尋索引定義,描述索引的欄位和搜尋行為。

SearchIndexerDataNoneIdentity

清除資料源的識別屬性。

SearchIndexerDataUserAssignedIdentity

指定要使用之數據源的身分識別。

SearchResourceEncryptionKey

Azure Key Vault 中客戶管理的加密密鑰。 您建立和管理的金鑰可用來加密或解密靜態資料,例如索引和同義字對映。

SearchSuggester

定義建議 API 應如何套用至索引中的欄位群組。

SemanticConfiguration

定義在語意功能內容中使用的特定組態。

SemanticField

做為語意組態一部分的欄位。

SemanticPrioritizedFields

描述要用於語意排名、標題、醒目提示和答案的標題、內容和關鍵詞欄位。

SemanticSearch

定義影響語意功能的搜尋索引參數。

ShingleTokenFilter

將標記組合建立為單一標記。 此令牌篩選器是使用 Apache Lucene 實作。

SnowballTokenFilter

使用 Snowball 產生的字幹分析器來幹詞的篩選。 此令牌篩選器是使用 Apache Lucene 實作。

SnowballTokenFilterLanguage

要用於 Snowball 權杖篩選器的語言。

StemmerOverrideTokenFilter

提供使用自定義字典型字幹分析覆寫其他字幹篩選的功能。 任何字典字幹字詞都會標示為關鍵詞,因此它們不會在鏈結中加上字幹分析器。 必須放在任何詞幹分析篩選器之前。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html

StemmerTokenFilter

語言特定字幹分析篩選器。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

StemmerTokenFilterLanguage

用於詞幹計算器權杖篩選器的語言。

StopAnalyzer

將文字分割為非字母;套用小寫和停用字詞標記篩選。 此分析器是使用 Apache Lucene 實作的。

StopwordsList

識別語言特定停用字詞的預先定義清單。

StopwordsTokenFilter

從語彙基元資料流移除停用字詞。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

SynonymTokenFilter

比對令牌數據流中的單字或多字同義字。 此令牌篩選器是使用 Apache Lucene 實作。

TagScoringFunction

定義函式,此函式會使用符合指定標籤清單的字串值來提升檔的分數。

TagScoringParameters

提供標記評分函式的參數值。

TextWeights

定義索引欄位的加權,比對應該在搜尋查詢中提升評分。

TokenCharacterKind

代表權杖過濾器可以操作的字元類別。

TokenFilterName

定義搜尋引擎支援的所有權杖篩選器的名稱。

TruncateTokenFilter

將字詞截斷為特定長度。 此令牌篩選器是使用 Apache Lucene 實作。

UaxUrlEmailTokenizer

將 URL 和電子郵件標記化為一個標記。 這個 Tokenizer 是使用 Apache Lucene 實作。

UniqueTokenFilter

篩選出與前一個字元相同文字的字元。 此令牌篩選器是使用 Apache Lucene 實作。

VectorEncodingFormat

解譯向量欄位內容的編碼格式。

VectorSearch

包含與向量搜尋相關的組態選項。

VectorSearchAlgorithmKind

用於索引和查詢的演算法。

VectorSearchAlgorithmMetric

用於向量比較的相似性指標。 建議選擇與內嵌模型訓練時相同的相似度指標。

VectorSearchCompressionKind

用於索引和查詢的壓縮方法。

VectorSearchCompressionTarget

壓縮向量值的量化資料類型。

VectorSearchProfile

定義要與向量搜尋搭配使用的組態組合。

VectorSearchVectorizerKind

查詢期間要使用的向量化方法。

WebApiVectorizer

指定使用者定義的向量化程式,以產生查詢字串的向量內嵌。 外部向量化工具的整合是使用技能集的自定義 Web API 介面來達成。

WebApiVectorizerParameters

指定連接到使用者定義向量化工具的屬性。

WordDelimiterTokenFilter

將字組分割成部分字組,並對部分字組群組執行選擇性的轉換。 此令牌篩選器是使用 Apache Lucene 實作。

Accept

接受標頭。

Description
application/json;odata.metadata=minimal

AIFoundryModelCatalogName

這是 Azure AI Foundry 目錄中將命名的嵌入模型名稱。

Description
OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32

OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32

OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336

OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336

Facebook-DinoV2-Image-Embeddings-ViT-Base

Facebook-DinoV2-圖像嵌入-ViT-Base

Facebook-DinoV2-Image-Embeddings-ViT-Giant

Facebook-DinoV2-圖像嵌入-ViT-Giant

Cohere-embed-v3-english

Cohere-embed-v3-english

Cohere-embed-v3-multilingual

Cohere-embed-v3-multilingual

Cohere-embed-v4

Cohere embed v4 模型,用於從文本和圖像生成嵌入。

AMLParameters

指定連接到 AML 向量化工具的屬性。

名稱 類型 Description
key

string

(金鑰驗證的必要專案)AML 服務的金鑰。

modelName

AIFoundryModelCatalogName

來自 Azure AI Foundry 目錄的嵌入模型名稱,部署於所提供端點。

region

string

(令牌驗證的選擇性)。 AML 服務所部署的區域。

resourceId

string

(令牌驗證的必要專案)。 AML 服務的 Azure Resource Manager 資源 ID。 格式應該是 subscriptions/{guid}/resourceGroups/{resource-group-name}/Microsoft。MachineLearningServices/workspaces/{workspace-name}/services/{service_name}.

timeout

string (duration)

(選擇性) 指定時,表示進行 API 呼叫的 http 用戶端逾時。

uri

string (uri)

( 不需要驗證或金鑰驗證 )將傳送 JSON 承載之 AML 服務的評分 URI。 只允許 HTTPs URI 配置。

AMLVectorizer

指定透過 Azure AI Foundry 模型目錄部署的 Azure Machine Learning 端點,用於產生查詢字串的向量嵌入。

名稱 類型 Description
amlParameters

AMLParameters

指定 AML 向量化工具的屬性。

kind string:

aml

向量搜尋向量器類型。

name

string

要與這個特定向量化方法產生關聯的名稱。

AsciiFoldingTokenFilter

如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.AsciiFoldingTokenFilter

衍生型別的歧視性。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

preserveOriginal

boolean

False

值,指出是否要保留原始令牌。 預設值為 false。

AzureOpenAIModelName

將呼叫的 Azure Open AI 模型名稱。

Description
text-embedding-ada-002

TextEmbeddingAda002 模型。

text-embedding-3-large

TextEmbedding3Large 模型。

text-embedding-3-small

TextEmbedding3小型模型。

gpt-5-mini

Gpt5Mini 型號。

gpt-5-nano

Gpt5Nano 模型。

gpt-5.4-mini

Gpt54Mini 型號。

gpt-5.4-nano

Gpt54Nano 模型。

AzureOpenAIVectorizer

指定用來向量化查詢字串的 Azure OpenAI 資源。

名稱 類型 Description
azureOpenAIParameters

AzureOpenAIVectorizerParameters

包含 Azure OpenAI 內嵌向量化的特定參數。

kind string:

azureOpenAI

向量搜尋向量器類型。

name

string

要與這個特定向量化方法產生關聯的名稱。

AzureOpenAIVectorizerParameters

指定連線到 Azure OpenAI 資源的參數。

名稱 類型 Description
apiKey

string

所指定 Azure OpenAI 資源的 API 金鑰。

authIdentity SearchIndexerDataIdentity:

用於輸出連線的使用者指派受控識別。

deploymentId

string

指定資源上 Azure OpenAI 模型部署的識別碼。

modelName

AzureOpenAIModelName

在提供的 deploymentId 路徑上部署的內嵌模型名稱。

resourceUri

string (uri)

Azure OpenAI 資源的資源 URI。

BinaryQuantizationCompression

包含二進位量化壓縮方法在編製索引和查詢期間所使用的組態選項。

名稱 類型 Description
kind string:

binaryQuantization

向量搜尋壓縮的類型。

name

string

要與此特定組態產生關聯的名稱。

rescoringOptions

RescoringOptions

包含重新記錄的選項。

truncationDimension

integer (int32)

要截斷向量的維度數目。 截斷向量可減少向量的大小,以及搜尋期間需要傳輸的數據量。 這可以節省記憶體成本,並降低搜尋效能,以犧牲召回率。 它只應該用於內嵌使用 Matryoshka 表示法學習 (MRL) 定型的內嵌,例如 OpenAI 文字內嵌-3-large(小型)。 默認值為 null,這表示不會截斷。

BM25SimilarityAlgorithm

根據 Okapi BM25 相似度演算法的排名函式。 BM25 是類似TF-IDF的演算法,包括長度正規化(由'b' 參數控制)以及詞彙頻率飽和度(由 'k1' 參數控制)。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.BM25Similarity

衍生型別的歧視性。

b

number (double)

此屬性會控制檔的長度如何影響相關性分數。 根據預設,會使用 0.75 的值。 值為 0.0 表示不會套用任何長度正規化,而值為 1.0 表示分數會完全由文件的長度正規化。

k1

number (double)

此屬性會控制每個相符字詞的字詞頻率與文件查詢組最終相關性分數之間的縮放函數。 根據預設,會使用1.2的值。 值為 0.0 表示分數不會隨著詞彙頻率增加而調整。

CharFilterName

定義搜尋引擎支援的所有字元篩選器的名稱。

Description
html_strip

嘗試去除 HTML 建構的字元篩選。 請參閱 https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html

CjkBigramTokenFilter

形成從標準Tokenizer產生的CJK詞彙 bigram。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.CjkBigramTokenFilter

衍生型別的歧視性。

ignoreScripts

CjkBigramTokenFilterScripts[]

要忽略的腳本。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

outputUnigrams

boolean

False

值,指出是否要同時輸出 unigram 和 bigrams (如果為 true),或只是 bigrams (如果為 false)。 預設值為 false。

CjkBigramTokenFilterScripts

CjkBigramTokenFilter 可以忽略的腳本。

Description
han

在形成中日韓術語的二元組時忽略漢文字。

hiragana

在形成 CJK 術語的二元組時忽略平假名腳本。

katakana

在形成 CJK 術語的二元組時忽略片假名腳本。

hangul

在形成 CJK 術語的二元組時忽略韓文文字。

ClassicSimilarityAlgorithm

舊版相似度演算法,其使用 TF-IDF 的 Lucene TFIDFSimilarity 實作。 這種 TF-IDF 變化引進靜態文件長度正規化,以及協調因只部分符合搜尋查詢的檔而受懲罰的因素。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.ClassicSimilarity

衍生型別的歧視性。

ClassicTokenizer

適用於處理大部分歐洲語言檔的文法型Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.ClassicTokenizer

衍生型別的歧視性。

maxTokenLength

integer (int32)

maximum: 300
255

令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

CommonGramTokenFilter

建立經常出現詞彙的雙詞組,並在建立索引時使用。 仍會編製單個字詞的索引,並與雙字母組重疊。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.CommonGramTokenFilter

衍生型別的歧視性。

commonWords

string[]

一組通用字組。

ignoreCase

boolean

False

值,指出一般字組比對是否不區分大小寫。 預設值為 false。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

queryMode

boolean

False

值,指出令牌篩選是否處於查詢模式。 在查詢模式中時,令牌篩選會產生 bigrams,然後移除通用單字和單一字詞,後面接著一般單字。 預設值為 false。

CorsOptions

定義選項,以控制索引的跨原始來源資源分享 (CORS)。

名稱 類型 Description
allowedOrigins

string[]

JavaScript 程式碼將從中獲得索引存取權的來源清單。 可以包含 {protocol}://{fully-qualified-domain-name}[:{port#}] 形式的主機清單,或單一 '*' 以允許所有來源 (不建議)。

maxAgeInSeconds

integer (int64)

瀏覽器應快取 CORS 預檢回應的持續時間。 預設為 5 分鐘。

CustomAnalyzer

可讓您控制將文字轉換成可編製索引/可搜尋令牌的程式。 它是使用者定義的組態,由單一預先定義的Tokenizer和一或多個篩選所組成。 Tokenizer 負責將文字分成令牌,以及修改 Tokenizer 所發出的令牌的篩選條件。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.CustomAnalyzer

衍生型別的歧視性。

charFilters

CharFilterName[]

在分詞器處理輸入文字之前,用來準備輸入文字的字元篩選器清單。 例如,它們可以替換某些字元或符號。 過濾器會依其列出的順序執行。

name

string

分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

tokenFilters

TokenFilterName[]

權杖篩選器清單,用來篩選或修改權杖化器所產生的權杖。 例如,您可以指定小寫篩選器,將所有字元轉換成小寫。 過濾器會依其列出的順序執行。

tokenizer

LexicalTokenizerName

用來將連續文字分割成一系列標記的標記器的名稱,例如將句子分成單字。

CustomNormalizer

可讓您設定可篩選、可排序和多面向字段的正規化,依預設會以嚴格的比對運作。 這是由至少一或多個篩選所組成的使用者定義組態,可修改所儲存的令牌。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.CustomNormalizer

衍生型別的歧視性。

charFilters

CharFilterName[]

用於在處理輸入文字之前準備輸入文字的字元篩選器清單。 例如,它們可以替換某些字元或符號。 過濾器會依其列出的順序執行。

name

string

char 篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

tokenFilters

TokenFilterName[]

用來篩選或修改輸入權杖的權杖篩選器清單。 例如,您可以指定小寫篩選器,將所有字元轉換成小寫。 過濾器會依其列出的順序執行。

DictionaryDecompounderTokenFilter

分解在許多日耳曼語系中找到的複合字。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.DictionaryDecompounderTokenFilter

衍生型別的歧視性。

maxSubwordSize

integer (int32)

maximum: 300
15

子字詞大小上限。 只輸出比這個短的子字。 預設值為 15。 最大值為300。

minSubwordSize

integer (int32)

maximum: 300
2

最小子字大小。 輸出的子字詞長度只會超過這個。 預設為 2。 最大值為300。

minWordSize

integer (int32)

maximum: 300
5

字型大小下限。 只有比處理此時間更長的字組。 預設值為 5。 最大值為300。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

onlyLongestMatch

boolean

False

值,指出是否只將最長相符的子字詞新增至輸出。 預設值為 false。

wordList

string[]

要比對的字組清單。

DistanceScoringFunction

定義根據地理位置距離提升分數的函式。

名稱 類型 Description
boost

number (double)

原始分數的乘數。 必須是不等於 1.0 的正數。

distance

DistanceScoringParameters

距離計分函式的參數值。

fieldName

string

做為評分函式輸入的功能變數名稱。

interpolation

ScoringFunctionInterpolation

值,指出如何跨檔分數插補提升;預設為 “Linear”。

type string:

distance

評分功能類型。

DistanceScoringParameters

提供距離評分函式的參數值。

名稱 類型 Description
boostingDistance

number (double)

與提升範圍結束的參考位置的距離(以公里為單位)。

referencePointParameter

string

在搜尋查詢中傳遞的參數名稱,以指定參考位置。

EdgeNGramTokenFilter

從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenFilter

衍生型別的歧視性。

maxGram

integer (int32)

2

n-gram 長度上限。 預設為 2。

minGram

integer (int32)

1

最小 n-gram 長度。 預設 為 1。 必須小於 maxGram的值。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

side

EdgeNGramTokenFilterSide

front

指定應從輸入的哪一端產生 n-gram。 預設值為「front」。

EdgeNGramTokenFilterSide

指定應從輸入的哪一側產生 n-gram。

Description
front

指定應該從輸入的前面產生 n-gram。

back

指定應該從輸入的背面產生 n-gram。

EdgeNGramTokenFilterV2

從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenFilterV2

衍生型別的歧視性。

maxGram

integer (int32)

maximum: 300
2

n-gram 長度上限。 預設為 2。 最大值為300。

minGram

integer (int32)

maximum: 300
1

最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

side

EdgeNGramTokenFilterSide

front

指定應從輸入的哪一端產生 n-gram。 預設值為「front」。

EdgeNGramTokenizer

將邊緣的輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenizer

衍生型別的歧視性。

maxGram

integer (int32)

maximum: 300
2

n-gram 長度上限。 預設為 2。 最大值為300。

minGram

integer (int32)

maximum: 300
1

最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

tokenChars

TokenCharacterKind[]

要保留在令牌中的字元類別。

ElisionTokenFilter

移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.ElisionTokenFilter

衍生型別的歧視性。

articles

string[]

要移除的發行項集。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

ErrorAdditionalInfo

資源管理錯誤附加資訊。

名稱 類型 Description
info

附加資訊。

type

string

其他資訊類型。

ErrorDetail

錯誤詳細資料。

名稱 類型 Description
additionalInfo

ErrorAdditionalInfo[]

錯誤附加資訊。

code

string

錯誤碼。

details

ErrorDetail[]

錯誤詳情

message

string

錯誤訊息。

target

string

錯誤目標。

ErrorResponse

所有 Azure Resource Manager API 的常見錯誤回應,用於回傳失敗操作的錯誤細節。 (這也遵循 OData 錯誤回應格式。)。

名稱 類型 Description
error

ErrorDetail

錯誤物件。

ExhaustiveKnnAlgorithmConfiguration

包含查詢期間所使用完整 KNN 演算法的特定組態選項,這會在整個向量索引上執行暴力密碼破解搜尋。

名稱 類型 Description
exhaustiveKnnParameters

ExhaustiveKnnParameters

包含完整 KNN 演算法特有的參數。

kind string:

exhaustiveKnn

向量搜尋演算法配置類型。

name

string

要與此特定組態產生關聯的名稱。

ExhaustiveKnnParameters

包含完整 KNN 演算法特有的參數。

名稱 類型 Description
metric

VectorSearchAlgorithmMetric

用於向量比較的相似性指標。

FreshnessScoringFunction

定義函式,根據日期時間欄位的值來提升分數。

名稱 類型 Description
boost

number (double)

原始分數的乘數。 必須是不等於 1.0 的正數。

fieldName

string

做為評分函式輸入的功能變數名稱。

freshness

FreshnessScoringParameters

Freshness 評分函式的參數值。

interpolation

ScoringFunctionInterpolation

值,指出如何跨檔分數插補提升;預設為 “Linear”。

type string:

freshness

評分功能類型。

FreshnessScoringParameters

提供更新評分函式的參數值。

名稱 類型 Description
boostingDuration

string (duration)

特定文件的加強推廣將停止的到期期間。

HnswAlgorithmConfiguration

包含索引和查詢期間使用的 HNSW 近似最近鄰演算法特有的組態選項。 HNSW 演算法在搜尋速度和準確性之間提供了可調整的權衡。

名稱 類型 Description
hnswParameters

HnswParameters

包含 HNSW 演算法特有的參數。

kind string:

hnsw

向量搜尋演算法配置類型。

name

string

要與此特定組態產生關聯的名稱。

HnswParameters

包含 HNSW 演算法特定的參數。

名稱 類型 預設值 Description
efConstruction

integer (int32)

minimum: 100
maximum: 1000
400

包含最近鄰居的動態清單大小,在索引時間期間使用。 增加此參數可能會改善索引品質,但代價是索引時間增加。 在某個時刻,增加該參數會導致收益遞減。

efSearch

integer (int32)

minimum: 100
maximum: 1000
500

包含最近鄰接項的動態清單大小,在搜尋期間使用。 增加此參數可能會改善搜尋結果,但會降低搜尋速度。 在某個時刻,增加該參數會導致收益遞減。

m

integer (int32)

minimum: 4
maximum: 10
4

在建構期間為每個新元素建立的雙向連結數目。 增加此參數值可能會改善召回率,並減少具有高內在維度的資料集的擷取時間,但代價是記憶體耗用量增加和索引時間延長。

metric

VectorSearchAlgorithmMetric

用於向量比較的相似性指標。

KeepTokenFilter

令牌篩選條件,只保留包含指定單字清單中的文字標記。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.KeepTokenFilter

衍生型別的歧視性。

keepWords

string[]

要保留的字組清單。

keepWordsCase

boolean

False

值,指出是否先小寫所有單字。 預設值為 false。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

KeywordMarkerTokenFilter

將字詞標示為關鍵字。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.KeywordMarkerTokenFilter

衍生型別的歧視性。

ignoreCase

boolean

False

值,指出是否忽略大小寫。 如果為 true,則所有單字都會先轉換成小寫。 預設值為 false。

keywords

string[]

要標示為關鍵詞的字組清單。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

KeywordTokenizer

以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.KeywordTokenizer

衍生型別的歧視性。

bufferSize

integer (int32)

256

讀取緩衝區大小 (以位元組為單位)。 預設值為 256。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

KeywordTokenizerV2

以單一語彙基元的形式輸出整個輸入。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.KeywordTokenizerV2

衍生型別的歧視性。

maxTokenLength

integer (int32)

maximum: 300
256

令牌長度上限。 預設值為 256。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

LengthTokenFilter

移除太長或太短的文字。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.LengthTokenFilter

衍生型別的歧視性。

max

integer (int32)

maximum: 300
300

字元的最大長度。 預設值和最大值為 300。

min

integer (int32)

maximum: 300
0

字元的最小長度。 預設值為 0。 最大值為300。 必須小於 max的值。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

LexicalAnalyzerName

定義搜尋引擎支援的所有文字分析器的名稱。

Description
ar.microsoft

Microsoft 阿拉伯語分析器。

ar.lucene

阿拉伯語的 Lucene 分析儀。

hy.lucene

亞美尼亞語的 Lucene 分析儀。

bn.microsoft

Microsoft 分析器用於孟加拉語。

eu.lucene

巴斯克語的 Lucene 分析儀。

bg.microsoft

Microsoft Analyzer for Bulgarian.

bg.lucene

保加利亞語的 Lucene 分析儀。

ca.microsoft

Microsoft analyzer for Catalan.

ca.lucene

加泰羅尼亞語的 Lucene 分析儀。

zh-Hans.microsoft

Microsoft Analyzer for 中文(簡體)。

zh-Hans.lucene

Lucene 中文分析儀(簡體)。

zh-Hant.microsoft

Microsoft 分析器(繁體)版。

zh-Hant.lucene

Lucene 中文分析儀(繁體)。

hr.microsoft

Microsoft analyzer for Croatian。

cs.microsoft

Microsoft analyzer for Czech.

cs.lucene

捷克語的 Lucene 分析儀。

da.microsoft

Microsoft 分析器用於丹麥語。

da.lucene

丹麥語的 Lucene 分析儀。

nl.microsoft

Microsoft analyzer for Dutch.

nl.lucene

荷蘭語的 Lucene 分析儀。

en.microsoft

Microsoft 英文分析儀。

en.lucene

英語的 Lucene 分析儀。

et.microsoft

Microsoft 分析器用於愛沙尼亞語。

fi.microsoft

Microsoft 分析器用於芬蘭語。

fi.lucene

芬蘭語的 Lucene 分析儀。

fr.microsoft

Microsoft analyzer for French.

fr.lucene

法語的 Lucene 分析儀。

gl.lucene

加利西亞的 Lucene 分析儀。

de.microsoft

Microsoft Analyzer for German。

de.lucene

德語 Lucene 分析儀。

el.microsoft

Microsoft analyzer for Greek.

el.lucene

希臘語的 Lucene 分析儀。

gu.microsoft

Microsoft analyzer for Gujarati.

he.microsoft

Microsoft 希伯來語分析器。

hi.microsoft

Microsoft Analyzer for Hindi。

hi.lucene

印地語的 Lucene 分析儀。

hu.microsoft

Microsoft analyzer for Hungarian。

hu.lucene

匈牙利語的 Lucene 分析儀。

is.microsoft

Microsoft 冰島語分析器。

id.microsoft

Microsoft analyzer for Indonesian (Bahasa).

id.lucene

印尼語 Lucene 分析儀。

ga.lucene

愛爾蘭的 Lucene 分析儀。

it.microsoft

Microsoft analyzer for Italian.

it.lucene

意大利語的 Lucene 分析儀。

ja.microsoft

Microsoft 日文分析器。

ja.lucene

日語 Lucene 分析儀。

kn.microsoft

Microsoft analyzer for Kannada.

ko.microsoft

Microsoft 韓文分析器。

ko.lucene

韓語 Lucene 分析儀。

lv.microsoft

Microsoft analyzer for Latvian.

lv.lucene

拉脫維亞語的 Lucene 分析儀。

lt.microsoft

Microsoft analyzer for Lithuanian。

ml.microsoft

Microsoft 分析器 for Malayalam.

ms.microsoft

Microsoft analyzer for Malay (Latin)。

mr.microsoft

Microsoft 馬拉地語分析器。

nb.microsoft

Microsoft analyzer for Norwegian (BokmÃll).

no.lucene

挪威語的 Lucene 分析儀。

fa.lucene

波斯語的 Lucene 分析儀。

pl.microsoft

Microsoft 波蘭語分析器。

pl.lucene

用於波蘭語的 Lucene 分析儀。

pt-BR.microsoft

Microsoft analyzer for Portuguese (Brazil).

pt-BR.lucene

葡萄牙語(巴西)的 Lucene 分析儀。

pt-PT.microsoft

Microsoft analyzer for Portuguese (Portugal).

pt-PT.lucene

葡萄牙語的 Lucene 分析儀(葡萄牙)。

pa.microsoft

Microsoft analyzer for Punjabi.

ro.microsoft

Microsoft analyzer for Romanian。

ro.lucene

羅馬尼亞語的 Lucene 分析儀。

ru.microsoft

Microsoft 分析器用於俄文。

ru.lucene

俄語 Lucene 分析儀。

sr-cyrillic.microsoft

Microsoft analyzer for Serbian (Cyrillic).

sr-latin.microsoft

Microsoft analyzer for Servian (Latin)。

sk.microsoft

Microsoft analyzer for Slovak.

sl.microsoft

Microsoft analyzer for Slovenian.

es.microsoft

Microsoft 西班牙語分析器。

es.lucene

西班牙語的 Lucene 分析儀。

sv.microsoft

Microsoft 分析器用於瑞典語。

sv.lucene

瑞典語 Lucene 分析儀。

ta.microsoft

Microsoft 分析器用於泰米爾語。

te.microsoft

Microsoft analyzer for Telugu.

th.microsoft

Microsoft analyzer for Thai.

th.lucene

泰語 Lucene 分析儀。

tr.microsoft

Microsoft analyzer for Turkish.

tr.lucene

土耳其語的 Lucene 分析儀。

uk.microsoft

Microsoft analyzer for Ukrainian.

ur.microsoft

Microsoft analyzer for Urdu.

vi.microsoft

Microsoft 越南語分析儀。

standard.lucene

標準 Lucene 分析儀。

standardasciifolding.lucene

標準 ASCII 折疊 Lucene 分析儀。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers

keyword

將欄位的整個內容視為單一語彙基元。 這適用於郵遞區號、標識元和某些產品名稱等數據。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html

pattern

透過規則運算式模式彈性地將文字分割成字詞。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html

simple

在非字母的位置分割文字,並將其轉換成小寫。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html

stop

將文字分割為非字母;套用小寫和停用字詞標記篩選。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html

whitespace

使用空白分詞器的分析器。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html

LexicalNormalizerName

定義搜尋引擎支援的所有文字正規化程式的名稱。

Description
asciifolding

如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

elision

移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

lowercase

將權杖文字正規化為小寫。 請參閱 https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

standard

標準歸一化器,由小寫和 asciifolding 組成。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

uppercase

將權杖文字正規化為大寫。 請參閱 https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

LexicalTokenizerName

定義搜尋引擎支援的所有標記器的名稱。

Description
classic

適用於處理大部分歐洲語言檔的文法型Tokenizer。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicTokenizer.html

edgeNGram

將邊緣的輸入標記化為指定大小的 n-gram。 請參閱 https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenizer.html

keyword_v2

以單一語彙基元的形式輸出整個輸入。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordTokenizer.html

letter

在非字母的位置上分割文字。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LetterTokenizer.html

lowercase

在非字母的位置分割文字,並將其轉換成小寫。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseTokenizer.html

microsoft_language_tokenizer

使用語言特有的規則分割文字。

microsoft_language_stemming_tokenizer

使用語言特有的規則來分割文字,並將字組縮減到其基本形式。

nGram

將輸入標記化為指定大小的 n-gram。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenizer.html

path_hierarchy_v2

路徑類階層的 Token 化工具。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/path/PathHierarchyTokenizer.html

pattern

使用 regex 模式比對來建構不同令牌的 Tokenizer。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/pattern/PatternTokenizer.html

standard_v2

標準 Lucene 分析器;由標準 Tokenizer、小寫篩選和停止篩選所組成。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/StandardTokenizer.html

uax_url_email

將 URL 和電子郵件標記化為一個標記。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/UAX29URLEmailTokenizer.html

whitespace

在空白字元處分割文字。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceTokenizer.html

LimitTokenFilter

限制索引過程中的標記數量。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.LimitTokenFilter

衍生型別的歧視性。

consumeAllTokens

boolean

False

值,指出是否必須取用輸入中的所有令牌,即使達到 maxTokenCount 也一樣。 預設值為 false。

maxTokenCount

integer (int32)

1

要產生的令牌數目上限。 預設 為 1。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

LuceneStandardAnalyzer

標準 Apache Lucene 分析器;由標準 Tokenizer、小寫篩選和停止篩選所組成。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.StandardAnalyzer

衍生型別的歧視性。

maxTokenLength

integer (int32)

maximum: 300
255

令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。

name

string

分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

stopwords

string[]

停用字詞清單。

LuceneStandardTokenizer

在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.StandardTokenizer

衍生型別的歧視性。

maxTokenLength

integer (int32)

255

令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

LuceneStandardTokenizerV2

在 Unicode 文字分割規則之後中斷文字。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.StandardTokenizerV2

衍生型別的歧視性。

maxTokenLength

integer (int32)

maximum: 300
255

令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

MagnitudeScoringFunction

定義函式,根據數值欄位的大小來提升分數。

名稱 類型 Description
boost

number (double)

原始分數的乘數。 必須是不等於 1.0 的正數。

fieldName

string

做為評分函式輸入的功能變數名稱。

interpolation

ScoringFunctionInterpolation

值,指出如何跨檔分數插補提升;預設為 “Linear”。

magnitude

MagnitudeScoringParameters

大小計分函式的參數值。

type string:

magnitude

評分功能類型。

MagnitudeScoringParameters

提供量級評分函式的參數值。

名稱 類型 Description
boostingRangeEnd

number (double)

加強推廣結束的欄位值。

boostingRangeStart

number (double)

開始加強推廣的欄位值。

constantBoostBeyondRange

boolean

一個值,指出是否要對超出範圍結束值的欄位值套用常數提升;預設值為 false。

MappingCharFilter

套用對應選項所定義的對應的字元篩選。 比對採用貪婪演算法 (由指定點上最長的模式比對勝出) 替換字串可以是空字串。 此字元篩選器是使用 Apache Lucene 實作。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.MappingCharFilter

衍生型別的歧視性。

mappings

string[]

下列格式的對應清單:“a=>b” (所有出現的字元 “a” 都會取代為字元 “b”。

name

string

char 篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

MicrosoftLanguageStemmingTokenizer

使用語言特有的規則來分割文字,並將字組縮減到其基本形式。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.MicrosoftLanguageStemmingTokenizer

衍生型別的歧視性。

isSearchTokenizer

boolean

False

值,指出如何使用Tokenizer。 如果使用 做為搜尋Tokenizer,請將 設定為 true,如果做為索引標記化工具,則設定為 false。 預設值為 false。

language

MicrosoftStemmingTokenizerLanguage

要使用的語言。 預設值為英文。

maxTokenLength

integer (int32)

maximum: 300
255

令牌長度上限。 超過長度上限的標記會進行分割。 可用的語彙基元長度上限是 300 個字元。 超過 300 個字元的令牌會先分割成長度為 300 的令牌,然後每個令牌都會根據設定的令牌長度上限來分割。 預設值為 255。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

MicrosoftLanguageTokenizer

使用語言特有的規則分割文字。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.MicrosoftLanguageTokenizer

衍生型別的歧視性。

isSearchTokenizer

boolean

False

值,指出如何使用Tokenizer。 如果使用 做為搜尋Tokenizer,請將 設定為 true,如果做為索引標記化工具,則設定為 false。 預設值為 false。

language

MicrosoftTokenizerLanguage

要使用的語言。 預設值為英文。

maxTokenLength

integer (int32)

maximum: 300
255

令牌長度上限。 超過長度上限的標記會進行分割。 可用的語彙基元長度上限是 300 個字元。 超過 300 個字元的令牌會先分割成長度為 300 的令牌,然後每個令牌都會根據設定的令牌長度上限來分割。 預設值為 255。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

MicrosoftStemmingTokenizerLanguage

列出 Microsoft 語言詞幹分詞器所支援的語言。

Description
arabic

選擇 Microsoft 的詞幹標記器以支援阿拉伯語。

bangla

選擇 Microsoft 的詞幹分詞器以支援孟加拉語。

bulgarian

選擇 Microsoft 的詞幹分詞器以取得保加利亞語。

catalan

選擇 Microsoft 的 Catalan 幹標記器。

croatian

選擇 Microsoft 的詞幹符號器以支援克羅埃西亞語。

czech

選擇 Microsoft 的 Stemming Tokenizer for Czech。

danish

選擇 Microsoft 的詞幹標記器以取得丹麥語。

dutch

選擇 Microsoft 的 Stemming Tokenizer for Dutch。

english

選擇 Microsoft 的詞幹分詞器來支援英文。

estonian

選擇 Microsoft 詞幹符號器以支援愛沙尼亞語。

finnish

選擇 Microsoft 詞幹標記器以取得芬蘭語。

french

選擇 Microsoft 詞幹分詞器以支援法語。

german

選擇 Microsoft 的詞幹分詞器以支援德語。

greek

選擇 Microsoft 詞幹標記器以取得希臘語。

gujarati

選擇 Microsoft 詞幹標記器 for Gujarati。

hebrew

選擇 Microsoft 的希伯來語詞幹標記器。

hindi

選擇 Microsoft 的印地語詞幹標記器。

hungarian

選擇 Microsoft 詞幹分詞器以支援匈牙利語。

icelandic

選擇 Microsoft 的詞幹標記器以支援冰島語。

indonesian

選擇印尼語的 Microsoft 詞幹標記器。

italian

選擇 Microsoft 詞幹標記器以取得義大利語。

kannada

選擇 Microsoft 幹幹標記器 for Kannada。

latvian

選擇 Microsoft 詞幹標記器 for Latvian。

lithuanian

選擇立陶宛語的 Microsoft 詞幹標記器。

malay

選擇 Microsoft 詞幹標記器以支援馬來語。

malayalam

選擇 Microsoft 詞幹標記器以支援馬拉雅拉姆語。

marathi

選擇 Microsoft 的詞幹標記器以支援馬拉地語。

norwegianBokmaal

Selects the Microsoft stemming tokenizer for Norwegian (Bokmã¥l).

polish

選擇 Microsoft 的詞幹標記器以取得波蘭語。

portuguese

選擇 Microsoft 詞幹符號器以支援葡萄牙語。

portugueseBrazilian

Selects the Microsoft stemming tokenizer for Portuguese (Brazil)。

punjabi

選擇 Microsoft 幹幹標記器 for Punjabi。

romanian

選擇 Microsoft 詞幹標記器以支援羅馬尼亞語。

russian

選擇 Microsoft 詞幹標記器以取得俄文。

serbianCyrillic

Selects the Microsoft stemming tokenizer for Serbian(西里爾字母)。

serbianLatin

選擇 Microsoft 詞幹標記器用於塞爾維亞語(拉丁語)。

slovak

選擇 Microsoft 詞幹標記器 for Slovak。

slovenian

選擇 Microsoft 的詞幹標記器以支援斯洛維尼亞語。

spanish

選擇 Microsoft 詞幹標記器以支援西班牙語。

swedish

選擇 Microsoft 的詞幹標記器以支援瑞典語。

tamil

選擇 Microsoft 的 Tamil 詞幹標記器。

telugu

選擇 Microsoft 的 Telugu stemming tokenizer。

turkish

選擇 Microsoft 幹幹標記器以支援土耳其語。

ukrainian

選擇 Microsoft 詞幹 Tokenizer for Ukrainian。

urdu

選擇 Microsoft 的詞幹符號器以支援烏爾都語。

MicrosoftTokenizerLanguage

列出 Microsoft 語言分詞器所支援的語言。

Description
bangla

選擇 Microsoft 的 Bengla 標記器。

bulgarian

選擇 Microsoft 的保加利亞語標記器。

catalan

選擇 Microsoft 的 Catalan 標記器。

chineseSimplified

選擇 Microsoft 的中文(簡體)標記器。

chineseTraditional

選擇 Microsoft 的中文(繁體)標記器。

croatian

選擇 Microsoft 克羅埃西亞語的標記器。

czech

選擇捷克語的 Microsoft 標記器。

danish

選擇丹麥語的 Microsoft 標記器。

dutch

選擇 Microsoft 的 Dutch 標記器。

english

選擇 Microsoft 的英文標記器。

french

選擇 Microsoft 法語標記器。

german

選擇 Microsoft 德語標記器。

greek

選擇 Microsoft 的希臘語標記器。

gujarati

選擇 Microsoft 的古吉拉特語標記器。

hindi

選擇 Microsoft 印地語標記器。

icelandic

選擇 Microsoft 的冰島語標記器。

indonesian

選擇印尼語的 Microsoft 標記器。

italian

選擇 Microsoft 的義大利語標記器。

japanese

選擇 Microsoft 日語標記器。

kannada

選擇 Microsoft 的 Kannada 標記器。

korean

選擇 Microsoft 的韓文分詞器。

malay

選擇 Microsoft 馬來語的標記器。

malayalam

選擇 Microsoft 馬拉雅拉姆語的標記器。

marathi

選擇 Microsoft 馬拉地語的標記器。

norwegianBokmaal

Selects the Microsoft tokenizer for Norwegian (Bokmål).

polish

選擇 Microsoft 的 Polish 分詞器。

portuguese

選擇 Microsoft 的葡萄牙語標記器。

portugueseBrazilian

Selects the Microsoft tokenizer for Portuguese (Brazil)。

punjabi

選擇 Microsoft 的 Punjabi 標記器。

romanian

選擇羅馬尼亞語的 Microsoft 標記器。

russian

選擇 Microsoft 的 Tokenizer 作為俄文。

serbianCyrillic

選擇 Microsoft 的 Serbian 代幣化器(西里爾字母)。

serbianLatin

選擇 Microsoft 的塞爾維亞語(拉丁語)標記器。

slovenian

選擇 Microsoft 的 Slovenian 標記器。

spanish

選擇 Microsoft 西班牙語標記器。

swedish

選擇瑞典語的 Microsoft 標記器。

tamil

選擇 Microsoft 的 Tamil 代幣化器。

telugu

選擇 Microsoft 的泰盧固語標記器。

thai

選擇 Microsoft 的 Thai 標記器。

ukrainian

選擇 Microsoft 的烏克蘭語標記器。

urdu

選擇 Microsoft 的烏爾都語標記器。

vietnamese

選擇 Microsoft 的越南語標記器。

NGramTokenFilter

產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.NGramTokenFilter

衍生型別的歧視性。

maxGram

integer (int32)

2

n-gram 長度上限。 預設為 2。

minGram

integer (int32)

1

最小 n-gram 長度。 預設 為 1。 必須小於 maxGram的值。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

NGramTokenFilterV2

產生指定大小的 n-gram。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.NGramTokenFilterV2

衍生型別的歧視性。

maxGram

integer (int32)

maximum: 300
2

n-gram 長度上限。 預設為 2。 最大值為300。

minGram

integer (int32)

maximum: 300
1

最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

NGramTokenizer

將輸入標記化為指定大小的 n-gram。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.NGramTokenizer

衍生型別的歧視性。

maxGram

integer (int32)

maximum: 300
2

n-gram 長度上限。 預設為 2。 最大值為300。

minGram

integer (int32)

maximum: 300
1

最小 n-gram 長度。 預設 為 1。 最大值為300。 必須小於 maxGram的值。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

tokenChars

TokenCharacterKind[]

要保留在令牌中的字元類別。

PathHierarchyTokenizerV2

路徑類階層的 Token 化工具。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.PathHierarchyTokenizerV2

衍生型別的歧視性。

delimiter

string

maxLength: 1
/

要使用的分隔符。 預設值為 “/”。

maxTokenLength

integer (int32)

maximum: 300
300

令牌長度上限。 預設值和最大值為 300。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

replacement

string

maxLength: 1
/

值,如果設定,則會取代分隔符。 預設值為 “/”。

reverse

boolean

False

值,指出是否要以反向順序產生令牌。 預設值為 false。

skip

integer (int32)

0

要略過的初始令牌數目。 預設值為 0。

PatternAnalyzer

透過規則運算式模式彈性地將文字分割成字詞。 此分析器是使用 Apache Lucene 實作的。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.PatternAnalyzer

衍生型別的歧視性。

flags

string

正規表達式旗標,以 '|' 分隔的 RegexFlags 值字串指定。

lowercase

boolean

True

指出字詞是否應該小寫的值。 預設值是「true」。

name

string

分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

pattern

string

\W+

比對權杖分隔符號的正規表示式模式。 預設值是符合一或多個非單字字元的運算式。

stopwords

string[]

停用字詞清單。

PatternCaptureTokenFilter

使用 Java regex 來發出多個令牌 - 一個或多個模式中每個擷取群組各一個。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.PatternCaptureTokenFilter

衍生型別的歧視性。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

patterns

string[]

要與每個令牌相符的模式清單。

preserveOriginal

boolean

True

值,指出是否要傳回原始令牌,即使其中一個模式相符也一樣。 預設值是「true」。

PatternReplaceCharFilter

字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此字元篩選器是使用 Apache Lucene 實作。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.PatternReplaceCharFilter

衍生型別的歧視性。

name

string

char 篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

pattern

string

正則表達式模式。

replacement

string

取代文字。

PatternReplaceTokenFilter

字元篩選條件,取代輸入字串中的字元。 其使用規則運算式來識別要保留的字元序列,並使用取代模式來識別要取代的字元。 例如,假設輸入文字 “aa bb aa bb”, pattern “(aa)\s+(bb)” 和取代 “$1#$$2”,結果會是 “aa#bb aa#bb”。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.PatternReplaceTokenFilter

衍生型別的歧視性。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

pattern

string

正則表達式模式。

replacement

string

取代文字。

PatternTokenizer

使用 regex 模式比對來建構不同令牌的 Tokenizer。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.PatternTokenizer

衍生型別的歧視性。

flags

string

正規表達式旗標,以 '|' 分隔的 RegexFlags 值字串指定。

group

integer (int32)

-1

正則運算式模式中比對群組的從零開始的序數,要擷取到權杖中。 如果您想要使用整個模式將輸入分割成記號,而不論相符的群組為何,請使用 -1。 預設值為 -1。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

pattern

string

\W+

比對權杖分隔符號的正規表示式模式。 預設值是符合一或多個非單字字元的運算式。

PhoneticEncoder

識別要與 PhoneticTokenFilter 搭配使用的語音編碼器類型。

Description
metaphone

將權杖編碼為 Metaphone 值。

doubleMetaphone

將記號編碼為雙元音值。

soundex

將權杖編碼為 Soundex 值。

refinedSoundex

將權杖編碼為精簡的 Soundex 值。

caverphone1

將權杖編碼為 Caverphone 1.0 值。

caverphone2

將權杖編碼為 Caverphone 2.0 值。

cologne

將記號編碼為科隆語音值。

nysiis

將代幣編碼為 NYSIIS 值。

koelnerPhonetik

使用 Kölner Phonetik 算法對令牌進行編碼。

haasePhonetik

使用 Kölner Phonetik 算法的 Haase 細化對標記進行編碼。

beiderMorse

將權杖編碼為 Beider-Morse 值。

PhoneticTokenFilter

建立拼音相符的標記。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.PhoneticTokenFilter

衍生型別的歧視性。

encoder

PhoneticEncoder

metaphone

要使用的語音編碼器。 預設值為 「metaphone」。。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

replace

boolean

True

值,指出編碼令牌是否應該取代原始令牌。 如果為 false,編碼的令牌會新增為同義字。 預設值是「true」。

RankingOrder

代表用於文件排序順序的分數。

Description
BoostedRerankerScore

將排序順序設定為 BoostedRerankerScore

RerankerScore

將排序順序設定為 ReRankerScore

RescoringOptions

包含重新記錄的選項。

名稱 類型 預設值 Description
defaultOversampling

number (double)

默認過度取樣因數。 過取樣會擷取一組更大的潛在文件,以抵消量化所造成的解析度損失。 這會增加將在全精度向量上重新評分的結果集。 最小值為 1,表示沒有過度取樣(1 倍)。 只有在 'enableRescoring' 為 true 時,才能設定此參數。 較高的值會犧牲延遲來改善召回率。

enableRescoring

boolean

True

如果設為 true,則在對壓縮向量進行初始搜尋之後,會使用全精確度向量重新計算相似性分數。 這會以犧牲延遲為代價來改善召回率。

rescoreStorageMethod enum:
  • discardOriginals
  • preserveOriginals
preserveOriginals

控制原始向量的儲存方法。 此設定是不可變的。

ScalarQuantizationCompression

包含索引編製和查詢期間所使用純量量化壓縮方法的特定組態選項。

名稱 類型 Description
kind string:

scalarQuantization

向量搜尋壓縮的類型。

name

string

要與此特定組態產生關聯的名稱。

rescoringOptions

RescoringOptions

包含重新記錄的選項。

scalarQuantizationParameters

ScalarQuantizationParameters

包含純量量化特有的參數。

truncationDimension

integer (int32)

要截斷向量的維度數目。 截斷向量可減少向量的大小,以及搜尋期間需要傳輸的數據量。 這可以節省記憶體成本,並降低搜尋效能,以犧牲召回率。 它只應該用於內嵌使用 Matryoshka 表示法學習 (MRL) 定型的內嵌,例如 OpenAI 文字內嵌-3-large(小型)。 默認值為 null,這表示不會截斷。

ScalarQuantizationParameters

包含純量量化特有的參數。

名稱 類型 Description
quantizedDataType

VectorSearchCompressionTarget

壓縮向量值的量化資料類型。

ScoringFunctionAggregation

定義用來合併評分設定檔中所有評分函數結果的彙總函數。

Description
sum

通過所有評分函數結果的總和來提高分數。

average

通過所有評分函數結果的平均值來提高分數。

minimum

將分數提高到所有評分函數結果的最小值。

maximum

將分數提高到所有評分函數結果的最大值。

firstMatching

使用評分設定檔中第一個適用的評分函數來提升分數。

product

通過所有評分函數結果的乘積來提高分數。

ScoringFunctionInterpolation

定義用來在一系列文件中插補分數提升的函數。

Description
linear

將分數線性遞減。 這是評分函數的預設插補。

constant

通過恆定係數提高分數。

quadratic

將分數提高二次方遞減的量。 分數越高,提升會緩慢減少,而分數越低,就會越快。 標籤評分函數不允許使用此插補選項。

logarithmic

將分數提高對數遞減的量。 分數越高,提升會迅速減少,而隨著分數的下降,提升會越慢。 標籤評分函數不允許使用此插補選項。

ScoringProfile

定義影響搜尋查詢評分之搜尋索引的參數。

名稱 類型 Description
functionAggregation

ScoringFunctionAggregation

指出如何組合個別評分函式結果的值。 預設為「總和」。 如果沒有評分函數,則忽略。

functions ScoringFunction[]:

影響文件評分的函數集合。

name

string

評分設定檔的名稱。

text

TextWeights

根據特定索引欄位中的文字相符來提升評分的參數。

SearchField

表示索引定義中的欄位,描述欄位的名稱、數據類型和搜尋行為。

名稱 類型 Description
analyzer

LexicalAnalyzerName

要用於欄位的分析器名稱。 此選項只能與可搜尋的字段搭配使用,而且無法與 searchAnalyzer 或 indexAnalyzer 一起設定。 選擇分析器之後,就無法變更欄位。 對於複雜欄位,必須為 Null。

dimensions

integer (int32)

minimum: 2
maximum: 4096

向量欄位的維度。

facetable

boolean

值,指出是否要在Facet查詢中參考欄位。 通常用於搜尋結果的呈現方式,其中包括依類別排序的點閱數 (例如,搜尋數位相機,然後依照品牌、百萬像素、價格等項目來查看點閱數)。 對於複雜欄位,此屬性必須為 Null。 類型為 Edm.GeographyPoint 或 Collection(Edm.GeographyPoint) 的欄位不可多面向。 所有其他簡單欄位的預設值為 true。

fields

SearchField[]

如果這是類型為 Edm.ComplexType 或 Collection(Edm.ComplexType) 的欄位,則為子欄位清單。 對於簡單欄位,必須為 Null 或空白。

filterable

boolean

值,指出是否要在$filter查詢中參考欄位。 filterable 與可搜尋的字串處理方式不同。 可篩選的 Edm.String 或 Collection(Edm.String) 類型的字段不會進行斷詞,因此比較僅適用於完全相符專案。 例如,如果您將這類字段 f 設定為 「sunny day」,$filter=f eq 'sunny' 將找不到相符專案,但$filter=f eq 'sunny day' 將會。 對於複雜欄位,此屬性必須為 Null。 簡單欄位的預設值為 true,複雜欄位的預設值為 null。

indexAnalyzer

LexicalAnalyzerName

用於欄位索引編製時間的分析器名稱。 此選項只能與可搜尋的欄位搭配使用。 它必須與 searchAnalyzer 一起設定,且無法與分析器選項一起設定。 此屬性無法設定為語言分析器的名稱;如果您需要語言分析器,請改用分析器屬性。 選擇分析器之後,就無法變更欄位。 對於複雜欄位,必須為 Null。

key

boolean

值,指出欄位是否唯一識別索引中的檔。 每個索引中只有一個最上層字段必須選擇為索引鍵欄位,而且必須是Edm.String類型。 索引鍵欄位可以用來直接查閱文件,並更新或刪除特定文件。 簡單欄位的預設值為 false,複雜欄位的預設值為 null。

name

string

欄位的名稱,在索引或父字段的 fields 集合中必須是唯一的。

normalizer

LexicalNormalizerName

要用於欄位的正規化程式名稱。 此選項只能用於已啟用可篩選、可排序或可多面的欄位。 選擇正規化器之後,就無法針對欄位變更它。 對於複雜欄位,必須為 Null。

retrievable

boolean

值,指出是否可以在搜尋結果中傳回欄位。 如果您想要使用欄位(例如 margin)做為篩選、排序或評分機制,但不想讓使用者看到字段,則可以停用此選項。 對於索引鍵欄位,此屬性必須為 true,對於複雜欄位,此屬性必須為 null。 這個屬性可以在現有的欄位上變更。 啟用此屬性不會造成索引記憶體需求增加。 簡單欄位的預設值為 true,向量欄位的預設值為 false,複雜欄位的預設值為 null。

searchAnalyzer

LexicalAnalyzerName

在搜尋時用於欄位的分析器名稱。 此選項只能與可搜尋的欄位搭配使用。 它必須與 indexAnalyzer 一起設定,而且不能與 analyzer 選項一起設定。 此屬性無法設定為語言分析器的名稱;如果您需要語言分析器,請改用分析器屬性。 您可以在現有的欄位更新此分析器。 對於複雜欄位,必須為 Null。

searchable

boolean

值,指出欄位是否可供全文搜索。 這表示它會在編製索引期間進行斷詞分析。 如果您將可搜尋的字段設定為「晴天」之類的值,則內部會分割成個別標記「陽光明媚」和「日」。 這樣就能針對這些字詞進行全文檢索搜尋。 默認可搜尋類型為 Edm.String 或 Collection(Edm.String) 的欄位。 對於其他非字串資料類型的簡單欄位,此屬性必須為 false,對於複雜欄位,此屬性必須為 null。 注意:可搜尋的欄位會耗用索引中的額外空間,以容納全文搜索之域值的其他標記化版本。 如果您想要在索引中節省空間,而且不需要在搜尋中包含字段,請將 [可搜尋] 設定為 false。

sortable

boolean

值,指出是否要在$orderby運算式中參考字段。 根據預設,搜尋引擎會依分數排序結果,但在許多情況下,使用者會想要依檔中的欄位排序。 只有在單一值時,才能排序簡單字段(在父檔範圍中有單一值)。 簡單集合欄位無法排序,因為它們是多重值。 複雜集合的簡單子欄位也是多重值,因此無法排序。 不論其為直接父欄位或上階欄位,都是如此,這就是複雜集合。 複雜欄位無法排序,且這類欄位的 sortable 屬性必須為 Null。 對於單值簡單欄位,可排序的預設值為 true,對於多值簡單欄位為 false,對於複雜欄位為 null。

stored

boolean

不可變的值,指出欄位是否會個別保存在要在搜尋結果中傳回的磁碟上。 如果您不打算在搜尋回應中傳回字段內容,以節省記憶體額外負荷,則可以停用此選項。 這隻能在索引建立期間設定,而且只能在向量字段設定。 現有欄位無法變更此屬性,或針對新欄位設定為 false。 如果此屬性設定為 false,則屬性 'retrievable' 也必須設定為 false。 對於索引鍵欄位、新字段和非向量欄位,此屬性必須為 true 或 unset,而且複雜欄位必須為 Null。 停用此屬性會減少索引記憶體需求。 向量欄位的預設值為 true。

synonymMaps

string[]

要與此欄位建立關聯的同義字對應名稱清單。 此選項只能與可搜尋的欄位搭配使用。 目前只支援每個欄位一個同義字對應。 將同義字對應指派給欄位可確保將該欄位設為目標的查詢字詞會使用同義字對應中的規則在查詢時展開。 這個屬性可以在現有的欄位上變更。 對於複雜欄位,必須為 Null 或空白集合。

type

SearchFieldDataType

欄位的數據類型。

vectorEncoding

VectorEncodingFormat

用來解譯欄位內容的編碼格式。

vectorSearchProfile

string

向量搜尋配置檔的名稱,指定搜尋向量字段時要使用的演算法和向量化程式。

SearchFieldDataType

定義搜尋索引中欄位的資料類型。

Description
Edm.String

表示欄位包含字串。

Edm.Int32

表示欄位包含32位帶正負號的整數。

Edm.Int64

表示欄位包含 64 位帶正負號的整數。

Edm.Double

表示欄位包含 IEEE 雙精確度浮點數。

Edm.Boolean

表示欄位包含布爾值 (true 或 false)。

Edm.DateTimeOffset

表示欄位包含日期/時間值,包括時區資訊。

Edm.GeographyPoint

表示欄位在經度和緯度方面包含地理位置。

Edm.ComplexType

表示欄位包含一或多個複雜物件,而該物件接著具有其他類型的子字段。

Edm.Single

表示欄位包含單精度浮點數。 只有在搭配 Collection(Edm.Single) 使用時才有效。

Edm.Half

表示欄位包含半精確度浮點數。 只有在搭配 Collection(Edm.Half) 使用時才有效。

Edm.Int16

表示欄位包含16位帶正負號的整數。 只有在搭配 Collection(Edm.Int16) 使用時才有效。

Edm.SByte

表示欄位包含 8 位帶正負號的整數。 只有在搭配 Collection(Edm.SByte) 使用時才有效。

Edm.Byte

表示欄位包含 8 位無符號整數。 只有在搭配 Collection(Edm.Byte) 使用時才有效。

SearchIndex

表示搜尋索引定義,描述索引的欄位和搜尋行為。

名稱 類型 Description
@odata.etag

string

索引的 ETag。

analyzers LexicalAnalyzer[]:

索引的分析器。

charFilters CharFilter[]:

索引的字元篩選。

corsOptions

CorsOptions

控制索引之跨原始來源資源分享 (CORS) 的選項。

defaultScoringProfile

string

如果在查詢中未指定評分配置檔,則為要使用的評分配置檔名稱。 如果未設定此屬性,而且查詢中未指定任何評分配置檔,則會使用預設評分 (tf-idf)。

description

string

索引的描述。

encryptionKey

SearchResourceEncryptionKey

您在 Azure Key Vault 中建立的加密金鑰描述。 當你想完全確保沒有人,甚至連 Microsoft 都無法解密你的資料時,這個金鑰用來為你的資料提供額外的靜態加密層級。 加密數據之後,一律會保持加密狀態。 搜尋服務會忽略嘗試將此屬性設定為 Null。 如果您想要輪替加密金鑰,您可以視需要變更此屬性;您的數據不會受到影響。 使用客戶管理的金鑰加密不適用於免費搜尋服務,而且僅適用於 2019 年 1 月 1 日或之後建立的付費服務。

fields

SearchField[]

索引的欄位。

name

string

索引的名稱。

normalizers LexicalNormalizer[]:

CustomNormalizer[]

索引的正規化程式。

scoringProfiles

ScoringProfile[]

索引的評分配置檔。

semantic

SemanticSearch

定義影響語意功能的搜尋索引參數。

similarity SimilarityAlgorithm:

評分和排名符合搜尋查詢的檔時所要使用的相似度演算法類型。 相似度演算法只能在索引建立時定義,而且無法在現有索引上修改。 如果為 null,則會使用 ClassicSimilarity 演算法。

suggesters

SearchSuggester[]

索引的建議工具。

tokenFilters TokenFilter[]:

索引的令牌篩選。

tokenizers LexicalTokenizer[]:

索引的Tokenizers。

vectorSearch

VectorSearch

包含與向量搜尋相關的組態選項。

SearchIndexerDataNoneIdentity

清除資料源的識別屬性。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.DataNoneIdentity

指定身分類型的 URI 片段。

SearchIndexerDataUserAssignedIdentity

指定要使用之數據源的身分識別。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.DataUserAssignedIdentity

指定身分類型的 URI 片段。

userAssignedIdentity

string

使用者指派受控識別的完整 Azure 資源標識符,通常格式為 “/subscriptions/12345678-1234-1234-1234-1234567890ab/resourceGroups/rg/providers/Microsoft.ManagedIdentity/userAssignedIdentities/myId”。

SearchResourceEncryptionKey

Azure Key Vault 中客戶管理的加密密鑰。 您建立和管理的金鑰可用來加密或解密靜態資料,例如索引和同義字對映。

名稱 類型 Description
accessCredentials.applicationId

string

AAD 應用程式識別碼,已將待用數據加密時要使用的 Azure Key Vault 所需訪問許可權授與。 應用程式標識碼不應與 AAD 應用程式的物件標識元混淆。

accessCredentials.applicationSecret

string

指定 AAD 應用程式的驗證金鑰。

identity SearchIndexerDataIdentity:

要用於此加密金鑰的明確受控識別。 如果未指定,且存取認證屬性為 Null,則會使用系統指派的受控識別。 更新資源時,如果未指定明確識別,則會維持不變。 如果指定了 「none」 ,則會清除此屬性的值。

keyVaultKeyName

string

要用來加密待用數據的 Azure Key Vault 金鑰名稱。

keyVaultKeyVersion

string

要用來加密待用數據的 Azure Key Vault 金鑰版本。

keyVaultUri

string

Azure Key Vault 的 URI,也稱為 DNS 名稱,其中包含用來加密待用數據的密鑰。 範例 URI 可能會 https://my-keyvault-name.vault.azure.net

SearchSuggester

定義建議 API 應如何套用至索引中的欄位群組。

名稱 類型 Description
name

string

建議者的名稱。

searchMode enum:

analyzingInfixMatching

指出建議者功能的值。

sourceFields

string[]

建議器所套用的欄位名稱清單。 每個欄位都必須是可搜尋的。

SemanticConfiguration

定義在語意功能內容中使用的特定組態。

名稱 類型 Description
name

string

語意組態的名稱。

prioritizedFields

SemanticPrioritizedFields

描述要用於語意排名、標題、醒目提示和答案的標題、內容和關鍵詞欄位。 至少必須設定三個子屬性的其中一個(titleField、優先順序為KeywordsFields 和優先順序的ContentFields)。

rankingOrder

RankingOrder

指定要用於搜尋結果排序順序的分數類型。

SemanticField

做為語意組態一部分的欄位。

名稱 類型 Description
fieldName

string

檔案名稱

SemanticPrioritizedFields

描述要用於語意排名、標題、醒目提示和答案的標題、內容和關鍵詞欄位。

名稱 類型 Description
prioritizedContentFields

SemanticField[]

定義要用於語意排名、標題、重點和答案的內容欄位。 為了獲得最佳結果,所選欄位應包含自然語言形式的文字。 陣列中欄位的順序代表其優先順序。 如果內容很長,優先順序較低的欄位可能會被截斷。

prioritizedKeywordsFields

SemanticField[]

定義要用於語意排名、標題、亮點和答案的關鍵字欄位。 為了獲得最佳結果,所選欄位應包含關鍵字清單。 陣列中欄位的順序代表其優先順序。 如果內容很長,優先順序較低的欄位可能會被截斷。

titleField

SemanticField

定義要用於語意排名、標題、醒目提示和答案的標題欄位。 如果您的索引中沒有標題欄位,請將此欄位留空。

SemanticSearch

定義影響語意功能的搜尋索引參數。

名稱 類型 Description
configurations

SemanticConfiguration[]

索引的語意組態。

defaultConfiguration

string

可讓您在索引中設定預設語意組態的名稱,讓每次都能選擇性地將其作為查詢參數傳遞。

ShingleTokenFilter

將標記組合建立為單一標記。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.ShingleTokenFilter

衍生型別的歧視性。

filterToken

string

_

要針對沒有標記之每個位置插入的字串。 默認值為底線 (“_” )。

maxShingleSize

integer (int32)

minimum: 2
2

閃亮大小上限。 預設值和最小值為 2。

minShingleSize

integer (int32)

minimum: 2
2

最小閃亮大小。 預設值和最小值為 2。 必須小於 maxShingleSize的值。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

outputUnigrams

boolean

True

值,指出輸出數據流是否會包含輸入標記 (unigrams) 以及隨機顯示。 預設值是「true」。

outputUnigramsIfNoShingles

boolean

False

值,指出是否要輸出單格,當沒有顯示任何擷取子時。 當 outputUnigrams 設定為 false 時,這個屬性會優先。 預設值為 false。

tokenSeparator

string

聯結相鄰標記以形成閃亮時所使用的字串。 預設值為單一空格 (“ ” )。

SnowballTokenFilter

使用 Snowball 產生的字幹分析器來幹詞的篩選。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.SnowballTokenFilter

衍生型別的歧視性。

language

SnowballTokenFilterLanguage

要使用的語言。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

SnowballTokenFilterLanguage

要用於 Snowball 權杖篩選器的語言。

Description
armenian

選取亞美尼亞語的 Lucene Snowball 詞幹標記器。

basque

選取巴斯克語的 Lucene Snowball 詞幹標記器。

catalan

選取加泰隆尼亞語的 Lucene Snowball 詞幹標記器。

danish

選取丹麥文的 Lucene Snowball 詞幹標記器。

dutch

選取 Dutch 的 Lucene Snowball 詞幹標記器。

english

選取英文的 Lucene Snowball 詞幹標記器。

finnish

選取芬蘭文的 Lucene Snowball 詞幹標記器。

french

選取法文的 Lucene Snowball 詞幹標記器。

german

選取德文的 Lucene Snowball 詞幹標記器。

german2

選取使用德語變體演算法的 Lucene Snowball 詞幹記號器。

hungarian

選取匈牙利文的 Lucene Snowball 詞幹標記器。

italian

選取義大利文的 Lucene Snowball 詞幹標記器。

kp

選取使用 Kraaij-Pohlmann 詞幹分析演算法的荷蘭語的 Lucene Snowball 詞幹記詞器。

lovins

選取使用 Lovins 詞幹提取演算法的英文 Lucene Snowball 詞幹記詞器。

norwegian

選取挪威文的 Lucene Snowball 詞幹記號器。

porter

選取使用 Porter 詞幹提取演算法的英文 Lucene Snowball 詞幹記詞器。

portuguese

選取葡萄牙文的 Lucene Snowball 詞幹標記器。

romanian

選取羅馬尼亞文的 Lucene Snowball 詞幹標記器。

russian

選取俄語的 Lucene Snowball 詞幹標記器。

spanish

選取西班牙文的 Lucene Snowball 詞幹標記器。

swedish

選取瑞典文的 Lucene Snowball 詞幹標記器。

turkish

選取土耳其文的 Lucene Snowball 詞幹標記器。

StemmerOverrideTokenFilter

提供使用自定義字典型字幹分析覆寫其他字幹篩選的功能。 任何字典字幹字詞都會標示為關鍵詞,因此它們不會在鏈結中加上字幹分析器。 必須放在任何詞幹分析篩選器之前。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.StemmerOverrideTokenFilter

衍生型別的歧視性。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

rules

string[]

下列格式的字幹規則清單:「word => stem」,例如:「ran => run」。。

StemmerTokenFilter

語言特定字幹分析篩選器。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.StemmerTokenFilter

衍生型別的歧視性。

language

StemmerTokenFilterLanguage

要使用的語言。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

StemmerTokenFilterLanguage

用於詞幹計算器權杖篩選器的語言。

Description
arabic

選取阿拉伯文的 Lucene 詞幹標記器。

armenian

選取亞美尼亞文的 Lucene 詞幹標記器。

basque

選取巴斯克語的 Lucene 詞幹標記器。

brazilian

選取葡萄牙文 (巴西) 的 Lucene 詞幹標記器。

bulgarian

選取保加利亞文的 Lucene 詞幹標記器。

catalan

選取加泰隆尼亞語的 Lucene 詞幹標記器。

czech

選取捷克文的 Lucene 詞幹記號器。

danish

選取丹麥文的 Lucene 詞幹標記器。

dutch

選取荷蘭語的 Lucene 詞幹記號器。

dutchKp

選取使用 Kraaij-Pohlmann 詞幹分析演算法的荷蘭語的 Lucene 詞幹記號化記號器。

english

選取英文的 Lucene 詞幹標記器。

lightEnglish

選取執行淺色詞幹的英文 Lucene 詞幹標記器。

minimalEnglish

選取執行最小詞幹處理的英文 Lucene 詞幹記詞器。

possessiveEnglish

選取英文的 Lucene 詞幹標記器,以移除單字中的尾端所有格。

porter2

選取使用 Porter2 詞幹轉換演算法的英文 Lucene 詞幹標記器。

lovins

選取使用 Lovins 詞幹提取演算法的英文 Lucene 詞幹標記器。

finnish

選取芬蘭文的 Lucene 詞幹標記器。

lightFinnish

選取執行輕詞幹的芬蘭文的 Lucene 詞幹記號器。

french

選取法文的 Lucene 詞幹標記器。

lightFrench

選取執行輕型詞幹的法語的 Lucene 詞幹標記器。

minimalFrench

選取法文的 Lucene 詞幹記詞器,以執行最小的詞幹處理。

galician

選取 Galician 的 Lucene 詞幹標記器。

minimalGalician

為加利西亞語選擇執行最小詞幹的 Lucene 詞幹標記器。

german

選取德文的 Lucene 詞幹記號器。

german2

選取使用德文變體演算法的 Lucene 詞幹記號化記號器。

lightGerman

為執行輕型詞幹提取的德文選取 Lucene 詞幹標記器。

minimalGerman

為德文選取執行最小詞幹處理的 Lucene 詞幹標記器。

greek

選取希臘文的 Lucene 詞幹標記器。

hindi

選取印地文的 Lucene 詞幹標記器。

hungarian

選取匈牙利文的 Lucene 詞幹標記器。

lightHungarian

選取執行輕型詞幹的匈牙利文的 Lucene 詞幹標記器。

indonesian

選取印尼文的Lucene詞幹記號器。

irish

選取愛爾蘭文的 Lucene 詞幹記號器。

italian

選取義大利文的 Lucene 詞幹標記器。

lightItalian

選取義大利語的 Lucene 詞幹標記器,以執行輕型詞幹處理。

sorani

選取 Sorani 的 Lucene 詞幹標記器。

latvian

選取拉脫維亞文的 Lucene 詞幹標記器。

norwegian

選擇挪威語(Bokmıl)的Lucene詞幹標記器。

lightNorwegian

選擇挪威語(Bokmıl)的Lucene詞幹標記器,該詞有輕度詞幹處理。

minimalNorwegian

選擇挪威語(Bokmãll)的Lucene詞幹符號器,該詞幹極少。

lightNynorsk

選取挪威語 (Nynorsk) 的 Lucene 詞幹標記器,以執行光詞幹處理。

minimalNynorsk

選取挪威文 (Nynorsk) 的 Lucene 詞幹標記器,以執行最少的詞幹處理。

portuguese

選取葡萄牙文的 Lucene 詞幹標記器。

lightPortuguese

為葡萄牙語選擇執行輕型詞幹的 Lucene 詞幹記號器。

minimalPortuguese

為葡萄牙語選擇執行最小詞幹的 Lucene 詞幹標記器。

portugueseRslp

選取使用 RSLP 詞幹分析演算法的葡萄牙文的 Lucene 詞幹記號化詞器。

romanian

選取羅馬尼亞文的 Lucene 詞幹記號器。

russian

選取俄語的 Lucene 詞幹標記器。

lightRussian

選取俄語的 Lucene 詞幹標記器,以執行輕型詞幹處理。

spanish

選取西班牙文的 Lucene 詞幹標記器。

lightSpanish

選取西班牙文的 Lucene 詞幹標記器,以執行輕色詞幹處理。

swedish

選取瑞典文的 Lucene 詞幹標記器。

lightSwedish

選取瑞典文的 Lucene 詞幹標記器,以執行輕型詞幹。

turkish

選取土耳其文的 Lucene 詞幹標記器。

StopAnalyzer

將文字分割為非字母;套用小寫和停用字詞標記篩選。 此分析器是使用 Apache Lucene 實作的。

名稱 類型 Description
@odata.type string:

#Microsoft.Azure.Search.StopAnalyzer

衍生型別的歧視性。

name

string

分析器的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

stopwords

string[]

停用字詞清單。

StopwordsList

識別語言特定停用字詞的預先定義清單。

Description
arabic

選取阿拉伯文的停用字詞清單。

armenian

選取亞美尼亞文的停用詞清單。

basque

選取巴斯克語的停用詞清單。

brazilian

選取葡萄牙文 (巴西) 的停用字詞清單。

bulgarian

選取保加利亞文的停用詞清單。

catalan

選取加泰隆尼亞語的停用詞清單。

czech

選取捷克文的停用字詞清單。

danish

選取丹麥文的停用詞清單。

dutch

選取荷蘭語的停用字詞清單。

english

選取英文的停用詞清單。

finnish

選取芬蘭文的停用詞清單。

french

選取法文的停用詞清單。

galician

選取 Galician 的停用字詞清單。

german

選取德文的停用字詞清單。

greek

選取希臘文的停用字詞清單。

hindi

選取印地文的停用詞清單。

hungarian

選取匈牙利文的停用詞清單。

indonesian

選取印尼文的停用詞清單。

irish

選取愛爾蘭語的停用詞清單。

italian

選取義大利文的停用字詞清單。

latvian

選取拉脫維亞文的停用詞清單。

norwegian

選取挪威文的停用詞清單。

persian

選取波斯文的停用字詞清單。

portuguese

選取葡萄牙文的停用詞清單。

romanian

選取羅馬尼亞文的停用字詞清單。

russian

選取俄語的停用字詞清單。

sorani

選取 Sorani 的停用詞清單。

spanish

選取西班牙文的停用字詞清單。

swedish

選取瑞典文的停用詞清單。

thai

選取泰文的停用詞清單。

turkish

選取土耳其語的停用字詞清單。

StopwordsTokenFilter

從語彙基元資料流移除停用字詞。 此令牌篩選器是使用 Apache Lucene 實作。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.StopwordsTokenFilter

衍生型別的歧視性。

ignoreCase

boolean

False

值,指出是否忽略大小寫。 如果為 true,則所有單字都會先轉換成小寫。 預設值為 false。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

removeTrailing

boolean

True

值,指出是否要忽略最後一個搜尋字詞是否為停用字詞。 預設值是「true」。

stopwords

string[]

停用字詞清單。 無法同時設定此屬性和停用字詞清單屬性。

stopwordsList

StopwordsList

english

要使用的停用字詞預先定義清單。 無法同時設定這個屬性和 stopwords 屬性。 預設值為英文。

SynonymTokenFilter

比對令牌數據流中的單字或多字同義字。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.SynonymTokenFilter

衍生型別的歧視性。

expand

boolean

True

值,指出同義字清單中的所有字組(如果未使用 => 表示法),是否會彼此對應。 如果為 true,則同義字清單中的所有字組(如果未使用 => 表示法),則會彼此對應。 下列清單:不可思議、難以置信、神話般的、驚人的相當於:不可思議、難以置信、不可思議、神奇 => 不可思議、不可思議、神話般的、驚人的。 如果為 false,下列清單:令人難以置信的,令人難以置信的,神話般的,驚人的將相當於:令人難以置信的,令人難以置信的,令人難以置信的,神話般的,驚人的 => 令人難以置信的。 預設值是「true」。

ignoreCase

boolean

False

值,指出是否要折疊輸入大小寫以進行比對。 預設值為 false。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

synonyms

string[]

下列兩種格式之一的同義字清單:1。 不可思議,難以置信,神話般的 => 驚人的 - 所有字詞在 => 符號左邊的所有字詞都將取代為其右側的所有字詞:2. 不可思議,難以置信,神話般的,驚人的 - 逗號分隔的對等字清單。 設定 expand 選項來變更此清單的解譯方式。

TagScoringFunction

定義函式,此函式會使用符合指定標籤清單的字串值來提升檔的分數。

名稱 類型 Description
boost

number (double)

原始分數的乘數。 必須是不等於 1.0 的正數。

fieldName

string

做為評分函式輸入的功能變數名稱。

interpolation

ScoringFunctionInterpolation

值,指出如何跨檔分數插補提升;預設為 “Linear”。

tag

TagScoringParameters

標記評分函式的參數值。

type string:

tag

評分功能類型。

TagScoringParameters

提供標記評分函式的參數值。

名稱 類型 Description
tagsParameter

string

在搜尋查詢中傳遞的參數名稱,以指定要與目標欄位比較的標籤清單。

TextWeights

定義索引欄位的加權,比對應該在搜尋查詢中提升評分。

名稱 類型 Description
weights

object

每個欄位權重的字典,可提升文件評分。 索引鍵是欄位名稱,值是每個欄位的權重。

TokenCharacterKind

代表權杖過濾器可以操作的字元類別。

Description
letter

將字母保存在令牌中。

digit

在權杖中保留數字。

whitespace

在權杖中保留空格。

punctuation

在標記中保留標點符號。

symbol

將符號保留在令牌中。

TokenFilterName

定義搜尋引擎支援的所有權杖篩選器的名稱。

Description
arabic_normalization

套用阿拉伯文標準化程式的語彙基元篩選器,用來標準化正字法。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ar/ArabicNormalizationFilter.html

apostrophe

去除單引號 (包括單引號本身) 之後的所有字元。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/tr/ApostropheFilter.html

asciifolding

如果這類對等專案存在,請將前127個ASCII字元中的字母、數位和符號 Unicode 字元轉換成其 ASCII 對等專案。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

cjk_bigram

形成從標準Tokenizer產生的CJK詞彙 bigram。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKBigramFilter.html

cjk_width

標準化 CJK 寬度的差異。 將全寬 ASCII 變體折成等效的基本拉丁文,並將半寬片假名折疊成等效假名。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKWidthFilter.html

classic

拿掉英文擁有者,以及縮略字中的點。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicFilter.html

common_grams

建立經常出現詞彙的雙詞組,並在建立索引時使用。 仍會編製單個字詞的索引,並與雙字母組重疊。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/commongrams/CommonGramsFilter.html

edgeNGram_v2

從輸入令牌的正面或背面開始,產生指定大小的 n-gram。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenFilter.html

elision

移除省略音。 例如,“l'avion” (平面) 會轉換成 “avion” (plane)。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

german_normalization

根據德國2雪球演算法的啟發學習法,將德文字符正規化。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/de/GermanNormalizationFilter.html

hindi_normalization

標準化印度文字,以移除拼字變化的一些差異。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/hi/HindiNormalizationFilter.html

indic_normalization

標準化印度語文字的 Unicode 表示法。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/in/IndicNormalizationFilter.html

keyword_repeat

發出每個傳入令牌兩次,一次作為關鍵詞,一次作為非關鍵詞。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/KeywordRepeatFilter.html

kstem

適用於英文的高效能 kstem 篩選條件。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/en/KStemFilter.html

length

移除太長或太短的文字。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LengthFilter.html

limit

限制索引過程中的標記數量。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LimitTokenCountFilter.html

lowercase

將標記文字標準化為小寫。 請參閱 https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

nGram_v2

產生指定大小的 n-gram。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenFilter.html

persian_normalization

對波斯文套用標準化。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/fa/PersianNormalizationFilter.html

phonetic

建立拼音相符的標記。 請參閱 https://lucene.apache.org/core/4_10_3/analyzers-phonetic/org/apache/lucene/analysis/phonetic/package-tree.html

porter_stem

使用 Porter 字幹分析演算法來轉換令牌數據流。 請參閱 http://tartarus.org/~martin/PorterStemmer

reverse

反轉語彙基元字串。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

scandinavian_normalization

標準化可交換的斯堪的納維亞字元用法。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianNormalizationFilter.html

scandinavian_folding

摺疊斯堪的納維亞字元 Ã¥...äÆ>-a和Ó̧-Ã̃-o>。 它還歧視使用雙音音 aa, ae, ao, oe 和 oo, 只留下第一個。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianFoldingFilter.html

shingle

將標記組合建立為單一標記。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/shingle/ShingleFilter.html

snowball

使用 Snowball 產生的字幹分析器來幹詞的篩選。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/snowball/SnowballFilter.html

sorani_normalization

標準化 Sorani 文字的 Unicode 表示法。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ckb/SoraniNormalizationFilter.html

stemmer

語言特定字幹分析篩選器。 請參閱 https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

stopwords

從語彙基元資料流移除停用字詞。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

trim

刪除標記前後的空白字元。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TrimFilter.html

truncate

將字詞截斷為特定長度。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TruncateTokenFilter.html

unique

篩選出與前一個字元相同文字的字元。 請參閱 http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/RemoveDuplicatesTokenFilter.html

uppercase

將標記文字標準化為大寫。 請參閱 https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

word_delimiter

將字組分割成部分字組,並對部分字組群組執行選擇性的轉換。

TruncateTokenFilter

將字詞截斷為特定長度。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.TruncateTokenFilter

衍生型別的歧視性。

length

integer (int32)

maximum: 300
300

將截斷字詞的長度。 預設值和最大值為 300。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

UaxUrlEmailTokenizer

將 URL 和電子郵件標記化為一個標記。 這個 Tokenizer 是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.UaxUrlEmailTokenizer

衍生型別的歧視性。

maxTokenLength

integer (int32)

maximum: 300
255

令牌長度上限。 預設值為 255。 超過長度上限的標記會進行分割。 可以使用的令牌長度上限為 300 個字元。

name

string

Tokenizer 的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

UniqueTokenFilter

篩選出與前一個字元相同文字的字元。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.UniqueTokenFilter

衍生型別的歧視性。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

onlyOnSamePosition

boolean

False

值,指出是否只移除相同位置的重複專案。 預設值為 false。

VectorEncodingFormat

解譯向量欄位內容的編碼格式。

Description
packedBit

編碼格式,表示封裝成較寬數據類型的位。

VectorSearch

包含與向量搜尋相關的組態選項。

名稱 類型 Description
algorithms VectorSearchAlgorithmConfiguration[]:

包含索引或查詢期間所使用演算法的特定組態選項。

compressions VectorSearchCompression[]:

包含在編製索引或查詢期間所使用之壓縮方法的特定組態選項。

profiles

VectorSearchProfile[]

定義要與向量搜尋搭配使用的組態組合。

vectorizers VectorSearchVectorizer[]:

包含如何向量化文字向量查詢的組態選項。

VectorSearchAlgorithmKind

用於索引和查詢的演算法。

Description
hnsw

HNSW (階層式導覽小型世界),一種近似近鄰演算法。

exhaustiveKnn

將執行暴力密碼破解搜尋的詳盡 KNN 演算法。

VectorSearchAlgorithmMetric

用於向量比較的相似性指標。 建議選擇與內嵌模型訓練時相同的相似度指標。

Description
cosine

測量向量之間的角度,以量化其相似性,忽略大小。 角度越小,相似度越近。

euclidean

計算多維度空間中向量之間的直線距離。 距離越小,相似度越近。

dotProduct

計算專案明智產品的總和,以量測對齊和大小相似度。 愈大愈積極,相似度愈近。

hamming

僅適用於位封裝的二進位數據類型。 藉由計算二元向量中的不同位置,來判斷不同的差異。 差異越少,相似性越接近。

VectorSearchCompressionKind

用於索引和查詢的壓縮方法。

Description
scalarQuantization

純量量化,這是一種壓縮方法。 在純量量化中,原始向量值會透過離散化和表示向量的每個元件,使用縮減的量化值集來壓縮成較窄的類型,藉此減少整體數據大小。

binaryQuantization

二元量化,這是一種壓縮方法。 在二進位量化中,原始向量值會藉由離散化並代表使用二進位值來表示向量的每個元件,藉此壓縮為較窄的二進位類型,藉此減少整體數據大小。

VectorSearchCompressionTarget

壓縮向量值的量化資料類型。

Description
int8

8 位帶正負號的整數。

VectorSearchProfile

定義要與向量搜尋搭配使用的組態組合。

名稱 類型 Description
algorithm

string

指定演算法和選用參數的向量搜尋演算法組態名稱。

compression

string

指定壓縮方法及選用參數的壓縮方法配置名稱。

name

string

要與此特定向量搜尋設定檔相關聯的名稱。

vectorizer

string

設定為與向量搜尋搭配使用的向量化名稱。

VectorSearchVectorizerKind

查詢期間要使用的向量化方法。

Description
azureOpenAI

在查詢時使用 Azure OpenAI 資源產生內嵌。

customWebApi

在查詢時使用自定義 Web 端點產生內嵌。

aiServicesVision

使用 Azure AI 服務視覺向量化 API,在查詢時產生影像或文字輸入的內嵌。

aml

在查詢時使用透過 Azure AI Foundry 模型目錄部署的 Azure Machine Learning 端點產生內嵌。

WebApiVectorizer

指定使用者定義的向量化程式,以產生查詢字串的向量內嵌。 外部向量化工具的整合是使用技能集的自定義 Web API 介面來達成。

名稱 類型 Description
customWebApiParameters

WebApiVectorizerParameters

指定使用者定義向量化程式的屬性。

kind string:

customWebApi

向量搜尋向量器類型。

name

string

要與這個特定向量化方法產生關聯的名稱。

WebApiVectorizerParameters

指定連接到使用者定義向量化工具的屬性。

名稱 類型 Description
authIdentity SearchIndexerDataIdentity:

用於輸出連線的使用者指派受控識別。 如果提供 authResourceId 且未指定,則會使用系統指派的受控識別。 在索引器更新時,如果未指定身分識別,該值會維持不變。 如果設定為 “none”,則會清除此屬性的值。

authResourceId

string

適用於連接 Azure 函式或其他提供轉換的外部程式碼的自訂端點。 當函式或應用程式向 Azure Active Directory 註冊時,此值應該是為該函式或應用程式所建立的應用程式識別碼。 指定時,向量化會使用搜尋服務的受控識別碼 (系統或使用者指派) 和函式或應用程式的存取權杖連線到函式或應用程式,並使用此值作為建立存取權杖範圍的資源識別碼。

httpHeaders

object

提出 HTTP 要求所需的標頭。

httpMethod

string

HTTP 要求的方法。

timeout

string (duration)

要求的所需逾時。 預設值為 30 秒。

uri

string (uri)

提供向量化器的 Web API 的 URI。

WordDelimiterTokenFilter

將字組分割成部分字組,並對部分字組群組執行選擇性的轉換。 此令牌篩選器是使用 Apache Lucene 實作。

名稱 類型 預設值 Description
@odata.type string:

#Microsoft.Azure.Search.WordDelimiterTokenFilter

衍生型別的歧視性。

catenateAll

boolean

False

值,指出是否會將所有子字詞部分都加大。 例如,如果此值設定為 true,“Azure-Search-1” 會變成 “AzureSearch1”。 預設值為 false。

catenateNumbers

boolean

False

值,指出是否將分隔數目部分的最大執行次數。 例如,如果此值設定為 true,“1-2” 會變成 “12”。 預設值為 false。

catenateWords

boolean

False

值,指出文字部分的最大執行是否會被限制。 例如,如果此設定為 true,“Azure-Search” 會變成 “AzureSearch”。 預設值為 false。

generateNumberParts

boolean

True

值,指出是否要產生數位子字詞。 預設值是「true」。

generateWordParts

boolean

True

值,指出是否要產生部分字組。 如果設定,則會導致產生部分文字;例如,“AzureSearch” 會變成 “Azure” “Search”。 預設值是「true」。

name

string

令牌篩選的名稱。 它只能包含字母、數位、空格、破折號或底線,只能以英數位元開頭和結尾,而且限制為128個字元。

preserveOriginal

boolean

False

值,指出是否會保留原始字組並新增至子字詞清單。 預設值為 false。

protectedWords

string[]

要防止分隔的令牌清單。

splitOnCaseChange

boolean

True

值,指出是否要在caseChange上分割單字。 例如,如果此值設定為 true,“AzureSearch” 會變成 “Azure” “Search”。 預設值是「true」。

splitOnNumerics

boolean

True

值,指出是否要在數位上分割。 例如,如果此值設定為 true,“Azure1Search” 會變成 “Azure” “1” “Search”。 預設值是「true」。

stemEnglishPossessive

boolean

True

值,指出是否要移除每個子字詞的尾端 「s」。。 預設值是「true」。