Indexes - Create

Membuat indeks pencarian baru.

POST {endpoint}/indexes?api-version=2026-04-01

Parameter URI

Nama Dalam Diperlukan Jenis Deskripsi
endpoint
path True

string (uri)

URL titik akhir layanan pencarian.

api-version
query True

string

minLength: 1

Versi API yang akan digunakan untuk operasi ini.

Header Permintaan

Nama Diperlukan Jenis Deskripsi
Accept

Accept

Header Terima.

x-ms-client-request-id

string (uuid)

Pengidentifikasi string yang buram dan unik secara global yang dihasilkan klien untuk permintaan tersebut.

Isi Permintaan

Nama Diperlukan Jenis Deskripsi
fields True

SearchField[]

Bidang indeks.

name True

string

Nama indeks.

@odata.etag

string

ETag indeks.

analyzers LexicalAnalyzer[]:

Penganalisis untuk indeks.

charFilters CharFilter[]:

Karakter memfilter indeks.

corsOptions

CorsOptions

Opsi untuk mengontrol Berbagi Sumber Daya Lintas Asal (CORS) untuk indeks.

defaultScoringProfile

string

Nama profil penilaian yang akan digunakan jika tidak ada yang ditentukan dalam kueri. Jika properti ini tidak diatur dan tidak ada profil penilaian yang ditentukan dalam kueri, maka penilaian default (tf-idf) akan digunakan.

description

string

Deskripsi indeks.

encryptionKey

SearchResourceEncryptionKey

Deskripsi kunci enkripsi yang Anda buat di Azure Key Vault. Kunci ini digunakan untuk memberikan tingkat enkripsi tambahan untuk data Anda saat Anda menginginkan jaminan penuh bahwa tidak ada seorang pun, bahkan Microsoft, yang dapat mendekripsi data Anda. Setelah Anda mengenkripsi data Anda, data tersebut akan selalu tetap dienkripsi. Layanan pencarian akan mengabaikan upaya untuk mengatur properti ini ke null. Anda dapat mengubah properti ini sesuai kebutuhan jika Anda ingin memutar kunci enkripsi; Data Anda tidak akan terpengaruh. Enkripsi dengan kunci yang dikelola pelanggan tidak tersedia untuk layanan pencarian gratis, dan hanya tersedia untuk layanan berbayar yang dibuat pada atau setelah 1 Januari 2019.

normalizers LexicalNormalizer[]:

CustomNormalizer[]

Normalizer untuk indeks.

scoringProfiles

ScoringProfile[]

Profil penilaian untuk indeks.

semantic

SemanticSearch

Menentukan parameter untuk indeks pencarian yang memengaruhi kemampuan semantik.

similarity SimilarityAlgorithm:

Jenis algoritma kesamaan yang akan digunakan saat menilai dan memberi peringkat dokumen yang cocok dengan kueri pencarian. Algoritma kesamaan hanya dapat ditentukan pada waktu pembuatan indeks dan tidak dapat dimodifikasi pada indeks yang ada. Jika null, algoritma ClassicSimilarity digunakan.

suggesters

SearchSuggester[]

Pemberi saran untuk indeks.

tokenFilters TokenFilter[]:

Token memfilter indeks.

tokenizers LexicalTokenizer[]:

Tokenizer untuk indeks.

vectorSearch

VectorSearch

Berisi opsi konfigurasi yang terkait dengan pencarian vektor.

Respons

Nama Jenis Deskripsi
201 Created

SearchIndex

Permintaan telah berhasil dan sumber daya baru telah dibuat sebagai hasilnya.

Other Status Codes

ErrorResponse

Respons kesalahan tak terduga.

Keamanan

api-key

Jenis: apiKey
Dalam: header

OAuth2Auth

Jenis: oauth2
Alur: implicit
URL Otorisasi: https://login.microsoftonline.com/common/oauth2/v2.0/authorize

Cakupan

Nama Deskripsi
https://search.azure.com/.default

Contoh

SearchServiceCreateIndex

Permintaan sampel

POST https://exampleservice.search.windows.net/indexes?api-version=2026-04-01


{
  "name": "temp-example-index",
  "description": "description",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "key": true,
      "sortable": true
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 20,
      "vectorSearchProfile": "config1"
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 10,
      "vectorSearchProfile": "config2"
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 5,
      "vectorSearchProfile": "config3"
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 5,
      "vectorSearchProfile": "config3"
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 10,
      "vectorSearchProfile": "config2"
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "retrievable": true,
      "searchable": true,
      "dimensions": 32,
      "vectorSearchProfile": "config4"
    },
    {
      "name": "name",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "description",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "standard.lucene"
    },
    {
      "name": "category",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "retrievable": true,
      "searchable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true,
      "analyzer": "en.lucene"
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "retrievable": true,
      "filterable": true,
      "sortable": true,
      "facetable": true
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "tag": {
            "tagsParameter": "categoryTag"
          },
          "type": "tag",
          "fieldName": "category",
          "boost": 2
        }
      ]
    }
  ],
  "defaultScoringProfile": "stringFieldBoost",
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ],
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer"
    }
  ],
  "tokenizers": [
    {
      "maxTokenLength": 100,
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer"
    }
  ],
  "tokenFilters": [
    {
      "preserveOriginal": false,
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter"
    }
  ],
  "charFilters": [
    {
      "mappings": [
        ".=>,",
        "_=>-"
      ],
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping"
    }
  ],
  "normalizers": [
    {
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ],
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer"
    }
  ],
  "similarity": {
    "k1": 10,
    "b": 0.1,
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity"
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        },
        "rankingOrder": "BoostedRerankerScore"
      }
    ]
  },
  "vectorSearch": {
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "algorithms": [
      {
        "hnswParameters": {
          "metric": "cosine"
        },
        "name": "cosine",
        "kind": "hnsw"
      },
      {
        "hnswParameters": {
          "metric": "euclidean"
        },
        "name": "euclidean",
        "kind": "hnsw"
      },
      {
        "hnswParameters": {
          "metric": "dotProduct"
        },
        "name": "dotProduct",
        "kind": "hnsw"
      }
    ],
    "vectorizers": [
      {
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com/",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        },
        "name": "openai",
        "kind": "azureOpenAI"
      },
      {
        "customWebApiParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "httpMethod": "POST",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        },
        "name": "custom-web-api",
        "kind": "customWebApi"
      },
      {
        "amlParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "resourceId": "aml resource id",
          "timeout": "PT1M",
          "region": "aml region",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        },
        "name": "aml",
        "kind": "aml"
      },
      {
        "amlParameters": {
          "uri": "https://my-custom-endpoint.org/",
          "resourceId": "aml resource id",
          "timeout": "PT1M",
          "region": "aml region",
          "modelName": "Cohere-embed-v4"
        },
        "name": "aml-cohere",
        "kind": "aml"
      }
    ],
    "compressions": [
      {
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        },
        "truncationDimension": 2
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        },
        "truncationDimension": 2
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        },
        "truncationDimension": 2
      }
    ]
  },
  "@odata.etag": "0x1234568AE7E58A1"
}

Respon sampel

{
  "@odata.etag": "0x1234568AE7E58A1",
  "name": "temp-example-index",
  "description": "description",
  "defaultScoringProfile": "stringFieldBoost",
  "fields": [
    {
      "name": "id",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": true,
      "synonymMaps": []
    },
    {
      "name": "vector1",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 20,
      "vectorSearchProfile": "config1",
      "synonymMaps": []
    },
    {
      "name": "vector1b",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector2",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector3",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 5,
      "vectorSearchProfile": "config3",
      "synonymMaps": []
    },
    {
      "name": "vector22",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 10,
      "vectorSearchProfile": "config2",
      "synonymMaps": []
    },
    {
      "name": "vector4",
      "type": "Collection(Edm.Single)",
      "searchable": true,
      "filterable": false,
      "retrievable": true,
      "stored": true,
      "sortable": false,
      "facetable": false,
      "key": false,
      "dimensions": 32,
      "vectorSearchProfile": "config4",
      "synonymMaps": []
    },
    {
      "name": "name",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "description",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "standard.lucene",
      "synonymMaps": []
    },
    {
      "name": "category",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "ownerId",
      "type": "Edm.String",
      "searchable": true,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "analyzer": "en.lucene",
      "synonymMaps": []
    },
    {
      "name": "price",
      "type": "Edm.Double",
      "searchable": false,
      "filterable": true,
      "retrievable": true,
      "stored": true,
      "sortable": true,
      "facetable": true,
      "key": false,
      "synonymMaps": []
    }
  ],
  "scoringProfiles": [
    {
      "name": "stringFieldBoost",
      "functionAggregation": "sum",
      "text": {
        "weights": {
          "name": 3,
          "description": 1,
          "category": 2,
          "ownerId": 1
        }
      },
      "functions": [
        {
          "fieldName": "category",
          "interpolation": "linear",
          "type": "tag",
          "boost": 2,
          "tag": {
            "tagsParameter": "categoryTag"
          }
        }
      ]
    }
  ],
  "corsOptions": {
    "allowedOrigins": [
      "https://www.example.com/foo"
    ],
    "maxAgeInSeconds": 10
  },
  "suggesters": [
    {
      "name": "sg",
      "searchMode": "analyzingInfixMatching",
      "sourceFields": [
        "category",
        "ownerId"
      ]
    }
  ],
  "analyzers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomAnalyzer",
      "name": "tagsAnalyzer",
      "tokenizer": "standard_v2",
      "tokenFilters": [
        "common_grams"
      ],
      "charFilters": [
        "html_strip"
      ]
    }
  ],
  "normalizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.CustomNormalizer",
      "name": "my_normalizer",
      "tokenFilters": [
        "my_tokenFilter"
      ],
      "charFilters": [
        "my_mapping"
      ]
    }
  ],
  "tokenizers": [
    {
      "@odata.type": "#Microsoft.Azure.Search.StandardTokenizerV2",
      "name": "my_tokenizer",
      "maxTokenLength": 100
    }
  ],
  "tokenFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.AsciiFoldingTokenFilter",
      "name": "my_tokenFilter",
      "preserveOriginal": false
    }
  ],
  "charFilters": [
    {
      "@odata.type": "#Microsoft.Azure.Search.MappingCharFilter",
      "name": "my_mapping",
      "mappings": [
        ".=>,",
        "_=>-"
      ]
    }
  ],
  "similarity": {
    "@odata.type": "#Microsoft.Azure.Search.BM25Similarity",
    "k1": 10,
    "b": 0.1
  },
  "semantic": {
    "defaultConfiguration": "testconfig",
    "configurations": [
      {
        "name": "testconfig",
        "rankingOrder": "BoostedRerankerScore",
        "prioritizedFields": {
          "titleField": {
            "fieldName": "category"
          },
          "prioritizedContentFields": [
            {
              "fieldName": "description"
            }
          ],
          "prioritizedKeywordsFields": [
            {
              "fieldName": "ownerId"
            }
          ]
        }
      }
    ]
  },
  "vectorSearch": {
    "algorithms": [
      {
        "name": "cosine",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "cosine",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "euclidean",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "euclidean",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      },
      {
        "name": "dotProduct",
        "kind": "hnsw",
        "hnswParameters": {
          "metric": "dotProduct",
          "m": 4,
          "efConstruction": 400,
          "efSearch": 500
        }
      }
    ],
    "profiles": [
      {
        "name": "config1",
        "algorithm": "cosine",
        "vectorizer": "openai",
        "compression": "mySQ8"
      },
      {
        "name": "config2",
        "algorithm": "euclidean",
        "vectorizer": "custom-web-api",
        "compression": "mySQ8"
      },
      {
        "name": "config3",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQC"
      },
      {
        "name": "config4",
        "algorithm": "dotProduct",
        "vectorizer": "custom-web-api",
        "compression": "myBQWithoutOriginals"
      }
    ],
    "vectorizers": [
      {
        "name": "openai",
        "kind": "azureOpenAI",
        "azureOpenAIParameters": {
          "resourceUri": "https://test-sample.openai.azure.com",
          "deploymentId": "model",
          "apiKey": "api-key",
          "modelName": "text-embedding-3-large"
        }
      },
      {
        "name": "custom-web-api",
        "kind": "customWebApi",
        "customWebApiParameters": {
          "httpMethod": "POST",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "authResourceId": "api://f89d1c93-58a7-4b07-9a5b-5f89048b927b",
          "httpHeaders": {
            "header1": "value1",
            "header2": "value2"
          },
          "authIdentity": {
            "@odata.type": "#Microsoft.Azure.Search.DataNoneIdentity"
          }
        }
      },
      {
        "name": "aml",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32"
        }
      },
      {
        "name": "aml-cohere",
        "kind": "aml",
        "amlParameters": {
          "resourceId": "aml resource id",
          "region": "aml region",
          "uri": "https://my-custom-endpoint.org/",
          "timeout": "PT1M",
          "modelName": "Cohere-embed-v4"
        }
      }
    ],
    "compressions": [
      {
        "name": "mySQ8",
        "kind": "scalarQuantization",
        "truncationDimension": 2,
        "scalarQuantizationParameters": {
          "quantizedDataType": "int8"
        },
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQC",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "preserveOriginals"
        }
      },
      {
        "name": "myBQWithoutOriginals",
        "kind": "binaryQuantization",
        "truncationDimension": 2,
        "rescoringOptions": {
          "enableRescoring": true,
          "defaultOversampling": 10,
          "rescoreStorageMethod": "discardOriginals"
        }
      }
    ]
  }
}

Definisi

Nama Deskripsi
Accept

Header Terima.

AIFoundryModelCatalogName

Nama model penyematan dari Azure AI Foundry Catalog yang akan dipanggil.

AMLParameters

Menentukan properti untuk menyambungkan ke vektorizer AML.

AMLVectorizer

Menentukan titik akhir Azure Machine Learning yang disebarkan melalui Azure AI Foundry Model Catalog untuk menghasilkan penyematan vektor string kueri.

AsciiFoldingTokenFilter

Mengonversi karakter Unicode alfabet, numerik, dan simbolis yang tidak berada dalam 127 karakter ASCII pertama (blok Unicode "Latin Dasar" ke dalam setara ASCII mereka, jika setara tersebut ada. Filter token ini diimplementasikan menggunakan Apache Lucene.

AzureOpenAIModelName

Nama model Azure Open AI yang akan dipanggil.

AzureOpenAIVectorizer

Menentukan sumber daya Azure OpenAI yang digunakan untuk mengvektorkan string kueri.

AzureOpenAIVectorizerParameters

Menentukan parameter untuk menyambungkan ke sumber daya Azure OpenAI.

BinaryQuantizationCompression

Berisi opsi konfigurasi khusus untuk metode kompresi kuantisasi biner yang digunakan selama pengindeksan dan kueri.

BM25SimilarityAlgorithm

Fungsi peringkat berdasarkan algoritma kesamaan Okapi BM25. BM25 adalah algoritma seperti TF-IDF yang mencakup normalisasi panjang (dikontrol oleh parameter 'b') serta saturasi frekuensi istilah (dikontrol oleh parameter 'k1').

CharFilterName

Menentukan nama semua filter karakter yang didukung oleh mesin pencari.

CjkBigramTokenFilter

Membentuk bigram istilah CJK yang dihasilkan dari tokenizer standar. Filter token ini diimplementasikan menggunakan Apache Lucene.

CjkBigramTokenFilterScripts

Skrip yang dapat diabaikan oleh CjkBigramTokenFilter.

ClassicSimilarityAlgorithm

Algoritma kesamaan warisan yang menggunakan implementasi Lucene TFIDFSimilarity dari TF-IDF. Variasi TF-IDF ini memperkenalkan normalisasi panjang dokumen statis serta faktor koordinasi yang mengharuskan dokumen yang hanya sebagian cocok dengan kueri yang dicari.

ClassicTokenizer

Tokenizer berbasis tata bahasa yang cocok untuk memproses sebagian besar dokumen berbahasa Eropa. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

CommonGramTokenFilter

Membuat bigram untuk istilah yang sering muncul saat mengindeks. Istilah tunggal juga masih diindeks, dengan bigram berlapis. Filter token ini diimplementasikan menggunakan Apache Lucene.

CorsOptions

Menentukan opsi untuk mengontrol Berbagi Sumber Daya Lintas Asal (CORS) untuk indeks.

CustomAnalyzer

Memungkinkan Anda mengambil kontrol atas proses konversi teks menjadi token yang dapat diindeks/dapat dicari. Ini adalah konfigurasi yang ditentukan pengguna yang terdiri dari satu tokenizer yang telah ditentukan sebelumnya dan satu atau beberapa filter. Tokenizer bertanggung jawab untuk memecah teks menjadi token, dan filter untuk memodifikasi token yang dipancarkan oleh tokenizer.

CustomNormalizer

Memungkinkan Anda mengonfigurasi normalisasi untuk bidang yang dapat difilter, dapat diurutkan, dan dapat difaset, yang secara default beroperasi dengan pencocokan yang ketat. Ini adalah konfigurasi yang ditentukan pengguna yang terdiri dari setidaknya satu atau beberapa filter, yang memodifikasi token yang disimpan.

DictionaryDecompounderTokenFilter

Menguraikan kata majemuk yang ditemukan dalam banyak bahasa Jermanik. Filter token ini diimplementasikan menggunakan Apache Lucene.

DistanceScoringFunction

Menentukan fungsi yang meningkatkan skor berdasarkan jarak dari lokasi geografis.

DistanceScoringParameters

Menyediakan nilai parameter ke fungsi penilaian jarak.

EdgeNGramTokenFilter

Menghasilkan n-gram dari ukuran yang diberikan mulai dari depan atau belakang token input. Filter token ini diimplementasikan menggunakan Apache Lucene.

EdgeNGramTokenFilterSide

Menentukan sisi input mana yang harus dihasilkan dari n-gram.

EdgeNGramTokenFilterV2

Menghasilkan n-gram dari ukuran yang diberikan mulai dari depan atau belakang token input. Filter token ini diimplementasikan menggunakan Apache Lucene.

EdgeNGramTokenizer

Tokenisasi input dari tepi ke dalam n-gram dari ukuran yang diberikan. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

ElisionTokenFilter

Menghilangkan elision. Misalnya, "l'avion" (bidang) akan dikonversi menjadi "avion" (bidang). Filter token ini diimplementasikan menggunakan Apache Lucene.

ErrorAdditionalInfo

Info tambahan kesalahan manajemen sumber daya.

ErrorDetail

Detail kesalahan.

ErrorResponse

Respons kesalahan umum untuk semua API Azure Resource Manager untuk mengembalikan detail kesalahan untuk operasi yang gagal. (Ini juga mengikuti format respons kesalahan OData.).

ExhaustiveKnnAlgorithmConfiguration

Berisi opsi konfigurasi khusus untuk algoritma KNN lengkap yang digunakan selama kueri, yang akan melakukan pencarian brute-force di seluruh indeks vektor.

ExhaustiveKnnParameters

Berisi parameter khusus untuk algoritma KNN lengkap.

FreshnessScoringFunction

Menentukan fungsi yang meningkatkan skor berdasarkan nilai bidang tanggal-waktu.

FreshnessScoringParameters

Menyediakan nilai parameter ke fungsi penilaian kesegaran.

HnswAlgorithmConfiguration

Berisi opsi konfigurasi khusus untuk algoritma perkiraan tetangga terdekat HNSW yang digunakan selama pengindeksan dan kueri. Algoritma HNSW menawarkan trade-off yang dapat disetel antara kecepatan dan akurasi pencarian.

HnswParameters

Berisi parameter khusus untuk algoritma HNSW.

KeepTokenFilter

Filter token yang hanya menyimpan token dengan teks yang terkandung dalam daftar kata tertentu. Filter token ini diimplementasikan menggunakan Apache Lucene.

KeywordMarkerTokenFilter

Menandai istilah sebagai kata kunci. Filter token ini diimplementasikan menggunakan Apache Lucene.

KeywordTokenizer

Mengirimkan seluruh input sebagai token tunggal. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

KeywordTokenizerV2

Mengirimkan seluruh input sebagai token tunggal. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

LengthTokenFilter

Menghapus kata-kata yang terlalu panjang atau terlalu pendek. Filter token ini diimplementasikan menggunakan Apache Lucene.

LexicalAnalyzerName

Menentukan nama semua penganalisis teks yang didukung oleh mesin pencari.

LexicalNormalizerName

Menentukan nama semua normalisasi teks yang didukung oleh mesin pencari.

LexicalTokenizerName

Menentukan nama semua tokenizer yang didukung oleh mesin pencari.

LimitTokenFilter

Membatasi jumlah token saat mengindeks. Filter token ini diimplementasikan menggunakan Apache Lucene.

LuceneStandardAnalyzer

Penganalisis Apache Lucene Standar; Terdiri dari tokenizer standar, filter huruf kecil, dan filter berhenti.

LuceneStandardTokenizer

Hentian teks mengikuti aturan Segmentasi Teks Unicode. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

LuceneStandardTokenizerV2

Hentian teks mengikuti aturan Segmentasi Teks Unicode. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

MagnitudeScoringFunction

Menentukan fungsi yang meningkatkan skor berdasarkan besarnya bidang numerik.

MagnitudeScoringParameters

Menyediakan nilai parameter ke fungsi penilaian besaran.

MappingCharFilter

Filter karakter yang menerapkan pemetaan yang ditentukan dengan opsi pemetaan. Pencocokan bersifat rakus (pola terpanjang yang cocok di titik tertentu menang). Penggantian diperbolehkan menggunakan string kosong. Filter karakter ini diimplementasikan menggunakan Apache Lucene.

MicrosoftLanguageStemmingTokenizer

Membagi teks menggunakan aturan khusus bahasa dan mengurangi kata-kata ke bentuk dasarnya.

MicrosoftLanguageTokenizer

Membagi teks menggunakan aturan spesifik bahasa.

MicrosoftStemmingTokenizerLanguage

Mencantumkan bahasa yang didukung oleh tokenizer stem bahasa Microsoft.

MicrosoftTokenizerLanguage

Mencantumkan bahasa yang didukung oleh tokenizer bahasa Microsoft.

NGramTokenFilter

Menghasilkan n-gram dari ukuran yang diberikan. Filter token ini diimplementasikan menggunakan Apache Lucene.

NGramTokenFilterV2

Menghasilkan n-gram dari ukuran yang diberikan. Filter token ini diimplementasikan menggunakan Apache Lucene.

NGramTokenizer

Tokenisasi input ke dalam n-gram dari ukuran yang diberikan. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

PathHierarchyTokenizerV2

Tokenizer untuk hierarki berupa jalur. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

PatternAnalyzer

Secara fleksibel memisahkan teks menjadi istilah melalui pola ekspresi reguler. Penganalisis ini diimplementasikan menggunakan Apache Lucene.

PatternCaptureTokenFilter

Menggunakan regex Java untuk memancarkan beberapa token - satu untuk setiap grup pengambilan dalam satu atau beberapa pola. Filter token ini diimplementasikan menggunakan Apache Lucene.

PatternReplaceCharFilter

Filter karakter yang menggantikan karakter dalam string input. Menggunakan ekspresi reguler untuk mengidentifikasi urutan karakter untuk dipertahankan dan pola pengganti untuk mengidentifikasi karakter untuk diganti. Misalnya, mengingat teks input "aa bb aa bb", pola "(aa)\s+(bb)", dan penggantian "$1#$2", hasilnya adalah "aa#bb aa#bb". Filter karakter ini diimplementasikan menggunakan Apache Lucene.

PatternReplaceTokenFilter

Filter karakter yang menggantikan karakter dalam string input. Menggunakan ekspresi reguler untuk mengidentifikasi urutan karakter untuk dipertahankan dan pola pengganti untuk mengidentifikasi karakter untuk diganti. Misalnya, mengingat teks input "aa bb aa bb", pola "(aa)\s+(bb)", dan penggantian "$1#$2", hasilnya adalah "aa#bb aa#bb". Filter token ini diimplementasikan menggunakan Apache Lucene.

PatternTokenizer

Tokenizer yang menggunakan pencocokan pola regex untuk membangun token yang berbeda. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

PhoneticEncoder

Mengidentifikasi jenis encoder fonetik yang akan digunakan dengan PhoneticTokenFilter.

PhoneticTokenFilter

Membuat token untuk kecocokan fonetik. Filter token ini diimplementasikan menggunakan Apache Lucene.

RankingOrder

Mewakili skor untuk digunakan untuk urutan pengurutan dokumen.

RescoringOptions

Berisi opsi untuk memulihkan.

ScalarQuantizationCompression

Berisi opsi konfigurasi khusus untuk metode kompresi kuantisasi skalar yang digunakan selama pengindeksan dan kueri.

ScalarQuantizationParameters

Berisi parameter khusus untuk Kuantisasi Skalar.

ScoringFunctionAggregation

Menentukan fungsi agregasi yang digunakan untuk menggabungkan hasil semua fungsi penilaian dalam profil penilaian.

ScoringFunctionInterpolation

Menentukan fungsi yang digunakan untuk menginterpolasi peningkatan skor di berbagai dokumen.

ScoringProfile

Menentukan parameter untuk indeks pencarian yang memengaruhi penilaian dalam kueri pencarian.

SearchField

Mewakili bidang dalam definisi indeks, yang menjelaskan nama, jenis data, dan perilaku pencarian bidang.

SearchFieldDataType

Menentukan jenis data bidang dalam indeks pencarian.

SearchIndex

Mewakili definisi indeks pencarian, yang menjelaskan bidang dan perilaku pencarian indeks.

SearchIndexerDataNoneIdentity

Menghapus properti identitas sumber data.

SearchIndexerDataUserAssignedIdentity

Menentukan identitas untuk sumber data yang akan digunakan.

SearchResourceEncryptionKey

Kunci enkripsi yang dikelola pelanggan di Azure Key Vault. Kunci yang Anda buat dan kelola dapat digunakan untuk mengenkripsi atau mendekripsi data-at-rest, seperti indeks dan peta sinonim.

SearchSuggester

Menentukan bagaimana SUGGEST API harus berlaku untuk sekelompok bidang dalam indeks.

SemanticConfiguration

Menentukan konfigurasi tertentu yang akan digunakan dalam konteks kemampuan semantik.

SemanticField

Bidang yang digunakan sebagai bagian dari konfigurasi semantik.

SemanticPrioritizedFields

Menjelaskan bidang judul, konten, dan kata kunci yang akan digunakan untuk peringkat, keterangan, sorotan, dan jawaban semantik.

SemanticSearch

Menentukan parameter untuk indeks pencarian yang memengaruhi kemampuan semantik.

ShingleTokenFilter

Membuat kombinasi token sebagai token tunggal. Filter token ini diimplementasikan menggunakan Apache Lucene.

SnowballTokenFilter

Filter yang membendung kata-kata menggunakan stemmer yang dihasilkan Snowball. Filter token ini diimplementasikan menggunakan Apache Lucene.

SnowballTokenFilterLanguage

Bahasa yang akan digunakan untuk filter token Snowball.

StemmerOverrideTokenFilter

Menyediakan kemampuan untuk mengambil alih filter stemming lain dengan stemming berbasis kamus kustom. Istilah apa pun yang bertangkai kamus akan ditandai sebagai kata kunci sehingga tidak akan dibendung dengan stemmer di bawah rantai. Harus ditempatkan sebelum filter stemming. Filter token ini diimplementasikan menggunakan Apache Lucene. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html

StemmerTokenFilter

Filter stemming khusus bahasa. Filter token ini diimplementasikan menggunakan Apache Lucene. Lihat https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

StemmerTokenFilterLanguage

Bahasa yang akan digunakan untuk filter token stemmer.

StopAnalyzer

Membagi teks pada non-huruf; Menerapkan filter token huruf kecil dan stopword. Penganalisis ini diimplementasikan menggunakan Apache Lucene.

StopwordsList

Mengidentifikasi daftar kata henti khusus bahasa yang telah ditentukan sebelumnya.

StopwordsTokenFilter

Menghapus kata stop dari stream token. Filter token ini diimplementasikan menggunakan Apache Lucene. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

SynonymTokenFilter

Cocok dengan sinonim tunggal atau multi-kata dalam aliran token. Filter token ini diimplementasikan menggunakan Apache Lucene.

TagScoringFunction

Menentukan fungsi yang meningkatkan skor dokumen dengan nilai string yang cocok dengan daftar tag tertentu.

TagScoringParameters

Menyediakan nilai parameter ke fungsi penilaian tag.

TextWeights

Menentukan bobot pada bidang indeks yang kecocokannya harus meningkatkan penilaian dalam kueri pencarian.

TokenCharacterKind

Mewakili kelas karakter tempat filter token dapat beroperasi.

TokenFilterName

Menentukan nama semua filter token yang didukung oleh mesin pencari.

TruncateTokenFilter

Memotong istilah ke panjang tertentu. Filter token ini diimplementasikan menggunakan Apache Lucene.

UaxUrlEmailTokenizer

Tokenisasi url dan email sebagai satu token. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

UniqueTokenFilter

Memfilter token yang memiliki teks sama dengan token sebelumnya. Filter token ini diimplementasikan menggunakan Apache Lucene.

VectorEncodingFormat

Format pengkodean untuk menafsirkan konten bidang vektor.

VectorSearch

Berisi opsi konfigurasi yang terkait dengan pencarian vektor.

VectorSearchAlgorithmKind

Algoritma yang digunakan untuk pengindeksan dan kueri.

VectorSearchAlgorithmMetric

Metrik kesamaan yang digunakan untuk perbandingan vektor. Disarankan untuk memilih metrik kesamaan yang sama dengan model penyematan yang dilatih.

VectorSearchCompressionKind

Metode kompresi yang digunakan untuk pengindeksan dan kueri.

VectorSearchCompressionTarget

Jenis data terkuantisasi dari nilai vektor terkompresi.

VectorSearchProfile

Menentukan kombinasi konfigurasi yang akan digunakan dengan pencarian vektor.

VectorSearchVectorizerKind

Metode vektorisasi yang akan digunakan selama waktu kueri.

WebApiVectorizer

Menentukan vektorizer yang ditentukan pengguna untuk menghasilkan penyematan vektor string kueri. Integrasi vektorizer eksternal dicapai menggunakan antarmuka API Web kustom dari set keterampilan.

WebApiVectorizerParameters

Menentukan properti untuk menyambungkan ke vektorizer yang ditentukan pengguna.

WordDelimiterTokenFilter

Membagi kata menjadi subkata dan melakukan transformasi opsional pada grup subkata. Filter token ini diimplementasikan menggunakan Apache Lucene.

Accept

Header Terima.

Nilai Deskripsi
application/json;odata.metadata=minimal

AIFoundryModelCatalogName

Nama model penyematan dari Azure AI Foundry Catalog yang akan dipanggil.

Nilai Deskripsi
OpenAI-CLIP-Image-Text-Embeddings-vit-base-patch32

OpenAI-CLIP-Gambar-Teks-Penyematan-vit-base-patch32

OpenAI-CLIP-Image-Text-Embeddings-ViT-Large-Patch14-336

OpenAI-CLIP-Gambar-Teks-Penyematan-ViT-Tambalan-Besar14-336

Facebook-DinoV2-Image-Embeddings-ViT-Base

Facebook-DinoV2-Image-Embeddings-ViT-Base

Facebook-DinoV2-Image-Embeddings-ViT-Giant

Facebook-DinoV2-Penyisipan-Gambar-ViT-Giant

Cohere-embed-v3-english

Cohere-embed-v3-english

Cohere-embed-v3-multilingual

Cohere-embed-v3-multilingual

Cohere-embed-v4

Cohere embed v4 model untuk menghasilkan penyematan dari teks dan gambar.

AMLParameters

Menentukan properti untuk menyambungkan ke vektorizer AML.

Nama Jenis Deskripsi
key

string

(Wajib untuk autentikasi kunci) Kunci untuk layanan AML.

modelName

AIFoundryModelCatalogName

Nama model penyematan dari Azure AI Foundry Catalog yang disebarkan di titik akhir yang disediakan.

region

string

(Opsional untuk autentikasi token). Wilayah tempat layanan AML disebarkan.

resourceId

string

(Diperlukan untuk autentikasi token). ID sumber daya Azure Resource Manager dari layanan AML. Itu harus dalam format subscriptions/{guid}/resourceGroups/{resource-group-name}/Microsoft. MachineLearningServices/workspaces/{workspace-name}/services/{service_name}.

timeout

string (duration)

(Opsional) Ketika ditentukan, menunjukkan batas waktu untuk klien http yang melakukan panggilan API.

uri

string (uri)

(Wajib untuk tidak ada autentikasi atau autentikasi kunci) URI penilaian layanan AML tempat payload JSON akan dikirim. Hanya skema URI https yang diizinkan.

AMLVectorizer

Menentukan titik akhir Azure Machine Learning yang disebarkan melalui Azure AI Foundry Model Catalog untuk menghasilkan penyematan vektor string kueri.

Nama Jenis Deskripsi
amlParameters

AMLParameters

Menentukan properti vektorizer AML.

kind string:

aml

Jenis VectorSearchVectorizer.

name

string

Nama yang akan dikaitkan dengan metode vektorisasi khusus ini.

AsciiFoldingTokenFilter

Mengonversi karakter Unicode alfabet, numerik, dan simbolis yang tidak berada dalam 127 karakter ASCII pertama (blok Unicode "Latin Dasar" ke dalam setara ASCII mereka, jika setara tersebut ada. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.AsciiFoldingTokenFilter

Diskriminator untuk jenis turunan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

preserveOriginal

boolean

False

Nilai yang menunjukkan apakah token asli akan disimpan. Nilai default adalah false.

AzureOpenAIModelName

Nama model Azure Open AI yang akan dipanggil.

Nilai Deskripsi
text-embedding-ada-002

TextEmbeddingAda002 model.

text-embedding-3-large

TextEmbedding3Model besar.

text-embedding-3-small

TextEmbedding3Model kecil.

gpt-5-mini

Model Gpt5Mini.

gpt-5-nano

Model Gpt5Nano.

gpt-5.4-mini

Model Gpt54Mini.

gpt-5.4-nano

Model Gpt54Nano.

AzureOpenAIVectorizer

Menentukan sumber daya Azure OpenAI yang digunakan untuk mengvektorkan string kueri.

Nama Jenis Deskripsi
azureOpenAIParameters

AzureOpenAIVectorizerParameters

Berisi parameter khusus untuk vektorisasi penyematan Azure OpenAI.

kind string:

azureOpenAI

Jenis VectorSearchVectorizer.

name

string

Nama yang akan dikaitkan dengan metode vektorisasi khusus ini.

AzureOpenAIVectorizerParameters

Menentukan parameter untuk menyambungkan ke sumber daya Azure OpenAI.

Nama Jenis Deskripsi
apiKey

string

Kunci API dari sumber daya Azure OpenAI yang ditunjuk.

authIdentity SearchIndexerDataIdentity:

Identitas terkelola yang ditetapkan pengguna yang digunakan untuk koneksi keluar.

deploymentId

string

ID penyebaran model Azure OpenAI pada sumber daya yang ditunjuk.

modelName

AzureOpenAIModelName

Nama model penyematan yang disebarkan di jalur deploymentId yang disediakan.

resourceUri

string (uri)

URI sumber daya sumber daya Azure OpenAI.

BinaryQuantizationCompression

Berisi opsi konfigurasi khusus untuk metode kompresi kuantisasi biner yang digunakan selama pengindeksan dan kueri.

Nama Jenis Deskripsi
kind string:

binaryQuantization

Jenis VectorSearchCompression.

name

string

Nama yang akan dikaitkan dengan konfigurasi khusus ini.

rescoringOptions

RescoringOptions

Berisi opsi untuk memulihkan.

truncationDimension

integer (int32)

Jumlah dimensi untuk memotong vektor. Memotong vektor mengurangi ukuran vektor dan jumlah data yang perlu ditransfer selama pencarian. Ini dapat menghemat biaya penyimpanan dan meningkatkan kinerja pencarian dengan mengorbankan penarikan. Ini hanya boleh digunakan untuk penyematan yang dilatih dengan Matryoshka Representation Learning (MRL) seperti OpenAI text-embedding-3-large (kecil). Nilai defaultnya adalah null, yang berarti tidak ada pemotongan.

BM25SimilarityAlgorithm

Fungsi peringkat berdasarkan algoritma kesamaan Okapi BM25. BM25 adalah algoritma seperti TF-IDF yang mencakup normalisasi panjang (dikontrol oleh parameter 'b') serta saturasi frekuensi istilah (dikontrol oleh parameter 'k1').

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.BM25Similarity

Diskriminator untuk jenis turunan.

b

number (double)

Properti ini mengontrol bagaimana panjang dokumen memengaruhi skor relevansi. Secara default, nilai 0,75 digunakan. Nilai 0,0 berarti tidak ada normalisasi panjang yang diterapkan, sementara nilai 1,0 berarti skor sepenuhnya dinormalisasi dengan panjang dokumen.

k1

number (double)

Properti ini mengontrol fungsi penskalaan antara frekuensi istilah setiap istilah yang cocok dan skor relevansi akhir pasangan kueri dokumen. Secara default, nilai 1.2 digunakan. Nilai 0,0 berarti skor tidak diskalakan dengan peningkatan frekuensi istilah.

CharFilterName

Menentukan nama semua filter karakter yang didukung oleh mesin pencari.

Nilai Deskripsi
html_strip

Filter karakter yang mencoba menghapus konstruksi HTML. Lihat https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html

CjkBigramTokenFilter

Membentuk bigram istilah CJK yang dihasilkan dari tokenizer standar. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.CjkBigramTokenFilter

Diskriminator untuk jenis turunan.

ignoreScripts

CjkBigramTokenFilterScripts[]

Skrip yang akan diabaikan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

outputUnigrams

boolean

False

Nilai yang menunjukkan apakah akan menghasilkan unigram dan bigram (jika benar), atau hanya bigram (jika salah). Nilai default adalah false.

CjkBigramTokenFilterScripts

Skrip yang dapat diabaikan oleh CjkBigramTokenFilter.

Nilai Deskripsi
han

Abaikan aksara Han saat membentuk bigram istilah CJK.

hiragana

Abaikan aksara Hiragana saat membentuk bigram istilah CJK.

katakana

Abaikan aksara Katakana saat membentuk bigram istilah CJK.

hangul

Abaikan aksara Hangul saat membentuk bigram istilah CJK.

ClassicSimilarityAlgorithm

Algoritma kesamaan warisan yang menggunakan implementasi Lucene TFIDFSimilarity dari TF-IDF. Variasi TF-IDF ini memperkenalkan normalisasi panjang dokumen statis serta faktor koordinasi yang mengharuskan dokumen yang hanya sebagian cocok dengan kueri yang dicari.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.ClassicSimilarity

Diskriminator untuk jenis turunan.

ClassicTokenizer

Tokenizer berbasis tata bahasa yang cocok untuk memproses sebagian besar dokumen berbahasa Eropa. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.ClassicTokenizer

Diskriminator untuk jenis turunan.

maxTokenLength

integer (int32)

maximum: 300
255

Panjang token maksimum. Defaultnya adalah 255. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

CommonGramTokenFilter

Membuat bigram untuk istilah yang sering muncul saat mengindeks. Istilah tunggal juga masih diindeks, dengan bigram berlapis. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.CommonGramTokenFilter

Diskriminator untuk jenis turunan.

commonWords

string[]

Kumpulan kata-kata umum.

ignoreCase

boolean

False

Nilai yang menunjukkan apakah pencocokan kata umum akan tidak peka huruf besar/kecil. Nilai default adalah false.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

queryMode

boolean

False

Nilai yang menunjukkan apakah filter token berada dalam mode kueri. Saat dalam mode kueri, filter token menghasilkan bigram lalu menghapus kata-kata umum dan istilah tunggal diikuti dengan kata umum. Nilai default adalah false.

CorsOptions

Menentukan opsi untuk mengontrol Berbagi Sumber Daya Lintas Asal (CORS) untuk indeks.

Nama Jenis Deskripsi
allowedOrigins

string[]

Daftar asal dari mana kode JavaScript akan diberikan akses ke indeks Anda. Dapat berisi daftar host dari bentuk {protocol}://{fully-qualified-domain-name}[:{port#}], atau satu '*' untuk mengizinkan semua asal (tidak disarankan).

maxAgeInSeconds

integer (int64)

Durasi browser harus menyimpan respons prapenerbangan CORS dalam cache. Default ke 5 menit.

CustomAnalyzer

Memungkinkan Anda mengambil kontrol atas proses konversi teks menjadi token yang dapat diindeks/dapat dicari. Ini adalah konfigurasi yang ditentukan pengguna yang terdiri dari satu tokenizer yang telah ditentukan sebelumnya dan satu atau beberapa filter. Tokenizer bertanggung jawab untuk memecah teks menjadi token, dan filter untuk memodifikasi token yang dipancarkan oleh tokenizer.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.CustomAnalyzer

Diskriminator untuk jenis turunan.

charFilters

CharFilterName[]

Daftar filter karakter yang digunakan untuk menyiapkan teks input sebelum diproses oleh tokenizer. Misalnya, mereka dapat menggantikan karakter atau simbol tertentu. Filter dijalankan dalam urutan di mana filter tersebut tercantum.

name

string

Nama penganalisis. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

tokenFilters

TokenFilterName[]

Daftar filter token yang digunakan untuk memfilter atau memodifikasi token yang dihasilkan oleh tokenizer. Misalnya, Anda dapat menetapkan filter huruf kecil yang mengonversi semua karakter menjadi huruf kecil. Filter dijalankan dalam urutan di mana filter tersebut tercantum.

tokenizer

LexicalTokenizerName

Nama tokenizer yang akan digunakan untuk membagi teks kontinu menjadi urutan token, seperti memecah kalimat menjadi kata-kata.

CustomNormalizer

Memungkinkan Anda mengonfigurasi normalisasi untuk bidang yang dapat difilter, dapat diurutkan, dan dapat difaset, yang secara default beroperasi dengan pencocokan yang ketat. Ini adalah konfigurasi yang ditentukan pengguna yang terdiri dari setidaknya satu atau beberapa filter, yang memodifikasi token yang disimpan.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.CustomNormalizer

Diskriminator untuk jenis turunan.

charFilters

CharFilterName[]

Daftar filter karakter yang digunakan untuk menyiapkan teks input sebelum diproses. Misalnya, mereka dapat menggantikan karakter atau simbol tertentu. Filter dijalankan dalam urutan di mana filter tersebut tercantum.

name

string

Nama filter karakter. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

tokenFilters

TokenFilterName[]

Daftar filter token yang digunakan untuk memfilter atau mengubah token input. Misalnya, Anda dapat menetapkan filter huruf kecil yang mengonversi semua karakter menjadi huruf kecil. Filter dijalankan dalam urutan di mana filter tersebut tercantum.

DictionaryDecompounderTokenFilter

Menguraikan kata majemuk yang ditemukan dalam banyak bahasa Jermanik. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.DictionaryDecompounderTokenFilter

Diskriminator untuk jenis turunan.

maxSubwordSize

integer (int32)

maximum: 300
15

Ukuran subkata maksimum. Hanya subkata yang lebih pendek dari ini yang dihasilkan. Defaultnya adalah 15. Maksimum adalah 300.

minSubwordSize

integer (int32)

maximum: 300
2

Ukuran subkata minimum. Hanya subkata yang lebih panjang dari ini yang dihasilkan. Nilai bawaan adalah 2. Maksimum adalah 300.

minWordSize

integer (int32)

maximum: 300
5

Ukuran kata minimum. Hanya kata-kata yang lebih panjang dari ini yang diproses. Pengaturan awal adalah 5. Maksimum adalah 300.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

onlyLongestMatch

boolean

False

Nilai yang menunjukkan apakah hanya menambahkan subword yang cocok terpanjang ke output. Nilai default adalah false.

wordList

string[]

Daftar kata yang cocok dengan.

DistanceScoringFunction

Menentukan fungsi yang meningkatkan skor berdasarkan jarak dari lokasi geografis.

Nama Jenis Deskripsi
boost

number (double)

Pengali untuk skor mentah. Harus berupa angka positif yang tidak sama dengan 1,0.

distance

DistanceScoringParameters

Nilai parameter untuk fungsi penilaian jarak.

fieldName

string

Nama bidang yang digunakan sebagai input ke fungsi penilaian.

interpolation

ScoringFunctionInterpolation

Nilai yang menunjukkan bagaimana peningkatan akan diinterpolasi di seluruh skor dokumen; default ke "Linear".

type string:

distance

Jenis ScoringFunction.

DistanceScoringParameters

Menyediakan nilai parameter ke fungsi penilaian jarak.

Nama Jenis Deskripsi
boostingDistance

number (double)

Jarak dalam kilometer dari lokasi referensi tempat jangkauan boosting berakhir.

referencePointParameter

string

Nama parameter yang diteruskan dalam kueri pencarian untuk menentukan lokasi referensi.

EdgeNGramTokenFilter

Menghasilkan n-gram dari ukuran yang diberikan mulai dari depan atau belakang token input. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenFilter

Diskriminator untuk jenis turunan.

maxGram

integer (int32)

2

Panjang n-gram maksimum. Nilai bawaan adalah 2.

minGram

integer (int32)

1

Panjang n-gram minimum. Nilai baku adalah 1. Harus kurang dari nilai maxGram.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

side

EdgeNGramTokenFilterSide

front

Menentukan sisi input mana yang harus dihasilkan dari n-gram. Defaultnya adalah "depan".

EdgeNGramTokenFilterSide

Menentukan sisi input mana yang harus dihasilkan dari n-gram.

Nilai Deskripsi
front

Menentukan bahwa n-gram harus dihasilkan dari bagian depan input.

back

Menentukan bahwa n-gram harus dihasilkan dari bagian belakang input.

EdgeNGramTokenFilterV2

Menghasilkan n-gram dari ukuran yang diberikan mulai dari depan atau belakang token input. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenFilterV2

Diskriminator untuk jenis turunan.

maxGram

integer (int32)

maximum: 300
2

Panjang n-gram maksimum. Nilai bawaan adalah 2. Maksimum adalah 300.

minGram

integer (int32)

maximum: 300
1

Panjang n-gram minimum. Nilai baku adalah 1. Maksimum adalah 300. Harus kurang dari nilai maxGram.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

side

EdgeNGramTokenFilterSide

front

Menentukan sisi input mana yang harus dihasilkan dari n-gram. Defaultnya adalah "depan".

EdgeNGramTokenizer

Tokenisasi input dari tepi ke dalam n-gram dari ukuran yang diberikan. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.EdgeNGramTokenizer

Diskriminator untuk jenis turunan.

maxGram

integer (int32)

maximum: 300
2

Panjang n-gram maksimum. Nilai bawaan adalah 2. Maksimum adalah 300.

minGram

integer (int32)

maximum: 300
1

Panjang n-gram minimum. Nilai baku adalah 1. Maksimum adalah 300. Harus kurang dari nilai maxGram.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

tokenChars

TokenCharacterKind[]

Kelas karakter untuk disimpan dalam token.

ElisionTokenFilter

Menghilangkan elision. Misalnya, "l'avion" (bidang) akan dikonversi menjadi "avion" (bidang). Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.ElisionTokenFilter

Diskriminator untuk jenis turunan.

articles

string[]

Kumpulan artikel yang akan dihapus.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

ErrorAdditionalInfo

Info tambahan kesalahan manajemen sumber daya.

Nama Jenis Deskripsi
info

Info tambahan.

type

string

Jenis info tambahan.

ErrorDetail

Detail kesalahan.

Nama Jenis Deskripsi
additionalInfo

ErrorAdditionalInfo[]

Info tambahan kesalahan.

code

string

Kode kesalahan.

details

ErrorDetail[]

Rincian kesalahan.

message

string

Pesan kesalahan.

target

string

Sasaran kesalahan.

ErrorResponse

Respons kesalahan umum untuk semua API Azure Resource Manager untuk mengembalikan detail kesalahan untuk operasi yang gagal. (Ini juga mengikuti format respons kesalahan OData.).

Nama Jenis Deskripsi
error

ErrorDetail

Objek kesalahan.

ExhaustiveKnnAlgorithmConfiguration

Berisi opsi konfigurasi khusus untuk algoritma KNN lengkap yang digunakan selama kueri, yang akan melakukan pencarian brute-force di seluruh indeks vektor.

Nama Jenis Deskripsi
exhaustiveKnnParameters

ExhaustiveKnnParameters

Berisi parameter khusus untuk algoritma KNN lengkap.

kind string:

exhaustiveKnn

Jenis VectorSearchAlgorithmConfiguration.

name

string

Nama yang akan dikaitkan dengan konfigurasi khusus ini.

ExhaustiveKnnParameters

Berisi parameter khusus untuk algoritma KNN lengkap.

Nama Jenis Deskripsi
metric

VectorSearchAlgorithmMetric

Metrik kesamaan yang digunakan untuk perbandingan vektor.

FreshnessScoringFunction

Menentukan fungsi yang meningkatkan skor berdasarkan nilai bidang tanggal-waktu.

Nama Jenis Deskripsi
boost

number (double)

Pengali untuk skor mentah. Harus berupa angka positif yang tidak sama dengan 1,0.

fieldName

string

Nama bidang yang digunakan sebagai input ke fungsi penilaian.

freshness

FreshnessScoringParameters

Nilai parameter untuk fungsi penilaian kesegaran.

interpolation

ScoringFunctionInterpolation

Nilai yang menunjukkan bagaimana peningkatan akan diinterpolasi di seluruh skor dokumen; default ke "Linear".

type string:

freshness

Jenis ScoringFunction.

FreshnessScoringParameters

Menyediakan nilai parameter ke fungsi penilaian kesegaran.

Nama Jenis Deskripsi
boostingDuration

string (duration)

Periode kedaluwarsa setelah itu peningkatan akan berhenti untuk dokumen tertentu.

HnswAlgorithmConfiguration

Berisi opsi konfigurasi khusus untuk algoritma perkiraan tetangga terdekat HNSW yang digunakan selama pengindeksan dan kueri. Algoritma HNSW menawarkan trade-off yang dapat disetel antara kecepatan dan akurasi pencarian.

Nama Jenis Deskripsi
hnswParameters

HnswParameters

Berisi parameter khusus untuk algoritma HNSW.

kind string:

hnsw

Jenis VectorSearchAlgorithmConfiguration.

name

string

Nama yang akan dikaitkan dengan konfigurasi khusus ini.

HnswParameters

Berisi parameter khusus untuk algoritma HNSW.

Nama Jenis Nilai default Deskripsi
efConstruction

integer (int32)

minimum: 100
maximum: 1000
400

Ukuran daftar dinamis yang berisi tetangga terdekat, yang digunakan selama waktu indeks. Meningkatkan parameter ini dapat meningkatkan kualitas indeks, dengan mengorbankan peningkatan waktu pengindeksan. Pada titik tertentu, meningkatkan parameter ini menyebabkan pengembalian yang berkurang.

efSearch

integer (int32)

minimum: 100
maximum: 1000
500

Ukuran daftar dinamis yang berisi tetangga terdekat, yang digunakan selama waktu pencarian. Meningkatkan parameter ini dapat meningkatkan hasil pencarian, dengan mengorbankan pencarian yang lebih lambat. Pada titik tertentu, meningkatkan parameter ini menyebabkan pengembalian yang berkurang.

m

integer (int32)

minimum: 4
maximum: 10
4

Jumlah tautan dua arah yang dibuat untuk setiap elemen baru selama konstruksi. Meningkatkan nilai parameter ini dapat meningkatkan penarikan dan mengurangi waktu pengambilan untuk himpunan data dengan dimensi intrinsik tinggi dengan mengorbankan peningkatan konsumsi memori dan waktu pengindeksan yang lebih lama.

metric

VectorSearchAlgorithmMetric

Metrik kesamaan yang digunakan untuk perbandingan vektor.

KeepTokenFilter

Filter token yang hanya menyimpan token dengan teks yang terkandung dalam daftar kata tertentu. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.KeepTokenFilter

Diskriminator untuk jenis turunan.

keepWords

string[]

Daftar kata yang harus disimpan.

keepWordsCase

boolean

False

Nilai yang menunjukkan apakah akan menurunkan huruf besar/kecil semua kata terlebih dahulu. Nilai default adalah false.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

KeywordMarkerTokenFilter

Menandai istilah sebagai kata kunci. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.KeywordMarkerTokenFilter

Diskriminator untuk jenis turunan.

ignoreCase

boolean

False

Nilai yang menunjukkan apakah akan mengabaikan kasus. Jika true, semua kata dikonversi ke huruf kecil terlebih dahulu. Nilai default adalah false.

keywords

string[]

Daftar kata untuk ditandai sebagai kata kunci.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

KeywordTokenizer

Mengirimkan seluruh input sebagai token tunggal. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.KeywordTokenizer

Diskriminator untuk jenis turunan.

bufferSize

integer (int32)

256

Ukuran buffer baca dalam byte. Defaultnya adalah 256.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

KeywordTokenizerV2

Mengirimkan seluruh input sebagai token tunggal. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.KeywordTokenizerV2

Diskriminator untuk jenis turunan.

maxTokenLength

integer (int32)

maximum: 300
256

Panjang token maksimum. Defaultnya adalah 256. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

LengthTokenFilter

Menghapus kata-kata yang terlalu panjang atau terlalu pendek. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.LengthTokenFilter

Diskriminator untuk jenis turunan.

max

integer (int32)

maximum: 300
300

Panjang maksimum dalam karakter. Default dan maksimum adalah 300.

min

integer (int32)

maximum: 300
0

Panjang minimum dalam karakter. Nilai default adalah 0. Maksimum adalah 300. Harus kurang dari nilai maks.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

LexicalAnalyzerName

Menentukan nama semua penganalisis teks yang didukung oleh mesin pencari.

Nilai Deskripsi
ar.microsoft

Microsoft analyzer untuk bahasa Arab.

ar.lucene

Lucene analyzer untuk bahasa Arab.

hy.lucene

Penganalisis Lucene untuk Armenia.

bn.microsoft

Microsoft analyzer untuk Bangla.

eu.lucene

Penganalisis Lucene untuk Basque.

bg.microsoft

Microsoft analyzer untuk bahasa Bulgaria.

bg.lucene

Penganalisis Lucene untuk bahasa Bulgaria.

ca.microsoft

Microsoft analyzer untuk bahasa Catalan.

ca.lucene

Penganalisis Lucene untuk bahasa Catalan.

zh-Hans.microsoft

Microsoft analyzer untuk bahasa Cina (Sederhana).

zh-Hans.lucene

Penganalisis Lucene untuk Cina (Sederhana).

zh-Hant.microsoft

Microsoft analyzer untuk bahasa Cina (Tradisional).

zh-Hant.lucene

Lucene analyzer untuk Cina (Tradisional).

hr.microsoft

Microsoft analyzer untuk bahasa Kroasia.

cs.microsoft

Penganalisis Microsoft untuk Ceko.

cs.lucene

Penganalisis Lucene untuk Ceko.

da.microsoft

Microsoft analyzer untuk Denmark.

da.lucene

Penganalisis Lucene untuk Denmark.

nl.microsoft

Microsoft analyzer untuk bahasa Belanda.

nl.lucene

Lucene analyzer untuk bahasa Belanda.

en.microsoft

Microsoft analyzer untuk bahasa Inggris.

en.lucene

Penganalisis Lucene untuk bahasa Inggris.

et.microsoft

Microsoft analyzer untuk bahasa Estonia.

fi.microsoft

Microsoft analyzer untuk bahasa Finlandia.

fi.lucene

Penganalisis Lucene untuk bahasa Finlandia.

fr.microsoft

Microsoft analyzer untuk bahasa Prancis.

fr.lucene

Penganalisis Lucene untuk bahasa Prancis.

gl.lucene

Penganalisis Lucene untuk Galicia.

de.microsoft

Microsoft analyzer untuk bahasa Jerman.

de.lucene

Penganalisis Lucene untuk bahasa Jerman.

el.microsoft

Microsoft analyzer untuk bahasa Yunani.

el.lucene

Penganalisis Lucene untuk bahasa Yunani.

gu.microsoft

Microsoft analyzer untuk Gujarati.

he.microsoft

Microsoft analyzer untuk bahasa Ibrani.

hi.microsoft

Microsoft analyzer untuk bahasa Hindi.

hi.lucene

Penganalisis Lucene untuk bahasa Hindi.

hu.microsoft

Microsoft analyzer untuk bahasa Hongaria.

hu.lucene

Penganalisis Lucene untuk bahasa Hongaria.

is.microsoft

Microsoft analyzer untuk Islandia.

id.microsoft

Microsoft analyzer untuk bahasa Indonesia (Bahasa).

id.lucene

Lucene analyzer untuk bahasa Indonesia.

ga.lucene

Penganalisis Lucene untuk Irlandia.

it.microsoft

Microsoft analyzer untuk bahasa Italia.

it.lucene

Penganalisis Lucene untuk bahasa Italia.

ja.microsoft

Microsoft analyzer untuk bahasa Jepang.

ja.lucene

Penganalisis Lucene untuk bahasa Jepang.

kn.microsoft

Microsoft analyzer untuk Kannada.

ko.microsoft

Microsoft analyzer untuk bahasa Korea.

ko.lucene

Penganalisis Lucene untuk bahasa Korea.

lv.microsoft

Microsoft analyzer untuk bahasa Latvia.

lv.lucene

Penganalisis Lucene untuk bahasa Latvia.

lt.microsoft

Penganalisis Microsoft untuk bahasa Lituania.

ml.microsoft

Microsoft analyzer untuk Malayalam.

ms.microsoft

Microsoft analyzer untuk bahasa Melayu (Latin).

mr.microsoft

Microsoft analyzer untuk Marathi.

nb.microsoft

Microsoft analyzer untuk Norwegia (Bokmål).

no.lucene

Penganalisis Lucene untuk Norwegia.

fa.lucene

Penganalisis Lucene untuk Persia.

pl.microsoft

Microsoft analyzer untuk Polandia.

pl.lucene

Lucene analyzer untuk Polandia.

pt-BR.microsoft

Microsoft analyzer untuk Portugis (Brasil).

pt-BR.lucene

Penganalisis Lucene untuk Portugis (Brasil).

pt-PT.microsoft

Microsoft analyzer untuk Portugis (Portugal).

pt-PT.lucene

Penganalisis Lucene untuk Portugis (Portugal).

pa.microsoft

Microsoft analyzer untuk Punjabi.

ro.microsoft

Microsoft analyzer untuk Rumania.

ro.lucene

Penganalisis Lucene untuk Rumania.

ru.microsoft

Microsoft analyzer untuk bahasa Rusia.

ru.lucene

Penganalisis Lucene untuk Rusia.

sr-cyrillic.microsoft

Microsoft analyzer untuk bahasa Serbia (Cyrillic).

sr-latin.microsoft

Microsoft analyzer untuk bahasa Serbia (Latin).

sk.microsoft

Microsoft analyzer untuk bahasa Slovakia.

sl.microsoft

Microsoft analyzer untuk bahasa Slovenia.

es.microsoft

Microsoft analyzer untuk bahasa Spanyol.

es.lucene

Lucene analyzer untuk bahasa Spanyol.

sv.microsoft

Microsoft analyzer untuk bahasa Swedia.

sv.lucene

Penganalisis Lucene untuk bahasa Swedia.

ta.microsoft

Microsoft analyzer untuk Tamil.

te.microsoft

Penganalisis Microsoft untuk Telugu.

th.microsoft

Microsoft analyzer untuk Thailand.

th.lucene

Penganalisis Lucene untuk Thailand.

tr.microsoft

Microsoft analyzer untuk bahasa Turki.

tr.lucene

Penganalisis Lucene untuk Turki.

uk.microsoft

Penganalisis Microsoft untuk bahasa Ukraina.

ur.microsoft

Microsoft analyzer untuk bahasa Urdu.

vi.microsoft

Penganalisis Microsoft untuk bahasa Vietnam.

standard.lucene

Penganalisis Lucene standar.

standardasciifolding.lucene

Alat analisis Lucene Lipat ASCII Standar. Lihat https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers

keyword

Perlakukan seluruh konten bidang sebagai token tunggal. Ini berguna untuk data seperti kode pos, id, dan beberapa nama produk. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html

pattern

Secara fleksibel memisahkan teks menjadi istilah melalui pola ekspresi reguler. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html

simple

Membagi teks di antara karakter non-huruf dan mengubah semuanya menjadi huruf kecil. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html

stop

Membagi teks pada non-huruf; Menerapkan filter token huruf kecil dan stopword. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html

whitespace

Penganalisis yang menggunakan tokenizer spasi kosong. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html

LexicalNormalizerName

Menentukan nama semua normalisasi teks yang didukung oleh mesin pencari.

Nilai Deskripsi
asciifolding

Mengonversi karakter Unicode alfabet, numerik, dan simbolis yang tidak berada dalam 127 karakter ASCII pertama (blok Unicode "Latin Dasar" ke dalam setara ASCII mereka, jika setara tersebut ada. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

elision

Menghilangkan elision. Misalnya, "l'avion" (bidang) akan dikonversi menjadi "avion" (bidang). Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

lowercase

Menormalkan teks token menjadi huruf kecil. Lihat https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

standard

Normalizer standar, yang terdiri dari huruf kecil dan asciifolding. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

uppercase

Menormalkan teks token ke huruf besar. Lihat https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

LexicalTokenizerName

Menentukan nama semua tokenizer yang didukung oleh mesin pencari.

Nilai Deskripsi
classic

Tokenizer berbasis tata bahasa yang cocok untuk memproses sebagian besar dokumen berbahasa Eropa. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicTokenizer.html

edgeNGram

Tokenisasi input dari tepi ke dalam n-gram dari ukuran yang diberikan. Lihat https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenizer.html

keyword_v2

Mengirimkan seluruh input sebagai token tunggal. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordTokenizer.html

letter

Membagi teks berdasarkan karakter non-huruf. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LetterTokenizer.html

lowercase

Membagi teks di antara karakter non-huruf dan mengubah semuanya menjadi huruf kecil. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseTokenizer.html

microsoft_language_tokenizer

Membagi teks menggunakan aturan spesifik bahasa.

microsoft_language_stemming_tokenizer

Membagi teks menggunakan aturan khusus bahasa dan mengurangi kata-kata ke bentuk dasarnya.

nGram

Tokenisasi input ke dalam n-gram dari ukuran yang diberikan. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenizer.html

path_hierarchy_v2

Tokenizer untuk hierarki berupa jalur. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/path/PathHierarchyTokenizer.html

pattern

Tokenizer yang menggunakan pencocokan pola regex untuk membangun token yang berbeda. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/pattern/PatternTokenizer.html

standard_v2

Penganalisis Lucene Standar; Terdiri dari tokenizer standar, filter huruf kecil, dan filter berhenti. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/StandardTokenizer.html

uax_url_email

Tokenisasi url dan email sebagai satu token. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/UAX29URLEmailTokenizer.html

whitespace

Membagi teks di spasi kosong. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceTokenizer.html

LimitTokenFilter

Membatasi jumlah token saat mengindeks. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.LimitTokenFilter

Diskriminator untuk jenis turunan.

consumeAllTokens

boolean

False

Nilai yang menunjukkan apakah semua token dari input harus digunakan bahkan jika maxTokenCount tercapai. Nilai default adalah false.

maxTokenCount

integer (int32)

1

Jumlah maksimum token yang akan dihasilkan. Nilai baku adalah 1.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

LuceneStandardAnalyzer

Penganalisis Apache Lucene Standar; Terdiri dari tokenizer standar, filter huruf kecil, dan filter berhenti.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StandardAnalyzer

Diskriminator untuk jenis turunan.

maxTokenLength

integer (int32)

maximum: 300
255

Panjang token maksimum. Defaultnya adalah 255. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter.

name

string

Nama penganalisis. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

stopwords

string[]

Daftar kata henti.

LuceneStandardTokenizer

Hentian teks mengikuti aturan Segmentasi Teks Unicode. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StandardTokenizer

Diskriminator untuk jenis turunan.

maxTokenLength

integer (int32)

255

Panjang token maksimum. Defaultnya adalah 255. Token yang lebih panjang dari panjang maksimum dipecah.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

LuceneStandardTokenizerV2

Hentian teks mengikuti aturan Segmentasi Teks Unicode. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StandardTokenizerV2

Diskriminator untuk jenis turunan.

maxTokenLength

integer (int32)

maximum: 300
255

Panjang token maksimum. Defaultnya adalah 255. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

MagnitudeScoringFunction

Menentukan fungsi yang meningkatkan skor berdasarkan besarnya bidang numerik.

Nama Jenis Deskripsi
boost

number (double)

Pengali untuk skor mentah. Harus berupa angka positif yang tidak sama dengan 1,0.

fieldName

string

Nama bidang yang digunakan sebagai input ke fungsi penilaian.

interpolation

ScoringFunctionInterpolation

Nilai yang menunjukkan bagaimana peningkatan akan diinterpolasi di seluruh skor dokumen; default ke "Linear".

magnitude

MagnitudeScoringParameters

Nilai parameter untuk fungsi penilaian besar.

type string:

magnitude

Jenis ScoringFunction.

MagnitudeScoringParameters

Menyediakan nilai parameter ke fungsi penilaian besaran.

Nama Jenis Deskripsi
boostingRangeEnd

number (double)

Nilai bidang di mana peningkatan berakhir.

boostingRangeStart

number (double)

Nilai bidang di mana peningkatan dimulai.

constantBoostBeyondRange

boolean

Nilai yang menunjukkan apakah akan menerapkan peningkatan konstan untuk nilai bidang di luar nilai akhir rentang; default adalah false.

MappingCharFilter

Filter karakter yang menerapkan pemetaan yang ditentukan dengan opsi pemetaan. Pencocokan bersifat rakus (pola terpanjang yang cocok di titik tertentu menang). Penggantian diperbolehkan menggunakan string kosong. Filter karakter ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.MappingCharFilter

Diskriminator untuk jenis turunan.

mappings

string[]

Daftar pemetaan format berikut: "a=>b" (semua kemunculan karakter "a" akan diganti dengan karakter "b").

name

string

Nama filter karakter. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

MicrosoftLanguageStemmingTokenizer

Membagi teks menggunakan aturan khusus bahasa dan mengurangi kata-kata ke bentuk dasarnya.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.MicrosoftLanguageStemmingTokenizer

Diskriminator untuk jenis turunan.

isSearchTokenizer

boolean

False

Nilai yang menunjukkan bagaimana tokenizer digunakan. Atur ke true jika digunakan sebagai tokenizer pencarian, atur ke false jika digunakan sebagai tokenizer pengindeksan. Nilai default adalah false.

language

MicrosoftStemmingTokenizerLanguage

Bahasa yang digunakan. Defaultnya adalah bahasa Inggris.

maxTokenLength

integer (int32)

maximum: 300
255

Panjang token maksimum. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter. Token yang lebih panjang dari 300 karakter pertama kali dibagi menjadi token dengan panjang 300 dan kemudian masing-masing token tersebut dibagi berdasarkan panjang token maksimum yang ditetapkan. Defaultnya adalah 255.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

MicrosoftLanguageTokenizer

Membagi teks menggunakan aturan spesifik bahasa.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.MicrosoftLanguageTokenizer

Diskriminator untuk jenis turunan.

isSearchTokenizer

boolean

False

Nilai yang menunjukkan bagaimana tokenizer digunakan. Atur ke true jika digunakan sebagai tokenizer pencarian, atur ke false jika digunakan sebagai tokenizer pengindeksan. Nilai default adalah false.

language

MicrosoftTokenizerLanguage

Bahasa yang digunakan. Defaultnya adalah bahasa Inggris.

maxTokenLength

integer (int32)

maximum: 300
255

Panjang token maksimum. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter. Token yang lebih panjang dari 300 karakter pertama kali dibagi menjadi token dengan panjang 300 dan kemudian masing-masing token tersebut dibagi berdasarkan panjang token maksimum yang ditetapkan. Defaultnya adalah 255.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

MicrosoftStemmingTokenizerLanguage

Mencantumkan bahasa yang didukung oleh tokenizer stem bahasa Microsoft.

Nilai Deskripsi
arabic

Memilih tokenizer steming Microsoft untuk bahasa Arab.

bangla

Memilih tokenizer steming Microsoft untuk Bangla.

bulgarian

Memilih tokenizer stem Microsoft untuk bahasa Bulgaria.

catalan

Memilih tokenizer stem Microsoft untuk Catalan.

croatian

Memilih tokenizer stem Microsoft untuk bahasa Kroasia.

czech

Memilih tokenizer stem Microsoft untuk bahasa Ceko.

danish

Memilih tokenizer stem Microsoft untuk bahasa Denmark.

dutch

Memilih tokenizer steming Microsoft untuk bahasa Belanda.

english

Memilih tokenizer steming Microsoft untuk bahasa Inggris.

estonian

Memilih tokenizer stem Microsoft untuk bahasa Estonia.

finnish

Memilih tokenizer stem Microsoft untuk bahasa Finlandia.

french

Memilih tokenizer steming Microsoft untuk bahasa Prancis.

german

Memilih tokenizer steming Microsoft untuk bahasa Jerman.

greek

Memilih tokenizer stem Microsoft untuk bahasa Yunani.

gujarati

Memilih tokenizer steming Microsoft untuk Gujarati.

hebrew

Memilih tokenizer stem Microsoft untuk bahasa Ibrani.

hindi

Memilih tokenizer stem Microsoft untuk bahasa Hindi.

hungarian

Memilih tokenizer steming Microsoft untuk bahasa Hongaria.

icelandic

Memilih tokenizer steming Microsoft untuk bahasa Islandia.

indonesian

Memilih tokenizer stem Microsoft untuk bahasa Indonesia.

italian

Memilih tokenizer stem Microsoft untuk bahasa Italia.

kannada

Memilih tokenizer stem Microsoft untuk Kannada.

latvian

Memilih tokenizer stem Microsoft untuk bahasa Latvia.

lithuanian

Memilih tokenizer stem Microsoft untuk bahasa Lituania.

malay

Memilih tokenizer stem Microsoft untuk bahasa Melayu.

malayalam

Memilih tokenizer stem Microsoft untuk Malayalam.

marathi

Memilih tokenizer stem Microsoft untuk Marathi.

norwegianBokmaal

Memilih tokenizer stem Microsoft untuk Norwegian (Bokmål).

polish

Memilih tokenizer steming Microsoft untuk bahasa Polandia.

portuguese

Memilih tokenizer steming Microsoft untuk bahasa Portugis.

portugueseBrazilian

Memilih tokenizer stem Microsoft untuk Portugis (Brasil).

punjabi

Memilih tokenizer steming Microsoft untuk Punjabi.

romanian

Memilih tokenizer stem Microsoft untuk bahasa Rumania.

russian

Memilih tokenizer steming Microsoft untuk bahasa Rusia.

serbianCyrillic

Memilih tokenizer stem Microsoft untuk bahasa Serbia (Cyrillic).

serbianLatin

Memilih tokenizer steming Microsoft untuk bahasa Serbia (Latin).

slovak

Memilih tokenizer stem Microsoft untuk bahasa Slovakia.

slovenian

Memilih tokenizer stem Microsoft untuk bahasa Slovenia.

spanish

Memilih tokenizer steming Microsoft untuk bahasa Spanyol.

swedish

Memilih tokenizer stem Microsoft untuk bahasa Swedia.

tamil

Memilih tokenizer steming Microsoft untuk bahasa Tamil.

telugu

Memilih tokenizer stem Microsoft untuk Telugu.

turkish

Memilih tokenizer stem Microsoft untuk bahasa Turki.

ukrainian

Memilih tokenizer stem Microsoft untuk bahasa Ukraina.

urdu

Memilih tokenizer stem Microsoft untuk bahasa Urdu.

MicrosoftTokenizerLanguage

Mencantumkan bahasa yang didukung oleh tokenizer bahasa Microsoft.

Nilai Deskripsi
bangla

Memilih tokenizer Microsoft untuk Bangla.

bulgarian

Memilih tokenizer Microsoft untuk bahasa Bulgaria.

catalan

Memilih tokenizer Microsoft untuk Catalan.

chineseSimplified

Memilih tokenizer Microsoft untuk bahasa Cina (Sederhana).

chineseTraditional

Memilih tokenizer Microsoft untuk bahasa Cina (Tradisional).

croatian

Memilih tokenizer Microsoft untuk bahasa Kroasia.

czech

Memilih tokenizer Microsoft untuk bahasa Ceko.

danish

Memilih tokenizer Microsoft untuk Denmark.

dutch

Memilih tokenizer Microsoft untuk bahasa Belanda.

english

Memilih tokenizer Microsoft untuk bahasa Inggris.

french

Memilih tokenizer Microsoft untuk bahasa Prancis.

german

Memilih tokenizer Microsoft untuk bahasa Jerman.

greek

Memilih tokenizer Microsoft untuk bahasa Yunani.

gujarati

Memilih tokenizer Microsoft untuk Gujarati.

hindi

Memilih tokenizer Microsoft untuk bahasa Hindi.

icelandic

Memilih tokenizer Microsoft untuk bahasa Islandia.

indonesian

Memilih tokenizer Microsoft untuk bahasa Indonesia.

italian

Memilih tokenizer Microsoft untuk bahasa Italia.

japanese

Memilih tokenizer Microsoft untuk bahasa Jepang.

kannada

Memilih tokenizer Microsoft untuk Kannada.

korean

Memilih tokenizer Microsoft untuk bahasa Korea.

malay

Memilih tokenizer Microsoft untuk bahasa Melayu.

malayalam

Memilih tokenizer Microsoft untuk Malayalam.

marathi

Memilih tokenizer Microsoft untuk Marathi.

norwegianBokmaal

Memilih tokenizer Microsoft untuk bahasa Norwegia (Bokmål).

polish

Memilih tokenizer Microsoft untuk bahasa Polandia.

portuguese

Memilih tokenizer Microsoft untuk bahasa Portugis.

portugueseBrazilian

Memilih tokenizer Microsoft untuk bahasa Portugis (Brasil).

punjabi

Memilih tokenizer Microsoft untuk Punjabi.

romanian

Memilih tokenizer Microsoft untuk bahasa Rumania.

russian

Memilih tokenizer Microsoft untuk bahasa Rusia.

serbianCyrillic

Memilih tokenizer Microsoft untuk bahasa Serbia (Cyrillic).

serbianLatin

Memilih tokenizer Microsoft untuk bahasa Serbia (Latin).

slovenian

Memilih tokenizer Microsoft untuk bahasa Slovenia.

spanish

Memilih tokenizer Microsoft untuk bahasa Spanyol.

swedish

Memilih tokenizer Microsoft untuk bahasa Swedia.

tamil

Memilih tokenizer Microsoft untuk bahasa Tamil.

telugu

Memilih tokenizer Microsoft untuk Telugu.

thai

Memilih tokenizer Microsoft untuk Thailand.

ukrainian

Memilih tokenizer Microsoft untuk bahasa Ukraina.

urdu

Memilih tokenizer Microsoft untuk bahasa Urdu.

vietnamese

Memilih tokenizer Microsoft untuk bahasa Vietnam.

NGramTokenFilter

Menghasilkan n-gram dari ukuran yang diberikan. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.NGramTokenFilter

Diskriminator untuk jenis turunan.

maxGram

integer (int32)

2

Panjang n-gram maksimum. Nilai bawaan adalah 2.

minGram

integer (int32)

1

Panjang n-gram minimum. Nilai baku adalah 1. Harus kurang dari nilai maxGram.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

NGramTokenFilterV2

Menghasilkan n-gram dari ukuran yang diberikan. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.NGramTokenFilterV2

Diskriminator untuk jenis turunan.

maxGram

integer (int32)

maximum: 300
2

Panjang n-gram maksimum. Nilai bawaan adalah 2. Maksimum adalah 300.

minGram

integer (int32)

maximum: 300
1

Panjang n-gram minimum. Nilai baku adalah 1. Maksimum adalah 300. Harus kurang dari nilai maxGram.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

NGramTokenizer

Tokenisasi input ke dalam n-gram dari ukuran yang diberikan. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.NGramTokenizer

Diskriminator untuk jenis turunan.

maxGram

integer (int32)

maximum: 300
2

Panjang n-gram maksimum. Nilai bawaan adalah 2. Maksimum adalah 300.

minGram

integer (int32)

maximum: 300
1

Panjang n-gram minimum. Nilai baku adalah 1. Maksimum adalah 300. Harus kurang dari nilai maxGram.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

tokenChars

TokenCharacterKind[]

Kelas karakter untuk disimpan dalam token.

PathHierarchyTokenizerV2

Tokenizer untuk hierarki berupa jalur. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PathHierarchyTokenizerV2

Diskriminator untuk jenis turunan.

delimiter

string

maxLength: 1
/

Karakter pemisah yang akan digunakan. Defaultnya adalah "/".

maxTokenLength

integer (int32)

maximum: 300
300

Panjang token maksimum. Default dan maksimum adalah 300.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

replacement

string

maxLength: 1
/

Nilai yang, jika diatur, menggantikan karakter pemisah. Defaultnya adalah "/".

reverse

boolean

False

Nilai yang menunjukkan apakah akan menghasilkan token dalam urutan terbalik. Nilai default adalah false.

skip

integer (int32)

0

Jumlah token awal yang akan dilewati. Nilai default adalah 0.

PatternAnalyzer

Secara fleksibel memisahkan teks menjadi istilah melalui pola ekspresi reguler. Penganalisis ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PatternAnalyzer

Diskriminator untuk jenis turunan.

flags

string

Bendera ekspresi reguler, ditentukan sebagai string nilai RegexFlags yang dipisahkan '|'.

lowercase

boolean

True

Nilai yang menunjukkan apakah istilah harus huruf kecil. Nilai default adalah benar.

name

string

Nama penganalisis. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

pattern

string

\W+

Pola ekspresi reguler untuk mencocokkan pemisah token. Default adalah ekspresi yang cocok dengan satu atau beberapa karakter non-kata.

stopwords

string[]

Daftar kata henti.

PatternCaptureTokenFilter

Menggunakan regex Java untuk memancarkan beberapa token - satu untuk setiap grup pengambilan dalam satu atau beberapa pola. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PatternCaptureTokenFilter

Diskriminator untuk jenis turunan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

patterns

string[]

Daftar pola yang cocok dengan setiap token.

preserveOriginal

boolean

True

Nilai yang menunjukkan apakah akan mengembalikan token asli meskipun salah satu pola cocok. Nilai default adalah benar.

PatternReplaceCharFilter

Filter karakter yang menggantikan karakter dalam string input. Menggunakan ekspresi reguler untuk mengidentifikasi urutan karakter untuk dipertahankan dan pola pengganti untuk mengidentifikasi karakter untuk diganti. Misalnya, mengingat teks input "aa bb aa bb", pola "(aa)\s+(bb)", dan penggantian "$1#$2", hasilnya adalah "aa#bb aa#bb". Filter karakter ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PatternReplaceCharFilter

Diskriminator untuk jenis turunan.

name

string

Nama filter karakter. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

pattern

string

Pola ekspresi reguler.

replacement

string

Teks pengganti.

PatternReplaceTokenFilter

Filter karakter yang menggantikan karakter dalam string input. Menggunakan ekspresi reguler untuk mengidentifikasi urutan karakter untuk dipertahankan dan pola pengganti untuk mengidentifikasi karakter untuk diganti. Misalnya, mengingat teks input "aa bb aa bb", pola "(aa)\s+(bb)", dan penggantian "$1#$2", hasilnya adalah "aa#bb aa#bb". Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PatternReplaceTokenFilter

Diskriminator untuk jenis turunan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

pattern

string

Pola ekspresi reguler.

replacement

string

Teks pengganti.

PatternTokenizer

Tokenizer yang menggunakan pencocokan pola regex untuk membangun token yang berbeda. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PatternTokenizer

Diskriminator untuk jenis turunan.

flags

string

Bendera ekspresi reguler, ditentukan sebagai string nilai RegexFlags yang dipisahkan '|'.

group

integer (int32)

-1

Ordinal berbasis nol dari grup yang cocok dalam pola ekspresi reguler untuk diekstrak ke dalam token. Gunakan -1 jika Anda ingin menggunakan seluruh pola untuk membagi input menjadi token, terlepas dari grup yang cocok. Defaultnya adalah -1.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

pattern

string

\W+

Pola ekspresi reguler untuk mencocokkan pemisah token. Default adalah ekspresi yang cocok dengan satu atau beberapa karakter non-kata.

PhoneticEncoder

Mengidentifikasi jenis encoder fonetik yang akan digunakan dengan PhoneticTokenFilter.

Nilai Deskripsi
metaphone

Mengkodekan token ke dalam nilai Metaphone.

doubleMetaphone

Mengkodekan token menjadi nilai metafon ganda.

soundex

Mengkodekan token ke dalam nilai Soundex.

refinedSoundex

Mengkodekan token ke dalam nilai Soundex Refined.

caverphone1

Mengkodekan token ke dalam nilai Caverphone 1.0.

caverphone2

Mengkodekan token ke dalam nilai Caverphone 2.0.

cologne

Mengkodekan token menjadi nilai Fonetik Cologne.

nysiis

Mengkodekan token ke dalam nilai NYSIIS.

koelnerPhonetik

Mengkodekan token menggunakan algoritma Kölner Phonetik.

haasePhonetik

Mengkodekan token menggunakan penyempurnaan Haase dari algoritma Kölner Phonetik.

beiderMorse

Mengkodekan token menjadi nilai Beider-Morse.

PhoneticTokenFilter

Membuat token untuk kecocokan fonetik. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.PhoneticTokenFilter

Diskriminator untuk jenis turunan.

encoder

PhoneticEncoder

metaphone

Encoder fonetik yang akan digunakan. Defaultnya adalah "metaphone".

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

replace

boolean

True

Nilai yang menunjukkan apakah token yang dikodekan harus menggantikan token asli. Jika false, token yang dikodekan ditambahkan sebagai sinonim. Nilai default adalah benar.

RankingOrder

Mewakili skor untuk digunakan untuk urutan pengurutan dokumen.

Nilai Deskripsi
BoostedRerankerScore

Mengatur urutan pengurutan sebagai BoostedRerankerScore

RerankerScore

Mengatur urutan pengurutan sebagai ReRankerScore

RescoringOptions

Berisi opsi untuk memulihkan.

Nama Jenis Nilai default Deskripsi
defaultOversampling

number (double)

Faktor oversampling default. Oversampling mengambil serangkaian dokumen potensial yang lebih besar untuk mengimbangi kehilangan resolusi akibat kuantisasi. Ini meningkatkan serangkaian hasil yang akan dinilai ulang pada vektor presisi penuh. Nilai minimum adalah 1, yang berarti tidak ada oversampling (1x). Parameter ini hanya dapat diatur jika 'enableRescoring' benar. Nilai yang lebih tinggi meningkatkan pengenalan dengan mengorbankan latensi.

enableRescoring

boolean

True

Jika diatur ke true, setelah pencarian awal pada vektor terkompresi, skor kesamaan dihitung ulang menggunakan vektor presisi penuh. Ini akan meningkatkan pengenalan dengan mengorbankan latensi.

rescoreStorageMethod enum:
  • discardOriginals
  • preserveOriginals
preserveOriginals

Mengontrol metode penyimpanan untuk vektor asli. Pengaturan ini tidak dapat diubah.

ScalarQuantizationCompression

Berisi opsi konfigurasi khusus untuk metode kompresi kuantisasi skalar yang digunakan selama pengindeksan dan kueri.

Nama Jenis Deskripsi
kind string:

scalarQuantization

Jenis VectorSearchCompression.

name

string

Nama yang akan dikaitkan dengan konfigurasi khusus ini.

rescoringOptions

RescoringOptions

Berisi opsi untuk memulihkan.

scalarQuantizationParameters

ScalarQuantizationParameters

Berisi parameter khusus untuk Kuantisasi Skalar.

truncationDimension

integer (int32)

Jumlah dimensi untuk memotong vektor. Memotong vektor mengurangi ukuran vektor dan jumlah data yang perlu ditransfer selama pencarian. Ini dapat menghemat biaya penyimpanan dan meningkatkan kinerja pencarian dengan mengorbankan penarikan. Ini hanya boleh digunakan untuk penyematan yang dilatih dengan Matryoshka Representation Learning (MRL) seperti OpenAI text-embedding-3-large (kecil). Nilai defaultnya adalah null, yang berarti tidak ada pemotongan.

ScalarQuantizationParameters

Berisi parameter khusus untuk Kuantisasi Skalar.

Nama Jenis Deskripsi
quantizedDataType

VectorSearchCompressionTarget

Jenis data terkuantisasi dari nilai vektor terkompresi.

ScoringFunctionAggregation

Menentukan fungsi agregasi yang digunakan untuk menggabungkan hasil semua fungsi penilaian dalam profil penilaian.

Nilai Deskripsi
sum

Tingkatkan skor dengan jumlah semua hasil fungsi penilaian.

average

Tingkatkan skor dengan rata-rata semua hasil fungsi penilaian.

minimum

Tingkatkan skor minimal dari semua hasil fungsi penilaian.

maximum

Tingkatkan skor dengan maksimum dari semua hasil fungsi penilaian.

firstMatching

Tingkatkan skor menggunakan fungsi penilaian pertama yang berlaku di profil penilaian.

product

Tingkatkan skor berdasarkan produk dari semua hasil fungsi penilaian.

ScoringFunctionInterpolation

Menentukan fungsi yang digunakan untuk menginterpolasi peningkatan skor di berbagai dokumen.

Nilai Deskripsi
linear

Meningkatkan skor dengan jumlah yang menurun secara linier. Ini adalah interpolasi default untuk fungsi penilaian.

constant

Meningkatkan skor dengan faktor konstan.

quadratic

Meningkatkan skor dengan jumlah yang menurun secara kuadrat. Peningkatan berkurang perlahan untuk skor yang lebih tinggi, dan lebih cepat saat skor menurun. Opsi interpolasi ini tidak diizinkan dalam fungsi penilaian tag.

logarithmic

Meningkatkan skor dengan jumlah yang menurun secara logaritma. Peningkatan berkurang dengan cepat untuk skor yang lebih tinggi, dan lebih lambat saat skor menurun. Opsi interpolasi ini tidak diizinkan dalam fungsi penilaian tag.

ScoringProfile

Menentukan parameter untuk indeks pencarian yang memengaruhi penilaian dalam kueri pencarian.

Nama Jenis Deskripsi
functionAggregation

ScoringFunctionAggregation

Nilai yang menunjukkan bagaimana hasil fungsi penilaian individu harus digabungkan. Default ke "Jumlah". Diabaikan jika tidak ada fungsi penilaian.

functions ScoringFunction[]:

Pengumpulan fungsi yang mempengaruhi penilaian dokumen.

name

string

Nama profil penilaian.

text

TextWeights

Parameter yang meningkatkan penilaian berdasarkan kecocokan teks di bidang indeks tertentu.

SearchField

Mewakili bidang dalam definisi indeks, yang menjelaskan nama, jenis data, dan perilaku pencarian bidang.

Nama Jenis Deskripsi
analyzer

LexicalAnalyzerName

Nama penganalisis yang digunakan untuk bidang . Opsi ini hanya dapat digunakan dengan bidang yang dapat dicari dan tidak dapat diatur bersama dengan searchAnalyzer atau indexAnalyzer. Setelah penganalisis dipilih, penganalisis tidak dapat diubah untuk bidang . Harus null untuk bidang kompleks.

dimensions

integer (int32)

minimum: 2
maximum: 4096

Dimensi bidang vektor.

facetable

boolean

Nilai yang menunjukkan apakah akan mengaktifkan bidang yang akan direferensikan dalam kueri faset. Biasanya digunakan dalam presentasi hasil pencarian yang mencakup jumlah hit berdasarkan kategori (misalnya, mencari kamera digital dan melihat jumlah hit berdasarkan merek, megapiksel, harga, dan sebagainya). Properti ini harus null untuk bidang kompleks. Bidang tipe Edm.GeographyPoint atau Collection(Edm.GeographyPoint) tidak dapat difaset. Default berlaku untuk semua bidang sederhana lainnya.

fields

SearchField[]

Daftar sub-bidang jika ini adalah bidang jenis Edm.ComplexType atau Collection(Edm.ComplexType). Harus null atau kosong untuk bidang sederhana.

filterable

boolean

Nilai yang menunjukkan apakah akan mengaktifkan bidang yang akan direferensikan dalam kueri $filter. dapat difilter berbeda dari yang dapat dicari dalam bagaimana string ditangani. Bidang tipe Edm.String atau Collection(Edm.String) yang dapat difilter tidak mengalami pemecahan kata, sehingga perbandingan hanya untuk kecocokan yang tepat. Misalnya, jika Anda mengatur bidang f seperti itu ke "hari cerah", $filter=f eq 'cerah' tidak akan menemukan kecocokan, tetapi $filter=f eq 'hari cerah' akan. Properti ini harus null untuk bidang kompleks. Default adalah true untuk bidang sederhana dan null untuk bidang kompleks.

indexAnalyzer

LexicalAnalyzerName

Nama penganalisis yang digunakan pada waktu pengindeksan untuk bidang . Opsi ini hanya dapat digunakan dengan bidang yang dapat dicari. Ini harus diatur bersama dengan searchAnalyzer dan tidak dapat diatur bersama dengan opsi penganalisis. Properti ini tidak dapat diatur ke nama penganalisis bahasa; gunakan properti penganalisis sebagai gantinya jika Anda memerlukan penganalisis bahasa. Setelah penganalisis dipilih, penganalisis tidak dapat diubah untuk bidang . Harus null untuk bidang kompleks.

key

boolean

Nilai yang menunjukkan apakah bidang secara unik mengidentifikasi dokumen dalam indeks. Tepat satu bidang tingkat atas di setiap indeks harus dipilih sebagai bidang kunci dan harus berjenis Edm.String. Bidang kunci dapat digunakan untuk mencari dokumen secara langsung dan memperbarui atau menghapus dokumen tertentu. Default adalah false untuk bidang sederhana dan null untuk bidang kompleks.

name

string

Nama bidang, yang harus unik dalam kumpulan bidang indeks atau bidang induk.

normalizer

LexicalNormalizerName

Nama normalizer yang akan digunakan untuk lapangan. Opsi ini hanya dapat digunakan dengan bidang dengan diaktifkan yang dapat difilter, dapat diurutkan, atau dapat disesuaikan. Setelah normalizer dipilih, itu tidak dapat diubah untuk bidang. Harus null untuk bidang kompleks.

retrievable

boolean

Nilai yang menunjukkan apakah bidang dapat dikembalikan dalam hasil pencarian. Anda dapat menonaktifkan opsi ini jika Anda ingin menggunakan bidang (misalnya, margin) sebagai mekanisme filter, pengurutan, atau penilaian tetapi tidak ingin bidang terlihat oleh pengguna akhir. Properti ini harus benar untuk bidang kunci, dan harus null untuk bidang kompleks. Properti ini dapat diubah pada bidang yang ada. Mengaktifkan properti ini tidak menyebabkan peningkatan persyaratan penyimpanan indeks. Default adalah true untuk bidang sederhana, false untuk bidang vektor, dan null untuk bidang kompleks.

searchAnalyzer

LexicalAnalyzerName

Nama penganalisis yang digunakan pada waktu pencarian untuk bidang . Opsi ini hanya dapat digunakan dengan bidang yang dapat dicari. Ini harus diatur bersama dengan indexAnalyzer dan tidak dapat diatur bersama dengan opsi penganalisis. Properti ini tidak dapat diatur ke nama penganalisis bahasa; gunakan properti penganalisis sebagai gantinya jika Anda memerlukan penganalisis bahasa. Penganalisis ini dapat diperbarui pada bidang yang ada. Harus null untuk bidang kompleks.

searchable

boolean

Nilai yang menunjukkan apakah bidang dapat dicari teks lengkap. Ini berarti ia akan menjalani analisis seperti pemecahan kata selama pengindeksan. Jika Anda mengatur bidang yang dapat dicari ke nilai seperti "hari cerah", secara internal akan dibagi menjadi token individu "cerah" dan "hari". Ini memungkinkan pencarian teks lengkap untuk istilah-istilah ini. Bidang tipe Edm.String atau Collection(Edm.String) dapat dicari secara default. Properti ini harus false untuk bidang sederhana dari tipe data non-string lainnya, dan harus null untuk bidang kompleks. Catatan: bidang yang dapat dicari menggunakan ruang ekstra dalam indeks Anda untuk mengakomodasi versi token tambahan dari nilai bidang untuk pencarian teks lengkap. Jika Anda ingin menghemat ruang dalam indeks Dan Anda tidak memerlukan bidang untuk disertakan dalam pencarian, atur dapat dicari ke false.

sortable

boolean

Nilai yang menunjukkan apakah akan mengaktifkan bidang yang akan direferensikan dalam ekspresi $orderby. Secara default, mesin pencari mengurutkan hasil menurut skor, tetapi dalam banyak pengalaman pengguna akan ingin mengurutkan menurut bidang dalam dokumen. Bidang sederhana hanya dapat diurutkan jika bernilai tunggal (memiliki nilai tunggal dalam cakupan dokumen induk). Bidang koleksi sederhana tidak dapat diurutkan, karena bernilai multinilai. Sub-bidang sederhana dari koleksi kompleks juga multinilai, dan karenanya tidak dapat diurutkan. Ini berlaku baik untuk bidang induk langsung maupun bidang leluhur yang merupakan kumpulan kompleks. Bidang kompleks tidak dapat diurutkan dan properti yang dapat diurutkan harus null untuk bidang tersebut. Default untuk dapat diurutkan adalah true untuk bidang sederhana bernilai tunggal, false untuk bidang sederhana multi-nilai, dan null untuk bidang kompleks.

stored

boolean

Nilai yang tidak dapat diubah yang menunjukkan apakah bidang akan disimpan secara terpisah pada disk yang akan dikembalikan dalam hasil pencarian. Anda dapat menonaktifkan opsi ini jika Anda tidak berencana mengembalikan konten bidang dalam respons pencarian untuk disimpan di overhead penyimpanan. Ini hanya dapat diatur selama pembuatan indeks dan hanya untuk bidang vektor. Properti ini tidak dapat diubah untuk bidang yang ada atau diatur sebagai false untuk bidang baru. Jika properti ini diatur sebagai false, properti 'retrievable' juga harus diatur ke false. Properti ini harus benar atau tidak diatur untuk bidang kunci, untuk bidang baru, dan untuk bidang non-vektor, dan harus null untuk bidang kompleks. Menonaktifkan properti ini akan mengurangi persyaratan penyimpanan indeks. Defaultnya adalah true untuk bidang vektor.

synonymMaps

string[]

Daftar nama peta sinonim untuk dikaitkan dengan bidang ini. Opsi ini hanya dapat digunakan dengan bidang yang dapat dicari. Saat ini hanya satu peta sinonim per bidang yang didukung. Menetapkan peta sinonim ke suatu bidang memastikan bahwa istilah kueri yang menargetkan bidang tersebut diperluas selama waktu kueri dengan menggunakan aturan yang terdapat dalam peta sinonim. Atribut ini dapat diubah pada bidang yang ada. Harus null atau koleksi kosong untuk bidang kompleks.

type

SearchFieldDataType

Jenis data bidang.

vectorEncoding

VectorEncodingFormat

Format pengodean untuk menginterpretasikan konten bidang.

vectorSearchProfile

string

Nama profil pencarian vektor yang menentukan algoritma dan vektorizer untuk digunakan saat mencari bidang vektor.

SearchFieldDataType

Menentukan jenis data bidang dalam indeks pencarian.

Nilai Deskripsi
Edm.String

Menunjukkan bahwa bidang berisi string.

Edm.Int32

Menunjukkan bahwa bidang berisi bilangan bulat bertanda tangan 32-bit.

Edm.Int64

Menunjukkan bahwa bidang berisi bilangan bulat bertanda tangan 64-bit.

Edm.Double

Menunjukkan bahwa bidang berisi nomor titik mengambang presisi ganda IEEE.

Edm.Boolean

Menunjukkan bahwa bidang berisi nilai Boolean (benar atau salah).

Edm.DateTimeOffset

Menunjukkan bahwa bidang berisi nilai tanggal/waktu, termasuk informasi zona waktu.

Edm.GeographyPoint

Menunjukkan bahwa bidang berisi lokasi geografis dalam hal garis bujur dan lintang.

Edm.ComplexType

Menunjukkan bahwa bidang berisi satu atau beberapa objek kompleks yang pada gilirannya memiliki sub-bidang jenis lain.

Edm.Single

Menunjukkan bahwa bidang berisi angka titik mengambang presisi tunggal. Ini hanya valid ketika digunakan dengan Collection(Edm.Single).

Edm.Half

Menunjukkan bahwa bidang berisi angka titik mengambang setengah presisi. Ini hanya valid ketika digunakan dengan Collection(Edm.Half).

Edm.Int16

Menunjukkan bahwa bidang berisi bilangan bulat bertanda 16-bit. Ini hanya valid ketika digunakan dengan Collection(Edm.Int16).

Edm.SByte

Menunjukkan bahwa bidang berisi bilangan bulat bertanda tangan 8-bit. Ini hanya valid ketika digunakan dengan Collection(Edm.SByte).

Edm.Byte

Menunjukkan bahwa bidang berisi bilangan bulat yang tidak ditandatangani 8-bit. Ini hanya valid ketika digunakan dengan Collection(Edm.Byte).

SearchIndex

Mewakili definisi indeks pencarian, yang menjelaskan bidang dan perilaku pencarian indeks.

Nama Jenis Deskripsi
@odata.etag

string

ETag indeks.

analyzers LexicalAnalyzer[]:

Penganalisis untuk indeks.

charFilters CharFilter[]:

Karakter memfilter indeks.

corsOptions

CorsOptions

Opsi untuk mengontrol Berbagi Sumber Daya Lintas Asal (CORS) untuk indeks.

defaultScoringProfile

string

Nama profil penilaian yang akan digunakan jika tidak ada yang ditentukan dalam kueri. Jika properti ini tidak diatur dan tidak ada profil penilaian yang ditentukan dalam kueri, maka penilaian default (tf-idf) akan digunakan.

description

string

Deskripsi indeks.

encryptionKey

SearchResourceEncryptionKey

Deskripsi kunci enkripsi yang Anda buat di Azure Key Vault. Kunci ini digunakan untuk memberikan tingkat enkripsi tambahan untuk data Anda saat Anda menginginkan jaminan penuh bahwa tidak ada seorang pun, bahkan Microsoft, yang dapat mendekripsi data Anda. Setelah Anda mengenkripsi data Anda, data tersebut akan selalu tetap dienkripsi. Layanan pencarian akan mengabaikan upaya untuk mengatur properti ini ke null. Anda dapat mengubah properti ini sesuai kebutuhan jika Anda ingin memutar kunci enkripsi; Data Anda tidak akan terpengaruh. Enkripsi dengan kunci yang dikelola pelanggan tidak tersedia untuk layanan pencarian gratis, dan hanya tersedia untuk layanan berbayar yang dibuat pada atau setelah 1 Januari 2019.

fields

SearchField[]

Bidang indeks.

name

string

Nama indeks.

normalizers LexicalNormalizer[]:

CustomNormalizer[]

Normalizer untuk indeks.

scoringProfiles

ScoringProfile[]

Profil penilaian untuk indeks.

semantic

SemanticSearch

Menentukan parameter untuk indeks pencarian yang memengaruhi kemampuan semantik.

similarity SimilarityAlgorithm:

Jenis algoritma kesamaan yang akan digunakan saat menilai dan memberi peringkat dokumen yang cocok dengan kueri pencarian. Algoritma kesamaan hanya dapat ditentukan pada waktu pembuatan indeks dan tidak dapat dimodifikasi pada indeks yang ada. Jika null, algoritma ClassicSimilarity digunakan.

suggesters

SearchSuggester[]

Pemberi saran untuk indeks.

tokenFilters TokenFilter[]:

Token memfilter indeks.

tokenizers LexicalTokenizer[]:

Tokenizer untuk indeks.

vectorSearch

VectorSearch

Berisi opsi konfigurasi yang terkait dengan pencarian vektor.

SearchIndexerDataNoneIdentity

Menghapus properti identitas sumber data.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.DataNoneIdentity

Fragmen URI yang menentukan jenis identitas.

SearchIndexerDataUserAssignedIdentity

Menentukan identitas untuk sumber data yang akan digunakan.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.DataUserAssignedIdentity

Fragmen URI yang menentukan jenis identitas.

userAssignedIdentity

string

Id sumber daya Azure yang sepenuhnya memenuhi syarat dari identitas terkelola yang ditetapkan pengguna biasanya dalam formulir "/subscriptions/12345678-1234-1234-1234567890ab/resourceGroups/rg/providers/Microsoft.ManagedIdentity/userAssignedIdentities/myId" yang seharusnya ditetapkan ke layanan pencarian.

SearchResourceEncryptionKey

Kunci enkripsi yang dikelola pelanggan di Azure Key Vault. Kunci yang Anda buat dan kelola dapat digunakan untuk mengenkripsi atau mendekripsi data-at-rest, seperti indeks dan peta sinonim.

Nama Jenis Deskripsi
accessCredentials.applicationId

string

ID Aplikasi AAD yang diberikan izin akses yang diperlukan ke Azure Key Vault yang akan digunakan saat mengenkripsi data Anda tidak aktif. ID Aplikasi tidak boleh bingung dengan ID Objek untuk Aplikasi AAD Anda.

accessCredentials.applicationSecret

string

Kunci autentikasi aplikasi AAD yang ditentukan.

identity SearchIndexerDataIdentity:

Identitas terkelola eksplisit yang digunakan untuk kunci enkripsi ini. Jika tidak ditentukan dan properti kredensial akses null, identitas terkelola yang ditetapkan sistem akan digunakan. Pada pembaruan ke sumber daya, jika identitas eksplisit tidak ditentukan, identitas tersebut tetap tidak berubah. Jika "tidak ada" ditentukan, nilai properti ini akan dihapus.

keyVaultKeyName

string

Nama kunci Azure Key Vault Anda yang akan digunakan untuk mengenkripsi data Anda saat tidak aktif.

keyVaultKeyVersion

string

Versi kunci Azure Key Vault Anda yang akan digunakan untuk mengenkripsi data Anda saat tidak aktif.

keyVaultUri

string

URI Azure Key Vault Anda, juga disebut sebagai nama DNS, yang berisi kunci yang akan digunakan untuk mengenkripsi data Anda saat tidak aktif. Contoh URI mungkin https://my-keyvault-name.vault.azure.net.

SearchSuggester

Menentukan bagaimana SUGGEST API harus berlaku untuk sekelompok bidang dalam indeks.

Nama Jenis Deskripsi
name

string

Nama penasaran.

searchMode enum:

analyzingInfixMatching

Nilai yang menunjukkan kemampuan pemberan.

sourceFields

string[]

Daftar nama bidang yang diterapkan oleh pemberan. Setiap bidang harus dapat dicari.

SemanticConfiguration

Menentukan konfigurasi tertentu yang akan digunakan dalam konteks kemampuan semantik.

Nama Jenis Deskripsi
name

string

Nama konfigurasi semantik.

prioritizedFields

SemanticPrioritizedFields

Menjelaskan bidang judul, konten, dan kata kunci yang akan digunakan untuk peringkat, keterangan, sorotan, dan jawaban semantik. Setidaknya salah satu dari tiga sub properti (titleField, prioritizedKeywordsFields dan prioritizedContentFields) perlu diatur.

rankingOrder

RankingOrder

Menentukan jenis skor yang akan digunakan untuk urutan pengurutan hasil pencarian.

SemanticField

Bidang yang digunakan sebagai bagian dari konfigurasi semantik.

Nama Jenis Deskripsi
fieldName

string

Nama file

SemanticPrioritizedFields

Menjelaskan bidang judul, konten, dan kata kunci yang akan digunakan untuk peringkat, keterangan, sorotan, dan jawaban semantik.

Nama Jenis Deskripsi
prioritizedContentFields

SemanticField[]

Menentukan bidang konten yang akan digunakan untuk peringkat semantik, teks, sorotan, dan jawaban. Untuk hasil terbaik, bidang yang dipilih harus berisi teks dalam bentuk bahasa alami. Urutan bidang dalam array mewakili prioritasnya. Kolom dengan prioritas yang lebih rendah dapat terpotong jika kontennya panjang.

prioritizedKeywordsFields

SemanticField[]

Menentukan bidang kata kunci yang akan digunakan untuk peringkat semantik, teks, sorotan, dan jawaban. Untuk hasil terbaik, bidang yang dipilih harus berisi daftar kata kunci. Urutan bidang dalam array mewakili prioritasnya. Kolom dengan prioritas yang lebih rendah dapat terpotong jika kontennya panjang.

titleField

SemanticField

Menentukan bidang judul yang akan digunakan untuk peringkat semantik, teks, sorotan, dan jawaban. Jika Anda tidak memiliki kolom judul di indeks, kosongkan kolom ini.

SemanticSearch

Menentukan parameter untuk indeks pencarian yang memengaruhi kemampuan semantik.

Nama Jenis Deskripsi
configurations

SemanticConfiguration[]

Konfigurasi semantik untuk indeks.

defaultConfiguration

string

Memungkinkan Anda mengatur nama konfigurasi semantik default dalam indeks Anda, menjadikannya opsional untuk meneruskannya sebagai parameter kueri setiap saat.

ShingleTokenFilter

Membuat kombinasi token sebagai token tunggal. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.ShingleTokenFilter

Diskriminator untuk jenis turunan.

filterToken

string

_

String yang akan disisipkan untuk setiap posisi di mana tidak ada token. Defaultnya adalah garis bawah ("_").

maxShingleSize

integer (int32)

minimum: 2
2

Ukuran shingle maksimum. Nilai default dan minimum adalah 2.

minShingleSize

integer (int32)

minimum: 2
2

Ukuran shingle minimum. Nilai default dan minimum adalah 2. Harus kurang dari nilai maxShingleSize.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

outputUnigrams

boolean

True

Nilai yang menunjukkan apakah aliran output akan berisi token input (unigram) serta shingle. Nilai default adalah benar.

outputUnigramsIfNoShingles

boolean

False

Nilai yang menunjukkan apakah akan menghasilkan unigram untuk waktu tersebut ketika tidak ada shingle yang tersedia. Properti ini lebih diutamakan ketika outputUnigram diatur ke false. Nilai default adalah false.

tokenSeparator

string

String yang digunakan saat menggabungkan token yang berdekatan untuk membentuk shingle. Defaultnya adalah spasi tunggal (" ").

SnowballTokenFilter

Filter yang membendung kata-kata menggunakan stemmer yang dihasilkan Snowball. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.SnowballTokenFilter

Diskriminator untuk jenis turunan.

language

SnowballTokenFilterLanguage

Bahasa yang digunakan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

SnowballTokenFilterLanguage

Bahasa yang akan digunakan untuk filter token Snowball.

Nilai Deskripsi
armenian

Memilih tokenizer steming Lucene Snowball untuk bahasa Armenia.

basque

Memilih tokenizer stem Lucene Snowball untuk Basque.

catalan

Memilih tokenizer steming Lucene Snowball untuk Catalan.

danish

Memilih tokenizer stem Lucene Snowball untuk bahasa Denmark.

dutch

Memilih tokenizer steming Lucene Snowball untuk bahasa Belanda.

english

Memilih tokenizer stem Lucene Snowball untuk bahasa Inggris.

finnish

Memilih tokenizer steming Lucene Snowball untuk bahasa Finlandia.

french

Memilih tokenizer stem Lucene Snowball untuk bahasa Prancis.

german

Memilih tokenizer stem Lucene Snowball untuk bahasa Jerman.

german2

Memilih tokenizer steming Lucene Snowball yang menggunakan algoritma varian Jerman.

hungarian

Memilih tokenizer stem Lucene Snowball untuk bahasa Hongaria.

italian

Memilih tokenizer stem Lucene Snowball untuk bahasa Italia.

kp

Memilih tokenizer steming Lucene Snowball untuk bahasa Belanda yang menggunakan algoritma stem Kraaij-Pohlmann.

lovins

Memilih tokenizer stem Lucene Snowball untuk bahasa Inggris yang menggunakan algoritma stemming Lovins.

norwegian

Memilih tokenizer batang Lucene Snowball untuk bahasa Norwegia.

porter

Memilih tokenizer stem Lucene Snowball untuk bahasa Inggris yang menggunakan algoritma stem Porter.

portuguese

Memilih tokenizer steming Lucene Snowball untuk bahasa Portugis.

romanian

Memilih tokenizer steming Lucene Snowball untuk bahasa Rumania.

russian

Memilih tokenizer stem Lucene Snowball untuk bahasa Rusia.

spanish

Memilih tokenizer stem Lucene Snowball untuk bahasa Spanyol.

swedish

Memilih tokenizer steming Lucene Snowball untuk bahasa Swedia.

turkish

Memilih tokenizer stem Lucene Snowball untuk bahasa Turki.

StemmerOverrideTokenFilter

Menyediakan kemampuan untuk mengambil alih filter stemming lain dengan stemming berbasis kamus kustom. Istilah apa pun yang bertangkai kamus akan ditandai sebagai kata kunci sehingga tidak akan dibendung dengan stemmer di bawah rantai. Harus ditempatkan sebelum filter stemming. Filter token ini diimplementasikan menggunakan Apache Lucene. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/StemmerOverrideFilter.html

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StemmerOverrideTokenFilter

Diskriminator untuk jenis turunan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

rules

string[]

Daftar aturan stemming dalam format berikut: "word => stem", misalnya: "ran => run".

StemmerTokenFilter

Filter stemming khusus bahasa. Filter token ini diimplementasikan menggunakan Apache Lucene. Lihat https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StemmerTokenFilter

Diskriminator untuk jenis turunan.

language

StemmerTokenFilterLanguage

Bahasa yang digunakan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

StemmerTokenFilterLanguage

Bahasa yang akan digunakan untuk filter token stemmer.

Nilai Deskripsi
arabic

Memilih tokenizer stem Lucene untuk bahasa Arab.

armenian

Memilih tokenizer steming Lucene untuk bahasa Armenia.

basque

Memilih tokenizer stem Lucene untuk Basque.

brazilian

Memilih tokenizer steming Lucene untuk Portugis (Brasil).

bulgarian

Memilih tokenizer steming Lucene untuk bahasa Bulgaria.

catalan

Memilih tokenizer stem Lucene untuk Catalan.

czech

Memilih tokenizer steming Lucene untuk bahasa Ceko.

danish

Memilih tokenizer steming Lucene untuk bahasa Denmark.

dutch

Memilih tokenizer stem Lucene untuk bahasa Belanda.

dutchKp

Memilih tokenizer steming Lucene untuk bahasa Belanda yang menggunakan algoritma steming Kraaij-Pohlmann.

english

Memilih tokenizer steming Lucene untuk bahasa Inggris.

lightEnglish

Memilih tokenizer steming Lucene untuk bahasa Inggris yang melakukan stem ringan.

minimalEnglish

Memilih token steming Lucene untuk bahasa Inggris yang melakukan stemming.

possessiveEnglish

Memilih penandaan steming Lucene untuk bahasa Inggris yang menghapus posesif trailing dari kata-kata.

porter2

Memilih tokenizer stem Lucene untuk bahasa Inggris yang menggunakan algoritma steming Porter2.

lovins

Memilih tokenizer steming Lucene untuk bahasa Inggris yang menggunakan algoritma steming Lovins.

finnish

Memilih tokenizer steming Lucene untuk bahasa Finlandia.

lightFinnish

Memilih tokenizer steming Lucene untuk bahasa Finlandia yang melakukan stem ringan.

french

Memilih tokenizer stem Lucene untuk bahasa Prancis.

lightFrench

Memilih penandaan steming Lucene untuk bahasa Prancis yang melakukan stem ringan.

minimalFrench

Memilih penandaan steming Lucene untuk bahasa Prancis yang melakukan stemming.

galician

Memilih tokenizer stem Lucene untuk bahasa Galicia.

minimalGalician

Memilih tokenizer stem Lucene untuk bahasa Galicia yang melakukan stemming minimal.

german

Memilih tokenizer steming Lucene untuk bahasa Jerman.

german2

Memilih tokenizer stem Lucene yang menggunakan algoritma varian Jerman.

lightGerman

Memilih tokenizer stem Lucene untuk bahasa Jerman yang melakukan stem ringan.

minimalGerman

Memilih tokenizer stem Lucene untuk bahasa Jerman yang melakukan stemming.

greek

Memilih tokenizer steming Lucene untuk bahasa Yunani.

hindi

Memilih tokenizer stem Lucene untuk bahasa Hindi.

hungarian

Memilih tokenizer stem Lucene untuk bahasa Hongaria.

lightHungarian

Memilih penandaan steming Lucene untuk bahasa Hongaria yang melakukan batang ringan.

indonesian

Memilih tokenizer steming Lucene untuk bahasa Indonesia.

irish

Memilih tokenizer stem Lucene untuk Irlandia.

italian

Memilih tokenizer stem Lucene untuk bahasa Italia.

lightItalian

Memilih tokenizer stem Lucene untuk bahasa Italia yang melakukan stem ringan.

sorani

Memilih tokenizer stem Lucene untuk Sorani.

latvian

Memilih tokenizer batang Lucene untuk bahasa Latvia.

norwegian

Memilih tokenizer stem Lucene untuk bahasa Norwegia (Bokmål).

lightNorwegian

Memilih penandaan steming Lucene untuk bahasa Norwegia (Bokmã¥l) yang melakukan batang ringan.

minimalNorwegian

Memilih tokenizer steming Lucene untuk Norwegian (Bokm¥l) yang melakukan stemming minimal.

lightNynorsk

Memilih penandaan batang Lucene untuk bahasa Norwegia (Nynorsk) yang melakukan penghentian ringan.

minimalNynorsk

Memilih penandaan steming Lucene untuk Norwegia (Nynorsk) yang melakukan stemming.

portuguese

Memilih tokenizer steming Lucene untuk bahasa Portugis.

lightPortuguese

Memilih penandaan batang Lucene untuk bahasa Portugis yang melakukan penghentian ringan.

minimalPortuguese

Memilih tokenizer stem Lucene untuk bahasa Portugis yang melakukan stemming minimal.

portugueseRslp

Memilih tokenizer stem Lucene untuk bahasa Portugis yang menggunakan algoritma stemming RSLP.

romanian

Memilih tokenizer steming Lucene untuk bahasa Rumania.

russian

Memilih tokenizer stem Lucene untuk bahasa Rusia.

lightRussian

Memilih tokenizer batang Lucene untuk bahasa Rusia yang melakukan batang ringan.

spanish

Memilih tokenizer steming Lucene untuk bahasa Spanyol.

lightSpanish

Memilih penandaan batang Lucene untuk bahasa Spanyol yang melakukan penghentian ringan.

swedish

Memilih tokenizer batang Lucene untuk bahasa Swedia.

lightSwedish

Memilih tokenizer stem Lucene untuk bahasa Swedia yang melakukan stem ringan.

turkish

Memilih tokenizer steming Lucene untuk bahasa Turki.

StopAnalyzer

Membagi teks pada non-huruf; Menerapkan filter token huruf kecil dan stopword. Penganalisis ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StopAnalyzer

Diskriminator untuk jenis turunan.

name

string

Nama penganalisis. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

stopwords

string[]

Daftar kata henti.

StopwordsList

Mengidentifikasi daftar kata henti khusus bahasa yang telah ditentukan sebelumnya.

Nilai Deskripsi
arabic

Memilih daftar kata henti untuk bahasa Arab.

armenian

Memilih daftar kata henti untuk bahasa Armenia.

basque

Memilih daftar kata henti untuk bahasa Basque.

brazilian

Memilih daftar kata henti untuk bahasa Portugis (Brasil).

bulgarian

Memilih daftar kata henti untuk bahasa Bulgaria.

catalan

Memilih daftar kata henti untuk bahasa Catalan.

czech

Memilih daftar kata henti untuk bahasa Ceko.

danish

Memilih daftar kata henti untuk bahasa Denmark.

dutch

Memilih daftar kata henti untuk bahasa Belanda.

english

Memilih daftar kata henti untuk bahasa Inggris.

finnish

Memilih daftar kata henti untuk bahasa Finlandia.

french

Memilih daftar kata henti untuk bahasa Prancis.

galician

Memilih daftar kata ganti untuk bahasa Galicia.

german

Memilih daftar kata henti untuk bahasa Jerman.

greek

Memilih daftar kata henti untuk bahasa Yunani.

hindi

Memilih daftar kata henti untuk bahasa Hindi.

hungarian

Memilih daftar kata henti untuk bahasa Hongaria.

indonesian

Memilih daftar kata henti untuk bahasa Indonesia.

irish

Memilih daftar kata henti untuk bahasa Irlandia.

italian

Memilih daftar kata henti untuk bahasa Italia.

latvian

Memilih daftar kata henti untuk bahasa Latvia.

norwegian

Memilih daftar kata henti untuk bahasa Norwegia.

persian

Memilih daftar kata henti untuk bahasa Persia.

portuguese

Memilih daftar kata henti untuk bahasa Portugis.

romanian

Memilih daftar kata henti untuk bahasa Rumania.

russian

Memilih daftar kata henti untuk bahasa Rusia.

sorani

Memilih daftar kata henti untuk Sorani.

spanish

Memilih daftar kata henti untuk bahasa Spanyol.

swedish

Memilih daftar kata henti untuk bahasa Swedia.

thai

Memilih daftar kata henti untuk bahasa Thailand.

turkish

Memilih daftar kata henti untuk bahasa Turki.

StopwordsTokenFilter

Menghapus kata stop dari stream token. Filter token ini diimplementasikan menggunakan Apache Lucene. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.StopwordsTokenFilter

Diskriminator untuk jenis turunan.

ignoreCase

boolean

False

Nilai yang menunjukkan apakah akan mengabaikan kasus. Jika true, semua kata dikonversi ke huruf kecil terlebih dahulu. Nilai default adalah false.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

removeTrailing

boolean

True

Nilai yang menunjukkan apakah akan mengabaikan istilah pencarian terakhir jika itu adalah kata berhenti. Nilai default adalah benar.

stopwords

string[]

Daftar stopwords. Properti ini dan properti daftar stopwords tidak dapat disetel keduanya.

stopwordsList

StopwordsList

english

Daftar stopword yang telah ditentukan sebelumnya untuk digunakan. Properti ini dan properti stopwords tidak dapat keduanya diatur. Defaultnya adalah bahasa Inggris.

SynonymTokenFilter

Cocok dengan sinonim tunggal atau multi-kata dalam aliran token. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.SynonymTokenFilter

Diskriminator untuk jenis turunan.

expand

boolean

True

Nilai yang menunjukkan apakah semua kata dalam daftar sinonim (jika => notasi tidak digunakan) akan memetakan satu sama lain. Jika true, semua kata dalam daftar sinonim (jika => notasi tidak digunakan) akan memetakan satu sama lain. Daftar berikut: luar biasa, luar biasa, luar biasa, luar biasa, luar biasa setara dengan: luar biasa, luar biasa, luar biasa, menakjubkan => luar biasa, luar biasa, luar biasa, luar biasa, luar biasa, luar biasa. Jika false, daftar berikut: luar biasa, luar biasa, luar biasa, luar biasa, luar biasa akan setara dengan: luar biasa, luar biasa, luar biasa, menakjubkan => luar biasa. Nilai default adalah benar.

ignoreCase

boolean

False

Nilai yang menunjukkan apakah akan memasukkan lipatan huruf besar/kecil untuk pencocokan. Nilai default adalah false.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

synonyms

string[]

Daftar sinonim dalam salah satu dari dua format berikut: 1. luar biasa, luar biasa, luar biasa => menakjubkan - semua istilah di sisi kiri = simbol> akan diganti dengan semua istilah di sisi kanannya; 2. luar biasa, tidak dapat dipercaya, luar biasa, menakjubkan - daftar kata-kata yang dipisahkan koma yang setara. Atur perluas opsi untuk mengubah cara daftar ini ditafsirkan.

TagScoringFunction

Menentukan fungsi yang meningkatkan skor dokumen dengan nilai string yang cocok dengan daftar tag tertentu.

Nama Jenis Deskripsi
boost

number (double)

Pengali untuk skor mentah. Harus berupa angka positif yang tidak sama dengan 1,0.

fieldName

string

Nama bidang yang digunakan sebagai input ke fungsi penilaian.

interpolation

ScoringFunctionInterpolation

Nilai yang menunjukkan bagaimana peningkatan akan diinterpolasi di seluruh skor dokumen; default ke "Linear".

tag

TagScoringParameters

Nilai parameter untuk fungsi penilaian tag.

type string:

tag

Jenis ScoringFunction.

TagScoringParameters

Menyediakan nilai parameter ke fungsi penilaian tag.

Nama Jenis Deskripsi
tagsParameter

string

Nama parameter yang diteruskan dalam kueri pencarian untuk menentukan daftar tag yang akan dibandingkan dengan bidang target.

TextWeights

Menentukan bobot pada bidang indeks yang kecocokannya harus meningkatkan penilaian dalam kueri pencarian.

Nama Jenis Deskripsi
weights

object

Kamus bobot per bidang untuk meningkatkan penilaian dokumen. Kuncinya adalah nama bidang dan nilainya adalah bobot untuk setiap bidang.

TokenCharacterKind

Mewakili kelas karakter tempat filter token dapat beroperasi.

Nilai Deskripsi
letter

Menyimpan huruf dalam token.

digit

Menyimpan digit dalam token.

whitespace

Menyimpan spasi kosong dalam token.

punctuation

Menyimpan tanda baca dalam token.

symbol

Menyimpan simbol dalam token.

TokenFilterName

Menentukan nama semua filter token yang didukung oleh mesin pencari.

Nilai Deskripsi
arabic_normalization

Filter token yang menerapkan normalisasi bahasa Arab untuk menormalkan ortografi. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ar/ArabicNormalizationFilter.html

apostrophe

Menghapus semua karakter setelah sebuah apostrof, termasuk apostrof itu sendiri. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/tr/ApostropheFilter.html

asciifolding

Mengonversi karakter Unicode alfabet, numerik, dan simbolis yang tidak berada dalam 127 karakter ASCII pertama (blok Unicode "Latin Dasar" ke dalam setara ASCII mereka, jika setara tersebut ada. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

cjk_bigram

Membentuk bigram istilah CJK yang dihasilkan dari tokenizer standar. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKBigramFilter.html

cjk_width

Menormalkan perbedaan lebar CJK. Melipat varian ASCII lebar penuh menjadi Latin dasar yang setara, dan varian Katakana setengah lebar menjadi Kana yang setara. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKWidthFilter.html

classic

Menghilangkan posesif bahasa Inggris, dan titik-titik dari akronim. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicFilter.html

common_grams

Membuat bigram untuk istilah yang sering muncul saat mengindeks. Istilah tunggal juga masih diindeks, dengan bigram berlapis. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/commongrams/CommonGramsFilter.html

edgeNGram_v2

Menghasilkan n-gram dari ukuran yang diberikan mulai dari depan atau belakang token input. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenFilter.html

elision

Menghilangkan elision. Misalnya, "l'avion" (bidang) akan dikonversi menjadi "avion" (bidang). Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

german_normalization

Menormalkan karakter Jerman sesuai dengan heuristik algoritma bola salju Jerman2. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/de/GermanNormalizationFilter.html

hindi_normalization

Menormalkan teks dalam bahasa Hindi untuk menghapus beberapa perbedaan dalam variasi ejaan. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/hi/HindiNormalizationFilter.html

indic_normalization

Menormalkan representasi teks Unicode dalam bahasa India. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/in/IndicNormalizationFilter.html

keyword_repeat

Memancarkan setiap token masuk dua kali, sekali sebagai kata kunci dan sekali sebagai non-kata kunci. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/KeywordRepeatFilter.html

kstem

Filter kstem berkinerja tinggi untuk bahasa Inggris. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/en/KStemFilter.html

length

Menghapus kata-kata yang terlalu panjang atau terlalu pendek. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LengthFilter.html

limit

Membatasi jumlah token saat mengindeks. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LimitTokenCountFilter.html

lowercase

Menormalkan teks token ke huruf kecil. Lihat https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

nGram_v2

Menghasilkan n-gram dari ukuran yang diberikan. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenFilter.html

persian_normalization

Menerapkan normalisasi untuk bahasa Persia. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/fa/PersianNormalizationFilter.html

phonetic

Membuat token untuk kecocokan fonetik. Lihat https://lucene.apache.org/core/4_10_3/analyzers-phonetic/org/apache/lucene/analysis/phonetic/package-tree.html

porter_stem

Menggunakan algoritma stemming Porter untuk mengubah aliran token. Lihat http://tartarus.org/~martin/PorterStemmer

reverse

Membalikkan urutan token. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

scandinavian_normalization

Menormalkan penggunaan karakter Skandinavia yang dapat dipertukarkan. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianNormalizationFilter.html

scandinavian_folding

Melipat karakter Skandinavia Ã¥Ã... äæÃ"Æ->a dan öÖà ̧à ̃-o>. Ini juga mendiskriminasi penggunaan vokal ganda aa, ae, ao, oe dan oo, hanya meninggalkan yang pertama. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianFoldingFilter.html

shingle

Membuat kombinasi token sebagai token tunggal. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/shingle/ShingleFilter.html

snowball

Filter yang membendung kata-kata menggunakan stemmer yang dihasilkan Snowball. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/snowball/SnowballFilter.html

sorani_normalization

Menormalkan representasi Unicode dari teks Sorani. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ckb/SoraniNormalizationFilter.html

stemmer

Filter stemming khusus bahasa. Lihat https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

stopwords

Menghapus kata stop dari stream token. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

trim

Menghapus spasi kosong depan dan belakang dari token. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TrimFilter.html

truncate

Memotong istilah ke panjang tertentu. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TruncateTokenFilter.html

unique

Memfilter token yang memiliki teks sama dengan token sebelumnya. Lihat http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/RemoveDuplicatesTokenFilter.html

uppercase

Menormalkan teks token ke huruf kapital. Lihat https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

word_delimiter

Membagi kata menjadi subkata dan melakukan transformasi opsional pada grup subkata.

TruncateTokenFilter

Memotong istilah ke panjang tertentu. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.TruncateTokenFilter

Diskriminator untuk jenis turunan.

length

integer (int32)

maximum: 300
300

Panjang istilah yang akan dipotong. Default dan maksimum adalah 300.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

UaxUrlEmailTokenizer

Tokenisasi url dan email sebagai satu token. Tokenizer ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.UaxUrlEmailTokenizer

Diskriminator untuk jenis turunan.

maxTokenLength

integer (int32)

maximum: 300
255

Panjang token maksimum. Defaultnya adalah 255. Token yang lebih panjang dari panjang maksimum dipecah. Panjang token maksimum yang dapat digunakan adalah 300 karakter.

name

string

Nama tokenizer. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

UniqueTokenFilter

Memfilter token yang memiliki teks sama dengan token sebelumnya. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.UniqueTokenFilter

Diskriminator untuk jenis turunan.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

onlyOnSamePosition

boolean

False

Nilai yang menunjukkan apakah akan menghapus duplikat hanya pada posisi yang sama. Nilai default adalah false.

VectorEncodingFormat

Format pengkodean untuk menafsirkan konten bidang vektor.

Nilai Deskripsi
packedBit

Format pengodean yang mewakili bit yang dikemas ke dalam jenis data yang lebih luas.

VectorSearch

Berisi opsi konfigurasi yang terkait dengan pencarian vektor.

Nama Jenis Deskripsi
algorithms VectorSearchAlgorithmConfiguration[]:

Berisi opsi konfigurasi khusus untuk algoritme yang digunakan selama pengindeksan atau kueri.

compressions VectorSearchCompression[]:

Berisi opsi konfigurasi khusus untuk metode pemadatan yang digunakan selama pengindeksan atau kueri.

profiles

VectorSearchProfile[]

Menentukan kombinasi konfigurasi yang akan digunakan dengan pencarian vektor.

vectorizers VectorSearchVectorizer[]:

Berisi opsi konfigurasi tentang cara mem-vektorisasi kueri vektor teks.

VectorSearchAlgorithmKind

Algoritma yang digunakan untuk pengindeksan dan kueri.

Nilai Deskripsi
hnsw

HNSW (Hierarkis Navigable Small World), jenis sekitar algoritma tetangga terdekat.

exhaustiveKnn

Algoritma KNN lengkap yang akan melakukan pencarian brute-force.

VectorSearchAlgorithmMetric

Metrik kesamaan yang digunakan untuk perbandingan vektor. Disarankan untuk memilih metrik kesamaan yang sama dengan model penyematan yang dilatih.

Nilai Deskripsi
cosine

Mengukur sudut antara vektor untuk mengukur kesamaannya, mengabaikan besaran. Semakin kecil sudutnya, semakin dekat kesamaannya.

euclidean

Menghitung jarak garis lurus antara vektor dalam ruang multidimensi. Semakin kecil jaraknya, semakin dekat kesamaannya.

dotProduct

Menghitung jumlah produk yang bijaksana elemen untuk mengukur keselarasan dan kesamaan besar. Semakin besar dan lebih positif, semakin dekat kesamaannya.

hamming

Hanya berlaku untuk jenis data biner yang dikemas bit. Menentukan perbedaan dengan menghitung posisi yang berbeda dalam vektor biner. Semakin sedikit perbedaan, semakin dekat kesamaannya.

VectorSearchCompressionKind

Metode kompresi yang digunakan untuk pengindeksan dan kueri.

Nilai Deskripsi
scalarQuantization

Kuantisasi Skalar, jenis metode kompresi. Dalam kuantisasi skalar, nilai vektor asli dikompresi ke jenis yang lebih sempit dengan membedakan dan mewakili setiap komponen vektor menggunakan sekumpulan nilai terkuantisasi yang dikurangi, sehingga mengurangi ukuran data keseluruhan.

binaryQuantization

Kuantisasi Biner, jenis metode pemadatan. Dalam kuantisasi biner, nilai vektor asli dikompresi ke jenis biner yang lebih sempit dengan membedakan dan mewakili setiap komponen vektor menggunakan nilai biner, sehingga mengurangi ukuran data keseluruhan.

VectorSearchCompressionTarget

Jenis data terkuantisasi dari nilai vektor terkompresi.

Nilai Deskripsi
int8

Bilangan bulat bertanda tangan 8-bit.

VectorSearchProfile

Menentukan kombinasi konfigurasi yang akan digunakan dengan pencarian vektor.

Nama Jenis Deskripsi
algorithm

string

Nama konfigurasi algoritma pencarian vektor yang menentukan algoritme dan parameter opsional.

compression

string

Nama konfigurasi metode kompresi yang menentukan metode kompresi dan parameter opsional.

name

string

Nama yang akan dikaitkan dengan profil pencarian vektor khusus ini.

vectorizer

string

Nama vektorisasi yang sedang dikonfigurasi untuk digunakan dengan pencarian vektor.

VectorSearchVectorizerKind

Metode vektorisasi yang akan digunakan selama waktu kueri.

Nilai Deskripsi
azureOpenAI

Buat penyematan menggunakan sumber daya Azure OpenAI pada waktu kueri.

customWebApi

Buat penyematan menggunakan titik akhir web kustom pada waktu kueri.

aiServicesVision

Buat penyematan untuk input gambar atau teks pada waktu kueri menggunakan AZURE AI Services Vision Vectorize API.

aml

Hasilkan penyematan menggunakan titik akhir Azure Machine Learning yang disebarkan melalui Katalog Model Azure AI Foundry pada waktu kueri.

WebApiVectorizer

Menentukan vektorizer yang ditentukan pengguna untuk menghasilkan penyematan vektor string kueri. Integrasi vektorizer eksternal dicapai menggunakan antarmuka API Web kustom dari set keterampilan.

Nama Jenis Deskripsi
customWebApiParameters

WebApiVectorizerParameters

Menentukan properti vektor yang ditentukan pengguna.

kind string:

customWebApi

Jenis VectorSearchVectorizer.

name

string

Nama yang akan dikaitkan dengan metode vektorisasi khusus ini.

WebApiVectorizerParameters

Menentukan properti untuk menyambungkan ke vektorizer yang ditentukan pengguna.

Nama Jenis Deskripsi
authIdentity SearchIndexerDataIdentity:

Identitas terkelola yang ditetapkan pengguna yang digunakan untuk koneksi keluar. Jika authResourceId disediakan dan tidak ditentukan, identitas terkelola yang ditetapkan sistem akan digunakan. Pada pembaruan pengindeks, jika identitas tidak ditentukan, nilainya tetap tidak berubah. Jika diatur ke "none", nilai properti ini akan dihapus.

authResourceId

string

Berlaku untuk titik akhir kustom yang tersambung ke kode eksternal dalam fungsi Azure atau beberapa aplikasi lain yang menyediakan transformasi. Nilai ini harus berupa ID aplikasi yang dibuat untuk fungsi atau aplikasi saat terdaftar di Azure Active Directory. Saat ditentukan, vektorisasi terhubung ke fungsi atau aplikasi menggunakan ID terkelola (baik sistem atau yang ditetapkan pengguna) dari layanan pencarian dan token akses fungsi atau aplikasi, menggunakan nilai ini sebagai ID sumber daya untuk membuat cakupan token akses.

httpHeaders

object

Header yang diperlukan untuk membuat permintaan HTTP.

httpMethod

string

Metode untuk permintaan HTTP.

timeout

string (duration)

Batas waktu yang diinginkan untuk permintaan. Secara default, waktunya adalah 30 detik.

uri

string (uri)

URI API Web yang menyediakan vektorisasi.

WordDelimiterTokenFilter

Membagi kata menjadi subkata dan melakukan transformasi opsional pada grup subkata. Filter token ini diimplementasikan menggunakan Apache Lucene.

Nama Jenis Nilai default Deskripsi
@odata.type string:

#Microsoft.Azure.Search.WordDelimiterTokenFilter

Diskriminator untuk jenis turunan.

catenateAll

boolean

False

Nilai yang menunjukkan apakah semua bagian subkata akan diukur. Misalnya, jika ini diatur ke true, "Azure-Search-1" menjadi "AzureSearch1". Nilai default adalah false.

catenateNumbers

boolean

False

Nilai yang menunjukkan apakah eksekusi maksimum bagian angka akan di catenated. Misalnya, jika ini diatur ke true, "1-2" menjadi "12". Nilai default adalah false.

catenateWords

boolean

False

Nilai yang menunjukkan apakah eksekusi maksimum bagian kata akan diukur. Misalnya, jika ini diatur ke true, "Azure-Search" menjadi "AzureSearch". Nilai default adalah false.

generateNumberParts

boolean

True

Nilai yang menunjukkan apakah akan menghasilkan subkata angka. Nilai default adalah benar.

generateWordParts

boolean

True

Nilai yang menunjukkan apakah akan menghasilkan kata-kata bagian. Jika diatur, menyebabkan bagian kata dihasilkan; misalnya "AzureSearch" menjadi "Azure" "Search". Nilai default adalah benar.

name

string

Nama filter token. Ini hanya boleh berisi huruf, digit, spasi, tanda hubung atau garis bawah, hanya dapat dimulai dan diakhir dengan karakter alfanumerik, dan dibatasi hingga 128 karakter.

preserveOriginal

boolean

False

Nilai yang menunjukkan apakah kata asli akan dipertahankan dan ditambahkan ke daftar subkata. Nilai default adalah false.

protectedWords

string[]

Daftar token yang akan dilindungi agar tidak dibatasi.

splitOnCaseChange

boolean

True

Nilai yang menunjukkan apakah akan membagi kata pada caseChange. Misalnya, jika ini diatur ke true, "AzureSearch" menjadi "Azure" "Search". Nilai default adalah benar.

splitOnNumerics

boolean

True

Nilai yang menunjukkan apakah akan memisahkan angka. Misalnya, jika ini diatur ke true, "Azure1Search" menjadi "Azure" "1" "Search". Nilai default adalah benar.

stemEnglishPossessive

boolean

True

Nilai yang menunjukkan apakah akan menghapus "'s" berikutnya untuk setiap subkata. Nilai default adalah benar.