Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Hinweis
Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.
Important
Diese Features und Funktionen unterstützen Verbindungen mit anderen Microsoft-Dienste und Drittanbieterdiensten. Die Nutzung dieser Dienste unterliegt den jeweiligen Bestimmungen und kann dazu führen, dass Daten außerhalb der Azure-Compliancegrenze verarbeitet oder gespeichert werden und dass Daten in die Azure-Compliancegrenze fließen.
Es liegt in Ihrer Verantwortung, zu verwalten, ob Ihre Daten außerhalb der Compliance- und geografischen Grenzen Ihrer Organisation und alle damit verbundenen Auswirkungen fließen und dass entsprechende Berechtigungen, Grenzen und Genehmigungen bereitgestellt werden.
Sie sind dafür verantwortlich, Anwendungen, die Sie im Kontext Ihrer spezifischen Anwendungsfälle erstellen, sorgfältig zu überprüfen und zu testen und alle geeigneten Entscheidungen und Anpassungen zu treffen. Dazu gehört die Implementierung ihrer eigenen verantwortungsvollen KI-Entschärfungen, wie Metaprompts, Inhaltsfilter oder andere Sicherheitssysteme, und sicherzustellen, dass Ihre Anwendungen angemessene Qualität, Zuverlässigkeit, Sicherheit und Vertrauenswürdigkeitsstandards erfüllen. Weitere Informationen finden Sie im Azure KI-Suche Transparenzhinweis.
In diesem Artikel erfahren Sie, wie Sie einen Indexer konfigurieren, der Inhalte aus Azure Data Lake Storage (ADLS) Gen2 importiert und es in Azure KI-Suche durchsuchbar macht. Eingaben für den Indexer sind Ihre Blobs, in einem einzelnen Container. Die Ausgabe ist ein Suchindex mit durchsuchbaren Inhalten und Metadaten, die in einzelnen Feldern gespeichert sind.
Dieser Artikel ergänzt das Erstellen eines Indexers mit Informationen, die für die Indizierung von ADLS Gen2 spezifisch sind. Er verwendet die REST-APIs, um einen dreiteiligen Workflow zu veranschaulichen, der allen Indexern gemeinsam ist: Erstellen einer Datenquelle, Erstellen eines Indexes und Erstellen eines Indexers. Die Datenextraktion erfolgt, wenn Sie die Anforderung für die Indexererstellung übermitteln.
Ein Codebeispiel in C# finden Sie unter Index Data Lake Gen2 mit Microsoft Entra ID auf GitHub.
Hinweis
ADLS Gen2 unterstützt ein Zugriffssteuerungsmodell mit rollenbasierter Zugriffssteuerung (Azure RBAC) und POSIX-ähnlichen Zugriffssteuerungslisten (ACCESS Control Lists, ACLs) auf Blob-Ebene. Azure KI-Suche kann jetzt Berechtigungen auf Dokumentebene in ADLS Gen2-Blobs während der Indizierung erkennen und diese Berechtigungen an indizierte Inhalte im Suchindex übertragen. Weitere Informationen über das Einbinden von ACLs und den RBAC-Bereich während der Indizierung finden Sie unter Indizierung von Zugriffskontrolllisten und rollenbasierter Zugriffssteuerung in Azure mit Indexern.
Voraussetzungen
ADLS Gen2 mit aktivierter hierarchischer Namensraum. ADLS Gen2 ist über Azure Storage verfügbar. Beim Einrichten eines Speicherkontos haben Sie die Möglichkeit, hierarchischen Namespace zu aktivieren, Dateien in einer Hierarchie von Verzeichnissen und geschachtelten Unterverzeichnissen zu organisieren. Durch Aktivieren eines hierarchischen Namespaces aktivieren Sie ADLS Gen2.
Access-Ebenen für ADLS Gen2 umfassen Hot-, Cool- und Archive. Suchindexer können nur auf die heiße und kalte Ebene zugreifen.
Blobs, die Text enthalten. Wenn Sie binäre Daten haben, können Sie die KI-Anreicherung für die Bildanalyse einschließen. Blob-Inhalte dürfen die Indizierungsgrenzwerte für die Suchdienststufe nicht überschreiten.
Behandeln Sie die Quellindizierung und KI-Anreicherung als separate Verarbeitungsstufen. Ein Qualifikations- oder externer Dienst kann einen niedrigeren Eingabegrenzwert aufweisen als die Menge an Inhalten, die der Indexer extrahieren kann. Überprüfen Sie den Referenzartikel für jede Fähigkeit in Ihrem Skillset .
Leseberechtigungen für Azure Storage. Eine Verbindungszeichenfolge "Vollzugriff" enthält einen Schlüssel, der Zugriff auf den Inhalt gewährt, aber wenn Sie stattdessen Azure-Rollen verwenden, stellen Sie sicher, dass die verwaltete Identität des Suchdiensts über Berechtigungen für den Speicher-Blob-Datenleser verfügt.
Verwenden Sie einen REST-Client, wenn Sie REST-Aufrufe formulieren wollen, die den in diesem Artikel gezeigten ähnlich sind.
Einschränkungen
Im Gegensatz zu BLOB-Indexern können ADLS Gen2-Indexer keine SAS-Token auf Containerebene zum Aufzählen und Indizieren von Inhalten aus einem Speicherkonto verwenden. Diese Einschränkung ist vorhanden, da der Indexer eine Überprüfung vorgibt, um festzustellen, ob das Speicherkonto hierarchische Namespaces aktiviert hat, indem die Filesystem -Get properties API aufgerufen wird. Verwenden Sie für Speicherkonten, bei denen hierarchische Namespaces nicht aktiviert sind, stattdessen BLOB-Indexer , um eine performante Enumeration von Blobs sicherzustellen.
Wenn die Eigenschaft
metadata_storage_pathdem Indexschlüsselfeld zugeordnet ist, ist nicht gewährleistet, dass Blobs bei einer Umbenennung des Verzeichnisses neu indiziert werden. Wenn Sie die Blobs neu indizieren möchten, die Teil der umbenannten Verzeichnisse sind, aktualisieren Sie dieLastModifiedZeitstempel für alle.
Unterstützte Dokumentformate
Der ADLS Gen2-Indexer kann Text aus den folgenden Dokumentformaten extrahieren:
- CSV (siehe Indizierung von CSV-Blobs)
- EML
- EPUB
- GZ
- HTML
- JSON (Siehe Indizierung von JSON-Blobs)
- KML (XML für geografische Darstellungen)
- Markdown
- Microsoft Office-Formate: DOCX/DOC/DOCM, XLSX/XLS/XLSM, PPTX/PPT/PPTM, MSG (Outlook-E-Mails), XML (WORD XML 2003 und 2006)
- Öffnen von Dokumentformaten: ODT, ODS, ODP
- Textdateien (Siehe auch Indizierung von Nur-Text)
- RTF
- XML
- ZIP
Bestimmen, welche Blobs indiziert werden sollen
Überprüfen Sie vor dem Einrichten der Indizierung die Quelldaten, um zu ermitteln, ob Änderungen im Voraus vorgenommen werden sollten. Ein Indexer kann immer nur Inhalte aus einem Container gleichzeitig indizieren. Standardmäßig werden alle Blobs im Container verarbeitet. Sie haben mehrere Optionen für eine stärker selektive Verarbeitung:
Platzieren Sie Blobs in einem virtuellen Ordner. Eine Indexerdatenquellendefinition enthält einen "query"-Parameter, der einen virtuellen Ordner annehmen kann. Wenn Sie einen virtuellen Ordner angeben, werden nur diese Blobs im Ordner indiziert.
Einschließen oder Ausschließen von Blobs nach Dateityp. Anhand der Liste der unterstützten Dokumentformate können Sie ermitteln, welche Blobs ausgeschlossen werden sollen. Beispielsweise können Sie Bild- oder Audiodateien ausschließen, die keinen durchsuchbaren Text bereitstellen. Diese Funktion wird über Konfigurationseinstellungen im Indexer gesteuert.
Einschließen oder Ausschließen beliebiger Blobs. Wenn Sie aus irgendeinem Grund ein bestimmtes Blob überspringen möchten, können Sie die folgenden Metadateneigenschaften und -werte zu Blob Storage-Blobs hinzufügen. Wenn ein Indexer auf diese Eigenschaft trifft, überspringt er das Blob oder dessen Inhalt in der Indizierungsausführung.
Eigenschaftsname Eigenschaftswert Explanation „AzureSearch_Skip“ "true"Weist den Blobindexer an, das Blob vollständig zu überspringen. Weder die Metadaten- noch die Inhaltsextraktion werden versucht. Dies ist nützlich, wenn ein bestimmtes Blob wiederholt fehlschlägt und den Indizierungsprozess unterbricht. „AzureSearch_SkipContent“ "true"Überspringt Inhalte und extrahiert nur die Metadaten. Diese Einstellung entspricht der "dataToExtract" : "allMetadata"in den Konfigurationseinstellungen beschriebenen Einstellung, gilt jedoch für ein bestimmtes Blob.
Wenn Sie keine Einschluss- oder Ausschlusskriterien einrichten, meldet der Indexer ein nicht berechtigtes Blob als Fehler und bewegt sich weiter. Wenn genügend Fehler auftreten, wird die Verarbeitung möglicherweise beendet. Sie können die Fehlertoleranz in den Konfigurationseinstellungen des Indexers angeben.
Ein Indexer erstellt in der Regel ein Suchdokument pro Blob, in dem der Textinhalt und die Metadaten als durchsuchbare Felder in einem Index erfasst werden. Wenn Blobs ganze Dateien sind, können Sie sie potenziell in mehrere Suchdokumente analysieren. Beispielsweise können Sie Zeilen in einer CSV-Datei analysieren, um ein Suchdokument pro Zeile zu erstellen.
Indizieren der Metadaten von Blobs
Sie können BLOB-Metadaten indizieren, was hilfreich ist, wenn Sie denken, dass eine der Standard- oder benutzerdefinierten Metadateneigenschaften in Filtern und Abfragen nützlich ist.
Vom Benutzer angegebene Metadateneigenschaften werden wortgetreu extrahiert. Um die Werte zu empfangen, müssen Sie ein Feld im Suchindex des Typs Edm.String mit demselben Namen wie der Metadatenschlüssel des Blobs definieren. Wenn ein Blob beispielsweise einen Metadatenschlüssel mit dem Wert Sensitivityhat, sollten Sie ein Feld definieren, das in Ihrem Suchindex benannt HighSensitivity ist, der mit dem Wert Highaufgefüllt wird.
Standard-Blobmetadateneigenschaften können wie unten aufgeführt in ähnlich benannte und typierte Felder extrahiert werden. Der Blobindexer erstellt automatisch interne Feldzuordnungen für diese Blobmetadateneigenschaften, wobei der ursprüngliche Bindestrichname ("Metadatenspeichername") in einen unterstrichenen gleichwertigen Namen ("metadata_storage_name") konvertiert wird.
Sie müssen der Indexdefinition weiterhin die unterstrichenen Felder hinzufügen, aber Sie können Feldzuordnungen weglassen, da der Indexer die Zuordnung automatisch macht.
metadata_storage_name (
Edm.String) – der Dateiname des Blobs. Wenn Sie z. B. über ein Blob /my-container/my-folder/subfolder/resume.pdf verfügen, lautet der Wert dieses Feldsresume.pdf.metadata_storage_path (
Edm.String): der vollständigen URI des Blobs, einschließlich Speicherkonto. Beispiel:https://myaccount.blob.core.windows.net/my-container/my-folder/subfolder/resume.pdfmetadata_storage_content_type (
Edm.String): Inhaltstyp, der mit dem Code angegeben wird, den Sie zum Hochladen des Blobs verwendet haben. Beispiel:application/octet-stream.metadata_storage_last_modified (
Edm.DateTimeOffset): Zeitstempel der letzten Änderung des Blobs. Azure KI-Suche verwendet diesen Zeitstempel, um geänderte Blobs zu identifizieren, damit nicht alles nach der ersten Indizierung neu indiziert wird.metadata_storage_size (
Edm.Int64): Blobgröße in Bytes.metadata_storage_content_md5 (
Edm.String): MD5-Hash des Blobinhalts, sofern vorhanden.metadata_storage_sas_token (
Edm.String) – Ein temporäres SAS-Token, das von benutzerdefinierten Fähigkeiten verwendet werden kann, um Zugriff auf das Blob zu erhalten. Dieses Token sollte nicht zur späteren Verwendung gespeichert werden, da es ablaufen kann.
Schließlich können auch alle Metadaten-Eigenschaften, die für das Dokumentformat der Blobs, die Sie indizieren, spezifisch sind, im Indexschema dargestellt werden. Weitere Informationen zu inhaltsspezifischen Metadaten finden Sie unter Eigenschaften von Inhaltsmetadaten.
Wichtig ist der Hinweis, dass Sie nicht für alle der oben genannten Eigenschaften Felder in Ihrem Suchindex definieren müssen. Erfassen Sie lediglich die Eigenschaften, die Sie für Ihre Anwendung benötigen.
Definieren der Datenquelle
Die Datenquellendefinition gibt die zu indizierenden Daten, die Anmeldeinformationen und die Richtlinien für die Identifizierung von Datenänderungen an. Eine Datenquelle wird als unabhängige Ressource definiert, sodass sie von mehreren Indexern verwendet werden kann.
Erstellen oder aktualisieren Sie eine Datenquelle, um ihre Definition festzulegen:
{ "name" : "my-adlsgen2-datasource", "type" : "adlsgen2", "credentials" : { "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<account name>;AccountKey=<account key>;" }, "container" : { "name" : "my-container", "query" : "<optional-virtual-directory-name>" } }Legen Sie "type" auf
"adlsgen2"fest (erforderlich).Setzen Sie
"credentials"auf eine Azure Storage-Verbindungszeichenfolge. Im nächsten Abschnitt werden die unterstützten Formate beschrieben.Legen Sie
"container"im Blobcontainer fest und verwenden Sie "query", um beliebige Unterordner anzugeben.
Eine Datenquellendefinition kann auch Richtlinien für vorläufiges Löschen enthalten, wenn der Indexer ein Suchdokument löschen soll, wenn das Quelldokument für den Löschvorgang gekennzeichnet ist.
Unterstützte Anmeldeinformationen und Verbindungszeichenfolgen
Indexer können mithilfe der folgenden Verbindungen eine Verbindung mit einem BLOB-Container herstellen.
| Verbindungszeichenfolge für den Vollzugriff auf ein Speicherkonto |
|---|
{ "connectionString" : "DefaultEndpointsProtocol=https;AccountName=<your storage account>;AccountKey=<your account key>;" } |
| Sie können die Verbindungszeichenfolge über die Seite "Speicherkonto" im Azure-Portal abrufen, indem Sie im linken Bereich Zugriffstasten auswählen. Stellen Sie sicher, dass Sie eine vollständige Verbindungszeichenfolge und nicht nur einen Schlüssel auswählen. |
| Verbindungszeichenfolge für verwaltete Identitäten |
|---|
{ "connectionString" : "ResourceId=/subscriptions/<your subscription ID>/resourceGroups/<your resource group name>/providers/Microsoft.Storage/storageAccounts/<your storage account name>/;" } |
| Diese Verbindungszeichenfolge erfordert keinen Kontoschlüssel, aber Sie müssen zuvor einen Suchdienst für das Herstellen einer Verbindung mithilfe einer verwalteten Identität konfiguriert haben. |
| Shared Access Signature (SAS)-Verbindungszeichenfolge für ein Speicherkonto |
|---|
{ "connectionString" : "BlobEndpoint=https://<your account>.blob.core.windows.net/;SharedAccessSignature=?sv=2016-05-31&sig=<the signature>&spr=https&se=<the validity end time>&srt=co&ss=b&sp=rl;" } |
| Die SAS sollte über Zugriffsrechte zum Auflisten und Lesen von Container- und Objektinhalten (in diesem Fall Blobs) verfügen. |
Hinweis
Wenn Sie SAS-Anmeldeinformationen verwenden, müssen Sie regelmäßig die Anmeldeinformationen der Datenquelle mit erneuerten Signaturen aktualisieren, um deren Ablauf zu verhindern. Wenn SAS-Anmeldeinformationen ablaufen, schlägt der Indexer mit einer Fehlermeldung wie "In der Verbindungszeichenfolge bereitgestellte Anmeldeinformationen sind ungültig oder abgelaufen" fehl.
Hinzufügen von Suchfeldern zu einem Index
Fügen Sie in einem Suchindex Felder hinzu, um den Inhalt und die Metadaten Ihrer Azure-Blobs zu akzeptieren.
Erstellen oder aktualisieren Sie einen Index , um Suchfelder zu definieren, die Blob-Inhalte und Metadaten speichern:
{ "name" : "my-search-index", "fields": [ { "name": "ID", "type": "Edm.String", "key": true, "searchable": false }, { "name": "content", "type": "Edm.String", "searchable": true, "filterable": false }, { "name": "metadata_storage_name", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true }, { "name": "metadata_storage_size", "type": "Edm.Int64", "searchable": false, "filterable": true, "sortable": true }, { "name": "metadata_storage_content_type", "type": "Edm.String", "searchable": false, "filterable": true, "sortable": true } ] }Erstellen Sie ein Dokumentschlüsselfeld („key“: true). Metadateneigenschaften sind die besten Kandidaten für Blobinhalte.
metadata_storage_path(Standard) vollständiger Pfad zum Objekt oder zur Datei. Das Schlüsselfeld ("ID" in diesem Beispiel) wird mit Werten aus metadata_storage_path aufgefüllt, da es sich um die Standardeinstellung handelt.metadata_storage_namekann nur verwendet werden, wenn Namen eindeutig sind. Wenn Sie dieses Feld als Schlüssel benötigen, verschieben Sie"key": truein diese Felddefinition.Eine benutzerdefinierte Metadateneigenschaft, die Sie Blobs hinzufügen. Für diese Option ist es erforderlich, dass diese Metadateneigenschaft im Prozess des Hochladens von Blobs allen Blobs hinzugefügt wird. Da der Schlüssel eine erforderliche Eigenschaft ist, werden alle Blobs, denen ein Wert fehlt, nicht indiziert. Wenn Sie eine benutzerdefinierte Metadateneigenschaft als Schlüssel verwenden, vermeiden Sie es, Änderungen an dieser Eigenschaft vorzunehmen. Indexer fügen doppelte Dokumente für dasselbe Blob hinzu, wenn sich die Schlüsseleigenschaft ändert.
Metadateneigenschaften enthalten häufig Zeichen wie
/und-, die für Dokumentschlüssel ungültig sind. Der Indexer codiert automatisch die Schlüsselmetadaten-Eigenschaft, ohne dass eine Konfiguration oder Feldzuordnung erforderlich ist.Fügen Sie ein Feld „content“ hinzu, um extrahierten Text aus jeder Datei über die Eigenschaft „content“ des Blobs zu speichern. Sie sind nicht verpflichtet, diesen Namen zu verwenden, aber Sie können so die Vorteile impliziter Zuordnungen von Feldern nutzen.
Fügen Sie Felder für Standardmetadateneigenschaften hinzu. Der Indexer kann Eigenschaften von benutzerdefinierten Metadaten, Standardmetadaten und inhaltsspezifischen Metadaten lesen.
Konfigurieren und Ausführen des ADLS Gen2-Indexers
Nach der Erstellung von Index und Datenquelle können Sie den Indexer erstellen. Die Indexerkonfiguration gibt die Eingaben, Parameter und Eigenschaften an, die das Laufzeitverhalten steuern. Sie können auch angeben, welche Teile eines Blobs indiziert werden sollen.
Erstellen oder aktualisieren Sie den Indexer, indem Sie ihm einen Namen geben und einen Verweis auf die Datenquelle und den Zielindex hinzufügen:
{ "name" : "my-adlsgen2-indexer", "dataSourceName" : "my-adlsgen2-datasource", "targetIndexName" : "my-search-index", "parameters": { "batchSize": null, "maxFailedItems": null, "maxFailedItemsPerBatch": null, "configuration": { "indexedFileNameExtensions" : ".pdf,.docx", "excludedFileNameExtensions" : ".png,.jpeg", "dataToExtract": "contentAndMetadata", "parsingMode": "default" } }, "schedule" : { }, "fieldMappings" : [ ] }Legen Sie "batchSize" fest, wenn der Standardwert (10 Dokumente) die verfügbaren Ressourcen nicht auslastet oder überlastet. Die Standardbatchgrößen sind datenquellenspezifisch. Blob-Indizierung legt die Batchgröße auf 10 Dokumente fest, in Anbetracht der größeren durchschnittlichen Dokumentgröße.
Unter "Konfiguration" steuern Sie, welche Blobs basierend auf dem Dateityp indiziert werden, oder lassen Sie das Feld leer, um alle Blobs abzurufen.
Geben Sie für
"indexedFileNameExtensions"eine durch Trennzeichen getrennte Liste der Dateierweiterungen an (mit vorangestelltem Punkt). Machen Sie dasselbe für"excludedFileNameExtensions", um anzugeben, welche Erweiterungen übersprungen werden sollen. Wenn sich dieselbe Erweiterung in beiden Listen befindet, wird sie von der Indizierung ausgeschlossen.Legen Sie unter "configuration" "dataToExtract" fest, um zu bestimmen, welche Teile der Blobs indiziert werden sollen.
"contentAndMetadata" gibt an, dass alle metadaten- und textbezogenen Inhalte, die aus dem Blob extrahiert wurden, indiziert werden. Dies ist der Standardwert.
"storageMetadata" gibt an, dass nur die Standard-BLOB-Eigenschaften und vom Benutzer angegebenen Metadaten indiziert werden.
"allMetadata" gibt an, dass Standard-BLOB-Eigenschaften und alle Metadaten für gefundene Inhaltstypen aus dem Blob-Inhalt extrahiert und indiziert werden.
Legen Sie unter "configuration" "parsingMode" fest, wenn Blobs mehreren Suchdokumenten zugeordnet werden sollen oder ob sie aus Nur-Text-, JSON-Dokumenten oder CSV-Dateien bestehen.
Geben Sie Feldzuordnungen an, wenn es Unterschiede beim Feldnamen oder -typ gibt, oder wenn Sie mehrere Versionen eines Quellfelds im Suchindex benötigen.
Bei der Blob-Indizierung können Sie Feldzuordnungen häufig weglassen, da der Indexer integrierte Unterstützung bei der Zuordnung der Inhalts- und Metadateneigenschaften zu ähnlich benannten und typisierten Feldern in einem Index hat. Bei Metadateneigenschaften ersetzt der Indexer automatisch Bindestriche
-durch Unterstriche im Suchindex.Weitere Informationen zu anderen Eigenschaften finden Sie unter Erstellen von Indexern in Azure Cognitive Search. Die vollständige Liste der Parameterbeschreibungen finden Sie in der REST-API unter Erstellen eines Indexers (REST).
Ein Indexer wird automatisch ausgeführt, wenn er erstellt wird. Sie können dies verhindern, indem Sie „disabled“ (Deaktiviert) auf „true“ festlegen. Um die Ausführung des Indexers zu steuern, führen Sie einen Indexer nach Bedarf aus, oder legen Sie für ihn einen Zeitplan fest.
Überprüfen des Indexerstatus
Um den Indexerstatus und den Ausführungsverlauf zu überwachen, senden Sie eine Anforderung zum Abrufen des Indexerstatus:
GET https://myservice.search.windows.net/indexers/myindexer/status?api-version=2026-04-01
Content-Type: application/json
api-key: [admin key]
Die Antwort enthält den Status und die Anzahl der verarbeiteten Elemente. Sie sollte in etwa wie das folgende Beispiel aussehen:
{
"status":"running",
"lastResult": {
"status":"success",
"errorMessage":null,
"startTime":"2024-02-21T00:23:24.957Z",
"endTime":"2024-02-21T00:36:47.752Z",
"errors":[],
"itemsProcessed":1599501,
"itemsFailed":0,
"initialTrackingState":null,
"finalTrackingState":null
},
"executionHistory":
[
{
"status":"success",
"errorMessage":null,
"startTime":"2024-02-21T00:23:24.957Z",
"endTime":"2024-02-21T00:36:47.752Z",
"errors":[],
"itemsProcessed":1599501,
"itemsFailed":0,
"initialTrackingState":null,
"finalTrackingState":null
},
... earlier history items
]
}
Der Ausführungsverlauf enthält bis zu 50 der zuletzt abgeschlossenen Ausführungen. Diese sind in umgekehrter chronologischer Reihenfolge sortiert, sodass die neueste Ausführung als Erstes aufgelistet wird.
Fehler behandeln
Fehler, die häufig während der Indizierung auftreten, umfassen nicht unterstützte Inhaltstypen, fehlende Inhalte oder überdimensionierte Blobs.
Standardmäßig stoppt der Blob-Indexer, sobald ein Blob mit einem nicht unterstützten Inhaltstyp (z. B. einer Audiodatei) auftritt. Sie können den Parameter "excludedFileNameExtensions" verwenden, um bestimmte Inhaltstypen zu überspringen. Möglicherweise möchten Sie jedoch, dass die Indizierung auch dann fortgesetzt wird, wenn Fehler auftreten, und dann später einzelne Dokumente debuggen. Weitere Informationen zu Indexerfehlern finden Sie unter Indexer-Problembehandlungsanleitungenund Indexerfehler und Warnungen.
Es gibt fünf Indexereigenschaften, die die Reaktion des Indexers beim Auftreten von Fehlern steuern.
PUT /indexers/[indexer name]?api-version=2026-04-01
{
"parameters" : {
"maxFailedItems" : 10,
"maxFailedItemsPerBatch" : 10,
"configuration" : {
"failOnUnsupportedContentType" : false,
"failOnUnprocessableDocument" : false,
"indexStorageMetadataOnlyForOversizedDocuments": false
}
}
}
| Parameter | Gültige Werte | Description |
|---|---|---|
| "maxFailedItems" | -1, NULL oder 0, positive ganze Zahl | Setzen Sie die Indizierung fort, wenn an einem beliebigen Punkt der Verarbeitung Fehler auftreten, entweder bei der Analyse von Blobs oder beim Hinzufügen von Dokumenten zu einem Index. Legen Sie diese Eigenschaften auf die Anzahl zulässiger Fehler fest. Der Wert -1 ermöglicht die Verarbeitung unabhängig davon, wie viele Fehler auftreten. Andernfalls ist der Wert eine positive ganze Zahl. |
| "maxFailedItemsPerBatch" | -1, NULL oder 0, positive ganze Zahl | Wie oben, wird aber für die Batchindizierung verwendet. |
| "failOnUnsupportedContentType" | wahr oder falsch | Wenn der Indexer den Inhaltstyp nicht bestimmen kann, geben Sie an, ob der Auftrag fortgesetzt wird oder als nicht gelungen gilt. |
| "failOnUnprocessableDocument" | wahr oder falsch | Wenn der Indexer ein Dokument eines ansonsten unterstützten Inhaltstyps nicht verarbeiten kann, geben Sie an, ob der Auftrag fortgesetzt wird oder als nicht gelungen gilt. |
| "indexStorageMetadataOnlyForOversizedDocuments" | wahr oder falsch | Zu große Blobs werden standardmäßig als Fehler behandelt. Wenn Sie diesen Parameter auf "true" festlegen, versucht der Indexer, seine Metadaten zu indizieren, auch wenn der Inhalt nicht indiziert werden kann. Grenzwerte für die Blobgröße finden Sie unter Dienstgrenzwerte. |
Nächste Schritte
Sie können nun den Indexer ausführen, den Status überwachen oder die Ausführung des Indexers planen. Die folgenden Artikel gelten für Indexer, die Inhalte mithilfe von Pull Requests aus Azure Storage übertragen: