Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Note
Azure KI-Suche ist über das Azure Portal, REST-APIs und Azure SDKs verfügbar. Es unterstützt auch Foundry IQ, die verwaltete Wissensschicht, die Unternehmensinhalte in wiederverwendbare, berechtigungsfähige Wissensbasen für Agenten im Microsoft Foundry-Portal transformiert.
Important
Features, Funktionen oder Eigenschaften, die markiert sind (Vorschau) werden nicht von einer Vereinbarung auf Serviceebene abgedeckt, werden für Produktionsworkloads nicht empfohlen und können geändert oder eingeschränkt werden, bevor sie allgemein verfügbar werden. Wenn Sie sich für die Verwendung von Vorschaufunktionen entscheiden, unabhängig davon, ob es sich um ein eigenständiges Feature oder um einen Teil eines allgemein verfügbaren Features handelt, sind Sie für die Datenverarbeitung, den Datenzugriff, die verantwortungsvolle KI-Nutzung und andere Verpflichtungen verantwortlich, die in den Azure KI-Suche Vorschaubedingungen beschrieben sind.
Die Fähigkeit Azure Content Understanding verwendet Dokumentanalysatoren aus Azure Content Understanding in Foundry Tools um unstrukturierte Dokumente und andere Inhaltstypen zu analysieren und organisierte, durchsuchbare Ausgaben zu erzeugen, die in Automatisierungsworkloads integriert werden können. Diese Fähigkeit extrahiert sowohl Text als auch Bilder, einschließlich Standortmetadaten, die die Position jedes Bildes im Dokument erhalten. Die Nähe von Bildern zu verwandten Inhalten ist besonders nützlich für multimodale Suche, agentische Abrufe und abrufaugmentierte Generierung (RAG).
Die Azure Content Understanding-Fähigkeit ist an eine fakturierbare Microsoft Foundry-Ressource gebunden. Im Gegensatz zu anderen Azure KI-Ressourcenfähigkeiten, wie der Dokumentenlayout-Fähigkeit, bietet die Azure Content Understanding-Fähigkeit nicht 20 kostenlose Dokumente pro Indexer pro Tag. Die Ausführung dieser Fähigkeit wird zum Preis Azure Content Understanding berechnet.
Du kannst die Azure Content Understanding-Fähigkeit sowohl für die Inhaltsextraktion als auch für das Chunking verwenden. Es ist nicht nötig, die Text-Split-Fähigkeit in deinem Skillset zu verwenden. Diese Fähigkeit implementiert dieselbe Schnittstelle wie die Dokumentenlayout-Fähigkeit, die das
Tabellen und Abbildungen werden im Markdown-Format ausgegeben, was sie für große Sprachmodelle (LLMs) leichter verständlich macht. Im Gegensatz dazu gibt die Dokumentenlayout-Fähigkeit Tabellen und Abbildungen als Klartext aus, was zu Informationsverlust führen kann.
Bei Tabellen, die sich über mehrere Seiten erstrecken, kann die Azure Fähigkeit zum Inhaltsverständnis seitenübergreifende Tabellen als einzelne Einheit erkennen und extrahieren.
Die Azure Fähigkeit zum Verständnis von Inhalten ermöglicht es Blöcken, mehrere Seiten über semantische Einheiten zu umfassen.
Die Azure Content Understanding-Fähigkeit ist kosteneffektiver als die Dokumentenlayout-Fähigkeit, da die Content Understanding-API günstiger ist.
Azure Inhaltsverständnis kann KI-basierte Beschreibungen für Bilder, Diagramme, Diagramme und eingebettete Abbildungen generieren. Eingebettete Abbildungsbeschreibungen werden direkt in markdown-Inhalte integriert, die zum Abrufen generiert werden. Diese Beschreibungen sind durchsuchbar und können DIE RAG-Bodenung und die multimodale Abrufqualität verbessern.
Die Azure Fähigkeit zum Verständnis von Inhalten ist in der 2026-04-01 REST-API allgemein verfügbar. Beginnend mit der 2026-05-01-previewFähigkeit generiert die Fähigkeit optional KI-basierte Beschreibungen für dokument eingebettete Bilder, Diagramme und Diagramme. Um Beschreibungen zu aktivieren, müssen Sie ein Azure OpenAI-Chatabschlussmodell in der Foundry-Ressource bereitstellen, die dem Skillset zugeordnet ist. Diese API-Version fügt auch semantische Blöcke (Vorschau) hinzu, eine Layout-fähige Option, die Absatzbegrenzungen berücksichtigt und die Blocklänge in Token misst. Für beide Funktionen ist die Anmeldung erforderlich. Wenn die neuen Parameter weggelassen werden, verhält sich die Fähigkeit wie in der stabilen 2026-04-01 API-Version.
Einschränkungen
Die Azure Content Understanding-Fähigkeit hat folgende Einschränkungen:
Diese Fähigkeit eignet sich nicht für große Dokumente, die mehr als fünf Minuten Bearbeitung im Content Understanding Dokumentenanalysator benötigen. Die Fertigkeit läuft ab, aber Ladungen gelten weiterhin für die Gießerei-Ressource, die dem Fertigkeitenset zugeordnet ist. Stellen Sie sicher, dass Dokumente so optimiert werden, dass sie innerhalb der Bearbeitungsgrenzen bleiben, um unnötige Kosten zu vermeiden.
Diese Fähigkeit ruft den Azure Content Understanding Dokumentanalysator auf, sodass alle dokumentierten Service-Verhaltensweisen für verschiedene Dokumenttypen auf die Ausgabe angewendet werden. Zum Beispiel können Word (DOCX) und PDF-Dateien aufgrund unterschiedlicher Bildverarbeitung unterschiedliche Ergebnisse liefern. Wenn ein einheitliches Bildverhalten zwischen DOCX und PDF erforderlich ist, sollten Sie in Erwägung ziehen, Dokumente in PDF zu konvertieren oder die multimodale Suchdokumentation auf alternative Ansätze zu prüfen.
Unterstützte Regionen
Die Fähigkeit Azure Content Understanding ruft die Content Understanding 2025-11-01 REST API auf. Ihre Foundry-Ressource muss sich in einer unterstützten Region befinden, die in Azure Content Understanding Region and language support beschrieben ist.
Ihr Suchdienst kann in jeder unterstützten Azure KI-Suche Region sein. Wenn Ihre Foundry-Ressource und Ihr Azure KI-Suche-Dienst nicht in derselben Region liegen, wirkt sich die Latenz zwischen den Regionen auf die Leistung Ihres Indexers aus.
Unterstützte Dateiformate
Die Azure Content Understanding-Fähigkeit erkennt folgende Dateiformate an:
- . JPEG
- .JPG
- .PNG
- .BMP
- .HEIF
- . TIFF
- .DOCX
- . XLSX
- .PPTX
- .HTML
- .TXT
- .MD
- .RTF
- .EML
Unterstützte Sprachen
Für gedruckten Text siehe Azure Content Understanding Region and language support.
@odata.type
Microsoft.Skills.Util.ContentUnderstandingSkill
Datenlimits
Selbst wenn die Dateigröße zur Analyse von Dokumenten innerhalb der 200-MB-Grenze liegt, wie in den Quoten und Limits des Content Understanding Service Azure beschrieben, unterliegt die Indexierung weiterhin den Indexer-Grenzen Ihrer Suchservice-Schicht.
Die Bildmaße müssen zwischen 50 x 50 Pixel oder 10.000 x 10.000 Pixel liegen.
Wenn deine PDFs passwortgesperrt sind, entferne die Sperre, bevor du den Indexer ausführst.
Qualifikationsparameter
Die Parameter sind groß- und kleinschreibungssensitiv.
| Parametername | Zulässige Werte | Beschreibung |
|---|---|---|
extractionOptions |
["images"], ["images", "locationMetadata"]["locationMetadata"] |
Identifizieren Sie alle zusätzlichen Inhalte, die aus dem Dokument extrahiert wurden. Definieren Sie ein Array von Enums, die dem Inhalt entsprechen, der in die Ausgabe aufgenommen werden soll. Wenn beispielsweise , extractionOptionsenthält die Ausgabe Bilder und Standortmetadaten, ["images", "locationMetadata"] die Seitenstandort und visuelle Informationen darüber liefern, wo der Inhalt extrahiert wurde. |
modelName (Vorschau) |
Zeichenfolge, z "gpt-4.1". B. . |
Optional. Verfügbar ab der 2026-05-01-preview REST-API. Der Name des Azure OpenAI-Chatabschlussmodells, das zum Generieren von Beschreibungen eingebetteter Bilder, Diagramme und Diagramme verwendet wird. Die Bildbeschreibung ist unabhängig von extractionOptions und kann ohne Extrahieren von Bildern aktiviert werden. Muss zusammen mit modelDeployment. Eine Liste der unterstützten Modelle finden Sie unter "Unterstützte generative Modelle". |
modelDeployment (Vorschau) |
Eine Zeichenfolge. | Optional. Verfügbar ab der 2026-05-01-preview REST-API. Der Bereitstellungsname des Azure OpenAI-Modells in der Foundry-Ressource, die dem Skillset zugeordnet ist. Muss zusammen mit modelName. |
chunkingProperties |
Siehe folgende Tabelle. | Optionen, die zusammenfassen, wie man Textinhalte chunkt. |
chunkingProperties Parameter |
Zulässige Werte | Beschreibung |
|---|---|---|
method |
fixedSize (Standard) oder semantic (Vorschau). Verfügbar ab der 2026-05-01-preview REST-API. |
Die Blockierungsstrategie.
fixedSize verwendet zeichenbasierte Fensterblöcke.
semantic verwendet Layout-fähige Blöcke, die Absatzgrenzen respektieren und große Tabellen, die Abschnittsgrenzen umfassen, intelligent behandelt. |
unit |
characters (mit fixedSize) oder tokens (Vorschau, mit semantic, verfügbar ab der 2026-05-01-preview REST-API). |
Kontrolliert die Kardinalität der Chunk-Einheit. Nur die fixedSize + characters Kombinationen und semantic + tokens Kombinationen werden unterstützt. Wenn unit dieser Wert nicht angegeben wird, wird er von method. |
maximumLength |
Wenn unit ist characters, eine ganze Zahl zwischen 300 und 50.000. Ist unit eine tokensganze Zahl zwischen 100 und 8.000. Der Standardwert ist 500. |
Die maximale Blocklänge, gemessen in der konfigurierten unit. |
overlapLength |
Ganzzahl. Der Wert muss kleiner als die Hälfte von maximumLength. |
Die Länge der Überlappung zwischen zwei Textblöcken. Gilt nur, wenn method dies der Zeitpunkt ist fixedSize. Muss ausgelassen oder festgelegt 0 werden, wenn method der Wert ist semantic. |
Qualifikationseingaben
| Eingabename | Beschreibung |
|---|---|
file_data |
Die Datei, aus der der Inhalt extrahiert werden sollte. |
Die Eingabe file_data muss ein Objekt sein, das definiert ist als:
{
"$type": "file",
"data": "BASE64 encoded string of the file"
}
Alternativ kann er definiert werden als:
{
"$type": "file",
"url": "URL to download the file",
"sasToken": "OPTIONAL: SAS token for authentication if the provided URL is for a file in blob storage"
}
Das Dateireferenzobjekt kann auf eine der folgenden Arten generiert werden:
Setzen Sie den
allowSkillsetToReadFileDataParameter in Ihrer Indexer-Definition auftrue. Diese Einstellung erstellt einen/document/file_dataPfad, der ein Objekt darstellt, das die ursprünglichen Dateidaten darstellt, die von deiner Blob-Datenquelle heruntergeladen wurden. Dieser Parameter gilt nur für Dateien in Azure Blob Storage.allowSkillsetToReadFileDatastellt die heruntergeladenen Dateidaten für die Fähigkeit zur Verfügung. Die Blob-Indexer-Grenzwerte oder die in Den Datengrenzwerten beschriebenen Inhaltsverständnisdienstgrenzwerte werden nicht erhöht.Eine benutzerdefinierte Fähigkeit zu haben, die eine JSON-Objektdefinition zurückgibt, die ,
$type, oderdataundurlliefertsastoken. Der Parameter$typemuss auffilegesetzt werden unddatamuss das Basis-64-codierte Byte-Array des Dateiinhalts sein. Der Parameterurlmuss eine gültige URL sein, die Zugriff auf den Download der Datei an diesem Ort hat.
Skill-Ergebnisse
| Ausgabename | Beschreibung |
|---|---|
text_sections |
Eine Sammlung von Textchunk-Objekten. Jeder Chunk kann sich über mehrere Seiten erstrecken (unter Berücksichtigung weiterer konfigurierter Chunking). Das Textabschnittsobjekt enthält locationMetadata ggf. eine imagePath Liste, wenn sich der Block mit Abbildungsabschnitten im Dokument überschneidet. |
normalized_images |
Gilt nur, wenn extractionOptions . enthalten ist images. Eine Sammlung von Bildern, die aus dem Dokument extrahiert wurden, einschließlich locationMetadata , falls zutreffend. |
Jedes Element in text_sections weist die folgenden Felder auf:
| Feld | Typ | Beschreibung |
|---|---|---|
id |
String | Eindeutiger Bezeichner für den Block. |
content |
String | Markdowninhalt für den Block. Wenn method dies der Grund ist semantic, enthält der Inhalt KI-generierte Beschreibungen von Abbildungen und Tabellen, die als Markdown inlined sind. |
locationMetadata |
Objekt | Seitenbereich und Positionsdaten (pageNumberFrom, pageNumberTo, ordinalPosition, source). Vorhanden, wenn extractionOptions enthalten locationMetadata. |
imagePath |
String | Durch Semikolons getrennte Liste von Pfaden zu Bildern, die im Block enthalten sind. Vorhanden, wenn sich der Block mit Abbildungsüberschneidungen im Dokument überschneidet. |
Jedes Element in normalized_images weist die folgenden Felder auf:
| Feld | Typ | Beschreibung |
|---|---|---|
id |
String | Eindeutiger Bezeichner für das Bild. |
data |
String | Base64-codierte Bilddaten. |
imagePath |
String | Pfadverweis auf das Bild im Dokument, z "figures/0". B. . |
locationMetadata |
Objekt | Seitenbereich und Positionsdaten. Vorhanden, wenn extractionOptions enthalten locationMetadata. |
Beispiele
Das erste Beispiel verwendet Blockierungen mit fester Größe und veranschaulicht, wie Textinhalte in Blöcken fester Größe ausgegeben und Bilder zusammen mit Positionsmetadaten aus dem Dokument extrahiert werden. Das zweite Beispiel, das ab der 2026-05-01-preview REST-API verfügbar ist, verwendet semantische Blöcke mit KI-generierten Bildbeschreibungen.
Beispiel 1: Blöcke mit fester Größe mit Bild- und Metadatenextraktion
{
"skills": [
{
"description": "Analyze a document",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"unit": "characters",
"maximumLength": 1325,
"overlapLength": 0
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Beispielausgabe
{
"text_sections": [
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "What is Azure Content Understanding (preview)?09/16/2025Important· Azure Al Content Understanding is available in preview. Public preview releases provide early access to features that are in active development.· Features, approaches, and processes can change or have limited capabilities, before General Availability (GA).. For more information, see Supplemental Terms of Use for Microsoft Azure PreviewsAzure Content Understanding is a Foundry Tool that uses generative AI to process/ingest content of many types (documents, images, videos, and audio) into a user-defined output format.Content Understanding offers a streamlined process to reason over large amounts of unstructured data, accelerating time-to-value by generating an output that can be integrated into automation and analytical workflows.<figure>\n\nInputs\n\nAnalyzers\n\nOutput\n\n0\nSearch\n\nContent Extraction\n\nField Extraction\n\nDocuments\n\nNew\n\nAgents\n\nPreprocessing\n\nEnrichments\n\nReasoning\n\nImage\n\nNormalization\n(resolution,\nformats)\n\nSpeaker\nrecognition\n\nGen Al\nContext\nwindows\n\nPostprocessing\nConfidence\nscores\nGrounding\nNormalization\n\nMulti-file input\nReference data\n\nDatabases\n\nVideo\n\nOrientation /\nde-skew\n\nLayout and\nstructure\n\nPrompt tuning\n\nStructured\noutput\n\nAudio\n\nFace grouping\n\nMarkdown or JSON schema\n\nCopilots\n\nApps\n\n\\+\n\nFaurIC\n\n</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455);D(1,0.6334,1.3758,1.3896,1.3738,1.39,1.5401,0.6338,1.542);D(1,0.8104,2.0716,1.8137,2.0692,1.8142,2.2669,0.8109,2.2693);D(1,1.0228,2.5023,7.6222,2.5029,7.6221,3.0075,1.0228,3.0069);D(1,1.0216,3.1121,7.3414,3.1057,7.342,3.6101,1.0221,3.6165);D(1,1.0219,3.7145,7.436,3.7048,7.4362,3.9006,1.0222,3.9103);D(1,0.6303,4.3295,7.7875,4.3236,7.7879,4.812,0.6307,4.8179);D(1,0.6304,5.0295,7.8065,5.0303,7.8064,5.7858,0.6303,5.7849);D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968);D(1,0.6381,9.1451,5.2731,9.1476,5.2729,9.4829,0.6379,9.4803)"
}
},
...
{
"id": "2_e0e57fd4-e835-4879-8532-73a415e47b0b",
"content": "<table>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Post-call analytics</td>\n<td>Businesses and call centers can generate insights from call recordings to track key KPIs, improve product experience, generate business insights, create differentiated customer experiences, and answer queries faster and more accurately.</td>\n</tr>\n<tr>\n<th>Application</th>\n<th>Description</th>\n</tr>\n<tr>\n<td>Media asset management</td>\n<td>Software and media vendors can use Content Understanding to extract richer, targeted information from videos for media asset management solutions.</td>\n</tr>\n<tr>\n<td>Tax automation</td>\n<td>Tax preparation companies can use Content Understanding to generate a unified view of information from various documents and create comprehensive tax returns.</td>\n</tr>\n<tr>\n<td>Chart understanding</td>\n<td>Businesses can enhance chart understanding by automating the analysis and interpretation of various types of charts and diagrams using Content Understanding.</td>\n</tr>\n<tr>\n<td>Mortgage application processing</td>\n<td>Analyze supplementary supporting documentation and mortgage applications to determine whether a prospective home buyer provided all the necessary documentation to secure a mortgage.</td>\n</tr>\n<tr>\n<td>Invoice contract verification</td>\n<td>Review invoices and contr",
"locationMetadata": {
"pageNumberFrom": 2,
"pageNumberTo": 3,
"ordinalPosition": 3,
"source": "D(2,0.6438,9.2645,7.8576,9.2649,7.8565,10.5199,0.6434,10.5194);D(3,0.6494,0.3919,7.8649,0.3929,7.8639,4.3254,0.6485,4.3232)"
}
...
}
],
"normalized_images": [
{
"id": "1_335140f1-9d31-4507-8916-2cde758639cb",
"data": "aW1hZ2UgMSBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.635,5.9572,7.8544,5.9573,7.8562,8.6971,0.6363,8.6968)"
}
},
{
"id": "3_699d33ac-1a1b-4015-9cbd-eb8bfff2e6b4",
"data": "aW1hZ2UgMiBkYXRh",
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_1.jpg",
"locationMetadata": {
"pageNumberFrom": 3,
"pageNumberTo": 3,
"ordinalPosition": 1,
"source": "D(3,0.6353,5.2142,7.8428,5.218,7.8443,8.4631,0.6363,8.4594)"
}
}
]
}
locationMetadata basiert auf der source Eigenschaft, die von Azure Content Understanding bereitgestellt wird. Informationen darüber, wie die visuelle Position des Elements in der Datei kodiert wird, finden Sie unter Dokumentanalyse: Strukturierte Inhalte extrahieren.
imagePath stellt den relativen Pfad eines gespeicherten Bildes dar. Wenn die Projektion der Knowledge Store-Datei im Skillset konfiguriert ist, entspricht dieser Pfad dem relativen Pfad des im Knowledge Store gespeicherten Bildes.
Beispiel 2: Semantischer Abschnitt mit Bildbeschreibung (Vorschau)
Dieses Beispiel, das ab der 2026-05-01-preview REST-API verfügbar ist, verwendet semantische Blöcke und erzeugt KI-generierte Beschreibungen eingebetteter Bilder, Diagramme und Diagramme. Die foundry-Ressource, die dem Skillset zugeordnet ist, muss das Chat-Vervollständigungsmodell aufweisen, das von modelName und der bereitgestellten Ressource modelDeploymentidentifiziert wird.
{
"skills": [
{
"description": "Extract and chunk document content with image descriptions",
"@odata.type": "#Microsoft.Skills.Util.ContentUnderstandingSkill",
"context": "/document",
"modelName": "gpt-4.1",
"modelDeployment": "myGpt41Deployment",
"extractionOptions": ["images", "locationMetadata"],
"chunkingProperties": {
"method": "semantic",
"unit": "tokens",
"maximumLength": 500
},
"inputs": [
{
"name": "file_data",
"source": "/document/file_data"
}
],
"outputs": [
{
"name": "text_sections",
"targetName": "text_sections"
},
{
"name": "normalized_images",
"targetName": "normalized_images"
}
]
}
]
}
Bei semantischer Blöcken enthält jeder Block in text_sections Markdown-Inhalt, der KI-generierte Beschreibungen aller Abbildungen und Tabellen enthält, die es abdeckt. Wenn ein Block sich mit einer oder mehreren Abbildungen überschneidet, enthält das Blockobjekt auch ein imagePath Feld, das die entsprechenden Bildpfade auflistet:
{
"id": "1_d4545398-8df1-409f-acbb-f605d851ae85",
"content": "# Architecture overview\n\nThe following diagram summarizes the ingestion pipeline...\n\n<figure>The diagram shows three stages: Inputs, Analyzers, and Output. Inputs include documents, images, video, and audio. Analyzers perform preprocessing, enrichments, and reasoning. Output is structured Markdown or JSON consumed by search, agents, copilots, and apps.</figure>",
"locationMetadata": {
"pageNumberFrom": 1,
"pageNumberTo": 1,
"ordinalPosition": 0,
"source": "D(1,0.6348,0.3598,7.2258,0.3805,7.223,1.2662,0.632,1.2455)"
},
"imagePath": "aHR0cHM6Ly9henNyb2xsaW5nLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsaXR5L0NVLnBkZg2/normalized_images_0.jpg"
}