智慧文件處理(IDP)將非結構化內容——如 PDF、DOCX 檔案、圖片和簡報——轉換成結構化且豐富的資料,驅動下游代理、應用程式和分析工具。
Azure Databricks 提供兩種運行 IDP 的方式,兩者皆基於相同的研究開發的 AI 功能:
- Agent Bricks UI:無程式碼、視覺化的體驗,用於解析、擷取及分類文件。 用它來測試範例文件、精煉結構或標籤,並在擴展前視覺化驗證結果。
- SQL AI 函式:直接在 Lakehouse 上執行智慧文件處理功能。 使用它們來大規模處理文件、將各個階段串接起來,並在 Lakeflow 管線中建置受治理的正式生產級管線。
智慧文件處理能力
| 能力 | Agent Bricks 使用者介面 | SQL 函式 |
|---|---|---|
| 將 PDF、DOCX、圖片和 PPT 轉換成結構化文字、表格和圖表描述。 | 文件解析 | ai_parse_document |
| 用你定義的架構,從文件或純文字中拉取結構化欄位。 | 資訊提取 | ai_extract |
| 為文件或文字指派預先定義的分類,支援最多 500+ 個標籤。 | 分類 | ai_classify |
| 將解析後的文件轉換為語意區塊,供檢索增強生成(RAG)及 AI 搜尋索引使用。 |
ai_prep_search (測試版) |
常見使用案例
Azure Databricks 上的 IDP 支援多種下游應用程式:
- 檢索增強生成(RAG):解析與結構文件以提升分塊、檢索品質及LLM應用的基礎性。
- 知識萃取與分析:提取關鍵欄位與元資料,以支援文件資料的搜尋、報告與商業智慧。
- 代理驅動工作流程:路由、分類並豐富文件,以支援自動化決策與任務執行。
- 文件理解與分類:依類型、主題或內容組織大型文件語料庫,以便後續處理。
運作原理
Azure Databricks 讓智慧文件處理成為 Lakehouse 上統一的端到端工作流程。 擷取、解析、豐富化及下游分析皆建置於單一平台,因此每個階段無縫協同運作,無需複雜的整合或資料流動。
導入與協調
使用 Lakeflow 管線來匯入原始文件(例如 PDF、圖片和 DOCX 檔案),並協調管線。 由於匯入與編排在 Lakehouse 中原生整合,文件直接流入後續處理,無需需要額外的基礎設施。
解析文件(青銅層)
應用
ai_parse_document將原始檔案轉換成結構化表示。 這建立了標準化的青銅層,能捕捉文字、表格/圖片描述及文件結構,為所有後續使用情境提供一致的基礎。擷取與分類
使用
ai_extract並ai_classify豐富解析文件,加入結構化欄位與元資料。 這些函式直接運作於解析後的輸出,讓你能提取關鍵資訊、分類文件,並在不需額外轉換步驟的情況下透過工作流程進行導向。為檢索做好準備(RAG)
應用
ai_prep_search(Beta)將解析後的文件轉換為充滿文件層級上下文(如標題、章節標題及頁面參考)的語意區塊。 輸出以 AI 搜尋索引格式化,為 RAG 與檢索工作負載提供一致的基礎。分析與實務化
利用額外的 AI 功能或其他工具(AI/BI 儀表板、應用程式、AI 搜尋)進行下游分析、檢索(RAG)及代理驅動工作流程。 由於所有資料都保留在 Lakehouse,結構化文件資料可立即用於搜尋、儀表板及應用程式。