簡介
您的組織每天從多個來源系統處理數百萬筆交易,利害關係人需要可靠的分析,既能反映當前營運也反映歷史趨勢。 資料工程團隊面臨關鍵決策:資料應該如何從來源系統流入 湖屋? 哪些表格格式能在效能與相容性之間取得適當的平衡? 你們如何在保持查詢快速的同時,保持歷史準確性?
Azure Databricks 與 Unity Catalog 的資料建模透過刻意的設計選擇來解決這些挑戰,影響每一位下游消費者。 你可以選擇符合你延遲需求的 資料擷取模式 。 你可以根據交易需求和跨平台相容性選擇像 Delta Lake 或 Apache Iceberg 這樣的表格格式。 你設計與分析師查詢資料方式相符的 分割方案 與 分群策略 。
這些決定會隨著時間累積。 現今分割錯誤的資料表會產生效能問題,且隨著資料量增加而加劇。 沒有適當變更追蹤的 維度表 會失去歷史脈絡。 深思熟慮的前期設計創造了一個能有效擴展的基礎,並解答那些尚未預料到的問題。
本模組將引導您了解 Azure Databricks 環境的關鍵資料建模決策。 你將學習設計擷取邏輯、為每種資料來源類型選擇合適的工具,以及實作優化查詢效能的儲存策略。 你將探索 緩慢變動的維度 以求歷史準確性,並理解何時 受管理的資料表 相較 外部資料表 具有優勢。