將 Unity 目錄資料表同步到 Postgres,並與你的營運資料一同查詢。
步驟: (1) 建立分析資料 → (2) 同步到 Lakebase → (3) 在 Postgres 中尋找資料 → (4) 跨兩個世界查詢
Note
這是快速入門。 完整文件請參閱 同步資料表。
開始之前
- 務必完成 取得 Postgres 資料庫。 你需要一個包含範例資料的 Lakebase 專案。
- 用於 Unity 目錄查詢的 SQL 倉庫或筆記本。
- USE_SCHEMA 並 CREATE_TABLE 你要建立同步表格的結構。
步驟 1:在 Unity 目錄中建立分析資料
假設你的資料團隊已在 Lakehouse 中建立了使用者分群分數。 在正式環境中,這是黃金資料表、機器學習輸出或增豐資料集。 在本指南中,請先做一個小範例。
在 SQL 倉庫或筆記本中,執行:
CREATE TABLE main.default.user_segments AS
SELECT * FROM VALUES
(1, 'power_user', 0.92),
(2, 'casual', 0.35),
(3, 'power_user', 0.88)
AS segments(user_id, segment, engagement_score);
請注意,這些user_id值與您在 get-started 中的id表格內playing_with_lakebase欄中的值相符。 這是刻意為之。 你在步驟 4 與他們會合。
了解更多: 支援的原始碼類型
步驟 2:將表格同步到 Lakebase
在你的 Azure Databricks 工作區,點到側邊欄的目錄。 選擇你的 user_segments 表格以開啟其詳細資料頁面,然後點 選「建立>同步表格」。
在 「建立同步資料表 」對話框中,選擇你 Lakebase 專案的 databricks_postgres 資料庫作為目標,並將 快照 作為同步模式。 快照只複製一次資料,這是最簡單的入門方式。
同步會自動執行。 完成後,你的 Lakebase 資料庫會出現一個新的唯讀資料表。 Unity 目錄中的結構名稱會變成 Postgres 架構名稱,而資料表名稱則加上 _synced 後綴: default.user_segments_synced。
了解更多:建立同步表格(完整程序) | 同步模式
步驟 3:在 Postgres 中尋找你的資料
切換到 Lakebase SQL 編輯器。 Unity 目錄中的分析資料現在可用標準 Postgres SQL 查詢。 尋找使用者 1:
SELECT * FROM "default".user_segments_synced WHERE user_id = 1;
Note
default 必須引用,因為它是 PostgreSQL 保留的關鍵字。 同步的資料表結構會繼承 Unity Catalog 的結構名稱,所以如果你的結構被命名 default為 ,查詢時必須一定要引用它。
你應該會看到使用者 1、區隔 power_user,以及互動分數 0.92。 這正是你在 Unity Catalog 中建立的同一列,現在在 Postgres 中以低延遲讀取功能提供。
了解更多: 資料型態映射
步驟 4:跨兩個環境查詢
這就是回報。 您的 playing_with_lakebase 表格包含作業資料。 你的 user_segments_synced 資料表具備 Lakehouse 分析功能。 加入他們:
SELECT
p.id,
p.name,
p.value,
s.segment,
s.engagement_score
FROM playing_with_lakebase p
JOIN "default".user_segments_synced s ON p.id = s.user_id;
您的應用程式現在可以提供豐富的資料。 單一的 Postgres 查詢結合了應用程式所知道的內容(名稱、數值)與資料湖倉計算出的結果(區段、分數)。 無需對 Lakehouse 進行 API 呼叫,無需同步指令碼,也沒有延遲成本。
了解更多: 容量規劃
下一步
- 保持資料新鮮: 為持續更新設定觸發同步 或持續同步模式 。
- 打造應用程式: 在 Databricks 應用程式 或 外部應用程式中使用同步資料。
- 探索湖基:核心概念 | 湖基