提供湖倉資料

將 Unity 目錄資料表同步到 Postgres,並與你的營運資料一同查詢。

步驟: (1) 建立分析資料 → (2) 同步到 Lakebase → (3) 在 Postgres 中尋找資料 → (4) 跨兩個世界查詢

Note

這是快速入門。 完整文件請參閱 同步資料表

開始之前

  • 務必完成 取得 Postgres 資料庫。 你需要一個包含範例資料的 Lakebase 專案。
  • 用於 Unity 目錄查詢的 SQL 倉庫或筆記本。
  • USE_SCHEMACREATE_TABLE 你要建立同步表格的結構。

步驟 1:在 Unity 目錄中建立分析資料

假設你的資料團隊已在 Lakehouse 中建立了使用者分群分數。 在正式環境中,這是黃金資料表、機器學習輸出或增豐資料集。 在本指南中,請先做一個小範例。

在 SQL 倉庫或筆記本中,執行:

CREATE TABLE main.default.user_segments AS
SELECT * FROM VALUES
  (1, 'power_user', 0.92),
  (2, 'casual', 0.35),
  (3, 'power_user', 0.88)
AS segments(user_id, segment, engagement_score);

請注意,這些user_id值與您在 get-started 中的id表格內playing_with_lakebase欄中的值相符。 這是刻意為之。 你在步驟 4 與他們會合。

了解更多: 支援的原始碼類型

步驟 2:將表格同步到 Lakebase

在你的 Azure Databricks 工作區,點到側邊欄的目錄。 選擇你的 user_segments 表格以開啟其詳細資料頁面,然後點 選「建立>同步表格」。

「建立同步資料表 」對話框中,選擇你 Lakebase 專案的 databricks_postgres 資料庫作為目標,並將 快照 作為同步模式。 快照只複製一次資料,這是最簡單的入門方式。

同步會自動執行。 完成後,你的 Lakebase 資料庫會出現一個新的唯讀資料表。 Unity 目錄中的結構名稱會變成 Postgres 架構名稱,而資料表名稱則加上 _synced 後綴: default.user_segments_synced

了解更多:建立同步表格(完整程序) | 同步模式

步驟 3:在 Postgres 中尋找你的資料

切換到 Lakebase SQL 編輯器。 Unity 目錄中的分析資料現在可用標準 Postgres SQL 查詢。 尋找使用者 1

SELECT * FROM "default".user_segments_synced WHERE user_id = 1;

Note

default 必須引用,因為它是 PostgreSQL 保留的關鍵字。 同步的資料表結構會繼承 Unity Catalog 的結構名稱,所以如果你的結構被命名 default為 ,查詢時必須一定要引用它。

你應該會看到使用者 1、區隔 power_user,以及互動分數 0.92。 這正是你在 Unity Catalog 中建立的同一列,現在在 Postgres 中以低延遲讀取功能提供。

了解更多: 資料型態映射

步驟 4:跨兩個環境查詢

這就是回報。 您的 playing_with_lakebase 表格包含作業資料。 你的 user_segments_synced 資料表具備 Lakehouse 分析功能。 加入他們:

SELECT
  p.id,
  p.name,
  p.value,
  s.segment,
  s.engagement_score
FROM playing_with_lakebase p
JOIN "default".user_segments_synced s ON p.id = s.user_id;

您的應用程式現在可以提供豐富的資料。 單一的 Postgres 查詢結合了應用程式所知道的內容(名稱、數值)與資料湖倉計算出的結果(區段、分數)。 無需對 Lakehouse 進行 API 呼叫,無需同步指令碼,也沒有延遲成本。

了解更多: 容量規劃

下一步