適用於:✅ Fabric 資料工程與資料科學
當你在 Fabric 建立工作區時,會自動建立一個與該工作區相關的起始池。 在 Fabric 的簡化設定中,不需要選擇節點或機器尺寸,這些選項都在幕後自動處理。 此設定提供更快速 (5-10 秒) 的 Apache Spark 工作階段啟動體驗,讓使用者在許多常見案例中開始使用和執行 Apache Spark 工作,而不必擔心設定計算。 針對具有特定計算需求的進階案例,使用者可以建立自訂 Apache Spark 集區,並根據節點的效能需求來調整節點大小。
若要變更工作區中的 Apache Spark 設定,需擁有該工作區的管理員角色。 若要深入了解,請參閱<工作區中的角色>。
若要管理與您的工作區相關聯的資源池的 Spark 設定:
前往工作區中的 [工作區設定],然後選擇 [資料工程/科學] 選項以展開功能表:
您會在左側功能表中看到 Spark Compute 選項:
注意
如果將預設集區從 [入門集區] 變更為 [自訂 Spark 集區],這可能會導致較長的會話啟動時間 (~3 分鐘)。
資源池
工作區的預設集區
您可以為工作區使用自動建立的入門集區,或建立自訂集區。
入門集區:預先潤濕的即用集區會自動建立,帶來更快速的體驗。 這些叢集為中型大小。 入門集區會根據購買的 Fabric 容量 SKU 設定為預設組態。 管理員可以根據其 Spark 工作負載規模需求來自訂最大節點和執行程式。 若要深入了解,請參閱<設定入門集區>。
自訂 Spark 集區:您可以根據您的 Spark 工作需求調整節點大小、自動縮放,以及動態配置執行程式。 若要建立自訂 Spark 集區,容量管理員應該在容量管理員設定的[Spark 運算]區段中啟用[自訂工作區集區]選項。
注意
預設啟用自訂工作區集區的容量層級控制。 若要深入了解,請參閱<設定和管理 Fabric 容量的資料工程和資料科學設定。
管理員可以選取 [新增集區] 選項,根據計算需求建立自訂 Spark 集區。
Apache Spark for Fabric 支援單一節點叢集,允許使用者選擇最小節點配置為 1,此時驅動程式與執行器可在單一節點中運行。 這些單一節點叢集可在節點失敗期間提供可還原的高可用性,併為具有較小計算需求的工作負載提供更好的作業可靠性。 您也可以為自訂 Spark 集區啟用或停用自動縮放選項。 啟用自動縮放時,集區會在使用者指定的最大節點限制內取得新的節點,並在工作執行之後淘汰這些節點,以提升效能。
您也可以選取選項,以動態方式配置執行程式,以根據資料磁碟區在指定的最大界限內自動將最佳數目的執行程式設為集區,以獲得更佳的效能。
深入了解適用於 Fabric 的 Apache Spark 計算。
- 自訂項目計算組態:作為工作區管理員,您可以允許使用者為各個項目(例如使用環境中的筆記本、Spark 作業定義)調整計算組態,這些組態為工作階段層級屬性,包括驅動程式/執行程式核心和驅動程式/執行程式記憶體。
如果工作區管理員關閉設定,預設集區及其計算組態會用於工作區中的所有環境。
環境
環境提供彈性的設定來執行 Spark 工作 (筆記本、Spark 工作定義)。 在環境中,可根據工作負載需求設定計算屬性、選取不同的執行階段、設定程式庫封裝相依性。
在 [環境] 索引標籤中,有設定預設環境的選項。 您可以選擇要用於工作區的 Spark 版本。
Fabric 工作區管理員可以選取一個 [環境] 作為工作區預設環境。
您也可以透過 [環境] 下拉式清單建立新的環境。
如果您停用預設環境的選項,可以選擇從下拉式清單中所列的可用執行階段版本選取 Fabric 執行階段版本。
深入了解 Apache Spark 執行階段。
工作
作業設定可讓系統管理員控制工作區中所有Spark作業的作業許可邏輯。
根據默認設定,所有工作區都會啟用樂觀的工作接納模式。 了解更多關於 Spark 在 Fabric 工作申請的資訊。
您可以啟用 保留最大核心以供活躍的 Spark 作業使用 ,以關閉樂觀式作業准入方式,並為其 Spark 作業保留最大核心。
您也可以設定 Spark 會話逾時,用於自訂筆記本互動會話的到期時間。
注意
互動式 Spark 工作階段的預設到期時間設為 20 分鐘。
設定最大工作壽命
使用 設定最大工作生命週期 設定作為護欄,防止失控的 Spark 工作在設定時間限制後消耗運算。 當你開啟此設定並指定持續時間時,Fabric 會自動終止任何超過設定壽命的合格 Spark 工作。 工作區管理員可利用此控制權:
- 在工作空間無法無限期佔用或阻塞工作前,阻止它們失控或卡住工作空間。
- 透過限制單一工作執行的時間,來強制執行計算合規與治理政策。
要設定,請開啟 設定最大工作壽命,輸入數值,選擇時間單位(如 工時),然後選擇 儲存 以套用工作區的限制。
哪些工作會受到影響
最大工作壽命僅適用於 使用者提交的作業 ——即使用者明確啟動並以使用者身份執行的工作。 這些工作包括,例如:
- 互動式與排程筆記本運行,包括透過管線協調的筆記本運行。
- Spark 工作定義會執行,不論你是直接提交、排程提交,還是透過管線提交。
- Livy 批次與互動式會話,包括高並發性會話。
系統管理的工作不受 此設定影響,且會持續執行直到完成。 這些工作由 Fabric 代表你觸發並管理,例如:
- 湖屋桌維護作業,例如優化和吸塵。
- 實體化的湖景煥然一新。
- 平台操作,例如安全和政策執行。
這種區分確保背景維護與平台運作不會中斷,維持資料與工作空間的健康,而使用者工作負載則受限於安全。
注意
當工作達到設定的最大壽命時,Fabric 會自動取消該任務。 設定一個限制,讓你最長壽的合法使用者工作有足夠時間完成。
高並行
高並行模式可讓使用者在 Apache Spark 中的 Fabric 資料工程和資料科學工作負載中同時使用相同的 Spark 工作階段。 如筆記本等項目會使用 Spark 工作階段來執行,且在啟用時,使用者可跨多個筆記本共享單一 Spark 工作階段。
深入了解 適用於 Fabric 的 Apache Spark 中的高並行。
機器學習 模型與實驗的自動記錄
管理員現在可以為其機器學習模型和實驗啟用自動記錄功能。 此選項會在訓練時自動擷取機器學習模型的輸入參數、輸出計量和輸出項目的值。 深入了解自動記錄。
相關內容
- 閱讀 Fabric 中的 Apache Spark 執行階段 - 概觀、版本控制、多重執行階段支援,以及升級 Delta Lake 通訊協定。
- 若要深入了解,請參閱 Apache Spark 公開文件。
- 尋找常見問題的解答:Apache Spark 工作區系統管理設定常見問題。