適用於:Azure Local 的超融合部署
本文說明如何修復 Azure 本機實例上的節點。 在本文中,每部伺服器稱為節點。
關於修復節點
Azure Local 是超融合系統,可讓您從現有系統修復節點。 如果系統中出現硬體故障,你可能需要修復節點。
在修復節點之前,請務必洽詢解決方案提供者,節點上哪些元件是現場更換單位 (FRU),您可以自行取代哪些元件,哪些元件需要技術人員來取代。
支援熱插拔的元件通常不需要您重新安裝系統節點,不像主機板等非熱插拔元件則需要。 請洽詢硬體製造商,以判斷哪些元件更換需要您重新安裝這個節點。 如需詳細資訊,請參閱 元件取代。
修復節點工作流程
下列流程圖顯示修復節點的整體程式。
*節點可能尚未處於可關機或必要的狀態*
若要修復現有的節點,請遵循下列高階步驟:
可能的話,請關閉您想要修復的節點。 根據節點的狀態,可能無法或不需要關機。
重新重建需要修復的節點。
執行修復節點作業。 Azure Stack HCI 操作系統、驅動程式和韌體會在修復作業中更新。
重新映像的節點上會自動重新平衡儲存空間。 記憶體重新平衡是一項低優先順序工作,可根據節點數目和使用的記憶體,執行數天。
支援的案例
修復節點會重新初始化節點,並將它以先前的名稱和配置帶回系統。
修復單一節點會導致重新部署,並且可以選擇將資料卷持續保留。 部署過程中,只有系統磁碟區會被刪除並重新配置。
重要
確保你工作負載隨時備份,不要只依賴系統的韌性。 這種預防措施在單節點情境中尤其重要。
復原設定
在這個版本中,對於修復節點操作,並不會在您部署後建立的工作負載卷上執行特定任務。 針對修復節點作業,只有必要的基礎結構磁碟區和工作負載磁碟區會還原併呈現為叢集共用磁碟區(CSV)。
部署后建立的其他工作負載磁碟區仍會保留,而您可以執行 Get-VirtualDisk Cmdlet 來探索這些磁碟區。 你必須手動解鎖該卷(如果卷有啟用 BitLocker),並建立 CSV 檔(如果需要的話)。
硬體需求
修復節點時,系統會驗證新的傳入節點的硬體,並確保節點符合硬體需求,再將它新增至系統。
| 元件 | 合規性檢查 |
|---|---|
| CPU | 驗證新節點的 CPU 核心數目相同或更多。 如果傳入節點上的 CPU 核心不符合此需求,則會顯示警告。 此作業是允許的。 |
| 記憶體 | 驗證新節點已安裝相同數量的或更多記憶體。 如果傳入節點上的記憶體不符合此需求,則會顯示警告。 此作業是允許的。 |
| 磁碟機 | 驗證新節點是否具有相同數目的資料磁碟可供「儲存空間直接」使用。 如果傳入節點上的磁碟驅動器數目不符合此需求,則會報告錯誤並封鎖作業。 |
節點替換
你可以替換整個節點:
- 與舊節點相比,新節點具有不同的序號。
- 在重新映射之後,使用目前的節點。
在節點替換過程中,支援下列情境:
| 節點 | 磁碟 | 支援 |
|---|---|---|
| 新節點 | 新磁碟 | 是的 |
| 新節點 | 目前的磁碟 | 是的 |
| 目前節點 (重新映射) | 新磁碟 | 是的 |
| 目前節點 (重新映射) | 目前的磁碟 | 是的 |
| 目前節點 (重新映射) | 重新格式化目前的數據磁碟 | 不 |
重要
如果您在節點修復期間取代元件,則不需要取代或重設數據磁碟驅動器。 如果你更換或重置硬碟,當節點加入系統時,硬碟就無法被辨識。
元件更換
在您的 Azure 本機執行個體上,不可熱交換的元件包含下列項目:
- 主機板/基礎板管理控制器 (BMC)/視訊卡
- 磁碟控制器/主機總線適配卡(HBA)/背板
- 網路介面卡
- 圖形處理單位
- 資料磁碟機 (不支援熱插拔的磁碟機,例如 PCI-e 附加介面卡)
非熱交換元件的實際更換步驟會根據您的原始設備製造商 (OEM) 硬體廠商而有所不同。 如果需要針對非熱插拔元件進行節點修復,請參閱 OEM 廠商的文件。
必要條件
在修復節點之前,您必須確定:
- Active Directory 中的
AzureStackLCMUser正在運行。 如需詳細資訊,請參閱 準備 Active Directory。 - 以
AzureStackLCMUser或具有相同許可權的其他使用者身分登入。 -
AzureStackLCMUser的認證尚未變更。
如果需要,將你指定要修復的節點離線。 請遵循這裡的步驟:
- 在離線前先確認節點是否健康。
- 暫停並清空節點。
- 關閉節點。
修復節點
本節說明如何使用 PowerShell 修復節點、監視Repair-Server作業的狀態,並在發生任何問題時進行疑難排解。
請確定您已檢閱 必要條件。
在嘗試修復的節點上遵循下列步驟。
在您想要修復的節點上安裝作業系統和必要的驅動程式。 請遵循 安裝 Azure Stack HCI作系統 23H2 版中的步驟。
注意
- 對於版本 2503 及以上,你必須使用與現有叢集上運行的相同解決方案的作業系統映像檔。
- 使用 Get solution version 來識別你在叢集上執行的解決方案版本。
- 使用 OS映像 數據表來識別並下載適當的OS映像版本。 不要使用 Azure 入口網站,因為它沒有列出所有可用的作業系統映像版本,也可能沒有所需的匹配版本。
- 確保管理網路介面卡名稱與其他節點使用的名稱(通常是管理)相符。 例如:
Rename-NetAdapter -Name "<current-adapter-name>" -NewName "Management"。
使用 Arc 註冊節點。請遵循 使用Arc註冊並設定許可權中的步驟。
注意
您必須使用與現有節點相同的參數,向Arc註冊。例如:資源組名、區域、訂用帳戶和租使用者。
將下列權限指定給已修復的節點:
- Azure Stack HCI 裝置管理 角色
- 金鑰保存庫 秘密使用者 如需詳細資訊,請參閱 將許可權指派給節點。
在另一個屬於相同 Azure 本機實例的節點上,遵循這些步驟。
請使用您在系統部署期間提供的網域用戶憑證,登入已是系統成員的節點。 執行下列命令以修復傳入節點:
$Cred = Get-Credential Repair-Server -Name "<Name of the new node>" -LocalAdminCredential $Cred注意
節點名稱必須是 NetBIOS 名稱。 參數
LocalAdminCredential預設是 Windows 作業系統安裝所建立的內建管理員帳號。記下由
Repair-Server命令輸出的操作識別碼作為輸出結果。 您稍後會使用此作業標識碼來監視作業的Repair-Server進度。
監視作業進度
若要監視新增節點作業的進度,請遵循下列步驟:
執行下列 Cmdlet,並提供上一個步驟中的作業標識碼。
$ID = "<Operation ID>" Start-MonitoringActionplanInstanceToComplete -actionPlanInstanceID $ID作業完成之後,背景記憶體重新平衡作業將會繼續執行。 等候記憶體重新平衡工作完成。 若要確認此記憶體重新平衡作業的進度,請使用下列 Cmdlet:
Get-VirtualDisk|Get-StorageJob如果記憶體重新平衡作業已完成,Cmdlet 將不會傳回輸出。
復原案例
下列復原案例和建議的緩和步驟會針對修復節點進行表化:
| 案例描述 | 緩解 | 有支援嗎? |
|---|---|---|
| 修復節點作業失敗。 | 若要完成這項操作,請調查問題原因。 使用 Repair-Server -Rerun重新執行失敗的作業。 |
是的 |
| 修復節點作業部分成功,但必須從全新操作系統安裝開始。 | 在此案例中,協調器(也稱為生命週期管理員)已使用新節點更新其知識存放區。 使用修復節點場景。 | 是的 |
疑難排除
從 2508 版開始,驗證會在您執行 Repair-Server 指令之後執行。 如果測試失敗,驗證器會傳回資訊以協助您解決失敗。
以下是驗證失敗訊息的範例:
如果您在修復節點時遇到失敗或錯誤,您可以在記錄檔中擷取失敗的輸出。
使用您在部署系統期間提供的網域用戶認證登入。 將問題記錄在記錄檔中。
Get-ActionPlanInstance -ActionPlanInstanceID $ID |out-file log.txt若要重新執行失敗的作業,請使用下列 Cmdlet:
Repair-Server -Rerun
如果您在修復節點作業期間遇到問題,且需要Microsoft支援方面的協助,您可以遵循 收集 Azure 本機診斷記錄中的步驟(預覽版) 來收集和傳送診斷記錄至Microsoft。
您可能需要從正在修復的節點提供診斷記錄。 請確定您從這個節點執行 Send-DiagnosticData Cmdlet。
下一步
深入瞭解如何 新增節點。