你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn

在运行 Linux 的 N 系列 VM 上安装 NVIDIA GPU 驱动程序

适用于:✔️ Linux VM

重要

为与包容性语言实践保持一致,本文档将“黑名单”一词替换为“阻止名单”。 这种变化反映了一项承诺,以避免可能具有意外的负面内涵或感知的种族偏见的术语。 但是,在代码片段和技术引用中,“黑名单”是已建立语法或工具的一部分(例如配置文件、命令行参数),保留原始术语以保留功能准确性。 这种用法严格是技术性的,并不意味着任何歧视性意图。

若要利用由 NVIDIA GPU 支持的Azure N 系列虚拟机(VM)的图形处理单元(GPU)功能,必须安装 NVIDIA GPU 驱动程序。 NVIDIA GPU 驱动程序扩展在 N 系列 VM 上安装相应的 NVIDIA 计算统一设备体系结构(CUDA)或 GRID 驱动程序。 可以使用Azure门户或Azure PowerShell等工具来安装和管理扩展。 有关支持的操作系统(OS)和部署步骤,请参阅 NVIDIA GPU 驱动程序扩展文档

若要手动安装 NVIDIA GPU 驱动程序,请按照本文中所述的步骤进行操作。 手动驱动程序设置信息也适用于 Windows VM

有关技术规范,请参阅 GPU Linux VM 大小

警告

使用本文所述方法之外的其他方法安装 NVIDIA 驱动程序,可能会导致无法按预期完成驱动程序安装。 Microsoft和 NVIDIA 不支持此安装。 若要确保适当的功能和支持,请仅遵循安装步骤并使用本文中指定的驱动程序版本。


CUDA 驱动程序

NVIDIA 为 NCasT4_v3、NC_A100_v4 和 NCads_H100_v5 VM 分发 CUDA 驱动程序。

支持的 CUDA 驱动程序

有关最新的 CUDA 驱动程序和支持的 OS,请访问 NVIDIA 网站。 确保安装或升级到分发版支持的最新 CUDA 驱动程序。

CUDA 驱动程序安装

有关 CUDA 驱动程序安装,请访问 NVIDIA 网站

验证 CUDA 驱动程序安装

运行 nvidia-smi。 如果安装了驱动程序,NVIDIA SMI 会将 GPU-Util 列为 N/A,直到在 VM 上运行 GPU 工作负荷。


GRID 驱动程序

Microsoft为 NVv3、NCasT4_v3、NVadsA10_v5 和 NCv6 RTX PRO 6000 BSE VM 重新分发 NVIDIA GRID 驱动程序安装程序,这些安装程序用作虚拟工作站或虚拟应用程序。

支持的 GRID 驱动程序

仅在这些 VM 上安装这些 GRID 驱动程序,并且仅在下表中列出的操作系统上安装这些 GRID 驱动程序。 这些驱动程序包括Azure中 GRID 虚拟 GPU (vGPU) 软件的许可。 无需设置 NVIDIA vGPU 软件许可证服务器。

NCasT4_v3和 NCv6 RTX PRO 6000 BSE 系列是唯一支持 GRID 驱动程序的非 NV GPU VM 系列。

警告

NVadsA10_v5 VM 不再支持 NVIDIA v17.x (R550) GRID 驱动程序。 如果你尝试部署使用 v17.x 来宾驱动程序的 VM,而该 VM 被部署到安装了 v20.x 主机驱动程序的服务器上,则该 VM 将无法部署,并显示 Code 43 错误消息。

改为将 v18.x 来宾驱动程序用于下表中列出的 NVadsA10_v5 VM。

VM 系列 GPU GRID 驱动程序 支持的 Linux OS 版本
NCv6 RTX PRO 6000 BSE NVIDIA RTX PRO 6000 Blackwell Server Edition GPU (96GB) vGPU20.2 • Ubuntu 24.04 LTS
• Ubuntu 22.04 LTS
• Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 9.4、9.6、9.7
• Red Hat Enterprise Linux (RHEL) 8.10
• SUSE Linux Enterprise Server 15 SP7
NCasT4_v3 NVIDIA Tesla T4 GPU (16GB) vGPU20.2 • Ubuntu 24.04 LTS
• Ubuntu 22.04 LTS
• Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 9.4、9.6、9.7
• Red Hat Enterprise Linux (RHEL) 8.10
NVadsA10_v5 NVIDIA A10 GPU (24GB) vGPU18.8 • Ubuntu 24.04 LTS
• Ubuntu 22.04 LTS
• Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 9.4、9.6、9.7
• Red Hat Enterprise Linux (RHEL) 8.10
NVv3 (2026 年 9 月 30 日退休 NVIDIA Tesla M60 GPU (16GB) vGPU16 (LTS) • Ubuntu 20.04 LTS
• Red Hat Enterprise Linux (RHEL) 8.6、8.8、8.9

有关特定 vGPU 和驱动程序分支版本的详细信息,请访问 NVIDIA 网站。

GRID 驱动程序安装

  1. 确保禁用安全启动和 vTPM。

  2. 安装前提条件。

    Ubuntu:

    sudo apt update 
    sudo apt install -y build-essential 
    

    RHEL (8.10、9.4、9.6、9.7):

    sudo yum check-update 
    sudo yum install -y make automake gcc gcc-c++ kernel-devel-$(uname -r) kernel-headers-$(uname -r) 
    
  3. 下载 Linux 驱动程序。

    a. 对于 NCv6 RTX PRO 6000 BSE、NCasT4_v3:

    wget -O ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run https://download.microsoft.com/download/51239696-ec04-4c02-a6b3-1d9c608fb57c/NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    

    b. 对于 NVadsA10_v5:

    wget -O ./NVIDIA-Linux-x86_64-570.211.01-grid-azure.run https://download.microsoft.com/download/2a04ca6a-9eec-40d9-9564-9cdea1ab795f/NVIDIA-Linux-x86_64-570.211.01-grid-azure.run
    

    c. 对于 NVv3:

    wget -O ./NVIDIA-Linux-x86_64-535.161.08-grid-azure.run https://download.microsoft.com/download/8/d/a/8da4fb8e-3a9b-4e6a-bc9a-72ff64d7a13c/NVIDIA-Linux-x86_64-535.161.08-grid-azure.run
    
  4. 安装驱动程序。

    a. 适用于 NCv6 RTX PRO 6000 BSE:

    sudo chmod +x ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run -M open
    

    b. 对于 NCasT4_v3:

    sudo chmod +x ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-595.58.03-grid-azure.run
    

    c. 对于 NVadsA10_v5:

    sudo chmod +x ./NVIDIA-Linux-x86_64-570.211.01-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-570.211.01-grid-azure.run
    

    d. 对于 NVv3:

    sudo chmod +x ./NVIDIA-Linux-x86_64-535.161.08-grid-azure.run
    sudo ./NVIDIA-Linux-x86_64-535.161.08-grid-azure.run
    

验证 GRID 驱动程序安装

运行 nvidia-smi。 如果安装了驱动程序,NVIDIA SMI 会将 GPU-Util 列为 N/A,直到在 VM 上运行 GPU 工作负荷。


疑难解答

  • 可以使用 nvidia-smi 设置持久性模式,以便在需要查询卡时该命令的输出更快。 若要设置持久性模式,请运行 nvidia-smi -pm 1。 如果 VM 重新启动,则模式设置将消失。 始终可以编写模式设置脚本,以在启动时运行。

  • 如果作业被 GPU 上的 ECC 错误中断(可纠正或无法纠正),请先检查 GPU 是否符合 Nvidia 的任何 ECC 错误的 RMA 标准。 如果 GPU 符合 RMA 的条件,请联系支持人员获取服务;否则,请重启 VM 以重新附加 GPU,如下所示。 入侵性较低的方法(如 nvidia-smi -r)不适用于Azure中部署的虚拟化解决方案。


后续步骤