Important
此功能目前以公共预览版提供。
Genie Code 可帮助您在已连接到 AI Runtime 的笔记本环境中开发和排查深度学习工作负载问题。 它可以生成分布式训练代码,解决环境和依赖问题,并调查GPU工作负载故障。
Requirements
要将 Genie Code 与 AI 运行时配合使用:
- 满足 Genie Code 智能体功能要求。
- 能够在同时支持这两种产品的区域中访问 AI Runtime。 请参阅 AI 运行时需求 和 Genie Code 地理可用性。
- 利用无服务器GPU计算将笔记本连接到AI运行时。 参见 “连接AI运行时”。
开始
打开一个Azure Databricks笔记本。
将笔记本连接到 AI 运行时。 参见 “连接AI运行时”。
打开精灵代码窗格。
描述你想开发的工作量或你想解决的问题。
在批准前,请审查拟议的计划、规范变更和相关行动。
Important
精灵代码会犯错。 在运行生成代码、环境变更及其他拟议操作前,请先审查。 有些诊断需要额外的日志或工作量背景。
Genie Code 可以提供哪些帮助?
开发分布式训练工作负载
Genie Code 可以生成或更新 AI 运行时的训练代码。 它可以帮助你选择合适的PyTorch分布式策略,使用 @distributed 包中的 serverless_gpu API,并应用AI运行时模式进行数据加载、检查点和机器学习流跟踪。 关于API的详细信息和示例,请参见 “笔记本中的分布式训练”。
解决环境和依赖问题
Genie Code 可以检查当前环境,区分软件包兼容性失败与代码或 API 变更,并推荐有针对性的修复方案。 它还能帮助你根据工作负载的依赖性在Databricks AI和标准环境之间做出选择。 有关可用环境的信息,请参见 “设置您的环境”。
调试GPU和分布式工作负载
Genie Code 可以利用笔记本输出和可用日志来调查分布式训练失败、通信错误、训练卡顿和 GPU 内存问题。 它可以帮助识别原始故障,并将其与其他等级的下游错误区分开来。 有关查看分布式训练日志的信息,请参见 实验跟踪与可观测性。
示例提示
开发分布式训练工作负载
- “更新本笔记本,在AI运行时中对所有八块H100 GPU运行分布式训练。”
- 检查这个分布式训练笔记本,并修正其中对
serverless_gpu和 MLflow 的使用。 - 将此训练工作负载适配为 AI Runtime,并说明其中的重要变更。
解决环境和依赖问题
- “这本笔记本在我安装新包后就坏了。 检查环境,确定问题是依赖问题还是代码API变更。”
- “这个工作负载应该使用Databricks AI还是标准环境? 在更改任何东西之前,先审查其依赖关系并推荐环境。”
- “诊断此包兼容性错误,并建议最小的适当更改。”
调试GPU和分布式工作负载
- “用每个等级的可用输出分析这次失败的分布式训练运行,找出根本原因。”
- 为什么这个分布式工作负载会卡住? 请使用笔记本输出来推荐下一步调试步骤。”
- “调查这次GPU内存故障,并建议有证据支持的下一步。”