创建 DeepSpeed 分布式训练
更新时间:2025-08-18 14:42:14
DeepSpeed 是基于 PyTorch 的深度学习训练优化框架,支持万亿参数规模的模型训练,提供高效的分布式并行策略(如流水线并行、张量并行、ZeRO 优化)、显存占用优化和算力加速,使得用户能够在更少的硬件资源上实现更快、更大规模、更具成本效益的训练与推理。
前提条件
- 选择的镜像中需要已安装 DeepSpeed、openssh-server。
操作步骤
请参考创建分布式训练模块填写基本配置,计算框架选择 DeepSpeed。
任务配置中固定有2个 Role(节点组):
- master:只有1个节点,执行发起 deepspeed 训练的节点,通过训练任务节点间免密 SSH 通信在其他 worker 节点同步启动训练。
- worker:可设置多个节点,每个 worker 节点仅启动 sshd 服务,等待 master 节点发起训练。
在 master 节点输入启动命令示例如下
deepspeed \
--hostfile=/etc/deepspeed/hostfile \
<client_entry.py> \
<client args> \
--deepspeed \
--deepspeed_config ds_config.json
其中
-
--hostfile文件中记录了当前 master 和 worker 所有节点地址及每个节点中 GPU 数量,请使用固定文件/etc/deepspeed/hostfile,改文件由平台生成内置。文件内容示例如下:# 节点名称 节点GPU数量job1-master-0.job1 slots=8job1-worker-0.job1 slots=8job1-worker-1.job1 slots=8 -
<client_entry.py>是您的启动脚本。 -
<client args>是你启动脚本接收的参数。
更多 DeepSpeed 使用方法请参考 DeepSpeed 官方文档: