跳到主要内容

创建 DeepSpeed 分布式训练

更新时间:2025-08-18 14:42:14

DeepSpeed 是基于 PyTorch 的深度学习训练优化框架,支持万亿参数规模的模型训练,提供高效的分布式并行策略(如流水线并行、张量并行、ZeRO 优化)、显存占用优化和算力加速,使得用户能够在更少的硬件资源上实现更快、更大规模、更具成本效益的训练与推理。

前提条件​

  • 选择的镜像中需要已安装 DeepSpeed、openssh-server。

操作步骤​

请参考创建分布式训练模块填写基本配置,计算框架选择 DeepSpeed。

任务配置中固定有2个 Role(节点组):

  • master:只有1个节点,执行发起 deepspeed 训练的节点,通过训练任务节点间免密 SSH 通信在其他 worker 节点同步启动训练。
  • worker:可设置多个节点,每个 worker 节点仅启动 sshd 服务,等待 master 节点发起训练。

在 master 节点输入启动命令示例如下

deepspeed \
--hostfile=/etc/deepspeed/hostfile \
<client_entry.py> \
<client args> \
--deepspeed \
--deepspeed_config ds_config.json

其中

  • --hostfile 文件中记录了当前 master 和 worker 所有节点地址及每个节点中 GPU 数量,请使用固定文件 /etc/deepspeed/hostfile,改文件由平台生成内置。文件内容示例如下:

    # 节点名称 节点GPU数量
    job1-master-0.job1 slots=8
    job1-worker-0.job1 slots=8
    job1-worker-1.job1 slots=8
  • <client_entry.py>是您的启动脚本。

  • <client args>是你启动脚本接收的参数。

更多 DeepSpeed 使用方法请参考 DeepSpeed 官方文档: