分布式训练为开发者和企业提供灵活、稳定、已用和高性能的机器学习训练环境。支持多种算法框架,能够处理大规模的分布式深度学习任务,用户可以通过【分布式训练】简单配置训练角色的数量及实例规格后,发起单机或大规模的分布式训练任务。
前提条件
为了方便您快速提交训练任务,您需要在创建训练任务前准备好所需的资源,并配置好可能需要使用的镜像、数据集和代码集。
准备资源
提交训练任务前,您需要准备计算资源,用于后续AI训练。以下资源任选其一即可:
- **公共资源:**每个集群下的公共资源池中都为您配置好了可共享使用的资源套餐,无需您手动执行任何操作。在您创建分布式训练任务时,支持选择共享资源套餐使用公共资源。
- **专属资源:**您可以预先创建专属资源池,并购买所需的节点资源。通过新增套餐来分配专属资源池中的资源。后续您只需将可以使用专属资源池的用户维护到该专属资源池中,就可以在创建分布式训练任务时,通过您配置的套餐使用该专属资源池中的计算资源。
准备镜像
提交训练任务前,您需要准备训练环境需要安装的镜像。以下镜像任选其一即可:
- **官方镜像:**平台提供了基于不同框架的官方镜像,此类镜像适合在类脑云平台上进行训练任务,能够获得更好的兼容性和性能。您可以在创建分布式训练任务时,通过官方镜像的筛选选择合适的镜像。
- **自定义镜像:**如果您的训练任务需要特殊的环境或依赖,可选择使用您添加到类脑云平台的自定义镜像,您可以通过创建自定义镜像,将自定义镜像维护到私有镜像仓库中,在您创建分布式训练任务时,可以通过自定义镜像的筛选选择合适的镜像。
准备数据集
- 提交训练任务前,您可以将训练任务需要的数据上传到文件存储,并将其创建为训练任务可直接使用的自定义数据集;
- 您也可以直接挂载文件存储或对象存储作为训练任务的训练集。
准备训练代码
提交训练任务前,您可以将训练任务可能需要使用的代码添加为代码集。为了方便管理和使用,建议您在平台的【代码管理】菜单中,将该代码添加到平台的代码仓库进行托管,便于多个训练任务直接选择使用。操作详情请参见代码管理。
操作步骤
通过控制台创建
1、左侧导航栏,【模型开发与训练】->【分布式训练】,进入分布式训练控制台页面;
2、单机列表页面左上方的【创建】进入创建页面;
3、在创建页面填写相关参数,具体参数如下:
| 参数名称 | 参数说明 |
|---|---|
任务名称 |
|
任务标签 |
|
存储挂载 | |
镜像选择 |
|
TensorBoard |
|
计算框架 |
|
任务配置 |
|
训练代码 |
|
环境变量 |
|
| 环境诊断 |
|
| 挂起检测 |
|
| 自动重试 |
|
4、参数配置完成后,单击确认完成任务创建。
通过命令行创建
1、根据您使用的操作系统下载Linux64或Mac版本的命令行工具。
2、Linux版本请把命令行工具安装在/usr/bin目录下。
3、macOS版本请把命令行工具放在终端访问的对应目录下即可使用。
4、安装好命令行工具后,通过命令行工具登录环境
bita login -u <username> -p <password> -e <url>
--username:用户登录的用户名
--password:用户登录的密码
--url:系统访问的路径
例如:bita login -u username -p password -e https://www.bitahub.com
5、通过yaml文件,可以进行任务的提交,命令如下:
bita apply -f [filename.yaml]
--filename.yaml可使用绝对路径或相对路径