跳到主要内容
更新时间:2025-12-01 08:43:02

分布式推理是平台面向大规模参数模型(如十亿/百亿级 LLM)提供的高性能部署能力。通过 Master-Worker 架构、节点横向扩展以及 PD(Prefill/Decode)分离模式,用户可快速构建具备 高并发、高吞吐、低时延 的推理服务。

该功能适用于:

  • 模型规模较大、单机现存不足的推理任务
  • 高并发业务场景,如在线对话、内容生成、信息抽取等
  • 对推理延迟敏感,希望通过PD分离提升整体吞吐的业务
  • 希望灵活选择vLLM/SGLang等性能框架,获得最佳推理性能

平台已提供可视化配置能力,用户无需了解复杂的分布式部署细节即可完成推理服务搭建。

Master-Worker 架构的一键式部署无需复杂脚本,快速启动分布式推理集群
支持标准模式 & PD 分离模式按业务场景灵活优化吞吐(标准)或降低延迟(PD 分离)
多框架支持(vLLM / SGLang / 自定义)满足不同模型生态的最佳实践
节点数、角色配置灵活支持超大规模集群部署
完善的监控、日志、历史记录清晰定位性能瓶颈与资源用量

操作步骤

部署分布式推理服务​

1、注册并登录平台,打开在线推理——>分布式推理模块;

2、点击页面左上角部署按钮,打开服务部署页面;

3、在服务部署页面填写相关参数,具体参数如下:

导航名称

字段名

解释说明

基础信息

服务名称

  • 分布式推理服务创建时的名称(集成Haikunator组件随机生成);
  • 必填项,若自定义,则不超过128字符、不支持表情符号;

 

环境配置

镜像选择

  • 必填,支持平台镜像、自定义镜像、共享镜像、第三方仓库拉取共四种方式,功能与开发环境一致,没有新增或修改;

网关配置

  • 必填,仅支持输入自定义网关地址;仅支持输入path路径,默认为根目录/;输入框限制与当前一致;

选择模型

  • 非必填,支持文件存储与模型挂载。其中模型挂载当前仅支持从控制台模型库中选择模型(即只能选择共享存储中存在的模型),后续会进行门户与控制台模型库的打通;

运行环境

资源类型

  • 必选,默认公共资源,包含「公共资源」和「专属资源池」,选择专属资源池,展示资源池名称,通过下拉选进行选择;

推理模式

  • 必选项,单选,包含:「标准模式」和「PD分离模式」
    • 标准模式:实例配置直接展示;
    • PD分离模式:实例配置分为两个页签,分别为「Prefill」和「Decode」;

实例配置

  • 角色信息:
    • Role:必填,默认展示两个角色输入框。第一个的Role名称默认「master」,第二个Role名称默认「worker」;
    • 节点数量:必填,默认为1,「master」不支持修改,「worker」支持修改,上限限制为9999;
    • 启动命令:非必填,shell编辑器,默认不输入,支持用户自定义。支持查看vLLM和SGLang的命令模版,支持一键导入到编辑器内进行修改;
  • 实例数:必填,默认为1,限制1-24的整数,支持用户自定义;
  • 实例规格:展示方式为侧边栏,点击输入框后弹出,选择完成后,在输入框内回显实例规格名称;
  • 共享内存:默认所选套餐内存的50%;页面提供该字段解释说明,内容见原型;
  • 端口号:必填,长度不少于4位数,1-65535之间的整数;

高级配置

环境变量

  • 非必填,部署服务时设置的环境变量,包含Key和Value,这里主要是用户代码里使用到的环境变量的设置;最多支持填写10对;

API认证
  • 支持用户开启和关闭API认证方式;开启后,用户通过API访问时需输入认证信息,类似于token认证;
  • 全局配置;

代码配置

  • 非必选,关联运行模型时的代码文件;

  • 部署服务时使用的代码库类型,可选择私有仓库或公开仓库,并输入相关的代码库信息(模块授权代码、代码库、分支等);具体操作参考可见代码管理;

信息确认后,点击确认按钮,系统将进行单机推理服务的部署启动。

推理模式选择​

平台当前支持两类分布式推理模式:标准模式与 PD 分离模式。不同模式适用于不同的业务场景,用户可在创建服务时按需选择。

1. 标准模式(Standard Mode)​

标准模式采用 Master–Worker 架构,并内置统一路由能力。

  • Master 节点:负责任务调度、集群管理和流量路由。

  • Worker 节点:执行实际的推理计算。

该模式适用于传统的大模型推理部署场景,部署简单且资源利用稳定。

2. PD 分离模式(Prefill–Decode Disaggregation Mode)​

PD 分离模式将推理解耦为 Prefill(预填阶段) 与 Decode(解码阶段),并新增 智能路由节点 实现自动流量调度。

  • Prefill 节点:负责处理 Token 生成前的计算密集阶段。

  • Decode 节点:负责 Token 逐步生成过程的轻量化计算。

  • 智能路由节点:仅负责流量分发,不参与推理计算。

  • Prefill 与 Decode 均采用 Master–Worker 架构,可分别独立扩缩容。

该模式适用于高并发、长文本生成、吞吐敏感等场景,可显著提升整体服务性能。

**注:**在推理服务运行中,业务指标数据,可通过「资源监控」中,「智能路由」的业务指标查看

image.png