跳到主要内容
更新时间:2025-08-12 06:30:16

单机推理提供极简部署体验,用户仅需在部署页面填写模型部署的镜像、资源规格、端口号等必填字段,即可快速启动一个独立推理服务并获取API服务调用地址。该模块适用于快速验证模型效果或轻量级API发布场景,无需关注应用编排细节,实现模型即服务(Model-as-a-Service)的一键交付。

操作步骤

部署单机推理服务​

1、注册并登录平台,打开在线推理——>单机推理模块;

2、点击页面左上角部署按钮,打开服务部署页面;

3、在服务部署页面填写相关参数,具体参数如下:

参数名称参数描述
服务名称
  • 必填项,用以记录当前部署的服务信息;
  • 系统默认给与系统名称,用户可自行修改;
  • 输入限制:128字符以内,除表情符号等不常见字符外,其他字符均可输入;
资源类型(选择资源池)
  • 必填项,支持用户选择专属资源或公共资源;
  • 默认选择公共资源;
  • 全局参数;
实例数
  • 必填项,设置当前服务部署应用的实例信息,需输入1-24之间的整数;
  • 默认实例数为1;
实例规格
  • 必填项,设置服务所需的部署资源,用户可按需配置;
共享内存
  • 请确保其大于64MB,且不超过套餐内存大小;任务将优先采用实例规格配置大小;
镜像选择

支持四种选择镜像的方式:

  • 平台镜像:平台提供的公共镜像。
  • 自定义镜像:用户自定义的镜像,具体构建方式可见 自定义镜像 。
  • 共享镜像:其他用户对您共享的镜像。
  • 仓库地址:若您的任务镜像存储在外部镜像仓库下,支持输入外部公开镜像仓库地址,若您存储在外部镜像仓库且为私有镜像,则可通过仓库授权,输入账号密码进行仓库拉取。
  • 注意:

  • 选择的镜像支持的CPU架构必须和“资源池”套餐中的CPU架构匹配,例如x86-64的镜像只能选择 x86-64 CPU 的套餐,arm64的镜像只能选择arm64 CPU的套餐。

  • 通过仓库地址获取镜像时,需确保您当前的网络环境可正常拉取,若您拉取的是境外仓库,可能存在拉取失败的情况。

端口号
  • 必填项,部署服务时使用的端口号,需要与用户挂载的代码里或者用户镜像代码里推理服务监听的端口号一致,长度不超过6位数字,范围为1-65535;
网关配置
  • 必填项,部署推理服务时,需明确指定一个服务对外暴露公网访问地址;
  • 配置服务的网关路径,需要与用户挂载的代码里或者用户镜像代码里推理服务的路由url路径一致;即服务代码中定义的访问路径前缀。例如,若代码定义了路由 /api/v1 ,此处可填写 /、/api 或 /api/v1 ,请根据您希望暴露的路径层级进行选择
启动命令
  • 必填项,支持用户设置相关启动命令;
  • 应用启动时的启动命令,默认为sh -c,如果用户使用到bash的话,则可以加上bash 关键字,支持如下这些格式:
    • "bash" "-c" python llm_server.py
    • "bash" "python llm_server.py"
    • sh" "-c" python llm_server.py
    • "sh" "python llm_server.py"
    • bash python llm_server.py
    • "sh" python llm_server.py
    • sh python llm_server.py
    • sh -c python llm_ser
  • bash -c 'cd /code/stable-diffusion-webui-async-master_zk;python3 -u webui.py --listen --port 7860 --api --allow-code --enable-insecure-extension-access --medvram --xformers --skip-version-check --no-hashing --no-download-sd-model --skip-prepare-environment --api-log --time-log --ckpt-dir /input/col-models/col-sd 2>&1 | tee webui.log'  
    • 对于比较复杂的推理的启动命令,暂不支持启动命令带反斜杠\ ,可以参考这个上面的命令的格式,用sh -c 或者bash -c 后面引号包裹长命令
选择模型

支持用户挂载存储目录下的数据,选择存储目录后,用户可自行修改容器内的挂载路径,系统将提供默认路径,用户也可自定义挂载路径

注意:同时挂载多个存储路径时挂载路径不允许重复,否则无法成功创建任务。

  • 支持用户选择挂载存储路径,挂载时需确保提前已在文件存储模块创建并维护好数据集目录。

image.png
  • 支持用户选择挂载模型,挂载时需确保提前已在模型管理模块创建并维护好模型目录。
image.png
环境变量
  • 部署服务时设置的环境变量,包含Key和Value,这里主要是用户代码里使用到的环境变量的设置;最多支持填写20对;
单次部署失败最大重试次数
  • 支持用户配置最大的失败重试机制;最小2次,最多5次,配置后对于有异常导致自动重启的推理服务,超出设置数量后将不再重试,并且系统将在服务重试次超过配置的次数后置为失败状态并清理相关资源,减少异常资源占用您的算力资源;
  • 全局配置;
API认证
  • 支持用户开启和关闭API认证方式;开启后,用户通过API访问时需输入认证信息,类似于token认证;
  • 全局配置;
最长等待时间
  • 任务提交后的最长等待时间,超出则置为失败,减少无效等待时间;
  • 全局配置;
Serverless
  • 选填项,支持用户设置服务进入休眠的等待时间;
  • 开启支持Serverless配置后,若服务连续N分钟未在使用,⽀持副本缩减到 0,在有请求的情况下快速将服务副本拉起,提高集群整体利用率;
  • 副本为0时不会对用户进行服务扣费;
  • 全局配置;
image.png
弹性伸缩
  • 选填项,⽀持基于监控指标的弹性伸缩⽀持,允许您根据实际需求灵活地进行资源扩缩,您可以选择自定义资源指标(如GPU利用率、GPU利用率显存、cpu利用率、内存利用率、推理服务http请求QPS指标等)作为扩缩容依据,以确保资源的高效利用和系统的稳定运行
  • 最小实例数:设置系统在任何情况下至少保持运行的实例数量。建议根据业务最低需求设定,避免资源浪费。当开启serverless功能时,此处默认是0
  • 设置系统在任何情况下最多可扩展到的实例数量。请根据您的套餐内存大小和预算合理设定,避免超出限制。
  • 0 <= 最小实例数 <= 实例数 < 最大实例数
  • 全局配置;
image.png
代码配置
  • 选填项,关联运行模型时的代码文件;
  • 部署服务时使用的代码库类型,可选择私有仓库或公开仓库,并输入相关的代码库信息(模块授权代码、代码库、分支等);具体操作参考可见代码管理;

信息确认后,点击确认按钮,系统将进行单机推理服务的部署启动。

API认证​

  • 用户创建推理服务,开启API认证后,可在服务详情页——>基础信息查看服务信息,可通过接口请求工具进行接口访问。如postman,key和token值塞进header里

image.png

serverless​

Serverless 即支持副本数为0,是一种云计算架构模式,用户无需关心服务器的管理、维护和扩展,只需将服务部署好,平台将根据服务的访问情况动态进行资源分配、自动扩展,确保闲忙时期的资源和用户访问合理分配。使用该功能时有以下注意事项:

  • 在服务部署页面的高级配置模块打开支持副本数为0的开关;
  • 支持用户自定义空闲时间,范围为10-60分钟;空闲时间是指当前部署在设置时间范围内无请求流量,超出则平台进行副本为0处理;
  • 副本缩为0后,系统将不会对服务进行收费;
  • 当缩为0后用户再请求时,响应时间会受网络、模型大小等影响而变化,建议副本缩为0后,用户首次请求启动服务时进行服务激活再进行正式请求,以防请求丢失;

image.png

弹性伸缩​

弹性伸缩允许用户根据应用程序的负载情况自动增加或减少 Pod 的数量,以确保应用程序的性能和可用性。通过自动监控应用程序的负载度量指标,并根据负载情况自动增加或减少 Pod 的数量,以满足应用程序的性能和可用性要求。这样可以更好地应对流量波动和负载变化,同时提高集群资源利用率。使用该功能时有以下注意事项:

  • 在服务部署页面的高级配置模块打开开启弹性伸缩的开关;
  • 用户可按需配置扩缩容指标和实例范围,如果只开启弹性伸缩没开启serverless,则实例范围为1-100,如果开启了serverless,则则实例范围为0-100;
  • 平台将根据用户对服务的请求情况以及资源使用情况动态实现实例副本的扩缩;
  • 每个指标只可设置一次,单个服务最多可设置5组指标,指标间为或关系,满足一条即触发扩缩容;

扩缩容指标包括:

CPU利用率阈值:指标范围为10%-100%,服务运行时资源超出阈值后,将按需进行实例扩充;

内存使用率阈值:指标范围为10%-100%,服务运行时资源超出阈值后,将按需进行实例扩充;

GPU利用率阈值:指标范围为10%-100%,服务运行时资源超出阈值后,将按需进行实例扩充;

GPU显存使用率阈值:指标范围为10%-100%,服务运行时资源超出阈值后,将按需进行实例扩充;

HTTP请求QPS指标阈值:指标范围为20-无上限 次/秒,服务运行时资源超出阈值后,将按需进行实例扩充;

image.png