最近更新时间:2026-08-18 21:09:50
本文介绍如何在金山云KEC GPU实例中,使用镜像市场中的DeepSeek-R1-Distill-Qwen-1.5B镜像,部署vLLM服务,如vLLM 部署所需环境信息、推荐配置及使用方法,具体包括支持的模型、环境参数、适用场景以及如何启动和验证推理服务,帮助用户快速完成大语言模型推理任务的部署。
vLLM 部署提供支持,适用于高性能大语言模型的推理和微调任务,支持 DeepSeek 系列模型运行,详细环境如下:
Python: conda 环境下 3.12.8,可指定 3.10.12
vLLM: 0.6.6
PyTorch: 2.5.1
CUDA: 12.4
miniconda3: 24.11.1
低成本模型体验与学习:若您希望以最小成本体验 DeepSeek 模型的完整部署流程,或用于个人学习/教学演示,云服务器 CPU 实例可满足基础需求。相较于 GPU 实例,其无需额外硬件投入,且通过多核并行计算能力可支持轻量化推理,显著降低学习与实验成本。
开发环境快速搭建与调试:在模型开发调试阶段,使用 CPU 实例可规避 GPU 驱动、CUDA 版本依赖等复杂环境配置问题,简化开发流程。尤其适用于代码逻辑验证、接口测试等非性能密集型场景,减少因环境兼容性导致的调试时间损耗。
轻量级生产任务处理:对于低频调用或小批量数据处理,云服务器 CPU 实例凭借多核资源与高内存带宽,可高效完成任务。典型场景包括企业内部知识库问答、周期性报表生成等轻量级 AI 应用。
以A10机型为例,相应DeepSeek-R1蒸馏模型所需资源配置如下:
模型 | 推荐配置实例规格 | 先卡数 |
|---|---|---|
DeepSeek-R1-Distill-Qwen-1.5B | GPU 计算型 GN7I.16C1 | 1 卡 |
DeepSeek-R1-Distill-Qwen-32B | GPU 计算型 GN7I.16C4 | 4 卡 |
登录金山云控制台,在顶部搜索框输入KEC,选择控制台 > 云服务器,进入云服务器控制台页面。
在左侧导航栏,选择实例,点击+新建。
在自定义购买页面,参考以下说明配置各项参数。
架构:选择GPU。
套餐规格:本示例选择GN7I.16C1 (GPU通用计算型GN7I, 16核 64GB)。
镜像类型:选择镜像市场。
镜像:选择工具软件 > DeepSeek-R1-Distill-Qwen-1.5B。
系统盘:选择ESSD云硬盘。
性能级别:选择PL1。
容量范围:至少100GB。
安全组(防火墙):所选安全组须添加入站规则并放行22、8000端口。
弹性IP:
选择购买弹性IP可立即绑定
选择稍后购买,则需实例创建完成后手动绑定弹性IP。
其他参数根据根据实际情况进行设置即可。
点击立即购买,完成相应实例的创建。
进入 root 模式。
sudo su执行如下命令,启动 vLLM API 服务。
vllm serve <大模型路径> --port 8000 -tp <GPU卡数> 本示例使用DeepSeek-R1-Distill-Qwen-1.5B模型,GPU卡数为1,故实际命令为:
vllm serve /model/HuggingFace/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --port 8000使用镜像内置 deepseek 模型的路径是 /model/HuggingFace/deepseek-ai/<模型名>。
返回结果如下,则证明服务启动成功。
保持vLLM后台持续运行,在本地主机终端,执行如下API调用命令。
curl -i -X POST 'http://<云服务器弹性IP>:8000/v1/completions'
-H "Content-Type:application/json" \
-d \
'{
"model": "/model/HuggingFace/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
"prompt": "找出2,3,5,7,11,13,15中特殊的一个 thinking\n",
"max_tokens": 1024,
"temperature": 0
}' 回显示例如下,表示API调用成功。
纯净模式
