全部文档
当前文档

暂无内容

如果没有找到您期望的内容,请尝试其他搜索词

文档中心

使用GPU实例部署DeepSeek-R1蒸馏模型

最近更新时间:2026-08-18 21:09:50

本文介绍如何在金山云KEC GPU实例中,使用镜像市场中DeepSeek-R1-Distill-Qwen-1.5B镜像,部署vLLM服务,如vLLM 部署所需环境信息、推荐配置及使用方法,具体包括支持的模型、环境参数、适用场景以及如何启动和验证推理服务,帮助用户快速完成大语言模型推理任务的部署。

背景信息

镜像环境介绍

vLLM 部署提供支持,适用于高性能大语言模型的推理和微调任务,支持 DeepSeek 系列模型运行,详细环境如下:

  • Python: conda 环境下 3.12.8,可指定 3.10.12

  • vLLM: 0.6.6

  • PyTorch: 2.5.1

  • CUDA: 12.4

  • miniconda3: 24.11.1

使用场景

  • 低成本模型体验与学习:若您希望以最小成本体验 DeepSeek 模型的完整部署流程,或用于个人学习/教学演示,云服务器 CPU 实例可满足基础需求。相较于 GPU 实例,其无需额外硬件投入,且通过多核并行计算能力可支持轻量化推理,显著降低学习与实验成本。

  • 开发环境快速搭建与调试:在模型开发调试阶段,使用 CPU 实例可规避 GPU 驱动、CUDA 版本依赖等复杂环境配置问题,简化开发流程。尤其适用于代码逻辑验证、接口测试等非性能密集型场景,减少因环境兼容性导致的调试时间损耗。

  • 轻量级生产任务处理:对于低频调用或小批量数据处理,云服务器 CPU 实例凭借多核资源与高内存带宽,可高效完成任务。典型场景包括企业内部知识库问答、周期性报表生成等轻量级 AI 应用。

资源配置要求

以A10机型为例,相应DeepSeek-R1蒸馏模型所需资源配置如下:

模型

推荐配置实例规格

先卡数

DeepSeek-R1-Distill-Qwen-1.5B

GPU 计算型 GN7I.16C1

1 卡

DeepSeek-R1-Distill-Qwen-32B

GPU 计算型 GN7I.16C4

4 卡

操作步骤

步骤一:创建GPU实例

  1. 登录金山云控制台,在顶部搜索框输入KEC,选择控制台 > 云服务器,进入云服务器控制台页面。

  2. 在左侧导航栏,选择实例,点击+新建。

  3. 在自定义购买页面,参考以下说明配置各项参数。

    • 架构:选择GPU

    • 套餐规格:本示例选择GN7I.16C1 (GPU通用计算型GN7I, 16核 64GB)

    • 镜像类型:选择镜像市场

    • 镜像:选择工具软件 > DeepSeek-R1-Distill-Qwen-1.5B。

    • 系统盘:选择ESSD云硬盘

    • 性能级别:选择PL1

    • 容量范围:至少100GB

    • 安全组(防火墙):所选安全组须添加入站规则并放行22、8000端口

    • 弹性IP

      • 选择购买弹性IP可立即绑定

      • 选择稍后购买,则需实例创建完成后手动绑定弹性IP

    • 其他参数根据根据实际情况进行设置即可。

  4. 点击立即购买,完成相应实例的创建。

步骤二:启动vLLM服务

  1. 登录KEC GPU实例

  2. 进入 root 模式。

    sudo su
  3. 执行如下命令,启动 vLLM API 服务。

    vllm serve <大模型路径> --port 8000 -tp <GPU卡数> 

    本示例使用DeepSeek-R1-Distill-Qwen-1.5B模型,GPU卡数为1,故实际命令为:

    vllm serve /model/HuggingFace/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --port 8000

    使用镜像内置 deepseek 模型的路径是 /model/HuggingFace/deepseek-ai/<模型名>

  4. 返回结果如下,则证明服务启动成功。

步骤三:验证DeepSeek服务

保持vLLM后台持续运行,在本地主机终端,执行如下API调用命令。

curl -i -X POST  'http://<云服务器弹性IP>:8000/v1/completions'
   -H "Content-Type:application/json" \
   -d \
'{
  "model": "/model/HuggingFace/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B",
  "prompt": "找出2,3,5,7,11,13,15中特殊的一个 thinking\n",
  "max_tokens": 1024,
  "temperature": 0
}' 

回显示例如下,表示API调用成功。

文档导读
纯净模式常规模式

纯净模式

点击可全屏预览文档内容
文档反馈