重要说明:推理框架与模型版本更新很快,下列命令是通用示例,参数名称和可用选项以 vLLM 与模型官方文档的当期版本为准,实际部署前请在您的环境中验证。本文不替代针对您具体硬件的实测。模型权重请从官方渠道获取,并留意各模型的许可条款是否允许您的使用方式。
一、部署前先算显存
先估算模型权重和并发缓存是否放得下,见 显存配置速查。举例:32B 级模型 4bit 量化权重约 21 GB,一张 48 GB 卡可以起步;不量化的 FP16 约 64 GB,需要多卡。
二、环境准备
- Linux 服务器,安装与显卡匹配的 NVIDIA 驱动和 CUDA 运行环境(版本需与所用 vLLM 版本要求一致)。
- Python 虚拟环境,或使用官方提供的容器镜像,便于隔离与复现。
- 确认磁盘空间:模型权重文件较大,且需要在内网环境预先下载或通过镜像导入。
# 创建独立环境并安装(示例)
python -m venv vllm-env
source vllm-env/bin/activate
pip install vllm
在完全离线的内网中,需要在有网络的机器上下载好权重和依赖,再拷贝到内网服务器。
三、启动一个模型服务
以 Qwen 系列 32B 为例(模型名称以官方发布为准):
vllm serve Qwen/Qwen3-32B \
--served-model-name qwen3-32b \
--tensor-parallel-size 2 \
--max-model-len 16384 \
--gpu-memory-utilization 0.90 \
--api-key YOUR_INTERNAL_KEY \
--host 127.0.0.1 --port 8000
常用参数说明:
--tensor-parallel-size:用几张卡做张量并行,应与可用显卡数及显存需求匹配。--max-model-len:最大上下文长度。设得越大,单路缓存越多、能支持的并发越少,应按业务实际需要设置,而不是越大越好。--gpu-memory-utilization:允许使用显存的比例,需给激活与碎片留余量。--api-key:接口认证密钥,必须设置并妥善保管。--host:监听地址。默认只监听本机,由网关对外转发,避免直接暴露。
若使用 4bit 量化版权重(如 AWQ 格式的发布版本),显存占用会明显下降,但需要用您的评估集验证精度损失是否可接受。
DeepSeek-R1 蒸馏版(如基于 Qwen 的 32B 版本)的启动方式类似,把模型路径换成对应权重即可。这类“深度思考”模型会输出推理过程,部分 vLLM 版本提供推理内容解析选项,可把思考内容与最终答案分开返回,具体选项名随版本变化,请查阅当期文档。671B 满血版需要多卡多机配置,部署复杂度和硬件要求都高得多,多数场景不必使用。
四、验证服务与调用
vLLM 提供 OpenAI 兼容接口,可以用 curl 做最基本的验证:
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_INTERNAL_KEY" \
-d '{
"model": "qwen3-32b",
"messages": [{"role": "user", "content": "用一句话介绍你自己"}],
"max_tokens": 100
}'
正常返回后,再用压测工具在预期并发与上下文长度下测首字延迟和生成速度,这些数字才是配置是否够用的依据。
五、接入知识库
知识库应用只需把模型地址配置为这个 OpenAI 兼容接口。完整的知识库还需要嵌入模型和重排序模型,它们占用显存不大,通常可与主模型共卡或放在另一张卡上。检索、权限、引用与拒答的设计,见 企业知识库搭建流程。
六、安全与上线检查清单
- 推理端口只在内网可达,由网关做认证、限流与审计,不直接暴露公网。
- 设置 API Key,并通过防火墙限制来源 IP。
- 日志中避免记录完整的敏感提问内容,或对日志做访问控制。
- 用 systemd 或容器编排管理服务,配置自动重启与健康检查。
- 监控显存、GPU 利用率、请求延迟与错误率,设定告警。
- 固定模型与框架版本,升级前用评估集回归。
- 记录模型来源、版本与许可条款,便于合规审查。
- 做压测与故障演练,确认在峰值并发下的表现。
七、国产算力卡怎么办
国产卡需要使用对应厂商提供的推理框架和适配镜像,启动命令、可用量化方式和支持的模型列表各不相同,请以厂商官方文档为准。选型时的注意事项见 国产算力卡与 NVIDIA 选型指南。如果需要我们代为部署与调优,可预约部署评估。
常见问题
国产算力卡也能用这套步骤吗?
部署后可以直接对公网开放吗?
想结合您的实际情况算一遍?
文章里的数字是通用参考。是否需要本地硬件、选哪一档、预算怎么构成,需要结合您的使用规模和数据要求评估。
- 用配置计算器先估算硬件量级
- 比较云端、专属云与本地部署的成本
- 给出硬件、软件、实施、培训与服务的分项估算