AI 模型部署入门:一步步安装 vLLM 并跑通第一个推理
学会安装 vLLM,配置环境,运行第一个 AI 模型推理,避开常见坑。
准备环境
在开始之前,你需要一台装有 Linux 系统的电脑(推荐 Ubuntu 20.04 或更新版本),并确保已安装 Python 3.8+ 和 CUDA(英伟达显卡驱动配套的并行计算平台)。如果你还没有 CUDA,可以到 NVIDIA 官网 下载安装,版本建议 12.1 或更新。检查 CUDA 是否安装成功:在终端输入 nvcc --version,看到版本号即可。
安装 vLLM
vLLM 是一个高效的 AI 模型推理引擎,特别适合部署大语言模型。安装步骤如下:
- 打开终端,创建一个新的 Python 虚拟环境(可选但推荐):
python -m venv vllm_env,然后激活它:source vllm_env/bin/activate。 - 安装 vLLM:
pip install vllm。如果速度慢,可以换国内镜像源,比如pip install vllm -i https://pypi.tuna.tsinghua.edu.cn/simple。 - 等待安装完成。这可能需要几分钟,因为会自动下载依赖(如 PyTorch、transformers 等)。
验证是否成功:跑第一个模型
安装成功后,我们来运行一个简单的推理示例。这里使用一个流行的开源模型 facebook/opt-125m(一个文本生成模型,参数量 1.25 亿,适合测试)。
- 在终端中启动 Python:
python。 - 输入以下代码:
from vllm import LLM, SamplingParams # 加载模型 llm = LLM(model="facebook/opt-125m") # 设置生成参数 sampling_params = SamplingParams(temperature=0.8, top_p=0.95) # 输入提示 prompts = ["AI 的未来是"] # 生成回复 outputs = llm.generate(prompts, sampling_params) # 打印结果 for output in outputs: print(output.outputs[0].text) - 如果看到模型输出的文本(可能是英文),说明安装成功!注意第一次运行会下载模型文件(几百 MB),请保持网络畅通。
常见坑与下一步
常见坑:
- CUDA 版本不匹配:vLLM 需要 CUDA 11.8 或更高,推荐 12.1。如果报错
CUDA error,请升级 CUDA 或检查环境变量。 - 显存不足:OPT-125M 需要约 2GB 显存。如果你显卡显存较小,可以换更小的模型如
gpt2。 - 多卡用户注意:如果你有多个 GPU,vLLM 默认使用所有卡。可以用环境变量
CUDA_VISIBLE_DEVICES=0指定单卡。
下一步可以做什么:
- 尝试其他模型,比如
meta-llama/Llama-2-7b-hf(需要申请权限)。 - 学习调整 SamplingParams(如 temperature、top_k)来控制生成文本的创造性。
- 用 vLLM 搭建一个简单的 API 服务,让其他程序调用模型。
内容来源
DEV Machine Learning
发布时间
2026-07-08 01:35