极客前沿

AI 模型部署入门:一步步安装 vLLM 并跑通第一个推理

2026-07-08 01:35
DEV Machine Learning
查看原文

学会安装 vLLM,配置环境,运行第一个 AI 模型推理,避开常见坑。

准备环境

在开始之前,你需要一台装有 Linux 系统的电脑(推荐 Ubuntu 20.04 或更新版本),并确保已安装 Python 3.8+CUDA(英伟达显卡驱动配套的并行计算平台)。如果你还没有 CUDA,可以到 NVIDIA 官网 下载安装,版本建议 12.1 或更新。检查 CUDA 是否安装成功:在终端输入 nvcc --version,看到版本号即可。

安装 vLLM

vLLM 是一个高效的 AI 模型推理引擎,特别适合部署大语言模型。安装步骤如下:

  1. 打开终端,创建一个新的 Python 虚拟环境(可选但推荐):python -m venv vllm_env,然后激活它:source vllm_env/bin/activate
  2. 安装 vLLM:pip install vllm。如果速度慢,可以换国内镜像源,比如 pip install vllm -i https://pypi.tuna.tsinghua.edu.cn/simple
  3. 等待安装完成。这可能需要几分钟,因为会自动下载依赖(如 PyTorch、transformers 等)。

验证是否成功:跑第一个模型

安装成功后,我们来运行一个简单的推理示例。这里使用一个流行的开源模型 facebook/opt-125m(一个文本生成模型,参数量 1.25 亿,适合测试)。

Tutorial Image
  1. 在终端中启动 Python:python
  2. 输入以下代码:
    from vllm import LLM, SamplingParams
    
    # 加载模型
    llm = LLM(model="facebook/opt-125m")
    
    # 设置生成参数
    sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
    
    # 输入提示
    prompts = ["AI 的未来是"]
    
    # 生成回复
    outputs = llm.generate(prompts, sampling_params)
    
    # 打印结果
    for output in outputs:
        print(output.outputs[0].text)
  3. 如果看到模型输出的文本(可能是英文),说明安装成功!注意第一次运行会下载模型文件(几百 MB),请保持网络畅通。

常见坑与下一步

常见坑:

  • CUDA 版本不匹配:vLLM 需要 CUDA 11.8 或更高,推荐 12.1。如果报错 CUDA error,请升级 CUDA 或检查环境变量。
  • 显存不足:OPT-125M 需要约 2GB 显存。如果你显卡显存较小,可以换更小的模型如 gpt2
  • 多卡用户注意:如果你有多个 GPU,vLLM 默认使用所有卡。可以用环境变量 CUDA_VISIBLE_DEVICES=0 指定单卡。

下一步可以做什么:

  • 尝试其他模型,比如 meta-llama/Llama-2-7b-hf(需要申请权限)。
  • 学习调整 SamplingParams(如 temperature、top_k)来控制生成文本的创造性。
  • 用 vLLM 搭建一个简单的 API 服务,让其他程序调用模型。

内容来源

DEV Machine Learning

发布时间

2026-07-08 01:35

返回 AI技术