vLLM :安装及部署大模型详解

vLLM 是一个快速且易于使用的 LLM 推理库,支持多种模型和硬件加速。中文官网地址:vllm快车道

1. 系统要求

1.1硬件要求

  • GPU: NVIDIA GPU (推荐 16GB+ 显存)
  • CUDA: 支持 CUDA 11.8 或 12.1
  • 内存: 至少 16GB RAM

1.2软件要求

  • Python 3.8-3.11
  • Linux

2. 安装方法

2.1方法一:使用 pip 安装(推荐)

# 创建虚拟环境(可选但推荐) conda create --name vllm python=3.10 conda activate vllm # 安装 vLLM pip install vllm

python环境搭建可参考 基本环境搭建教程

2.2方法二:从源码编译安装

# 克隆仓库 git clone https://github.com/vllm-project/vllm.git cd vllm # 安装依赖 pip install -e .

3.部署大模型

python -m vllm.entrypoints.openai.api_server \ --model your_model_path \ --dtype half \ --trust-remote-code \ --tensor-parallel-size 1 \ --max-model-len 5120 \ --enforce-eager \ --gpu-memory-utilization 0.95 \ --max-num-batched-tokens 5120 \ --max-num-seqs 5 \ --host 0.0.0.0 \ --served-model-name DeepSeek-R1-7B \ --port 8080 &

部署的模型需要先下载到本地,your_model_path 这里需替换成自己的模型路径,下载模型可从huggingface或者modelscope官网下载,huggingface还有国内镜像网站。如果顺利的话这样就已经把本地大模型部署成 OpenAI API 服务,就可以使用了连接使用了。

4.常见问题

4.1 vllm依赖缺失

推荐安装

# 使用python3.10 conda create --name vllm python=3.10 # 安装vllm相关依赖 pip install torch==2.3.0 torchvision==0.18.0 torchaudio==2.3.0 --index-url https://download.pytorch.org/whl/cu121 # 使用指定的版本 pip install vllm==0.43

pytorch的安装可参考pytorch官网。

部分依赖安装可能需要指定版本才能适配,按照报错的提示安装指定版本即可。

4.2 CUDA问题

(1)nvidia驱动地址安装驱动:nvidia驱动地址 选取x86_64 历史版本中的530.30.02版本,此版本对应cuda12.1

(2)Cuda安装:安装完cuda驱动后,再进行 cuda安装。

(3)修改cuda环境变量

# 第一步 vim ~/.bashrc # 第二步:在最下面插入并保存,/usr/local/cuda-xx.x,/usr/local/cuda-xx.x/libxx export PATH=/usr/local/cuda-xx.x/bin:$PATH export LD_LIBRARY_PATH=/usr/local/cuda-xx.x/libxx:$LD_LIBRARY_PATH # 第三步:刷新环境变量 source ~/.bashrc # 第四步:验证cuda nvcc -V

(4)检查 cuda 、driver 是否一致

nvcc -V Nvidia-smi

4.3 模型配置到Harness中无法掉工具

vllm部署时加上这2个参数即可:

--enable-auto-tool-choice --tool-call-parser hermes