vLLM :安装及部署大模型详解
vLLM 是一个快速且易于使用的 LLM 推理库,支持多种模型和硬件加速。中文官网地址:vllm快车道
1. 系统要求
1.1硬件要求
- GPU: NVIDIA GPU (推荐 16GB+ 显存)
- CUDA: 支持 CUDA 11.8 或 12.1
- 内存: 至少 16GB RAM
1.2软件要求
- Python 3.8-3.11
- Linux
2. 安装方法
2.1方法一:使用 pip 安装(推荐)
# 创建虚拟环境(可选但推荐) conda create --name vllm python=3.10 conda activate vllm # 安装 vLLM pip install vllmpython环境搭建可参考 基本环境搭建教程
2.2方法二:从源码编译安装
# 克隆仓库 git clone https://github.com/vllm-project/vllm.git cd vllm # 安装依赖 pip install -e .3.部署大模型
python -m vllm.entrypoints.openai.api_server \ --model your_model_path \ --dtype half \ --trust-remote-code \ --tensor-parallel-size 1 \ --max-model-len 5120 \ --enforce-eager \ --gpu-memory-utilization 0.95 \ --max-num-batched-tokens 5120 \ --max-num-seqs 5 \ --host 0.0.0.0 \ --served-model-name DeepSeek-R1-7B \ --port 8080 &部署的模型需要先下载到本地,your_model_path 这里需替换成自己的模型路径,下载模型可从huggingface或者modelscope官网下载,huggingface还有国内镜像网站。如果顺利的话这样就已经把本地大模型部署成 OpenAI API 服务,就可以使用了连接使用了。
4.常见问题
4.1 vllm依赖缺失
推荐安装
# 使用python3.10 conda create --name vllm python=3.10 # 安装vllm相关依赖 pip install torch==2.3.0 torchvision==0.18.0 torchaudio==2.3.0 --index-url https://download.pytorch.org/whl/cu121 # 使用指定的版本 pip install vllm==0.43pytorch的安装可参考pytorch官网。
部分依赖安装可能需要指定版本才能适配,按照报错的提示安装指定版本即可。
4.2 CUDA问题
(1)nvidia驱动地址安装驱动:nvidia驱动地址 选取x86_64 历史版本中的530.30.02版本,此版本对应cuda12.1
(2)Cuda安装:安装完cuda驱动后,再进行 cuda安装。
(3)修改cuda环境变量
# 第一步 vim ~/.bashrc # 第二步:在最下面插入并保存,/usr/local/cuda-xx.x,/usr/local/cuda-xx.x/libxx export PATH=/usr/local/cuda-xx.x/bin:$PATH export LD_LIBRARY_PATH=/usr/local/cuda-xx.x/libxx:$LD_LIBRARY_PATH # 第三步:刷新环境变量 source ~/.bashrc # 第四步:验证cuda nvcc -V(4)检查 cuda 、driver 是否一致
nvcc -V Nvidia-smi4.3 模型配置到Harness中无法掉工具
vllm部署时加上这2个参数即可:
--enable-auto-tool-choice --tool-call-parser hermes