部署Qwen2.5-VL-3B-Instruc视觉模型的教程

发布时间:2026/9/22 7:00:48

部署Qwen2.5-VL-3B-Instruc视觉模型的教程 部署视觉模型的教程1. 环境信息项目详情主机型号DPS-Z790-S-DDR4操作系统Ubuntu 22.04 LTS (Linux Desktop)GPUNVIDIA GeForce RTX 系列 (Z790 平台)CUDA12.6Python3.10模型Qwen2.5-VL-3B-Instruct推理框架vLLM 0.8.xAPI 端口8003部署日期2026-08-052. 基础环境安装2.1 系统依赖sudoaptupdatesudoaptinstall-y\build-essentialgitwgetcurl\libgl1 libglib2.0-0 ffmpeg\python3-pip python3-venvlibgl1和libglib2.0-0是 OpenCV / Pillow 处理图像时的运行时依赖缺失会导致多模态图片预处理报错。2.2 CUDA cuDNN确认已安装 CUDA 12.6 及对应 cuDNNnvidia-smi# 确认驱动 ≥ 560nvcc--version# 确认 CUDA 12.6python3-cimport nvidia.cudnn; print(nvidia.cudnn.__version__)若未安装或版本不匹配pipinstallnvidia-cuda-runtime-cu1212.6.*\nvidia-cudnn-cu129.5.*\nvidia-cublas-cu1212.6.*\--no-cache-dir2.3 Python 虚拟环境python3-mvenv ~/桌面/ai/.venvsource~/桌面/ai/.venv/bin/activate pipinstall--upgradepip setuptools wheel2.4 核心依赖版本锁定以下版本经实测兼容 Qwen2.5-VL vLLM请勿随意升级# PyTorch必须与 CUDA 12.6 匹配pipinstalltorch2.6.0torchvision0.21.0torchaudio2.6.0\--index-url https://download.pytorch.org/whl/cu126# TransformersQwen2.5-VL 需要 ≥ 4.49pipinstalltransformers4.51.3accelerate1.6.0 qwen-vl-utils0.0.11# vLLMpipinstallvllm0.8.5.post1 --no-cache-dir# FlashInfer可选加速编译失败可跳过pipinstallflashinfer-python0.2.6 --no-cache-dir# 验证安装python3-c import torch, transformers, vllm print(ftorch: {torch.__version__}) print(fCUDA avail: {torch.cuda.is_available()}) print(ftransformers: {transformers.__version__}) print(fvllm: {vllm.__version__}) 预期输出示例torch: 2.6.0cu126 CUDA avail: True transformers: 4.51.3 vllm: 0.8.5.post13. 模型下载3.1 ModelScope国内推荐pipinstallmodelscope modelscope download--modelQwen/Qwen2.5-VL-3B-Instruct\--local_dir~/桌面/ai/models/Qwen2.5-VL-3B-Instruct3.2 HuggingFace备选pipinstallhuggingface_hub huggingface-cli download Qwen/Qwen2.5-VL-3B-Instruct\--local-dir ~/桌面/ai/models/Qwen2.5-VL-3B-Instruct3.3 校验完整性ls~/桌面/ai/models/Qwen2.5-VL-3B-Instruct/# 应包含: config.json, tokenizer.json, *.safetensors, preprocessor_config.json, chat_template.jinja4. 启动 vLLM 服务4.1 手动启动首次调试用cd~/桌面/aisource.venv/bin/activate vllm serve ./models/Qwen2.5-VL-3B-Instruct\--served-model-name Qwen2.5-VL-3B-Instruct\--host0.0.0.0--port8003--dtypebfloat16\--gpu-memory-utilization0.90--max-model-len32768\--max-num-seqs64--enable-prefix-caching\--trust-remote-code --limit-mm-per-prompt{image: 10}\--enforce-eager关键参数说明参数值说明--dtypebfloat16Z790 平台 RTX 卡支持 BF16比 FP16 数值更稳定--gpu-memory-utilization0.90预留 10% 显存给系统/CUDA context--max-model-len32768Qwen2.5-VL-3B 最大支持 128K按实际显存调整--max-num-seqs64最大并发请求数受 KV Cache 总量限制--enable-prefix-caching-相同 system prompt / 图片前缀可复用 KV Cache--limit-mm-per-promptimage:10单条消息最多 10 张图片防止 OOM--enforce-eager-禁用 CUDA Graph降低显存占用适合小显存卡--served-model-name短别名API 调用时使用此名称代替完整路径4.2 验证服务就绪等待日志出现Uvicorn running on http://0.0.0.0:8003后# 检查模型列表curlhttp://localhost:8003/v1/models# 纯文本测试curl-m120http://localhost:8003/v1/chat/completions\-HContent-Type: application/json\-d{ model: Qwen2.5-VL-3B-Instruct, messages: [{role:user,content:用一句话介绍你自己}], temperature: 0.7, max_tokens: 256, stream: true }# 图文多模态测试curl-m120http://localhost:8003/v1/chat/completions\-HContent-Type: application/json\-d{ model: Qwen2.5-VL-3B-Instruct, messages: [{ role: user, content: [ {type:image_url,image_url:{url:https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-VL/assets/demo.jpeg}}, {type:text,text:请详细描述这张图片的内容} ] }], temperature: 0.7, max_tokens: 512, stream: true }5. 配置开机自启动systemd 用户服务5.1 创建服务文件mkdir-p~/.config/systemd/usercat~/.config/systemd/user/vllm-qwen.serviceEOF [Unit] DescriptionvLLM Server for Qwen2.5-VL-3B-Instruct Afternetwork-online.target graphical-session.target Wantsnetwork-online.target [Service] Typesimple WorkingDirectory%h/桌面/ai EnvironmentVIRTUAL_ENV%h/桌面/ai/.venv EnvironmentPATH%h/桌面/ai/.venv/bin:%h/.local/bin:/usr/local/cuda/bin:/usr/local/bin:/usr/bin:/bin EnvironmentLD_LIBRARY_PATH/usr/local/cuda/lib64:%h/桌面/ai/.venv/lib/python3.10/site-packages/nvidia/cudnn/lib ExecStart%h/桌面/ai/.venv/bin/vllm serve ./models/Qwen2.5-VL-3B-Instruct \ --served-model-name Qwen2.5-VL-3B-Instruct \ --host 0.0.0.0 --port 8003 --dtype bfloat16 \ --gpu-memory-utilization 0.90 --max-model-len 32768 \ --max-num-seqs 64 --enable-prefix-caching \ --trust-remote-code --limit-mm-per-prompt {image: 10} \ --enforce-eager Restarton-failure RestartSec10 StandardOutputjournal StandardErrorjournal [Install] WantedBydefault.target EOF⚠️注意相比之前版本此处增加了VIRTUAL_ENV环境变量并将ExecStart指向虚拟环境内的 vllm 二进制确保 systemd 环境下使用正确的 Python 解释器和依赖。5.2 启用并启动systemctl--userdaemon-reload loginctl enable-linger$USER# 允许未登录时服务持续运行systemctl--userenablevllm-qwen# 设置开机自启systemctl--userstart vllm-qwen# 立即启动5.3 验证systemctl--userstatus vllm-qwen journalctl--user-uvllm-qwen-f# 等待 Uvicorn running 日志后 CtrlC 退出curlhttp://localhost:8003/v1/models6. 部署过程中遇到的问题及解决方案问题 1PyTorch 与 CUDA 版本不匹配现象torch.cuda.is_available()返回False或 vLLM 启动报CUDA error: no kernel image is available for execution on the device。原因通过默认 pip 安装的 PyTorch 链接的是 CUDA 11.8与本机 CUDA 12.6 不兼容。解决卸载后使用--index-url https://download.pytorch.org/whl/cu126重新安装指定 CUDA 版本的 PyTorch。问题 2Transformers 版本过低导致模型加载失败现象KeyError: qwen2_vl或AttributeError: Qwen2VLForConditionalGeneration has no attribute ...。原因Qwen2.5-VL 架构在 transformers ≥ 4.49 才引入旧版无法识别模型类型。解决pip install transformers4.51.3同时安装qwen-vl-utils提供图像处理工具函数。问题 3FlashInfer 编译失败现象pip install flashinfer-python报 C 编译错误或找不到nvcc。原因FlashInfer 需要本地 CUDA toolkit 头文件和匹配的 GCC 版本。解决确认nvcc --version可用且 GCC ≤ 12若仍失败可跳过安装vLLM 自动回退到 PyTorch 原生采样功能不受影响。问题 4模型名称过长导致调用不便现象默认模型 ID 为完整路径./models/Qwen2.5-VL-3B-Instruct对接 SDK 时易出错。解决启动时添加--served-model-name Qwen2.5-VL-3B-Instruct。问题 5非流式响应长回复超时现象图文理解任务 prompt_tokens 高达 3604非流式模式下 curl 长时间无响应。解决所有请求添加stream: true和-m 120超时保护。问题 6systemd 环境中 GPU / CUDA 不可见现象手动终端启动正常systemd 拉起后报CUDA not found。原因systemd 用户会话不继承.bashrc中的环境变量。解决在服务文件中显式声明PATH、LD_LIBRARY_PATH、VIRTUAL_ENV并将ExecStart指向虚拟环境内的绝对路径。问题 7开机自启未生效现象enable成功但重启后服务未拉起。原因未开启 linger用户服务仅在登录会话存活时运行。解决loginctl enable-linger $USER验证loginctl show-user $USER | grep Linger输出yes。问题 8中文路径兼容性隐患现象工作目录~/桌面/ai含中文当前组合可正常运行但部分旧版工具链可能异常。建议长期生产使用建议迁移至纯英文路径如~/projects/ai。7. 日常运维速查表操作命令查看实时日志journalctl --user -u vllm-qwen -f查看服务状态systemctl --user status vllm-qwen重启服务systemctl --user restart vllm-qwen停止服务systemctl --user stop vllm-qwen禁用自启systemctl --user disable vllm-qwen重新启用自启systemctl --user enable vllm-qwen编辑服务配置nano ~/.config/systemd/user/vllm-qwen.service systemctl --user daemon-reload验证 API 可用curl http://localhost:8003/v1/models进入虚拟环境source ~/桌面/ai/.venv/bin/activate8. 性能参考数据基于本次部署实测Qwen2.5-VL-3B-Instruct, Z790 平台指标数值模型权重占用~7.16 GiBKV Cache 分配~9.80 GiB (285K tokens)最大上下文长度32,768 tokens纯文本 prompt tokens23图文 prompt tokens3,604 (含图像编码)理论并发数 (32K ctx)~8.7x9. 完整依赖版本清单供复现环境时对照torch2.6.0cu126 torchvision0.21.0cu126 torchaudio2.6.0cu126 transformers4.51.3 accelerate1.6.0 qwen-vl-utils0.0.11 vllm0.8.5.post1 flashinfer-python0.2.6 # 可选 nvidia-cuda-runtime-cu1212.6.* nvidia-cudnn-cu129.5.* nvidia-cublas-cu1212.6.* modelscope1.24.0 # 或 huggingface_hub0.30.2文档版本v2.0 |最后更新2026-08-05 |作者DP
延伸阅读

更多相关文章

2026/9/22 7:00:27

零基础入门ESP32如何点亮LED灯

很多零基础的朋友拿到ESP32开发板,第一反应是兴奋,第二反应是茫然——这东西怎么上手?驱动怎么装?固件怎么烧?代码写在哪?怎么传到板子上? 传统的入门路径太长了:装驱动→烧固件→装…

2026/9/22 7:00:46

AI数字人唱歌视频生成:从Wav2Lip到游戏应用的技术解析

1. 先搞清楚这个玩法到底是什么,以及它为什么能火 如果你玩《逆水寒》手游,最近可能被一个玩法刷屏了:用自己游戏里精心捏出来的角色,生成一段唱歌视频。这听起来有点“黑科技”,但核心体验其实很直接——你上传一张游…

2026/9/21 19:52:12

PNP晶体管工作原理、关键参数与经典应用电路全解析

1. 项目概述:从“电流阀门”到无处不在的开关 在电子世界的底层,有一种元件,它不像CPU那样光芒万丈,也不像屏幕那样直观可见,但它却是构建现代数字与模拟电路的基石之一。它就是PNP型双极结型晶体管。很多人一听到“晶…

2026/9/22 7:00:11

图解原理:xinai手写实现避坑指南,3招搞定跑不通代码

图解原理:xinai手写实现避坑指南,3招搞定跑不通代码 复制来的 xinai 相关代码,跑不通?别慌,这通常是环境配置或底层逻辑理解偏差导致的。很多应届生在面试突击阶段,遇到这种“看似简单实则坑多”的面试题,往往因为缺乏对【图解原理】的深…

2026/9/22 7:00:11

计算机组成原理白中英怎么学:从入门到精通的底层逻辑

计算机组成原理白中英怎么学:从入门到精通的底层逻辑 看了一堆视频,背了不少公式,一到真题还是懵?这是很多自学者在啃《计算机组成原理》(白中英版)时的共同噩梦。 你以为你在学计算机,其实你只是在背“死知识”。 真正的 入门到精通…

2026/9/22 7:00:11

3个Solider新手必踩的深坑,面试原理一答就崩

3个Solider新手必踩的深坑,面试原理一答就崩 面试被问到“为什么你的代码在多线程下偶发崩溃”时,如果你只能支支吾吾说“可能是锁没加好”,面试官的眼神就会变冷。这种尴尬,往往是新手在接触底层组件如…

2026/9/22 6:55:10

5分钟搞懂星矢长弓:图解原理助你避开90%的坑

5分钟搞懂星矢长弓:图解原理助你避开90%的坑 刚接触【星矢长弓】的朋友,大概率被官方文档劝退过。那几百页的PDF,术语堆砌,代码示例还老掉牙,看两页就头大,根本抓不住重点。 别慌,今天我不讲虚的。咱们直接用 图解原理…

2026/9/21 3:28:31

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/21 3:33:19

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/22 0:04:49

输电线路在线监测高频面试题拆解 3秒抓住官方文档重点

输电线路在线监测高频面试题拆解 3秒抓住官方文档重点 官方文档几百页翻到头还是懵?面试问到 输电线路在线监测 的数据链路时,脑子一片空白?别慌,这种 高频面试题 我整理了10年,专门治各种“文档太长抓不住重点”的毛病。…

2026/9/22 0:04:49

中介房源管理系统重构避坑:3个关键步骤搞定API变更

中介房源管理系统重构避坑:3个关键步骤搞定API变更 版本升级后 API 全变了,这种痛只有真做过的人懂。 很多团队在接手老旧房产项目时,最崩溃的不是代码烂,而是底层框架升级后,原本熟悉的接口调用方式彻底失效。 这份 保姆级教程…

2026/9/22 0:04:49

3个坑点带你一文搞懂55gg小游戏源码

3个坑点带你一文搞懂55gg小游戏源码 盯着控制台满屏的红色报错,看着那一长串 StackTrace ,是不是脑子瞬间宕机?别急,这种时候最忌讳的就是盲目改代码。很多刚入行的前端同学,面对 55gg 小游戏这类轻量级 H5…

2026/9/20 4:54:47

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/21 18:32:12

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/21 10:29:02

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码