发布时间:2026/8/6 8:09:55
部署Qwen2.5-VL-3B-Instruc视觉模型的教程 部署视觉模型的教程1. 环境信息项目详情主机型号DPS-Z790-S-DDR4操作系统Ubuntu 22.04 LTS (Linux Desktop)GPUNVIDIA GeForce RTX 系列 (Z790 平台)CUDA12.6Python3.10模型Qwen2.5-VL-3B-Instruct推理框架vLLM 0.8.xAPI 端口8003部署日期2026-08-052. 基础环境安装2.1 系统依赖sudoaptupdatesudoaptinstall-y\build-essentialgitwgetcurl\libgl1 libglib2.0-0 ffmpeg\python3-pip python3-venvlibgl1和libglib2.0-0是 OpenCV / Pillow 处理图像时的运行时依赖缺失会导致多模态图片预处理报错。2.2 CUDA cuDNN确认已安装 CUDA 12.6 及对应 cuDNNnvidia-smi# 确认驱动 ≥ 560nvcc--version# 确认 CUDA 12.6python3-cimport nvidia.cudnn; print(nvidia.cudnn.__version__)若未安装或版本不匹配pipinstallnvidia-cuda-runtime-cu1212.6.*\nvidia-cudnn-cu129.5.*\nvidia-cublas-cu1212.6.*\--no-cache-dir2.3 Python 虚拟环境python3-mvenv ~/桌面/ai/.venvsource~/桌面/ai/.venv/bin/activate pipinstall--upgradepip setuptools wheel2.4 核心依赖版本锁定以下版本经实测兼容 Qwen2.5-VL vLLM请勿随意升级# PyTorch必须与 CUDA 12.6 匹配pipinstalltorch2.6.0torchvision0.21.0torchaudio2.6.0\--index-url https://download.pytorch.org/whl/cu126# TransformersQwen2.5-VL 需要 ≥ 4.49pipinstalltransformers4.51.3accelerate1.6.0 qwen-vl-utils0.0.11# vLLMpipinstallvllm0.8.5.post1 --no-cache-dir# FlashInfer可选加速编译失败可跳过pipinstallflashinfer-python0.2.6 --no-cache-dir# 验证安装python3-c import torch, transformers, vllm print(ftorch: {torch.__version__}) print(fCUDA avail: {torch.cuda.is_available()}) print(ftransformers: {transformers.__version__}) print(fvllm: {vllm.__version__}) 预期输出示例torch: 2.6.0cu126 CUDA avail: True transformers: 4.51.3 vllm: 0.8.5.post13. 模型下载3.1 ModelScope国内推荐pipinstallmodelscope modelscope download--modelQwen/Qwen2.5-VL-3B-Instruct\--local_dir~/桌面/ai/models/Qwen2.5-VL-3B-Instruct3.2 HuggingFace备选pipinstallhuggingface_hub huggingface-cli download Qwen/Qwen2.5-VL-3B-Instruct\--local-dir ~/桌面/ai/models/Qwen2.5-VL-3B-Instruct3.3 校验完整性ls~/桌面/ai/models/Qwen2.5-VL-3B-Instruct/# 应包含: config.json, tokenizer.json, *.safetensors, preprocessor_config.json, chat_template.jinja4. 启动 vLLM 服务4.1 手动启动首次调试用cd~/桌面/aisource.venv/bin/activate vllm serve ./models/Qwen2.5-VL-3B-Instruct\--served-model-name Qwen2.5-VL-3B-Instruct\--host0.0.0.0--port8003--dtypebfloat16\--gpu-memory-utilization0.90--max-model-len32768\--max-num-seqs64--enable-prefix-caching\--trust-remote-code --limit-mm-per-prompt{image: 10}\--enforce-eager关键参数说明参数值说明--dtypebfloat16Z790 平台 RTX 卡支持 BF16比 FP16 数值更稳定--gpu-memory-utilization0.90预留 10% 显存给系统/CUDA context--max-model-len32768Qwen2.5-VL-3B 最大支持 128K按实际显存调整--max-num-seqs64最大并发请求数受 KV Cache 总量限制--enable-prefix-caching-相同 system prompt / 图片前缀可复用 KV Cache--limit-mm-per-promptimage:10单条消息最多 10 张图片防止 OOM--enforce-eager-禁用 CUDA Graph降低显存占用适合小显存卡--served-model-name短别名API 调用时使用此名称代替完整路径4.2 验证服务就绪等待日志出现Uvicorn running on http://0.0.0.0:8003后# 检查模型列表curlhttp://localhost:8003/v1/models# 纯文本测试curl-m120http://localhost:8003/v1/chat/completions\-HContent-Type: application/json\-d{ model: Qwen2.5-VL-3B-Instruct, messages: [{role:user,content:用一句话介绍你自己}], temperature: 0.7, max_tokens: 256, stream: true }# 图文多模态测试curl-m120http://localhost:8003/v1/chat/completions\-HContent-Type: application/json\-d{ model: Qwen2.5-VL-3B-Instruct, messages: [{ role: user, content: [ {type:image_url,image_url:{url:https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-VL/assets/demo.jpeg}}, {type:text,text:请详细描述这张图片的内容} ] }], temperature: 0.7, max_tokens: 512, stream: true }5. 配置开机自启动systemd 用户服务5.1 创建服务文件mkdir-p~/.config/systemd/usercat~/.config/systemd/user/vllm-qwen.serviceEOF [Unit] DescriptionvLLM Server for Qwen2.5-VL-3B-Instruct Afternetwork-online.target graphical-session.target Wantsnetwork-online.target [Service] Typesimple WorkingDirectory%h/桌面/ai EnvironmentVIRTUAL_ENV%h/桌面/ai/.venv EnvironmentPATH%h/桌面/ai/.venv/bin:%h/.local/bin:/usr/local/cuda/bin:/usr/local/bin:/usr/bin:/bin EnvironmentLD_LIBRARY_PATH/usr/local/cuda/lib64:%h/桌面/ai/.venv/lib/python3.10/site-packages/nvidia/cudnn/lib ExecStart%h/桌面/ai/.venv/bin/vllm serve ./models/Qwen2.5-VL-3B-Instruct \ --served-model-name Qwen2.5-VL-3B-Instruct \ --host 0.0.0.0 --port 8003 --dtype bfloat16 \ --gpu-memory-utilization 0.90 --max-model-len 32768 \ --max-num-seqs 64 --enable-prefix-caching \ --trust-remote-code --limit-mm-per-prompt {image: 10} \ --enforce-eager Restarton-failure RestartSec10 StandardOutputjournal StandardErrorjournal [Install] WantedBydefault.target EOF⚠️注意相比之前版本此处增加了VIRTUAL_ENV环境变量并将ExecStart指向虚拟环境内的 vllm 二进制确保 systemd 环境下使用正确的 Python 解释器和依赖。5.2 启用并启动systemctl--userdaemon-reload loginctl enable-linger$USER# 允许未登录时服务持续运行systemctl--userenablevllm-qwen# 设置开机自启systemctl--userstart vllm-qwen# 立即启动5.3 验证systemctl--userstatus vllm-qwen journalctl--user-uvllm-qwen-f# 等待 Uvicorn running 日志后 CtrlC 退出curlhttp://localhost:8003/v1/models6. 部署过程中遇到的问题及解决方案问题 1PyTorch 与 CUDA 版本不匹配现象torch.cuda.is_available()返回False或 vLLM 启动报CUDA error: no kernel image is available for execution on the device。原因通过默认 pip 安装的 PyTorch 链接的是 CUDA 11.8与本机 CUDA 12.6 不兼容。解决卸载后使用--index-url https://download.pytorch.org/whl/cu126重新安装指定 CUDA 版本的 PyTorch。问题 2Transformers 版本过低导致模型加载失败现象KeyError: qwen2_vl或AttributeError: Qwen2VLForConditionalGeneration has no attribute ...。原因Qwen2.5-VL 架构在 transformers ≥ 4.49 才引入旧版无法识别模型类型。解决pip install transformers4.51.3同时安装qwen-vl-utils提供图像处理工具函数。问题 3FlashInfer 编译失败现象pip install flashinfer-python报 C 编译错误或找不到nvcc。原因FlashInfer 需要本地 CUDA toolkit 头文件和匹配的 GCC 版本。解决确认nvcc --version可用且 GCC ≤ 12若仍失败可跳过安装vLLM 自动回退到 PyTorch 原生采样功能不受影响。问题 4模型名称过长导致调用不便现象默认模型 ID 为完整路径./models/Qwen2.5-VL-3B-Instruct对接 SDK 时易出错。解决启动时添加--served-model-name Qwen2.5-VL-3B-Instruct。问题 5非流式响应长回复超时现象图文理解任务 prompt_tokens 高达 3604非流式模式下 curl 长时间无响应。解决所有请求添加stream: true和-m 120超时保护。问题 6systemd 环境中 GPU / CUDA 不可见现象手动终端启动正常systemd 拉起后报CUDA not found。原因systemd 用户会话不继承.bashrc中的环境变量。解决在服务文件中显式声明PATH、LD_LIBRARY_PATH、VIRTUAL_ENV并将ExecStart指向虚拟环境内的绝对路径。问题 7开机自启未生效现象enable成功但重启后服务未拉起。原因未开启 linger用户服务仅在登录会话存活时运行。解决loginctl enable-linger $USER验证loginctl show-user $USER | grep Linger输出yes。问题 8中文路径兼容性隐患现象工作目录~/桌面/ai含中文当前组合可正常运行但部分旧版工具链可能异常。建议长期生产使用建议迁移至纯英文路径如~/projects/ai。7. 日常运维速查表操作命令查看实时日志journalctl --user -u vllm-qwen -f查看服务状态systemctl --user status vllm-qwen重启服务systemctl --user restart vllm-qwen停止服务systemctl --user stop vllm-qwen禁用自启systemctl --user disable vllm-qwen重新启用自启systemctl --user enable vllm-qwen编辑服务配置nano ~/.config/systemd/user/vllm-qwen.service systemctl --user daemon-reload验证 API 可用curl http://localhost:8003/v1/models进入虚拟环境source ~/桌面/ai/.venv/bin/activate8. 性能参考数据基于本次部署实测Qwen2.5-VL-3B-Instruct, Z790 平台指标数值模型权重占用~7.16 GiBKV Cache 分配~9.80 GiB (285K tokens)最大上下文长度32,768 tokens纯文本 prompt tokens23图文 prompt tokens3,604 (含图像编码)理论并发数 (32K ctx)~8.7x9. 完整依赖版本清单供复现环境时对照torch2.6.0cu126 torchvision0.21.0cu126 torchaudio2.6.0cu126 transformers4.51.3 accelerate1.6.0 qwen-vl-utils0.0.11 vllm0.8.5.post1 flashinfer-python0.2.6 # 可选 nvidia-cuda-runtime-cu1212.6.* nvidia-cudnn-cu129.5.* nvidia-cublas-cu1212.6.* modelscope1.24.0 # 或 huggingface_hub0.30.2文档版本v2.0 |最后更新2026-08-05 |作者DP

相关新闻

2026/8/6 8:09:55

零基础入门ESP32如何点亮LED灯

很多零基础的朋友拿到ESP32开发板,第一反应是兴奋,第二反应是茫然——这东西怎么上手?驱动怎么装?固件怎么烧?代码写在哪?怎么传到板子上? 传统的入门路径太长了:装驱动→烧固件→装…

2026/8/6 8:09:55

AI数字人唱歌视频生成:从Wav2Lip到游戏应用的技术解析

1. 先搞清楚这个玩法到底是什么,以及它为什么能火 如果你玩《逆水寒》手游,最近可能被一个玩法刷屏了:用自己游戏里精心捏出来的角色,生成一段唱歌视频。这听起来有点“黑科技”,但核心体验其实很直接——你上传一张游…

2026/8/6 8:04:55

PNP晶体管工作原理、关键参数与经典应用电路全解析

1. 项目概述:从“电流阀门”到无处不在的开关 在电子世界的底层,有一种元件,它不像CPU那样光芒万丈,也不像屏幕那样直观可见,但它却是构建现代数字与模拟电路的基石之一。它就是PNP型双极结型晶体管。很多人一听到“晶…

2026/8/6 9:04:58

从工具到资产:蓝色星球造价机器人重构造价行业数字化底层逻辑

一、清晰产品定位:与传统算量软件形成互补分层体系在 GB/T 50500-2024 新版清单计价规范全面落地、行业数字化转型加速的当下,造价咨询、建设、施工企业普遍陷入多重发展瓶颈:服务价格持续走低,项目资料散落于个人设备、聊天记录难…

2026/8/6 9:04:58

RTT学习-双向链表

一、为什么 RTOS 内核需要双向链表在 RT-Thread 中,双向链表是组织内核对象的重要基础。链表中的每个节点都保存两个指针:next:指向直接后继节点;prev:指向直接前驱节点。与单向链表相比,双向链表可以从任意…

2026/8/6 9:04:58

用AI自动承接私信,解决短视频运营人手不足难题

短视频运营新解法:利用AI自动化承接私信,缓解人力瓶颈对于许多初创团队、个体经营者以及中小企业主而言,同时维护多个社交平台账号是一项极具挑战的任务。手动回复海量私信、实时查看评论以及保持账号的日常活跃度,往往占据了运营…

2026/8/6 9:04:58

通信系统ADC性能评估实战:从SNR与SFDR测试到链路预算映射

1. 项目概述:为什么通信系统工程师必须关注ADC的SNR与SFDR?在通信系统的硬件设计里,模数转换器(ADC)的性能评估从来都不是一个可以“差不多就行”的环节。你可能已经熟练地在STM32或者ESP32上配置了ADC,完成…

2026/8/6 8:59:58

老旧小区门禁改造:四种技术路线怎么选?

> 摘要:弱电工程商接老旧小区门禁改造,总线制、4G、无线自组网、云对讲到底怎么选?本文基于广州越秀区某8层老楼现场实测数据,从施工条件、信号稳定性、长期费用、适老化四个维度做技术对比,附选型决策流程图与勘查…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/6 0:04:22

电力系统调度中的源荷不确定性建模与优化实践

1. 电力系统调度中的源荷不确定性挑战现代电力系统正面临前所未有的复杂性,其中源荷不确定性(Source-Load Uncertainty)已成为调度决策中最棘手的难题之一。我在参与某省级电网调度系统升级时,曾遇到风电预测误差导致日内调度计划…

2026/8/6 0:04:22

VGG-T3技术解析:3D重建速度的革命性突破

1. 项目概述:VGG-T3如何重新定义3D重建速度在计算机视觉领域,3D场景重建一直是个计算密集型任务。传统方法重建1000帧图像规模的场景往往需要数小时甚至更长时间,而英伟达最新发布的VGG-T3技术将这个时间压缩到了惊人的54秒。这个突破性进展来…

2026/8/6 0:04:22

深度解析旅游网站建设的意义及其对行业发展的深远影响与核心价值体现

在这个数字化浪潮席卷全球的今天,我们似乎已经忘记了,曾经有一段时间,人们想要去一个陌生的地方,只能靠在书桌前翻阅厚厚的旅游杂志,或者向刚从那里回来的朋友询问那些模糊不清的印象。那时候,“远方”是一个需要精打细算才能抵达的奢侈概念。而现在,只需要一部手机,轻…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/5 19:21:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…