发布时间:2026/8/19 21:40:45
JoyAI-VL-Interaction 部署实战:在 RTX 2080 Ti 上搭建多模态推理服务 JoyAI-VL-Interaction 部署实战在 RTX 2080 Ti 上搭建多模态推理服务本文记录了在双卡 RTX 2080 Ti 环境下从零部署 JoyAI-VL-Interaction 多模态大模型的全过程包括环境配置、依赖安装、代码修复以及网络问题的排查与解决。 项目背景应用户需求我们在配备2x NVIDIA RTX 2080 Ti每卡 11GB的服务器上进行 JoyAI-VL-Interaction 模型的部署工作。该模型源自 vllm-omni 项目是一个支持图像和视频理解的多模态大语言模型。硬件与软件环境组件版本/规格GPU2x NVIDIA RTX 2080 Ti (11GB)操作系统Ubuntu 22.04Python3.10 (via conda)CUDA 驱动580.159.03 第一阶段环境配置1.1 创建 Conda 环境我们首先创建独立的 Python 环境以避免依赖冲突conda create-nvllm-omnipython3.10conda activate vllm-omni环境位置~/miniconda3/envs/vllm-omni/1.2 安装核心依赖包在vllm-omni环境中安装以下包vllm-omni 0.22.0— vLLM 多模态扩展vllm 0.24.0— 底层推理引擎opencv-python— 图像处理pytest— 单元测试框架CUDA 相关依赖torch、nvidia-* 系列包pipinstallvllm-omni0.22.0vllm0.24.0 opencv-python pytest 提示建议在安装前更新 conda 和 pip以避免潜在的版本兼容问题。 第二阶段代码修复问题描述在启动 vLLM 服务时发现vllm-omni 0.22.0尝试从 vLLM 导入supports_xccl函数但 vLLM0.24.0版本中已经移除该函数导致以下错误AttributeError: module ‘vllm.utils.torch_utils’ has no attribute ‘supports_xccl’解决方案手动在 vLLM 的torch_utils.py文件中添加缺失的函数。文件路径~/miniconda3/envs/vllm-omni/lib/python3.10/site-packages/vllm/utils/torch_utils.py添加位置约第 73 行defsupports_xccl()-bool:Check if the current platform supports XCCL (AMD ROCm).returntorch.version.hipisnotNone函数作用该函数用于检测当前平台是否支持 AMD ROCm 平台的 XCCL 通信库。由于我们使用的是 NVIDIA GPU该函数直接返回False不影响正常推理。 第三阶段源码配置3.1 获取 vllm-omni 源码虽然已通过 pip 安装了 vllm-omni但我们还需要本地源码以支持 orchestrator 服务的运行gitclone https://github.com/vllm-project/vllm-omni.git ~/vllm-omni源码目录包含关键模块vllm_omni/experimental/fullduplex/— 全双工通信模块3.2 配置 PYTHONPATH确保 Python 能找到本地源码exportPYTHONPATH~/vllm-omni:$PYTHONPATH⚠️ 重要此环境变量在每次启动服务前都必须设置否则 orchestrator 将无法找到必要模块。⏳ 第四阶段模型下载进行中4.1 当前进度配置文件的缓存目录已创建~/miniconda3/envs/vllm-omni/hf_cache/hub/models–jdopensource–JoyAI-VL-Interaction-Preview/模型权重文件safetensors 格式约 17GB尚未下载完成。4.2 遇到的网络问题系统配置了代理http_proxyhttp://127.0.0.1:7897https_proxyhttp://127.0.0.1:7897all_proxysocks://127.0.0.1:7897问题httpx库不支持 socks 代理 scheme导致下载请求失败。4.3 尝试过的解决方案方案结果说明取消代理环境变量❌ SSL EOF 错误可能是网络直连问题使用 hf-mirror.com❌ 相同 SSL 错误镜像站也受影响干净环境下载❌ 卡在 0 bytes网络连接不稳定4.4 待执行的下载命令source~/miniconda3/bin/activate vllm-omniunsethttp_proxy https_proxy http_proxy https_proxy all_proxy ALL_PROXYexportHF_HOME~/miniconda3/envs/vllm-omni/hf_cacheexportHF_ENDPOINThttps://hf-mirror.com python-cfrom huggingface_hub import snapshot_download; snapshot_download(jdopensource/JoyAI-VL-Interaction-Preview, cache_dir$HF_HOME) 第五阶段服务启动待完成5.1 启动 vLLM 后端服务模型下载完成后执行以下命令启动 vLLM 服务器source~/miniconda3/bin/activate vllm-omniunsetall proxy varsexportHF_HOME~/miniconda3/envs/vllm-omni/hf_cacheexportVLLM_USE_FLASHINFER_SAMPLER0vllm serve jdopensource/JoyAI-VL-Interaction-Preview\--served-model-name JoyAI-VL-Interaction-Preview\--port8061\--quantizationfp8\--max-model-len32768\--gpu-memory-utilization0.5\--enable-prefix-caching\--limit-mm-per-prompt{image:256,video:1}参数说明参数值说明--port8061vLLM 服务端口--quantizationfp8FP8 量化以节省显存--max-model-len32768最大上下文长度--gpu-memory-utilization0.5每卡 50% 显存用于模型--limit-mm-per-promptimage:256, video:1单请求最多 256 张图或 1 个视频5.2 启动 Orchestrator 编排服务source~/miniconda3/bin/activate vllm-omniunsetall proxy varsexportPYTHONPATH~/vllm-omni:$PYTHONPATHexportHF_HOME~/miniconda3/envs/vllm-omni/hf_cacheexportVLLM_USE_FLASHINFER_SAMPLER0python-mvllm_omni.experimental.fullduplex.joyvl.serving.server\--port8070\--main-backend-url http://127.0.0.1:8061/v1\--main-model JoyAI-VL-Interaction-Preview架构说明Orchestrator 作为前端网关将请求转发至后端 vLLM 服务实现全双工多模态推理。 关键文件清单文件路径vLLM 补丁文件~/miniconda3/envs/vllm-omni/lib/python3.10/site-packages/vllm/utils/torch_utils.pyvllm-omni 源码~/vllm-omni/HuggingFace 缓存~/miniconda3/envs/vllm-omni/hf_cache/vLLM 日志~/vllm-serve.logOrchestrator 日志~/orchestrator.log 后续优化建议模型下载替代方案若 Python 下载持续失败可尝试使用wget或curl直接从 hf-mirror.com 下载模型权重多卡并行RTX 2080 Ti 双卡可通过tensor-parallel-size2进一步提升吞吐量监控指标建议配置 Prometheus Grafana 监控 GPU 利用率和推理延迟 总结本次部署的核心挑战在于vllm-omni 与 vLLM 版本不匹配以及网络代理兼容性两个问题。通过手动修补缺失函数和配置环境变量我们已解决大部分障碍。模型下载是当前唯一阻塞项一旦完成即可启动完整的推理服务。

相关新闻

2026/8/19 10:48:09

TLCPGMSSL协议及Wireshark抓包详解

一、TLCP/GMSSL 概念 TLCP 是国家标准协议(GB/T 38636-2020/GM/T 0024-2014),非标准叫法也有叫GMSSL协议的,这个和GMSSL开源库( 实现TLCP协议的开源密码库名称)容易造成混淆,所以标准的统一名称应为 TLCP协…

2026/8/20 0:50:29

兴趣培养,遵从孩子喜好不要盲目报班

在孩子的课余时间,许多家长会精心安排各种兴趣班,觉得多学一门技能就多一份竞争力。但在这股热潮中,一个关键问题往往被忽视了:这些兴趣班究竟是孩子真正的喜好,还是家长觉得“应该学”的?当培养方向与孩子…

2026/8/19 4:14:00

ChatGPT+DALL·E 3 工作流优化:3步完成图片迭代,效率提升对比

ChatGPTDALLE 3 高效工作流:3步实现专业级AI图片迭代当设计需求像潮水般涌来时,大多数创意工作者都经历过这样的困境:反复修改的图片版本堆满桌面,客户反馈的邮件塞满收件箱,而截止日期就在眼前。传统设计流程中&#…

2026/8/20 2:36:49

智能高边开关PROFET:从保险丝到智能节点的车载电源进化

1. 从“保险丝”到“智能开关”:一个被忽视的进化如果你问一个干了十几年的硬件工程师,车上最不起眼但又最要命的器件是什么,很多人可能会说是MCU、是传感器。但在我经手过的无数个车载项目里,真正让我“翻车”次数最多、也最能体…

2026/8/20 2:36:49

蔚来赴美IPO传闻解析:企业融资策略与资本市场博弈

1. 从“赴美IPO”传闻看企业融资的必然性与复杂性最近,关于蔚来汽车可能赴美进行首次公开募股的传闻,在业内和投资者圈子里传得沸沸扬扬。副总裁朱江的出面澄清,让这个事件从一个简单的市场传闻,变成了一个观察企业战略、市场预期…

2026/8/20 2:31:49

基于BLE与5GHz WiFi的实时考勤系统:ESP32网关与低功耗工卡设计

1. 项目概述:一个基于BLE与5GHz WiFi的考勤系统最近在捣鼓一个挺有意思的硬件项目,核心是用蓝牙低功耗(BLE)来做人员签到,然后通过5GHz WiFi把数据实时推送到一个网页仪表盘上。项目代号叫“NU87DK”,听起来…

2026/8/19 4:14:28

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/19 15:09:57

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/20 0:01:41

Cline、Hermes、OpenClaw 都能连:HTTP 型 MCP 客户端全适配

后台被问得最多的一类问题是:“我用的是 Cline / Hermes / OpenClaw,能连察元的 WPS 文档服务吗?” 统一回答:能。而且这个"都能连"值得单独写一篇——不是我们挨个给每个客户端做了适配,而是所有这些客户端…

2026/8/20 0:01:41

46 个文档工具一次看懂:察元AI文档助手 MCP 工具目录速览

把察元AI文档助手接进 Claude Code 之后,我建议的第一件事不是急着下提示词,而是把它的 MCP 工具目录过一遍——46 个工具(MCP 目录版本 0.10.0),乍看吓人,其实按"一份文档的生命周期"分组之后非…

2026/8/18 18:23:10

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/19 4:14:38

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/19 16:39:34

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…