发布时间:2026/9/2 11:29:58
SGLang 多模态完整指南:让模型看图、懂视频、做图文检索一步到位 SGLang 多模态完整指南让模型看图、懂视频、做图文检索一步到位【免费下载链接】sglangSGLang is a high-performance serving framework for large language models and multimodal models.项目地址: https://gitcode.com/GitHub_Trending/sg/sglang丢一张截图给模型问这是啥或者把一段会议录屏丢过去让它总结重点——这类需求看起来离生产环境还差一步其实也就是几行 API 调用的距离。SGLang 是一个面向大语言模型与多模态模型的高性能推理服务框架图像问答、视频理解、图文嵌入检索这些能力都能接。读完全文你会知道能接哪些视觉模型、怎么一条命令拉起服务以及视频抽帧和图文检索该怎么调。能接哪些多模态模型端侧、主力、专项三档端侧轻量MiniCPM-V 2.6openbmb/MiniCPM-V-2_6约 8B面向移动/边缘部署优化MiniCPM-o 版本再加音频、视频模态。主力视觉模型图像文本进、文本出Qwen-VLQwen/Qwen3-VL-235B-A22B-Instruct图像分析与讨论的当前标杆。Llama 3.2 Vision 11Bmeta-llama/Llama-3.2-11B-Vision-Instruct适合视觉问答这类任务。Gemma 3google/gemma-3-4b-it4B/12B/27B 三档每张图像编码成 256 个 token放在 128K 上下文里。LLaVA 系liuhaotian/llava-v1.5-13b、lmms-lab/llava-next-72bLLaVA-OneVisionlmms-lab/llava-onevision-qwen2-7b-ov可一次输入多张图甚至视频帧兼容 OpenAI Vision API 的格式。DeepSeek-VL2deepseek-ai/deepseek-vl2带专用图像处理器Kimi-VLmoonshotai/Kimi-VL-A3B-Instruct可从图像理解并生成文本MiMo-VL 7BXiaomiMiMo/MiMo-VL-7B-RL用原生分辨率 ViT 抓细粒度细节。Mistral-Small-3.1-24Bmistralai/Mistral-Small-3.1-24B-Instruct-2503支持图像输入还带工具调用和结构化输出。专项能力Janus-Pro 1B/7Bdeepseek-ai/Janus-Pro-7B图像理解和生成都能做视觉编码路径与生成解耦。Phi-4-multimodalmicrosoft/Phi-4-multimodal-instruct文本、视觉、音频三模态多模态能力通过 LoRA 增强。GLM-4.5V 106B / GLM-4.1V 9Bzai-org/GLM-4.5V靠可扩展强化学习做多模态推理启动时记得加--chat-template glm-4v。DotsVLMrednote-hilab/dots.vlm1.inst及其 OCR 变体rednote-hilab/dots.ocr后者是专用 OCR 模型注意别给它加--trust-remote-code。另外如果模型的对话格式比较特殊启动时可以指定自定义模板仓库里就有现成参考examples/chat_template/vision_template_sarashina_vl.jinjaSarashina-VL 用。️ 场景一让模型看懂一张图含多图先把服务拉起来一条命令的事python3 -m sglang.launch_server \ --model-path meta-llama/Llama-3.2-11B-Vision-Instruct \ --host 0.0.0.0 --port 30000调用侧直接用 OpenAI 客户端就行——SGLang 的接口和 OpenAI 兼容你原来对接其他推理服务的代码基本能原样搬过来from openai import OpenAI client OpenAI(base_urlhttp://localhost:30000/v1, api_keyNone) resp client.chat.completions.create( modelmeta-llama/Llama-3.2-11B-Vision-Instruct, messages[{role: user, content: [ {type: text, text: 这张图里有什么}, {type: image_url, image_url: { url: https://github.com/sgl-project/sglang/blob/main/test/lang/example_image.png?rawtrue}}, ]}], max_tokens300, ) print(resp.choices[0].message.content)多图就更有意思了在同一个content列表里继续追加image_url项即可模型能把两张毫不相关的图分别描述再对比。不想引客户端库的话直接 POST/v1/chat/completions也行JSON 结构完全一样。 场景二让模型看懂视频抽帧转 base64视频理解本质上是把视频变成一串图片。思路三步走用 decord 均匀抽帧 → 每帧压成 JPEG → base64 编码后塞进content当image_url用import base64, io from decord import VideoReader, cpu from PIL import Image vr VideoReader(jobs_presenting_ipod.mp4, ctxcpu(0)) n 10 # 抽帧数量 idx [int(i * (len(vr) - 1) / (n - 1)) for i in range(n)] # 均匀采样 frames vr.get_batch(idx).asnumpy() content [] for f in frames: buf io.BytesIO() Image.fromarray(f).save(buf, formatJPEG) content.append({type: image_url, image_url: { url: data:image/jpeg;base64, base64.b64encode(buf.getvalue()).decode()}}) content.append({type: text, text: 请描述这段视频。})剩下的照旧把messages[{role: user, content: content}]发给client.chat.completions.create模型就会输出一段视频描述。帧数怎么取舍帧多信息全但 token 变长、响应变慢、显存吃紧。问这视频讲了什么这类整体性问题均匀抽 10 帧通常够用要定位某个具体动作或时间点就在该时段附近加帧、加密采样。特别长的视频建议先分段处理别一次性把整个文件读进来。 场景三图文嵌入检索embedding想做以文搜图找相似图或者聚类就走嵌入这条路先用--is-embedding参数启动服务模型Alibaba-NLP/gme-Qwen2-VL-2B-Instruct请求体里文本、图像可以混着传返回的是同一个向量空间的 embeddingimport requests payload { model: gme-qwen2-vl, input: [ {text: Represent this image in embedding space.}, {image: https://huggingface.co/datasets/liuhaotian/llava-bench-in-the-wild/resolve/main/images/023.jpg}, ], } resp requests.post(http://127.0.0.1:30000/v1/embeddings, jsonpayload).json() print(resp[data][0][embedding])文字和图片的向量落在同一个空间直接算相似度就能做检索、聚类接上向量数据库就是一套图文搜索系统。⚡ 参数与性能怎么调6 条可操作清单特征张量留在 GPU 上默认情况下多模态特征张量处理完会搬回 CPU 省显存显存够的话启动时加--keep-mm-feature-on-device张量常驻 GPU少一次设备间拷贝延迟直接受益。控制分辨率分辨率越高计算和内存开销越大先按模型的要求降采样多数模型对输入分辨率有明确规格。批处理提吞吐请求可以排队的话就让多个多模态请求攒一批框架会自动合并GPU 利用率更实在。GPU 打底多卡扩展视觉编码器的计算量不小大模型直接多 GPU 或上云部署。挂上监控仓库自带 Prometheus/Grafana 配置边调边看延迟、吞吐和 GPU 占用瓶颈一眼定位。重复请求吃缓存同一批图反复问命中内置缓存就不用重算省时间也省卡。收尾服务一拉起来看图、读视频、图文检索之间只是请求体的差别——选个模型、拷走上面的代码今天就能跑通。想继续深挖仓库里这几处值得看一眼官方视觉 API 文档docs/docs/basic_usage/openai_api_vision.mdx图文嵌入示例脚本examples/runtime/multimodal_embedding.py自定义视觉对话模板examples/chat_template/vision_template_sarashina_vl.jinja视觉服务测试test/registered/vlm/test_vision_openai_server_a.py【免费下载链接】sglangSGLang is a high-performance serving framework for large language models and multimodal models.项目地址: https://gitcode.com/GitHub_Trending/sg/sglang创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/9/2 11:29:58

恶劣天气点外卖不迟到:从ETA预判到预订单的实操指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/2 11:44:58

YOLO工程化流水线:从可复现训练到工业落地

简介:YOLO图像检测自动化训练平台是一个面向人工智能初学者与计算机视觉开发者的轻量级YOLO模型训练工具,旨在降低目标检测模型训练门槛,解决手动编写训练脚本、配置环境、管理数据集等重复性难题。资源包共53个文件,含22个Python…

2026/9/2 11:44:58

PBR地面纹理实战指南:从通道解析到4K贴图决策的完整工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/2 11:44:58

当大模型快100倍:性能跃迁背后的工程挑战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/2 11:44:58

龙珠人造人全解:盖罗博士的技术树、无限能源与时间线差异

这次我们来看一个龙珠系列里的经典主题:最新龙珠宇宙第4期 地球人造人。很多龙珠内容讨论主要集中在赛亚人战力、变身形态和破坏神这些“高维力量”上,反而把“地球人造人”这块技术含量非常高的设定当成过渡剧情简单带过。实际上,从盖罗博士…

2026/9/2 11:39:58

Matlab频谱分析实战:基于傅里叶变换的乐器识别

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/1 16:02:17

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/9/2 9:00:32

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/9/2 8:41:06

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/9/2 0:03:41

单片机毕业设计-基于单片机与蓝牙通讯的输液状态监测终端设计与开发 基于 STM32 或 51 单片机的液位‑滴速‑温度多参数输液监护装置设计(024005)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/9/2 0:03:41

DeepSeek字幕翻译实战:从API调用到批量SRT转中文的完整方案

这次我们来看一个很实用的 DeepSeek 落地场景:用 DeepSeek 把英文视频字幕自动翻译成中文。具体案例是《恶魔君》1989 年第 28 集的英转中字幕任务,标题写得很直白,但背后其实是一整套可以复用的技术流程:字幕解析、模型调用、批量…

2026/9/2 0:03:41

用Python搭建搞笑语音助手:从语音识别到语音合成全教程

当你家里摆着一台天猫精灵,却总希望语音助手偶尔“不正经”一点,不用官方腔回答问题,而是张口就接几句搞笑段子,会是什么体验?我最近动手验证了一下这个想法——没有去改装任何市面上现有的智能音箱,而是直…

2026/9/2 1:15:22

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/2 1:15:22

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/2 1:15:20

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…