WeMM-Embedding输入类型完全指南:文本、图像、视频、文档与交错多模态的5种用法

发布时间:2026/10/11 14:18:16

WeMM-Embedding输入类型完全指南:文本、图像、视频、文档与交错多模态的5种用法 人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载WeMM-Embedding 是微信视觉团队WeChat Vision开源的通用多模态 Embedding 模型家族能把文本、图像、视频、视觉文档、交错多模态这 5 种输入统一编码成同一个向量空间里的嵌入向量Embedding一个模型就能完成跨模态的语义检索。本文带你从零看懂这 5 种输入类型分别怎么用以及它们各自的典型场景。一、5种输入类型总览一张表看懂无论输入是什么模态WeMM-Embedding 的输出都是同一个维度的向量——不同模态的向量可以直接做相似度计算余弦相似度这就是统一表示的意义。输入类型典型场景示例 文本文搜图、文搜视频、语义搜索用一段描述从图库中找照片️ 图像以图搜图、图文跨模态检索找同款商品、以图搜描述 视频文搜视频、视频推荐湖心船上看山景定位视频片段 视觉文档图表/票据/页面截图检索问题定位到相关图表 交错多模态图文混排内容理解与检索商品页图标题价格卖点整体编码 全系列 3 个模型2B / 4B / 9B都支持以上全部 5 种输入音频输入暂不支持。模型规模与维度一览模型支持的 Matryoshka 维度WeMM-Embedding-2B64 / 128 / 256 / 512 / 1024 / 2048WeMM-Embedding-4B64 / 128 / 256 / 512 / 1024 / 2560WeMM-Embedding-9B64 / 128 / 256 / 512 / 1024 / 2048 / 4096二、文本嵌入从一句话到检索结果最基础的用法把一段自然语言编码成向量。WeMM-Embedding 的文本嵌入特别强的一点是细粒度语义区分——连图片里包含的文字招牌、水印都能理解。比如用文字一家转角建筑门上方写着 Red Corner Cafe 的招牌去检索模型能精确命中带这块招牌的店面而不是其他长得像的转角咖啡馆。下面这张就是模型用来做干扰项的相似店面在 TextCaps 等图中文字检索基准上WeMM-Embedding 都能把正确目标排到 Top-1。三、图像嵌入以图搜图与图文跨模态图像输入走的是视觉语言模型VLM预处理管线图片被切分成视觉 token与文本 token 在同一个 Transformer 里融合编码。这意味着图像嵌入天然理解图像里的语义而不只是像素相似度。看一个真实案例输入一段很长的描述——一只龟坐在长满青苔的漂浮树干上水面漂着泡沫远处有枯草——模型在 5000 张候选图里精准找到了下面这张图Top-1 命中两个近似干扰项只有龟木头但缺少青苔、泡沫等细节的图都被正确排在了后面。这就是细粒度描述检索的威力。四、视频嵌入把整段视频压成一个向量视频输入会被均匀采样成帧序列官方评测使用 64 帧按帧包frame bundle约定展开后与文本一起编码输出和文本/图像完全同构的向量。典型场景是文搜视频在 MSR-VTT 基准中用文本 the mountain views are from a boat on the center of a lake湖中心船上的山景视角检索WeMM-Embedding-9B 能在一千个候选视频中把从船上拍摄湖面山景的那段排到第一并把陆上旅行视角等干扰视频排到后面。五、视觉文档嵌入检索图表、票据与页面截图视觉文档VisDoc任务处理的是以图像形式存在的文档内容图表、表格、票据、合同页、网页截图。模型需要理解图中的数字、单位和类别标签而不只是版式。看一个图表检索案例问题是按每 100 千卡热量计的羊肉与山羊肉生产的土地利用是多少模型要在 500 张图表里找到单位是每 100 千卡而不是相近的每 100 克蛋白质的那张单位、指标、类别三个条件全部对上才能命中这也是 VisDoc 任务得分最高的关键。六、交错多模态图文混排在同一个 Prompt 里第 5 种输入是前四种的组合体一段 Prompt 里文本和图片按顺序穿插排列。输入消息中的内容列表content list可以包含多个text、image、video项模型会把它们按占位符位置交错插入后一起编码。典型应用是商品信息理解与检索MCMR 任务候选商品 商品主图 Title / Description / Price / Features字段整体作为一个图文混合样本编码查询则是一条文字描述。相关解析逻辑见 mmeb_v3_eval/src/data/eval_dataset/mcmr_dataset.py交错插入的处理在 mmeb_v3_eval/src/model/processor.py。在 MMEB-v3 的 47 个 Agent 任务上交错多模态理解能力让 WeMM-Embedding 拿到同规模第一9B 达 50.1 分。七、快速上手三步跑通第一种输入依赖非常轻核心就是transformerssentence-transformerspip install -r requirements.txt仓库自带两个最小推理示例官方推荐transformers5.2.0以保证预处理行为一致python examples/transformers_inference.py \ --model /path/to/WeMM-Embedding-2B \ --image /path/to/image.jpg \ --video /path/to/video.mp4 \ --dimension 2048它会对同一条消息里的文本、图像、视频分别输出独立嵌入向量省略--dimension则使用完整维度。另外 examples/sentence_transformers_inference.py 展示了用SentenceTransformer.encode()的更简洁写法——文本、图像、视频都可以直接encode()。生产环境部署可用 vLLM 或 SGLang 起推理服务一键脚本在 scripts/serve_vllm.sh 与 scripts/serve_sglang.shSGLang 需先跑 scripts/patch_sglang_video.py 打视频补丁。八、Matryoshka 维度一个模型输出多种向量长度所有模型都支持MatryoshkaMRL嵌入截取完整向量前 d 维再 L2 归一化即可得到 d 维表示无需重新训练。维度越短向量库存储和检索越快性能损失很小——以 2B 模型为例256 维时仍保留完整维度图像/视频性能的98.7%九、性能表现与评测代码WeMM-Embedding 在 MMEB-v278 个数据集与 MMEB-v3190 个任务上全面领先同规模模型模型MMEB-v2 AVG图像视频视觉文档WeMM-Embedding-2B77.979.670.880.7WeMM-Embedding-4B79.280.872.182.0WeMM-Embedding-9B80.681.974.383.3MMEB-v3 上 9B 模型更是拿下 Agent 任务 50.1 分的全场最高分。完整对比见 README.md 的评测章节与技术报告 assets/WeMM_Embedding_tech_report.pdf。评测代码在 mmeb_v3_eval/mmeb_v3_eval/README.md 有数据下载、单机/多机多卡的完整命令如scripts/run_eval.sh。另外docs/ 是一个交互式项目页内置 6 个真实检索案例数据见 docs/data/cases.json可以在线查看每个查询的 Top-1 命中与干扰项分析。十、总结选哪种输入只有文字→ 直接传文本消息覆盖文搜图/文搜视频/语义搜索有一张图→ 图像消息适合以图搜图、同款识别有一段视频→ 视频消息采样 64 帧编码适合视频检索图表/票据/截图→ 视觉文档消息适合 RAG 图表问答、单据归档检索图文混排内容→ 交错多模态消息商品理解、GUI 轨迹、多截图对话都可以整体编码。无论哪种输入输出的都是同一个空间里的向量——这就是 WeMM-Embedding 作为多模态 Embedding 统一底座的核心价值5 种输入1 个向量空间。赞分享人工智能大模型Embedding多模态模型评测模型推理服务【免费下载链接】WeMM-EmbeddingWeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.项目地址https://gitcode.com/gh_mirrors/we/WeMM-Embedding点击查看免费下载相关推荐WeMM-Embedding概览微信开源的通用多模态嵌入模型文本、图像、视频、文档统一进一个向量空间WeMM Embedding概览微信开源的通用多模态嵌入模型文本、图像、视频、文档统一进一个向量空间 WeMM Embedding 是微信视觉团队WeCh人工智能大模型Embedding多模态模型评测模型推理服务Xinference 文本嵌入完全指南Embeddings API、多引擎服务与多模态 WeMM 输入Xinference 文本嵌入完全指南Embeddings API、多引擎服务与多模态 WeMM 输入 本文围绕 Xinference 的 Embedding模型推理服务人工智能大模型本地部署多模态语音vLLM-Omni多模态输入处理文本、图像、音频、视频全支持vLLM Omni多模态输入处理文本、图像、音频、视频全支持 vLLM Omni是一个高效的 多模态推理框架 专门设计用于处理文本、图像、音频和视频等多种模人工智能大模型模型推理服务多模态语音音频媒体生成本地部署创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/11 14:18:16

中南大学数据库试题:数据库工程师能力校准器

简介:本资源为中南大学数据库课程历年典型试题汇编,面向计算机专业本科生、考研备考学生及数据库初学者,系统覆盖数据库原理核心考点与应试难点。试题内容紧扣教学大纲,涵盖DBMS演进逻辑、三级模式结构、ER与关系模型设计、SQL语法…

2026/10/11 14:18:16

Origin 安装全流程指南:选型、部署、激活与避坑

简介:Origin是一套专为科研与工程领域设计的专业数据分析和绘图软件,集成数据导入、函数拟合、统计分析及二维/三维图形绘制功能,适合高校师生、科研人员及工程师用于制作论文中的高质量插图,尤其适合需要发表高水平学术论文的学者…

2026/10/11 16:43:25

Docker容器化Python应用:从部署翻车到生产环境实践

前几天帮某开发者排查部署问题,他的Flask应用在自己笔记本上跑得好好的,换到服务器上就开始报ModuleNotFoundError,补装依赖之后又遇到版本冲突,最后连Python解释器版本都不一样了。这种场面我见过太多次,绝大多数时候…

2026/10/11 16:43:25

SVG电力图元开发指南:从坐标规范到实时数据接入

简介:面向电力行业绘图与软件开发人员的SVG电力图元定义文档,统一了电力接线图中隔离开关、断路器、变压器等常见设备符号的绘制标准。SVG作为基于XML的矢量格式,可无损缩放,非常适合在不同尺寸屏幕与打印材料上保持图形清晰一致。…

2026/10/11 16:43:25

Java爬虫工程化实战:从HttpClient到反爬与调度系统设计

做数据采集项目时,很多人第一反应是用 Python 写爬虫,但我们在实际落地一个多城市公共交通数据采集系统时,最终选型却定为 Java。Java 爬虫在并发控制、工程化整合和长期稳定性上确实有它不可替代的位置。这篇东西不是教程式的废话堆砌&#…

2026/10/11 16:38:25

Imatest SFRplus教程:从拍摄规范到MTF50指标解读与常见问题排查

简介:这份Imatest教程是一份面向相机评测人员、影像工程师及摄影爱好者的图像质量分析入门文档,重点解决如何看懂Imatest色彩、噪声与解像力测试图表。资源为单个doc文档,压缩包仅128KB,内容紧凑,适合快速查阅。文档依…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑