发布时间:2026/9/6 23:58:36
VLM发展路线(概述) 实际上VLM的发展可以总结成一句话从“让模型看懂图文关系” → “让模型拥有视觉能力” → “让大语言模型理解视觉” → “让视觉语言模型成为通用助手”。一、VLM发展的四个阶段整个路线可以分成阶段时间核心问题代表论文阶段1视觉-语言对齐2021图片和文字如何建立联系CLIP阶段2视觉语言预训练2022如何同时理解、生成、多任务学习BLIP、Flamingo阶段3视觉连接LLM2023如何让LLM获得视觉能力BLIP-2、InstructBLIP、LLaVA阶段4大规模通用多模态模型2023-2024如何成为GPT-4V一样的通用助手Qwen-VL、InternVL、Florence-2第一阶段CLIP(2021) 找到视觉和语言的共同空间背景2020年前后的视觉模型CNN/ViT输入图片 → 分类标签问题模型只能识别固定类别。所以OpenAI提出能不能直接利用互联网的图片文本让模型学习世界概念于是CLIP出现。核心思想不预测类别。而是Image-Text Contrastive Learning学习图片 → Image Encoder 二者映射到同一个空间 文本 → Text Encoder解决了如何让视觉和语言对齐的问题但不会生成文字、不会聊天、不理解复杂指令所以CLIP更像视觉世界 → 语言空间而不是一个助手。第二阶段BLIP (2022) —— 从“对齐”走向“理解”CLIP的问题图片和文字只是匹配。但是VLM需要看图回答问题、图片描述、视觉推理所以需要更强的视觉语言预训练。核心思想同时训练理解任务和生成任务。提出MED模型Multimodal Mixture of Encoder-Decoder一个模型三个身份1. Image-Text Contrastive Learning类似CLIP图片和文字靠近。2. Image-Text Matching判断图片和文本是否匹配二分类3. Image Captioning所以BLIP比CLIP多了一步CLIP图片 ↔ 文本BLIP图片 ↔ 文本理解↓文本生成BLIP最大的贡献不是结构。而是提出CapFilt 数据过滤机制互联网图片图片 垃圾文本 很多BLIP用Captioner生成高质量captionFilter过滤错误caption得到 clean image-text pairs成为后来大量VLM的数据构建基础。Flamingo(2022)让LLM“看图”CLIP视觉理解强BLIP视觉语言任务强但它们不是LLM。问题能不能直接把视觉能力接到GPT这种语言模型核心思想保持LLM参数冻结通过增加视觉编码器和视觉-语言交互模块将视觉信息注入LLM使LLM具备视觉理解能力。结构Image | Vision Encoder | Perceiver Resampler | Visual Tokens ↓ LLM关键Cross Attention原本LLMText → Self AttentionFlamingoText token → Cross Attention ← Image feature让语言模型读取图片。Flamingo解决了如何让大语言模型拥有视觉输入能力但是训练成本高因为需要大量LLM结构修改。Flamingo没有改动预训练视觉模型Vision Encoder的主体也没有重新训练LLM的主体参数但是它改造了LLM结构在LLM中插入了新的Cross-Attention模块并训练这些新增模块。第三阶段BLIP-2 —— 最经典的桥接思想Flamingo的问题需要训练大量参数。BLIP-2提出能不能不用改视觉模型也不用改LLM答案增加一个桥。Flamingo 的思路是冻结视觉编码器 冻结语言模型然后在语言模型内部插入大量可训练的 Gated Cross-Attention 层参数量大。BLIP-2更激进地压缩了要训练的部分把“桥”集中到Q-Former主要训练Q-Former 投影层。Q-Former 本身只有大约188M 参数且LLM 完全冻结不需要像 Flamingo 那样在 LLM 的多层结构中增加一套 Cross-Attention 模块。结构核心Q-Former负责视觉特征 → LLM能够理解的语言空间Flamingo选择把视觉信息通过Gated Cross-Attention直接注入语言模型内部的多层网络BLIP-2则把视觉信息先交给Q-Former提炼成少量query表示再作为LLM的输入前缀/视觉token送入LLM。所以CLIP视觉 ↔ 文本BLIP视觉 ↔ 语言任务Flamingo视觉 → LLMBLIP-2视觉 → QFormer → LLMInstructBLIP(2023)让模型听懂任务BLIP-2的问题会看但是不知道 “你现在让我做什么”。如图片狗问题1这是什么动物 回答狗问题2描述图片 回答一只狗在草地。BLIP-2没有明确任务意识。InstructBLIP加入Instruction tuning输入Image Instruction:Describe this image输出A dog running...用预训练的 BLIP-2 初始化训练在指令调整期间冻结图像编码器和 LLM只微调Q-Former。核心Q-Former增加instruction输入。所以BLIP-2视觉→语言InstructBLIP视觉任务→语言LLaVA(2023)视觉指令微调路线LLaVA其实和InstructBLIP路线不同。它的问题能不能像ChatGPT一样训练一个视觉聊天机器人结构Image ↓ CLIP Vision Encoder ↓ Linear Projection ↓ Vicuna/LLaMA ↓ Answer非常简单。关键创新Visual Instruction Tuning制作图片问题答案例如图片猫生成Human: What is in the image? Assistant: There is a cat.训练LLM学会看图聊天。区别BLIP-2的假设Vision Encoder虽然强但视觉特征和LLM语言空间差距大需要一个强大的桥。LLaVA的假设CLIP已经学好了视觉语义只需要一个简单映射让LLM能读懂即可。BLIP-2重点更好的视觉-LM连接方式Q-FormerLLaVA重点更简单的连接方式 大规模视觉指令数据让LLM获得视觉对话能力BLIP-2认为connector本身需要具备视觉理解能力LLaVA认为connector只需要负责维度映射把视觉理解能力交给CLIP把推理能力交给LLM。第四阶段大规模通用VLM前面模型规模有限、数据有限。GPT-4V出现后目标变成一个模型解决所有视觉任务。Qwen-VL核心中文大模型路线。基础Qwen-LM增加Visual Receptor视觉编码器Input-output interface视觉token接口例如image 图片token /image让LLM知道这里有图片。训练三个阶段图文对齐、多任务预训练、指令微调InternVL核心提高视觉理解能力。路线InternViT QLLaMA 大规模数据重点视觉编码器扩大。因为发现很多VLM瓶颈不是LLM而是视觉理解不足。所以InternVL强化Vision Encoder。Florence-2(2024)它代表另一条路线不做聊天模型而做统一视觉基础模型。目标一个模型完成caption、detection、segmentation、grounding、OCR核心统一序列生成。如检测输出loc_1loc_2分割输出mask token。所以Florence-2更像视觉领域GPT。最终形成三条路线路线1CLIP路线目标视觉语言对齐代表CLIP → BLIP路线2LLM增强路线目标让LLM看懂图片代表Flamingo → BLIP-2 → InstructBLIP → LLaVA路线3通用视觉基础模型路线目标一个模型解决所有视觉任务代表Qwen-VL、InternVL、Florence-2最后一张总图视觉语言模型发展 图片文本如何关联CLIP(2021) | 图文理解生成能力BLIP(2022) | 让LLM拥有视觉 / \ Flamingo BLIP-2 | | 视觉Cross Attention Q-Former桥接 | Instruction能力 | InstructBLIP | Visual Instruction Tuning | LLaVA | 大规模通用多模态模型 / | \ Qwen-VL InternVL Florence-2真正需要记住的不是9个模型而是4个关键问题CLIP视觉和语言怎么对齐BLIP怎么做统一视觉语言预训练BLIP-2/LLaVA怎么让LLM获得视觉能力Qwen-VL/InternVL/Florence-2怎么做通用多模态基础模型

相关新闻

2026/9/6 23:58:36

基于YOLOv8与PyQt5的头盔佩戴检测桌面应用开发实践

在城市道路、产业园区、建筑工地和外卖配送场景里,非机动车骑行者的头盔佩戴情况往往需要人工盯监控或者现场抽查。人工方式不仅效率低,而且容易漏看、疲劳误判,事后追溯也不方便。基于深度学习 YOLOv8 目标检测模型,配合 PyQt5 开…

2026/9/6 23:58:36

闭环温度控制系统设计实战:PID算法与硬件选型全解析

简介:基于8051单片机实现闭环温度控制系统的完整电子工程设计报告,适合自动化、电子信息类专业本科生及嵌入式初学者参考。报告完成于2012年,由自动化专业学生小组在张辉老师指导下撰写,内容涵盖系统背景与功能要求、总体方案论证…

2026/9/7 0:03:37

2026 AI视觉与物联网开发板选购指南:从MCU到Jetson的档位解析

2026 年已经过了一大半,如果你现在正准备入手 AI 视觉或物联网开发板,我建议你先别急着下单。市面上从几十块的 ESP32 到几千块的英伟达 Jetson,价格差了近百倍,宣传话术却几乎一样,都告诉你“能跑 AI、能做视觉、能搞…

2026/9/7 0:03:37

基于Vue的企业门户网站管理系统的设计与实现

目 录 摘 要 Abstract 目 录 1 引言 1.1 选题背景 1.2 研究现状 1.3 目的和意义 1.4 论文结构安排 1.5本章小结 2 开发环境与技术 2.1 MySQL数据库 2.2 Java语言技术 2.3 Spring Boot框架 2.4 Vue.js 2.5 本章小节 3 系统分析 …

2026/9/7 0:03:36

BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析

简介:BS EN 13814-1:2019是英国采纳欧洲标准EN 13814-1:2019的正式版本,由BSI标准出版,重点规定游乐设施和游乐设备在设计与制造环节的安全准则,与BS EN 13814-2:2019、BS EN 13814-3:2019共同取代旧版BS EN 13814:2004。该标准面…

2026/9/7 0:03:36

UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南

简介:UL 1642是锂电池安全领域的重要规范,本中文版资源适合锂电池制造商、检测机构工程师及产品认证相关人员阅读,用于理解电池在设计与制造层面的安全要求、测试方法与合规要点。资源共1个PDF文件,压缩包大小834KB,便…

2026/9/7 0:03:36

基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现

这次我们来看一个把目标检测算法和桌面端工具结合得很典型的项目:基于 YOLOv8 PyQt5 的麦穗稻穗检测识别系统。这个项目本身不是新概念,但它的价值在于落地形态很完整。YOLOv8 负责核心的麦穗稻穗目标检测,PyQt5 负责提供可视化的桌面交互界…

2026/9/6 23:58:36

S698-T处理器上RTEMS移植与开发实战

简介:文档围绕S698-T处理器上的RTEMS实时操作系统移植与应用程序开发展开,定位为航天嵌入式领域的专业技术文献,适合嵌入式实时系统开发者、航天器电子系统工程师及相关专业研究生阅读参考。文档以构建星载计算机模型为背景,论证了…

2026/9/7 0:47:43

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/7 0:14:19

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/7 0:14:17

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/7 0:03:36

基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现

这次我们来看一个把目标检测算法和桌面端工具结合得很典型的项目:基于 YOLOv8 PyQt5 的麦穗稻穗检测识别系统。这个项目本身不是新概念,但它的价值在于落地形态很完整。YOLOv8 负责核心的麦穗稻穗目标检测,PyQt5 负责提供可视化的桌面交互界…

2026/9/7 0:03:36

UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南

简介:UL 1642是锂电池安全领域的重要规范,本中文版资源适合锂电池制造商、检测机构工程师及产品认证相关人员阅读,用于理解电池在设计与制造层面的安全要求、测试方法与合规要点。资源共1个PDF文件,压缩包大小834KB,便…

2026/9/7 0:03:36

BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析

简介:BS EN 13814-1:2019是英国采纳欧洲标准EN 13814-1:2019的正式版本,由BSI标准出版,重点规定游乐设施和游乐设备在设计与制造环节的安全准则,与BS EN 13814-2:2019、BS EN 13814-3:2019共同取代旧版BS EN 13814:2004。该标准面…

2026/9/6 11:40:10

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/6 19:33:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/6 10:19:40

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…