VLM 发展脉络

发布时间:2026/9/12 4:05:18

VLM 发展脉络 Vision-Language ModelVLM的发展逻辑可以概括为图文对齐 → 多模态预训练 → 连接LLM → 指令微调 → 大规模统一多模态模型传统CV │ ▼ ──────────────────────────────────── ① 图文表示学习Representation 2019~2021 │ ├── ViLBERT ├── LXMERT ├── UNITER └── CLIP ← 第一次革命 │ ▼ ──────────────────────────────────── ② 统一视觉语言预训练Unified VLP 2021~2022 │ ├── ALIGN ├── ALBEF ├── BLIP ├── CoCa └── Flamingo ← 第二次革命 │ ▼ ──────────────────────────────────── ③ LLM时代Bridge to LLM 2023 │ ├── BLIP-2 ├── InstructBLIP ├── MiniGPT-4 └── LLaVA ← 第三次革命 │ ▼ ──────────────────────────────────── ④ 大模型时代Large VLM 2023~2024 │ ├── GPT-4V ├── Gemini ├── Qwen-VL ├── CogVLM ├── InternVL └── Florence-2 │ ▼ ──────────────────────────────────── ⑤ Foundation VLM2024~至今 │ ├── Qwen2-VL ├── InternVL2 ├── LLaVA-OneVision ├── Molmo └── Omni方向这一演进过程也反映了 VLM 从表示学习模型逐步发展为具备通用推理能力的多模态智能体。第一阶段2019-2021图文表示学习目标让图片和文本能够映射到同一个语义空间。这一阶段的模型还不能“聊天”主要解决的是图文匹配和跨模态表示学习。代表论文年份论文贡献2019ViLBERT首次采用双流 Transformer 处理图文2019LXMERT大规模视觉语言预训练2019UNITER统一视觉语言编码器2021CLIP⭐⭐⭐⭐⭐提出大规模图文对比学习成为现代 VLM 的起点2021ALIGN验证超大规模图文数据的重要性这一阶段的关键词Contrastive Learning对比学习经典结构Image Encoder │ │ Shared Embedding Space │ │ Text EncoderCLIP(Contrastive Language-Image Pre-training)是整个 VLM 发展的第一座里程碑。第二阶段2021-2022统一视觉语言预训练仅仅学会图文对齐还不够模型开始学习Caption根据图片生成一段自然语言描述Image → Text目的是让模型学会图片中有什么Object、它们之间的关系Relation、正在发生什么Action、场景是什么Scene使模型逐渐学习到更丰富的视觉语义。VQAVisual Question Answering视觉问答Image Question → Answer根据图片回答用户的问题。不仅训练模型识别物体的能力还包括Counting计数、Color颜色、OCR文字识别、Spatial Relation空间关系、Common Sense常识推理流程Image \ --- Multimodal Model --- Answer / QuestionRetrievalImage-Text Retrieval图文检索根据图片找文本或者根据文本找图片Image → Text、Text→ ImageMatchingImage-Text Matching图文匹配判断一张图片和一句话是否匹配。流程Image Sentence → Binary Classification → Yes / NoMatching 与 Retrieval 的区别Retrieval在很多候选中找最匹配的属于排序问题Matching只判断 Image Text→True / False属于二分类问题目标变成一个模型完成所有 Vision-Language 任务。代表论文年份论文贡献2021ALBEF提出更好的图文对齐机制2022BLIP⭐⭐⭐⭐⭐统一理解与生成任务2022CoCa融合对比学习和生成学习2022Flamingo⭐⭐⭐⭐⭐首次实现 Few-shot 多模态学习BLIP的贡献主要是ITC ITM LM 三种训练目标统一。训练目标作用ITCImage-Text Contrastive学习统一图文表示用于 RetrievalITMImage-Text Matching判断图文是否真正匹配提高细粒度对齐能力LMLanguage Modeling根据图片生成自然语言即 Caption而Flamingo则首次证明https://blog.csdn.net/c_y_w_/article/details/162674359LLM 可以真正理解图片。第三阶段2023连接 LLM这是 VLM 发展史上的第二个重大转折点。研究重点从如何学习图文表示变成如何把视觉信息送进 LLM。于是出现了各种桥接模块Bridge。代表论文一BLIP-2BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Modelshttps://blog.csdn.net/c_y_w_/article/details/162733937最大贡献提出Q-Former结构Image Encoder (Frozen) │ Q-Former │ Large Language Model代表论文二InstructBLIP增加Instruction Tuning指令微调即Describe、Explain、Count、OCR、Reasoning 全部统一到 Instruction。代表论文三LLaVAVisual Instruction Tuning这是今天影响最大的开源 VLM。结构极其简单CLIP ↓ Linear Projector ↓ Vicuna它告诉大家不需要复杂结构一个投影层就能连接视觉编码器和 LLM并通过视觉指令微调获得很强的多模态能力。这一范式迅速成为开源 VLM 的主流路线。第四阶段2023-2024大型 VLM进入 GPT-4V 时代。大家开始追求一个模型完成所有视觉任务。代表模型模型特点GPT-4V闭源、多模态推理能力突出Gemini统一图像、视频、文本Qwen-VL中文能力强支持 OCR、GroundingCogVLM开源大模型InternVL**高分辨率、多图、多文档Florence-2统一视觉任务接口这一阶段的重要变化是以前Detection、Caption、OCR、Segmentation是四个模型。现在Prompt→One Model→Everything 统一接口成为主流设计思路。第五阶段2024-至今Foundation VLM目前最前沿的研究方向已经不是“做一个能看图的聊天机器人”而是构建真正的视觉基础模型。代表工作包括Qwen2-VL、InternVL2、LLaVA-OneVision、Molmo、Florence-2模型共同特点支持高分辨率图像支持多图输入支持长视频OCR 与文档理解能力显著增强更强的空间推理与工具调用能力研究重点也逐渐从“图文理解”扩展到Agent、长上下文、多模态推理和具身智能。推荐精读的 10 篇代表性论文阶段论文为什么必读① 图文表示学习CLIP (2021)现代 VLM 的起点建立图文对比学习范式① 图文表示学习ALIGN (2021)展示大规模数据驱动的图文预训练能力② 统一预训练BLIP (2022)统一视觉理解与生成任务② Few-shotFlamingo (2022)首个具备强 Few-shot 多模态能力的 VLM③ Bridge LLMBLIP-2 (2023)提出经典 Q-Former 桥接模块③ 指令微调InstructBLIP (2023)将 Instruction Tuning 引入 VLM③ 开源 VLMLLaVA (2023)奠定现代开源 VLM 基础框架④ 大模型GPT-4V (2023)展示通用多模态推理能力④ Foundation VLMInternVL (2023/2024)高分辨率、多图、多场景统一建模④ 统一视觉模型Florence-2 (2024)将检测、OCR、分割等任务统一到 Prompt 驱动框架如果你的目标是做 VLM 方向的科研我建议按照以下顺序阅读CLIP → BLIP → Flamingo → BLIP-2 → InstructBLIP → LLaVA → GPT-4V技术报告→ InternVL → Florence-2这条阅读路线几乎完整覆盖了 VLM 从图文表示学习到现代多模态大模型的发展脉络也能够帮助你理解当前顶会CVPR、ICCV、NeurIPS、ICLR论文中最常见的模型设计思想。
延伸阅读

更多相关文章

2026/9/6 12:12:29

TVA具身智能的概念、架构与应用(15)

前沿技术探索:AI智能体视觉(TVA,Transformer-based Vision Agent)是依托Transformer架构与“因式智能体”理论所构建的颠覆性工业视觉技术,是集深度强化学习(DRL)、卷积神经网络(CNN…

2026/9/12 4:04:44

PyTorch激活层实战指南:从源码、数值稳定性到工业部署避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 4:04:44

Java封装机制详解:从基础到高级实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 4:04:44

SpringBoot舞蹈室管理系统开发实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 4:04:44

基于YOLO与多模态大模型的电子元器件目标检测系统设计

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 3:59:43

创新创业大赛方案设计的3个核心原则与实战技巧

1. 创新创业大赛方案设计核心思路参加创新创业大赛不同于普通的商业计划比赛,评委更关注项目的创新性、可行性和成长潜力。我在担任多次创业大赛评委和指导参赛团队的过程中,总结出三个核心设计原则:首先是问题导向。真正优秀的创业项目都源于…

2026/9/12 2:05:33

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/12 3:55:12

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介:本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包,聚焦于长鼻浣熊优化算法(COA)的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题,作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码