Vit和VideoMAE

发布时间:2026/9/14 13:26:16

Vit和VideoMAE Vit Vision Transformer 视觉TransformerVideoMAE Video Masked Autoencoders 视频掩码自编码器是对Vit在视频上的进化。传统工业视觉单独使用 ViT / VideoMAE大模型时代作为 LLM 的视觉 Encoder两者用途完全不同是两种模型的神经架构。一、单独使用 ViT在工业上最常见业务是什么先说结论ViT 单独使用最多的不是普通图片分类而是需要“高级视觉理解”的任务。普通分类猫/狗/汽车CNN已经很好。ViT真正发挥优势的是大规模视觉理解图像检索医疗影像遥感自动驾驶工业检测1. 图像分类早期主要用途最早 ViT 就是为了 ImageNet 分类提出的。流程图片 ↓ ViT Encoder ↓ 分类Head ↓ 1000类别例如ImageNet狗 猫 汽车 飞机代表模型ViTGoogle原始版本ViT-B/16ViT-L/16ViT-H/14但是现在工业分类很多仍然用ResNetEfficientNetConvNeXt原因CNN更快更省算力小数据效果好2. 工业视觉检测非常重要例如工厂检测PCB缺陷芯片缺陷产品瑕疵以前CNN图片 | ResNet | 分类现在ViT图片 ↓ ViT ↓ 异常特征 ↓ 缺陷判断优势可以捕获长距离关系。例如PCB一个地方的小缺陷可能和远处线路有关。常用模型Swin Transformer工业视觉非常常见。原因纯ViT Attention计算量大。Swin窗口Attention更适合高分辨率图片。3. 图像检索非常重要例如淘宝搜同款。输入鞋子图片图片 ↓ ViT ↓ Feature Vector ↓ 向量数据库 ↓ 找相似商品常用CLIP ViTDINOv2EVA4. 医疗影像例如CTCT切片 ↓ ViT ↓ 疾病判断MRI脑部影像 ↓ Transformer ↓ 病灶分析因为医疗图像需要全局关系。5. 自动驾驶例如摄像头Camera ↓ ViT/Swin ↓ 环境理解识别车辆行人道路Tesla、Waymo路线大量使用Transformer视觉。二、单独使用 VideoMAE在工业上最常见业务是什么VideoMAE定位视频理解Video Understanding不是生成视频。1. 视频行为识别最直接你的 UCF101 就属于这个。例如监控检测打架摔倒奔跑入侵流程视频 ↓ VideoMAE ↓ 动作分类 ↓ 报警代表模型VideoMAEMCG-NJU经典。2. 视频搜索例如视频网站搜索“一个人在滑雪的视频”系统视频↓VideoMAE↓视频Embedding↓向量数据库↓搜索。3. 视频监控分析工业非常大。例如智慧城市摄像头人流 车辆 异常事件VideoMAE理解时间变化。4. 体育分析例如足球球员动作战术分析篮球投篮动作防守动作5. 机器人机器人需要理解环境变化。例如机器人看到人拿杯子。Video Encoder提取动作变化。三、单独 VideoMAE 工业常用模型有哪些目前主要① VideoMAE最经典。特点自监督预训练。模型VideoMAE BaseVideoMAE LargeVideoMAE Huge② VideoMAE V2更大规模。适合大数据训练。③ Video Swin Transformer工业应用很多。结构视频版Swin。④ MViTMultiscale Vision Transformer。Meta提出。特点多尺度视频理解。⑤ SlowFast虽然不是Transformer但是工业仍大量使用。Meta提出。视频行为识别经典。四、现在进入大模型时代LLM里面最常用的Vision Encoder是什么这个和单独视觉完全不同。现在LLM需要的不是分类器而是“视觉Token生成器”。1. 图片LLM最常用Vision Encoder第一梯队CLIP ViT目前最经典。例如LLaVA结构CLIP ViT-L/14 ↓ Projector ↓ LLaMA用途图片问答。SigLIPGoogle提出。现在很多新模型使用。例如Gemini相关路线。优势比CLIP训练方式改进。EVA-CLIP国内外很多视觉大模型使用。特点更强视觉能力。InternViT商汤/InternVL路线。例如InternVLInternViT LLM2. 视频LLM最常用Video Encoder这里目前比图片复杂。因为视频成本巨大。常见InternVideo非常热门。结构Video Encoder ↓ LLMVideoMAE很多研究使用。例如VideoMAE ↓ LLMVideo Swin Transformer也是常见。CLIP逐帧 时间模型工业也很多Frame ↓ CLIP ViT ↓ Temporal Transformer ↓ LLM原因计算便宜。五、单独模型 vs LLM视觉Encoder 对比单独ViTLLM视觉Encoder目标完成视觉任务给LLM提供视觉理解输出分类/特征视觉Token后面有没有LLM没有有训练目标分类/自监督视觉语言对齐例子ImageNetGPT-4V、LLaVA六、你作为音视频工程师最相关路线结合你的方向视频分析例如摄像头异常检测推荐RTSP视频流 ↓ 抽帧 ↓ VideoMAE / Video Swin ↓ 行为识别 ↓ 报警AI数字人/视频生成不是VideoMAE。路线语音 ↓ LLM ↓ Diffusion Video Model ↓ 视频视频大模型未来路线视频 ↓ Video Encoder (VideoMAE / InternVideo) ↓ Projector ↓ LLM ↓ 理解视频最后总结一句单独使用ViT图片理解、检索、工业检测、医疗、自动驾驶。最常见模型ViTSwin TransformerDINOv2CLIP ViTVideoMAE视频理解、行为识别、监控分析、视频搜索。最常见模型VideoMAEVideoMAE V2Video Swin TransformerMViT在LLM里面图片CLIP ViT、SigLIP、EVA-CLIP、InternViT视频InternVideo、VideoMAE、Video Swin、CLIPTemporal Transformer
延伸阅读

更多相关文章

2026/9/10 19:16:07

LattePanda Alpha移植Slimbootloader并引导Ubuntu实战指南

1. 项目概述:当开源固件遇上迷你主机最近在折腾我的LattePanda Alpha,这是一块搭载了Intel Cherry Trail处理器的单板电脑,性能足够跑一些轻量级服务。但原厂的BIOS/UEFI固件功能比较基础,而且更新缓慢,很多新特性&…

2026/9/14 6:38:22

行空板灯光控制全攻略:从RGB灯到WS2812B灯带的Python与Mind+实践

1. 从“点灯”开始:为什么行空板是创客入门的绝佳选择如果你对编程、硬件交互或者智能设备感兴趣,但又觉得Arduino、树莓派这些名字听起来有点“硬核”,那么“行空板”可能就是你一直在找的那个有趣又友好的入口。我第一次接触行空板&#xf…

2026/9/10 12:33:28

ESP32-C6点灯报错全解析:从环境搭建到硬件调试的嵌入式入门实战

1. 项目概述:从“点灯”到“排错”的嵌入式入门必修课“点灯”,这个在嵌入式开发领域近乎仪式感的操作,对于每一位开发者而言,都像是打开新世界大门的第一把钥匙。它简单到只需控制一个GPIO引脚的高低电平,却又复杂到足…

2026/9/14 13:24:42

相控阵方向图仿真:从阵列信号处理到Matlab代码实现

简介:这是一份面向雷达通信与阵列信号处理学习者的Matlab仿真资源,专注于相控阵雷达方向图的绘制与分析。资源包含可运行的.m源码、对应的.fig交互图以及3张运行结果截图,方便读者直观对比仿真输出与理论结果。压缩包内共5个文件,…

2026/9/14 13:24:42

二维浅水方程非结构网格求解:typhon-solver源码剖析

简介:基于Fortran的二维浅水方程求解器typhon-solver-0.3.0完整源码包,面向流体力学数值模拟学习者和研究者,可用于复杂地形下的洪水模拟、海洋动力学等场景。软件采用非结构网格上的有限体积法,较规则网格能更好适应不规则边界与…

2026/9/14 13:19:39

Spring Boot+MyBatis图书管理系统毕设实战指南

简介:本资源是一套完整的Java语言图书管理系统毕业设计实现方案,面向计算机专业本科生及Java初学者,聚焦课程设计、毕业实践与小型桌面应用开发场景。压缩包共74个文件,包含24个核心Java源码文件(如Form1.java至Form22…

2026/9/14 2:17:50

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/14 0:03:22

KCF目标跟踪算法与OTB工程实现:毕业设计实战解析

简介:这是一份基于KCF核相关滤波算法、融合尺度池与抗遮挡处理的目标检测跟踪MATLAB完整源码,主要面向计算机相关专业准备毕业设计、课程设计或期末大作业的学生,也适合需要项目实战练习的初学者。源码在OTB数据集上完成验证,能够…

2026/9/14 0:03:22

语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比

简介:面向语音情感识别入门与进阶开发者,这份基于Keras的项目源码完整实现了LSTM、CNN、SVM、MLP四种模型,兼容Python3.8与Keras/TensorFlow2环境。压缩包内含49个文件,大小约70.31MB,主体包括Python脚本、yaml/json配…

2026/9/14 11:59:31

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/14 11:22:57

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码