发布时间:2026/7/28 9:49:38
Vit和VideoMAE Vit Vision Transformer 视觉TransformerVideoMAE Video Masked Autoencoders 视频掩码自编码器是对Vit在视频上的进化。传统工业视觉单独使用 ViT / VideoMAE大模型时代作为 LLM 的视觉 Encoder两者用途完全不同是两种模型的神经架构。一、单独使用 ViT在工业上最常见业务是什么先说结论ViT 单独使用最多的不是普通图片分类而是需要“高级视觉理解”的任务。普通分类猫/狗/汽车CNN已经很好。ViT真正发挥优势的是大规模视觉理解图像检索医疗影像遥感自动驾驶工业检测1. 图像分类早期主要用途最早 ViT 就是为了 ImageNet 分类提出的。流程图片 ↓ ViT Encoder ↓ 分类Head ↓ 1000类别例如ImageNet狗 猫 汽车 飞机代表模型ViTGoogle原始版本ViT-B/16ViT-L/16ViT-H/14但是现在工业分类很多仍然用ResNetEfficientNetConvNeXt原因CNN更快更省算力小数据效果好2. 工业视觉检测非常重要例如工厂检测PCB缺陷芯片缺陷产品瑕疵以前CNN图片 | ResNet | 分类现在ViT图片 ↓ ViT ↓ 异常特征 ↓ 缺陷判断优势可以捕获长距离关系。例如PCB一个地方的小缺陷可能和远处线路有关。常用模型Swin Transformer工业视觉非常常见。原因纯ViT Attention计算量大。Swin窗口Attention更适合高分辨率图片。3. 图像检索非常重要例如淘宝搜同款。输入鞋子图片图片 ↓ ViT ↓ Feature Vector ↓ 向量数据库 ↓ 找相似商品常用CLIP ViTDINOv2EVA4. 医疗影像例如CTCT切片 ↓ ViT ↓ 疾病判断MRI脑部影像 ↓ Transformer ↓ 病灶分析因为医疗图像需要全局关系。5. 自动驾驶例如摄像头Camera ↓ ViT/Swin ↓ 环境理解识别车辆行人道路Tesla、Waymo路线大量使用Transformer视觉。二、单独使用 VideoMAE在工业上最常见业务是什么VideoMAE定位视频理解Video Understanding不是生成视频。1. 视频行为识别最直接你的 UCF101 就属于这个。例如监控检测打架摔倒奔跑入侵流程视频 ↓ VideoMAE ↓ 动作分类 ↓ 报警代表模型VideoMAEMCG-NJU经典。2. 视频搜索例如视频网站搜索“一个人在滑雪的视频”系统视频↓VideoMAE↓视频Embedding↓向量数据库↓搜索。3. 视频监控分析工业非常大。例如智慧城市摄像头人流 车辆 异常事件VideoMAE理解时间变化。4. 体育分析例如足球球员动作战术分析篮球投篮动作防守动作5. 机器人机器人需要理解环境变化。例如机器人看到人拿杯子。Video Encoder提取动作变化。三、单独 VideoMAE 工业常用模型有哪些目前主要① VideoMAE最经典。特点自监督预训练。模型VideoMAE BaseVideoMAE LargeVideoMAE Huge② VideoMAE V2更大规模。适合大数据训练。③ Video Swin Transformer工业应用很多。结构视频版Swin。④ MViTMultiscale Vision Transformer。Meta提出。特点多尺度视频理解。⑤ SlowFast虽然不是Transformer但是工业仍大量使用。Meta提出。视频行为识别经典。四、现在进入大模型时代LLM里面最常用的Vision Encoder是什么这个和单独视觉完全不同。现在LLM需要的不是分类器而是“视觉Token生成器”。1. 图片LLM最常用Vision Encoder第一梯队CLIP ViT目前最经典。例如LLaVA结构CLIP ViT-L/14 ↓ Projector ↓ LLaMA用途图片问答。SigLIPGoogle提出。现在很多新模型使用。例如Gemini相关路线。优势比CLIP训练方式改进。EVA-CLIP国内外很多视觉大模型使用。特点更强视觉能力。InternViT商汤/InternVL路线。例如InternVLInternViT LLM2. 视频LLM最常用Video Encoder这里目前比图片复杂。因为视频成本巨大。常见InternVideo非常热门。结构Video Encoder ↓ LLMVideoMAE很多研究使用。例如VideoMAE ↓ LLMVideo Swin Transformer也是常见。CLIP逐帧 时间模型工业也很多Frame ↓ CLIP ViT ↓ Temporal Transformer ↓ LLM原因计算便宜。五、单独模型 vs LLM视觉Encoder 对比单独ViTLLM视觉Encoder目标完成视觉任务给LLM提供视觉理解输出分类/特征视觉Token后面有没有LLM没有有训练目标分类/自监督视觉语言对齐例子ImageNetGPT-4V、LLaVA六、你作为音视频工程师最相关路线结合你的方向视频分析例如摄像头异常检测推荐RTSP视频流 ↓ 抽帧 ↓ VideoMAE / Video Swin ↓ 行为识别 ↓ 报警AI数字人/视频生成不是VideoMAE。路线语音 ↓ LLM ↓ Diffusion Video Model ↓ 视频视频大模型未来路线视频 ↓ Video Encoder (VideoMAE / InternVideo) ↓ Projector ↓ LLM ↓ 理解视频最后总结一句单独使用ViT图片理解、检索、工业检测、医疗、自动驾驶。最常见模型ViTSwin TransformerDINOv2CLIP ViTVideoMAE视频理解、行为识别、监控分析、视频搜索。最常见模型VideoMAEVideoMAE V2Video Swin TransformerMViT在LLM里面图片CLIP ViT、SigLIP、EVA-CLIP、InternViT视频InternVideo、VideoMAE、Video Swin、CLIPTemporal Transformer

相关新闻

2026/7/28 9:49:38

LattePanda Alpha移植Slimbootloader并引导Ubuntu实战指南

1. 项目概述:当开源固件遇上迷你主机最近在折腾我的LattePanda Alpha,这是一块搭载了Intel Cherry Trail处理器的单板电脑,性能足够跑一些轻量级服务。但原厂的BIOS/UEFI固件功能比较基础,而且更新缓慢,很多新特性&…

2026/7/28 9:49:38

行空板灯光控制全攻略:从RGB灯到WS2812B灯带的Python与Mind+实践

1. 从“点灯”开始:为什么行空板是创客入门的绝佳选择如果你对编程、硬件交互或者智能设备感兴趣,但又觉得Arduino、树莓派这些名字听起来有点“硬核”,那么“行空板”可能就是你一直在找的那个有趣又友好的入口。我第一次接触行空板&#xf…

2026/7/28 9:49:38

ESP32-C6点灯报错全解析:从环境搭建到硬件调试的嵌入式入门实战

1. 项目概述:从“点灯”到“排错”的嵌入式入门必修课“点灯”,这个在嵌入式开发领域近乎仪式感的操作,对于每一位开发者而言,都像是打开新世界大门的第一把钥匙。它简单到只需控制一个GPIO引脚的高低电平,却又复杂到足…

2026/7/28 10:44:42

Header Editor终极指南:3分钟掌握浏览器请求控制神器

Header Editor终极指南:3分钟掌握浏览器请求控制神器 【免费下载链接】HeaderEditor Manage browsers requests, include modify the request headers, response headers, response body, redirect requests, cancel requests 项目地址: https://gitcode.com/gh_m…

2026/7/28 10:44:42

物联网设备低功耗设计:NBM5100A与PIC32MX675F512L电源管理方案

1. 项目背景与核心需求解析在物联网和低功耗设备设计中,电池寿命和突发电流能力一直是工程师面临的两大挑战。以典型的无线传感器节点为例,设备大部分时间处于微安级休眠电流状态,但在无线传输瞬间需要高达150mA的脉冲电流。这种"静如处…

2026/7/28 10:44:42

UE5.3中HDRI背景无法照亮模型的原理分析与完整解决方案

1. 项目概述:当HDRI背景在UE5.3中“罢工”在虚幻引擎5.3(UE5.3)中进行场景搭建时,使用高动态范围图像(HDRI)作为环境背景来照亮场景,是一种非常高效且能获得真实光照效果的工作流。无论是制作产…

2026/7/28 10:44:42

更纱黑体深度解析:现代CJK复合字体的专业实战指南

更纱黑体深度解析:现代CJK复合字体的专业实战指南 【免费下载链接】Sarasa-Gothic Sarasa Gothic / 更纱黑体 / 更紗黑體 / 更紗ゴシック / 사라사 고딕 项目地址: https://gitcode.com/gh_mirrors/sa/Sarasa-Gothic 更纱黑体(Sarasa Gothic&…

2026/7/28 10:39:41

物联网设备低功耗优化:NBM7100A与STM32L031电源管理实战

1. 项目背景与核心挑战在物联网设备设计中,初级电池(不可充电电池)的寿命优化一直是个棘手问题。这类设备通常需要连续工作数年甚至十年以上,而传统方案中,电池往往在设备实际需要停止工作前就耗尽了能量。我曾参与过一…

2026/7/27 9:04:58

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/28 0:03:34

学术论文研究创新点梳理与核心价值提炼指南

本科毕业论文是大学四年最大的坎。开题报告憋一周写不出三页,找文献翻遍十几个网站还是缺关键资料,写正文卡壳半天憋不出一句话,降重改到凌晨三点结果逻辑全乱,答辩前一天PPT还没做完。别慌,亲测这四个工具能让你少熬半…

2026/7/28 0:03:34

开发商售楼处数字化升级怎么做?

房企的数字化转型投入正在快速增长,据行业数据显示,2025年房企数字化投入规模已突破800亿元,年复合增长率达35%。售楼处的数字化升级不是单一环节的改造,而是从“获客-展示-成交-服务”全链路的系统升级。数字化升级四步法第一步&…

2026/7/28 0:03:34

模型不再值钱之后,AI 编程工具在争什么

2026 年 7 月,AI 编程工具赛道发生了一个标志性转折:模型本身不再值钱了。当 Kimi K3 开源模型在编程基准上击败 GPT 和 Claude,当 GitHub Copilot 第一次把开源模型纳入选择器,当 OpenAI 把 Codex 并入 ChatGPT 做成三合一超级应…

2026/7/28 4:38:09

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…