发布时间:2026/8/9 20:53:46
视觉特征提取器-训练范式02-自监督-掩码图像建模01:MAE的Mask Vector【所有遮挡块复制同一个共享可学习向量】【初始化完全相同,预训练后仍为同一个参数向量】【各位置差异仅由位置编码提供】 MAE 中的 Mask Vector:从形状、初始化到预训练与推理1. Mask Vector 到底是什么?论文《Masked Autoencoders Are Scalable Vision Learners》的核心任务是:随机删除图片中的大量 patch,只让 Encoder 观察剩余 patch,再让 Decoder 重建被删除的 patch。MAE 使用一个特殊的掩码向量(mask vector)来告诉 Decoder:“这个位置原本存在一个 patch,但它的内容现在未知,需要预测。”论文将每个掩码标记(mask token)描述为共享的、通过学习得到的向量。同时,MAE 的 Encoder 只处理真实的可见图像块(visible patches),mask token 只在 Decoder 中出现。因此,首先要建立最重要的概念:maskvector不是缺失patch的内容,而是缺失patch的可学习占位符。\boxed{\text{mask vector 不是缺失 patch 的内容,而是缺失 patch 的可学习占位符。}}maskvector不是缺失patch的内容,而是缺失patch的可学习占位符。​2. Masked Patch、Mask Token 和 Mask Vector 的区别这三个概念不能混淆。被掩码图像块(masked patch)是原始图片中真实存在、后来被随机删除的 patch。例如原始图片有:[P0,P1,P2,P3,P4,P5,P6,P7][P_0,P_1,P_2,P_3,P_4,P_5,P_6,P_7][P0​,P1​,P2​,P3​,P4​,P5​,P6​,P7​]假设只保留P1P_1P1​和P3P_3P3​,那么其他 6 个 patch 都属于 masked patches。但在 Encoder 中,它们不是被替换成某个特殊向量,而是直接被删除。论文明确说明 Encoder 不使用 mask tokens。掩码向量(mask vector)则是模型真正保存的一个可训练参数,记为:m\mathbf mm掩码标记(mask token)可以理解为把这个m\mathbf mm复制到某个缺失位置后得到的 token。因此:一个maskvector→复制出很多masktokens\boxed{\text{一个 mask vector}\rightarrow\text{复制出很多 mask tokens}}一个maskvector→复制出很多masktokens​而不是每个 masked patch 都拥有自己独立的 mask vector。3. Mask Vector 的形状假设 Decoder 的隐藏维度为:DDD_DDD​那么从数学上看:m∈RDD\mathbf m\in\mathbb R^{D_D}m∈RDD​官方 MAE PyTorch 实现将它保存为:self.mask_token=nn.Parameter(torch.zeros(1,1,decoder_embed_dim))所以张量形状是:1×1×DD\boxed{1\times1\times D_D}1×1×DD​​官方 MAE 的 ViT-Base、ViT-Large 和 ViT-Huge 配置都采用 512 维 Decoder,因此这些默认模型中的 mask token 参数形状为:1×1×512\boxed{1\times1\times512}1×1×512​官方代码同时表明,ViT-Large 的 Encoder 维度为 1024,而 Decoder 维度为 512;Encoder 输出首先通过线性层映射到 Decoder 维度,然后才加入 mask tokens。这说明一个重要事实:maskvector属于Decoder表示空间,而不是Encoder表示空间。\boxed{\text{mask vector 属于 Decoder 表示空间,而不是 Encoder 表示空间。}}maskvector属于Decoder表示空间,而不是Encoder表示空间。​4. 为什么形状是[1, 1, 512]?可以把它拆成:[1, 1, 512] │ │ │ │ │ └── 一个 token 含 512 个特征 │ └────── 只有一个 mask token 参数 └───────── batch 维真正需要模型学习的是:m=[m1,m2,…,m512]\mathbf m=[m_1,m_2,\ldots,m_{512}]m=[m1​,m2​,…,m512​]也就是 512 个标量。如果一张图片有 147 个 masked patches,并不意味着模型学习:147×512147\times512147×512套独立参数。它只学习一个:m\mathbf mm然后重复使用。5. “Shared” 到底是什么意思?假设一张224×224224\times224224×224图片使用16×1616\times1616×16patch。patch 总数:L=22416×22416=14×14=196L=\frac{224}{16}\times\frac{224}{16}=14\times14=196L=16224​×16224​=14×14=196MAE 的典型 masking ratio 为 75%,因此:Lvisible=196×0.25=49L_{\text{visible}}=196\times0.25=49Lvisible​=196×0.25=49Lmasked=196−49=147L_{\text{masked}}=196-49=147Lmasked​=196−49=147论文的默认设置就是 75% masking ratio,并使用 512 维 Decoder。对于这 147 个缺失位置,模型不是学习:m1,m2,…,m147\mathbf m_1,\mathbf m_2,\ldots,\mathbf m_{147}m1​,m2​,…,m147​而是使用:m,m,…,m⏟147次\underbrace{\mathbf m,\mathbf m,\ldots,\mathbf m}_{147\text{ 次}}147次m,m,…,m​​所以共享(shared)的准确含义是:同一张图片的所有 masked positions、不同图片的 masked positions,都使用同一个可训练参数m\mathbf mm。6. Mask Vector 如何初始化?这里要区分“论文描述”和“官方代码实现”。论文说明它是可学习向量(learned vector),但方法部分并没有指定它必须按照什么概率分布初始化。官方 PyTorch 实现首先创建全零参数张量:self.mask_token=nn.Parameter(torch.zeros(1,1,decoder_embed_dim))随后在模型初始化函数中执行:torch.nn.init.normal_(self.mask_token,std=.02)因此真正开始训练时,每个维度近似满足:mj∼N(0,0.022)m_j\sim\mathcal N(0,0.02^2)mj​∼N(0,0.022)也就是说:创建时先是零张量,正式训练前再用标准差0.02的正态随机数初始化。\boxed{\text{创建时先是零张量,正式训练前再用标准差 0.02 的正态随机数初始化。}}创建时先是零张量,正式训练前再用标准差0.02的正态随机数初始化。​刚初始化时,这些数字没有“狗”“天空”“汽车”等视觉语义,它只是一个待优化的小随机向量。7. Mask Vector 在 Encoder 中出现吗?不出现。这是 MAE 与很多容易产生的直觉最不一样的地方。假设:[P0,P1,P2,P3,P4,P5,P6,P7][P_0,P_1,P_2,P_3,P_4,P_5,P_6,P_7][P0​,P1​,P2​,P3​,P4​,P5​,P6​,P7​]只保留:P1,P3P_1,P_3P1​,P3​Encoder 实际处理的是:[P1,P3][P_1,P_3][P1​,P3​]而不是:[m,P1,m,P3,m,m,m,m][\mathbf m,P_1,\mathbf m,P_3,\mathbf m,\mathbf m,\mathbf m,\mathbf m][m,P1​,m,P3​,m,m,m,m]论文明确采用非对称编码器—解码器(asymmetric encoder-decoder):Encoder 只处理 visible patches,而完整 token 集合只交给较轻量的 Decoder。这样既减少计算量,也避免 Encoder 在预训练阶段依赖下游完整图片中不存在的 mask tokens。

相关新闻

2026/8/9 22:08:52

GenUI:用自然语言重构UI界面,AI驱动界面现代化改造实战

1. 项目概述:当“界面重构”遇上“文字描述”最近在社区里,看到不少朋友在讨论一个挺有意思的话题:能不能直接用文字描述,就让一个现有的软件界面“焕然一新”?比如,你对着一套用了好几年的后台管理系统说&…

2026/8/9 22:08:52

Python金融时间序列预测:LSTM与Spark实战

1. 项目概述:当Python遇上金融时间序列这个毕业设计项目的核心目标,是构建一个基于Python的股票价格预测系统。不同于传统的技术分析工具,我们将在Hadoop/Spark大数据平台上处理海量历史行情数据,并运用LSTM神经网络捕捉时间序列中…

2026/8/9 22:08:52

2026年电脑录屏软件深度横评:从OBS到Camtasia,6款工具全解析

大家好,我是专注于分享实用工具与效率技巧的技术博主。在日常开发、技术分享、在线教学甚至问题排查时,录屏都是一个高频且刚需的操作。面对市面上琳琅满目的录屏软件,很多朋友都会陷入选择困难:免费的是否够用?收费的…

2026/8/9 22:08:52

石墨烯超材料吸收体的FDTD仿真技术与应用

1. 项目概述:石墨烯超材料吸收体的FDTD仿真实践在太赫兹和红外波段的光学器件设计中,可调谐吸收体一直是研究热点。传统金属基超材料一旦加工成型,其性能参数就难以改变。而石墨烯凭借其独特的电学可调性,为动态调控电磁响应提供了…

2026/8/9 22:08:51

围绕瑞德克斯隐私保护表达观察做得细吗?

放到日常场景里,瑞德克斯更适合从安全核验和使用秩序来理解,细节往往比宣传性结论更重要。这种偏谨慎的呈现,也让瑞德克斯的正面印象更扎实。因此,文章如果从场景、说明和服务边界展开,会比空泛称赞更能体现瑞德克斯的…

2026/8/9 22:03:51

5分钟掌握Notepad--:免费跨平台编辑器的终极效率秘籍

5分钟掌握Notepad--:免费跨平台编辑器的终极效率秘籍 【免费下载链接】notepad-- 一个支持windows/linux/mac的文本编辑器,目标是做中国人自己的编辑器,来自中国。 项目地址: https://gitcode.com/GitHub_Trending/no/notepad-- 还在为…

2026/8/9 0:01:56

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:56

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/9 0:01:56

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:56

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/7 9:44:18

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/7 19:03:32

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/9 15:24:19

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…