发布时间:2026/9/6 23:53:36
(2026|CVPR|安大,可学习正常/异常 token,空间感知交叉注意力)VisualAD:基于 ViT 的语言无关零样本异常检测 VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer论文地址https://arxiv.org/abs/2603.07952项目页面https://github.com/7HHHHH/VisualAD学术交流922230617目录1. 引言3. 方法3.1 问题设定3.2 空间感知交叉注意力SCA3.3 自对齐函数与异常评分3.4 训练目标4. 实验4.1 实验设置4.2 与最先进方法的性能比较4.3 消融研究4.4 可视化1. 引言零样本异常检测zero-shot anomaly detectionZSAD旨在不使用任何类别内图像训练的情况下检测未见类别的异常从而将异常检测与逐类别数据收集负担解耦。在此背景下大规模预训练模型为 ZSAD 提供了可行路径。预训练视觉-语言模型如 CLIP通过在共享embedding空间中对齐视觉与文本语义展现出强迁移性。利用此特性一系列工作将表示正常与异常的提示输入文本编码器并将所得文本embedding与图像特征对比以实现开集异常检测。该范式下的文本提示通常分为两类手工设计类如 WinCLIP依赖固定模板将类别上下文词与状态描述词结合以表达正常与异常状态虽无需训练且易用但对措辞敏感且可能难以覆盖多样异常模式。可学习类如 AnomalyCLIP将上下文词参数化为可训练向量在小规模辅助数据集上优化得到可跨类别泛化的对象无关正常/异常表示。尽管方式不同这些方法暗示一个简单原则异常可由两组对应正常与异常的参考特征来描述。然而该原则引出一个问题若最终决策仅由正常和异常两组潜在向量决定语言模态是否真的不可或缺从纯视觉角度看异常表现为纹理、形状或颜色上的结构或统计偏差这些都可在视觉域内捕获。为验证此假设本文对 AnomalyCLIP 进行了小规模改动移除文本编码器直接优化两个表示正常与异常的可学习向量。所得检测性能几乎未降而可训练参数数量减少超过 99%。如上图所示训练轮次间的评估曲线在泛化行为上呈现明显差异本文的纯视觉变体稳定提升并保持平滑上升趋势而原始 AnomalyCLIP 在各轮次间波动显著。该发现表明在基于 CLIP 的 ZSAD 流程中文本提示可能主要作为塑造一对判别性视觉原型的间接途径而非提供必要的语义基础。受此观察启发本文提出 VisualAD——一个基于冻结 Vision Transformer 的纯视觉零样本异常检测框架。VisualAD 不依赖文本编码器而是直接在 ViT token 序列中引入两个可学习 token异常 token 和正常 token。通过多层自注意力这些 token 与 patch token 交互逐渐获取正常与异常的高层概念同时引导 patch 突出异常相关线索。为使高层语义 token 与跨层细粒度图像特征对齐本文采用空间感知交叉注意力Spatial-AwareCross-AttentionSCA模块为 token 提供显式空间线索和局部细节并配合轻量级自对齐函数Self-Alignment FunctionSAF实现为小型 MLP在 token-patch 对齐前重新校准 patch 特征。与直接对齐到 patch 级特征的方法不同SCA 利用细粒度视觉证据动态更新 token从而提升 ZSAD 性能。本文通过整合多个更新后 token 与跨层重新校准后 patch 特征之间的对齐结果来合成异常图并从异常得分最高的前 1% 像素中获取图像级异常判定。贡献总结如下重新审视文本在零样本异常检测中的必要性表明判别性异常特征可仅从视觉线索中学习。提出 VisualAD一个纯 ViT 的零样本异常检测框架在冻结主干中注入两个可学习 token使其通过多层自注意力与 patch token 交互编码正常与异常。提出 SCA 和 SAF 模块其中 SCA 向 token 注入显式空间证据SAF 重新校准 patch 特征实现稳定的多层对齐和改进的定位。在工业和医学基准上的大量实验证明了其对未见类别和数据集的强零样本泛化能力。3. 方法3.1 问题设定本文遵循零样本异常检测协议。模型在可见类别 C_s来自工业数据集上以监督方式训练并直接评估于未见类别 C_u​来自其他工业或医学数据集。根据定义 Cu∩Cs∅辅助训练类别与测试类别来自不同数据集存在显著领域偏移。该设定评估跨域泛化能力无需任何类别特定的微调。如上图所示本文提出 VisualAD一个基于冻结 Vision Transformer 的零样本异常检测框架。给定如 ViT-L/14336px 的主干网络本文插入两个可学习全局 token即异常 token t_a 和正常 token t_n​直接在视觉特征空间中编码异常与正常。输入序列为其中t_c 为类别 token{p_i}_{i1}^N 为图像 patch token所有 token 均为 d 维。为捕获多样空间与语义线索本文从一组中间层 L{l_1, …, l_K} 中提取特征默认对 ViT-L/14 使用 {6,12,18,24}。对每个选定层引入空间感知交叉注意力SCA模块从 patch 特征中聚合局部空间证据以增强 token 表示。同时轻量级自对齐函数SAF在该层重新校准 patch 特征。增强后的 token 与 SAF 重新校准的 patch 共同生成层间异常图并在各层间融合。像素级和图像级异常得分从融合图中获得。训练与推理共享相同计算路径无文本编码器或跨模态对齐。3.2 空间感知交叉注意力SCA全局 token 编码高层语义但缺乏显式空间基础。为在保持 ViT 流程完整的同时注入局部证据本文在每个选定层 ℓ 应用单个 SCA 模块。给定 patch 特征 P_ℓ ∈ R^{B×N×d}B 为批量大小N 为 patch 数量d 为特征维度首先添加层特定的可学习位置编码 E_pos^(ℓ)​使模块能够区分空间不同区域。为高效聚合空间线索SCA 采用 m 个可学习 anchor query Q_anchor ∈ R^{m×d}其中 m≪N。为清晰起见省略batch维度记 P_ℓ^pos​ ∈ R^{N×d}。交叉注意力权重与 anchor 聚合特征计算如下其中A_ℓ ∈ R^{m×N} 为空间注意力分布U_ℓ ∈ R^{m×d} 为 anchor 聚合特征其第 i 行记为 a_i​。随后SCA 通过 token 引导的门控机制将 anchor 特征适配到每个 token。计算门控向量其中t∈{t_a​, t_n​} 为增强前的全局 tokenW_g 在各 anchor 间共享。增强后 token 为α 为可学习残差缩放因子g_i(t) 为 g(t) 的第 i 项。该公式在保留全局 token 语义角色的同时以 anchor 特定方式选择性注入空间信息。本文为每个 ℓ∈L 独立实例化 SCA产生 ~t_a^(ℓ) 和 ~t_n^(ℓ)​随后与重新校准的 patch 特征匹配以形成层间异常图。由于注意力和门控为每张图像重新计算SCA 动态调整全局 token 的异常敏感性以适应每个测试样本的局部结构。3.3 自对齐函数与异常评分除 SCA 外本文使用可学习的自对齐函数Self-Alignment FunctionSAF精炼 patch 表示。对每个选定层 ℓSAF 实现为单隐层 MLP隐层维度与输入尺寸相同其中F_ℓ 表示层 ℓ 的 SAF。该非线性重新校准使 patch 特征与不断演化的正常和异常 token 对齐。随后通过自对齐的余弦对比计算 patch 级异常得分。使用 ℓ2 归一化特征层 ℓ 第 i 个 patch 的得分为得分重塑为空间图 H_ℓ ∈ R^{H×W} 并上采样至输入尺寸。多层融合得到最终异常图图像级异常得分 S 通过取前 k 个最异常像素的平均值计算其中 k⌊0.01HW⌋ 表示所有像素的 1% 向下取整H(i) 为 H 中第 i 大值。至此完成 VisualAD 中异常图与图像级得分的构建。3.4 训练目标本文在统一目标下联合优化图像级分类、像素级分割和 token 对比分离同时保持 ViT 主干冻结仅更新异常/正常 token t_a​,t_n​、SCA 模块和每层变换 {F_ℓ​}。对于图像级监督对得分 S 应用二元交叉熵对于像素级监督在每个选定层图上结合 Focal Loss 和 Dice Loss其中^M^(ℓ)σ(H_ℓ​) 为预测掩码M 为二值真实掩码为显式分离异常与正常 token在最大层索引 L即 L 中最大元素处施加余弦间隔惩罚鼓励其相似度低于 −0.5对应角距离大于 120°总损失为训练与推理严格共享同一流程包括层集合 L、SCA、变换 F_ℓ​、跨层融合和 top-k 聚合无文本分支或跨模态对齐。4. 实验4.1 实验设置数据集为评估 ZSAD 性能在 13 个真实数据集上实验涵盖工业和医学领域。工业领域采用 MVTec-AD、VisA、BTAD、KSDD2、DAGM 和 DTD-Synthetic医学领域采用 OCT17、BrainMRI、BrainAD、HIS、CVC-ClinicDB、Endo 和 Kvasir覆盖多样成像模态和任务。OCT17 包含视网膜 OCT 用于疾病分类BrainMRI 和 BrainAD 提供脑 MRI 用于肿瘤或病变分类HIS 为组织病理图像用于异常组织分析CVC-ClinicDB、Endo 和 Kvasir 为结肠镜数据集带像素级息肉分割标注。遵循先前工作在一个工业数据集上训练直接在其他工业和医学数据集上推理无需进一步微调。因 VisA 包含与其他类别不相交的对象类别将其用作辅助训练集。评估 VisA 自身时在 MVTec-AD 上微调。评估指标分类报告图像级 AUROC、最大 F1​F1​-max和 AP。分割评估像素级 AUROC、F1​-max、AP 和 Per-Region OverlapPRO以评估定位能力。实现细节采用公开主干CLIPViT-L/14336px和 DINOv2ViT-L/14。输入图像缩放至 518×518。从 24 层视觉编码器中提取层 {6,12,18,24} 的 patch token。SCA 中 anchor query 数默认 m4。VisualAD 使用 Adam 优化器初始学习率 1×10−3批量大小 8。4.2 与最先进方法的性能比较本文比较 VisualAD 与五种最先进方法WinCLIP、APRIL-GAN、CLIP-AD、AnomalyCLIP 和 AdaCLIP。由于本文方法可适配多种主干报告了 CLIP 的 ViT-L/14336px 和 DINOv2ViT-L/14的结果以展示其在不同视觉架构上的灵活性。表 1 报告了工业和医学基准上的定量 ZSAD 结果。与现有方法相比VisualAD 在几乎所有数据集的图像和像素级别均达到最先进性能。尤其在工业数据集上使用 CLIP ViT-L/14336px 的 VisualAD 在所有分类指标上取得最佳结果。进一步观察到基于 CLIP 和基于 DINOv2 的 VisualAD 实例呈现互补优势前者略偏向图像级分类后者在像素级分割上表现更强。图 3 可视化了来自代表性工业和医学数据集的异常图与其他方法相比VisualAD 提供了更清晰、更精确的异常定位。4.3 消融研究模块消融实验结果如表 2 所示移除任意单个组件都会导致性能持续下降表明每个模块都对框架有积极贡献。去除 SCA 会削弱空间对齐和细粒度证据聚合能力而移除 SAF 则会破坏高层语义的非线性重校准同时移除两者时性能下降最为显著凸显了二者之间的互补作用。在损失函数消融实验中排除 Focal、Dice 或 Ctr 目标中的任一一项均会导致明显性能下降说明混合监督机制有效平衡了分类关注、区域一致性与特征可分离性。总体而言完整模型在图像级和像素级上均取得了最优结果验证了所有组件的有效性及其协同效应。不同预训练视觉主干的影响图 4 比较了从 small 到 large 规模的 CLIP 和 DINO 变体。更大主干和更高输入分辨率通常带来像素级和样本级指标的持续提升。在 CLIP 系列中 ViT-L/14336px 取得最佳样本级结果而在 DINO 系列中 ViT-g/14 取得最高像素级精度。anchor 数量的影响如表 3 所示像素级上anchor 从 1 增至 4 时 AUROC、F1​-max 和 AP 稳步提升m4 取得最强整体结果。超过 4如 8-32则引入冗余略微降低像素级精度表明过多 anchor 会稀释空间聚焦而非增强。图像级指标趋势较平缓m16 虽提供最高 AUROC、F1F1​-max 和 AP但相对 m4 的提升在 1-2 个百分点内。因此默认采用 m4在像素级精度与图像级鲁棒性间取得平衡。不同层组合的影响如表 4 所示单层中中层{18}相比浅层或深层产生更强表示在局部细节与全局语义间达到最佳平衡。多层组合性能持续提升{6,12,18} 已在像素和样本级指标上带来明显增益扩展至 {6,12,18,24} 进一步提升稳定性和整体精度。表明多层特征集成有效捕获跨尺度互补信息带来更鲁棒的异常定位与分类。SCA 中位置建模的影响如表 5 所示比较了六种变体无位置编码、可学习 1D 绝对 embedding、固定 1D 正弦编码、可学习 2D 绝对 embedding、固定 2D 正弦编码和可学习 2D 相对位置偏置。简单的可学习 1D 绝对 embedding 在所有指标上取得最佳整体权衡而更复杂的 2D 或相对公式仅带来微小增益甚至损害稳定性。因此默认采用可学习 1D 绝对变体。4.4 可视化层间 anchor 注意力图 6 展示了地毯carpet上的层间 anchor 注意力。同一层内各 anchor 一致关注几乎相同的空间区域表明稳定连贯的局部证据。跨层看关注点以结构化方式转移中层如层 12强调细粒度缺陷边界和细微纹理扰动深层如层 24则突出更广泛的正常区域。该递进反映了冻结 ViT 编码器的层次特性中层 anchor 捕获细节不规则性高层 anchor 编码整体正常模式产生互补线索增强异常定位。特征表示演变图 5 绘制了三种配置下的 PCA 分布。原始 CLIP 特征中正常与异常样本大量重叠PC1 仅占 8.8%表明可分离性差。引入可学习正常和异常 token 后 PC1 略升至 9.0%指示判别方向初步出现。应用 SAF 后 PC1 升至 89.1%方差集中于单一主轴清晰分离两个类别。异常聚类也更紧凑并远离正常聚类。表明 token 提供初始判别结构而 SAF 增强类内紧凑性并扩大类间间隔。

相关新闻

2026/9/6 23:53:36

手写ChCore操作系统内核实验:从启动到进程调度的完整实战指南

简介:上海交通大学头歌实践教学平台Chcore操作系统实验整理版docx资料,定位为操作系统课程配套学习材料,适合正在完成内存管理、系统调用与缺页异常实验的本科生与自学者。文档以实验二内存管理和实验三系统调用与缺页异常为主线,…

2026/9/6 23:53:36

国产USB转千兆网卡芯片CH398X-巨型帧(Jumbo Frame)应用

CH398X 巨型帧(Jumbo Frame)应用 CH398 是沁恒微电子推出的 USB 3.0 转千兆以太网控制器,内置自研 RISC-V 处理器,集成 USB3.2 Gen1 及 10/100/1000M 自适应以太网 PHY。本文验证其硬件巨型帧功能——最大支持 9KB MTU&#xff0…

2026/9/6 23:53:36

千万QPS架构演进:从VM到容器的确定性之路

千万 QPS 架构系列讲到第 218 讲,话题落到“容器化:从 VM 到容器”。很多人看到这个题目,第一反应是“这还有什么好讲的,容器不就是比虚拟机更轻的虚拟化吗?”但如果你真的在千万 QPS 的业务场景里做过架构演进&#x…

2026/9/7 0:03:37

2026 AI视觉与物联网开发板选购指南:从MCU到Jetson的档位解析

2026 年已经过了一大半,如果你现在正准备入手 AI 视觉或物联网开发板,我建议你先别急着下单。市面上从几十块的 ESP32 到几千块的英伟达 Jetson,价格差了近百倍,宣传话术却几乎一样,都告诉你“能跑 AI、能做视觉、能搞…

2026/9/7 0:03:37

基于Vue的企业门户网站管理系统的设计与实现

目 录 摘 要 Abstract 目 录 1 引言 1.1 选题背景 1.2 研究现状 1.3 目的和意义 1.4 论文结构安排 1.5本章小结 2 开发环境与技术 2.1 MySQL数据库 2.2 Java语言技术 2.3 Spring Boot框架 2.4 Vue.js 2.5 本章小节 3 系统分析 …

2026/9/7 0:03:36

BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析

简介:BS EN 13814-1:2019是英国采纳欧洲标准EN 13814-1:2019的正式版本,由BSI标准出版,重点规定游乐设施和游乐设备在设计与制造环节的安全准则,与BS EN 13814-2:2019、BS EN 13814-3:2019共同取代旧版BS EN 13814:2004。该标准面…

2026/9/7 0:03:36

UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南

简介:UL 1642是锂电池安全领域的重要规范,本中文版资源适合锂电池制造商、检测机构工程师及产品认证相关人员阅读,用于理解电池在设计与制造层面的安全要求、测试方法与合规要点。资源共1个PDF文件,压缩包大小834KB,便…

2026/9/7 0:03:36

基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现

这次我们来看一个把目标检测算法和桌面端工具结合得很典型的项目:基于 YOLOv8 PyQt5 的麦穗稻穗检测识别系统。这个项目本身不是新概念,但它的价值在于落地形态很完整。YOLOv8 负责核心的麦穗稻穗目标检测,PyQt5 负责提供可视化的桌面交互界…

2026/9/6 23:58:36

S698-T处理器上RTEMS移植与开发实战

简介:文档围绕S698-T处理器上的RTEMS实时操作系统移植与应用程序开发展开,定位为航天嵌入式领域的专业技术文献,适合嵌入式实时系统开发者、航天器电子系统工程师及相关专业研究生阅读参考。文档以构建星载计算机模型为背景,论证了…

2026/9/7 0:47:43

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/7 0:14:19

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/7 0:14:17

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/7 0:03:36

基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现

这次我们来看一个把目标检测算法和桌面端工具结合得很典型的项目:基于 YOLOv8 PyQt5 的麦穗稻穗检测识别系统。这个项目本身不是新概念,但它的价值在于落地形态很完整。YOLOv8 负责核心的麦穗稻穗目标检测,PyQt5 负责提供可视化的桌面交互界…

2026/9/7 0:03:36

UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南

简介:UL 1642是锂电池安全领域的重要规范,本中文版资源适合锂电池制造商、检测机构工程师及产品认证相关人员阅读,用于理解电池在设计与制造层面的安全要求、测试方法与合规要点。资源共1个PDF文件,压缩包大小834KB,便…

2026/9/7 0:03:36

BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析

简介:BS EN 13814-1:2019是英国采纳欧洲标准EN 13814-1:2019的正式版本,由BSI标准出版,重点规定游乐设施和游乐设备在设计与制造环节的安全准则,与BS EN 13814-2:2019、BS EN 13814-3:2019共同取代旧版BS EN 13814:2004。该标准面…

2026/9/6 11:40:10

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/6 19:33:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/6 10:19:40

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…