伊朗科技大学研发出“双眼看片“的AI乳腺癌诊断系统

发布时间:2026/9/13 22:54:07

伊朗科技大学研发出“双眼看片“的AI乳腺癌诊断系统 这项由伊朗科技大学计算机工程学院主导的研究以预印本形式于2026年7月7日发布在arXiv平台编号为arXiv:2607.06309目前正在向Elsevier旗下相关期刊投稿审核中。感兴趣的读者可以通过该编号查阅完整论文。乳腺癌在全球范围内始终是威胁女性生命的重大疾病之一而早期发现是提高生存率最关键的一步。钼靶X光片也就是乳腺X线摄影是目前筛查乳腺癌最常用的工具。然而让机器自动读懂这些图像并给出准确判断一直是医学影像领域的一道难题——病灶对比度低、组织结构复杂、不同类别之间的细微差异难以区分这些困难叠加在一起让自动诊断系统的研发举步维艰。更重要的是在临床实践中放射科医生从不只看一张图。每次乳腺检查通常会拍摄两个角度的图像一张从正上方俯视拍摄称为CC位颅尾位另一张从斜侧方拍摄称为MLO位内外侧斜位。这两张图好比两个侦探从不同角度观察同一个案发现场各自捕捉到对方看不到的细节。经验丰富的医生会把两张图结合起来综合判断但大多数现有的AI系统却只会单眼看片——要么只处理一张图要么把两张图的结果简单叠加并没有真正实现像医生那样的双视角联合分析。正是为了填补这个缺口伊朗科技大学的研究团队提出了一套全新的AI框架让机器能够像经验丰富的放射科医生一样真正把两个角度的图像对话起来通过结构化的信息交换来提升诊断准确性。一、为什么单眼看片还不够现有方法又差在哪里在深入了解这套新系统之前有必要先理解已有方法的局限性这样才能体会新方法的价值所在。早期的深度学习方法主要依靠卷积神经网络一种擅长识别图像特征的AI结构逐张处理钼靶图像。这类方法虽然取得了不错的成绩但本质上是单眼侦探——它只能靠一张图判断无论CC位还是MLO位都被独立处理两者之间毫无交流。后来研究者们意识到这个问题开始尝试把两个视角的信息融合起来。最常见的做法是特征级融合——分别提取CC图和MLO图的特征然后通过平均、拼接等方式合并。这就好比两个侦探各自写完案情报告后把两份报告简单装订在一起交给上级却没有面对面讨论、相互补充细节。信息是合并了但深层次的关联和互补关系并没有被充分挖掘。更进阶的方法引入了注意力机制Attention一种让AI关注图像中重要区域的技术让两个视角的特征能够相互参考对方。然而这类方法存在两个关键缺陷第一信息交换的结果被直接叠加回原始特征上导致来自对方视角的信息和自己视角的原有信息混在一起难以区分就像两个侦探的笔记被随意写在同一张纸上混成一团第二这种信息交换通常只发生在网络的某一个固定深度就像侦探只在案件调查的某个特定阶段开了一次会之后就再也不沟通了错过了在不同分析阶段不断碰撞、修正的机会。此外近年来出现的大型预训练视觉模型可以理解为经过海量图像训练、具备强大通用视觉理解能力的超级侦探虽然在医学影像领域展示出巨大潜力但已有的提示词学习Prompt Learning一种用极少量可训练参数来调整预训练模型行为的技术方法都是为单张图像设计的并不支持多视角之间的结构化交互。二、这套新系统的核心思路让两个侦探通过专属信使持续对话伊朗科技大学的团队提出的解决方案可以用一个形象的比喻来理解。假设CC视角的侦探和MLO视角的侦探正在调查同一起案件。新方法的核心创新在于不是让两个侦探把笔记混在一起而是在两人之间安排了专属的信使。这个信使负责提炼一方侦探的关键发现然后将其以一种独立的、干净的形式传递给另一方让接收方侦探可以在不破坏自己原有笔记的前提下参考这些新线索继续深化分析。更妙的是这种信使传递不是只发生一次而是在整个案件分析过程的多个节点上反复进行。每一轮交流之后双方侦探都能带着更丰富的信息继续深挖形成一个持续迭代、螺旋上升的分析过程。在技术层面整套框架建立在一个被冻结即不修改其内部参数的大型预训练视觉模型MedSigLIP之上。MedSigLIP是一个经过大规模生物医学图像-文本配对数据训练的视觉编码器具备强大的通用医学图像理解能力。整个框架分为两个训练阶段每个阶段负责不同层面的能力建设。三、第一阶段用共享暗号让两个侦探说同一种语言在第一阶段研究团队引入了深度共享视觉提示学习策略。所谓提示词Prompt在这里指的是一些可学习的小型向量数字序列被插入到预训练模型的输入序列中就像在原有的图像信息前面加了几个引导暗语让模型以特定的方式处理后续信息。这个思路的精妙之处在于整个预训练模型本身完全不动只训练这几个小小的提示词参数量极小效果却相当显著。在传统单视角应用中提示词只针对单张图像设计。伊朗科技大学的团队则将这个思路扩展到双视角场景CC图和MLO图共享同一套提示词。这就像给两个侦探发放相同的机密工作手册确保他们在分析案件时采用同样的框架和视角使得两人产出的分析报告格式统一、语言一致为后续的信息交换打下基础。具体实现上提示词被分层插入到模型的多个变换层Transformer Layer可以理解为模型内部处理信息的多个分析站中每个分析站各有一个提示词。CC图和MLO图分别通过同一个共享编码器处理得到各自的特征表示然后拼接在一起送入一个轻量级的分类器来做出最终判断。在这个阶段只有提示词和分类器的参数会被更新预训练模型的全部参数保持冻结不动。这一阶段的效果在于通过共享提示词两个视角的特征表示被对齐到同一个语义空间中就像让两个原本说不同方言的侦探学会了同一种标准语言为后续的深度对话创造了条件。不过此时两个侦探的对话依然是间接的——他们只是被迫使用了同一套分析框架并没有直接交流各自发现的案情细节。四、第二阶段用专属信使令牌实现双向深度对话第二阶段是整套框架最核心的创新所在。研究团队在第一阶段训练好的提示词基础上进一步引入了跨视角融合令牌Cross-View Fusion Token。这个令牌就是前文比喻中的信使是一个专门用来携带跨视角信息的独立向量。具体工作流程如下在模型处理图像的某个中间节点CC图的当前特征序列会向MLO图的特征序列发出关注查询这个过程在技术上叫做多头交叉注意力Multi-Head Cross-Attention可以理解为CC侦探系统性地翻阅MLO侦探的所有分析记录找出对自己最有用的信息反过来MLO图也同样向CC图发起同样的查询。两次查询的结果都经过均值池化即把所有查询结果取平均提炼出一个综合摘要压缩成一个紧凑的融合令牌。这个融合令牌随后被插入到各自视角的特征序列中与原有的特征一起被后续的模型层继续处理。这就相当于CC侦探把从MLO侦探那里学到的关键线索写成一张便条夹在自己的分析记录里后续每次深入分析时都能参考这张便条MLO侦探也同样如此。两人都带着对方的线索摘要继续工作而不是把笔记混在一起搞混。更重要的是这种信息交换不只发生一次而是在模型的多个不同深度节点重复进行。每次交换之后新的融合令牌都会随着后续的处理层得到进一步精炼形成一个多轮次、多层次的信息整合过程。这样浅层提取的纹理细节信息和深层提取的语义概念信息都能得到充分的跨视角交融就像两个侦探不只在案件调查初期交换线索而是在每个关键节点都碰头讨论随时更新彼此的认知。在第二阶段的训练中第一阶段学到的提示词被冻结不再更新只有新引入的融合模块、视觉编码器的输出处理头Attention Pooling Head以及最终分类层的参数被更新。这种分阶段、分层次的训练策略确保了新功能的引入不会破坏之前已经学到的知识。五、两个真实数据集上的测试数字背后的故事研究团队在两个公开的钼靶数据集上验证了这套框架的效果。第一个数据集是VinDr-Mammo由越南的研究团队构建包含5000个四视角检查案例共20000张图像每张图像都有BI-RADS分级标注。BI-RADS是乳腺影像报告和数据系统的分级标准从1级正常到5级高度怀疑恶性是放射科医生评估乳腺异常的标准化工具。这个数据集存在明显的类别不平衡问题——BI-RADS 1级正常的训练样本多达4842个而BI-RADS 5级高度可疑恶性只有78个相差60多倍对AI系统的公平性和鲁棒性是极大的考验。第二个数据集是CMMD中国乳腺癌数据库包含来自1775名患者的5202张图像每张图像都有经病理活检确认的良性或恶性标注是一个二分类问题。研究团队按患者级别而非图像级别划分了训练集、验证集和测试集确保同一患者的图像不会同时出现在训练集和测试集中避免数据泄露。所有图像在送入模型之前都经过了统一的预处理首先用前景轮廓检测裁剪出乳腺区域去除大量无关背景然后用对比度受限的自适应直方图均衡化CLAHE增强组织细节的可见度最后统一调整到448×448像素的分辨率以匹配MedSigLIP的输入要求。在评估指标上团队使用了两个互补的标准AUC曲线下面积衡量模型在不同判断阈值下的综合区分能力满分为1.0和宏观F1分数对每个类别的F1分数取平均确保少数类别和多数类别对最终评分贡献相同不让多数类别刷分。六、关键对比实验层层递进的效果验证研究团队设计了一系列对比实验就像一个精心设计的侦探推理链逐步排除干扰因素验证每个设计决策的价值。最基础的基线是线性探针Linear Probing完全冻结MedSigLIP只训练一个简单的线性分类层。CC图和MLO图被独立处理通过概率平均或取最大值来合并两个视角的预测结果。这个方法代表了不做任何特殊适配、不做任何视角交互的最低起点。在VinDr-Mammo五分类任务上平均融合的线性探针取得了F1分数38.95%、AUC 0.7548的成绩。加入第一阶段的共享提示词学习之后但不加入第二阶段的融合模块F1分数提升到47.66%AUC提升到0.7887。这说明仅仅通过少量可训练的提示词来引导预训练模型适应钼靶图像领域就能带来相当显著的改善。单独使用第二阶段的跨视角融合但不使用第一阶段的提示词初始化直接在原始预训练特征上做融合的成绩是F1分数47.85%、AUC 0.7692同样优于线性探针但略低于完整框架。将两个阶段合并的完整框架在VinDr-Mammo五分类任务上达到了F1分数50.40%、AUC 0.8090全面超越所有基线。在CMMD二分类任务上完整框架同样展现出最高的AUC0.7161尽管F1分数64.96%略低于仅使用融合模块的65.20%但综合来看性能最为均衡。研究团队还将方法与DIVF一种专门为双视角钼靶设计的特征级融合框架进行了直接比较测试平台是VinDr-Mammo二分类任务。DIVF的成绩是F1分数75.98%、AUC 0.7486。使用2个融合模块的新方法取得了F1分数77.88%、AUC 0.8593使用4个融合模块时F1分数进一步提升至79.57%但AUC略降至0.8313。整体来看新方法在AUC指标上的优势尤为突出意味着在区分良性和恶性病变的综合能力上有实质性的提升AUC的提升幅度超过了0.10。七、细节决定成败多项消融实验揭示设计背后的逻辑为了进一步验证每个设计决策的必要性研究团队进行了多项消融实验——即逐一去掉某个组件观察性能变化以此评估该组件的真实贡献。在融合策略的对比上团队将融合令牌方案与更简单的残差融合方案即将跨视角注意力的输出直接加回原始特征上不引入独立令牌进行对比。结果显示融合令牌方案在VinDr-Mammo五分类任务上比残差融合高出5.22个百分点的F1分数和0.0521的AUC在CMMD上也有一致的提升。这有力地证明了让跨视角信息以独立令牌的形式存在、由后续层进一步精炼这个设计思路的价值。在融合令牌的聚合方式上团队比较了最大池化、均值池化和基于注意力的池化三种方案。均值池化取平均值在VinDr-Mammo二分类任务上表现最佳F1分数达到77.88%、AUC 0.8593最大池化的AUC为0.8227注意力池化的AUC为0.8475。均值池化简单而稳健在这个应用场景下胜出。在视觉编码器输出处理头的微调策略上团队发现用学习率1e-5对其进行微调能带来最佳性能AUC 0.8593优于完全冻结AUC 0.8338和极小学习率1e-7AUC 0.8468的方案。值得注意的是即便完全冻结该模块新方法依然超越了所有对比基线说明方法的核心优势来自提示词和融合令牌本身而非依赖于输出处理头的微调。在提示词深度的选择上研究团队测试了在MedSigLIP变换器的不同层数插入提示词的效果。实验发现在第12层时性能达到峰值F1分数47.66%在第8层和第16层也有相近的表现而在第20层、第24层和第27层性能出现明显下滑。这个结果表明并非越深的提示词注入越好——在过深的层引入提示词反而可能干扰模型已经形成的高层语义表示产生适得其反的效果。在融合模块数量和位置的选择上团队测试了三种配置在第18层插入1个融合模块AUC 0.8441、在第12层和第23层各插入1个共2个融合模块AUC 0.8593最优、在第12、18、23、26层各插入1个共4个融合模块AUC 0.8313。结果清晰地表明适度间隔的少量融合模块效果最好过于密集的融合反而可能带来信息冗余或干扰就像两个侦探如果在每一步都停下来开会讨论反而会降低整体效率。八、让AI的判断可见用遮挡法理解模型关注什么研究团队还通过遮挡敏感性分析一种解释AI决策的可视化方法通过逐区域遮挡图像并观察预测分数的变化来找出哪些区域对判断最重要对模型的决策逻辑进行了直观展示。在论文中呈现的四个典型案例中可以清晰地看到对于CC图和MLO图模型关注的热点区域通常集中在乳腺组织的异常区域而非背景或正常组织。这种可视化结果为模型的临床可信度提供了一定支撑说明模型的判断并不是蒙猜而是确实在关注医学上有意义的区域。---归根结底这项研究所做的事情是用一套更聪明的信息传递机制让AI在分析乳腺钼靶图像时能够真正模拟放射科医生的双眼联合阅片习惯。不同于过去那些要么完全忽略多视角信息、要么把两张图简单叠加的方法这套框架让两个视角的信息通过专属的信使令牌持续交流而且这种交流在分析过程的多个阶段反复发生使得信息整合更加深入和全面。对于普通读者来说这意味着未来的AI辅助乳腺癌筛查系统可能会变得更加准确可靠。在资源有限的基层医疗机构中一个能够像经验丰富的放射科医生一样综合利用多个视角信息的AI系统有潜力弥补专业医生数量不足的缺口帮助更多患者在疾病早期得到发现和治疗。当然这项研究目前还处于方法验证阶段。数据集的规模和多样性有限尤其是CMMD数据集中恶性样本和测试集样本数量相对较少如何在更大规模、更多样化的真实临床环境中保持性能稳定性仍是后续需要深入探索的问题。此外当前框架仅使用了双视角信息如何进一步扩展到包含更多视角如双侧乳腺的对比或整合临床文本信息也是未来值得探索的方向。有兴趣深入了解技术细节的读者可以通过arXiv编号2607.06309查阅完整论文研究团队也已将代码开源可在GitHub搜索CrossViewTokenFusion找到相关资源。---QAQ1BI-RADS分级是什么AI为什么要学会判断它ABI-RADS是放射科医生用于描述钼靶图像中乳腺异常程度的标准化评分体系从1级正常到5级高度怀疑恶性帮助医生统一沟通和制定后续检查方案。让AI学会判断BI-RADS分级相当于让机器掌握放射科医生的评估语言从而实现对乳腺异常程度的自动化分级辅助或加速临床筛查流程。Q2跨视角融合令牌和直接把两张图特征加在一起有什么本质区别A直接把两张图的特征加在一起就像把两个人的笔记混写在同一张纸上——信息合并了但两份信息互相交缠之后很难分清哪部分来自哪个视角也无法进一步单独精炼。融合令牌则是专门创建一个独立的信使摘要只携带跨视角的关键信息插入原序列后由后续处理层继续打磨两份原始信息保持各自的独立性效果更加精准。Q3为什么不直接微调整个预训练模型而要把它冻结起来A大型预训练模型的参数数量通常高达数亿甚至数十亿完全微调需要大量标注数据和极高的计算成本而医学影像数据集往往规模有限。冻结预训练模型并只训练少量额外参数提示词和融合模块能在极低的计算和数据成本下充分利用模型的通用视觉理解能力同时避免在小数据集上过拟合是一种兼顾效率与效果的务实选择。
延伸阅读

更多相关文章

2026/9/13 22:25:37

CAR-T细胞疗法:肿瘤免疫治疗的突破与应用

1. CAR-T疗法:突破性治疗方案的临床价值CAR-T细胞疗法(Chimeric Antigen Receptor T-Cell Therapy)作为近年来肿瘤免疫治疗领域的重大突破,已在复发/难治性B细胞淋巴瘤的治疗中展现出显著疗效。这种个体化治疗方案通过基因工程技术…

2026/9/4 1:46:59

电源管理芯片技术解析与国产化替代策略

1. 电源管理芯片行业概述电源管理芯片(PMIC)是现代电子设备中不可或缺的核心元器件,它如同电子系统的"心脏"和"血管系统",负责电能的转换、分配和监控。这个看似不起眼的小芯片,实际上决定了电子设…

2026/9/14 19:50:22

SPIRAL框架解析:轻量级Web组件开发实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/14 19:50:22

日语MV中文字幕制作全流程与技术要点

我无法根据当前输入生成符合要求的博文。原因如下:项目标题“【中字】高桥优—CANDY”属于音乐视频类内容,指向一首日语歌曲的中文字幕版发布;项目正文为空,无任何功能性描述、技术细节、操作过程或创作背景;关键词与摘…

2026/9/14 19:50:22

音视频处理技术入门:FFmpeg基础操作与实战场景

我无法基于“Rufus Wainwright - Going To A Town (Official Music Video) 2007”这一纯音乐视频标题生成符合你所设定的技术类项目博文规范的内容。原因如下:该标题明确指向一首2007年发布的官方音乐视频,属于文化内容/数字媒体资产范畴,而非…

2026/9/14 19:50:22

Java学习语法篇:键盘录入

1. 引言在Java程序开发中,键盘录入是程序与用户交互最基础、最常用的方式之一。无论是控制台小工具、命令行应用,还是学习阶段的练习程序,都离不开从键盘读取用户输入。掌握键盘录入技术,是每个Java初学者必须跨越的第一道门槛。本…

2026/9/14 19:50:22

DFS与BFS:图遍历的两大核心算法

1. 深度优先搜索(DFS)1.1 DFS 的原理深度优先搜索的核心思想是“一条路走到黑”。从起始顶点出发,沿着一条路径一直往下走,直到无法继续前进时,再回退到上一个分岔口,选择另一条路径继续探索。这个过程很像…

2026/9/14 19:45:22

企业数字化转型的挑战与破局之道

1. 数字化转型的现状与挑战 过去十年间,数字化转型已经从企业的可选项变成了必选项。根据麦肯锡最新研究显示,85%的企业已经启动数字化项目,但仅有30%能实现预期效益。这种落差背后,是大多数组织在转型过程中遇到的系统性障碍。 …

2026/9/14 2:17:50

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/14 0:03:22

KCF目标跟踪算法与OTB工程实现:毕业设计实战解析

简介:这是一份基于KCF核相关滤波算法、融合尺度池与抗遮挡处理的目标检测跟踪MATLAB完整源码,主要面向计算机相关专业准备毕业设计、课程设计或期末大作业的学生,也适合需要项目实战练习的初学者。源码在OTB数据集上完成验证,能够…

2026/9/14 0:03:22

语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比

简介:面向语音情感识别入门与进阶开发者,这份基于Keras的项目源码完整实现了LSTM、CNN、SVM、MLP四种模型,兼容Python3.8与Keras/TensorFlow2环境。压缩包内含49个文件,大小约70.31MB,主体包括Python脚本、yaml/json配…

2026/9/14 11:59:31

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/14 13:53:59

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/14 11:22:57

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码