发布时间:2026/7/31 18:17:50
论文笔记|LLM 的医学知识藏在哪?ICLR 2026 用四种可解释性方法画出大模型 Medical Knowledge Map Medical Interpretability and Knowledge Maps of Large Language ModelsICLR 2026 24661 动机LLM 在医学任务上越来越常用但我们并不清楚模型内部到底如何表示医学知识比如患者年龄、症状、疾病、疾病进展、药物、剂量等信息分别在哪些层被处理如果一个模型在医学场景里存在偏差例如对年龄、疾病阶段、药物类别的理解有问题仅看最终回答很难定位问题来源所以作者想做一件事不是只问“模型答得对不对”而是问“模型内部在哪些层表示了哪些医学概念”。这对于后续医学 LLM 的 fine-tuning、unlearning、de-biasing、causal intervention 都有指导价值比如如果年龄偏差主要在某几层出现就没必要全模型微调可以只干预相关层2 现有方法的不足现有医学可解释性工作主要有几个问题。第一很多工作只是让模型解释自己的诊断过程也就是 self-explanation这种解释不一定忠实于模型真实内部机制容易变成“事后合理化”。第二已有 mechanistic interpretability 工作大多研究通用知识、语法、事实召回、attention head、induction head 等很少系统研究医学领域知识。第三少数医学解释性工作通常只用一种技术比如只看 t-SNE/UMAP或者只看 sparse dictionary或者只看某个模型单一方法很容易有解释偏差因为不同解释方法有不同假设。UMAP 全称是Uniform Manifold Approximation and Projection把高维 embedding 压到低维同时尽量保留原来空间里的邻近关系第四医学知识不是一种单一概念年龄是连续变量症状和疾病是类别变量疾病进展是阶段性/轨迹性变量药物既可以按作用机制分类也可以按医学专科分类剂量还涉及安全/危险边界。因此只用一个统一指标很难覆盖这些结构3 论文的研究假设或直觉核心直觉是LLM 内部并不是在所有层均匀处理医学知识而是不同医学概念会在不同层形成可检测的表示结构如果多种解释性方法都指向相似层区间那么这些层很可能就是该类医学知识的关键处理区域。4 论文novelty4.1 Novelty 1医学知识地图 LLM Map【创新点解决的问题是什么】以往很难知道医学知识在 LLM 的哪些层被表示且单一解释方法不可靠如果多个机制解释方法在不同假设下都指向相似层那么这些层更可能是真正负责该概念的层——作者把 UMAP 表示聚类、gradient-based weight saliency、layer lesioning、activation patching 四种方法统一起来对 age、symptoms、diseases、drugs、dosage 分别提取高响应层区间最终画成 LLM Medical Map显示每类医学知识在模型深度上的分布4.2 Novelty 2把医学概念分成不同几何类型来解释【创新点解决的问题是什么】医学知识不是普通分类标签年龄、疾病进展、药物分类、剂量风险的结构完全不同用同一种解释指标会过于粗糙同知识类型应该对应不同 representation geometry年龄应接近一维连续流形症状/疾病/药物应有类别聚类疾病进展应有阶段轨迹——对年龄使用 local anisotropy 和线性回归 R²——对症状、疾病、药物使用 Silhouette Score——对疾病进展设计 closest-stage-to-first 和 closest-stage-to-last 之类的 circularity proxy——对剂量使用 activation patching effect4.3 Novelty 3发现年龄表示存在非线性和 18 岁断点【创新点解决的问题是什么】年龄看似是简单连续变量但模型可能并没有把年龄表示成平滑、可编辑、可去偏的线性方向——作者用不同年龄 prompt 提取中间层 activation然后用 UMAP 可视化和 age discontinuity heatmap 分析年龄流形发现 Llama3.3-70B 在部分中间层存在明显非线性并在 17/18 岁附近出现表示断点4.4 Novelty 4发现疾病进展表示可能是 circular / non-monotonic医学上的疾病进展通常被认为从健康到严重阶段逐步变化但 LLM 内部是否这样表示并不清楚。如果模型真的理解 disease progression那么健康、早期、中期、晚期、死亡阶段在表示空间里应具有某种单调轨迹——作者构造 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 阶段 progression prompts分析每层 UMAP 空间中不同阶段的相对距离发现晚期阶段有时反而靠近早期阶段因此表示呈现环形或非单调结构4.5 Novelty 5发现药物更按医学专科而不是作用机制聚类药物知识可以按药理机制组织也可以按临床使用场景组织不知道 LLM 内部偏向哪一种——作者分别按 mechanism of action 和 medical specialty 给药物上色比较 UMAP 聚类和 Silhouette Score发现尤其在 Llama3.3-70B 中药物按医学专科聚类通常比按作用机制更明显4.6 Novelty 6发现 Gemma/MedGemma 中间层 activation collapse模型中间层可能存在表示坍缩但这类现象在医学知识表示中很少被系统观察如果 UMAP 投影中大量不同医学概念在某些层坍缩成少数 blob说明这些层可能暂时丢失了区分性表示——作者对 Gemma3-27B 和 MedGemma-27B 的中间层 activation 做 UMAP发现部分中间层表示会坍缩但在后续层又恢复提示这些层可能存在 representational inefficiency5 方法5.1 整体pipeline第一步构造医学 prompt 集合作者围绕五类医学知识构造 prompt年龄、症状、疾病、药物、药物剂量每类 prompt 又服务于不同解释方法第二步对每个模型跑 forward保存每一层 activation模型输入一个医学 prompt 后每层 transformer block 都会产生 hidden state把每层中间表示拿出来分析。这样可以回答“某个医学概念在哪些层逐渐形成”第三步跑 UMAP 表示分析对于年龄、症状、疾病、药物等 prompt作者把每层 activation 降维到低维空间可视化时用 2D UMAP定量计算 Silhouette Score 时用 30D UMAP以保留更多信息对于类别型概念Silhouette Score 衡量同类样本是否更靠近、异类样本是否更分开Silhouette Score 的意义很简单如果同一类点彼此很近不同类点彼此很远那么分数高对于年龄这种连续变量作者不用 Silhouette而是用 local anisotropy 衡量年龄点是否接近一维流形并用线性回归 R² 衡量年龄是否线性可读Local anisotropy 衡量的是一堆点是否像一条线UMAP 模块回答的是“这些医学概念在 hidden space 里有没有形成结构可视化能力强但不一定证明因果作用。第四步跑 gradient-based weight saliency作者对目标答案的 loss 关于模型权重求梯度即看某层权重对医学答案的敏感程度如果某层权重梯度大说明模型回答该医学问题时更依赖这一层作者把 attention heads 和 MLP 的权重 saliency 按层平均再跨多个 prompt 平均得到每一层的 saliency 曲线。Saliency 模块回答的是“哪些层的参数对医学答案的 loss 更敏感”它能定位权重层面的重要性但梯度大不一定代表真实因果。第五步跑 layer lesioning。Layer lesioning 的做法是把某一层 transformer block 替换成 identity function相当于让这一层“不工作”然后观察模型回答退化多少退化程度由 GPT-4o 作为 judge 打分1/10 表示几乎没退化10/10 表示严重退化某层被移除后如果医学回答明显变差说明该层对该类医学知识重要Lesioning 模块回答的是“去掉某层后模型医学能力会不会明显下降它比 UMAP 更接近功能性分析但层之间可能有冗余因此某层不退化不代表没用第六步跑 activation patchingActivation patching 是最接近因果干预的方法最基本的设定是三次 forward passclean run、corrupted run、patched runpatching effect 怎么衡量通常不是只看最终生成文本因为文本生成有随机性也不好比较。更常用的是看目标答案 token 的 logitpatching effect (patched 的 logit 差值 - corrupted 的 logit 差值)/(clean 的 logit 差值 - corrupted 的 logit 差值)最后一步汇总成 LLM Medical Map5.2 使用的数据第一年龄 prompt。年龄从 1 到 100模板包括 “He is X years old.”、“She is X years old.”、“Someone is X years old.” 等用来分析年龄表示是否连续、线性、有无断点。第二症状 prompt症状被分为 pain、neurological、respiratory、digestive、cardiovascular、dermatological、musculoskeletal、psychological、genitourinary、ENT/ocular 等组别用于分析症状类别聚类第三疾病 prompt疾病按医学专科分类包括 cardiology、orthopedics、oncology、neurology、obstetrics gynecology、dermatology、gastroenterology、pulmonology、urology 等第四疾病进展 prompt作者为 Alzheimer’s disease、COVID-19、COPD、Parkinson’s disease 各构造 9 个阶段从健康、轻微症状、中重度症状到最终严重结局用来分析 progression geometry第五药物 prompt第六药物剂量 prompt作者构造不同剂量场景例如安全剂量和高风险剂量用 activation patching 或 saliency 分析模型如何处理 dosage 信息6 主要结论Llama3.3-70B 中年龄主要在 0–5 层附近被处理症状在 0–9 层以及 15–40 层有信号疾病在 0–5 或 27–37 层药物主要在 15–45 层药物剂量大致在前半部分层但结论更不稳定不同年龄 prompt 在 Llama3.3-70B 不同层的 UMAP 分布年龄不是一条简单直线而是在中间层形成弯曲、转向甚至断裂尤其在 17/18 岁附近出现明显 discontinuity说明模型可能把未成年人和成年人分成两个表示区域用 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 阶段 prompt 做 UMAP理想情况下疾病应从健康到严重阶段逐步远离健康状态但图中显示某些晚期阶段反而靠近早期阶段形成 circular / non-monotonic pattern。也就是说模型内部对疾病进展的表示不一定符合医学上的单调恶化逻辑Gemma3-27B 某些中间层的 UMAP 点坍缩成少数几个 blob但后面层又恢复分散。作者认为这可能表示中间层出现了表示能力浪费或者模型内部有某种压缩-恢复过程。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/7/31 18:17:50

linux系统下进行磁盘扩容

本文中的前提是基于在虚拟化平台中进行扩容,在虚拟化平台中有个centos7.2镜像格式安装的centos7的系统;如果使用虚拟机,除前面两大步骤不一样外,后面服务器扩展分区的步骤都是一样 一、查看服务器磁盘 df -h fdisk -l 可以看到…

2026/7/31 18:17:50

Kissui.ScrollAnim 使用指南

Kissui.ScrollAnim 使用指南 【免费下载链接】kissui.scrollanim CSS3 scroll animation library 项目地址: https://gitcode.com/gh_mirrors/ki/kissui.scrollanim 项目介绍 Kissui.ScrollAnim 是一个基于 CSS3 的页面滚动动画库,由 Afshin Mehrabani 开发…

2026/7/31 19:17:54

西安选培训机构避坑全攻略:看准这 4 点不踩雷!

在西安这座科教资源密集的城市,各类培训机构层出不穷,从职业技能到兴趣深造,选择面广但门槛参差。不少人冲着 “高薪就业”“快速入门” 报班,最终却遭遇师资注水、退费无门、学完与市场脱节的窘境。 其实挑选靠谱机构有章可循&am…

2026/7/31 19:17:54

部署SoulChat服务:本地服务器与云端平台的高效实现教程

部署SoulChat服务:本地服务器与云端平台的高效实现教程 【免费下载链接】SoulChat 中文领域心理健康对话大模型SoulChat 项目地址: https://gitcode.com/gh_mirrors/so/SoulChat SoulChat是中文领域领先的心理健康对话大模型,能够提供专业的情感支…

2026/7/31 19:17:54

一个关于水壶的笑话

一个程序员走进厨房,拿起水壶准备烧水。 同事问:"你干嘛呢?" 程序员:"我要烧一壶水。" 同事:"那你得先检查水壶里有没有水。" 程序员愣了一下,把水壶放下,走…

2026/7/31 19:17:54

仅限首批500名AI工程师获取:2024最新《AIGC服务性能测试脚本工厂》——含自动打标、动态负载生成、异常模式注入三大核心模块(GitHub Star 1.2K+未公开版)

更多请点击: https://kaifayun.com 第一章:AIGC服务性能测试脚本工厂的演进逻辑与核心价值 AIGC服务正从单点模型调用走向多模态、高并发、低延迟的生产级交付,传统手工编写压测脚本的方式已难以应对动态扩缩容、Prompt版本迭代、推理链路异…

2026/7/31 19:17:54

40岁再考PMP,还有职业提升意义吗?说点不贩卖焦虑的实话

到了40岁再考PMP,晚不晚? 这个问题背后,真正让人担心的可能不是考试,而是另外几件事: 公司开始提拔更年轻的项目经理; 自己做了多年技术,却一直没有正式的管理身份; 想换工作&…

2026/7/29 22:32:30

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/31 0:01:11

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:01:11

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:01:11

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:38:56

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…