发布时间:2026/9/2 7:29:14
CVPR 2026 | DIQ:只用1%精选微调数据,让医学推理更高效,媲美全量数据 引言大语言模型在医疗推理中展现出巨大潜力但现有微调方法往往依赖海量标注数据不仅计算成本高昂且大量冗余、低质量的样本反而会稀释模型的临床推理能力。如何在有限数据下实现高效、精准的医学推理成为亟待解决的核心难题。近日发表于CVPR的一项研究中来自华东师范大学、MBZUAI等机构的研究团队提出了一个名为DIQDifficulty-Influence Quadrant的数据选择框架。不同于传统方法仅基于样本难度或梯度影响单一维度进行筛选DIQ创新性地将二者结合优先选取“高难度-高影响力”的样本。实验表明仅用1%的DIQ精选数据微调性能即可媲美全量数据使用10%数据时则持续超越现有基线方法为构建高效、可扩展的医学推理模型提供了全新路径。基本信息•文章标题Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data•发表时间2026年3月14日•研究单位华东师范大学、穆罕默德·本·扎耶德人工智能大学MBZUAI、莫纳什大学、上海人工智能实验室•Github地址https://github.com/mihara-bot/DIQ•论文地址https://arxiv.org/abs/2508.01450v3•算力描述所有训练在搭载4块NVIDIA A800 GPU的Ubuntu 22.04服务器上进行采用LoRA微调LoRA目标模块包含query、key、value投影LoRA秩设为8最大上下文长度为8192 tokens学习率为1×10−4并使用余弦衰减调度训练3个epoch。研究内容与方法一、医疗推理数据集预处理针对现有医疗推理数据集如Huatuo、FineMed、MedReason等进行统一格式转换将样本处理为包含问题文本、推理过程与答案的结构化数据确保后续难度评估与影响力计算的输入一致性。代码片段来自process_data.pydefprocess_medical_data(raw_data):processed_samples[]foriteminraw_data:sample{text:item[question]\nitem[reasoning],answer:item[answer]}processed_samples.append(sample)returnprocessed_samples二、DIQ框架概述DIQ是一种面向医疗推理的高效数据选择框架通过联合评估样本的难度得分与Dot影响力得分在二维空间划分象限并优先选择兼具临床复杂度与优化效用的样本实现小样本微调下的高效医疗推理。框架流程分为三步样本得分标注、象限划分、优先级选择。【DIQ框架流程图】三、难度得分计算1. 核心目的评估医疗样本的知识复杂度、推理复杂度与整体难度筛选具有临床价值的复杂推理样本。2. 实现逻辑难度分类器训练采用BiomedBERT作为基础模型在标注了知识Knowledge、推理Reasoning、整体Overall三个维度难度的医疗样本上微调每个维度难度为1-5分对应不同临床复杂度层级。代码片段来自difficulty.pydefpredict_difficulty(model,tokenizer,text):inputstokenizer(text,return_tensorspt,paddingTrue,truncationTrue)outputsmodel(**inputs)logitsoutputs.logits scorestorch.softmax(logits,dim1).tolist()[0]# 返回知识、推理、整体三个维度的得分returnscores[0],scores[1],scores[2]难度得分提取从分类器输出中选择指定维度默认选择Overall作为样本的最终难度得分公式为D(z)Dϕ(z),ϕ∈{K,R,O}D(z) D_\phi(z), \phi \in \{K, R, O\}D(z)Dϕ​(z),ϕ∈{K,R,O}其中ϕ\phiϕ为选择的难度维度K知识、R推理、O整体。代码片段来自selection.pydefget_difficulty_scores(difficulty_model,tokenizer,samples,dimensionoverall):difficulty_scores[]forsampleinsamples:k_score,r_score,o_scorepredict_difficulty(difficulty_model,tokenizer,sample[text])ifdimensionknowledge:difficulty_scores.append(k_score)elifdimensionreasoning:difficulty_scores.append(r_score)else:difficulty_scores.append(o_score)returndifficulty_scores四、Dot影响力得分计算1. 核心目的评估样本对模型验证损失的优化效用筛选能有效降低验证损失的高价值训练样本。2. 实现逻辑梯度内积计算计算每个训练样本的梯度与验证集平均梯度的内积作为Dot影响力得分公式为Dot(z)1∣Dval∣∑z′∈Dvalg(z;θ^)⊤g(z′;θ^)\text{Dot}(z) \frac{1}{|D_{val}|} \sum_{z \in D_{val}} g(z; \hat{\theta})^\top g(z; \hat{\theta})Dot(z)∣Dval​∣1​z′∈Dval​∑​g(z;θ^)⊤g(z′;θ^)其中g(z;θ^)g(z; \hat{\theta})g(z;θ^)是样本zzz在预训练模型参数θ^\hat{\theta}θ^下的梯度DvalD_{val}Dval​为验证集。高效降维优化采用随机投影降低梯度维度减少计算成本同时保留梯度排序信息确保大规模数据集下的计算效率。代码片段来自influence.pydefcompute_dot_influence(model,train_samples,val_samples,tokenizer,proj_dim4096):# 计算验证集平均梯度val_grads[]forsampleinval_samples:inputstokenizer(sample[text],return_tensorspt)outputsmodel(**inputs,labelsinputs[input_ids])lossoutputs.loss loss.backward()gradtorch.cat([p.grad.flatten()forpinmodel.parameters()ifp.gradisnotNone])val_grads.append(grad)model.zero_grad()avg_val_gradtorch.stack(val_grads).mean(dim0)# 随机投影矩阵降低梯度维度proj_matrixtorch.randn(avg_val_grad.shape[0],proj_dim)/np.sqrt(proj_dim)# 计算训练样本的Dot得分dot_scores[]forsampleintrain_samples:inputstokenizer(sample[text],return_tensorspt)outputsmodel(**inputs,labelsinputs[input_ids])lossoutputs.loss loss.backward()gradtorch.cat([p.grad.flatten()forpinmodel.parameters()ifp.gradisnotNone])# 投影后计算内积proj_gradgrad proj_matrix proj_avg_val_gradavg_val_grad proj_matrix dot_scoretorch.dot(proj_grad,proj_avg_val_grad).item()dot_scores.append(dot_score)model.zero_grad()returndot_scores五、象限划分与优先级选择1. 核心目的结合难度与影响力得分筛选兼具临床推理复杂度与模型优化效用的样本子集。2. 实现逻辑象限划分设定难度阈值τd\tau_dτd​训练集难度得分的百分位数和Dot得分中位数mdotm_{dot}mdot​将样本分为四个象限Q1高难度高影响力D(z)≥τdD(z) \geq \tau_dD(z)≥τd​且Dot(z)≥mdot\text{Dot}(z) \geq m_{dot}Dot(z)≥mdot​Q2低难度高影响力D(z)τdD(z) \tau_dD(z)τd​且Dot(z)≥mdot\text{Dot}(z) \geq m_{dot}Dot(z)≥mdot​Q3高难度低影响力D(z)≥τdD(z) \geq \tau_dD(z)≥τd​且Dot(z)mdot\text{Dot}(z) m_{dot}Dot(z)mdot​Q4低难度低影响力D(z)τdD(z) \tau_dD(z)τd​且Dot(z)mdot\text{Dot}(z) m_{dot}Dot(z)mdot​代码片段来自selection.pydefpartition_quadrants(difficulty_scores,dot_scores,tau_d0.7,m_dotNone):ifm_dotisNone:m_dotnp.median(dot_scores)# 难度阈值取tau_d对应的百分位数tau_d_valnp.percentile(difficulty_scores,tau_d*100)quadrants{Q1:[],Q2:[],Q3:[],Q4:[]}foridx,(d,dot)inenumerate(zip(difficulty_scores,dot_scores)):ifdtau_d_valanddotm_dot:quadrants[Q1].append(idx)elifdtau_d_valanddotm_dot:quadrants[Q2].append(idx)elifdtau_d_valanddotm_dot:quadrants[Q3].append(idx)else:quadrants[Q4].append(idx)returnquadrants优先级样本选择按照Q1→Q2→Q3→Q4的优先级顺序选择样本每个象限内按Dot得分降序排序若Dot得分相同则按难度得分降序排序直到达到目标样本比例rrr。代码片段来自selection.pydefselect_samples(quadrants,difficulty_scores,dot_scores,target_ratio):total_samplessum(len(q)forqinquadrants.values())target_numint(total_samples*target_ratio)selected[]# 优先级顺序Q1 Q2 Q3 Q4forq_namein[Q1,Q2,Q3,Q4]:iflen(selected)target_num:breakq_indicesquadrants[q_name]# 按Dot降序、难度降序排序sorted_indicessorted(q_indices,keylambdax:(-dot_scores[x],-difficulty_scores[x]))take_nummin(len(sorted_indices),target_num-len(selected))selected.extend(sorted_indices[:take_num])returnselected实验结果分析1. DIQ数据选择策略的总体性能表现DIQ方法在多个数据集和保留比例下均显著优于随机选择和基线方法。实验表明仅使用1%-10%的DIQ选择数据即可匹配甚至超越全量数据微调的性能。数据效率极高在FineMed数据集上仅1%的DIQ选择数据约170个样本就使Llama3.1-8B-Instruct的平均准确率AvgA达到41.46%远超全量数据训练的38.57%提升2.89个百分点。持续超越基线在Huatuo数据集上10%的DIQ选择数据约1,900个样本达到44.04%的AvgA超过所有基线方法如LESS的40.54%、Similarity的41.73%甚至优于全量数据训练的43.44%。标准任务提升显著在FineMed数据集1%保留比例下DIQ在标准任务平均准确率AvgS上达到58.14%相比全量数据训练的42.52%提升15.62个百分点。【Llama3.1-8B-Instruct在不同数据集和保留比例下的下游任务性能对比DIQ方法在多数设置下取得最佳结果】2. 临床推理质量与专家对齐评估DIQ选择的数据不仅提升了模型性能还显著改善了临床推理质量使其更贴近专家实践。通过LLM-as-a-judge评估DIQ在鉴别诊断、安全检查、证据引用三个关键维度均表现优异。数据层面质量提升DIQ-1%选择的数据子集在鉴别诊断DDx评分上达到4.39远高于全量数据剩余的3.59提升0.80证据引用EC评分4.77 vs 4.31提升0.46。模型推理对齐增强使用DIQ-1%数据训练的模型在鉴别诊断3.71 vs 3.66、安全检查3.30 vs 3.14和证据引用4.90 vs 4.75上均优于全量数据训练模型。案例验证在MedBullets-option5的临床病例中DIQ-1%训练的Qwen3-8B模型能够系统性地进行鉴别诊断DDx、安全检查SC和证据引用EC其推理过程与专家临床思维高度一致。【DIQ-1%数据与剩余数据、DIQ-1%模型与全量数据模型的临床价值对比DDx、SC、EC三个指标均按5分制评分】3. 消融实验与泛化能力验证DIQ的二维选择策略难度影响力优于任何单一维度的选择并且在不同模型规模和模型家族间展现出良好的泛化能力。二维策略优于单维度在1%保留比例下DIQ42.78% AvgA优于仅使用影响力42.67%、仅使用总体难度41.36%、仅使用知识难度41.59%和仅使用推理难度40.70%的单维度选择方法。10%保留比例下同样保持优势44.04% vs 43.16%/40.01%/41.89%/40.70%。跨模型家族泛化使用Llama3.1-8B计算的影响力分数应用于Qwen3-8B时在10%保留比例下仍取得47.62%的AvgA优于随机选择的45.51%提升2.11个百分点。跨模型规模泛化使用Qwen3-8B计算的影响力分数应用于Qwen3-14B时在1%/10%/50%保留比例下分别提升1.42/1.89/1.56个百分点应用于Qwen3-32B时提升0.45/2.41/2.64个百分点。【不同消融设置下Llama3.1-8B-Instruct的平均准确率对比DIQ在1%和10%保留比例下均优于单一维度选择方法】【使用不同来源影响力分数的DIQ在Qwen3系列模型上的下游任务性能DIQ能够跨模型规模和模型家族泛化】优势与局限优势高效数据选择DIQ通过联合评估样本难度与梯度影响仅需1%–10%的精选数据即可匹配或超越全量微调性能显著降低训练成本。临床推理对齐DIQ优先选择高难度-高影响力样本提升模型在鉴别诊断、安全检查和证据引用上的表现生成更贴近专家实践的推理过程。跨模型泛化性强DIQ在不同规模8B–32B和不同家族Llama、Qwen的模型上均有效且支持跨模型迁移和偏好学习DPO扩展。局限计算资源依赖DIQ需要为每个训练样本计算梯度内积尽管已采用随机投影降维但对大规模模型≥70B的计算开销仍需进一步验证。验证集依赖DIQ的性能受验证集大小影响较小验证集可能导致影响力估计不稳定需在成本与稳定性间权衡。跨家族迁移有限DIQ的跨家族迁移如Llama→Qwen在极低数据预算下可能表现不稳定需结合模型特定影响力或难度重加权来弥补差距。参考文献Supervised Fine-tuning (SFT) of the language backbone plays a pivotal role in adapting Vision-Language Models to specialized domains such as medical reasoning.Zhuang et al., 2025该论文提出了DIQ框架通过联合评估样本难度与梯度影响实现了仅用1%-10%精选数据即可匹配或超越全量微调性能是本研究数据高效微调策略的核心方法。Huatuogpt-o1, towards medical complex reasoning with llms.Chen et al., 2024该论文构建了大规模医学推理数据集HuatuoGPT-o1是本研究训练与评估所使用的核心数据来源之一为验证DIQ的数据选择有效性提供了基准。Lima: Less is more for alignment.Zhou et al., 2023该论文证明了少量高质量数据即可有效激发大模型的对齐能力启发了本研究“少即是多”的数据选择理念并作为DIQ框架的理论基础之一。LESS: Selecting influential data for targeted instruction tuning.Xia et al., 2024该论文提出了基于TracIn影响分数的数据选择方法LESS是本研究在实验部分对比的主要基线方法之一用于验证DIQ在医学推理场景下的优越性。Disentangling reasoning and knowledge in medical large language models.Thapa et al., 2025该论文提出解耦医学推理中的知识与推理难度是本研究DIQ框架中难度评估维度的直接来源为样本难度的多维度量化提供了方法论支持。

相关新闻

2026/9/2 7:29:14

脉冲快速充磁机是什么?

脉冲快充磁机是什么?① 脉冲快速充磁机利用电容器储存电能,通过充磁线圈瞬间放电产生强脉冲磁场,使永磁体一次性饱和充磁。 ② 适用于钕铁硼/铁氧体/钐钴永磁体、电机转子、扬声器磁钢、微波器件和自动产线连续充磁。 ③ 力田PFD系列电压精度…

2026/9/2 7:24:14

博朗KBL4300W厨师机实战指南:从和面到打发,家庭烘焙效率提升

最近在整理烘焙工具时,发现很多朋友在挑选厨师机时容易陷入纠结:是买一个基础款打蛋器,还是直接上专业的厨师机?两者功能似乎有重叠,但价格和体验又相差甚远。直到深度体验了这款博朗KBL4300W多功能电动打蛋器&#xf…

2026/9/2 7:24:14

自研串口调试下载助手:基于Qt6/C++的嵌入式上位机开发实践

简介:这是一款面向嵌入式开发者、物联网工程师及硬件调试人员的专业串口调试与程序下载工具,将串口通信、数据监控和固件更新集成于一体。软件支持自定义波特率、数据位、停止位及校验方式,可灵活匹配不同设备,并提供文本或十六进…

2026/9/2 7:44:15

第31章 综合案例​​

同样是百亿级快消品集团,同样是三年前启动数据资产化。A集团已将数据资产打造成第二增长曲线——入表资产规模超过5亿元,获得首笔数据资产质押贷款2000万元,数据资产驱动的精准营销增量毛利贡献占集团利润的3%。集团CFO在年度投资者日上&…

2026/9/2 7:44:15

《三角洲行动》摩斯密码门解密:从听声辨位到快速破解

这次我们来看一个在《三角洲行动》游戏中让不少玩家头疼的“摩斯密码门”解密技巧。如果你在游戏里卡在这类需要听声辨位的密码门前,这篇文章能帮你快速理解机制、掌握方法,从“完全听不懂”到“听一遍就会”。这种密码门的核心不是考验你的密码学知识&a…

2026/9/2 7:44:15

第26章 数据资产金融化“五级火箭”

2024年,某快消品供应链企业以“经销商数据资产”为质押,从银行获得首笔1200万元贷款。[1]这家企业的主营业务是为品牌方提供区域经销和终端配送服务,年营收规模约8亿元,旗下管理着超过2000家经销商。企业的固定资产主要是仓储设施…

2026/9/2 7:44:15

FOC+霍尔+PMSM在Matlab中的实机落地关键

简介:本资源是一套基于磁场定向控制(FOC)与霍尔传感器位置反馈的永磁同步电机(PMSM)Matlab仿真控制代码,面向计算机、电子信息工程、自动化及数学等专业的本科生,适用于课程设计、期末大作业与毕…

2026/9/2 7:44:15

基于STM32与多传感器融合的疲劳驾驶检测系统设计与实现

简介:本资源是一套面向嵌入式开发者与智能交通系统学习者的疲劳驾驶检测完整实践方案,聚焦于STM32平台下的实时生理行为识别与预警实现,适用于课程设计、毕业设计及安全辅助驾驶技术原型开发。压缩包共237个文件,4.35MB&#xff0…

2026/9/2 7:39:15

从零构建高可用Python机器人框架:插件化架构与事件驱动设计详解

简介:DPbot是一款面向Python开发者与自动化运维人员的轻量级机器人框架,聚焦于企业微信、QQ、Telegram等主流平台的Bot快速开发与插件化扩展,解决多场景下重复性消息处理、定时任务调度与AI能力集成等实际问题。资源包共150个文件&#xff0c…

2026/9/1 16:02:17

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/9/1 8:27:47

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/9/1 7:04:43

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/9/2 0:03:41

单片机毕业设计-基于单片机与蓝牙通讯的输液状态监测终端设计与开发 基于 STM32 或 51 单片机的液位‑滴速‑温度多参数输液监护装置设计(024005)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/9/2 0:03:41

DeepSeek字幕翻译实战:从API调用到批量SRT转中文的完整方案

这次我们来看一个很实用的 DeepSeek 落地场景:用 DeepSeek 把英文视频字幕自动翻译成中文。具体案例是《恶魔君》1989 年第 28 集的英转中字幕任务,标题写得很直白,但背后其实是一整套可以复用的技术流程:字幕解析、模型调用、批量…

2026/9/2 0:03:41

用Python搭建搞笑语音助手:从语音识别到语音合成全教程

当你家里摆着一台天猫精灵,却总希望语音助手偶尔“不正经”一点,不用官方腔回答问题,而是张口就接几句搞笑段子,会是什么体验?我最近动手验证了一下这个想法——没有去改装任何市面上现有的智能音箱,而是直…

2026/9/2 1:15:22

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/2 1:15:22

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/2 1:15:20

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…