
引言大语言模型在医疗推理中展现出巨大潜力但现有微调方法往往依赖海量标注数据不仅计算成本高昂且大量冗余、低质量的样本反而会稀释模型的临床推理能力。如何在有限数据下实现高效、精准的医学推理成为亟待解决的核心难题。近日发表于CVPR的一项研究中来自华东师范大学、MBZUAI等机构的研究团队提出了一个名为DIQDifficulty-Influence Quadrant的数据选择框架。不同于传统方法仅基于样本难度或梯度影响单一维度进行筛选DIQ创新性地将二者结合优先选取“高难度-高影响力”的样本。实验表明仅用1%的DIQ精选数据微调性能即可媲美全量数据使用10%数据时则持续超越现有基线方法为构建高效、可扩展的医学推理模型提供了全新路径。基本信息•文章标题Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data•发表时间2026年3月14日•研究单位华东师范大学、穆罕默德·本·扎耶德人工智能大学MBZUAI、莫纳什大学、上海人工智能实验室•Github地址https://github.com/mihara-bot/DIQ•论文地址https://arxiv.org/abs/2508.01450v3•算力描述所有训练在搭载4块NVIDIA A800 GPU的Ubuntu 22.04服务器上进行采用LoRA微调LoRA目标模块包含query、key、value投影LoRA秩设为8最大上下文长度为8192 tokens学习率为1×10−4并使用余弦衰减调度训练3个epoch。研究内容与方法一、医疗推理数据集预处理针对现有医疗推理数据集如Huatuo、FineMed、MedReason等进行统一格式转换将样本处理为包含问题文本、推理过程与答案的结构化数据确保后续难度评估与影响力计算的输入一致性。代码片段来自process_data.pydefprocess_medical_data(raw_data):processed_samples[]foriteminraw_data:sample{text:item[question]\nitem[reasoning],answer:item[answer]}processed_samples.append(sample)returnprocessed_samples二、DIQ框架概述DIQ是一种面向医疗推理的高效数据选择框架通过联合评估样本的难度得分与Dot影响力得分在二维空间划分象限并优先选择兼具临床复杂度与优化效用的样本实现小样本微调下的高效医疗推理。框架流程分为三步样本得分标注、象限划分、优先级选择。【DIQ框架流程图】三、难度得分计算1. 核心目的评估医疗样本的知识复杂度、推理复杂度与整体难度筛选具有临床价值的复杂推理样本。2. 实现逻辑难度分类器训练采用BiomedBERT作为基础模型在标注了知识Knowledge、推理Reasoning、整体Overall三个维度难度的医疗样本上微调每个维度难度为1-5分对应不同临床复杂度层级。代码片段来自difficulty.pydefpredict_difficulty(model,tokenizer,text):inputstokenizer(text,return_tensorspt,paddingTrue,truncationTrue)outputsmodel(**inputs)logitsoutputs.logits scorestorch.softmax(logits,dim1).tolist()[0]# 返回知识、推理、整体三个维度的得分returnscores[0],scores[1],scores[2]难度得分提取从分类器输出中选择指定维度默认选择Overall作为样本的最终难度得分公式为D(z)Dϕ(z),ϕ∈{K,R,O}D(z) D_\phi(z), \phi \in \{K, R, O\}D(z)Dϕ(z),ϕ∈{K,R,O}其中ϕ\phiϕ为选择的难度维度K知识、R推理、O整体。代码片段来自selection.pydefget_difficulty_scores(difficulty_model,tokenizer,samples,dimensionoverall):difficulty_scores[]forsampleinsamples:k_score,r_score,o_scorepredict_difficulty(difficulty_model,tokenizer,sample[text])ifdimensionknowledge:difficulty_scores.append(k_score)elifdimensionreasoning:difficulty_scores.append(r_score)else:difficulty_scores.append(o_score)returndifficulty_scores四、Dot影响力得分计算1. 核心目的评估样本对模型验证损失的优化效用筛选能有效降低验证损失的高价值训练样本。2. 实现逻辑梯度内积计算计算每个训练样本的梯度与验证集平均梯度的内积作为Dot影响力得分公式为Dot(z)1∣Dval∣∑z′∈Dvalg(z;θ^)⊤g(z′;θ^)\text{Dot}(z) \frac{1}{|D_{val}|} \sum_{z \in D_{val}} g(z; \hat{\theta})^\top g(z; \hat{\theta})Dot(z)∣Dval∣1z′∈Dval∑g(z;θ^)⊤g(z′;θ^)其中g(z;θ^)g(z; \hat{\theta})g(z;θ^)是样本zzz在预训练模型参数θ^\hat{\theta}θ^下的梯度DvalD_{val}Dval为验证集。高效降维优化采用随机投影降低梯度维度减少计算成本同时保留梯度排序信息确保大规模数据集下的计算效率。代码片段来自influence.pydefcompute_dot_influence(model,train_samples,val_samples,tokenizer,proj_dim4096):# 计算验证集平均梯度val_grads[]forsampleinval_samples:inputstokenizer(sample[text],return_tensorspt)outputsmodel(**inputs,labelsinputs[input_ids])lossoutputs.loss loss.backward()gradtorch.cat([p.grad.flatten()forpinmodel.parameters()ifp.gradisnotNone])val_grads.append(grad)model.zero_grad()avg_val_gradtorch.stack(val_grads).mean(dim0)# 随机投影矩阵降低梯度维度proj_matrixtorch.randn(avg_val_grad.shape[0],proj_dim)/np.sqrt(proj_dim)# 计算训练样本的Dot得分dot_scores[]forsampleintrain_samples:inputstokenizer(sample[text],return_tensorspt)outputsmodel(**inputs,labelsinputs[input_ids])lossoutputs.loss loss.backward()gradtorch.cat([p.grad.flatten()forpinmodel.parameters()ifp.gradisnotNone])# 投影后计算内积proj_gradgrad proj_matrix proj_avg_val_gradavg_val_grad proj_matrix dot_scoretorch.dot(proj_grad,proj_avg_val_grad).item()dot_scores.append(dot_score)model.zero_grad()returndot_scores五、象限划分与优先级选择1. 核心目的结合难度与影响力得分筛选兼具临床推理复杂度与模型优化效用的样本子集。2. 实现逻辑象限划分设定难度阈值τd\tau_dτd训练集难度得分的百分位数和Dot得分中位数mdotm_{dot}mdot将样本分为四个象限Q1高难度高影响力D(z)≥τdD(z) \geq \tau_dD(z)≥τd且Dot(z)≥mdot\text{Dot}(z) \geq m_{dot}Dot(z)≥mdotQ2低难度高影响力D(z)τdD(z) \tau_dD(z)τd且Dot(z)≥mdot\text{Dot}(z) \geq m_{dot}Dot(z)≥mdotQ3高难度低影响力D(z)≥τdD(z) \geq \tau_dD(z)≥τd且Dot(z)mdot\text{Dot}(z) m_{dot}Dot(z)mdotQ4低难度低影响力D(z)τdD(z) \tau_dD(z)τd且Dot(z)mdot\text{Dot}(z) m_{dot}Dot(z)mdot代码片段来自selection.pydefpartition_quadrants(difficulty_scores,dot_scores,tau_d0.7,m_dotNone):ifm_dotisNone:m_dotnp.median(dot_scores)# 难度阈值取tau_d对应的百分位数tau_d_valnp.percentile(difficulty_scores,tau_d*100)quadrants{Q1:[],Q2:[],Q3:[],Q4:[]}foridx,(d,dot)inenumerate(zip(difficulty_scores,dot_scores)):ifdtau_d_valanddotm_dot:quadrants[Q1].append(idx)elifdtau_d_valanddotm_dot:quadrants[Q2].append(idx)elifdtau_d_valanddotm_dot:quadrants[Q3].append(idx)else:quadrants[Q4].append(idx)returnquadrants优先级样本选择按照Q1→Q2→Q3→Q4的优先级顺序选择样本每个象限内按Dot得分降序排序若Dot得分相同则按难度得分降序排序直到达到目标样本比例rrr。代码片段来自selection.pydefselect_samples(quadrants,difficulty_scores,dot_scores,target_ratio):total_samplessum(len(q)forqinquadrants.values())target_numint(total_samples*target_ratio)selected[]# 优先级顺序Q1 Q2 Q3 Q4forq_namein[Q1,Q2,Q3,Q4]:iflen(selected)target_num:breakq_indicesquadrants[q_name]# 按Dot降序、难度降序排序sorted_indicessorted(q_indices,keylambdax:(-dot_scores[x],-difficulty_scores[x]))take_nummin(len(sorted_indices),target_num-len(selected))selected.extend(sorted_indices[:take_num])returnselected实验结果分析1. DIQ数据选择策略的总体性能表现DIQ方法在多个数据集和保留比例下均显著优于随机选择和基线方法。实验表明仅使用1%-10%的DIQ选择数据即可匹配甚至超越全量数据微调的性能。数据效率极高在FineMed数据集上仅1%的DIQ选择数据约170个样本就使Llama3.1-8B-Instruct的平均准确率AvgA达到41.46%远超全量数据训练的38.57%提升2.89个百分点。持续超越基线在Huatuo数据集上10%的DIQ选择数据约1,900个样本达到44.04%的AvgA超过所有基线方法如LESS的40.54%、Similarity的41.73%甚至优于全量数据训练的43.44%。标准任务提升显著在FineMed数据集1%保留比例下DIQ在标准任务平均准确率AvgS上达到58.14%相比全量数据训练的42.52%提升15.62个百分点。【Llama3.1-8B-Instruct在不同数据集和保留比例下的下游任务性能对比DIQ方法在多数设置下取得最佳结果】2. 临床推理质量与专家对齐评估DIQ选择的数据不仅提升了模型性能还显著改善了临床推理质量使其更贴近专家实践。通过LLM-as-a-judge评估DIQ在鉴别诊断、安全检查、证据引用三个关键维度均表现优异。数据层面质量提升DIQ-1%选择的数据子集在鉴别诊断DDx评分上达到4.39远高于全量数据剩余的3.59提升0.80证据引用EC评分4.77 vs 4.31提升0.46。模型推理对齐增强使用DIQ-1%数据训练的模型在鉴别诊断3.71 vs 3.66、安全检查3.30 vs 3.14和证据引用4.90 vs 4.75上均优于全量数据训练模型。案例验证在MedBullets-option5的临床病例中DIQ-1%训练的Qwen3-8B模型能够系统性地进行鉴别诊断DDx、安全检查SC和证据引用EC其推理过程与专家临床思维高度一致。【DIQ-1%数据与剩余数据、DIQ-1%模型与全量数据模型的临床价值对比DDx、SC、EC三个指标均按5分制评分】3. 消融实验与泛化能力验证DIQ的二维选择策略难度影响力优于任何单一维度的选择并且在不同模型规模和模型家族间展现出良好的泛化能力。二维策略优于单维度在1%保留比例下DIQ42.78% AvgA优于仅使用影响力42.67%、仅使用总体难度41.36%、仅使用知识难度41.59%和仅使用推理难度40.70%的单维度选择方法。10%保留比例下同样保持优势44.04% vs 43.16%/40.01%/41.89%/40.70%。跨模型家族泛化使用Llama3.1-8B计算的影响力分数应用于Qwen3-8B时在10%保留比例下仍取得47.62%的AvgA优于随机选择的45.51%提升2.11个百分点。跨模型规模泛化使用Qwen3-8B计算的影响力分数应用于Qwen3-14B时在1%/10%/50%保留比例下分别提升1.42/1.89/1.56个百分点应用于Qwen3-32B时提升0.45/2.41/2.64个百分点。【不同消融设置下Llama3.1-8B-Instruct的平均准确率对比DIQ在1%和10%保留比例下均优于单一维度选择方法】【使用不同来源影响力分数的DIQ在Qwen3系列模型上的下游任务性能DIQ能够跨模型规模和模型家族泛化】优势与局限优势高效数据选择DIQ通过联合评估样本难度与梯度影响仅需1%–10%的精选数据即可匹配或超越全量微调性能显著降低训练成本。临床推理对齐DIQ优先选择高难度-高影响力样本提升模型在鉴别诊断、安全检查和证据引用上的表现生成更贴近专家实践的推理过程。跨模型泛化性强DIQ在不同规模8B–32B和不同家族Llama、Qwen的模型上均有效且支持跨模型迁移和偏好学习DPO扩展。局限计算资源依赖DIQ需要为每个训练样本计算梯度内积尽管已采用随机投影降维但对大规模模型≥70B的计算开销仍需进一步验证。验证集依赖DIQ的性能受验证集大小影响较小验证集可能导致影响力估计不稳定需在成本与稳定性间权衡。跨家族迁移有限DIQ的跨家族迁移如Llama→Qwen在极低数据预算下可能表现不稳定需结合模型特定影响力或难度重加权来弥补差距。参考文献Supervised Fine-tuning (SFT) of the language backbone plays a pivotal role in adapting Vision-Language Models to specialized domains such as medical reasoning.Zhuang et al., 2025该论文提出了DIQ框架通过联合评估样本难度与梯度影响实现了仅用1%-10%精选数据即可匹配或超越全量微调性能是本研究数据高效微调策略的核心方法。Huatuogpt-o1, towards medical complex reasoning with llms.Chen et al., 2024该论文构建了大规模医学推理数据集HuatuoGPT-o1是本研究训练与评估所使用的核心数据来源之一为验证DIQ的数据选择有效性提供了基准。Lima: Less is more for alignment.Zhou et al., 2023该论文证明了少量高质量数据即可有效激发大模型的对齐能力启发了本研究“少即是多”的数据选择理念并作为DIQ框架的理论基础之一。LESS: Selecting influential data for targeted instruction tuning.Xia et al., 2024该论文提出了基于TracIn影响分数的数据选择方法LESS是本研究在实验部分对比的主要基线方法之一用于验证DIQ在医学推理场景下的优越性。Disentangling reasoning and knowledge in medical large language models.Thapa et al., 2025该论文提出解耦医学推理中的知识与推理难度是本研究DIQ框架中难度评估维度的直接来源为样本难度的多维度量化提供了方法论支持。