发布时间:2026/7/29 0:23:23
清华AIR与字节联手:只需0.58%的参数,AI推理能力竟然不降反升? 这项由清华大学人工智能产业研究院AIR与字节跳动Seed联合开展的研究于2026年7月发表在arXiv预印本平台论文编号为arXiv:2607.03065v1。有兴趣深入了解的读者可以通过该编号检索完整论文。假设你是一位音乐老师花了十年时间教会学生演奏各种乐器——钢琴、小提琴、吉他、长笛。每位学生都把这些乐器的基本演奏技巧刻在脑海里。某一天你希望让他们学会即兴演奏爵士乐。你有两种方式一种是让他们从头开始接受全新训练打乱原有的演奏习惯另一种是帮他们发现其实他们脑海里原本分散的那些技巧只需要换一种组合和搭配方式爵士乐自然而然就出来了。这篇论文讲的就是第二种方式——只不过主角不是学生而是大型语言模型也就是像GPT、DeepSeek这样的AI系统。研究团队发现当我们用强化学习训练一个AI模型去提升推理能力时真正有用的那部分改变其实早就藏在模型的记忆结构里了。他们把这个发现做成了一种后处理工具叫做**子空间对齐重连线**Subspace-Aligned Rewiring简称SAR——只需在训练完成后对模型做一次数学处理不用重新训练就能让模型表现更好、用更少的参数、还能在多个任务领域之间配合得更顺畅。一、先搞清楚问题所在AI越训练反而越死板要理解这项研究的价值得先明白当下AI训练面临的两个让人头疼的困境。第一个困境叫做推理饱和。当AI模型通过强化学习不断被训练去解数学题或者写代码时它会慢慢变得专一——它越来越擅长用固定的几种套路拿到高分但同时失去了灵活尝试不同方法的能力。用音乐来打比方这个学生练到后来只会一种风格的演奏给他听一首从没听过的曲子他就卡住了。在实际测试中这种现象叫做测试时扩展饱和——也就是说就算你让AI多生成几十个答案再从中选最好的它能达到的上限也很有限因为它的答案来来去去都是那几种套路。第二个困境叫做跨领域干扰。如果你想让AI同时擅长数学、写代码、回答问题最直觉的做法是把这三种任务混在一起训练。但麻烦在于这三种能力的训练方向往往互相矛盾——提升数学能力的参数更新可能会压制编程能力反过来也一样。就像一个乐手同时练古典和摇滚两种风格的肌肉记忆可能会互相干扰导致两种都练不精。这两个困境共同指向一个问题AI的训练过程像一个黑盒我们很难精确控制哪部分参数更新是真正有用的哪部分是噪音甚至有害的。研究团队由此提出了一个核心问题——能不能找到一个坐标系把真正有用的推理能力更新从无关甚至有害的更新里分离出来二、乐谱里藏着的秘密模型的原子技能研究团队给出的答案从一种叫做奇异值分解SVD的数学工具开始。这个名字听起来很学术但背后的思想其实非常直观。每一个AI模型的神经网络层本质上是一张巨大的数字表格数学上叫做矩阵。这张表格决定了当输入信息进来时模型如何把它变换成输出信息。奇异值分解这个工具能把这张表格拆解成三部分一组输入方向右奇异向量一组输出方向左奇异向量以及连接这两组方向的权重数字奇异值。用音乐的比喻来说可以把这三部分理解成右奇异向量是听到什么乐器声音的感知器左奇异向量是要输出什么音乐动作的执行器而奇异值则是把听到A乐器声音和做出A演奏动作连接起来的一对一映射关系。一个训练好的基础模型它的这套乐器感知器-演奏动作体系就是模型积累的原子技能库。在这套框架里原始的对角矩阵Σ只允许一对一的简单映射听到钢琴声输出钢琴动作听到小提琴声输出小提琴动作。每个技能是孤立的互不相关。但爵士即兴演奏需要的是什么它需要多对一的组合同时感知到钢琴节奏、贝斯线条、鼓点然后综合判断输出一个和声织体。这种多个输入方向共同激活一个输出方向的能力正是复杂推理的核心。研究团队发现当我们用强化学习训练AI之后模型参数的变化放在这套坐标系里看恰好体现为一个重连线矩阵Rewiring Matrix用字母M表示。这个矩阵不再是对角的而是有丰富的非对角元素——这些非对角元素正是把原本孤立的技能方向重新连线、让它们协同工作的结构。矩阵M中的对角元素只是把某个原有技能放大或缩小并不会创造新的联系而非对角元素才是真正让模型能够把多个前提条件综合成一个结论的推理机制。这与人类思维中的关系推理高度相似——不是简单地看到X想到Y而是同时看到X、Y、Z三个线索综合推断出结论W。三、SAR是怎么工作的一次精准的乐谱精炼基于以上发现研究团队提出的SAR方法操作逻辑相当简洁可以用精炼乐谱来理解。训练完成之后我们拿到的是完整的强化学习更新量ΔW原始的全套新乐谱。这份乐谱里有真正有价值的内容但也掺杂了大量冗余的、甚至有干扰性的音符。SAR做的事情就是用基础模型的奇异向量坐标系作为滤网把这份更新量过滤一遍只保留那些在基础模型原有坐标系内可以表达的部分丢弃那些跑出了原有坐标系之外的部分。具体操作分为六步。第一步是对基础模型的权重矩阵做奇异值分解得到左右奇异向量U和V。第二步是计算强化学习前后的参数差ΔW。第三步是从ΔW中提取排名最靠前的k个低秩成分相当于先粗筛一遍只保留最主要的变化方向。第四步是把这个低秩成分投影到基础模型的坐标系里得到重连线矩阵M。第五步是用U和M以及V重建出精炼后的更新量ΔW*。第六步是把ΔW*加回基础模型得到SAR处理后的模型。整个过程不需要任何新的训练不需要额外数据不需要修改原有的训练目标计算量也相当低。它只是一次针对已训练参数的数学后处理。四、核心发现一用0.58%的参数保住99%以上的推理能力这一部分的实验结果可能是整篇论文最令人印象深刻的地方。研究团队在多个不同大小的模型上测试了SAR的效果包括1.5B参数的DeepScaleR、4B参数的POLARIS、7B参数的OLMo-3.1-7B以及32B参数的OLMo-3.1-32B-Think。评测基准选用的是AIME数学竞赛题2024和2025年版本这是目前公认对推理能力要求极高的测试集。最核心的发现是对于1.5B的DeepScaleR只需要保留基础模型顶部1%的奇异向量坐标对应的重连线矩阵M只占模型总参数量的约0.58%就能让SAR处理后的模型在数学推理上与完整强化学习模型几乎持平。对于32B的OLMo-3.1-32B-Think同样只需1%的奇异坐标对应约0.64%的参数量就能保住原始强化学习训练带来的推理增益。4B的POLARIS稍微需要多一点需要保留10%的坐标但仍然远比完整参数少得多。用具体数字来说在AIME 2024上1.5B的DeepScaleR完整强化学习版本AVG32每道题生成32个答案取平均是40.31%而SAR 1%版本是40.21%差距几乎可以忽略不计Pass3232个答案里至少一个正确的概率两者都是76.67%完全一致。对于从零基础出发、不是专门为数学优化的OLMo-3-7B-Base情况稍有不同——它需要30%的奇异坐标才能充分恢复强化学习带来的推理能力。研究团队对此的解释也很合理如果基础模型本身已经练过基本功那强化学习只需要调整连线方式一小部分坐标就够了如果基础模型的原子技能库相对薄弱强化学习需要动用更多坐标来做出更大范围的重连线。这个发现意味着什么意味着强化学习带来的真正有用的推理能力提升并不是均匀分散在所有参数里的而是高度集中在基础模型的少数几个奇异坐标上。大量的参数更新对于最终的推理表现来说其实是冗余甚至有噪声的。五、核心发现二去掉噪声之后AI反而能探索得更远这个发现在某种程度上更让人意外SAR处理后的模型在高采样数量下的表现竟然超过了完整的强化学习模型。研究团队测量的指标叫做Passk——给每道题生成k个答案只要有一个答案正确就算通过。k越大对模型探索能力能不能生成多样化的正确答案路径的要求就越高。实验结果显示在AIME 2024上完整的DeepScaleR强化学习模型随着k增大Passk的提升速度会越来越慢出现明显的探索饱和。而SAR处理后的模型虽然在k1时与完整模型几乎一样Pass1都约为40%但随着k增大它的提升速度更快——到k2时就超过完整模型并且在更大的k值下保持领先。在256次采样的覆盖率测试中SAR模型能解决AIME 2024中26道题而完整强化学习模型只能解决25道。32B的OLMo-3.1-32B-Think也呈现完全相同的规律SAR在k4时越过完整强化学习模型的Passk曲线之后持续领先。为什么会这样研究团队给出的解释是完整的强化学习更新中除了真正的推理重连线之外还包含一些残差方向——这些方向虽然没有直接损害单次准确率但会让模型倾向于反复生成相似的答案路径从而压缩了有效的探索空间。SAR去掉了这些残差方向让模型保留了原始的多样性因此在多次采样时能够覆盖更多不同的解题路径。六、核心发现三代码能力被压住了SAR帮它重见天日研究团队还把SAR应用到了混合领域强化学习Mix-RL场景结果揭示了一个有趣的现象多领域同时训练时某些能力会被其他领域的训练压制而SAR能把这些被压制的能力释放出来。实验对象是OLMo-3.1-32B-Think这个模型是在数学推理、编程、指令跟随、对话等多个领域同时进行强化学习训练的。理论上多领域联合训练应该让模型在所有领域都表现良好但实际上由于不同领域的参数更新方向存在冲突往往会有此消彼长的现象。SAR只保留了该模型奇异坐标系里前1%的重连线部分。结果令人惊喜在编程领域SAR处理后的模型在LiveCodeBench v5测试集上从67.61%提升到69.09%在v6测试集上从64.30%提升到65.25%——这是在完整强化学习训练已经完成的基础上仅通过后处理就实现的提升说明原本的混合训练中编程能力确实被其他领域的训练方向压制了一部分。与此同时数学推理能力基本保持不变AVG32误差在1%以内指令跟随能力IFEval测试从92.42%微降至92.05%几乎没有损失。更关键的是数学探索能力明显增强AIME 2025的Pass16从88.33%提升到91.71%。用刚才的音乐比喻来说这个学生被要求同时练古典、摇滚和爵士结果爵士被另外两种风格盖住了。SAR做的事情就是帮他把三种风格里共同的、最基础的音乐感知能力提炼出来去掉三种风格之间互相干扰的部分让他在爵士领域反而能发挥得更好同时古典和摇滚也没有退步。七、核心发现四把数学专家和编程专家合体结果超越了两个单独专家最后一个实验场景也是最能体现SAR在实际应用中潜力的一个场景把两个分别在不同领域训练的专家模型合并成一个能不能让合并后的模型在两个领域都表现优异传统的模型合并方法如Task Arithmetic、TIES、DARETIES的逻辑大体上是把两个模型的参数更新量按照某种规则加权叠加。但问题在于两个模型的参数更新量方向往往不兼容简单叠加会引发干扰导致合并后的模型反而不如其中一个单独的专家。研究团队在两个规模下做了测试。在1.5B规模基础模型DeepSeek-Distill-Qwen-1.5B上数学专家是DeepScaleR编程专家是Archer-Code。在14B规模基础模型DeepSeek-Distill-Qwen-14B上数学专家是OpenReasoner-Zero编程专家是DeepCoder。SAR的做法是先对数学专家的参数更新量做奇异坐标投影提取出紧凑的数学推理重连线矩阵M然后把这个精炼后的更新量叠加到编程专家上。结果在两个规模上都呈现出一个规律SAR合并后的模型在数学和编程两个领域的主要指标上都超过了两个单独专家中的最佳者。在1.5B规模上数学上的AIME AVG32达到43.44%超过了数学专家DeepScaleR的40.31%编程上的LiveCodeBench AVG8达到32.25%超过了编程专家Archer-Code的31.80%。在14B规模上SAR合并模型的数学表现74.38%同样超过数学专家74.27%编程表现63.40%超过编程专家61.00%。反观传统方法Task Arithmetic它直接把两个完整的参数更新量叠加结果数学能力大幅下滑1.5B规模下AIME AVG32只有36.25%Pass32降到63.33%说明未经精炼的参数更新量之间存在严重冲突。TIES和DARETIES有所改善但在大多数指标上仍不及SAR。用音乐比喻来说传统方法是把古典乐手和爵士乐手的全套演奏习惯强行叠加结果两种风格互相干扰谁都演奏不好。SAR则是先从古典乐手的演奏习惯里提炼出最核心的音乐感知能力再把这部分精华叠加给爵士乐手——结果这位乐手不仅保住了爵士演奏水平连古典曲目也能弹得更好了。八、SAR什么时候最有效什么时候会遇到边界研究团队也坦诚地讨论了SAR不是万能的情况这让整个研究的评估更加可信。SAR最有效的场景是当强化学习的作用主要是激发和重组基础模型里本来就有的能力时。在这种情况下奇异坐标系里原有的原子技能已经足够强化学习只需要改变它们之间的连线方式SAR就能精确提取这部分改变。但有几种情况下SAR的效果会打折扣。第一种是训练时间特别长的深度优化场景——研究团队测试了一个训练超过4000步的JustRL模型发现SAR投影后确实能恢复约43%的AIME 2024得分接近DeepScaleR水平但无法完全追上这个模型最终约52%的得分。这说明在长时间优化后有一部分参数变化已经超出了重连线的范畴开始真正改写基础模型的知识结构这部分SAR就无法捕捉了。第二种是直接从基础模型出发做代码强化学习的场景。代码能力的习得不只是推理能力的重组还涉及代码语法规范、函数接口格式、标准输入输出处理等执行协议这些在基础模型里并没有完善的基础。SAR对这类情况的压缩效果明显不如数学推理场景。但有一个有趣的发现如果先做代码监督微调SFT建立基础再做强化学习此时强化学习的更新就变得与奇异坐标系更加兼容SAR也能有效提炼。第三种是使用PPO等外部价值模型做密集奖励强化学习的场景。外部价值模型带来的梯度方向与基础模型奇异坐标系的对齐程度不如稀疏结果奖励信号因此SAR在这类训练方式上的效果也相对弱一些。九、消融实验证明精炼的价值不只是压缩为了排除SAR的效果只是因为参数更少更不容易过拟合这一种解释研究团队设计了一系列对比实验直接戳穿了这个疑虑。第一个对比是不投影控制——用同样的低秩提取但不把提取出来的更新量投影回基础模型的奇异坐标系直接加回去。结果显示在单次准确率Pass1上不投影控制与SAR相近但在高采样数量下的探索表现Pass32及以上上不投影控制明显比SAR差并且在跨领域合并实验里不投影版本虽然保住了编程能力但数学推理大幅下滑而SAR在两个领域都提升了。第二个对比是随机投影控制——用随机生成的奇异向量替代基础模型的真实奇异向量做投影。结果是Pass1虽然比基础模型稍好但远不如SAR说明用基础模型真实的奇异向量坐标这一点不可或缺不能换成任意低维坐标系。第三个和第四个对比是只保留重连线矩阵M的对角元素只做技能放大缩小或者只保留非对角元素只做跨技能连线。只保留对角元素时Pass1大幅下滑30.73% vs 完整强化学习的40.31%说明单纯调整技能权重并不够。只保留非对角元素时Pass1能恢复到38.54%但Pass32下降说明跨技能连线承担了推理的主要信号但配合对角调整效果更完整。这些对比实验共同指向一个结论SAR的效果来自于用基础模型的真实奇异坐标系做精准投影这个核心机制而非简单的参数压缩或低秩近似。十、在实际应用场景中的表现代码智能体基准测试研究团队还在一个内部in-house模型上做了实际代码智能体场景的测试进一步验证SAR的实用价值。他们在7个公开的代码智能体基准测试上对比了基线模型和SAR处理后的模型测试类型涵盖了GitHub问题修复SWE-Bench系列、多语言代码修复MSWE-Bench和命令行终端任务TerminalBench。结果是7个基准中有6个得到了提升平均提升幅度为2.52%最大提升出现在TerminalBench 2.0上提升幅度高达25.10%从0.194到0.243。只有MSWE-Bench的CodeAct智能体版本出现了微小下滑-0.33%几乎可以视为波动范围内。这个结果说明SAR不仅在学术数学测试集上有效在实际的工程应用场景中同样能发挥作用。说到底这项研究告诉我们一件很有意思的事AI的推理能力或许并没有我们以为的那样神秘。它很大程度上是把基础模型里本来就存在的技能碎片重新连接组合的过程。而强化学习整个训练过程所产生的大量参数变化中真正在做这件有意义的事情的只是其中极小的一部分——最少只有0.58%的参数。其余的大部分变化要么是冗余的要么是在不同任务领域之间互相干扰的噪声。这意味着我们或许不需要用那么大的代价去追求AI的能力提升。一次精准的后处理精炼不改变训练过程不需要新数据在几分钟内就能完成却能让模型表现得更好、探索能力更强、跨领域兼容性更高。这为未来构建多能力AI系统提供了一条成本更低的路径先分别训练各个领域的专家模型再通过SAR把每个专家的精炼推理核心提取出来合并成一个在多个领域都表现优异的统一模型。有兴趣深入了解技术细节的读者可以通过arXiv:2607.03065v1查阅完整论文包括所有的消融实验、实现细节和扩展分析。QAQ1SAR处理之后的模型参数变少了会不会导致某些能力变弱A这是一个很关键的疑问。实验结果显示SAR保留的是基础模型奇异坐标系内的精炼更新部分而不是随机删减参数所以它的效果并不等同于压缩。在数学推理上SAR处理后的模型保留了超过99%的强化学习训练增益在混合领域场景中数学和指令跟随能力几乎没有损失编程能力反而提升了。只有在基础模型原本不具备相关技能的领域如直接从零做代码强化学习SAR的效果才会相对有限。Q2SAR和LoRA这类低秩适配方法有什么本质区别ALoRA是在训练阶段把参数更新限制在低秩结构里相当于在练琴时就只练特定的指法组合。SAR则是在训练完成之后把已经完成的全量训练的参数变化投影到基础模型的奇异坐标系里——它不改变训练过程而是对训练结果做后处理。更重要的是SAR提炼出来的是与基础模型坐标系对齐的低秩更新而不是任意低维结构这让它在探索能力和跨领域迁移上都优于单纯的低秩提取。Q3SAR能用在中文大模型或者其他语言的模型上吗A从方法本身来看SAR对语言没有假设它依赖的只是模型权重矩阵的奇异值分解这在任何语言的Transformer架构模型上都可以做。研究团队测试的模型包括基于Qwen千问架构的DeepSeek系列和OLMo系列其中Qwen本身就是一个中文能力很强的模型家族。所以理论上SAR完全可以应用于中文大模型只要该模型经历了强化学习的后训练过程。

相关新闻

2026/7/29 0:12:59

Sunshine游戏串流服务器完整指南:3步打造家庭云游戏系统

Sunshine游戏串流服务器完整指南:3步打造家庭云游戏系统 【免费下载链接】Sunshine Self-hosted game stream host for Moonlight. 项目地址: https://gitcode.com/GitHub_Trending/su/Sunshine Sunshine是一款开源自托管的游戏串流服务器,它能让…

2026/7/29 1:18:26

如何3步完成Palworld存档编辑:免费开源工具终极指南

如何3步完成Palworld存档编辑:免费开源工具终极指南 【免费下载链接】palworld-save-tools Tools for converting Palworld .sav files to JSON and back 项目地址: https://gitcode.com/gh_mirrors/pa/palworld-save-tools 你是否曾想过完全掌控《幻兽帕鲁》…

2026/7/29 1:18:26

国内GEO优化工具怎么选?新手友好平台实测推荐

随着生成式 AI 搜索普及,GEO(生成式引擎优化)成为品牌线上获客的核心赛道,不少新手运营、中小企业、营销服务商想要入局,却不清楚如何挑选适配自身需求的工具。结合多平台实测体验、各产品原生技术能力与落地实操表现&…

2026/7/29 1:18:26

3步搞定OpenCore黑苹果安装:Windows用户终极指南

3步搞定OpenCore黑苹果安装:Windows用户终极指南 【免费下载链接】OpenCore-Install-Guide Repo for the OpenCore Install Guide 项目地址: https://gitcode.com/gh_mirrors/op/OpenCore-Install-Guide 想要在普通PC上体验macOS的魅力吗?OpenCor…

2026/7/29 1:13:26

计算机毕业设计之基于SpringBoot的党员学习交流平台的设计与实现

随着党员学习交流的推进,该系统成为促进党员学习交流发展的重要工具。为此开发了党员学习交流平台,以满足该用户的需求。 本研究构建了一个基于SpringBoot和Vue技术的党员学习交流平台,该系统与MySQL数据库紧密集成,以实现多角色…

2026/7/28 13:41:25

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/29 0:02:56

商标注册找代理还是自己办?算清这笔“时间账”和“风险账

商标注册,找代理还是自己办?帮你算清这笔“时间账”和“风险账”“商标注册,找代理还是自己办?”这是深圳每个创业者都会遇到的灵魂拷问。有人说找代理是花冤枉钱,有人说自己办风险太高。到底哪种更划算?本…

2026/7/29 0:02:56

免费开源RPA工具OpenRPA:企业级自动化流程的终极解决方案

免费开源RPA工具OpenRPA:企业级自动化流程的终极解决方案 【免费下载链接】openrpa Free Open Source Enterprise Grade RPA 项目地址: https://gitcode.com/gh_mirrors/op/openrpa 你是否厌倦了每天重复枯燥的数据录入和报表整理工作?是否希望有…

2026/7/29 0:02:56

KMS智能激活工具:一站式解决Windows和Office激活难题

KMS智能激活工具:一站式解决Windows和Office激活难题 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 还在为系统弹出激活提示而烦恼吗?KMS智能激活工具能够帮你彻底告别W…

2026/7/28 4:38:09

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…