北京大学联合快手团队提出“灯塔“模型

发布时间:2026/9/30 17:10:10

北京大学联合快手团队提出“灯塔“模型 这项由北京大学、快手团队、香港科技大学广州、中文大学、浙江大学和清华大学联合完成的研究以预印本形式发布于2026年7月30日论文编号为arXiv:2607.28595。感兴趣的读者可通过该编号查阅完整论文。你有没有遇到过这样的情况请一个助手帮你查资料结果他不管什么问题都先翻出一大堆工具折腾半天给出的答案反而比直接回答还差或者反过来明明面对一道极其复杂的数数题却偏偏不肯动手算就靠肉眼瞎猜猜错了也不知道这正是当前人工智能视觉助手普遍存在的困境。研究团队把这个问题比作两种失职的员工一种是工具控不管什么鸡毛蒜皮的小事都要搬出工具箱折腾半天反而出错另一种是裸奔选手明明有工具可以用偏偏靠感觉硬扛遇到真正需要精确计算的任务就露了馅。研究团队正是为了解决这个知道什么时候该用工具的核心难题提出了名为Beacon中文可理解为灯塔的全新模型。一、工具用多了和用少了都是问题以当前最流行的多模态大语言模型为例这类系统能看图说话、回答问题、甚至写代码。为了处理更复杂的视觉任务研究者会给模型配备一套工具箱——比如放大镜图像裁剪、标注笔画框标记、计算器数值计算等。通过调用这些工具模型理论上可以处理肉眼难以分辨的细节。然而研究团队在仔细分析了多个代表性的前沿模型后发现了一个令人意外的现象给模型配备工具并不意味着模型就会变得更聪明甚至有可能越用越糟糕。打个比方一道简单题——图里的天气是晴天还是阴天——本来直接看图就能秒答但某些模型偏偏要先写一段代码裁剪图像、调用工具折腾一大圈最终答案没变时间和计算资源白白浪费了。更糟糕的是工具调用过程中一旦出错代码bug、坐标算偏等原本能答对的题反而答错了。这就是研究团队所说的工具伤害——工具的使用在本不需要它的地方制造了新的错误。与此同时对于真正困难的任务——比如轨道上有多少颗蓝色弹珠这类需要精确数数的视觉任务——很多模型却又不知道主动调用工具靠视觉估算猜一个数字大概率猜错。这就是工具收益不足的问题工具本来大有用武之地模型却没有抓住机会。研究团队把这两种能力分别定义为模式适应性Mode Adaptiveness和工具效果Tool Effect。前者考察的是模型能否根据题目的难易程度灵活选择直接回答还是先用工具后者衡量的是工具使用究竟是帮了忙还是帮了倒忙。这两个维度构成了整项研究的核心框架。二、研究团队是怎么量化聪明程度的要评判一个模型在工具使用上表现好不好不能只看最终答题的准确率因为那个数字掩盖了太多细节。研究团队设计了一套更精细的测量体系。具体做法是对每道题不是只问一次而是连续问五次并且强制模型在这五次里不许使用任何工具看看它纯靠文字推理能答对几次。如果五次里有四次或以上都答对了就把这道题标记为文本简单题如果五次里只有零次或一次答对就标记为文本困难题介于二者之间的题目太模糊直接剔除不参与分析。这个设计非常巧妙就好比给一个人出一道题不是问他一次就判断而是连续测试五次看他是真的懂还是偶尔蒙对。有了这个分类之后研究团队再让模型在允许使用工具的情况下回答这些题目记录模型是否主动调用了工具以及最终答对没有。由此衍生出几个关键指标模型在文本简单题上有多少比例不动工具叫做MAtext越高越好说明模型懂得在不必要时省力气模型在文本困难题上有多少比例主动调用了工具叫做MAtool越高越好说明模型在真正需要帮助时知道求助工具帮助模型在困难题上答对的比例叫做Tool-Gain越高说明工具越有价值工具在简单题上把原本答对的题搞错的比例叫做Tool-Harm越低越好。研究团队用这套体系评测了四款代表性的前沿模型Thyme、DeepEyesV2、CodeV和Metis。结果出乎意料地一致这四款模型几乎都在模式适应性上表现糟糕——不是几乎所有题都去调工具就是几乎所有题都不调工具缺乏根据题目难易灵活切换的能力。更关键的是这些模型的Tool-Gain和Tool-Harm几乎旗鼓相当意味着工具帮你解决了一些难题但同时也在容易的题上犯了差不多数量的错净收益几乎为零。允许使用工具之后这些模型的平均准确率和强制不用工具时几乎没有差别。这一发现直接揭示了问题的根源当前的训练方式根本没有给模型足够的信号去学习什么时候该用工具也没有有效地增强模型在最困难任务上通过工具解决问题的能力。三、灯塔模型是怎么诞生的Beacon的训练分为两个阶段就像先教会一个学生基本技能再通过实战演练让他变得更聪明、更懂分寸。第一阶段是打基础监督微调SFT。研究团队从16个公开数据集里收集了超过21万道题涵盖数学几何、图表理解、高分辨率感知、空间推理、知识问答等多个方向。他们先让基础模型Qwen3-VL-8B回答这些题目筛选出那些基础模型答不好的困难题目再让强大的Gemini 3.1 Pro为这些题目生成带有Python代码调用的完整解题轨迹只保留最终答对的轨迹。光有正确答案还不够因为Gemini生成的轨迹可能也存在冗余的工具调用、代码没真正帮上忙就直接靠猜答题等问题。于是团队又用Gemini对这些轨迹进行了二次精炼剔除工具没有真正发挥作用的轨迹、删掉重复无意义的步骤、补充缺失的观察分析。最终保留了约1.57万条高质量的有工具调用的解题轨迹同时混入了一些基础模型本来就能直接答对、不需要工具的题目防止模型被过度训练成什么都用工具的习惯。第二阶段是实战磨砺强化学习RL。研究团队在第一阶段的SFT模型基础上针对那些即便经过SFT训练仍然难以解决的题目进行了强化学习。这一阶段包含两个核心设计也是整个Beacon最独特的地方。四、必要性感知奖励教会模型何时该动手第一个核心设计叫做必要性感知自适应奖励Necessity-Aware Adaptive RewardNAAR。普通的强化学习训练方法通常只管答对了就给奖励答错了就扣分完全不考虑模型是靠工具答对的还是靠直接推理答对的。这就好比老师批改作业时只看答案对不对不管学生是认真计算还是偷看答案抄来的——长此以往学生就不知道什么时候该老老实实自己算什么时候才需要借助参考资料。NAAR的设计逻辑是先判断当前这组回答里有没有纯靠文字推理就答对的情况。如果有说明这道题靠自己就能搞定那么直接答对的回答得满分而用了工具才答对的回答只得四分之一的分。注意用工具答对的情况不是零分因为它毕竟是正确答案有一定参考价值只是分数打折传递这种情况你本可以不用工具的信号。反过来如果这组回答里根本没有靠纯文字推理答对的说明这道题对模型来说是真正的难题那么用工具答对的就给满分鼓励模型在真正需要的时候积极调用工具。这个奖励机制还有一个关键优势它是基于模型自身当前能力动态标注的而不是让一个外部老师模型来预先判断哪些题需要工具。这样就避免了学生的能力和老师的能力不匹配的尴尬——因为老师可能觉得简单的题学生不一定也觉得简单。五、提示引导能力扩展突破模型能力的天花板第二个核心设计叫做提示引导能力扩展Hint-Guided Capability ExpansionHCE。强化学习有一个著名的瓶颈如果一道题对模型来说实在太难模型在一批次内生成的所有回答全都是错的那这一批次的训练就完全浪费了。因为强化学习的核心机制是比较一组回答的好坏如果所有回答都是错的大家同样差就没有什么可以学习的梯度信号就像一群考生都考了零分老师完全不知道谁比谁稍微好一点点。然而这些最难的题目恰恰是模型最需要突破的地方也是工具使用最能发挥价值的场景。就这么放弃太可惜了。HCE的解法是当一道题被标记为全军覆没之后先请Gemini 3.1 Pro生成一条正确的完整解题轨迹然后从这条轨迹中提取出关键的推理步骤和工具使用策略转化为一段提示Hint——注意提示里只包含解题方向和中间目标绝对不包含最终答案。然后把这段提示附加到原始问题后面让正在训练的模型重新尝试看看有没有能够在提示的帮助下答对的回答。举个例子原来的问题是这场羽毛球比赛的当前比分是多少如果球落在红圈里新比分会怎样变化模型完全没有头绪全部答错。专家给出的提示是第一步裁剪比分板区域和红圈位置第二步根据出界规则计算新得分并找出赛事年份。有了这个提示模型在重新尝试时会去学习专家推荐的工具调用思路从而有机会答对。更巧妙的是在用提示生成的正确轨迹来更新模型参数时研究团队会把提示从输入里悄悄去掉——只保留模型在有提示帮助下产生的行为轨迹但告诉模型你当时面对的是没有提示的原始问题。这样训练出来的模型就把在提示辅助下学到的工具使用技巧内化成了自己在没有任何提示时也能自主运用的能力。效果相当于老师带着学生做了一遍下次学生就能自己做了不再需要老师帮忙。六、实验结果灯塔照亮了多远研究团队在13个不同的视觉推理基准测试上全面评测了Beacon这13个测试涵盖了高分辨率视觉搜索比如在密集图像中找到特定目标、空间感知推理判断物体之间的相对位置关系、数学图表理解、组合推理和代理任务等各种类型。在整体性能上Beacon在13个测试中的11个位列所有开源模型第一平均得分58.98%比基础模型Qwen3-VL-8B-Instruct提高了约6个百分点也超过了同等规模的其他所有前沿系统。相比之下第二名Metis的平均得分是56.67%差距明显。在工具使用的适应性方面研究团队特别绘制了一张图横轴是纯文字模式下答对次数代表题目的难易程度纵轴是实际调用工具的比例。对于真正聪明的模型这条曲线应该是向右下方倾斜的——越容易的题工具调用比例越低越难的题工具调用比例越高。在被测试的五个模型里只有Beacon呈现出这种理想的趋势对于五次都能答对的简单题Beacon调用工具的比例较低而对于基本答不对的困难题Beacon几乎次次都会调用工具。其他模型的曲线则基本上是平的说明它们完全不根据题目难易来决定是否用工具。在工具效果方面Beacon的Tool-Gain达到9.3%Tool-Harm为6.2%净收益Tool-Gain减去Tool-Harm为3.1个百分点是所有模型中最大的正差值。相比之下Thyme的工具净收益几乎是负数DeepEyesV2和Metis也基本打平说明在这些模型上工具几乎没有带来实质性的进步。在文本保留率即用了工具之后原来靠文字就能答对的题还有多少比例保住了正确方面Beacon达到91%远高于其他模型说明工具的引入基本上没有破坏原本就能正确解答的能力。七、消融实验揭示的规律为了搞清楚哪些设计真正起到了作用研究团队还做了一系列拆零件实验依次去掉NAAR和HCE观察性能变化。实验结果显示单纯用普通的GRPO强化学习没有NAAR没有HCE模型的工具使用净收益仅有1.4个百分点整体准确率57.1%。加入NAAR之后模式适应性指标MAmean从56.3%提升到了59.7%工具净收益提升到2.54个百分点整体准确率小幅提升至57.75%。单独加入HCE之后工具净收益提升到2.96个百分点说明HCE主要在强化工具真正帮上忙这个方向。两者同时使用整体准确率达到58.98%工具净收益最高3.14个百分点两项指标互相促进。研究团队还分析了训练过程中各项指标的动态变化曲线。一个关键发现是在整个强化学习训练过程中使用文字回答和使用代码回答的比例始终保持稳定没有明显的漂移——模型并不是简单地越来越偏向某种回答方式。真正在提升的是推理模式与题目类型的匹配准确率也就是说模型逐渐学会了识别题目性质并据此选择合适的模式而不是无脑偏向其中一种。在HCE的效果上研究团队统计了所有全军覆没组所有回答都错的训练题目中经过提示引导的再次尝试有多少比例成功被救活至少出现一个正确回答。结果显示约有40%的全军覆没组得到了有效转化从完全没有学习价值的数据变成了有用的训练信号这对于提升模型在最困难任务上的工具使用能力贡献显著。研究团队还描述了几个生动的案例在第一个案例中面对轨道上有多少颗蓝色弹珠的问题Beacon先获取图像尺寸再通过像素级蓝色区域检测和连通分量算法数出22颗完全正确。在第二个案例中面对图中有多少辆白色汽车的街景照片Beacon通过多次裁剪中景和远景区域逐步锁定每辆车的颜色最终判断出2辆白色车答对选项B。在一个使用提示引导的案例中面对这场羽毛球比赛的新比分是多少这道需要同时识别比分板、判断红圈位置、理解出界规则的复合题Beacon按照提示提供的步骤依次裁剪比分区域、用辅助线标注球场边界最终正确判断出红圈在边线外、球出界、新比分为IND 1:20对TPE 0:16并识别出比赛年份为2023年。说到底Beacon的核心贡献不在于发明了什么前所未有的全新技术而在于清晰地定义了一个此前被忽视的问题——工具使用的智慧性并提出了可操作的解决方案。知道什么时候该动手、动手之后真的有帮助这才是工具真正的价值所在。对于未来的多模态AI系统来说与其追求工具的数量和调用的频率不如先把知道何时该用、用了真有效这个基本功练扎实。这项研究还提示了一个有趣的思考方向当我们评价一个AI系统有多聪明时或许不应该只看它能做什么更要看它知不知道自己的局限在哪里、能不能在需要外援时主动寻求帮助而不是硬撑。这种元认知能力可能正是人工智能走向真正实用的关键一步。有兴趣深入了解细节的读者可以通过arXiv编号2607.28595找到这篇完整论文里面包含了完整的提示词设计、数据统计、训练参数设置和更多案例分析。---QAQ1Beacon模型和普通的视觉AI有什么不同A普通视觉AI通常要么总是调用工具要么从不调用缺乏根据题目难易灵活判断的能力。Beacon通过必要性感知奖励训练机制让模型学会在简单问题上直接作答在真正困难的问题上才调用代码工具从而减少不必要的错误并提升复杂任务的解决率。Q2Beacon的提示引导能力扩展在训练时是怎么起作用的A当模型对某道题完全不会做时系统会请更强的Gemini模型生成一段解题提示只提供方向和步骤不含答案让模型借助提示练习工具使用技巧。训练时再悄悄去掉提示只保留学到的行为轨迹让模型在没有提示的正常情况下也能复现这些技能。大约40%原本全部答错的题目经过这个机制得到了有效利用。Q3Beacon在哪些任务类型上提升最明显ABeacon在需要精细视觉操作的任务上提升最为突出比如高分辨率图像搜索、图表理解、计数推理和组合推理等平均比基础模型提升约6个百分点。在ChartQAPro图表问答上提升了约17个百分点在视觉谜题和竞技问答类任务上也有10个百分点左右的提升。
延伸阅读

更多相关文章

2026/9/30 17:10:02

AI原生组织转型:跨越认知、组织与实施三大鸿沟

1. 从“口号”到“现实”:AI原生组织的理想与现实鸿沟最近和几个不同行业的朋友聊天,发现一个挺有意思的现象:几乎每个人都在说自己的公司要搞“AI转型”,要成为“AI原生组织”。从科技大厂到传统制造业,从金融到零售&…

2026/9/27 1:44:37

AE新手入门全攻略:从零掌握动态图形与视频特效核心技能

很多刚接触视频特效和动态图形设计的朋友,面对 After Effects(简称 AE)这个庞然大物时,常常感到无从下手。网上教程要么太零散,要么过于深奥,或者需要付费才能看到核心内容。本文旨在为你提供一份系统、完整…

2026/9/30 17:09:38

华为 MetaERP 的总账(GL)不是“把 Oracle/SAP 的 GL 抄一遍”,而是用云原生 + 元数据驱动 + 事件驱动会计把传统“子账→接口表→总账批处理”重构为“业务事件→会计引擎→多账

华为 MetaERP 的总账(GL)不是“把 Oracle/SAP 的 GL 抄一遍”,而是用云原生 元数据驱动 事件驱动会计把传统“子账→接口表→总账批处理”重构为“业务事件→会计引擎→多账簿实时入账”。下面按你要的四块讲:设计哲学 → 核心模…

2026/9/30 17:04:37

等保说的内外网隔离,要隔到什么程度才算过关

等保体系里的「内外网隔离」,不是拔网线,是国标 22239《信息安全技术 网络安全等级保护基本要求》规定的一组控制项。很多单位以为装个防火墙就算隔离,测评时在边界防护、访问控制、安全审计三处被扣分。先拆解隔离在等保里落在哪。国标 2223…

2026/9/29 11:07:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/29 21:48:03

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 0:01:22

MATLAB+Yalmip+CPLEX实战:综合能源系统优化调度全流程解析

做综合能源系统优化调度这活儿,最痛苦的不是建模本身,而是模型写完之后不知道该怎么求解。看论文里轻飘飘一句“采用Yalmip调用CPLEX求解”,自己上手时却往往卡在环境配置、变量声明、约束写法和求解状态判读上,一耗就是两三天。这…

2026/9/30 0:01:22

I3C比I2C快10倍?RK3576实战:速率、DTS配置与混合总线避坑指南

I3C 比 I2C 快 10 倍?这句话在嵌入式群里传了很久,每次都能吵出一堆截图。前段时间我正好在 RK3576 上调板级 I3C 接口,从控制器寄存器一路摸到 Linux DTS 配置,踩了不少坑,也把这笔速度账彻底算明白了。本文就用 RK35…

2026/9/30 0:01:22

字符串转对象:JSON.parse、new Function与URLSearchParams

“字符串转对象”这几个字,我在技术群里见过的问法至少有十几种:有人拿着一串{a:1,b:2}说 JSON.parse 直接报错,有人要从 URL 里抠出参数,还有人只是想把abc变成能挂属性的东西。js 这门语言里,字符串和对象之间的转换…

2026/9/29 3:53:39

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/29 9:46:12

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/30 10:28:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑