发布时间:2026/8/11 2:25:53
北京大学联合快手团队提出“灯塔“模型 这项由北京大学、快手团队、香港科技大学广州、中文大学、浙江大学和清华大学联合完成的研究以预印本形式发布于2026年7月30日论文编号为arXiv:2607.28595。感兴趣的读者可通过该编号查阅完整论文。你有没有遇到过这样的情况请一个助手帮你查资料结果他不管什么问题都先翻出一大堆工具折腾半天给出的答案反而比直接回答还差或者反过来明明面对一道极其复杂的数数题却偏偏不肯动手算就靠肉眼瞎猜猜错了也不知道这正是当前人工智能视觉助手普遍存在的困境。研究团队把这个问题比作两种失职的员工一种是工具控不管什么鸡毛蒜皮的小事都要搬出工具箱折腾半天反而出错另一种是裸奔选手明明有工具可以用偏偏靠感觉硬扛遇到真正需要精确计算的任务就露了馅。研究团队正是为了解决这个知道什么时候该用工具的核心难题提出了名为Beacon中文可理解为灯塔的全新模型。一、工具用多了和用少了都是问题以当前最流行的多模态大语言模型为例这类系统能看图说话、回答问题、甚至写代码。为了处理更复杂的视觉任务研究者会给模型配备一套工具箱——比如放大镜图像裁剪、标注笔画框标记、计算器数值计算等。通过调用这些工具模型理论上可以处理肉眼难以分辨的细节。然而研究团队在仔细分析了多个代表性的前沿模型后发现了一个令人意外的现象给模型配备工具并不意味着模型就会变得更聪明甚至有可能越用越糟糕。打个比方一道简单题——图里的天气是晴天还是阴天——本来直接看图就能秒答但某些模型偏偏要先写一段代码裁剪图像、调用工具折腾一大圈最终答案没变时间和计算资源白白浪费了。更糟糕的是工具调用过程中一旦出错代码bug、坐标算偏等原本能答对的题反而答错了。这就是研究团队所说的工具伤害——工具的使用在本不需要它的地方制造了新的错误。与此同时对于真正困难的任务——比如轨道上有多少颗蓝色弹珠这类需要精确数数的视觉任务——很多模型却又不知道主动调用工具靠视觉估算猜一个数字大概率猜错。这就是工具收益不足的问题工具本来大有用武之地模型却没有抓住机会。研究团队把这两种能力分别定义为模式适应性Mode Adaptiveness和工具效果Tool Effect。前者考察的是模型能否根据题目的难易程度灵活选择直接回答还是先用工具后者衡量的是工具使用究竟是帮了忙还是帮了倒忙。这两个维度构成了整项研究的核心框架。二、研究团队是怎么量化聪明程度的要评判一个模型在工具使用上表现好不好不能只看最终答题的准确率因为那个数字掩盖了太多细节。研究团队设计了一套更精细的测量体系。具体做法是对每道题不是只问一次而是连续问五次并且强制模型在这五次里不许使用任何工具看看它纯靠文字推理能答对几次。如果五次里有四次或以上都答对了就把这道题标记为文本简单题如果五次里只有零次或一次答对就标记为文本困难题介于二者之间的题目太模糊直接剔除不参与分析。这个设计非常巧妙就好比给一个人出一道题不是问他一次就判断而是连续测试五次看他是真的懂还是偶尔蒙对。有了这个分类之后研究团队再让模型在允许使用工具的情况下回答这些题目记录模型是否主动调用了工具以及最终答对没有。由此衍生出几个关键指标模型在文本简单题上有多少比例不动工具叫做MAtext越高越好说明模型懂得在不必要时省力气模型在文本困难题上有多少比例主动调用了工具叫做MAtool越高越好说明模型在真正需要帮助时知道求助工具帮助模型在困难题上答对的比例叫做Tool-Gain越高说明工具越有价值工具在简单题上把原本答对的题搞错的比例叫做Tool-Harm越低越好。研究团队用这套体系评测了四款代表性的前沿模型Thyme、DeepEyesV2、CodeV和Metis。结果出乎意料地一致这四款模型几乎都在模式适应性上表现糟糕——不是几乎所有题都去调工具就是几乎所有题都不调工具缺乏根据题目难易灵活切换的能力。更关键的是这些模型的Tool-Gain和Tool-Harm几乎旗鼓相当意味着工具帮你解决了一些难题但同时也在容易的题上犯了差不多数量的错净收益几乎为零。允许使用工具之后这些模型的平均准确率和强制不用工具时几乎没有差别。这一发现直接揭示了问题的根源当前的训练方式根本没有给模型足够的信号去学习什么时候该用工具也没有有效地增强模型在最困难任务上通过工具解决问题的能力。三、灯塔模型是怎么诞生的Beacon的训练分为两个阶段就像先教会一个学生基本技能再通过实战演练让他变得更聪明、更懂分寸。第一阶段是打基础监督微调SFT。研究团队从16个公开数据集里收集了超过21万道题涵盖数学几何、图表理解、高分辨率感知、空间推理、知识问答等多个方向。他们先让基础模型Qwen3-VL-8B回答这些题目筛选出那些基础模型答不好的困难题目再让强大的Gemini 3.1 Pro为这些题目生成带有Python代码调用的完整解题轨迹只保留最终答对的轨迹。光有正确答案还不够因为Gemini生成的轨迹可能也存在冗余的工具调用、代码没真正帮上忙就直接靠猜答题等问题。于是团队又用Gemini对这些轨迹进行了二次精炼剔除工具没有真正发挥作用的轨迹、删掉重复无意义的步骤、补充缺失的观察分析。最终保留了约1.57万条高质量的有工具调用的解题轨迹同时混入了一些基础模型本来就能直接答对、不需要工具的题目防止模型被过度训练成什么都用工具的习惯。第二阶段是实战磨砺强化学习RL。研究团队在第一阶段的SFT模型基础上针对那些即便经过SFT训练仍然难以解决的题目进行了强化学习。这一阶段包含两个核心设计也是整个Beacon最独特的地方。四、必要性感知奖励教会模型何时该动手第一个核心设计叫做必要性感知自适应奖励Necessity-Aware Adaptive RewardNAAR。普通的强化学习训练方法通常只管答对了就给奖励答错了就扣分完全不考虑模型是靠工具答对的还是靠直接推理答对的。这就好比老师批改作业时只看答案对不对不管学生是认真计算还是偷看答案抄来的——长此以往学生就不知道什么时候该老老实实自己算什么时候才需要借助参考资料。NAAR的设计逻辑是先判断当前这组回答里有没有纯靠文字推理就答对的情况。如果有说明这道题靠自己就能搞定那么直接答对的回答得满分而用了工具才答对的回答只得四分之一的分。注意用工具答对的情况不是零分因为它毕竟是正确答案有一定参考价值只是分数打折传递这种情况你本可以不用工具的信号。反过来如果这组回答里根本没有靠纯文字推理答对的说明这道题对模型来说是真正的难题那么用工具答对的就给满分鼓励模型在真正需要的时候积极调用工具。这个奖励机制还有一个关键优势它是基于模型自身当前能力动态标注的而不是让一个外部老师模型来预先判断哪些题需要工具。这样就避免了学生的能力和老师的能力不匹配的尴尬——因为老师可能觉得简单的题学生不一定也觉得简单。五、提示引导能力扩展突破模型能力的天花板第二个核心设计叫做提示引导能力扩展Hint-Guided Capability ExpansionHCE。强化学习有一个著名的瓶颈如果一道题对模型来说实在太难模型在一批次内生成的所有回答全都是错的那这一批次的训练就完全浪费了。因为强化学习的核心机制是比较一组回答的好坏如果所有回答都是错的大家同样差就没有什么可以学习的梯度信号就像一群考生都考了零分老师完全不知道谁比谁稍微好一点点。然而这些最难的题目恰恰是模型最需要突破的地方也是工具使用最能发挥价值的场景。就这么放弃太可惜了。HCE的解法是当一道题被标记为全军覆没之后先请Gemini 3.1 Pro生成一条正确的完整解题轨迹然后从这条轨迹中提取出关键的推理步骤和工具使用策略转化为一段提示Hint——注意提示里只包含解题方向和中间目标绝对不包含最终答案。然后把这段提示附加到原始问题后面让正在训练的模型重新尝试看看有没有能够在提示的帮助下答对的回答。举个例子原来的问题是这场羽毛球比赛的当前比分是多少如果球落在红圈里新比分会怎样变化模型完全没有头绪全部答错。专家给出的提示是第一步裁剪比分板区域和红圈位置第二步根据出界规则计算新得分并找出赛事年份。有了这个提示模型在重新尝试时会去学习专家推荐的工具调用思路从而有机会答对。更巧妙的是在用提示生成的正确轨迹来更新模型参数时研究团队会把提示从输入里悄悄去掉——只保留模型在有提示帮助下产生的行为轨迹但告诉模型你当时面对的是没有提示的原始问题。这样训练出来的模型就把在提示辅助下学到的工具使用技巧内化成了自己在没有任何提示时也能自主运用的能力。效果相当于老师带着学生做了一遍下次学生就能自己做了不再需要老师帮忙。六、实验结果灯塔照亮了多远研究团队在13个不同的视觉推理基准测试上全面评测了Beacon这13个测试涵盖了高分辨率视觉搜索比如在密集图像中找到特定目标、空间感知推理判断物体之间的相对位置关系、数学图表理解、组合推理和代理任务等各种类型。在整体性能上Beacon在13个测试中的11个位列所有开源模型第一平均得分58.98%比基础模型Qwen3-VL-8B-Instruct提高了约6个百分点也超过了同等规模的其他所有前沿系统。相比之下第二名Metis的平均得分是56.67%差距明显。在工具使用的适应性方面研究团队特别绘制了一张图横轴是纯文字模式下答对次数代表题目的难易程度纵轴是实际调用工具的比例。对于真正聪明的模型这条曲线应该是向右下方倾斜的——越容易的题工具调用比例越低越难的题工具调用比例越高。在被测试的五个模型里只有Beacon呈现出这种理想的趋势对于五次都能答对的简单题Beacon调用工具的比例较低而对于基本答不对的困难题Beacon几乎次次都会调用工具。其他模型的曲线则基本上是平的说明它们完全不根据题目难易来决定是否用工具。在工具效果方面Beacon的Tool-Gain达到9.3%Tool-Harm为6.2%净收益Tool-Gain减去Tool-Harm为3.1个百分点是所有模型中最大的正差值。相比之下Thyme的工具净收益几乎是负数DeepEyesV2和Metis也基本打平说明在这些模型上工具几乎没有带来实质性的进步。在文本保留率即用了工具之后原来靠文字就能答对的题还有多少比例保住了正确方面Beacon达到91%远高于其他模型说明工具的引入基本上没有破坏原本就能正确解答的能力。七、消融实验揭示的规律为了搞清楚哪些设计真正起到了作用研究团队还做了一系列拆零件实验依次去掉NAAR和HCE观察性能变化。实验结果显示单纯用普通的GRPO强化学习没有NAAR没有HCE模型的工具使用净收益仅有1.4个百分点整体准确率57.1%。加入NAAR之后模式适应性指标MAmean从56.3%提升到了59.7%工具净收益提升到2.54个百分点整体准确率小幅提升至57.75%。单独加入HCE之后工具净收益提升到2.96个百分点说明HCE主要在强化工具真正帮上忙这个方向。两者同时使用整体准确率达到58.98%工具净收益最高3.14个百分点两项指标互相促进。研究团队还分析了训练过程中各项指标的动态变化曲线。一个关键发现是在整个强化学习训练过程中使用文字回答和使用代码回答的比例始终保持稳定没有明显的漂移——模型并不是简单地越来越偏向某种回答方式。真正在提升的是推理模式与题目类型的匹配准确率也就是说模型逐渐学会了识别题目性质并据此选择合适的模式而不是无脑偏向其中一种。在HCE的效果上研究团队统计了所有全军覆没组所有回答都错的训练题目中经过提示引导的再次尝试有多少比例成功被救活至少出现一个正确回答。结果显示约有40%的全军覆没组得到了有效转化从完全没有学习价值的数据变成了有用的训练信号这对于提升模型在最困难任务上的工具使用能力贡献显著。研究团队还描述了几个生动的案例在第一个案例中面对轨道上有多少颗蓝色弹珠的问题Beacon先获取图像尺寸再通过像素级蓝色区域检测和连通分量算法数出22颗完全正确。在第二个案例中面对图中有多少辆白色汽车的街景照片Beacon通过多次裁剪中景和远景区域逐步锁定每辆车的颜色最终判断出2辆白色车答对选项B。在一个使用提示引导的案例中面对这场羽毛球比赛的新比分是多少这道需要同时识别比分板、判断红圈位置、理解出界规则的复合题Beacon按照提示提供的步骤依次裁剪比分区域、用辅助线标注球场边界最终正确判断出红圈在边线外、球出界、新比分为IND 1:20对TPE 0:16并识别出比赛年份为2023年。说到底Beacon的核心贡献不在于发明了什么前所未有的全新技术而在于清晰地定义了一个此前被忽视的问题——工具使用的智慧性并提出了可操作的解决方案。知道什么时候该动手、动手之后真的有帮助这才是工具真正的价值所在。对于未来的多模态AI系统来说与其追求工具的数量和调用的频率不如先把知道何时该用、用了真有效这个基本功练扎实。这项研究还提示了一个有趣的思考方向当我们评价一个AI系统有多聪明时或许不应该只看它能做什么更要看它知不知道自己的局限在哪里、能不能在需要外援时主动寻求帮助而不是硬撑。这种元认知能力可能正是人工智能走向真正实用的关键一步。有兴趣深入了解细节的读者可以通过arXiv编号2607.28595找到这篇完整论文里面包含了完整的提示词设计、数据统计、训练参数设置和更多案例分析。---QAQ1Beacon模型和普通的视觉AI有什么不同A普通视觉AI通常要么总是调用工具要么从不调用缺乏根据题目难易灵活判断的能力。Beacon通过必要性感知奖励训练机制让模型学会在简单问题上直接作答在真正困难的问题上才调用代码工具从而减少不必要的错误并提升复杂任务的解决率。Q2Beacon的提示引导能力扩展在训练时是怎么起作用的A当模型对某道题完全不会做时系统会请更强的Gemini模型生成一段解题提示只提供方向和步骤不含答案让模型借助提示练习工具使用技巧。训练时再悄悄去掉提示只保留学到的行为轨迹让模型在没有提示的正常情况下也能复现这些技能。大约40%原本全部答错的题目经过这个机制得到了有效利用。Q3Beacon在哪些任务类型上提升最明显ABeacon在需要精细视觉操作的任务上提升最为突出比如高分辨率图像搜索、图表理解、计数推理和组合推理等平均比基础模型提升约6个百分点。在ChartQAPro图表问答上提升了约17个百分点在视觉谜题和竞技问答类任务上也有10个百分点左右的提升。

相关新闻

2026/8/11 2:20:53

AI原生组织转型:跨越认知、组织与实施三大鸿沟

1. 从“口号”到“现实”:AI原生组织的理想与现实鸿沟最近和几个不同行业的朋友聊天,发现一个挺有意思的现象:几乎每个人都在说自己的公司要搞“AI转型”,要成为“AI原生组织”。从科技大厂到传统制造业,从金融到零售&…

2026/8/11 2:20:53

AE新手入门全攻略:从零掌握动态图形与视频特效核心技能

很多刚接触视频特效和动态图形设计的朋友,面对 After Effects(简称 AE)这个庞然大物时,常常感到无从下手。网上教程要么太零散,要么过于深奥,或者需要付费才能看到核心内容。本文旨在为你提供一份系统、完整…

2026/8/11 3:35:57

纯视觉AI玩转经典游戏:从截图到决策的强化学习实战

1. 项目概述:当AI“看图说话”玩转经典游戏 最近在AI应用和游戏自动化社区里,一个挺有意思的讨论点冒了出来:一个曾经很火的自动化工具“Fable5”似乎失效了,但社区里的玩家和开发者们并没有停下脚步,反而探索出了一种…

2026/8/11 3:35:57

Reactor模型 + muduo网络库日志打印

一个好的服务器的设计一个良好的服务器应该怎么设计在之后的文章里面,我不仅仅会写网络库,也会解析sylar服务器框架,所以一个良好的服务器设计很重要。我们现在都是多核的计算机,所以多线程服务的问题就转化成了如何设计一个高效且…

2026/8/11 3:35:57

Spring事务失效的八大场景与解决方案

1. Spring事务失效场景深度解析从事Java开发这些年,Spring事务管理就像个熟悉的陌生人——看似简单,实则暗藏玄机。最近团队里连续出现几起因事务失效导致的线上事故,让我决定系统梳理这个"老熟人"的脾气秉性。下面这些坑&#xff…

2026/8/11 3:35:57

联想记忆法在语言学习中的应用与技巧

由于提供的输入内容过于简略(项目标题为"2026.03.11四级联想 第三节",其余字段均为空),且缺乏明确的主题、技术背景或应用场景说明,无法生成符合要求的专业博文。为保障内容质量与安全性,建议补充…

2026/8/11 3:35:57

springboot单位考勤系统的管理设计与实现

课题背景 随着信息技术的快速发展,传统的人工考勤管理方式逐渐暴露出效率低、易出错、数据难以统计分析等问题。尤其在企事业单位、教育机构等场景中,考勤管理涉及大量人员数据的记录、存储和分析,传统纸质签到或简单的电子表格已无法满足现代…

2026/8/11 3:30:57

Kafka在大数据架构中的核心应用与优化实践

1. Kafka在大数据架构中的核心定位Kafka作为分布式消息队列系统的代表,已经成为现代大数据架构中不可或缺的基础组件。它最初由LinkedIn开发,后来成为Apache顶级项目,其高吞吐、低延迟的特性完美契合了大数据场景下海量数据流转的需求。在实际…

2026/8/11 3:03:40

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/10 5:09:58

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/11 0:00:39

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:39

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/10 11:20:30

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/10 11:20:30

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/11 3:05:11

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…