发布时间:2026/8/27 13:47:46
解密Prompt系列38.多Agent路由策略 前言常见的多智能体框架有几类有智能体相互沟通配合一起完成任务的例如ChatDevCAMEL等协作模式, 还有就是一个智能体负责一类任务通过选择最合适的智能体来完成任务的路由模式当然还有一些多智能体共享记忆层的复杂交互模式这一章我们针对智能体路由也就是选择最合适的智能体来完成任务这个角度看看有哪些方案。上一章我们讨论的何时使用RAG的决策问题把范围放大把RAG作为一个智能体基座LLM作为另一个智能体其实RAG决策问题也是多智能体路由问题的一个缩影。那实际应用场景中还有哪些类型的智能体路由呢不同角色的智能体例如看到最搞笑的是不同流派的算命机器人不同工具挂载的智能体例如接入不同知识库拥有不同领域工具不同思考方式的智能体例如COT思考有Step-back思考有outline思考不同工作流的智能体例如例如不使用RAG使用单步RAG多步RAG的智能体路由把以上融合也就是不同角色工具思考方式工作流的综合智能体路由而这里我们看两种外挂策略也就是可以直接在当前已有多智能体外层进行路由的方案。基于能力和领域的智能体路由One Agent To Rule Them All: Towards Multi-agent Conversational AIhttps://github.com/ChrisIsKing/black-box-multi-agent-integationMARS其实是一篇大模型出现前的文章但是却可以作为多Agent路由的基础文章之一它主要针对当不同领域能力的智能体选择。思路非常清晰。论文先定义了多智能体选择问题该问题的组成元素包括query 用户提问agent skill对于智能体能力的描述也可以是sample queriesagent response智能体对用户提问的回答那自然就有两种智能体选择的方案一个是直接基于query进行选择Query-Pairing一个是基于智能体response进行选择Response-pairing当前的多智能体决策也就是这两个大方向前者更快但精度有限后者更慢但效果更好。下面说下方案中的细节因为实际操作时你会发现两个方案都有难点。Question pairing基于query进行判断的问题在于如何描述agent能干啥论文指出智能体的能力边界不好界定更难描述。论文给出的一个方案是使用query sample虽然不知道模型的全局能力但是基于用户历史的使用情况可以知道模型能回答哪些query例如locate me some good places in Kentucky that serve sushi这个问题“Alexa”, Google可以回答这个问题。那就可以基于历史收集的query样本训练一个多标签分类模型预测每个query哪些智能体可以回答。其实这种方案也是使用了response只不过使用的是历史agent回答。除了query分类论文还用了相似度。论文收集了agent在公开网站上的能力描述例如Our productivity bot helps you stay productive and organized. From sleep timers and alarms to reminders, calendar management, and email ….然后使用agent描述和query的文本相似度排序作为agent能否回答该问题的判断。这里论文尝试了bm25USE还有微调Roberta等方式进行向量编码。之前我们也考虑过类似KNN的方案但这种方案有个问题在于文本相似可以衡量领域差异例如数学Agent金融Agent但是无法区分任务复杂程度所以不适用于领域之外的其他agent路由场景。Response Pairing使用在线模型回答来进行路由的核心难点其实就是如何判断response质量论文指出的是前文多通过response和query的相似度来判断这是不够的还要判断准确性因此论文采用了cross-encoder训练了query-response ranking模型。不过在大模型出来后的这两年对于response回答质量有了更全面的评价标准例如OpenAI的3HHelful, Harmless,HonestyDeepMind更关注的2Hhelpful, harmless,也有了更多的Reward和Judement模型的训练方案。这里就不细说论文的方案了直接来看下效果吧。论文在22年当时的四大AgentAleax,Google,houndify,Adasa上评估基于Response排序的方案最好不过使用Query Sample分类的方案效果也不差。基于问题复杂程度的智能体路由Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity前面的MARS更多是从领域层面对智能体进行划分例如bank agentweather agenttransport agent但是RAG问题上领域差异更多只影响数据库路由也就是使用哪些召回查什么数据。还有一个更重要的差异来自问题的复杂度。类似的方案有SELF-RAG不过它是把路由融合在了模型推理的过程中整体复杂度太高可用性就有些低了。所以我们看下Adaptive-RAG的外挂路由的方案。Adaptive-RAG提出了通过分类器对query复杂程度进行分类并基于分类结果分别选择LLM直接回答简单单步RAG或者复杂多步RAG论文选择了Interleaving-COT如下图那如何判断一个query的复杂程度呢这里其实和前面MARS提出的query pairing中的query多标签分类模型的思路是相似的。也是使用同一个query3种模式的回答结果的优劣作为标签来训练分类模型当然也可以是listwise排序模型。论文使用的是有标准答案的QA数据集因此多模型回答的结果判断起来会比较简单这里3种回答方式也有优先级那就是更简单的链路能回答正确的话默认标签是最简单的方案。这里的query分类器论文训练了T5-Large样本只有400条query以及每个问题对应在3种链路上的回答结果。而在现实场景中RAG样本的反馈收集要复杂的多需要先基于标注样本训练Reward模型得到对回答质量的评分再使用Reward模型对多个链路的回答进行打分从而得到分类标签。如果你的RAG链路选择更多优先级排序更加复杂的话不妨使用多标签模型得到多个候选agent再基于多个agent之间的优先级选择复杂程度最低或者在该任务上优先级最高的Agent进行回答。效果论文分别在single-step和multi-hopQA数据集上进行验证Adaptive都能在保证更优效果的同时使用更少的时间和步骤完成任务Oracle是当分类器完全正确时的效果比较天花板基于用户偏好的智能体路由ZooterRouting to the Expert: Efficient Reward-guided Ensemble of LargeLanguage Models第三篇论文是从用户回答偏好出发选择最合适的agent其实也是最优的基座模型。基座模型Ensemble和Routing也算是智能体路由中的一个独立的方向包括的大模型小模型路由以求用更少的成本更快的速度来平衡效果也有多个同等能能力的模型路由来互相取长补短。个人认为基座模型的路由比不同领域的Agent或者rag要复杂一些因为基座模型间的差异在文本表征上更加分散抽象难以进行归类和划分。这差异可能来自预训练的数据分布差异指令数据集的风格差异或者rlhf的标注规则差异等等~正是因为难以区分所以基座模型路由要是想使用query-pairing达到可以和response-pairing相近的效果和泛化性需要更多更丰富的训练数据。Zooter给出的就是蒸馏方案也就是训练reward模型对多模型的回答进行评分然后把模型评分作为标签来训练query路由模型。如下蒸馏部分论文借鉴了蒸馏损失函数为了从reward模型中保留更多的信息这里没有把多模型的reward打分最后转化成top-answer的多分类问题而是把reward打分进行了归一化直接使用KL-divergence让模型去拟合多个模型回答之间的相对优劣。同时考虑到reward-model本身的噪声问题论文在蒸馏时也使用了label-smoothing的方案来降低噪声提高模型回答置信度。其实也可以使用多模型reward打分的熵值来进行样本筛选。奖励函数论文使用QwenRM作为reward模型混合多数据集构建了47,986条query样本对mdeberta-v3-base进行了蒸馏训练。效果上论文对比了6个单基座模型使用蒸馏后的模型进行query路由ours以及使用不同Reward模型对response进行路由还有SOTA GPT3.5和GPT4不同Reward模型的效果差异较大在当前评估的4个任务集上Qwen和Ultra的效果要显著更好论文蒸馏的方式训练的Zooter模型在query路由的效果上可以基本比肩使用RM进行response路由使用1/6的推理成本就能做到相似的效果有相似的推理效果最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/8/27 13:42:45

PoE受电端隔离DC-DC设计实战:从时序到防护的完整指南

PoE供电做了这几年,我最大的体会是:真正能让一个PoE设备稳定跑起来的,往往不是那套握手协议选得多花哨,而是后端电源方案有没有选对。早期我也图省事,48V进来直接挂一个非隔离Buck拉到5V,当时觉得便宜、简单…

2026/8/27 13:42:45

LTE-M智能模组开发板评测:从开箱到低功耗避坑指南

拿到这块LTE-M智能模组开发板之后,我先把这几个坑替你踩了做物联网硬件这些年,蜂窝模组接触了不少,但大多数时候拿到的都是裸模组加一串排针,自己画底板、自己接电源、自己写初始化脚本。所以当看到“Development Kit Rolls for C…

2026/8/27 13:42:45

光学系统微型升压稳压器设计:噪声、动态响应与布局实战

我一直觉得,光学系统的电源设计是整个项目中“看起来不起眼、砸起盘来最要命”的一环。你花大把时间调好的激光器驱动、光电探测器偏置,可能因为一颗升压稳压器的纹波没处理好,信噪比直接崩掉;也可能因为选了一颗体积合适的升压芯…

2026/8/27 14:38:02

96Boards SOM规范解读:从交叉编译到载板设计的ARM嵌入式实战指南

老读者可能还有印象,96Boards 这几年在开发板圈子里一直挺有存在感,尤其是 Consumer Edition 和 Enterprise Edition 那两条产品线,把 ARM 开发板从“各家各玩各的”往“标准化”方向推了一大步。但嵌入式产品开发真正需要的往往不是一块板子…

2026/8/27 14:38:02

MCU离线人脸识别实战:从硬件选型到算法轻量化全解析

做智能门锁项目的时候,我第一次认真考虑“把离线人脸识别跑在一颗MCU上”这个方向。当时的直觉和大多数人一样:主频只有几百兆赫兹、内部SRAM按KB算、还要外挂SDRAM才能放图像缓冲,这种资源条件怎么跑得动人脸识别?但回过头看&…

2026/8/27 14:38:02

Transformer瓶颈与下一代大模型架构:SSM、Mamba与MoE路线解析

最近大模型圈有两则消息值得放在一起看。一位在 OpenAI 做到较高职级、参与过大模型预训练与扩展性核心工作的人,选择离开;另一位在 Google 深耕多年、长期负责语言模型技术路线的人,也做出同样选择。更关键的是,两人离职后的下一…

2026/8/27 14:38:02

5G物联网模块安全落地:从安全启动到TLS双向认证的实践指南

1. 从4G到5G,物联网模块的安全门槛到底高在哪先讲一个我今年在项目里遇到的实际场景。客户部署了一批工业数据采集终端,用的还是老的4G Cat.1模块,业务侧跑的是MQTT over TCP,数据明文传输。前期小规模试点没出什么问题&#xff0…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/27 10:58:22

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…