发布时间:2026/8/14 14:27:41
AAAI 2026 | S-DAG:细粒度主题分析驱动的多智能体异构推理框架 引言大语言模型LLM在复杂推理任务中表现出色但其能力高度依赖于任务所涉及的特定领域知识。当前主流方法如专家混合MoE通常在任务层面进行路由选择这种粗粒度的方式难以有效解决那些横跨多个学科的复杂、异构问题。近日一项发表于AAAI 2026的研究提出了一个名为S-DAG的创新框架。该框架首次在“学科”层面进行细粒度分析通过构建一个基于学科的有向无环图来识别问题相关的多个学科及其依赖关系并据此组织多智能体进行结构化协作。实验表明该方法在多个高难度基准测试上其准确性和效率均显著超越了现有的任务级模型选择与多智能体协作基线。基本信息•文章标题S-DAG: A Subject-Based Directed Acyclic Graph for Multi-Agent Heterogeneous Reasoning•会议AAAI 2026•发表时间2026年1月20日•研究单位香港理工大学数据科学与人工智能系香港理工大学计算学系•Github地址https://github.com/WanyuGroup/AAAI2026 S-DAG•论文地址https://arxiv.org/abs/2511.06727•算力描述所有实验包括基线方法和本文提出的方法均在配备40GB显存的A100 GPU上进行对于70B量级的开源大模型和Qwen系列模型采用基于API的推理方式模型池中的小型专家模型则本地部署。研究内容与方法1. 多主题推理数据集构建数据集筛选逻辑从MMLU-Pro、GPQA、MedMCQA基准数据集中筛选需要跨2-5个主题知识的复杂问题主题标注与权重分配调用LLM对每个问题进行3轮主题标注仅保留3轮结果中一致出现的主题为每个主题分配权重并归一化剔除权重低于阈值的主题标注prompt代码片段来自githubdataset_preprocess.pyPROMPTQuestion: {Q} What are the core knowledge, subjects or skills needed to solve this problem? List 2-5 keywords separated in comma, with the weights (0∼1.0). These weights represent the proportion of these skills are needed in the question. And the proportion of all keywords sum to 1. Candidate keywords: Math, Physics, Chemistry, Law, Engineering, Economics, Health, Psychology, Business, Biology, Philosophy, Computer Science, History, Medicine, Other. Give ONLY the keywords with weights, no other words or explanation. Please follow this format: Keywords: Math0.6 , Physics0.3 , Chemistry0.1 ...数据集划分划分为训练集、测试集以及包含200样本的LLM能力评测集2. S-DAG框架两阶段多主体异构推理【S-DAG框架整体流程图】框架分为S-DAG生成阶段和多主体协作推理阶段以下分述2.1 阶段1基于GNN的S-DAG生成目标从输入问题中提取相关主题及其依赖关系构建主题导向的有向无环图问题编码与节点初始化用BERT编码输入问题得到语义嵌入hQh_QhQ​每个主题节点的初始特征融合主题嵌入与问题嵌入公式如下xi(0)MLPinit([hi;hQ])x_i^{(0)} \text{MLP}_{init}([h_i; h_Q])xi(0)​MLPinit​([hi​;hQ​])对应代码片段来自githubgnn_model.pydefinit_node_features(self,subject_embeds,question_emb):question_emb_expandedquestion_emb.expand(subject_embeds.shape[0],-1)concat_embtorch.cat([subject_embeds,question_emb_expanded],dim-1)returnself.mlp_init(concat_emb)GNN节点与边预测用GNN进行多轮消息传递更新节点特征节点预测预测每个主题与问题的相关性得分s^iQMLPnode(xi)\hat{s}_i^Q \text{MLP}_{node}(x_i)s^iQ​MLPnode​(xi​)边预测预测主题间的依赖关系得分a^ijQMLPedge(xi;xj;hQ)\hat{a}_{ij}^Q \text{MLP}_{edge}(x_i; x_j; h_Q)a^ijQ​MLPedge​(xi​;xj​;hQ​)对应代码片段来自githubgnn_model.pydefforward(self,subject_embeds,question_emb,adj):xself.init_node_features(subject_embeds,question_emb)forgnn_layerinself.gnn_layers:xgnn_layer(x,adj)node_scoresself.mlp_node(x)node_pairstorch.combinations(x,2)edge_inputtorch.cat([node_pairs[:,0],node_pairs[:,1],question_emb.expand(node_pairs.shape[0],-1)],dim-1)edge_scoresself.mlp_edge(edge_input)returnnode_scores,edge_scoresS-DAG构建基于节点得分过滤掉相关性低于阈值的主题基于边得分保留显著的依赖关系构建有向无环图边si→sjs_i \to s_jsi​→sj​表示主题iii为主题jjj提供推理支持对应代码片段来自githubs_dag_generator.pydefbuild_s_dag(self,node_scores,edge_scores,subject_list,node_threshold0.1):relevant_subjects[subject_list[i]foriinrange(len(node_scores))ifnode_scores[i]node_threshold]relevant_indices[iforiinrange(len(node_scores))ifnode_scores[i]node_threshold]relevant_edges[]foridx,(i,j)inenumerate(torch.combinations(torch.tensor(relevant_indices),2)):ifedge_scores[idx]self.edge_threshold:ifself.subject_weights[i]self.subject_weights[j]:relevant_edges.append((subject_list[i],subject_list[j]))else:relevant_edges.append((subject_list[j],subject_list[i]))returnrelevant_subjects,relevant_edges【S-DAG与全连接主题图对比】2.2 阶段2基于S-DAG的多主体协作推理目标将主题节点与领域专家LLM匹配按照S-DAG的拓扑结构实现多主体信息流动与推理LLM主题能力Profiling用200样本的评测集计算每个LLM在各主题上的加权得分归一化得到每个LLM的主题能力得分公式如下CijScoreMi,sj∑sk∈SScoreMi,skC_{ij} \frac{\text{Score}_{M_i, s_j}}{\sum_{s_k \in S} \text{Score}_{M_i, s_k}}Cij​∑sk​∈S​ScoreMi​,sk​​ScoreMi​,sj​​​对应代码片段来自githubllm_profiler.pydefcompute_capability_scores(self,llm_performance):capability_scores{}forllm_name,scoresinllm_performance.items():totalsum(scores.values())normalized{subj:score/totalforsubj,scoreinscores.items()}capability_scores[llm_name]normalizedreturncapability_scores主题-LLM匹配为S-DAG中的每个主题节点选择对应主题能力得分最高的LLM公式如下Mjarg⁡max⁡MiCijM_j \arg\max_{M_i} C_{ij}Mj​argMi​max​Cij​对应代码片段来自githubagent_assigner.pydefassign_agents(self,s_dag_subjects,capability_scores):agent_assignment{}forsubjectins_dag_subjects:best_llmmax(capability_scores.keys(),keylambdax:capability_scores[x][subject])agent_assignment[subject]best_llmreturnagent_assignment多主体信息流动推理定义三类主体角色主题专家主体S-DAG起始节点直接处理原始问题支持主体S-DAG中间节点融合上游主体的输出进行推理主导主体S-DAG最终节点整合所有主体的输出生成最终答案按照S-DAG的有向边实现信息流动公式如下youtjMj({youti∣aij1},Q)y_{out}^j M_j(\{y_{out}^i | a_{ij}1\}, Q)youtj​Mj​({youti​∣aij​1},Q)对应代码片段来自githubmulti_agent_reasoner.pydefrun_reasoning(self,question,s_dag,agent_assignment):topo_orderself.get_topological_order(s_dag)agent_outputs{}forsubjectintopo_order:llmself.llm_pool[agent_assignment[subject]]upstream_outputs[]forpredins_dag.predecessors(subject):upstream_outputs.append(agent_outputs[pred])promptself.build_prompt(subject,question,upstream_outputs)outputllm.generate(prompt)agent_outputs[subject]output final_subject[subjforsubjins_dag.nodesifs_dag.out_degree(subj)0][0]returnagent_outputs[final_subject]【多主体信息流动示意图】实验结果分析S-DAG在异构推理中的准确性与效率以下图表展示了S-DAG框架在三个多学科基准测试MMLU-Pro, GPQA, MedMCQA上的性能表现。通过与单模型和多模型基线的对比评估了S-DAG在解决复杂、多学科问题上的准确性和效率。S-DAG与各类基线在三个多学科数据集上的准确率对比。准确性优势与模型对比S-DAG框架在平均准确率上显著超越了现有的任务级模型选择和多智能体协作基线。超越单模型与多模型基线S-DAG的平均准确率达到59.73%优于混合专家MoE54.56%、图路由器GraphRouter56.03%等多模型选择方法也超过了多智能体辩论MAD56.39%和符号化混合专家Symbolic-MoE57.53%等多智能体协作方法。媲美大型通用模型尽管S-DAG由多个小型领域专家模型组成但其性能与闭源的GPT-4o-mini58.52%以及开源的大型模型如Qwen2.5-72B60.08%和Llama3.3-70B60.04%相当展示了通过结构化协作实现高效推理的潜力。跨数据集鲁棒性S-DAG在三个不同领域的数据集上均保持了稳定且领先的性能证明了其对于多样化、跨学科推理任务的适应能力。S-DAG关键组件的有效性分析通过消融实验我们深入分析了S-DAG框架中三个核心设计选择GNN协调、模型性能画像、有向无环图结构各自对系统性能和效率的贡献。S-DAG框架各关键组件的消融实验结果包括平均准确率、推理时间和LLM调用次数。组件贡献与效率提升消融研究表明S-DAG的每个设计组件都对最终性能至关重要并且其有向无环图结构显著提升了推理效率。GNN模块的有效性使用GNN学习并生成S-DAG相比直接依赖LLM输出构建图结构能获得更准确、更简洁的学科依赖关系从而提升多智能体推理的准确性。模型性能画像的必要性基于学科能力画像为S-DAG节点选择最擅长的专家模型相比随机分配模型带来了显著的性能提升。这凸显了将特定学科任务与具备相应领域专长的LLM精准匹配的重要性。有向无环图结构的优势与全连接图Fully-connected Graph相比S-DAG的稀疏、有向结构在取得更高准确率59.73% vs 57.29%的同时大幅降低了平均推理时间15.02秒 vs 38.45秒和LLM调用次数4.1次 vs 8.2次。这证明了结构化的、定向的协作比无限制的全连接通信更高效、更有效。优势与局限优势•细粒度主题分析框架在主题层面进行细粒度分解能识别多学科问题中的相关主题及其依赖关系构建有向无环图S-DAG以指导推理流程。•高效多智能体协作通过主题-LLM匹配策略为S-DAG中的每个主题节点动态分配最擅长的专家模型并依据图结构进行信息流协作显著提升了复杂异构问题的推理准确率与效率。•数据与计算高效在多个基准测试上使用小型专家模型池协作的S-DAG框架其性能可媲美甚至超越参数量大得多的单体LLM降低了计算成本与数据依赖。局限•主题图生成依赖监督数据S-DAG的构建依赖于GNN模块该模块需要带标注主题及依赖关系的数据进行训练在缺乏高质量标注数据的领域可能受限。•专家模型池能力上限框架性能受限于预设的专家模型池中每个模型在其专业领域内的能力若某个主题缺乏高性能的专家模型会影响整体推理效果。•图结构可能简化复杂依赖S-DAG强制要求有向无环结构虽然提升了效率但可能无法完全捕捉某些复杂问题中主题间存在的循环或双向依赖关系。参考文献GraphRouter: A Graph-based Router for LLM Selections(Feng, Shen, and You, 2025)该论文提出了一种基于图神经网络的LLM选择路由机制是本研究在异构推理任务中进行模型选择的重要基线。S-DAG框架通过引入更细粒度的主题级分析和有向无环图结构扩展了此类路由方法以支持多智能体协作。Symbolic Mixture-of-Experts: Adaptive Skill-based Routing for Heterogeneous Reasoning(Chen et al., 2025)本文提出了Symbolic-MoE方法基于技能相关性进行专家模型选择与聚合是本研究处理异构推理问题的直接相关前沿工作。S-DAG通过构建主题依赖图并实现主题级的多智能体结构化协作对此方法进行了细粒度的深化与改进。Heterogeneous Swarms: Jointly Optimizing Model Roles And Weights for Multi-LLM Systems(Feng et al., 2025b)该论文研究了异构多LLM系统的协作优化并利用有向无环图结构进行推理。本研究提出的S-DAG框架与之理念相近但专注于对单个复杂问题进行主题级分解并设计了基于主题-模型匹配的图结构多智能体协作机制。BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding(Devlin et al., 2019)该论文提出的BERT模型是本研究中用于编码输入问题、提取语义特征的基干编码器。研究者利用BERT将自然语言问题转化为稠密向量为后续图神经网络进行主题依赖关系预测提供了高质量的输入表示。Mixture-of-experts With Expert Choice Routing(Zhou et al., 2022)本文是混合专家MoE领域的代表性工作研究了动态选择最适合的专家模型的路由机制。本研究在构建主题级多智能体协作系统时参考并超越了此类任务级路由范式实现了对涉及多主题的单一复杂问题的精细化解构与协作求解。

相关新闻

2026/8/14 14:27:41

154、Zephyr RTOS电源管理基础:无线通信功耗优化

Zephyr RTOS电源管理基础:无线通信功耗优化 去年冬天调试一个NB-IoT温湿度传感器节点,电池标称能用两年,结果客户反馈三个月就趴窝了。抓了整整一周的功耗曲线,发现罪魁祸首是Zephyr的电源管理配置——设备在发送完数据后,射频模块根本没进入深度睡眠,而是卡在了一个半睡…

2026/8/14 14:27:41

CI/CD 加 AI 审查,别让建议直接变成发布门禁

CI/CD 加 AI 审查,别让建议直接变成发布门禁 LLM 可以总结 diff、提示风险和补测试思路,但输出具有不确定性。直接用一句模型判断阻断发布,会让流水线变得难复现,也难申诉。 机械规则继续交给确定性工具 格式、类型、测试、依赖漏…

2026/8/14 14:27:41

153、Zephyr RTOS电源管理基础:低功耗传感器应用

Zephyr RTOS电源管理基础:低功耗传感器应用 去年做的一个环境监测节点,用nRF52840跑Zephyr,挂了个BME280。板子扔在仓库角落,号称能跑三个月。结果第七天就收到告警——电池电压掉到2.8V。拆回来一查,罪魁祸首是那个该死的I2C总线。传感器明明进了休眠,总线却还在周期性…

2026/8/14 17:38:20

VCPToolBox开发者指南:插件开发与系统扩展完全手册

VCPToolBox开发者指南:插件开发与系统扩展完全手册 【免费下载链接】VCPToolBox VCP 部署在 AI 模型 API 与前端应用之间,是面向AGI OS开发和探索的工业级基建示范项目。通过统一指令协议、多层级持久化记忆、分布式插件引擎及多 Agent 协作框架&#xf…

2026/8/14 17:38:20

Milvus RAG 灰度上线,先核对新旧召回差异

Milvus RAG 灰度上线,先核对新旧召回差异 向量库升级或索引参数变化后,接口还能返回结果,不等于召回行为没变。灰度阶段应让新旧链路处理同一批查询,先看差异来自哪里。 绑定语料和索引版本 文档切分、embedding、字段 schema、过…

2026/8/14 17:38:20

技术人做产品选型,功能表之后还要算使用成本

技术人做产品选型,功能表之后还要算使用成本 技术人转做产品,最顺手的分析工具往往是功能对比表。我也认可它适合快速盘点,但它回答不了用户为什么使用、团队要付出多少迁移和维护成本。 在规划新产品或新模块时,工程背景的 PM 倾…

2026/8/14 17:38:20

mri vs minimist vs yargs-parser:终极Node.js CLI解析工具性能对比

mri vs minimist vs yargs-parser:终极Node.js CLI解析工具性能对比 【免费下载链接】mri Quickly scan for CLI flags and arguments 项目地址: https://gitcode.com/gh_mirrors/mr/mri 在Node.js开发中,命令行参数解析工具是构建高效CLI应用的核…

2026/8/14 4:27:24

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/14 4:27:24

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/14 0:00:09

Flutter与OpenHarmony实现剧本杀组队表单开发实战

1. 项目概述在移动应用开发领域,跨平台框架Flutter因其高效的开发体验和出色的性能表现,已经成为众多开发者的首选。而OpenHarmony作为新兴的操作系统平台,其开放性和灵活性为开发者提供了全新的可能性。本文将聚焦于一个实际应用场景——剧本…

2026/8/14 0:00:09

VSCode高效Git管理:从入门到实战技巧

1. 为什么选择VSCode进行Git代码管理作为微软推出的轻量级代码编辑器,Visual Studio Code(简称VSCode)已经成为全球开发者使用率最高的编辑器之一。根据2023年Stack Overflow开发者调查,VSCode的市场占有率高达74.48%。它内置的Gi…

2026/8/14 4:27:24

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/14 4:27:24

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/14 4:27:24

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…