Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

📄 arXiv: 2608.20099v1 📥 PDF

作者: Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

分类: cs.MA, cs.CL, cs.LG

发布日期: 2026-08-20

备注: Full version of extended abstract accepted at ICONIP 2026 (poster)


💡 一句话要点

提出奖励引导的自回归图生成方法以优化多智能体通信拓扑设计

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 多智能体系统 图生成 奖励模型 通信拓扑 资源优化 强化学习 结构紧凑性

📋 核心要点

  1. 现有的ARG-Designer方法未能有效激励生成稀疏和高效的通信拓扑,导致资源浪费。
  2. 本文提出的RGA-Designer通过引入奖励模型,结合任务正确性和结构紧凑性来优化图生成过程。
  3. 实验结果表明,RGA-Designer在保持任务准确性的同时,令牌消耗平均减少了20.5%。

📝 摘要(中文)

基于大型语言模型的多智能体系统在复杂推理任务中表现出色,但其代价是显著的令牌消耗。近期的自动拓扑设计工作ARG-Designer将此问题重新构架为自回归图生成。然而,其训练目标未能明确激励模型生成稀疏且高效的拓扑。为了解决这一局限性,本文提出了一种受人类反馈强化学习启发的奖励引导自回归图生成方法(RGA-Designer)。我们训练了一个奖励模型,联合捕捉任务正确性和结构紧凑性,然后利用奖励模型作为反馈对预训练的图生成器进行微调。我们的方法在保持ARG-Designer任务准确性的同时,平均减少了20.5%的令牌消耗。

🔬 方法详解

问题定义:本文旨在解决现有ARG-Designer在生成稀疏高效拓扑时缺乏明确激励的问题,导致资源消耗过高。

核心思路:通过引入奖励引导机制,结合任务的正确性和拓扑的结构紧凑性,优化自回归图生成过程,从而提高生成效率。

技术框架:整体架构包括奖励模型的训练和图生成器的微调两个主要阶段。首先,训练奖励模型以评估生成图的质量;然后,利用该模型对预训练的图生成器进行微调。

关键创新:最重要的创新在于引入了奖励模型,使得图生成不仅关注任务的准确性,还考虑到生成图的稀疏性和结构紧凑性,与现有方法形成鲜明对比。

关键设计:在设计中,奖励模型的损失函数综合考虑了任务正确性和结构紧凑性,确保生成的图既能满足任务需求,又能有效减少令牌消耗。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,RGA-Designer在保持与ARG-Designer相同的任务准确性的同时,令牌消耗平均减少了20.5%。这一显著的性能提升证明了奖励引导机制在图生成中的有效性。

🎯 应用场景

该研究的潜在应用领域包括多智能体系统的通信拓扑优化、网络设计和资源管理等。通过提高通信效率,RGA-Designer能够在实际应用中降低成本,提升系统性能,具有重要的实际价值和未来影响。

📄 摘要(原文)

LLM-based Multi-Agent Systems (MAS) achieve strong performance on complex reasoning tasks by coordinating multiple agents, but at the cost of substantial token consumption. Recent work on automatic topology design, ARG-Designer, has reframed this problem as autoregressive graph generation. However, its training objective provides no explicit incentive for the model to generate sparse and efficient topologies. We address this limitation by introducing a Reward-Guided Autoregressive Graph Generation (RGA-Designer) inspired by Reinforcement Learning from Human Feedback (RLHF). We train a reward model that jointly captures task correctness and structural compactness, and then fine-tune the pretrained graph generator using the reward model as feedback. Our method preserves task accuracy at the level of ARG-Designer while reducing token consumption by an average of 20.5%.