GRAIN: Bridging Name and Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RL
作者: Zike Yuan, Han Zhang, Jianzhi Yan, Le Liu, Cai Ke, Huozhi Zhou, Jian Xie, Jiran Yin, Yukun Cao, Yue Yu, Hui Wang, Ming Liu, Bing Qin
分类: cs.AI
发布日期: 2026-08-27
💡 一句话要点
提出GRAIN以解决图推理中的名称与叙述转变问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 图推理 强化学习 结构不变性 语义解析 大型语言模型 多代理系统 鲁棒性
📋 核心要点
- 现有方法在处理节点标识符和任务表述的转变时表现脆弱,导致图推理的准确性下降。
- GRAIN通过强化学习优化推理过程,将其建模为语义解析和工具执行的管道,利用结构不变性奖励提升模型的鲁棒性。
- GRAIN在准确性上比多代理基线提高了16.45%,并且在大规模图上保持了良好的鲁棒性,显著降低了延迟。
📝 摘要(中文)
尽管大型语言模型(LLMs)在标准化图任务中具有潜力,但在节点标识符和任务表述的现实世界转变中仍显脆弱。现有的确定性图工具对这些转变具有不变性,但从嘈杂文本中提取拓扑结构对LLMs来说非常脆弱,常常过拟合于表面模式。为了解决这一问题,本文提出了GRAIN,一个通过强化学习优化的单代理框架。GRAIN将推理建模为语义解析和工具执行的管道,并通过结构不变性奖励进行引导。通过验证提取的中间图与真实拓扑的匹配,该奖励迫使LLM学习稳健的文本到结构的映射,而不是简单记忆语言特征。实验表明,GRAIN在准确性上比多代理基线提高了16.45%,且延迟降低约24%。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在图推理任务中对节点标识符和任务表述转变的脆弱性,现有方法在面对这些转变时常常导致解析失败。
核心思路:GRAIN通过强化学习优化推理过程,将推理视为语义解析和工具执行的管道,利用结构不变性奖励来引导模型学习稳健的文本到结构映射。
技术框架:GRAIN的整体架构包括三个主要模块:语义解析、工具执行和结构不变性奖励计算。首先,模型解析输入文本生成中间图,然后执行相应的工具操作,最后通过奖励机制验证图的结构与真实拓扑的一致性。
关键创新:GRAIN的核心创新在于引入了结构不变性奖励机制,强制模型学习稳健的映射,而不是简单记忆语言特征。这一设计使得模型在处理语言转变时表现出更强的鲁棒性。
关键设计:在模型训练中,采用了特定的损失函数来优化结构不变性奖励,并设计了适应性参数设置,以确保模型在不同任务和数据分布下的有效性。
🖼️ 关键图片
📊 实验亮点
GRAIN在准确性上比多代理基线提高了16.45%,并且延迟降低约24%。此外,它在结构泛化能力上表现优异,将超出分布(OOD)模型的差距从15.77%降低至7.80%,在大规模图上保持了良好的鲁棒性。
🎯 应用场景
GRAIN的研究成果在多个领域具有潜在应用价值,包括自然语言处理中的知识图谱构建、信息抽取以及复杂系统的推理任务。其提升的鲁棒性和准确性可以帮助更好地处理现实世界中的数据不确定性,推动智能系统的进一步发展。
📄 摘要(原文)
Despite their potential in standardized graph tasks, Large Language Models (LLMs) remain brittle to real-world shifts in node identifiers and task formulation. While deterministic graph tools are invariant to such shifts, extracting topological structures from noisy text is highly fragile for LLMs, which often overfit to surface patterns. Moreover, mitigating these parsing failures via multi-agent systems incurs prohibitive latency. To address this, we propose GRAIN, a single-agent framework optimized via reinforcement learning. GRAIN models reasoning as a semantic parsing and tool-execution pipeline, guided by a Structure Invariance Reward. By validating extracted intermediate graphs against ground-truth topologies, this reward forces the LLM to learn robust text-to-structure mappings rather than memorizing linguistic artifacts. We also introduce GRIT, a benchmark evaluating sensitivity to such linguistic shifts. GRAIN outperforms multi-agent baselines by 16.45\% in accuracy with approximately 24\% lower latency. Furthermore, it demonstrates superior structural generalization, halving the out-of-distribution (OOD) gap of SFT models (from 15.77\% to 7.80\%) and maintaining robustness on large-scale graphs beyond the training distribution.