LCoT-GV: Graph Attention Networks for Verifying Long Reasoning Chains in Large Language Models

📄 arXiv: 2608.30679v1 📥 PDF

作者: Bérénice Jaulmes, Mehwish Alam

分类: cs.CL, cs.AI

发布日期: 2026-08-31

备注: 6 pages without references, 2 tables, 1 algorithm, 1 figure


💡 一句话要点

提出LCoT-GV以验证大型语言模型的长推理链

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长推理链 图注意力网络 推理验证 语义关系 逻辑推理

📋 核心要点

  1. 现有方法在处理长推理链时,常常出现推理步骤之间的矛盾和不相关性,影响最终结果的可靠性。
  2. 本文提出LCoT-GV框架,通过将长思维链表示为推理图,利用图注意力网络进行推理步骤的正确性验证。
  3. 实验结果显示,LCoT-GV在多个推理基准上表现出色,与现有方法相比具有竞争力。

📝 摘要(中文)

大型推理模型生成的长思维链(LCoTs)在得出结论之前需要将问题分解为多个推理步骤。然而,这些步骤常常包含矛盾、缺乏支持的推论或无关的步骤,即使最终答案是正确的。本文提出了一种长思维链图验证器(LCoT-GV),该框架将LCoTs表示为推理图。图中的每个节点代表一个推理步骤,边则编码语义和逻辑关系。通过训练图注意力网络来预测推理图的链条正确性。我们从多个推理基准构建了一个新的图导向验证数据集,结果表明我们的方法在与最相似的方法比较时具有竞争力。

🔬 方法详解

问题定义:本文旨在解决大型语言模型生成的长推理链中推理步骤的矛盾和不相关性问题。现有方法在验证这些推理链的正确性时存在不足,无法有效识别推理中的错误。

核心思路:LCoT-GV框架的核心思想是将长思维链转化为推理图,通过图注意力网络来分析推理步骤之间的语义和逻辑关系,从而判断推理链的正确性。这样的设计能够更好地捕捉推理步骤之间的复杂关系。

技术框架:LCoT-GV的整体架构包括数据预处理、推理图构建和图注意力网络训练三个主要模块。首先,从长思维链中提取推理步骤并构建推理图;然后,利用图注意力网络对推理图进行训练,以预测推理链的正确性。

关键创新:该研究的主要创新在于将长思维链表示为推理图,并利用图注意力网络进行验证。这种方法与传统的线性推理验证方法有本质区别,能够更有效地处理推理步骤之间的复杂关系。

关键设计:在模型设计中,采用了图注意力网络作为核心组件,损失函数设计为交叉熵损失,以优化推理链的正确性预测。同时,数据集的构建也考虑了多样性和代表性,以确保模型的泛化能力。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,LCoT-GV在多个推理基准上表现优异,尤其在长推理链的正确性验证方面,性能与现有最先进的方法相当,展示了其有效性和实用性。

🎯 应用场景

LCoT-GV的研究成果在多个领域具有潜在应用价值,包括教育、法律推理和医疗决策等。通过验证推理链的正确性,可以提高自动化推理系统的可靠性,帮助用户更好地理解和信任模型的输出。未来,该方法有望推动更复杂推理任务的研究与应用。

📄 摘要(原文)

Large Reasoning Models produce Long Chains-of-Thought (LCoTs) which involve breaking down the problem into smaller reasoning steps before reaching the conclusion. However, these steps often contain contradictions, unsupported inferences, or irrelevant steps, even when the final answer is correct. We propose Long Chain-of-Thought Graph Verifier (LCoT-GV), a graph-based framework that represents LCoTs as reasoning graphs. Each node in the graph represents a reasoning step and the edges encode semantic and logical relations. A Graph Attention Network is then trained to predict chain-of-thought correctness from the reasoning graph. We construct a new graph-oriented verification dataset from multiple reasoning benchmarks for question answering in various domains. The results show that our method is competitive with the most similar approaches.