Escaping Redundant Reasoning: Structure-Aware Search for Inference-Time LLMs

📄 arXiv: 2609.00738v1 📥 PDF

作者: Lu Cheng

分类: cs.AI

发布日期: 2026-09-01

🔗 代码/项目: GITHUB


💡 一句话要点

提出BASIN方法以解决推理时间LLMs的冗余推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 推理时间 大语言模型 结构感知 冗余推理 搜索优化 多样性提升

📋 核心要点

  1. 现有方法在推理时间搜索中容易陷入结构相似的轨迹,导致冗余推理和探索不足。
  2. BASIN方法通过将推理状态分组为盆地,并惩罚重复策略访问,优化搜索路径。
  3. 在实验中,BASIN在多个任务上显著提升性能,尤其在Game of 24和MuSR上表现突出。

📝 摘要(中文)

在大语言模型(LLMs)的推理时间搜索中,常常集中于一小部分结构或语义相似的轨迹,导致其他选择未被充分探索,这种现象被称为“推理盆地崩溃”。本文提出了一种名为BASIN的无训练、结构感知的选择方法,通过将推理状态分组为盆地并惩罚重复访问相同策略,从而在固定计算预算下重新分配搜索到真正不同的推理路径。在匹配的推理预算下,BASIN在Game of 24上比Tree of Thoughts(ToT)提高了最多22个百分点,在MuSR上提高了6.7个百分点。质量感知变体QA-BASIN进一步提高了鲁棒性,保留高质量盆地以防止无条件多样化过度探索。我们引入冗余差距Δ来解释盆地感知选择的帮助程度,标准ToT通常在Δ≈0附近运行,而BASIN则始终将Δ向正方向移动。更广泛地说,BASIN表明结构感知选择是一种简单而通用的方法来改善推理时间推理。

🔬 方法详解

问题定义:本文旨在解决大语言模型推理时间搜索中的冗余推理问题,现有方法如Tree of Thoughts(ToT)往往集中于少量相似轨迹,导致探索不足。

核心思路:BASIN通过将推理状态分组为不同的“盆地”,并对重复访问相同策略进行惩罚,从而鼓励模型探索更多不同的推理路径。这样的设计旨在提高推理的多样性和有效性。

技术框架:BASIN的整体架构包括状态分组、盆地选择和策略惩罚三个主要模块。首先,将推理状态根据结构特征分组;然后,在每次推理时选择不同的盆地进行探索;最后,应用惩罚机制以减少对相同策略的重复访问。

关键创新:BASIN的主要创新在于引入了“盆地”概念,通过结构感知的选择方法有效减少了冗余推理,与传统方法相比,显著提高了推理的多样性和准确性。

关键设计:在设计中,BASIN采用了特定的损失函数来惩罚重复策略访问,并通过质量感知的QA-BASIN变体来保留高质量的盆地,以增强模型的鲁棒性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在实验中,BASIN在Game of 24任务上比Tree of Thoughts提高了最多22个百分点,在MuSR任务上提高了6.7个百分点,显示出显著的性能提升,验证了其有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能问答系统和自动推理等。通过提高推理时间的多样性和准确性,BASIN方法能够在实际应用中提升模型的性能,尤其是在需要快速响应和高准确率的场景中,具有重要的实际价值和未来影响。

📄 摘要(原文)

Inference-time search with large language models (LLMs) often concentrates on a small set of structurally or semantically similar trajectories, leaving alternatives underexplored---a failure mode we call \textit{reasoning basin collapse}. We introduce BASIN, a training-free, structure-aware selection method that groups reasoning states into basins and penalizes repeated visits to the same strategy, thereby reallocating search across genuinely distinct reasoning paths under a fixed compute budget. Under matched inference budgets, BASIN improves over Tree of Thoughts (ToT) by up to $+22$pp on Game of 24 and $+6.7$pp on MuSR. A quality-aware variant, QA-BASIN, further improves robustness by preserving high-quality basins when unconditional diversification over-explores. To explain when basin-aware selection helps, we introduce the redundancy gap $Δ$, which measures how differently search concentrates for correct versus incorrect predictions: standard ToT often operates near $Δ\approx 0$, while BASIN consistently shifts $Δ$ positive. More broadly, BASIN suggests structure-aware selection as a simple and general approach to improving inference-time reasoning. Code can be found at https://github.com/GitHubLuCheng/basin.