ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling

📄 arXiv: 2608.10928v1 📥 PDF

作者: Vaibhav Singh, Soumya Suvra Ghosal, Sarvesh Gharat, Soumyabrata Pal, Ramasuri Narayanam, Dinesh Manocha

分类: cs.AI

发布日期: 2026-08-11


💡 一句话要点

提出ThinkRetrieve以解决LRMs推理过程中的不确定性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 推理模型 动态检索 测试时间扩展 不确定性 错误累积 教育应用 智能问答 机器学习

📋 核心要点

  1. 现有方法在推理过程中面临不确定性和错误累积的问题,导致性能下降。
  2. ThinkRetrieve通过在推理每一步动态检索相关示例,增强了推理链的有效性。
  3. 实验结果显示,ThinkRetrieve在多个数据集上均显著提高了模型的准确性,尤其在AIME 2025上表现突出。

📝 摘要(中文)

大型推理模型(LRMs)通过在推理时分配额外计算资源来生成扩展的思维链,从而提高性能。然而,近期研究表明,顺序测试时间扩展常常导致收益递减甚至负收益,因为较长的推理链会增加不确定性、错误累积和偏离原始问题。为此,本文提出了ThinkRetrieve,一个在每个推理步骤动态检索已解决示例的测试时间扩展框架。该框架从外部问题库中检索相关示例,并将其直接注入推理链中,为模型提供推理指导,而不仅仅是相关事实。实验结果表明,ThinkRetrieve在多个推理模型上均显著提高了准确性,尤其在AIME 2025数据集上相较于标准测试时间扩展提升高达60%。

🔬 方法详解

问题定义:本文旨在解决大型推理模型在推理过程中因推理链过长而导致的不确定性、错误累积和偏离原始问题的挑战。现有的顺序测试时间扩展方法在推理时间的增加上往往未能带来预期的性能提升,反而可能导致结果的下降。

核心思路:论文提出的ThinkRetrieve框架通过在每个推理步骤动态检索与当前推理相关的已解决示例,来增强推理过程的有效性。这种方法不仅提供了相关事实,还为模型提供了推理的指导,帮助其更好地理解问题。

技术框架:ThinkRetrieve的整体架构包括两个主要模块:一是外部问题库的构建,包含问题及其逐步解决方案;二是在推理过程中动态检索相关示例并将其注入到推理链中。每个推理步骤都会从问题库中获取与当前状态最相关的示例。

关键创新:ThinkRetrieve的核心创新在于其动态检索机制,能够在推理过程中实时引入外部知识,与传统的静态推理方法形成鲜明对比。这种方法有效降低了推理过程中的不确定性和错误累积。

关键设计:在设计上,ThinkRetrieve采用了特定的检索算法来确保所选示例的相关性,并通过优化损失函数来平衡推理的准确性与复杂性。此外,模型的参数设置经过精心调整,以适应不同规模的推理任务。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,ThinkRetrieve在五个推理模型(参数规模从1.5B到8B)上均表现出色,尤其在AIME 2025数据集上相较于标准测试时间扩展实现了高达60%的准确性提升。这一显著的性能改进展示了动态检索机制的有效性。

🎯 应用场景

ThinkRetrieve的研究成果在教育、自动化推理和智能问答系统等领域具有广泛的应用潜力。通过提供动态的推理指导,该框架可以帮助学生和专业人士更有效地解决复杂问题,提升学习和决策的效率。未来,该技术有望在更多实际场景中得到应用,推动智能系统的进一步发展。

📄 摘要(原文)

Large Reasoning Models (LRMs) improve performance by allocating additional inference-time compute to generate extended chain-of-thought reasoning. However, recent studies reveal that sequential test-time scaling often yields diminishing or even negative returns, as longer traces exhibit increased uncertainty, error compounding, and drift from the original problem. We propose ThinkRetrieve, a test-time scaling framework that augments the reasoning traces of LRMs with dynamically retrieved solved examples at each reasoning step. Given an external corpus of problems paired with step-by-step solutions, ThinkRetrieve retrieves relevant exemplars at each intermediate step and injects them directly into the thinking trace, providing the model with guidance on how to reason rather than merely what facts are relevant. Experiments across five reasoning models (1.5B--8B parameters) on GSM-8K, MATH-500, AIME 2025, and SciQ demonstrate that ThinkRetrieve consistently improves accuracy over standard test-time scaling, with relative gains of up to $60\%$ on AIME 2025.