Penelope: Localized Latent Recurrence for Efficient Structured Reasoning
作者: Yutong Chen, Shouqian Shi, Xinran Liu, Haochen Wang, Jiaying Wang, Tianxing Xu, Yuanxi Wang, Zirui Ding
分类: cs.AI
发布日期: 2026-07-28
备注: 8 pages, 2 figures
💡 一句话要点
提出Penelope以解决复杂结构推理的效率问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 结构推理 潜在推理 递归计算 Transformer 高效推理 自然语言处理 知识图谱 智能问答
📋 核心要点
- 现有方法在处理复杂结构推理任务时,往往需要增加计算资源,导致训练和部署成本上升。
- 本文提出Penelope框架,通过局部化递归计算,优化解码器的计算效率,减少不必要的重复执行。
- 实验结果显示,Penelope在保持竞争性准确度的同时,显著降低了推理延迟,提供了准确性与效率的良好平衡。
📝 摘要(中文)
复杂的结构推理任务通常需要额外的计算,但现有语言模型主要通过增加参数规模或将中间步骤序列化为链式思维(CoT)标记来实现。前者提高了训练和部署成本,而后者则将推理计算与自回归输出长度绑定。本文提出了Penelope,一个高效的潜在推理框架,针对预训练的解码器仅Transformer,局部化递归计算到选定的解码器区间。通过时间调制的GRU动态和递归读出状态,构建问题条件的边界记忆并进行迭代精炼,最终生成答案。实验表明,Penelope在开放源结构推理基准上,在验证选择的潜在预算下,取得了与现有潜在推理模型相当的准确性,同时减少了推理延迟。
🔬 方法详解
问题定义:本文旨在解决复杂结构推理任务中计算资源消耗过大的问题。现有方法通过增加模型参数或生成长链式思维标记来实现推理,导致训练和推理效率低下。
核心思路:Penelope框架的核心思想是将递归计算局部化到选定的解码器区间,通过构建问题条件的边界记忆,优化推理过程,避免重复执行完整解码器。
技术框架:Penelope的整体架构包括初始解码器前缀的评估、边界记忆的构建、时间调制的GRU动态以及递归读出状态的迭代精炼,最终生成答案。
关键创新:Penelope的主要创新在于将潜在推理与递归计算结合,允许在潜在空间中分配额外计算,而无需重复执行完整解码器或生成长的可见推理轨迹。
关键设计:在设计中,采用了时间调制的GRU动态来精炼边界记忆,并通过递归读出状态来生成最终答案,确保了计算效率和推理准确性。具体的参数设置和损失函数设计尚未详细说明。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Penelope在开放源结构推理基准上,能够在验证选择的潜在预算下,达到与现有潜在推理模型相当的准确性,同时推理延迟显著降低,展示了其在准确性与效率之间的良好平衡。
🎯 应用场景
Penelope框架在复杂结构推理任务中具有广泛的应用潜力,尤其是在需要高效推理的自然语言处理、知识图谱构建和智能问答系统等领域。其高效的计算方式能够降低资源消耗,提高系统的响应速度,具有重要的实际价值和未来影响。
📄 摘要(原文)
Complex structured reasoning tasks often require additional computation, yet current language models obtain it mainly by increasing parameter scale or by serializing intermediate steps as chain-of-thought (CoT) tokens. The former raises training and deployment costs, while the latter ties reasoning computation to autoregressive output length. We introduce Penelope, an efficient latent-reasoning framework for pretrained decoder-only Transformers that localizes recurrent computation to a selected decoder interval. The lower decoder prefix is evaluated once to construct a problem-conditioned boundary memory, which is then iteratively refined through time-modulated GRU dynamics and recurrent readout states before answer generation. A progressive CoT-to-latent curriculum transfers visible reasoning into this internal recurrent path, allowing additional computation to be allocated in latent space without repeatedly executing the complete decoder or generating a long intermediate trace. Experiments on open-source structured-reasoning benchmarks show that, at validation-selected latent budgets, Penelope attains competitive accuracy relative to established latent-reasoning models while reducing measured inference latency. These results show that latent refinement can be localized to a narrow decoder interval, reducing repeated full-decoder execution without generating a long visible reasoning trace and providing a practical accuracy-efficiency tradeoff for decoder-only Transformer models.