HSRM: Hidden-State Reward Models for Test-Time Verification
作者: Xianzhi Li, Xiaodan Zhu
分类: cs.AI, cs.CL
发布日期: 2026-08-31
备注: EMNLP 2026
💡 一句话要点
提出HSRM以解决大型语言模型验证效率问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 数学推理 验证模型 Transformer 隐藏状态
📋 核心要点
- 现有的验证方法依赖文本验证器逐一处理生成的解,导致验证过程效率低下。
- HSRM通过直接读取生成器的内部表示来验证候选解,避免了重复处理文本的开销。
- 实验结果显示,HSRM在多个基准测试中表现优异,参数量显著低于传统验证器。
📝 摘要(中文)
大型语言模型(LLMs)在生成数学推理过程时,常常能够产生看似合理的推理轨迹,但在多个候选解中可靠地识别正确解仍然是一个关键挑战。现有的测试时推理管道通常依赖文本验证器逐一重新阅读生成的解,使得验证成为推理中的一个昂贵环节。研究表明,LLMs在其内部表示中往往编码了与正确性相关的信号,包括对自身答案可能错误的意识。基于这一观察,本文提出了一种轻量级的隐藏状态奖励模型(HSRM),通过直接读取生成器的内部表示来验证候选解,而不是重新处理文本。HSRM在推理步骤边界提取冻结生成器的隐藏状态,并使用小型Transformer编码器对候选解进行排序。该模型通过自生成轨迹及结果标签进行训练,无需人工编写的过程监督或大型预训练验证器。在四个数学推理基准上,HSRM在16个生成器-数据集设置中,有15个匹配或超越了一个55M参数的仅文本能量验证器,同时仅使用约2M参数,提供了一种高效的文本验证替代方案。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在生成数学推理时,如何高效且准确地验证候选解的问题。现有方法依赖文本验证器,导致验证过程耗时且效率低下。
核心思路:HSRM的核心思路是利用生成器的内部表示来进行验证,而不是重新处理文本。这种方法可以直接利用生成过程中已计算的表示,从而提高验证效率。
技术框架:HSRM的整体架构包括两个主要模块:首先,从冻结的生成器中提取隐藏状态,其次,使用小型Transformer编码器对候选解进行排序。该模型在推理步骤边界提取信息,确保验证过程的高效性。
关键创新:HSRM的主要创新在于其轻量级设计,使用约2M参数即可达到与传统55M参数文本验证器相当的性能。这一设计使得验证过程更加高效,且不依赖于大型预训练模型。
关键设计:在模型设计中,HSRM使用了小型Transformer作为编码器,确保了在保持低参数量的同时,仍能有效地对候选解进行排序。此外,模型通过自生成轨迹进行训练,避免了对人工标签的依赖。
🖼️ 关键图片
📊 实验亮点
在实验中,HSRM在16个生成器-数据集设置中,有15个超越或匹配了一个55M参数的文本能量验证器,显示出其在性能上的竞争力。相较于传统方法,HSRM仅使用约2M参数,显著提高了验证效率,展示了其作为文本验证替代方案的潜力。
🎯 应用场景
HSRM的研究成果在多个领域具有潜在应用价值,尤其是在教育、自动化推理和智能问答系统中。通过提高验证效率,HSRM可以帮助开发更智能的教育工具,支持学生的学习过程,并在自动化推理中提供更快速的反馈。未来,HSRM的设计理念也可能被应用于其他需要高效验证的任务中。
📄 摘要(原文)
Large language models can often generate plausible mathematical reasoning traces, but reliably identifying the correct solution among multiple candidates remains a key challenge. Existing test-time reasoning pipelines typically rely on text-based verifiers that re-read each generated solution, making verification an expensive component of inference. Prior work has shown, however, that LLMs often encode correctness-related signals in their internal representations, including awareness of when their own answers are likely to be wrong. Building on this observation, we introduce HSRM, a lightweight hidden-state reward model that verifies candidate solutions by directly reading the generator's internal representations rather than re-processing its text. HSRM extracts hidden states from a frozen generator at reasoning-step boundaries and uses a small Transformer encoder to rank candidates. It is trained from self-generated trajectories with outcome labels, requiring neither human-written process supervision nor a large pretrained verifier. Across four mathematical reasoning benchmarks, HSRM matches or outperforms a 55M-parameter text-only energy verifier in 15 of 16 generator--dataset settings while using only about 2M parameters, providing an efficient alternative to text-only verification by reusing representations already computed during generation.