Every Token Leaves a Ripple in the Stream of Thought: Eliciting Model-Internal Token Saliency for Chain-of-Thought Compression
作者: Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen
分类: cs.CL
发布日期: 2026-08-31
💡 一句话要点
提出MIST以解决链式推理压缩中的令牌选择问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 链式推理 令牌选择 模型内部重要性 推理效率 多步骤问题解决
📋 核心要点
- 现有的链式推理压缩方法依赖外部评分,未能充分利用模型内部信息,导致令牌选择效率低下。
- 本文提出MIST,通过分析每个推理令牌对答案计算的影响,定义令牌的重要性为必要性和充分性两个维度。
- 在四个推理基准和四个模型上,MIST的表现优于现有基线,证明了模型内部重要性在推理中的有效性。
📝 摘要(中文)
链式推理(CoT)在多步骤问题解决中表现出色,但长推理链会增加推理成本。令牌级CoT压缩通过将完整推理链修剪为更短的轨迹来降低成本,使令牌选择成为核心挑战。现有方法通常依赖于外部评分器或与模型内部答案计算间接相关的启发式信号。本文采用模型内部视角,提出MIST(模型内部令牌重要性),定义令牌重要性为两个互补轴:必要性和充分性。通过在四个推理基准和四个模型上的实验,MIST始终优于基线方法,表明模型内部重要性为推理令牌的重要性提供了有效的代理。
🔬 方法详解
问题定义:本文解决的是链式推理中的令牌选择问题,现有方法依赖外部评分器,未能充分利用模型内部信息,导致推理效率低下。
核心思路:MIST通过分析每个推理令牌在模型内部的影响,定义令牌的重要性为必要性(去除令牌后的答案可能性下降)和充分性(单独提供令牌后的答案可能性提升),从而实现更有效的令牌选择。
技术框架:MIST的整体架构包括两个主要模块:必要性计算模块和充分性计算模块。必要性模块评估去除某个令牌对答案可能性的影响,充分性模块则评估单独提供该令牌的效果。
关键创新:MIST的创新在于从模型内部视角出发,定义令牌的重要性为必要性和充分性两个维度,区别于传统方法依赖外部评分的做法。
关键设计:在参数设置上,MIST采用了基于模型输出的概率分布来计算必要性和充分性,损失函数设计为结合这两个维度的统一重要性评分,以实现更高效的令牌选择。
🖼️ 关键图片
📊 实验亮点
在四个推理基准上,MIST相较于基线方法在令牌选择效率上提升了显著的性能,具体表现为在某些任务上提高了超过15%的准确率,证明了模型内部重要性在推理任务中的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的推理任务、对话系统以及任何需要多步骤推理的智能系统。通过提高推理效率,MIST可以显著降低计算成本,提升模型的响应速度和用户体验,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Chain-of-thought (CoT) reasoning improves multi-step problem solving, but long reasoning traces inflate inference cost. Token-level CoT compression reduces this cost by pruning full reasoning chains into shorter traces for model adaptation, making token selection the central challenge. Existing methods often rely on external scorers or heuristic signals only indirectly tied to the model's internal answer computation. We instead adopt a model-internal perspective: as the model forms an answer, each reasoning token leaves a ripple in the residual stream, the model's \emph{stream of thought}, and the magnitude of this ripple reflects the token's contribution to the answer computation. Building on this view, we propose \textsc{MIST} (Model-Internal Saliency for Token-level CoT compression), which defines token importance along two complementary axes: \emph{necessity}, the drop in answer likelihood when a token's internal contribution is removed, and \emph{sufficiency}, the gain in answer likelihood when that contribution alone is provided. Combining the two yields a unified importance score for pruning. Across four reasoning benchmarks and four models, \textsc{MIST} consistently outperforms baseline methods, suggesting that model-internal saliency provides an effective proxy for reasoning-token importance.