EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models
作者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang
分类: cs.CR, cs.AI
发布日期: 2026-08-20
💡 一句话要点
提出EchoCoT以提取大型推理模型中的隐含思维链
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 隐含思维链 大型推理模型 API交互 安全性评估 模型透明性 推理过程可解释性 多步骤攻击
📋 核心要点
- 现有方法在从黑箱大型推理模型中提取隐含思维链方面存在不足,相关研究较少。
- 论文提出的EchoCoT通过API交互和保真信号迭代提取隐含思维链,具有创新性。
- 实验结果显示,EchoCoT在开源LRMs上实现了66.4%的提取成功率,并在未见数据集上也表现良好。
📝 摘要(中文)
隐含思维链(CoT)追踪,尤其是来自前沿专有大型推理模型(LRMs)的思维链,是宝贵的模型资产。然而,如何从黑箱模型中直接提取这些隐含思维链仍然未被充分探索。本文系统研究了通过API交互从黑箱LRMs中提取隐含思维链的可行性,提出了EchoCoT这一多步骤攻击方法,利用API返回的保真信号迭代提取隐含思维链。我们还开发了基于大语言模型的优化框架,自动搜索有效的通用注入轨迹。实验结果表明,EchoCoT在开源LRMs上实现了高达66.4%的近乎逐字提取成功率,并在前沿专有LRMs上也取得了显著成果。
🔬 方法详解
问题定义:本文旨在解决如何从黑箱大型推理模型中提取隐含思维链的问题。现有方法对这一过程的可行性研究不足,导致隐含思维链的提取面临挑战。
核心思路:论文的核心思路是通过API交互利用保真信号来迭代提取隐含思维链,识别工具调用之间的推理重放表面,从而实现有效提取。
技术框架:整体架构包括多步骤攻击流程,首先通过API获取模型响应,然后根据保真信号迭代优化提取过程,最后形成完整的思维链。
关键创新:最重要的技术创新在于识别并利用推理重放表面,结合大语言模型的优化框架,使得提取过程更为高效和准确。
关键设计:在参数设置上,采用了多种数据集进行训练和测试,损失函数设计为最大化提取的保真度,网络结构则基于现有的语言模型进行优化。
🖼️ 关键图片
📊 实验亮点
实验结果显示,EchoCoT在开源LRMs上实现了高达66.4%的近乎逐字提取成功率,且提取的思维链长度与目标相差不超过10%。在未见数据集上,提取成功率达到80%。对于前沿专有LRMs,提取的思维链与提供者报告的推理长度高度一致,显示出该方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括安全性评估、模型透明性提升和推理过程的可解释性。通过有效提取隐含思维链,研究者可以更好地理解和优化大型推理模型的决策过程,进而提高模型的安全性和可靠性。
📄 摘要(原文)
Hidden chain-of-thought (CoT) traces, especially those from frontier proprietary large reasoning models (LRMs), are valuable model assets. Yet whether these hidden CoTs can be directly extracted from black-box models remains largely unexplored. In this work, we systematically study whether hidden CoTs can be extracted near-verbatim from black-box LRMs through API interactions. We identify a previously overlooked reasoning replay surface between tool calls and develop EchoCoT, a multi-step attack that iteratively extracts hidden CoTs using API-returned fidelity signals. We further develop an LLM-based optimization framework that automatically searches for an effective universal injection trajectory across various datasets. We evaluate EchoCoT on three open-source and five frontier proprietary LRMs. On open-source LRMs, EchoCoT achieves up to 66.4\% near-verbatim extraction success, with the extracted trace length within 10\% of the target and at least 90\% of tokens exactly matching the target CoT. The same injection trajectory also generalizes to unseen datasets, achieving up to 80\% extraction success under the same criterion. For tested frontier proprietary LRMs, a substantial fraction of extracted CoTs closely align with provider-reported reasoning lengths and available CoT summaries. EchoCoT can also extract very long CoTs: on Gemini-2.5, it extracts 33,463 tokens from a 32,948-token target. These results establish hidden-CoT extraction as a practical security risk and highlight the need to better protect hidden CoT assets.