CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

📄 arXiv: 2608.27455v1 📥 PDF

作者: Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu

分类: cs.CL

发布日期: 2026-08-27

备注: https://github.com/umwyf/CRITICL

🔗 代码/项目: GITHUB


💡 一句话要点

提出CritICL框架以提升小型语言模型推理效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 推理效率 小型语言模型 失败模式 上下文学习 自然语言处理

📋 核心要点

  1. 现有推理方法依赖重复生成或外部验证,效率较低且存在局限性。
  2. CritICL框架通过利用小型模型的失败模式作为指导,提升推理效率和准确性。
  3. 实验结果显示,CritICL在性能上超越标准上下文学习,且生成次数和成本显著降低。

📝 摘要(中文)

近年来,推理时的扩展技术显著提升了大型语言模型(LLMs)的推理性能。然而,这些方法通常依赖于重复生成或外部验证。为了解决这一局限性,本文提出了CritICL,一个新颖的推理框架,旨在提高推理效率。我们的关键见解是,LLM的失败模式在同一家族的模型规模间表现出结构化的模式。CritICL将这些失败模式视为指导来源,通过基于批评的上下文示例将其融入推理中。我们提出了两种变体:CritICL-dynamic和CritICL-static,前者根据输入自适应预测失败模式并检索批评,后者则使用全局失败模式配置提供稳定指导。实验结果表明,CritICL在标准上下文学习中表现优越,并在性能上与测试时扩展方法相当或更优,同时生成次数和token成本显著降低。

🔬 方法详解

问题定义:本文旨在解决大型语言模型推理效率低下的问题,现有方法往往依赖于重复生成和外部验证,导致资源浪费和响应延迟。

核心思路:CritICL框架的核心思路是将小型语言模型的失败模式视为有价值的指导信息,而非简单的错误输出,从而提升推理过程的效率和准确性。

技术框架:CritICL包含两个主要模块:CritICL-dynamic和CritICL-static。前者根据输入自适应预测失败模式并检索相关批评,后者则使用全局失败模式配置提供稳定的指导。

关键创新:CritICL的创新在于将失败模式作为指导信息进行利用,突破了传统方法对失败的消极看法,形成了一种新的推理策略。

关键设计:在设计上,CritICL动态模块通过输入特征预测失败模式,静态模块则依赖于全局配置,确保在不同输入情况下均能提供有效指导。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,CritICL在标准上下文学习中表现出色,性能与测试时扩展方法相当或更优。具体而言,CritICL在生成次数和token成本上显著降低,展示了其在推理效率上的优势。

🎯 应用场景

CritICL框架具有广泛的应用潜力,尤其在需要高效推理的自然语言处理任务中,如对话系统、文本生成和问答系统等。其高效的推理能力将有助于提升用户体验,降低计算资源消耗,推动智能助手和自动化系统的发展。

📄 摘要(原文)

Recent advances in inference-time scaling have significantly improved the reasoning performance of large language models (LLMs). However, these methods typically rely on repeated generation or external verification. To address this limitation, we introduce CritICL, a novel inference-time framework that improves reasoning while maintaining high efficiency. Our key insight is that LLM failure modes exhibit structured patterns across model scales within the same family. Instead of treating failures as undesirable outputs, CritICL leverages them as a source of guidance. Specifically, we utilize failure modes derived from weaker models and incorporate them into inference through critique-based in-context examples. We propose two variants: CritICL-dynamic, which adaptively predicts input-specific failure modes and retrieves critiques, and CritICL-static, which uses a global failure mode profile to provide stable guidance. Experimental results show that CritICL consistently outperforms standard in-context learning and achieves performance competitive with or superior to test-time scaling methods, while requiring significantly fewer generations and lower token cost. Code available at: https://github.com/umwyf/CRITICL