CAST: Game Solvers as Turn-Level Teachers for LLM Agents

📄 arXiv: 2607.25308v1 📥 PDF

作者: Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

分类: cs.CL, cs.AI

发布日期: 2026-07-28

🔗 代码/项目: GITHUB


💡 一句话要点

提出CAST以解决长时间游戏中的奖励稀疏问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时间游戏 强化学习 信用分配 求解器优势 决策系统

📋 核心要点

  1. 现有的强化学习方法在长时间游戏中面临奖励稀疏的问题,难以有效指导决策。
  2. CAST通过利用游戏求解器状态值的变化,将其转化为回合级信号,增强了奖励反馈的密度。
  3. 在多个游戏中,CAST的表现超越了所有基线,尤其在未见难度的评估中表现突出。

📝 摘要(中文)

训练大型语言模型(LLMs)在长时间游戏中进行决策是一项有前景的研究方向,但现有的基于可验证奖励的强化学习(RLVR)依赖于稀疏的最终奖励,这些奖励对成功决策的影响信息有限。本文提出CAST(来自求解教师的信用分配),通过将游戏求解器状态值的变化转化为求解器优势,并将其作为回合级信号注入RLVR中,从而提供更密集的过程信号。实验结果表明,CAST在Sokoban、Minesweeper和Rush Hour等游戏中均优于所有训练基线,并在ALFWorld和WebShop上实现了最高的零-shot性能。

🔬 方法详解

问题定义:本文旨在解决长时间游戏中奖励稀疏的问题,现有的强化学习方法依赖于最终奖励,无法有效指导中间决策。

核心思路:CAST通过观察游戏求解器状态值的变化,提取出回合级的信用分配信号,从而为RLVR提供更密集的反馈信息。

技术框架:CAST的整体架构包括状态值变化的监测、求解器优势的计算以及将这些优势注入到强化学习过程中的模块。

关键创新:CAST的主要创新在于将求解器的状态值变化转化为回合级信号,这一方法与传统的基于最终奖励的强化学习方法有本质区别。

关键设计:在实现中,CAST仅需使用标量值而非复杂的教师logits,简化了模型的训练过程,同时保持了高效的性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CAST在Sokoban、Minesweeper和Rush Hour等游戏中均超越了所有训练基线,尤其是在未见难度的评估中表现优异,且在ALFWorld和WebShop上实现了最高的平均零-shot性能,展示了其强大的泛化能力。

🎯 应用场景

该研究的潜在应用领域包括游戏AI、智能决策系统和自动化训练等。通过提供更密集的奖励信号,CAST能够提升智能体在复杂环境中的学习效率,未来可能对多种决策任务产生深远影响。

📄 摘要(原文)

Training large language models (LLMs) to act in long-horizon games is a promising step toward generalist decision-making, yet reinforcement learning with verifiable rewards (RLVR) relies on sparse final rewards that reveal little about which decisions determine success. Denser process signals could supply this missing turn-level credit, but existing sources are hard to keep both cheap and accurate. We observe that changes in a game solver's state value reveal whether an action advances the state toward success. Building on this insight, we propose CAST (Credit Assignment from Solver Teachers), which converts these value changes into solver advantages and injects them into RLVR as turn-level signals. We further show that, under a soft-optimal solver assumption, maximizing the solver advantage is equivalent to on-policy distillation from the solver, requiring only scalar values rather than teacher logits. Across Sokoban, Minesweeper, and Rush Hour, CAST outperforms all trained baselines on every game under both in-domain and unseen-difficulty evaluation and achieves the highest average zero-shot performance on ALFWorld and WebShop. Our code is available at https://github.com/Wloner0809/CAST.