CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents

📄 arXiv: 2608.21114v1 📥 PDF

作者: Jiancheng Wang, Mingli Zhu, Tong Zhang, Jiaqi Ruan, Wei Wang, Siyuan Liang, Dacheng Tao

分类: cs.CV, cs.AI

发布日期: 2026-08-21

备注: Includes supplementary material


💡 一句话要点

提出CIVA以解决视觉世界模型代理的攻击问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视觉世界模型 对抗攻击 强化学习 批评者引导 低维子空间 在线优化 动态系统

📋 核心要点

  1. 现有的视觉世界模型代理在逐帧观察攻击中表现不佳,导致攻击效果减弱。
  2. CIVA通过批评者引导的扰动集中在低维子空间中,优化子空间系数以实现有效攻击。
  3. 实验结果显示,CIVA在DMC walker walk任务中实现了26.07%的奖励下降,且时间变化保持较低。

📝 摘要(中文)

视觉世界模型代理(如DreamerV3)通过递归潜在状态进行决策,这使得逐帧观察攻击的效果减弱,并且在严格的逐帧扰动约束下,其扰动在时间上变化剧烈。本文研究了针对此类代理的白盒、因果、在线攻击,并提出了批评者诱导的价值子空间攻击(CIVA)。我们的关键观察是,在一次回滚过程中,批评者引导的扰动集中在受害者自身批评者诱导的低维子空间中。CIVA首先通过批评者引导的PGD对冻结的受害者进行离线探测,并通过SVD提取低秩价值子空间。在测试时,仅优化子空间系数,并通过指数移动平均(EMA)进行平滑,然后映射回像素。这种设计在保持在线优化低成本和时间一致性的同时,攻击价值敏感的递归动态。大量实验表明,CIVA在多个任务上表现优异。

🔬 方法详解

问题定义:本文旨在解决视觉世界模型代理在逐帧观察攻击中的脆弱性,现有方法在此场景下的攻击效果较差,难以实现有效的扰动。

核心思路:CIVA的核心思路是利用批评者引导的扰动,集中在受害者的低维价值子空间中进行攻击,从而提高攻击的有效性和效率。

技术框架:CIVA的整体流程包括两个主要阶段:首先是离线阶段,通过批评者引导的PGD对受害者进行探测并提取低秩子空间;其次是在线阶段,优化子空间系数并进行平滑处理。

关键创新:CIVA的创新点在于利用批评者的反馈信息,集中扰动在低维子空间中,从而在保持时间一致性的同时实现有效攻击,这与传统方法的逐帧扰动方式有本质区别。

关键设计:在设计中,CIVA使用了指数移动平均(EMA)来平滑子空间系数,并通过奇异值分解(SVD)提取低秩子空间,确保了优化过程的高效性和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

CIVA在DMC walker walk任务中实现了26.07%的奖励下降,同时保持了较低的时间变化(TempAbs为0.646),显著优于五种最新方法,展示了其在攻击效果和效率上的优势。

🎯 应用场景

该研究的潜在应用领域包括强化学习代理的安全性评估和对抗攻击防御。通过理解和改进视觉世界模型代理的脆弱性,可以为未来的智能体设计提供更强的安全保障,促进智能体在复杂环境中的应用。

📄 摘要(原文)

Visual world-model agents such as DreamerV3 act through a recurrent latent state rather than a single observation, which weakens frame-wise observation attacks and makes their perturbations vary sharply over time under a strict per-frame perturbation constraint. We study white-box, causal, online attacks on such agents and propose Critic-Induced Value-Subspace Attacks (\textbf{CIVA}). Our key observation is that, along a rollout, critic-guided perturbations concentrate in a low-dimensional subspace induced by the victim's own critic. Based on this observation, CIVA first probes the frozen victim offline with critic-guided PGD and extracts a low-rank value-subspace by SVD. At test time, it optimizes only the subspace coefficients, smooths them with an exponential moving average (EMA), and maps them back to pixels. This design attacks value-sensitive recurrent dynamics while keeping the online optimization cheap and temporally coherent. Extensive experiments on DMC walker walk, Atari Pong, and Crafter show that CIVA consistently outperforms five recent methods; on DMC walker walk, it achieves the largest reward drop of 26.07\% while keeping temporal variation low, with TempAbs of 0.646.