Self-Evolving Learning for Embodied AI with Criticality Model

📄 arXiv: 2607.28251v1 📥 PDF

作者: Linxuan He, Yuying Tian, Lingxiang Fan, Jiaqi Pi, Yinqiao Lu, Shang Su, Mengkai Shi, Shuo Feng

分类: eess.SY

发布日期: 2026-07-30


💡 一句话要点

提出自演化学习方法以解决嵌入式AI的任务特定微调瓶颈问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 嵌入式AI 自演化学习 状态关键性模型 重要性采样 失败案例优化

📋 核心要点

  1. 现有的微调方法在数据收集上存在不足,随机采样导致重要的失败案例被忽视,影响了系统的改进。
  2. 本文提出了一种自演化学习方法,利用状态关键性模型预测失败概率,从而优化数据采样,聚焦于失败场景。
  3. 实验结果显示,该方法在多个任务上显著降低了失败率,证明了其在提升嵌入式AI系统性能方面的有效性。

📝 摘要(中文)

尽管政策预训练取得了快速进展,但嵌入式AI系统在任务特定微调过程中常常出现性能停滞。其根本原因在于微调数据的收集方式:默认管道随机收集数据,忽视了稀有失败案例。本文提出了一种自演化方法,通过学习状态关键性模型,预测未来失败的概率,从而指导重要性采样,聚焦于失败倾向场景。通过用多样化的失败案例替换冗余的名义场景,训练过程中的数据重采样有效提高了信息密度。实验结果表明,该方法在四足运动、多任务操作、视觉-语言-动作基准和真实机器人任务中,相较于训练基线降低了51%至67%的失败率,相较于最先进的视觉-语言-动作模型降低了8%至25%。

🔬 方法详解

问题定义:本文旨在解决嵌入式AI系统在任务特定微调过程中因数据收集方式不当而导致的性能停滞问题。现有方法随机收集数据,导致重要的失败案例被忽视,影响了系统的学习效果。

核心思路:论文的核心思路是通过学习状态关键性模型,预测未来失败的概率,从而指导重要性采样,优先关注失败倾向的场景。这种方法旨在提高训练数据的信息密度,促进系统的自我改进。

技术框架:整体架构包括三个主要模块:首先,利用政策执行结果学习状态关键性模型;其次,根据模型预测的失败概率进行重要性采样;最后,重采样训练数据以替换冗余的名义场景,确保训练过程的有效性。

关键创新:最重要的技术创新在于引入状态关键性模型来指导数据采样,这与传统的随机采样方法本质上不同,能够更有效地聚焦于对系统改进最有价值的失败案例。

关键设计:在关键设计上,论文详细描述了状态关键性模型的构建方法、重要性采样的具体实现,以及如何在训练过程中动态调整数据集,以保持学习目标的无偏性。具体的损失函数和网络结构也进行了优化,以适应新的数据采样策略。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在四足运动、多任务操作、视觉-语言-动作基准和真实机器人任务中,相较于训练基线降低了51%至67%的失败率,相较于最先进的视觉-语言-动作模型降低了8%至25%。这些结果展示了该方法在提升嵌入式AI系统性能方面的显著效果。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能制造等需要高可靠性的嵌入式AI系统。通过提高系统在复杂环境中的适应能力和故障处理能力,能够显著提升实际应用的安全性和效率,具有重要的实际价值和广泛的未来影响。

📄 摘要(原文)

Despite rapid advances in policy pretraining, embodied AI systems routinely plateau during task-specific finetuning. The root cause lies in how finetuning data are collected: the default pipeline gathers data randomly, treating every sample as informative. Datasets become dominated by nominal scenarios, while rare failure cases--the most valuable for improvement--are missed. We propose a self-evolving method that breaks this plateau. Our core insight is that a state-wise criticality model, learned from the policy's own execution outcomes to predict the probability of future failure, can guide importance sampling toward failure-prone scenarios. After replacing redundant nominal scenarios with diverse failure-prone ones, importance weights are used to resample the data during training. This effectively preserves an unbiased learning objective while fundamentally increasing the information density of the training pool. Across quadrupedal locomotion, multi-task manipulation, vision-language-action benchmarks, and a real-robot task, our method reduces failure rates by 51--67% relative to trained baselines and by 8-25% relative to state-of-the-art vision-language-action models.