SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

📄 arXiv: 2608.26583v1 📥 PDF

作者: Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Yijie Guo, Qiang Zhang

分类: cs.RO

发布日期: 2026-08-27

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出SOLO框架以解决长距离人形机器人在复杂地形中的稳定性问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 人形机器人 复杂地形 长距离行走 深度感知 轨迹优化 稳定性控制 模仿学习 增强学习

📋 核心要点

  1. 现有的人形机器人在复杂地形上长距离行走时,感知和控制误差的累积导致其稳定性不足,表现脆弱。
  2. SOLO框架通过查询重构器和轨迹感知均方误差蒸馏,解决了地形重建和模仿学习中的关键问题,增强了机器人在复杂环境中的表现。
  3. 在仿真和实际测试中,SOLO显著提高了机器人在复杂地形上的成功率,尤其在压力测试中表现优异。

📝 摘要(中文)

人类能够在复杂地形上长距离行走而不失去平衡,但现有的人形机器人在感知和控制误差累积时变得脆弱。本文提出了SOLO,一个统一框架,解决了长距离脆弱性的两个主要原因:密集地形重建平滑了关键细节,而逐点模仿缺乏时间信用分配。其查询重构器(QR)使用傅里叶编码的单元查询从深度-本体感知标记中检索空间特定证据,保留了清晰的地形边界。轨迹感知均方误差(TA-MSE)蒸馏将下一状态的教师-学生不一致性添加到PPO奖励中,使得广义优势估计能够将未来的不一致惩罚传播到之前的动作。在仿真中,QR将高度图L1误差降低了3.3-4.0倍,而TA-MSE在课程进展中超越了PPO和MSE+PPO。在压力测试地形上,SOLO实现了97.5%的平均通过成功率和96%的踏脚石成功率,相比之下,密集重构变体的成功率仅为75.0-75.6%和0-3%。

🔬 方法详解

问题定义:本文旨在解决人形机器人在复杂地形上长距离行走时的稳定性问题,现有方法在感知和控制误差累积时表现脆弱,无法有效应对复杂环境。

核心思路:SOLO框架通过引入查询重构器(QR)和轨迹感知均方误差(TA-MSE)蒸馏,旨在保留地形的关键细节并改善时间信用分配,从而增强机器人在长距离行走中的稳定性和成功率。

技术框架:SOLO的整体架构包括两个主要模块:查询重构器(QR)用于从深度-本体感知标记中提取空间特定信息,轨迹感知均方误差蒸馏(TA-MSE)用于优化奖励机制。

关键创新:SOLO的主要创新在于使用傅里叶编码的单元查询来保留地形边界的清晰度,以及通过教师-学生不一致性来改进奖励机制,这与现有的密集重构方法和简单模仿学习有本质区别。

关键设计:在QR模块中,采用傅里叶编码的查询以提高空间信息的准确性;在TA-MSE中,设计了新的损失函数以增强时间信用分配,确保未来的决策能够影响当前的动作选择。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SOLO在压力测试地形上实现了97.5%的平均通过成功率和96%的踏脚石成功率,显著优于密集重构变体的75.0-75.6%和0-3%的成功率。QR模块将高度图L1误差降低了3.3-4.0倍,TA-MSE在课程进展中超越了PPO和MSE+PPO,展现了卓越的性能提升。

🎯 应用场景

SOLO框架具有广泛的应用潜力,特别是在复杂环境中的人形机器人导航、救援任务和探索等领域。其高效的地形感知和稳定性控制能力,可以为未来的智能机器人系统提供重要的技术支持,推动人形机器人在真实世界中的应用。

📄 摘要(原文)

Humans traverse complex terrain over long distances without losing balance, whereas perceptive humanoid policies become fragile as perception and control errors accumulate. We present SOLO, a unified framework addressing two compounding causes of this long-horizon fragility: dense terrain reconstruction smooths action-critical details, and pointwise imitation lacks temporal credit assignment. Its Query Reconstructor (QR) uses Fourier-encoded cell queries to retrieve spatially specific evidence from depth-proprioception tokens, preserving sharp terrain boundaries. Trajectory-Aware MSE (TA-MSE) Distillation adds next-state teacher-student disagreement to the PPO reward, enabling Generalized Advantage Estimation to propagate future disagreement penalties to preceding actions. In simulation, QR reduces height-map L1 error by factors of 3.3-4.0, while TA-MSE surpasses PPO and MSE+PPO in curriculum progression. On stress-test terrains, SOLO achieves 97.5% mean traversal success and 96% stepping-stone success, versus 75.0-75.6% and 0-3% for dense-reconstructor variants. Deployed zero-shot with only a chest-mounted depth camera and proprioception, SOLO completes a continuous 1.5-km outdoor route and an indoor mixed-terrain course. Project page: https://sunpihai-up.github.io/solo/