Perception-and-action system for humanoid robot task execution in construction

📄 arXiv: 2608.01600v1 📥 PDF

作者: Yanxi Liu, Yizhi Liu

分类: cs.RO

发布日期: 2026-08-03

期刊: Computer-Aided Civil and Infrastructure Engineering, Volume 50, 100107, ISSN 1093-9687, 2026

DOI: 10.1016/j.cacaie.2026.100107


💡 一句话要点

提出感知与行动系统以解决人形机器人在建筑任务中的执行问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱八:物理动画 (Physics-based Animation)

关键词: 人形机器人 建筑任务 深度学习 动作学习 人机协作 姿态转换 工人示范

📋 核心要点

  1. 现有研究对人形机器人在建筑任务中的实际能力赋予探索有限,缺乏有效的学习和执行机制。
  2. 本研究提出的感知与行动系统通过工人示范,使人形机器人能够学习并执行建筑任务,包含两个深度网络。
  3. 实验表明,该系统使人形机器人成功执行八种建筑相关动作,平均运动跟踪误差为82.45毫米,表现出良好的执行能力。

📝 摘要(中文)

人形机器人以其类人形态和多任务能力,适合在土木和建筑工程等人类主导的工作场所中与人类工人协作或自主执行体力要求高且危险的任务。尽管前景广阔,但目前关于如何赋予这些机器人执行建筑任务的实际能力的研究仍然有限。为此,本研究提出了一种新颖的感知与行动系统,使人形机器人能够通过工人示范学习和执行建筑任务。该系统包含两个深度网络:Humanoid-PoseNet用于提取人类姿态并将其转换为人形机器人可机械执行的姿态;Humanoid-ActionNet则基于这些转换后的姿态学习机器人可执行的动作。实验结果表明,人形机器人可靠地执行了八种与建筑相关的动作,平均运动跟踪误差为82.45毫米(MPJPE)。该研究为在建筑领域部署人形协作机器人迈出了早期一步。

🔬 方法详解

问题定义:本论文旨在解决人形机器人在建筑任务中缺乏有效学习和执行能力的问题。现有方法未能充分利用工人示范来指导机器人执行复杂的建筑任务,导致机器人在实际应用中的局限性。

核心思路:论文的核心解决思路是构建一个感知与行动系统,通过工人示范来学习人类的动作,并将其转化为机器人可执行的姿态和动作。这种设计旨在提高人形机器人在建筑环境中的适应性和执行效率。

技术框架:整体架构包括两个主要模块:Humanoid-PoseNet和Humanoid-ActionNet。Humanoid-PoseNet负责提取人类的姿态信息并将其转换为适合人形机器人的机械姿态;Humanoid-ActionNet则基于这些姿态学习具体的机器人动作。

关键创新:最重要的技术创新在于将人类示范与深度学习相结合,形成了一种新的学习机制,使人形机器人能够在复杂的建筑环境中自主学习和执行任务。这与传统的基于规则或简单模仿的方法有本质区别。

关键设计:在网络结构上,Humanoid-PoseNet和Humanoid-ActionNet均采用了深度卷积神经网络(CNN)架构,优化了损失函数以提高姿态转换的准确性和动作执行的可靠性。具体参数设置和训练细节在论文中进行了详细描述。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,人形机器人成功执行了八种建筑相关动作,平均运动跟踪误差为82.45毫米(MPJPE),表明该系统在动作学习和执行方面具有较高的可靠性和准确性。这一成果为人形机器人在建筑领域的实际应用奠定了基础。

🎯 应用场景

该研究的潜在应用领域包括建筑工地、制造业及其他需要人机协作的环境。通过提高人形机器人在建筑任务中的执行能力,能够有效减轻人类工人的工作负担,提升工作效率,并在危险环境中保障工人的安全。未来,这一技术有望在更广泛的工业应用中发挥重要作用。

📄 摘要(原文)

Humanoid robots, with their human-like shape and multi-tasking capabilities, are well-aligned with human-dominated workplaces, like those in civil and construction engineering, where they could collaborate with human workers or autonomously perform physically demanding and hazardous tasks. Despite this promise, limited research has explored how to endow these robots with the practical capabilities needed to perform construction tasks. To this end, this study proposes a novel perception-and-action system that enables humanoid robots to learn and perform construction tasks from worker demonstrations. This system contains two deep networks: Humanoid-PoseNet, which extracts human postures and translates them into mechanically feasible poses for a humanoid robot; and Humanoid-ActionNet, which learns robot-executable actions based on these translated poses. Experimental results demonstrate that the humanoid robot reliably executed eight construction-related actions, achieving an average motion-tracking error of 82.45 mm MPJPE (Mean Per Joint Position Error). This work provides an early step toward deploying humanoid collaborators in construction.