When Robots Exchange Meaning: A Demo of Goal-Oriented Semantic Communications for Collaborative Robotics
作者: Peizheng Li, Xinyi Lin, Sajida Gufran, Adnan Aijaz
分类: cs.RO
发布日期: 2026-07-30
备注: 3 pages, 3 figures. This paper has been accepted for presentation as a demo paper at IEEE CSCN 2026
💡 一句话要点
提出机器人边缘语义通信以提升协作机器人任务执行能力
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱四:生成式动作 (Generative Motion) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 协作机器人 语义通信 视觉压缩 边缘计算 任务导向 6G网络 深度学习
📋 核心要点
- 现有的协作机器人通信方法往往只关注数据包传输,未能有效提升任务执行和环境理解的质量。
- 本文提出了一种集成视觉压缩和语义映射的机器人边缘语义通信框架,以提高协作机器人在复杂环境中的任务执行能力。
- 实验结果表明,RGB图像的编码和重建实现了42.67倍的数据压缩,为后续的语义映射和任务交互奠定了基础。
📝 摘要(中文)
协作机器人是6G应用中的典型任务导向场景,通信质量应体现在任务执行、环境理解和闭环操作中,而不仅仅是数据包传输。本文展示了一个机器人边缘语义通信测试平台,集成了机器人端的视觉压缩、边缘端的语义映射和基于仪表盘的任务交互。移动机器人配备RGB-D传感器和LiDAR,运行ROS 2,而Jetson Orin边缘节点负责重建、RTAB-Map映射、语义对象处理和基于浏览器的可视化。作为初步概念验证,RGB帧在机器人上编码为VQ-VAE令牌,并在边缘使用PyTorch解码器重建。320x240的图像通过80x60的令牌网格表示,数据包大小为5400字节,相较于模型输入的RGB字节减少了42.67倍。重建的视觉流进一步与深度、姿态和3D映射信息关联,以生成用于后续机器人应用的语义地图。
🔬 方法详解
问题定义:本文旨在解决现有协作机器人通信方法在任务执行和环境理解中的不足,特别是如何在保证通信质量的同时减少数据传输量。
核心思路:通过将视觉数据压缩为语义令牌,并在边缘节点进行重建,来实现高效的语义通信。这种设计使得机器人能够在复杂环境中更好地理解和执行任务。
技术框架:整体架构包括三个主要模块:机器人端的视觉数据采集与压缩、边缘端的语义映射与重建,以及基于仪表盘的任务交互。机器人使用RGB-D传感器和LiDAR收集环境信息,边缘节点负责处理和可视化。
关键创新:最重要的创新在于将视觉数据压缩为VQ-VAE令牌,并在边缘进行重建,这种方法显著减少了数据传输量,并提高了任务执行的效率。
关键设计:在参数设置上,使用ONNX Runtime进行编码,PyTorch进行解码,320x240的图像通过80x60的令牌网格表示,数据包大小为5400字节,确保了高效的语义传输。
🖼️ 关键图片
📊 实验亮点
实验结果显示,RGB图像的编码和重建实现了42.67倍的数据压缩,相较于传统方法显著提升了数据传输效率。这一成果为后续的语义映射和任务交互提供了坚实基础。
🎯 应用场景
该研究具有广泛的应用潜力,尤其是在智能制造、自动驾驶和服务机器人等领域。通过提升机器人在复杂环境中的任务执行能力,能够实现更高效的协作与交互,推动未来6G网络的任务感知研究。
📄 摘要(原文)
Collaborative robotics is a representative task-oriented 6G use-case, where communication quality should be reflected in mission execution, environment understanding, and closed-loop operation rather than packet delivery alone. This demo paper presents a robot-edge semantic communication (SemCom) testbed integrating robot-side visual compression, edge-side semantic mapping, and dashboard-based mission interaction. A mobile robot equipped with RGB-D sensing and LiDAR runs ROS 2, while a Jetson Orin edge node performs reconstruction, RTAB-Map mapping, semantic object handling, and browserbased visualization. As an initial proof of concept, RGB frames are encoded on the robot into VQ-VAE tokens using an ONNX Runtime encoder and reconstructed on the edge using a PyTorch decoder. A 320 X 240 image is represented by an 80 X 60 token grid with a packed payload of 5400 bytes, corresponding to a 42.67X reduction relative to model-input RGB bytes. The reconstructed visual stream is further associated with depth, pose, and 3D mapping information to generate a semantic map for downstream robotic applications. The demo exposes the full path from semantic visual transport to object-level map interaction, and provides a practical platform for future task-aware 6G networking studies at the intersection of SemCom, embodied AI, and physical AI-enabled robotics. A video of the demo is available at https://tinyurl.com/Tos09