Neural-Primitive: An Efficient End-to-end Local Planner with Primitive-based Imitation Learning for Autonomous Flight
作者: Zhitao Liu, Guangtong Xu, Zihan Wang, Jialiang Hou, Chao Xu, Fei Gao
分类: cs.RO, cs.AI
发布日期: 2026-08-21
备注: Accepted by IEEE Transactions on Industrial Informatics
💡 一句话要点
提出一种高效的端到端局部规划器解决自主飞行中的轨迹生成问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自主飞行 模仿学习 轨迹规划 神经网络 实时计算 动态可行性 数据集收集 复杂环境
📋 核心要点
- 现有自主飞行方法在复杂环境中面临计算速度、轨迹质量和内存占用之间的权衡,限制了其实际应用。
- 本文提出了一种基于模仿学习的局部规划器,利用轻量级的数据集收集框架生成高质量轨迹原始数据,并通过神经网络直接映射输入。
- 实验结果表明,该方法在规划延迟和目标到达质量上显著优于现有方法,且在真实环境中具备良好的适应性。
📝 摘要(中文)
自主飞行在未知复杂环境中受到计算、质量和内存三者之间的权衡限制。本文提出了一种通过模仿学习实现的高效端到端局部规划器。设计了一个轻量级的离线原始数据集收集框架,以在非凸环境中生成安全且高质量的轨迹原始数据。一个紧凑的神经网络直接将传感器输入映射到多项式系数,从而固有地编码了高阶动态信息。所学习的策略能够实时生成平滑、经验上无碰撞且动态可行的轨迹,无需后端求解。该方法在标准桌面上实现了超快计算(低于1毫秒),在机载飞行中平均为3.68毫秒,同时保持低于1.5MiB的内存需求。广泛的仿真基准测试展示了在规划延迟和目标到达质量方面的优越性。零样本部署的真实世界实验进一步验证了该方法的稳健的仿真到现实转移能力。
🔬 方法详解
问题定义:本文旨在解决自主飞行在复杂环境中轨迹生成的计算、质量和内存三者之间的权衡问题。现有方法往往在速度和质量上存在不足,无法满足实时性要求。
核心思路:提出了一种基于模仿学习的高效局部规划器,通过轻量级的原始数据集收集框架生成安全且高质量的轨迹原始数据,利用神经网络直接映射传感器输入到多项式系数。
技术框架:整体架构包括数据集收集、神经网络训练和轨迹生成三个主要模块。数据集收集模块负责生成轨迹原始数据,神经网络模块用于学习输入与轨迹之间的映射关系,最后生成模块实时输出轨迹。
关键创新:最重要的创新在于通过模仿学习生成高质量的轨迹原始数据,并利用紧凑的神经网络实现了实时轨迹生成,显著提高了计算效率和动态可行性。
关键设计:网络结构采用紧凑型设计,确保低内存占用(小于1.5MiB),同时在损失函数中考虑了轨迹的平滑性和动态可行性,以优化生成的轨迹质量。
🖼️ 关键图片
📊 实验亮点
实验结果显示,该方法在标准桌面上实现了低于1毫秒的计算时间,在机载飞行中平均为3.68毫秒,显著优于现有方法。同时,规划的轨迹在经验上无碰撞且动态可行,展示了其在实际应用中的有效性。
🎯 应用场景
该研究的潜在应用领域包括无人机自主飞行、机器人导航和智能交通系统等。通过提高自主飞行的实时规划能力,该方法能够在复杂环境中实现更安全、更高效的飞行,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Autonomous flight in unknown cluttered environments is hindered by the computation-quality-memory trilemma of onboard trajectory generation. In this paper, we propose an efficient end-to-end local planner via imitation learning. A lightweight offline-primitive-based dataset collection framework is designed to produce safe and high-quality trajectory primitives in non-convex environments. A compact neural network directly maps sensory inputs to polynomial coefficients that inherently encode higher-order dynamical information. The learned policy generates smooth, empirically collision-free and dynamically feasible trajectories in real time without back-end solving. It achieves ultra-fast computation (below 1ms on a standard desktop and average 3.68ms during onboard flight), while maintaining low onboard memory requirements (less than 1.5MiB). Extensive simulation benchmarks demonstrate superiority in both planning latency and target-reaching progress quality. Zero-shot deployment in real-world experiments further validates the robust sim-to-real transfer capability of the proposed method.