FLEET: Token-Based Feature Extraction for Event Camera-based Reinforcement Learning
作者: Tristan Gottwald, Maximilian Schier, Melanie Schaller, Bodo Rosenhahn
分类: cs.CV
发布日期: 2026-08-17
💡 一句话要点
提出FLEET以解决事件相机强化学习中的特征提取问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 事件相机 强化学习 特征提取 随机傅里叶特征 交叉注意力 端到端学习 鲁棒性
📋 核心要点
- 现有的强化学习方法未能充分利用事件相机的特性,导致性能受限。
- FLEET通过直接处理事件序列,利用随机傅里叶特征和交叉注意力进行特征提取。
- 实验结果显示,FLEET在新基准上超越了现有最优性能,且对频率变化更具鲁棒性。
📝 摘要(中文)
事件相机生成异步、高频的数据流,提供空间稀疏的信息,具有比传统相机更低的延迟。这些特性理论上应有助于控制策略的设计。然而,现有的强化学习研究未能充分利用这些传感器的特性,CNN方法通过将事件聚合到稀疏网格中,削弱了传感器的优势。本文提出FLEET(通过高效标记进行事件特征学习),直接处理事件序列,利用随机傅里叶特征和交叉注意力,将可变流压缩为固定大小的潜在表示,从而解耦特征提取器的推理成本与传感器分辨率,支持端到端学习。实验验证表明,FLEET在新的高吞吐量基准上超越了现有最优性能,并对观察频率的变化表现出更强的鲁棒性。
🔬 方法详解
问题定义:本文旨在解决现有强化学习方法在事件相机数据处理中的不足,尤其是CNN方法对传感器优势的削弱和对时间信息的模糊化。
核心思路:FLEET通过直接处理事件序列,利用随机傅里叶特征和交叉注意力机制,将可变长度的事件流压缩为固定大小的潜在表示,从而解耦推理成本与传感器分辨率。
技术框架:FLEET的整体架构包括事件序列输入模块、随机傅里叶特征提取模块和交叉注意力机制模块,最终输出固定大小的特征表示。
关键创新:FLEET的主要创新在于其特征提取方法,直接处理事件流而非聚合成稀疏网格,从而保留了时间信息并提高了计算效率。
关键设计:FLEET采用随机傅里叶特征来实现高效的特征压缩,并通过交叉注意力机制增强特征之间的关联性,确保模型在不同分辨率下的稳定性。实验中未详细说明具体的参数设置和损失函数,但强调了端到端学习的能力。
🖼️ 关键图片
📊 实验亮点
FLEET在新提出的高吞吐量基准上表现出色,超越了现有最优性能,具体提升幅度未详述。实验结果表明,该方法在不同观察频率下展现出更强的鲁棒性,验证了其在实际应用中的有效性。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动驾驶、实时监控等需要快速响应和高精度感知的场景。FLEET的高效特征提取能力能够提升这些领域的智能系统性能,推动相关技术的进步与应用。未来,FLEET可能会在更广泛的动态环境中得到应用,进一步提升智能决策的效率与准确性。
📄 摘要(原文)
Event cameras generate asynchronous, high-frequency data streams offering spatially sparse information at lower latency than traditional cameras.In principle, these properties should be ideal for the design of control policies.However, reinforcement learning research in this field remains limited as existing approaches fail to fully exploit the sensor's properties.CNN-based methods negate the sensors benefits by aggregating events into sparse grids. This couples compute cost to sensor resolution and blurs the temporal information. Meanwhile, existing generative baselines rely on the availability of trajectory data to pretrain the model. We propose FLEET (Feature Learning from Events via Efficient Tokenization), a feature extractor that processes event sequences directly. Leveraging random Fourier features and cross-attention, our architecture compresses variable streams into fixed-size latent representations. This decouples inference cost of the feature extractor's backbone from the sensor's resolution, enabling end-to-end learning without auxiliary losses. We validate FLEET on a new, high-throughput benchmark. The results demonstrate that our sequence-based approach surpasses SOTA performance and exhibits superior robustness to variations in observation frequencies.