Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility
作者: Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox
分类: cs.RO, cs.CV
发布日期: 2026-08-11
备注: Project page: https://flex-pi.github.io/
💡 一句话要点
提出Flex-$π$以解决现有世界动作模型的局限性
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 世界动作模型 多模态学习 3D几何 视频生成 变分自编码器 机器人操作 深度学习
📋 核心要点
- 现有的世界动作模型主要依赖RGB图像进行训练,缺乏对3D几何和物体语义的处理,限制了其在复杂任务中的应用。
- Flex-$π$通过利用冻结的视频生成VAE,几乎无损地编码3D点图,同时实现RGB和3D几何的联合监督,提升了模型的灵活性和效率。
- 实验结果表明,Flex-$π$在双手精确操作任务中,相比最强基线提升了2-7倍,同时推理速度快于现有模型。
📝 摘要(中文)
世界动作模型(WAMs)旨在通过预测未来来优化动作,但现有模型主要依赖RGB图像进行像素重建,缺乏对3D几何和物体语义的明确处理。本文提出Flex-$π$,利用冻结的视频生成变分自编码器(VAE)几乎无损地编码3D点图,同时支持RGB和3D几何的联合监督。该模型在Mixture-of-Transformers框架下,通过交叉模态强制和每流丢弃实现灵活的多流处理,显著提高了在双手操作任务中的演示效率和泛化能力,超越了现有基线。
🔬 方法详解
问题定义:本文旨在解决现有世界动作模型在3D几何和物体语义处理上的不足,现有模型主要依赖RGB图像进行训练,缺乏对3D信息的有效利用。
核心思路:Flex-$π$的核心思路是利用冻结的视频生成VAE,几乎无损地编码3D点图,从而实现RGB与3D几何的联合监督,避免了额外的传感器和训练成本。
技术框架:Flex-$π$采用Mixture-of-Transformers架构,所有视觉信号被投影到共享的潜在空间中,并与动作共同去噪。通过每流丢弃和交叉模态强制,模型能够在不同流的子集上灵活运行。
关键创新:Flex-$π$的主要创新在于其利用冻结VAE实现3D点图的无损编码,同时支持多模态信息的联合处理,显著提升了模型的灵活性和效率。
关键设计:模型包含6B参数,采用交叉模态强制和每流丢弃策略,确保在不同任务模式下的高效运行,损失函数设计上兼顾RGB和3D几何的联合监督。
🖼️ 关键图片
📊 实验亮点
Flex-$π$在双手精确操作任务中表现出色,相比最强基线提升了2-7倍的演示效率,同时推理速度快于现有模型$π_{0.5}$,展示了其在实际应用中的优势。
🎯 应用场景
Flex-$π$在机器人操作、虚拟现实和增强现实等领域具有广泛的应用潜力。其高效的多模态处理能力可以用于复杂环境下的自主导航和人机交互,提升智能系统的决策能力和适应性。
📄 摘要(原文)
World-action models (WAMs) predict the future to act better, but nearly all of them predict only RGB latents, trained purely for pixel reconstruction, with no explicit signal for the 3D geometry or object semantics manipulation needs. We find a surprising free lunch: the same frozen video-generation VAE that encodes RGB also encodes 3D pointmaps almost losslessly, with no pointmap-specific training at all. This lets us supervise Flex-$π$, a 6B-parameter WAM, on 3D geometry and object-centric DINO semantics alongside RGB, at no cost in new sensors, new pre-training, or inference latency. Every visual signal is projected into this shared latent space and denoised jointly with actions inside a Mixture-of-Transformers backbone; per-stream dropout with cross-modality forcing then lets a single trained checkpoint run on any subset of these streams, from a fast action-only mode to full joint generation. The result is a policy that is exceptionally demonstration-efficient and generalizes well, beating the strongest baselines by up to 2-7$\times$ on dexterous, precise, real-world bimanual manipulation tasks both in and out of distribution, all while running faster than $π_{0.5}$. Our project website: https://flex-pi.github.io/