SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
作者: Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang
分类: cs.CV
发布日期: 2026-09-02
备注: https://junchao-cs.github.io/SolarWM-Web/
💡 一句话要点
提出SolarWM以解决长视频世界模型构建的挑战
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 长视频理解 交互式模型 多源数据 视频生成 模型适应 可复现研究 开放数据
📋 核心要点
- 现有方法在处理异构数据源和视频骨干网时,面临数据集差异导致的监督不一致性和结果难以复现的问题。
- SolarWM提出了一个可重配置的多源数据引擎和适应框架,旨在统一不同数据集的处理,提升模型训练的可比性和可复现性。
- 通过实验,SolarWM实现了在仅使用5秒序列训练的情况下,支持长达数小时的实时交互,展示了显著的性能提升。
📝 摘要(中文)
我们介绍了SolarWM,这是一个完全开放的基础框架,用于从数据准备到长时间推理构建交互式视频世界模型。训练跨异构数据源和视频骨干网面临挑战:数据集在时间尺度、相机几何、视觉质量、运动和字幕风格上存在差异,而视频生成器使用不同的表示和架构。SolarWM通过可重配置的多源数据引擎和骨干网本地适应框架解决了这一耦合问题。该引擎将来自10个数据集的143万条标准剪辑转换为统一的、帧对齐的合同,涵盖视觉观察、度量相机几何、字幕、质量元数据、选择决策和来源,同时将源处理与混合构建解耦。在共享相机条件、训练和推理接口下,我们基于Wan2.2、LTX-2.5和MiniMax-H3实例化了四个5B-33B模型,同时保留其本地表示和目标。通过发布结果数据、管道、配方、权重和框架,SolarWM为交互式世界模型研究提供了可重复和可扩展的基础。
🔬 方法详解
问题定义:论文要解决的问题是如何有效地构建交互式视频世界模型,尤其是在面对来自不同数据源的异构数据时,现有方法往往因数据差异导致监督不一致,结果难以复现。
核心思路:SolarWM的核心思路是通过一个可重配置的多源数据引擎,将不同数据集的特征统一化,进而实现模型训练的标准化和可复现性。该设计旨在解耦数据源处理与模型构建,提升模型的适应性和灵活性。
技术框架:SolarWM的整体架构包括三个主要模块:多源数据引擎、骨干网适应框架和训练推理接口。数据引擎负责将不同数据集的剪辑转换为统一格式,适应框架则确保模型在不同数据源上的有效训练。
关键创新:SolarWM的关键创新在于其多源数据引擎和骨干网本地适应框架的结合,能够有效处理异构数据,提升模型的训练效率和结果的可比性。这一方法与传统的单一数据源训练方法本质上不同。
关键设计:在设计上,SolarWM采用了共享相机条件的训练和推理接口,结合双向适应、教师强制自回归初始化和分布匹配蒸馏等技术,确保模型在不同数据集上的一致性和性能提升。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SolarWM在训练过程中实现了显著的性能提升,支持长达数小时的实时交互,且仅需5秒的训练序列。与基线模型相比,所提出的模型在多个任务上表现出更高的准确性和一致性,展示了其在长视频理解中的有效性。
🎯 应用场景
SolarWM的研究成果在多个领域具有潜在应用价值,包括智能视频分析、自动驾驶、虚拟现实和增强现实等。通过提供一个开放的框架和数据集,研究人员可以在此基础上进行更深入的探索和创新,推动交互式世界模型的研究进展。
📄 摘要(原文)
We introduce SolarWM, a fully open foundation for building interactive video world models from data preparation through long-horizon inference. Training across heterogeneous data sources and video backbones is challenging: datasets differ in temporal scale, camera geometry, visual quality, motion, and captioning styles, while video generators use distinct representations and architectures. Naive data mixing and model-specific implementations therefore produce inconsistent supervision and make results difficult to reproduce and compare. SolarWM addresses this coupling with a reconfigurable multi-source data engine and a backbone-native adaptation framework. The engine converts 1.43 million canonical clips from 10 datasets into a unified, frame-aligned contract covering visual observations, metric camera geometry, captions, quality metadata, selection decisions, and provenance, while decoupling source processing from mixture construction. Under shared camera-conditioning, training, and inference interfaces, we instantiate four 5B--33B models based on Wan2.2, LTX-2.5, and MiniMax-H3 while preserving their native representations and objectives. A unified three-stage recipe combines bidirectional adaptation, teacher-forced autoregressive initialization, and distribution matching distillation. The resulting causal models enable real-time interaction over rollouts ranging from minutes to hours after being trained on only 5s sequences. By releasing the resulting data, pipeline, recipes, weights, and framework, SolarWM provides a reproducible and extensible foundation for interactive world-model research.