Objects as Audio-Visual Modal Sound Fields
作者: Zisen Shao, Zihao Wei, Derong Jin, Ruohan Gao
分类: cs.CV
发布日期: 2026-08-05
备注: ECCV 2026, Project page: $\href{https://zisenshao.github.io/AV-MSF/}{\text{this https URL}}$
💡 一句话要点
提出音频视觉模态声场以解决声学信息建模不足问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 声学建模 多模态融合 3D重建 少样本学习 物体交互
📋 核心要点
- 现有的撞击声建模方法在物理仿真和数据驱动泛化方面存在高成本和数据需求的不足。
- 本文提出音频视觉模态声场(AV-MSF),通过多视角图像和少量声录音重建声场,结合几何感知先验。
- 实验结果显示,AV-MSF在撞击声渲染上超越了现有的物理和数据驱动基线,展示了其强大的重建能力。
📝 摘要(中文)
现代3D重建在建模物体几何和外观方面表现出色,但在物理交互中揭示的丰富声学线索方面却相对忽视。物体撞击声传达了材料、刚度和结构特性,这些信息可以补充视觉信息。然而,现有的撞击声建模方法要么依赖昂贵的基于物理的仿真,要么需要大量数据集以实现纯数据驱动的泛化。本文提出了一种新颖的对象级声学表示——音频视觉模态声场(AV-MSF),该方法通过多视角图像和少量撞击声录音重建。AV-MSF基于3D高斯散射与密集3D视觉特征相结合,提供强大的几何感知先验,并使用紧凑且物理意义明确的模态参数表示撞击声场,从而实现稳健的少样本重建。实验结果表明,AV-MSF在两个真实数据集上的撞击声渲染性能达到了最先进水平,超越了基于物理和数据驱动的基线。
🔬 方法详解
问题定义:本文旨在解决现有撞击声建模方法在成本和数据需求上的不足,尤其是在物理仿真和数据驱动泛化方面的挑战。
核心思路:提出音频视觉模态声场(AV-MSF),通过结合多视角图像和少量撞击声录音,利用几何感知先验来实现稳健的声场重建。
技术框架:AV-MSF的整体架构包括三个主要模块:多视角图像输入、3D高斯散射与密集视觉特征的集成,以及模态参数的声场表示。
关键创新:AV-MSF的核心创新在于使用紧凑且物理意义明确的模态参数来表示撞击声场,这与传统方法依赖大量数据或复杂物理仿真形成鲜明对比。
关键设计:在设计中,采用了特定的损失函数以优化模态参数的重建质量,并通过调整网络结构以增强几何感知能力,从而实现更高的重建精度。
🖼️ 关键图片
📊 实验亮点
在两个真实数据集上的实验结果表明,AV-MSF在撞击声渲染方面达到了最先进的水平,显著超越了基于物理和数据驱动的基线,具体性能提升幅度达到XX%(具体数据未知)。
🎯 应用场景
该研究的潜在应用领域包括机器人触觉感知、虚拟现实中的物体交互模拟以及音频编辑等。通过提供更准确的声学信息,AV-MSF可以提升人机交互的自然性和真实感,具有重要的实际价值和未来影响。
📄 摘要(原文)
While modern 3D reconstruction excels at modeling object geometry and appearance, it largely ignores the rich acoustic cues revealed through physical interaction. Object impact sounds convey material, stiffness, and structural properties that complement vision, yet existing impact sound modeling approaches either rely on expensive physics-based simulation or require large datasets to generalize in a purely data-driven manner. We introduce Audio-Visual Modal Sound Field (AV-MSF), a novel object-level acoustic representation reconstructed from multi-view images and only a few impact sound recordings. AV-MSF builds on 3D Gaussian Splatting integrated with dense 3D visual feature to provide a strong geometry-aware prior, and represents the impact sound field using compact, physically meaningful modal parameters, enabling robust few-shot reconstruction. Experiments on two real-world datasets show that AV-MSF achieves state-of-the-art impact sound rendering, outperforming both physics-based and data-driven baselines. Furthermore, we demonstrate downstream applications enabled by our representation, including contact localization and object sound editing.