MeshFM: 2D Features Are All You Need for 3D Shape Understanding

📄 arXiv: 2607.27592v1 📥 PDF

作者: Jinfan Zhou, Richard Liu, Itai Lang, Rana Hanocka

分类: cs.CV, cs.GR

发布日期: 2026-07-30

备注: Project page: https://threedle.github.io/MeshFM/

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出MeshFM以解决3D形状理解中的2D特征利用问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 3D形状理解 特征蒸馏 2D特征 深度学习 计算机视觉

📋 核心要点

  1. 现有方法在3D形状理解中往往依赖于复杂的3D标注,导致训练成本高且难以扩展。
  2. MeshFM通过将2D特征蒸馏到3D,利用2D监督进行训练,简化了3D特征提取过程。
  3. 实验结果显示,MeshFM在多个下游任务上表现出色,且与3D监督方法的性能相当,具有更高的训练效率。

📝 摘要(中文)

我们提出了MeshFM,一个高效的前馈框架,用于从3D输入中提取丰富特征。该方法将视觉基础模型中的2D特征蒸馏到3D中。我们训练一个前馈网络,直接预测3D特征,无需在推理期间进行优化。该方法采用两阶段训练策略,首先使用2D特征监督优化3D特征场,然后训练网络回归该特征场。整个过程不需要3D标注,而是依赖于2D基础模型中的强大信息。实验表明,MeshFM在下游任务中表现优异,包括部件分割、密集对应和网格变形,且其性能与显式使用3D监督训练的方法相当,甚至无需特定任务的微调。此外,我们的模型在输入对象的极端旋转下也表现出鲁棒性。

🔬 方法详解

问题定义:本论文旨在解决3D形状理解中对3D标注的依赖问题。现有方法通常需要大量的3D标注数据,导致训练过程复杂且成本高昂。

核心思路:论文提出的MeshFM框架通过将2D特征蒸馏到3D,利用2D特征监督来训练3D特征,避免了对3D标注的需求。这一设计使得模型能够高效地学习3D特征。

技术框架:MeshFM的整体架构包括两个主要阶段:第一阶段,优化一个3D特征场,仅使用2D特征监督;第二阶段,训练一个网络来回归该特征场。整个流程不需要在推理时进行优化。

关键创新:MeshFM的主要创新在于其完全依赖于2D特征进行3D特征学习,突破了传统方法对3D标注的依赖。这一方法在性能上与使用3D监督的模型相当,具有显著的实用价值。

关键设计:在网络结构上,MeshFM采用了前馈网络设计,损失函数则基于2D特征的回归损失进行优化。模型在训练过程中还特别考虑了输入对象的极端旋转,以增强其鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,MeshFM在多个下游任务上表现优异,尤其是在部件分割和网格变形任务中,其性能与使用3D监督的基线方法相当,且无需进行特定任务的微调,展示了其强大的适应性和效率。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、机器人、虚拟现实等,能够显著降低3D形状理解的标注成本,提高模型的训练效率。未来,MeshFM可能会推动更多基于2D数据的3D任务的研究与应用。

📄 摘要(原文)

We present MeshFM, an efficient feedforward framework for extracting rich features from 3D inputs. Our method distills 2D features from visual foundation models into 3D. We train a feedforward network to directly predict 3D features without requiring optimization during inference. The approach utilizes a two-stage training strategy. First, we optimize a feature field in 3D using only 2D feature supervision. Second, we train a network to regress this feature field. The entire procedure requires no 3D annotation, instead relying on the powerful information in 2D foundation models. We demonstrate that our learned features can be immediately applied to downstream tasks, including part segmentation, dense correspondence, and mesh deformation. Extensive experiments show that MeshFM, trained solely with 2D supervision, performs on par with methods trained explicitly with 3D supervision, even without task-specific fine-tuning. Moreover, our model is trained to be robust to extreme rotations of the input objects. Project page: https://threedle.github.io/MeshFM/