ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation
作者: Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang
分类: cs.CV
发布日期: 2026-07-30
🔗 代码/项目: GITHUB
💡 一句话要点
提出ROAD框架以降低3D形状生成的训练成本
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 3D形状生成 判别性模型 语义对齐 结构对齐 生成模型 计算成本 深度学习
📋 核心要点
- 现有的高保真3D生成方法通常需要大量的计算资源和数据,导致训练成本高昂。
- 本文提出ROAD框架,通过将判别性模型的语义先验转移到生成模型中,降低训练成本。
- 实验结果表明,ROAD在使用仅1.5%训练数据的情况下,生成性能与基线方法相比具有显著提升。
📝 摘要(中文)
高保真3D生成通常依赖于扩大模型容量和数据,这导致了高昂的计算成本。现有方法通常从头学习几何形状,忽视了判别性3D基础模型中已经包含的丰富语义和结构先验。本文提出ROAD框架,通过将这些判别性先验转移到扩散变换器中,显著降低3D生成的训练成本。为了解决生成和判别潜在空间之间固有的语义-结构异质性,本文引入了互惠目标对齐策略,结合整体语义凝聚和结构最优对齐,严格对齐不同潜在空间之间的微观几何细节。与工业基线Step1X-3D相比,ROAD在仅使用1.5%的训练数据的情况下,实现了具有竞争力的生成性能,并显著降低了训练成本。
🔬 方法详解
问题定义:本文旨在解决高保真3D生成中训练成本高和计算资源消耗大的问题。现有方法往往从头学习几何形状,未能利用判别性模型中已有的丰富先验知识。
核心思路:ROAD框架的核心思想是通过将判别性模型的语义和结构先验转移到生成模型中,从而减少训练成本。通过互惠目标对齐策略,确保生成模型与判别模型之间的语义和结构一致性。
技术框架:ROAD框架主要包括两个模块:整体语义凝聚和结构最优对齐。整体语义凝聚用于确保生成结果的全局语义一致性,而结构最优对齐则通过构建二分匹配问题,严格对齐不同潜在空间之间的几何细节。
关键创新:ROAD的关键创新在于引入互惠目标对齐策略,解决了生成和判别潜在空间之间的异质性问题。这一策略与现有方法相比,能够更有效地利用判别性模型的先验知识。
关键设计:在设计上,ROAD框架使用了特定的损失函数来平衡语义和结构对齐的权重,并采用了适应性参数设置,以确保在不同数据集上的有效性。
🖼️ 关键图片
📊 实验亮点
在与工业基线Step1X-3D的比较中,ROAD在仅使用1.5%的训练数据的情况下,依然实现了具有竞争力的生成性能,显著降低了训练成本,展示了其在高保真3D生成中的有效性和实用性。
🎯 应用场景
ROAD框架在3D形状生成领域具有广泛的应用潜力,尤其是在虚拟现实、游戏开发和工业设计等领域。通过降低训练成本,ROAD能够使得高保真3D生成技术更易于普及,推动相关行业的发展。未来,该框架还可以与其他生成模型结合,进一步提升生成效果。
📄 摘要(原文)
High-fidelity 3D generation predominantly relies on scaling model capacity and data, which incurs prohibitive computational costs. This paradigm typically requires learning geometry from scratch and overlooks the rich semantic and structural priors already encapsulated in discriminative 3D foundation models. We contend that leveraging the profound understanding of the 3D world possessed by these discriminative models can significantly reduce generative cost. To this end, we propose ROAD, a framework that reduces the training cost of 3D generation by transferring these rich discriminative priors into diffusion transformers. To address the inherent semantic-structural heterogeneity between generative and discriminative latents, we introduce a reciprocal-objective alignment strategy. This method synergizes Holistic Semantic Condensing to enforce global semantic coherence and Structural Optimal Alignment, which is formulated as a bipartite matching problem to rigorously align microscopic geometric details between disparate latent spaces. The 3D foundation model is only used for training-time supervision of alignment and is not used at inference, incurring no additional inference cost. Compared with the industrial baseline Step1X-3D, the proposed ROAD achieves highly competitive generation performance with only 1.5% of the training data and significantly reduces training costs, effectively reducing the computational overhead of high-fidelity 3D generation. Code is available at https://github.com/H-EmbodVis/ROAD.