Luce: Relightable Gaussians for 3D Asset Generation

📄 arXiv: 2608.23943v1 📥 PDF

作者: Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

分类: cs.CV, cs.AI, cs.GR

发布日期: 2026-08-25

备注: 27 pages, 19 figures, 5 tables


💡 一句话要点

提出Luce以解决高保真图像到3D生成问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 3D生成 高保真图像 物理基础渲染 多模态高斯云 变分自编码器 整流流变换器 图像对齐 数字内容创作

📋 核心要点

  1. 现有的图像到3D生成方法在几何和外观的表示上存在不足,难以实现高保真度和重光照效果。
  2. Luce通过将几何和PBR材料统一在多模态高斯云中,利用变分自编码器和整流流变换器实现从单幅图像生成3D表示。
  3. 在Toys4K数据集上,Luce的FID指标比最强基线提高了28%,并在AI生成图像基准上提升了CLIP图像对齐分数。

📝 摘要(中文)

高保真图像到3D生成需要一种能够同时捕捉几何和外观的3D表示。为了支持重光照和与标准渲染管道的集成,该表示应包括基于物理的渲染(PBR)模式,如反照率、金属度-粗糙度和表面法线。我们提出了Luce,这是一种将几何和PBR材料统一在体素化的多模态高斯云中的3D表示,使用专门的高斯原语来表示每种模式。变分自编码器将该表示压缩到一个统一的材料感知潜在空间。经过预训练的图像编码器的多层特征条件下,整流流变换器从单幅图像生成该潜在空间。该潜在空间随后解码为可重光照的PBR高斯和可选的带切线空间法线图的纹理网格。在Toys4K数据集上,Luce在单幅图像到3D生成方面达到了最先进的水平,FID比最强基线提高了28%。我们进一步引入了AI生成图像的基准,Luce在该基准上提高了CLIP图像对齐分数(0.8519对比0.8299)。Luce生成的资产在几何上准确且材料上真实,能够保留文本、标志和铭文等细节。

🔬 方法详解

问题定义:本论文旨在解决高保真图像到3D生成中的几何和外观表示不足的问题。现有方法难以同时捕捉细节和实现重光照效果,限制了生成资产的质量和应用场景。

核心思路:Luce的核心思路是将几何信息与PBR材料特性结合在一个多模态高斯云中,通过专门的高斯原语来表示不同的材料特性,从而实现更高质量的3D生成。

技术框架:整体架构包括三个主要模块:首先,使用变分自编码器将高维的3D表示压缩到一个材料感知的潜在空间;其次,整流流变换器从单幅图像生成该潜在空间,条件是来自预训练图像编码器的多层特征;最后,潜在空间解码为可重光照的PBR高斯和可选的纹理网格。

关键创新:Luce的主要创新在于其将几何和PBR材料统一在一个高斯云中,并通过变分自编码器和整流流变换器实现高效的3D生成。这种方法与传统的分离表示方法有本质区别,能够更好地保留细节和实现重光照。

关键设计:在设计中,使用了专门的高斯原语来表示不同的材料特性,并通过变分自编码器的损失函数优化潜在空间的生成。此外,整流流变换器的结构设计使其能够有效地从图像中提取多层特征,增强了生成的3D资产的质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Luce在Toys4K数据集上实现了最先进的单幅图像到3D生成,FID指标提高了28%,并在AI生成图像基准上提升了CLIP图像对齐分数至0.8519,相较于最佳基线(0.8299)有显著提升。这表明Luce在生成高质量3D资产方面的有效性。

🎯 应用场景

Luce的研究成果在多个领域具有广泛的应用潜力,包括游戏开发、虚拟现实、增强现实以及数字内容创作等。通过生成高质量的3D资产,Luce能够显著提升这些领域中的视觉效果和用户体验,推动数字内容的创新和发展。

📄 摘要(原文)

High-fidelity image-to-3D generation requires a 3D representation that captures both geometry and appearance. To support relighting and integration into standard rendering pipelines, the representation should include physically based rendering (PBR) modalities such as albedo, metallic-roughness, and surface normals. We propose Luce, a 3D representation that unifies geometry and PBR materials within a voxelized multimodal Gaussian cloud, using dedicated Gaussian primitives for each modality. A variational autoencoder compresses this representation into a unified material-aware latent space. A rectified-flow transformer generates this latent from a single image, conditioned on multi-layer features from a pretrained image encoder that preserve both semantic context and fine spatial detail. The latent then decodes into relightable PBR Gaussians and an optional textured mesh with a tangent-space normal map. On Toys4K, Luce achieves state-of-the-art single-image-to-3D generation, improving FID by 28% over the strongest baseline. We further introduce a benchmark of AI-generated images, on which Luce improves the CLIP image-alignment score over the best baseline (0.8519 vs. 0.8299). Luce generates relightable, geometrically accurate, and materially faithful assets that preserve fine details such as text, logos, and inscriptions.