CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

📄 arXiv: 2608.30342v1 📥 PDF

作者: Jirong Li, Satoshi Ikehata, Shuhei Kurita, Ikuro Sato

分类: cs.CV

发布日期: 2026-08-31

备注: Accepted at ECCV 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出CapFrame以解决3D场景中的文本指令视角定位问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 3D场景 文本指令 相机姿态 几何伪标签 视角定位 多层次语言模型 优化算法

📋 核心要点

  1. 现有方法在3D场景中主要关注对象定位,难以实现对相机视角的精确控制,导致生成的图像与文本指令不一致。
  2. 本文提出CapFrame框架,通过检索、翻译和优化流程,将文本指令转化为几何伪标签,从而实现相机姿态的优化。
  3. 实验结果显示,CapFrame在视角对齐方面优于传统方法,验证了其在真实场景中的有效性和实用性。

📝 摘要(中文)

3D Gaussian Splatting (3DGS) 实现了逼真的实时新视角合成,但虚拟相机的放置仍然主要依赖手动操作。现有的语言引导方法主要集中在对象中心的定位,难以控制单帧中的外观,如主体方向或布局。为了解决这一限制,本文提出了一项新任务:文本指令视角定位(TIVG),旨在识别与文本指令对齐的3D场景中的6自由度相机姿态。我们提出了CapFrame,一个部分可微的框架,将语言转换为几何伪标签以优化相机姿态。实验表明,CapFrame在38个真实场景和135条指令上,生成的视角与文本的对齐程度优于启发式视角搜索和适应性轨迹生成基线。

🔬 方法详解

问题定义:本文要解决的问题是如何在3D Gaussian场景中,根据文本指令精确定位相机姿态。现有方法主要集中在对象的识别和定位,缺乏对相机视角的控制,导致生成的图像与文本指令不一致。

核心思路:CapFrame框架的核心思路是将文本指令转化为几何伪标签,进而优化相机姿态。通过这一方法,能够实现对相机位置和方向的精确控制,从而生成符合文本描述的图像。

技术框架:CapFrame遵循检索-翻译-优化的流程。首先,通过问题评估过程检索相关视角并进行排序;然后,将文本指令翻译为方向和布局的伪标签;最后,通过可微优化方法结合布局和方向损失来精细调整相机姿态。

关键创新:CapFrame的主要创新在于引入了文本指令视角定位任务(TIVG),并通过几何伪标签实现了对相机姿态的优化。这一方法与现有的对象中心定位方法有本质区别,能够更好地满足用户对图像生成的需求。

关键设计:在设计中,CapFrame采用了多层次语言模型(MLLM)进行问题评估,并通过布局和方向损失函数来优化相机姿态。具体的参数设置和网络结构细节在论文中进行了详细描述,以确保优化过程的有效性和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,CapFrame在38个真实场景和135条指令的测试中,生成的视角与文本的对齐程度显著优于启发式视角搜索和适应性轨迹生成基线,验证了其有效性。具体而言,CapFrame在VLM指标和用户研究中均表现出色,显示出较高的用户满意度和生成图像的质量。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、增强现实和游戏开发等,能够为用户提供更为自然和直观的交互体验。通过精确控制相机视角,用户可以更好地探索和理解3D场景,提升沉浸感和参与感。未来,CapFrame可能会在多模态内容生成和人机交互等领域发挥重要作用。

📄 摘要(原文)

3D Gaussian Splatting (3DGS) enables photorealistic real-time novel view synthesis, yet placing a virtual camera to capture a desired frame remains largely manual. Existing language-guided approaches in 3D scenes mainly focus on object-centric grounding, determining what to observe but rarely controlling how it should appear in a single frame, such as subject orientation or frame layout. To address this limitation, we introduce a new task, Text-Instructed Viewpoint Grounding (TIVG), which aims to identify a 6-DoF camera pose in a 3D Gaussian scene whose rendered frame aligns with a text instruction. To solve this task, we propose CapFrame, a partially differentiable framework that converts language into geometric pseudo labels for camera pose optimization. CapFrame follows a Retrieve-Translate-Refine pipeline: it retrieves relevant views and ranks them through a Question-Evaluation process with MLLMs, translates the instruction into orientation and layout pseudo labels, and refines the camera pose via differentiable optimization with layout and orientation losses in 3DGS. Experiments on 38 real-world scenes with 135 instructions indicate that CapFrame produces viewpoints better aligned with texts than heuristic viewpoint search and adapted trajectory generation baselines, validated by VLM metrics, MLLM judges, and user studies. Code is available at: https://github.com/jirongli/CapFrame