When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

📄 arXiv: 2608.20810v1 📥 PDF

作者: Guangyuan Dong, Chuang Liu, Yangchen Zeng, Haoyu Wang, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin

分类: cs.MM, cs.AI, cs.CV, cs.GR

发布日期: 2026-08-21

备注: 20 pages, 7 figures, and 20 tables


💡 一句话要点

提出CERES框架以解决生成图像检索不一致问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态索引 生成图像 语义崩溃 尺度变化 图像检索 闭环系统 U-Net生成器

📋 核心要点

  1. 现有的语言引导生成器在处理不同尺度的实体时,容易导致语义崩溃,影响概念-查询的检索能力。
  2. 论文提出CERES框架,通过三层语义金字塔和共现感知路由器,解决了生成图像与查询之间的检索一致性问题。
  3. CERES在四个全色化基准测试中表现优异,概念-查询检索的Recall@5提升了14.0个百分点,显示出显著的效果改进。

📝 摘要(中文)

多模态信息系统越来越多地将生成的视觉内容通过同一视觉-语言索引进行路由,因此输出必须能够被其所服务的查询检索。当场景中包含不同尺度的实体时,现有的语言引导生成器仅依赖单一的全局文本嵌入,导致特定尺度的概念被忽略,从而破坏了概念-查询检索。我们将这一失败形式化为语义崩溃,并提出CERES,一个闭环多模态索引框架,构建三层语义金字塔,通过共现感知路由器挖掘隐含概念,执行尺度路由的交叉注意力到轻量级U-Net生成器,并通过使用相同的冻结视觉-语言模型重新索引生成的图像来验证覆盖率。在四个全色化基准测试中,CERES在七个设置下实现了新的最先进水平,尤其在尺度变化最极端的情况下取得了最大的提升。

🔬 方法详解

问题定义:本论文旨在解决生成图像在检索时与查询不一致的问题,现有方法在处理不同尺度的实体时,容易导致特定尺度的概念被忽略,形成语义崩溃。

核心思路:CERES框架通过构建三层语义金字塔,结合共现感知路由器,能够有效挖掘隐含概念,并通过尺度路由的交叉注意力机制,确保生成图像与查询的一致性。

技术框架:CERES的整体架构包括三层语义金字塔、共现感知路由器、轻量级U-Net生成器和基于DINOv2的线性探测器,形成一个闭环的多模态索引系统。

关键创新:CERES的主要创新在于引入了闭环的多模态索引机制,通过重新索引生成的图像来验证覆盖率,确保生成内容的可查询性,而非仅仅保持特征一致性。

关键设计:在设计中,使用了连续可微的soft-Jaccard覆盖目标,以返回密集梯度给生成器,并在显式的非退化条件下进行优化,同时使用DINOv2线性探测器进行独立的覆盖验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在四个全色化基准测试中,CERES框架实现了新的最先进水平,特别是在尺度变化极端的情况下,Recall@5提升了14.0个百分点,图像-文本的平均倒数排名提升了0.19,显示出显著的性能改进。

🎯 应用场景

该研究具有广泛的应用潜力,尤其在图像生成、计算机视觉和自然语言处理的结合领域。CERES框架能够提升生成内容的检索能力,适用于多模态信息检索、智能搜索引擎和增强现实等场景,未来可能推动相关技术的进一步发展与应用。

📄 摘要(原文)

Multimodal information systems increasingly route generated visual content back through the same vision-language index that informed its production, so the output must remain retrievable by the queries it was meant to serve. When the scene contains entities at vastly different scales, existing language-guided generators condition on a single, globally pooled text embedding and quietly drop scale-specific concepts, breaking concept-query retrieval even when pixel fidelity is high. We formalise this failure as semantic collapse and propose CERES, a closed-loop multimodal indexing framework that builds a three-level semantic pyramid, mines implicit concepts via a co-occurrence-aware router, performs scale-routed cross-attention into a lightweight U-Net generator, and verifies coverage by re-indexing the generated image with the same frozen VLM. A continuously differentiable soft-Jaccard coverage objective returns dense gradients to the 0.39M-parameter generator under explicit non-degeneracy conditions, and coverage is verified by an independent DINOv2 linear probe trained only on external scene and object labels. On four pansharpening benchmarks across seven settings, CERES delivers the new state of the art with the largest gains where scale variation is most extreme. It also improves concept-query retrieval Recall@5 by +14.0 points and image-text mean reciprocal rank by 0.19 over the strongest baseline, showing that the closed loop preserves queryable content rather than self-referential feature consistency.