Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models
作者: Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu
分类: cs.CV
发布日期: 2026-08-27
备注: ECCV 2026
💡 一句话要点
提出CoDeLayout与MASON以解决复杂布局理解问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 布局理解 视觉-语言模型 多模态对齐 结构感知 组合设计
📋 核心要点
- 现有视觉-语言模型在处理复杂的组合布局时面临语义漂移和结构模糊性等挑战,导致理解效果不佳。
- 论文提出MASON后训练范式,通过多模态对齐和结构感知来提升元素理解和层次关系建模能力。
- 实验表明,MASON在准确性上显著提升,Qwen2.5-VL 7B模型在使用MASON后达到91.66%的准确率,超越了现有最强基线模型。
📝 摘要(中文)
布局理解,即元素组织的解释,对于文档分析、用户界面创建和图形设计至关重要。尽管近期的视觉-语言模型在解释独立元素的原子布局方面表现出色,但在处理需要推理视觉交织元素的层次多层结构的组合布局时却显得力不从心。本文提出了一项新任务——组合布局理解,并介绍了CoDeLayout,一个包含约2万种真实世界多层布局的视觉问答数据集,标注了组合元素对和设计意图。通过对CoDeLayout的实证分析,我们识别出现有视觉-语言模型面临的两个主要挑战:文本元数据与视觉内容之间的语义漂移,以及层次间元素关系的结构模糊性。为了解决这些挑战,我们提出了MASON,一种后训练范式,结合了多模态对齐和结构感知。实验结果显示,MASON在准确性上显著优于现有模型。
🔬 方法详解
问题定义:本文旨在解决组合布局理解中的语义漂移和结构模糊性问题。现有视觉-语言模型在处理层次多层结构时,无法有效推理元素间的复杂关系,导致理解效果不理想。
核心思路:MASON后训练范式通过多模态对齐(MA)和结构感知(SP)来增强模型的理解能力。MA通过将元数据定义的元素与其视觉对应物对齐,减少语义漂移;SP则关注层次间元素的空间关系,提升结构理解。
技术框架:MASON的整体架构包括两个主要模块:多模态对齐模块和结构感知模块。多模态对齐模块负责处理文本与视觉信息的对齐,而结构感知模块则建模层次结构中的元素关系。
关键创新:MASON的最大创新在于将多模态对齐与结构感知相结合,显著提升了对复杂布局的理解能力。这一方法与传统的单一模型训练方法有本质区别。
关键设计:在MASON中,采用了特定的损失函数来优化多模态对齐效果,并设计了层次感知的网络结构,以更好地捕捉元素间的空间关系。
🖼️ 关键图片
📊 实验亮点
实验结果显示,现有最强基线模型GPT-o3的准确率仅为79.68%,而使用MASON的Qwen2.5-VL 7B模型达到了91.66%的准确率,提升幅度显著。此外,MASON在仅使用30%训练数据的情况下,仍能超越全数据的直接微调效果,展现出更好的数据扩展能力。
🎯 应用场景
该研究的潜在应用领域包括文档分析、用户界面设计和图形设计等。通过提升布局理解能力,MASON可以帮助设计师更高效地创建和优化界面,改善用户体验,并在自动化设计工具中发挥重要作用。未来,该技术可能会推动智能设计助手的发展,进一步提升设计工作的智能化水平。
📄 摘要(原文)
Layout understanding, or the interpretation of element organization, is essential for document analysis, user interface (UI) creation, and graphic design. While recent vision-language models (VLMs) excel at interpreting atomic layouts composed of independent elements, they struggle with compositional layouts that require reasoning over visually entangled elements within hierarchical multi-layer structures. In this paper, we introduce a new task, compositional layout understanding, and present CoDeLayout, a VQA dataset of ~20K real-world multi-layer layouts annotated with compositional element pairs and design intent. Through empirical analysis on CoDeLayout, we identify two key challenges for existing VLMs: semantic drift between textual metadata and visual content, and structural ambiguity in hierarchical inter-element relationships. To address these challenges, we propose MASON, a post-training paradigm that integrates multimodal alignment (MA) and structural perception (SP). MA enhances element interpretation by grounding metadata-defined elements to their visual counterparts, mitigating semantic drift, while SP models layer-aware inter-element spatial relationships to improve hierarchical understanding and reduce structural ambiguity. Experiments reveal substantial gaps in existing VLMs: even the strongest baseline, GPT-o3, achieves only 79.68% accuracy, whereas Qwen2.5-VL 7B with MASON reaches 91.66%. Notably, MASON surpasses full-data Direct Finetune using only 30% of the training data and scales better with additional data.