Learning visual representations for compositional analysis of artworks and photographs

📄 arXiv: 2608.06142v1 📥 PDF

作者: Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

分类: cs.CV

发布日期: 2026-08-06

备注: ECCV workshops 2026


💡 一句话要点

提出基于人类启发的视觉表示学习以分析艺术作品的构图

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 构图分析 视觉表示 人类启发 自监督学习 图注意力网络 艺术作品 空间关系

📋 核心要点

  1. 现有方法在学习有意义的构图表示时存在语义偏差,导致构图分析的效果不佳。
  2. 论文提出了一种基于人类启发的构图分析方法,结合感知分组和图注意力网络来捕捉元素间的空间关系。
  3. 实验结果表明,人类启发的方法在可解释性上表现良好,而大型自监督模型在数据充足时性能显著提升。

📝 摘要(中文)

构图是视觉元素的有意排列,对于艺术作品中意义、情感和美学质量的传达至关重要,但在视觉理解中仍然缺乏形式化的定义。以往的研究指出,学习有意义的构图表示存在持续的差距,主要归因于语义偏差,并建议人类启发的方法可能是关键。本文比较了两种构图分析的平行范式:一种基于感知分组的人类启发方法,另一种是利用最近的大规模构图数据集进行微调的基础模型。人类启发的方法使用以对象为中心的模型进行区域级分解,并通过图注意力网络捕捉元素之间的空间关系。两种方法在构图评分/类别预测、构图图像检索和视觉显著性检测上进行了评估。使用冻结编码器时,人类启发的方法表现出竞争力,同时保持可解释性。当数据充足以进行微调时,大型自监督模型显著超越前者,但牺牲了可解释性和跨领域泛化能力。

🔬 方法详解

问题定义:本文旨在解决构图分析中学习有意义的视觉表示的不足,现有方法存在语义偏差,导致构图理解的效果不理想。

核心思路:论文提出的核心思路是结合人类启发的方法与大型自监督模型,通过感知分组和图注意力网络来捕捉视觉元素之间的空间关系,从而提高构图分析的准确性和可解释性。

技术框架:整体架构包括两个主要模块:人类启发的对象中心模型用于区域级分解,图注意力网络用于捕捉元素间的空间关系。实验中还使用了大型构图数据集来微调基础模型。

关键创新:最重要的技术创新点在于将人类启发的构图分析方法与大型自监督模型相结合,形成了一种新的分析框架,显著提高了构图分析的性能和可解释性。

关键设计:在设计中,采用了冻结编码器以保持可解释性,同时在数据充足时进行微调以提升模型性能,损失函数和网络结构的选择也经过精心设计,以适应构图分析的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,人类启发的方法在构图评分和类别预测上表现出竞争力,尤其在可解释性方面优于大型自监督模型。微调后的自监督模型在数据充足时的性能提升显著,具体提升幅度未知,但在构图图像检索和视觉显著性检测任务中表现优异。

🎯 应用场景

该研究的潜在应用领域包括艺术作品的自动分析、图像检索系统以及视觉内容的情感分析等。通过提高构图分析的准确性和可解释性,该方法能够为艺术教育、博物馆展览和数字内容创作提供有价值的支持,未来可能影响视觉艺术领域的研究和应用。

📄 摘要(原文)

Composition, the deliberate arrangement of visual elements, is central to how meaning, emotion, and aesthetic quality are conveyed in artwork, yet it remains among the least formalized dimensions of visual understanding. Prior work highlights a persistent gap in learning meaningful compositional representations, attributing it to semantic bias and suggesting that human-inspired approaches may be key. We compare two parallel paradigms for composition analysis: a human-inspired method grounded in perceptual grouping, and fine-tuned foundation models enabled by recent large-scale compositional datasets. The human-inspired approach uses object-centric models for region-level decomposition and a graph attention network to capture spatial relationships between elements. Both paradigms are evaluated on composition score/category prediction, compositional image retrieval, and visual saliency detection. With frozen encoders, the human-inspired method achieves competitive performance while remaining interpretable. When sufficient data enables fine-tuning, large self-supervised models outperform significantly, but at the cost of interpretability and cross-domain generalization.