DensFiLM: Density-Conditioned Video Saliency for Crowd Scenes

📄 arXiv: 2607.25465v1 📥 PDF

作者: Anis Ur Rahman

分类: cs.CV

发布日期: 2026-07-28

备注: 12 pages, 2 figures, 3 tables

🔗 代码/项目: GITHUB


💡 一句话要点

提出DensFiLM以解决人群场景视频显著性建模问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 视频显著性 人群密度 特征调制 Swin Transformer 深度学习

📋 核心要点

  1. 现有视频显著性模型在处理人群场景时未考虑密度变化,导致注意力分配不合理。
  2. DensFiLM通过引入密度条件的特征线性调制层,动态调整显著性特征的重建过程。
  3. 实验结果表明,DensFiLM在CrowdFix数据集上显著提升了显著性预测性能,验证了其有效性。

📝 摘要(中文)

视频显著性模型通常在拥挤场景中应用单一的注视策略,尽管注意力随着人群密度的变化而系统性变化。稀疏场景鼓励跟踪个体,而密集场景则将注意力转向集体运动和场景级地标。我们提出DensFiLM,一种密度条件的视频显著性模型,在视频Swin Transformer的瓶颈处插入轻量级的特征线性调制层。通过学习的密度嵌入生成通道级的缩放和偏移参数,使解码器能够从为每个密度状态选择的特征中重建显著性。该模块仅增加约10万参数,并可以使用CrowdFix密度标签或模型自身的密度预测。在CrowdFix上,DensFiLM在四个种子上实现了平均NSS 1.434和CC 0.517,分别比ACLNet提高了14.7%和14.9%。

🔬 方法详解

问题定义:论文旨在解决现有视频显著性模型在拥挤场景中未能有效考虑人群密度变化的问题,导致注意力分配不合理,影响显著性预测的准确性。

核心思路:DensFiLM通过引入密度条件的特征线性调制层,利用学习到的密度嵌入生成通道级的缩放和偏移参数,从而使解码器能够根据不同密度状态选择特征进行显著性重建。

技术框架:整体架构基于视频Swin Transformer,主要模块包括特征提取、密度嵌入生成、特征调制和显著性重建。特征提取模块负责从视频帧中提取特征,密度嵌入生成模块根据输入密度生成调制参数,最后通过调制后的特征进行显著性重建。

关键创新:最重要的技术创新在于引入了密度条件的特征线性调制层,使得模型能够根据人群密度动态调整显著性特征的重建过程,这与现有方法的静态特征处理形成了本质区别。

关键设计:模型仅增加约10万参数,使用CrowdFix密度标签或模型自身的密度预测进行训练,实验中还验证了RAFT光流和更大时间及社会力扩展的影响,结果表明这些设计未能进一步提升性能。实验还通过中心优先减法诊断显示,密度条件化相比于未条件化的基础模型在NSS上获得了显著提升。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

DensFiLM在CrowdFix数据集上实现了平均NSS 1.434和CC 0.517,分别比ACLNet提高了14.7%和14.9%。此外,密度条件化在中心优先减法诊断中显示出0.462的NSS增益,表明其有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括智能监控、交通流量分析和人群行为理解等。通过更准确地预测人群场景中的显著性,可以帮助系统更好地识别重要事件和行为,从而提升安全性和效率。未来,该模型的设计理念也可以扩展到其他动态场景的显著性检测任务中。

📄 摘要(原文)

Video saliency models typically apply a single fixation strategy across crowd scenes, despite systematic changes in attention with crowd density. Sparse scenes encourage tracking individuals, whereas dense scenes shift attention toward collective motion and scene-level landmarks. We introduce DensFiLM, a density-conditioned video saliency model that inserts a lightweight Feature-wise Linear Modulation layer at the bottleneck of a Video Swin Transformer. A learned density embedding produces channel-wise scale and shift parameters, allowing the decoder to reconstruct saliency from features selected for each density regime. The module adds only ~100K parameters and can use either CrowdFix density labels or the model's own density prediction. On CrowdFix, DensFiLM achieves mean NSS 1.434 and CC 0.517 over four seeds, improving over ACLNet by 14.7% and 14.9%, respectively, while predicted-density conditioning matches oracle-label performance. Ablations show that explicit RAFT optical flow and larger temporal and social-force extensions provide no further improvement in this setting. In a centre-prior-subtraction diagnostic, density conditioning yields an NSS gain of 0.462 over the unconditioned backbone, compared with 0.124 under standard evaluation. These results show that lightweight bottleneck conditioning provides a more effective inductive bias than increasing model capacity for crowd-video saliency. Our code is available at https://github.com/aniskhan25/crowdfix-saliency.