SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

📄 arXiv: 2608.17514v1 📥 PDF

作者: Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

分类: cs.CV, cs.MM

发布日期: 2026-08-18


💡 一句话要点

提出SE-MoLoRA以解决摄影评估中的语义与美学判断纠缠问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 摄影评估 多模态学习 参数高效 模块化设计 正交正则化

📋 核心要点

  1. 现有的视觉语言模型在提供摄影评估时,常常无法有效分离语义内容与美学判断,导致评估结果不够精准。
  2. SE-MoLoRA通过共享LoRA专家和路由适配器的设计,将一般摄影知识与专业判断分离,从而实现更高效的领域特定评估。
  3. 实验结果显示,SE-MoLoRA在评估生成任务中显著提升了性能,并在参数使用上优于传统方法,展示了其有效性。

📝 摘要(中文)

视觉语言模型能够流畅地描述图像,但在提供可操作的摄影评估时常常失败,因为语义内容与美学判断相互纠缠。我们提出了SE-MoLoRA,这是一种模块化的参数高效适应框架,专注于领域特定的摄影评估。该方法通过始终激活的共享LoRA专家和针对构图、光照及技术质量的路由适配器,将一般摄影知识与专业残差判断分离。轻量级查询路由器选择相关专家,实现针对性评估,而无需训练单独的完整模型。实验结果表明,SE-MoLoRA在保留的评估生成任务中,BERTScore-F1从0.2317提升至0.4215,并在84.6%的成对比较中被偏好,同时使用的活跃参数少于单独的专家模型。

🔬 方法详解

问题定义:本论文旨在解决现有视觉语言模型在摄影评估中无法有效分离语义内容与美学判断的问题,导致评估结果缺乏可操作性和准确性。

核心思路:SE-MoLoRA的核心思路是通过模块化设计,将一般摄影知识与领域特定的专业判断分开,利用共享LoRA专家和路由适配器实现高效的适应性评估。

技术框架:整体架构包括一个始终激活的共享LoRA专家和多个针对特定评估维度(如构图、光照和技术质量)的路由适配器。轻量级查询路由器负责选择合适的专家进行针对性评估。

关键创新:最重要的技术创新在于共享专家与专业适配器的分解设计,以及引入正交正则化惩罚以促进表示的解耦,这与现有方法的单一模型设计形成鲜明对比。

关键设计:在参数设置上,使用了秩为64的共享适配器和秩为32的专业适配器,正则化损失函数设计为正交形式,以减少专家之间的重叠,确保每个适配器专注于特定的评估维度。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SE-MoLoRA在保留的评估生成任务中,BERTScore-F1从0.2317提升至0.4215,显示出显著的性能提升。此外,在84.6%的成对比较中,SE-MoLoRA被偏好,且其活跃参数数量少于单独的专家模型,展示了其高效性。

🎯 应用场景

该研究的潜在应用领域包括摄影教育、在线摄影社区和专业摄影评估服务。通过提供更精准的摄影评估,SE-MoLoRA能够帮助摄影师提升作品质量,促进摄影技术的传播与发展。未来,该框架还可扩展至其他领域的多模态评估任务。

📄 摘要(原文)

Vision-language models can describe images fluently, but they often fail to provide actionable photographic critique because semantic content and aesthetic judgment remain entangled. We propose SE-MoLoRA, a modular parameter-efficient adaptation framework for domain-specific photographic assessment. The method separates general photographic knowledge from specialist residual judgments using an always-active shared LoRA expert and routed adapters for composition, lighting, and technical quality. A lightweight query router selects the relevant specialist, enabling targeted critique without training separate full models. A rank-64 shared adapter captures broad photographic vocabulary, while rank-32 specialists learn domain-specific residuals with an orthogonal regularization penalty that encourages disentangled representations. Training data is obtained by distilling the Reddit Photo Critique Dataset into domain-labeled critique samples. On held-out critique generation, SE-MoLoRA improves BERTScore-F1 from 0.2317 to 0.4215 over monolithic LoRA and is preferred in 84.6\% of pairwise comparisons, while using fewer active parameters than separate specialist models. SVD-based ablation study shows that shared-specialist decomposition and orthogonal regularization reduce expert overlap. These results demonstrate that modular adaptation improves controllability and specificity in multimodal photographic critique.