AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation
作者: Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li
分类: cs.CV
发布日期: 2026-08-21
备注: 8 pages, 6 figures. Accepted by ACM Multimedia 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出AGIDefect-4K数据集以解决AI生成图像缺陷检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: AI生成图像 缺陷检测 数据集构建 多模态学习 质量评估
📋 核心要点
- 现有的AI生成图像评估方法在缺陷诊断方面仍显不足,缺乏全面的检测和解释机制。
- 论文提出AGIDefect-4K数据集,包含丰富的缺陷注释,结合多模态大型语言模型实现缺陷检测和解释。
- 实验结果表明,AGI缺陷理解依然具有挑战性,AGIDefect-4K数据集为未来研究提供了重要基础。
📝 摘要(中文)
生成性人工智能(Generative AI)能够生成高度逼真的图像,但当前模型仍存在微妙但关键的缺陷,影响其可靠性。尽管现有的AI生成图像(AGI)评估基准取得了一定进展,但全面的AGI缺陷诊断仍未得到充分探索。为此,我们引入AGIDefect-4K,这是一个包含4000张来自15种先进生成模型的丰富注释数据集,涵盖开源和闭源系统。AGIDefect-4K具有分层缺陷注释,包括缺陷存在的检测标签、定位缺陷区域的像素级分割掩码,以及详细的文本解释,描述缺陷类型及其感知影响。每张图像还附有整体质量评分。基于此,我们提出了AGIDA(AGI缺陷助手),这是一个利用多模态大型语言模型(MLLMs)进行缺陷检测、定位、解释和质量预测的基线框架。对AGIDefect-4K的全面基准测试表明,AGI缺陷理解仍然具有挑战性,突显了该数据集的价值。
🔬 方法详解
问题定义:本论文旨在解决AI生成图像中存在的缺陷检测与诊断问题。现有方法在缺陷识别和解释方面存在不足,无法全面评估生成图像的质量。
核心思路:论文提出AGIDefect-4K数据集,提供分层次的缺陷注释,包括缺陷检测、定位和详细解释,旨在为AGI缺陷理解提供丰富的数据支持。
技术框架:整体架构包括数据集构建、缺陷检测模型(AGIDA)以及多模态语言模型的应用。数据集中的每张图像都附有缺陷标签、分割掩码和质量评分,AGIDA框架则整合了检测、定位和解释功能。
关键创新:最重要的技术创新在于AGIDefect-4K数据集的构建及其分层注释方式,提供了比现有方法更为全面的缺陷理解能力。
关键设计:在模型设计中,采用了多模态大型语言模型,结合图像特征和文本信息进行联合学习,优化了缺陷检测和质量预测的性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,AGIDA在AGIDefect-4K数据集上的表现仍然面临挑战,尤其是在缺陷理解方面。尽管如此,该框架为未来的研究提供了基线,强调了数据集在推动AGI缺陷诊断领域的重要性。
🎯 应用场景
该研究的潜在应用领域包括生成图像的质量控制、自动化内容审核以及AI生成内容的安全性评估。通过提供全面的缺陷检测和解释机制,AGIDefect-4K数据集能够帮助开发更可靠的生成模型,提升生成内容的可信度和用户体验。
📄 摘要(原文)
Generative AI can now produce highly realistic images, yet current models still exhibit subtle but critical defects that undermine their reliability. While existing AI-generated image (AGI) evaluation benchmarks have made notable progress, comprehensive AGI defect diagnosis remains underexplored. To bridge this gap, we introduce AGIDefect-4K, a richly annotated dataset of 4,000 images from 15 state-of-the-art generative models spanning both open-source and closed-source systems. AGIDefect-4K features hierarchical defect annotations: (1) detection labels identifying whether defects exist, (2) pixel-level segmentation masks localizing defective regions, and (3) detailed textual explanations characterizing defect types and their perceptual impact. Each image is further annotated with an overall quality score. Building on this, we present AGIDA (AGI Defect Assistant), a baseline framework leveraging Multimodal Large Language Models (MLLMs) for joint defect detection, localization, explanation, and quality prediction. Comprehensive benchmarking on AGIDefect-4K reveals that AGI defect understanding remains challenging, underscoring the value of this dataset. The dataset is publicly available at https://github.com/sxfly99/AGIDefect-4K.