AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
作者: Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
分类: cs.CV, cs.AI, cs.CL
发布日期: 2026-08-13
备注: Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign
💡 一句话要点
提出AutoDesign框架以优化长时程代理设计过程
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长时程设计 元工具优化 多模态生成 海报生成 自我改进系统
📋 核心要点
- 现有的设计工具系统缺乏动态适应能力,无法有效利用经验进行自我改进。
- AutoDesign框架通过元工具优化器引导代码代理,基于反馈实现工具的递归改进,符合人类设计先验。
- 在PosterBench数据集上,AutoDesign显著提升了海报生成的质量,超越了现有的商业系统,展示了其有效性。
📝 摘要(中文)
将多模态源转化为凝练且结构化的媒体输出可以被视为一个以模型-工具系统为中心的长时程代理过程。理想的工具系统应与人类设计先验相一致,并通过经验探索积累可重用的经验,以推动递归自我改进。然而,现有方法仍然静态,无法实现这一能力。本文提出了AutoDesign框架,通过元工具优化器引导代码代理基于反馈递归改进工具。我们专注于学术论文到海报生成任务,引入了PosterBench数据集,包含100篇论文的主轨道和10篇论文的子集进行控制评估。在PosterBench主轨道上,AutoDesign的得分为78.32,超越了闭源商业系统Claude Design 7.45分。通过七种控制代码代理模型配置,集成学习的DesignHarness显著提升性能,平均PosterBench得分从54.99提高到67.39(+12.4%)。在完全自主的长时程循环中,系统在40分钟内执行了253次工具调用和11次编辑,达到人类评估的平均会议海报质量。
🔬 方法详解
问题定义:本文旨在解决现有设计工具系统静态且缺乏自我改进能力的问题。这些系统无法有效利用经验进行动态调整,导致设计质量受限。
核心思路:AutoDesign框架的核心思路是通过元工具优化器引导代码代理,利用反馈信息递归改进设计工具,从而更好地符合人类的设计先验。这样的设计能够实现更高效的学习和适应。
技术框架:AutoDesign的整体架构包括元工具优化器、代码代理和反馈回路。元工具优化器负责指导代码代理的学习过程,而代码代理则根据反馈不断调整和优化设计工具。
关键创新:AutoDesign的主要创新在于引入了元工具优化器,使得设计工具能够在使用过程中不断自我改进。这一机制与传统静态设计工具的本质区别在于其动态适应能力。
关键设计:在设计过程中,AutoDesign采用了特定的损失函数来评估生成海报的质量,并通过多种参数设置优化代码代理的学习过程。此外,网络结构的设计也考虑了如何有效整合多模态信息。
🖼️ 关键图片
📊 实验亮点
在PosterBench主轨道上,AutoDesign的得分达到78.32,超越了闭源商业系统Claude Design 7.45分。通过七种控制代码代理模型配置,集成学习的DesignHarness将平均PosterBench得分从54.99提升至67.39,提升幅度达到12.4%。
🎯 应用场景
该研究的潜在应用领域包括学术界的论文展示、商业广告设计以及任何需要将复杂信息转化为视觉内容的场景。AutoDesign框架的自我改进能力将极大提高设计效率和质量,未来可能在教育、市场营销等领域产生深远影响。
📄 摘要(原文)
Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.