ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

📄 arXiv: 2608.24103v1 📥 PDF

作者: JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

分类: cs.AI

发布日期: 2026-08-25

备注: 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)


💡 一句话要点

提出ACE以解决多幻灯片演示自动化中的布局问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多幻灯片演示 自我纠正机制 层次场景图 内容感知路由器 大型语言模型

📋 核心要点

  1. 现有的设计平台在处理遗留文档格式时,面临布局破坏和缺乏真实标准的问题。
  2. ACE通过层次场景图和内容感知路由器,优化了多幻灯片演示的编辑过程,并引入自我纠正机制。
  3. 实验显示,ACE在指令跟随任务中表现优异,速度提升1.75倍,成本降低约44%。

📝 摘要(中文)

商业设计平台越来越多地通过大型语言模型(LLM)代理编辑文档,但由于遗留文档格式仅暴露平面元素,导致代理需要重新计算坐标并经常破坏布局。此外,设计缺乏唯一的真实标准,使得基于参考的差异度量惩罚有效但不同的输出。本文提出了ACE,一个基于层次场景图的代理画布编辑器,配备了专门针对演示的98种工具的动作空间,以及一个内容感知路由器CARE,显著减少输入令牌。ACE还引入了自我纠正循环,通过无真实标准的指令跟随评估者提供自然语言反馈,作为下一步指令。实验结果表明,ACE在指令跟随和成本效益上均优于现有方法。

🔬 方法详解

问题定义:本论文旨在解决多幻灯片演示自动化中的布局破坏和缺乏真实标准的问题。现有方法在处理遗留文档格式时,常常需要重新计算元素坐标,导致布局不稳定,同时设计输出缺乏统一的评估标准。

核心思路:ACE通过构建一个层次场景图和专门的动作空间,结合内容感知路由器,优化了编辑过程。此外,自我纠正机制使得代理能够根据自然语言反馈进行调整,从而提高输出质量。

技术框架:ACE的整体架构包括三个主要模块:层次场景图编辑器、内容感知路由器(CARE)和自我纠正循环。层次场景图用于管理元素的层次关系,CARE负责筛选输入内容,自我纠正循环则通过指令跟随评估者的反馈进行优化。

关键创新:ACE的主要创新在于引入了自我纠正机制和内容感知路由器,这使得代理能够在没有真实标准的情况下,依然能够有效地优化输出质量。与现有方法相比,ACE在指令跟随的准确性和效率上都有显著提升。

关键设计:ACE的设计中,动作空间包含98种工具,内容感知路由器实现了约89%的输入令牌减少。自我纠正机制通过自然语言反馈进行迭代,确保输出质量的持续提升。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,ACE在94项任务基准测试中的指令跟随得分为4.23,相较于传统方法的3.81有显著提升,且速度提高了1.75倍,成本降低约44%。此外,26名盲评者中58.7%选择ACE为更优方案,自我纠正输出的偏好率达到81%。

🎯 应用场景

ACE的研究成果在多种领域具有潜在应用价值,包括教育、商业演示和在线内容创作等。通过自动化演示文稿的编辑过程,ACE能够显著提高工作效率,降低设计成本,未来可能在更多设计平台中得到广泛应用。

📄 摘要(原文)

Commercial design platforms increasingly edit documents through large language model (LLM) agents, but two practical problems block reliable deployment: legacy document formats expose only \emph{flat}, absolutely positioned elements, so agents must recompute coordinates and routinely break layouts; and design has no unique ground truth, so diff-against-reference metrics penalize valid-but-different outputs. We present \textbf{ACE}, an agentic canvas editor over a \emph{hierarchical scene-graph} with a presentation-specialized action space (98 tools), paired with \textbf{CARE}, a content-aware router that feeds the agent only the relevant slice of each deck (avg.\ $\sim$89\% input-token reduction), and a \emph{self-correction} loop driven by a \emph{ground-truth-free} instruction-following (IF) judge whose natural-language critique is fed back as the next-turn instruction. With a fixed backbone, a scene-graph editor in a \emph{single turn} already matches a same-backbone \emph{agentic} HTML pipeline that iterates internally; adding self-correction lifts ACE significantly above it on instruction following (IF 4.23 vs.\ 3.81 on the full 94-task benchmark, paired $p{=}.010$, replicated by an out-of-loop judge) at 1.75$\times$ the speed and $\sim$44\% lower cost. VQ means are statistically indistinguishable, but 26 blind raters prefer ACE overall (58.7\% decisive win-rate) and prefer the self-corrected output 81\% of the time; the ranking is invariant across three judge families, and out-of-loop judges retain two-thirds of the self-correction gain, bounding circularity. 66\% of cases halt after one pass, and a strict-peak rollback removes every observed regression.