OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

📄 arXiv: 2607.27155v1 📥 PDF

作者: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

分类: cs.AI, cs.CL, cs.HC

发布日期: 2026-07-29


💡 一句话要点

提出OmegaUse-OfficeVal基准以评估LLM在长时间办公任务中的经济效益

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 经济基础 办公任务 基准评估 人机协作 任务设计 性能比较

📋 核心要点

  1. 现有的基准在评估LLM代理执行办公套件工作流时缺乏经济成本的考虑,限制了其实际应用。
  2. 论文提出了OmegaUse-OfficeVal基准,结合任务级经济信号,评估LLM在长时间办公任务中的表现。
  3. 实验结果显示,尽管LLM在成本和速度上优于人类,但在可交付质量上仍有待提升。

📝 摘要(中文)

大型语言模型(LLM)代理越来越被期望帮助用户完成任务。然而,现有基准在评估代理是否能够以合理成本执行办公套件工作流方面支持有限。我们引入了OmegaUse-OfficeVal,这是一个用于评估LLM代理在长时间办公任务中的基准,具有任务级经济基础。该基准包含100个任务,源自实践者提出的办公套件请求,并通过隐私保护过程进行了调整。这些任务平均需要2.32小时的人力劳动完成。基准的一个重要特征是每个任务都配有两个经济信号:人力劳动时间和任务价格代理。这些信号使得人类成本与LLM推理成本之间的直接比较成为可能,并支持价值加权评估。为了支持稳定评估,我们开发了基于代码的细粒度评分标准的验证器。我们评估了几种前沿LLM以及人类基线。尽管所有评估的LLM在成本和速度上显著优于人类工人,但在可交付质量上尚未接近人类水平。代码和数据集已完全开源,更多信息可在我们的项目网站上找到。

🔬 方法详解

问题定义:本论文旨在解决现有基准在评估LLM代理执行办公任务时缺乏经济成本考量的问题。现有方法无法有效比较人类与LLM在任务执行中的效率与成本。

核心思路:论文提出的OmegaUse-OfficeVal基准通过引入任务级经济信号(人力劳动时间和任务价格代理),使得对比人类成本与LLM推理成本成为可能,从而提供更全面的评估。

技术框架:该基准包含100个办公任务,经过隐私保护处理,并配有细粒度评分标准的代码验证器。评估过程包括对多种前沿LLM的测试与人类基线的比较。

关键创新:最重要的创新在于将经济信号与任务评估结合,使得评估不仅限于时间和成本,还考虑了任务的经济价值。这一设计与现有方法的本质区别在于引入了经济基础的评估维度。

关键设计:在任务设计中,明确了每个任务的完成时间和价格代理,并通过细粒度的评分标准确保评估的稳定性与准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所有评估的LLM在成本和速度上显著优于人类工人,LLM的推理成本平均降低了70%以上。然而,尽管在效率上有所提升,LLM的可交付质量仍未达到人类水平,表明在实际应用中仍需进一步改进。

🎯 应用场景

该研究的潜在应用领域包括办公自动化、智能助手开发和人机协作系统。通过提供经济基础的评估,能够帮助企业更好地选择和优化LLM代理的使用,提升工作效率和降低成本。未来,该基准可能推动更多经济驱动的AI应用研究。

📄 摘要(原文)

Large language model (LLM) agents are increasingly expected to assist users in completing tasks. However, existing benchmarks provide limited support for evaluating whether agents can carry out office-suite workflows at a reasonable cost. We introduce OmegaUse-OfficeVal, a benchmark for evaluating LLM agents on long-horizon office-suite tasks with task-level economic grounding. The benchmark comprises 100 tasks derived from office-suite requests proposed by practitioners and adapted through a privacy-preserving process. On average, these tasks require 2.32 hours of human labor to complete. An important feature of the benchmark is that each task is paired with two economic signals: human labor time and task price proxy. These signals enable direct comparisons between human costs and LLM inference costs, as well as value-weighted evaluation. To support stable evaluation, we develop code-based verifiers from fine-grained rubrics. We evaluate several frontier LLMs together with a human baseline. Although all evaluated LLMs are substantially cheaper and faster than human workers, they have not yet approached human-level deliverable quality. The code and dataset are fully open-sourced, and more information is available on our project website: https://omegause-officeval.github.io.