DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

📄 arXiv: 2607.25675v1 📥 PDF

作者: Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao

分类: cs.AI

发布日期: 2026-07-28


💡 一句话要点

提出DecoEvo以解决文本空间优化中的评估瓶颈问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本空间优化 大型语言模型 求解器技能 评估生成器 解耦进化 自然语言处理 开放式任务

📋 核心要点

  1. 现有文本空间优化方法在评估上固定不变,导致求解器在某些维度的进步无法被优化信号捕捉。
  2. DecoEvo通过解耦求解器技能和评估生成器技能的目标,避免了依赖当前求解器分数的评估更新,从而更有效地识别求解器的弱点。
  3. 在五个基准测试中,DecoEvo相较于SkillOpt实现了2.8%至5.0%的相对提升,显示出其优越的性能。

📝 摘要(中文)

文本空间优化通过编辑外部自然语言文档来适应大型语言模型(LLMs),使得优化后的文档可检查且模型可视为黑箱。然而,现有方法在评估上往往固定不变,这在开放式任务中可能成为瓶颈。为了解决这一问题,本文提出了DecoEvo(解耦共同进化),该方法在不使用黄金标准评估的情况下,共同进化求解器技能和评估生成器技能。求解器技能通过标准级反馈进行更新,而评估生成器技能则通过独立于求解器总分的补充审计进行修订。实验结果表明,DecoEvo在五个基准测试和三个LLM基础上均优于所有比较方法,平均相较于SkillOpt提升了2.8%至5.0%。

🔬 方法详解

问题定义:本文旨在解决文本空间优化中评估固定导致的求解器进步不可见的问题。现有方法在求解器技能提升时,未能有效更新评估标准,造成优化信号的缺失。

核心思路:DecoEvo通过解耦求解器与评估生成器的进化目标,采用独立的反馈机制,使得求解器的更新不再依赖于当前的评估分数,从而更精准地识别并改进求解器的弱点。

技术框架:该方法包括两个主要模块:求解器技能更新和评估生成器技能修订。求解器通过标准级反馈进行更新,而评估生成器则通过独立的审计机制进行修订,确保更新聚焦于求解器的新弱点。

关键创新:DecoEvo的核心创新在于其解耦的进化机制,避免了传统方法中因求解器分数变化而导致的评估标准不可靠更新,从而提高了优化的有效性。

关键设计:在设计中,求解器技能的更新依赖于标准级反馈,而评估生成器的修订则通过对需求覆盖和响应区分的审计进行,确保了评估的全面性和准确性。具体的损失函数和网络结构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DecoEvo在五个基准测试中均超越了所有对比方法,平均相较于SkillOpt提升了2.8%至5.0%。这一显著的性能提升表明,解耦的共同进化机制在文本空间优化中具有重要的实际价值。

🎯 应用场景

该研究的潜在应用领域包括教育评估、自动化内容生成和智能问答系统等。通过提高求解器与评估生成器的协同进化能力,DecoEvo能够在多种开放式任务中实现更高效的优化,未来可能对自然语言处理领域产生深远影响。

📄 摘要(原文)

Text-space optimization adapts large language models (LLMs) by editing external natural-language artifacts rather than model weights, so the optimized artifacts remain inspectable and the model can be treated as a black box. However, most existing text-space methods keep evaluation fixed. On open-ended tasks, this can become a bottleneck: once the solver improves on the criteria a rubric measures, omitted dimensions remain invisible to the optimization signal. Simply evolving the rubric is also unreliable when updates are selected by the current solver's score, because apparent progress can come from making the rubric easier to satisfy. We introduce DecoEvo (Decoupled Co-Evolution), which co-evolves a solver skill and a rubric-generator skill under decoupled objectives without using gold rubrics during optimization. The solver skill is updated using criterion-level feedback, while the rubric-generator skill is revised through complementary audits of requirement coverage and response discrimination that are independent of aggregate solver score. This separation focuses generator updates on newly exposed solver weaknesses, reducing repeated emphasis on criteria the solver already satisfies. Under each benchmark's official evaluation, DecoEvo outperforms all compared methods across five benchmarks and three LLM backbones, yielding 2.8--5.0\% relative gains over SkillOpt in the five-benchmark average.