Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

📄 arXiv: 2608.05541v1 📥 PDF

作者: Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

分类: cs.AI

发布日期: 2026-08-06

备注: 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES

🔗 代码/项目: GITHUB


💡 一句话要点

提出Hyper-ES以解决大规模语言模型推理中的优化效率问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 进化策略 大规模语言模型 优化算法 梯度微调 数学推理 CMA-ES 子空间优化

📋 核心要点

  1. 现有的进化策略在高维参数空间中表现不佳,导致优化过程不稳定,难以有效应用于大规模语言模型。
  2. Hyper-ES通过少量梯度微调获取有效的下降方向,并在此基础上优化合并系数,从而提高了优化效率。
  3. 在多个数学推理数据集上,Hyper-ES的性能比GRPO-LoRA提升了1%,且减少了10%的梯度更新空间需求。

📝 摘要(中文)

进化策略(ES)作为一种有前景的替代方案,适用于资源受限的大规模语言模型(LLM)推理。然而,直接将ES应用于数十亿参数的LLM效果不佳,因为在高维参数空间中,大多数随机扰动与有效更新方向几乎正交,导致优化不稳定。我们提出了Hyper-ES,一个基于子空间的ES框架,避免了全参数搜索中的ES弱点,同时利用其在低维优化中的优势。Hyper-ES通过少量的低成本基于梯度的微调运行获取下降方向,并利用CMA-ES优化该子空间内的层级DARE-TIES合并系数,从而使ES能够在有意义的下降方向组合上进行搜索。实验结果表明,Hyper-ES在多个数学推理数据集上表现优于GRPO-LoRA,且所需的梯度更新空间减少了10%。

🔬 方法详解

问题定义:本论文旨在解决在数十亿参数的大规模语言模型中,进化策略(ES)在高维参数空间中优化效率低下的问题。现有方法在随机扰动与有效更新方向之间存在几乎正交的关系,导致优化不稳定。

核心思路:我们提出Hyper-ES,通过少量的梯度微调获取有效的下降方向,形成一个紧凑的适应子空间。然后,利用CMA-ES在该子空间内优化层级DARE-TIES合并系数,使得ES能够在有意义的下降方向组合上进行搜索,而不是在全模型的随机扰动上进行搜索。

技术框架:Hyper-ES的整体架构包括两个主要阶段:首先进行少量的梯度微调以获取下降方向,其次在这些方向的组合上应用CMA-ES进行优化。该框架有效结合了梯度方法和进化策略的优点。

关键创新:Hyper-ES的核心创新在于通过低维优化避免了全参数搜索中的ES弱点,利用梯度微调获取的下降方向形成适应子空间,从而提升了优化的稳定性和效率。

关键设计:在Hyper-ES中,关键的参数设置包括梯度微调的次数和CMA-ES的合并系数优化策略,确保了在子空间内的有效搜索和组合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,Hyper-ES在三个Qwen2.5-Instruct和DeepSeek-R1-Distill基础模型上进行了评估,结果显示其性能比GRPO-LoRA提升了1%,同时减少了10%的梯度更新空间需求,验证了其优化效率的显著提升。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能问答系统和其他需要高效推理的大规模语言模型。Hyper-ES的设计能够在资源受限的环境中提升模型的推理能力,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Evolution Strategy (ES) is a promising alternative to gradient-based fine-tuning for resource-constrained Large Language Model (LLM) reasoning. However, directly applying ES to billion-parameter LLMs is highly ineffective. In such high-dimensional parameter spaces, most random perturbations are nearly orthogonal to useful update directions, leading to unstable optimization. We propose Hyper-ES, a subspace-based ES framework that avoids the weakness of ES in full-parameter search while exploiting its strength in low-dimensional optimization. Instead of asking ES to discover useful directions from random perturbations in the LLM parameter space, Hyper-ES first performs a small number of inexpensive gradient-based fine-tuning runs to obtain descent directions. Although each direction may provide only a limited improvement on its own, their span forms a compact adaptation subspace that captures useful reasoning updates. Hyper-ES then applies CMA-ES to optimize layer-wise DARE-TIES merging coefficients within this subspace, allowing ES to search over combinations of meaningful descent directions rather than over arbitrary full-model perturbations. We evaluate Hyper-ES on three Qwen2.5-Instruct and DeepSeek-R1-Distill backbones across six mathematical reasoning datasets. Results show that Hyper-ES consistently outperforms GRPO-LoRA by 1% while requiring 10% fewer space-consuming gradient updates. Code at https://github.com/kuangrepi/Hyper-ES.