Can Bayesian Optimization Efficiently Find a Strong Single Expert in Neural Thickets?

📄 arXiv: 2608.10867v1 📥 PDF

作者: Nigel Bastian Cendra, Abdelhamid Ezzerg, Fernando Julio Cendra, Jeremias Knoblauch, Jakob Zeitler

分类: cs.LG

发布日期: 2026-08-11


💡 一句话要点

提出贝叶斯优化以高效寻找强单一专家模型

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 贝叶斯优化 无梯度后训练 大型语言模型 高斯过程 结构化搜索 模型优化 候选评估

📋 核心要点

  1. 现有的无梯度后训练方法在优化大型语言模型时成本高昂,效率亟待提升。
  2. 本文提出通过贝叶斯优化在权重空间的随机线性嵌入中进行结构化搜索,以识别强单一专家。
  3. 实验结果表明,使用贝叶斯优化的候选评估次数减少五倍,性能与RandOpt相当或更优,显示出显著的成本效益。

📝 摘要(中文)

无梯度后训练已成为大型语言模型(LLMs)优化的有力替代方案,但现有方法仍然成本高昂。本文探讨在适度评估预算下,结构化搜索是否能识别出强单一专家。基于有用权重更新位于低维子空间的证据,我们在权重空间的随机线性嵌入中应用贝叶斯优化。该方法无需反向传播,并利用高斯过程代理高效指导候选评估。在多个推理基准上,使用五倍更少的候选评估次数,贝叶斯优化的表现与RandOpt相当或更优。这些结果表明,代理引导搜索可以显著降低无梯度后训练的评估成本,同时产生更强的可部署单一专家。

🔬 方法详解

问题定义:本文旨在解决现有无梯度后训练方法在优化大型语言模型时的高成本问题。现有方法通常依赖于大量的候选评估,导致效率低下。

核心思路:论文提出通过贝叶斯优化在随机线性嵌入的权重空间中进行结构化搜索,旨在高效识别出强单一专家,而无需反向传播。

技术框架:整体架构包括权重空间的随机线性嵌入、高斯过程代理模型和候选评估模块。通过高斯过程模型指导评估过程,减少不必要的计算。

关键创新:最重要的技术创新在于使用高斯过程作为代理模型,显著提高了候选评估的效率,与传统的随机优化方法相比,能够在更少的评估次数下达到相似或更好的性能。

关键设计:在参数设置上,采用了适度的评估预算和随机线性嵌入的策略,确保了搜索过程的高效性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用贝叶斯优化的候选评估次数减少了五倍,且在多个推理基准上,性能与RandOpt相当或更优。这表明代理引导搜索在无梯度后训练中具有显著的成本效益。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的优化和后训练过程,尤其是在资源受限的环境中。通过降低评估成本,研究成果有助于更广泛的模型部署和应用,推动智能系统的普及与发展。

📄 摘要(原文)

Gradient-free post-training has emerged as a compelling alternative to gradient-based optimization for large language models (LLMs), but existing approaches remain costly. We ask whether structured search can identify a strong single expert under a modest evaluation budget. Motivated by evidence that useful weight updates lie in low-dimensional subspaces, we apply Bayesian optimization within a random linear embedding of weight space. Our method requires no backpropagation and uses a Gaussian process surrogate to guide candidate evaluations efficiently. Across several reasoning benchmarks with Qwen2.5-Instruct models from 0.5B to 3B parameters, Bayesian optimization using five times less candidate evaluations matches or exceeds RandOpt. These results show that surrogate-guided search can substantially reduce the evaluation cost of gradient-free post-training while producing stronger deployable single experts.