Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

📄 arXiv: 2609.01431v1 📥 PDF

作者: Zhiliang Chen, Sebastian Ament, David Eriksson, Maximilian Balandat, Eytan Bakshy, Jihao Andreas Lin

分类: cs.LG, cs.AI

发布日期: 2026-09-01


💡 一句话要点

提出PLES以高效估计超参数缩放规律

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 超参数优化 贝叶斯优化 多保真模型 计算效率 机器学习

📋 核心要点

  1. 现有方法在估计超参数缩放规律时,通常需要进行大量的训练运行,导致计算资源消耗巨大。
  2. 本文提出的幂律熵搜索(PLES)通过自适应实验,优化不确定性而非单一目标函数,从而高效估计超参数缩放规律。
  3. 实验表明,PLES在合成基准、真实LLM训练数据的代理模型以及实际LLM预训练运行中,均显著降低了计算成本。

📝 摘要(中文)

最优超参数缩放规律描述了大型语言模型(LLM)训练中最佳超参数如何随模型和数据规模变化,从而使实践者能够在生产规模下预测最佳配置,而无需进行昂贵的大规模调优。然而,传统上估计这些缩放规律需要对数千次训练运行进行全面的网格搜索,消耗巨大的计算资源。本文提出了一种基于多保真贝叶斯优化的计算成本感知获取函数——幂律熵搜索(PLES),通过自适应实验高效估计最优超参数缩放规律。PLES的关键创新在于,它搜索能够减少缩放规律估计总体不确定性的候选项,而不是优化单一目标函数。实验结果表明,PLES在所有设置下都能以不到传统网格搜索十分之一的计算预算收敛到准确的最优超参数缩放规律。

🔬 方法详解

问题定义:本文旨在解决在大型语言模型训练中,如何高效估计超参数缩放规律的问题。现有方法依赖于耗时的网格搜索,导致计算资源浪费和效率低下。

核心思路:PLES通过自适应实验选择候选配置,旨在最大程度减少缩放规律估计的不确定性,而非单纯优化某一目标。这种方法使得小规模实验更具信息量,从而提高了效率。

技术框架:PLES的整体框架包括多个阶段:首先,通过多保真贝叶斯优化建立模型;其次,在每次迭代中选择能够最大化不确定性减少的候选配置;最后,执行小规模实验以获取反馈并更新模型。

关键创新:PLES的主要创新在于其不再单一追求目标函数的优化,而是关注于缩放规律估计的不确定性降低。这一设计使得PLES在计算效率上优于传统方法。

关键设计:在PLES中,关键参数设置包括选择合适的贝叶斯优化模型和定义计算成本的权重。此外,损失函数设计为关注不确定性度量,以确保每次实验的选择都是信息丰富的。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PLES在合成基准和真实数据上均表现出色,能够在不到传统网格搜索十分之一的计算预算下,准确收敛到最优超参数缩放规律。这一成果表明PLES在效率和准确性上的显著提升,具有重要的实际应用价值。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的训练优化、机器学习模型的超参数调优等。通过减少计算资源的消耗,PLES可以帮助研究人员和工程师更高效地进行模型开发和部署,提升生产效率。未来,PLES有望在更广泛的机器学习任务中得到应用,推动智能系统的快速迭代与优化。

📄 摘要(原文)

Optimal hyperparameter scaling laws describe how the best hyperparameters for large language model (LLM) training change with model and data scale, enabling practitioners to predict optimal configurations at production scales without expensive large-scale tuning. However, estimating these scaling laws conventionally requires exhaustive grid searches over thousands of training runs, consuming enormous computational resources. We introduce Power-Law Entropy Search (PLES), a computational cost-aware acquisition function built on multi-fidelity Bayesian optimization that efficiently estimates optimal hyperparameter scaling laws through adaptive experimentation. A key innovation in PLES is that it searches for candidates that reduce the overall uncertainty of a scaling law estimate, instead of optimizing a single objective function. At each iteration, PLES selects the candidate configuration that maximally reduces the uncertainty of the scaling law estimates per unit computational cost, naturally favoring informative small-scale experiments. We evaluate PLES on synthetic benchmarks, surrogate models fitted to real LLM training data, and actual LLM pre-training runs. Across all settings, PLES converges to accurate optimal hyperparameter scaling laws using less than one-tenth of the computational budget required by conventional grid search and other baselines.