Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

📄 arXiv: 2608.16620v1 📥 PDF

作者: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

分类: cs.CL, cs.AI

发布日期: 2026-08-17

备注: 12 pages


💡 一句话要点

提出Palmyra x6以优化企业导向的智能代理任务

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 工具使用 监督微调 企业智能 模型优化

📋 核心要点

  1. 现有的语言模型在企业导向的智能代理任务中表现不足,尤其是在工具使用的有效性和安全性方面。
  2. 论文提出了一种基于Mixture-of-Experts模型的后训练方法,通过锚定监督微调来优化工具使用轨迹,从而提升模型的代理能力。
  3. 实验结果显示,Palmyra x6在Writer Agent任务上显著优于之前的模型,并在多个基准测试中取得了最高分,验证了其有效性。

📝 摘要(中文)

Palmyra x6是一种大型语言模型,专为企业导向的智能代理任务优化。该模型通过在经过验证的合成工具使用轨迹的紧凑语料库上进行锚定监督微调,基于Mixture-of-Experts基础模型进行后训练。模型采用保守且可控的训练策略,包括626条轨迹、单个训练周期、低学习率和对冻结基础模型的KL锚定。与之前的默认模型相比,Palmyra x6在Writer Agent任务上表现出显著提升,并在多个公共基准测试中表现良好,在BFCL Core上得分为0.785,并在六个基准的平均分中名列前茅。此外,该模型在偏见和安全性评估中表现出竞争力或领先地位。

🔬 方法详解

问题定义:本论文旨在解决现有语言模型在企业导向的智能代理任务中表现不足的问题,尤其是在工具使用的有效性和安全性方面。现有方法在处理复杂任务时常常缺乏足够的适应性和准确性。

核心思路:论文的核心解决思路是通过在经过验证的合成工具使用轨迹上进行锚定监督微调,来优化Mixture-of-Experts基础模型。这种方法旨在提高模型在特定任务上的表现,同时保持训练过程的可控性。

技术框架:整体架构包括一个Mixture-of-Experts基础模型,后续通过锚定监督微调进行优化。训练过程中使用了626条工具使用轨迹,设置了低学习率和KL锚定,以确保模型的稳定性和有效性。

关键创新:最重要的技术创新点在于采用了锚定监督微调策略,这种方法在训练过程中对基础模型进行了有效的约束,从而提升了模型的性能和安全性。这与传统的无监督或简单监督训练方法有本质区别。

关键设计:在训练过程中,采用了626条轨迹和单个训练周期,设置了较低的学习率以避免过拟合,并使用KL散度作为锚定损失函数,以确保模型在学习过程中保持对基础模型的依赖。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Palmyra x6在Writer Agent任务上显著优于之前的默认模型,并在多个公共基准测试中表现出色,特别是在BFCL Core上得分为0.785,且在六个基准的平均分中名列前茅,展示了其卓越的性能和竞争力。

🎯 应用场景

该研究的潜在应用领域包括企业智能助手、自动化工具使用和人机交互等。Palmyra x6的优化能力使其能够在复杂的企业环境中执行多种任务,提升工作效率和安全性。未来,该模型可能在更多领域得到应用,如客户服务、数据分析和决策支持等。

📄 摘要(原文)

Palmyra x6 is a large language model optimized for use with enterprise-oriented agentic tasks. The model was built by post-training a Mixture-of-Experts base model with Anchored Supervised Fine-Tuning on a compact corpus of verified, synthetic tool-use trajectories, optimized with a Muon + Adam hybrid. The recipe is deliberately conservative and deliberately controlled: 626 trajectories, a single epoch, a low learning rate, and a KL anchor to the frozen base. The model shows substantial gains over the previous default model for Writer Agent, and compares favorably with several recent models on public benchmarks, scoring the highest on BFCL Core at $0.785$ and posts the highest six-benchmark mean of the cohort. Furthermore, the model has shown itself to be competitive or leading relative to comparators in our bias and safety evaluations.