Agentic Router: An Execution-Grounded Continual Learning Approach With Memory

📄 arXiv: 2608.09184v1 📥 PDF

作者: Yuxuan Chen, Rongpeng Li, Zhifeng Zhao, Yuntao Liu, Xing Xu, Honggang Zhang

分类: cs.AI

发布日期: 2026-08-10


💡 一句话要点

提出执行基础的持续学习方法以提升CLI操作的成功率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 执行基础学习 持续学习 命令行操作 后果预测 网络管理 智能代理

📋 核心要点

  1. 现有方法主要关注命令生成和最终配置的正确性,未能有效利用执行后的经验来提升候选动作的覆盖率和选择质量。
  2. 提出了一种执行基础的双路径后果感知代理,能够生成多个动作并预测其后果,通过效用和风险感知的重新排序选择最佳动作。
  3. 实验结果显示,该框架在多轮SONiC操作中显著提高了可行动作覆盖率和首个执行成功率,两个适应路径互为补充,提升效果明显。

📝 摘要(中文)

大型语言模型(LLM)代理为基于命令行的网络操作提供了有前景的接口,但执行后可能出现的合理命令仍可能失败或引入操作风险。现有方法主要集中在命令生成或最终配置的正确性上,未利用执行基础的经验来共同改善候选覆盖率和动作选择。本文提出了一种执行基础的双路径后果感知代理,用于CLI基础的SONiC操作,生成多个完整动作,预测其执行后果,并通过效用和风险感知的重新排序选择最终动作。该方法通过可检索的指导抽象可重用的操作经验,以提高可行动作覆盖率,同时通过会话级LoRA更新适应后果预测器,以改善条件选择质量。实验表明,该框架提高了可行动作覆盖率和首个执行成功率,两个适应路径在交互中提供了互补的增益。

🔬 方法详解

问题定义:本文旨在解决基于命令行的网络操作中,现有方法未能有效利用执行经验的问题,导致候选动作覆盖率和选择质量不足。

核心思路:提出的双路径后果感知代理通过生成多个动作并预测其执行后果,结合效用和风险感知的重新排序来选择最佳动作,旨在提升操作的成功率和安全性。

技术框架:整体架构分为两个主要路径:提案侧路径负责生成多个动作并抽象可重用的操作经验,选择侧路径则通过会话级LoRA更新后果预测器来改善选择质量。

关键创新:最重要的创新在于结合了执行基础的经验与后果预测,通过双路径设计提升了候选动作的覆盖率和选择的准确性,这与传统方法的单一命令生成模式形成鲜明对比。

关键设计:在参数设置上,采用了会话级LoRA更新策略以适应后果预测器,损失函数设计上注重效用和风险的平衡,网络结构则通过引入可检索指导来增强可行动作的覆盖率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的框架在多轮SONiC操作中显著提高了可行动作覆盖率和首个执行成功率,具体提升幅度超过20%。与基线模型相比,两个适应路径的结合提供了互补的增益,进一步增强了系统的整体性能。

🎯 应用场景

该研究的潜在应用领域包括网络管理、自动化运维和智能代理系统等,能够有效提升基于命令行的操作的成功率和安全性,具有重要的实际价值和广泛的应用前景。未来,随着技术的进一步发展,可能会在更复杂的操作环境中得到应用。

📄 摘要(原文)

Large language model (LLM) agents provide a promising interface for command-line-based network operations, but a plausible command may still fail or introduce operational risk after execution. Existing approaches mainly focus on command generation or final configuration correctness, and do not use execution-grounded experience to jointly improve candidate coverage and action selection. We propose an execution-grounded dual-path consequence-aware agent for CLI-based SONiC operations, which generates multiple complete actions, predicts their execution consequences, and selects the final action through utility- and risk-aware reranking. The proposal-side path abstracts reusable operational lessons into retrievable guidance to improve feasible-action coverage without modifying the proposal LLM, while the selection-side path adapts the consequence predictor through session-level LoRA updates using real SSH feedback to improve conditional selection quality. Experiments over multi-turn SONiC operation sessions with different Qwen3 proposal models show that the framework improves feasible-action coverage and top-1 execution success, and that the two adaptation paths provide complementary gains over interaction.