Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents
作者: Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou
分类: cs.AI, cs.CL
发布日期: 2026-08-20
备注: 34 pages, 28 figures, 7 tables
💡 一句话要点
提出跨任务技能转移方法以提升LLM代理的能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨任务技能转移 大型语言模型 技能诱导 任务执行 技能效用评分
📋 核心要点
- 现有方法在跨任务技能转移时存在不可靠性,可能导致代理性能下降,尤其是在任务级别技能诱导时。
- 论文提出通过比较任务级别与子任务级别的技能诱导,以及文本与代码技能格式,来优化技能转移效果。
- 实验结果表明,子任务级别技能诱导能够提升代理性能,且文本技能的转移效果优于代码技能,提出的技能效用评分与任务成功率相关性强。
📝 摘要(中文)
大型语言模型(LLM)代理能够从已完成的任务中诱导技能并在后续任务中重用这些技能,从而随着经验的积累而变得更为强大。然而,诱导的技能在跨任务转移时可能不可靠,甚至可能对代理造成负面影响。本文通过全面的控制研究,探讨了技能诱导方式如何影响其在任务间的转移。研究发现,子任务级别的技能诱导相较于任务级别的技能诱导,能够显著提升代理的表现,而文本格式的技能转移效果优于代码格式。为进一步理解这些发现,本文提出了一种技能效用评分,结合了技能的特异性和抽象性,能够有效预测任务成功率。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在跨任务技能转移中的不可靠性问题,现有方法在任务级别技能诱导时往往导致性能下降。
核心思路:通过比较不同层级的技能诱导(任务级别与子任务级别)及不同格式(文本与代码),探索更有效的技能转移机制,以提高代理的整体表现。
技术框架:研究设计了一个控制实验,比较不同诱导方式下的技能转移效果,主要模块包括技能诱导、技能评估和任务执行。
关键创新:提出了技能效用评分这一新概念,结合技能的特异性和抽象性来预测任务成功率,这一方法在现有研究中尚属首次。
关键设计:技能效用评分的计算仅依赖于技能和任务描述,而不需要实际执行任务,简化了评估过程,提升了实用性。具体参数设置和损失函数设计在实验中进行了详细探讨。
🖼️ 关键图片
📊 实验亮点
实验结果显示,子任务级别的技能诱导平均提升了代理的性能,超过了无记忆基线,而文本技能的转移效果在各项测试中均优于代码技能。技能效用评分与任务成功率之间存在显著相关性,为技能评估提供了新的视角。
🎯 应用场景
该研究的潜在应用领域包括智能助手、自动化客服和教育领域等,能够帮助LLM代理更有效地学习和适应新任务,提高其在实际应用中的表现和可靠性。未来,该方法可能推动更广泛的技能转移研究,促进智能系统的自主学习能力。
📄 摘要(原文)
Large language model (LLM) agents can induce skills from completed tasks and reuse them later to grow more capable with experience. In practice, induced skills may transfer unreliably and can even harm the agent that retrieves them. When agent-induced skills transfer reliably across tasks remains an open question. We conduct a comprehensive and controlled study of how the way skills are induced shapes their transfer across tasks. Specifically, we compare task-level with subtask-level skill induction and text with code skill formats, the two axes along which existing methods differ. Task-level skills mostly reduce the agent's performance below its no-memory baseline while subtask-level skills raise it above on average, and text skills transfer better than code skills. To further understand our findings, we examine two complementary properties of the induced skills: specificity, which measures how closely a skill matches real tasks, and abstractness, which measures how evenly its relevance spreads across tasks. Neither property alone predicts task success, but their combined effect does, which we propose as a skill utility score. The score correlates consistently with task success when skills are transferred, and subtask-level and text skills score higher. Computing skill utility only needs the skills and task descriptions but not any task execution, so our score serves as a practical diagnostic of a skill memory before any new task runs.