HiSkill: Empowering LLM Agents with Hierarchical Skill Graphs
作者: Yu Hao, Jinxuan Cai, Qi Zhang, Yawen Li, Zhiqiang Zhang, Chuan Shi, Cheng Yang
分类: cs.AI
发布日期: 2026-07-28
🔗 代码/项目: GITHUB
💡 一句话要点
提出HiSkill框架以解决LLM代理技能关系不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 层次化技能图 大型语言模型 任务执行 技能重用 智能代理
📋 核心要点
- 现有的轨迹到技能方法未能充分利用技能之间的关系,导致高层技能与可执行动作之间存在明显的差距。
- 提出HiSkill框架,通过层次化技能图将交互轨迹组织为有向图,连接高层技能与可执行动作模板。
- 实验结果显示,HiSkill在三个交互环境中表现优于现有基线,并显著降低了推理过程中的令牌消耗。
📝 摘要(中文)
技能已成为使大型语言模型(LLM)代理在长时间交互任务中重用过去经验的重要抽象。然而,现有的轨迹到技能方法往往生成独立存储和检索的高层文本技能集合,导致技能关系未被充分利用,并在高层技能与可执行动作之间存在差距。本文提出了HiSkill,一个层次化技能图框架,将交互轨迹组织成一个包含技能节点、原子操作节点和类型化边的有向图。该图连接可重用的高层技能与可执行的动作模板,同时捕捉它们之间的分解、时间过渡、兼容性、支持和恢复关系。在推理时,HiSkill检索一个紧凑的任务相关子图,并执行子图引导的任务执行,符号任务状态、活动技能和检索的子图引导LLM代理迭代切换技能、选择原子操作并落实可执行动作。实验表明,HiSkill在三个交互环境中超越了最先进的基线,同时减少了推理令牌消耗,展示了通过层次化技能图架构连接高层技能与可执行动作的有效性。
🔬 方法详解
问题定义:本文旨在解决现有方法在技能关系利用不足和高层技能与可执行动作之间存在的差距问题。现有的轨迹到技能方法往往生成独立的技能集合,未能有效利用技能之间的关系。
核心思路:HiSkill框架通过构建层次化技能图,将交互轨迹组织成有向图,连接高层技能与可执行动作模板,从而实现技能的重用和有效执行。这样的设计使得技能之间的关系得以充分利用,提升了任务执行的效率。
技术框架:HiSkill的整体架构包括技能节点、原子操作节点和类型化边,构成一个有向图。该框架在推理时检索任务相关的子图,并基于符号任务状态和活动技能引导LLM代理进行任务执行。
关键创新:HiSkill的主要创新在于引入了层次化技能图,能够有效捕捉技能之间的分解、时间过渡、兼容性、支持和恢复关系。这一创新与现有方法的本质区别在于其能够实现高层技能与可执行动作之间的有效连接。
关键设计:在设计中,HiSkill使用了特定的参数设置和损失函数,以确保技能图的有效构建和推理过程的高效执行。具体的网络结构和技术细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,HiSkill在三个不同的交互环境中均超越了最先进的基线,具体提升幅度达到XX%,同时显著减少了推理过程中的令牌消耗,验证了其在技能执行效率上的优势。
🎯 应用场景
HiSkill框架具有广泛的应用潜力,特别是在需要长时间交互的智能代理系统中,如虚拟助手、游戏AI和机器人控制等领域。通过有效地连接高层技能与可执行动作,HiSkill能够提升这些系统的智能水平和用户体验,未来可能在多个行业中发挥重要作用。
📄 摘要(原文)
Skills have become an important abstraction for enabling large language model (LLM) agents to reuse past experience in long-horizon interactive tasks. However, existing trajectory-to-skill methods often produce flat collections of high-level textual skills that are stored and retrieved independently, leaving skill relations underutilized and maintaining a gap between high-level skills and executable actions. In this paper, we propose HiSkill, a hierarchical skill graph framework that organizes interaction trajectories into a directed graph with skill nodes, AtomicOp nodes, and typed edges. Specifically, the graph connects reusable high-level skills with executable action templates, while also capturing decomposition, temporal transition, compatibility, support, and recovery relations among them. At inference time, HiSkill retrieves a compact task-relevant subgraph and performs subgraph-guided task execution, where a symbolic task state, an active skill, and the retrieved subgraph guide the LLM agent to switch skills, select AtomicOps, and ground executable actions iteratively. Experiments on three interactive environments show that HiSkill outperforms state-of-the-art baselines while reducing inference token consumption, demonstrating the effectiveness of bridging high-level skills and executable action grounding through a hierarchical skill graph. Our data and code is available at https://github.com/BUPT-GAMMA/HiSkill.