SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation
作者: Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang
分类: cs.AI
发布日期: 2026-08-11
💡 一句话要点
提出Visual Skill Cards以解决GUI动作预测中的视觉程序记忆缺失问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉技能卡 GUI动作预测 程序记忆 多模态学习 模型蒸馏 人机交互 智能代理
📋 核心要点
- 现有方法在处理软件界面时,缺乏有效的视觉程序记忆,导致决策不够准确。
- 论文提出视觉技能卡(VSCs),将可重用程序与视觉证据和验证信号结合,提升动作预测的准确性。
- 在Multimodal-Mind2Web和WebLINX-BrowserGym上,SkillLens显著提升了模型性能,分别提高了11.6和2.9点。
📝 摘要(中文)
计算机使用代理能够感知丰富的软件界面,但其决策常常缺乏视觉程序记忆:它们可能识别单个控件,却无法识别当前活动的熟悉工作流程、下一个重要控件或确认进展的证据。原始交互轨迹虽然保留了这些信息,但往往冗长且噪声较大,而仅依赖文本的技能则常常忽略了使程序适用的视觉状态。为此,本文提出了视觉技能卡(Visual Skill Cards, VSCs),这是一种状态条件的记忆表示,结合了可重用程序的适用性线索、视觉证据和验证信号。SkillLens通过Trace-to-Visual-Skill-Card构建VSCs,并在推理时检索相关卡片,仅扩展固定视觉语言模型执行器所需的证据,以实现基于GUI的动作预测。该表示还支持CardDistill,利用VSC证据作为特权教师上下文,训练无需运行时卡片检索的学生模型。
🔬 方法详解
问题定义:本文旨在解决计算机代理在软件界面中缺乏视觉程序记忆的问题。现有方法无法有效利用交互轨迹中的视觉信息,导致决策过程中的不确定性和错误。
核心思路:论文提出的视觉技能卡(VSCs)通过结合可重用程序的适用性线索和视觉证据,提供了一种新的状态条件记忆表示。这种设计使得代理能够在决策时更好地理解当前的工作流程和所需的操作。
技术框架:SkillLens的整体架构包括两个主要模块:Trace-to-Visual-Skill-Card用于构建VSCs,以及在推理时检索相关卡片并扩展必要的证据。该框架利用固定的视觉语言模型执行器进行基于GUI的动作预测。
关键创新:最重要的创新在于引入了视觉技能卡(VSCs),这种表示方式有效地结合了视觉信息与程序执行的上下文,显著提升了动作预测的准确性。与传统方法相比,VSCs能够更好地捕捉程序的适用性和执行条件。
关键设计:在模型训练中,使用了特定的损失函数来优化VSC的构建和检索过程。同时,设计了高效的网络结构,以确保在推理时能够快速检索和扩展所需的视觉证据。
🖼️ 关键图片
📊 实验亮点
在实验中,SkillLens在Multimodal-Mind2Web和WebLINX-BrowserGym上分别提升了11.6和2.9点,显著提高了模型的动作预测能力。此外,CardDistill进一步提升了学生模型的性能,分别提高了12.0和3.2点,显示出该方法的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括智能助手、自动化测试和人机交互等。通过提升计算机代理在复杂软件界面中的决策能力,能够显著提高用户体验和工作效率。未来,该技术有望在更多领域得到广泛应用,如教育、医疗和客户服务等。
📄 摘要(原文)
Computer-using agents can perceive rich software interfaces, yet their decisions often lack visual procedural memory: they may recognize individual controls without identifying which familiar workflow is active, which control matters next, or what evidence would confirm progress. Raw interaction traces preserve such information but are long and noisy to condition on, whereas text-only skills often omit the visual state that makes a procedure applicable. We introduce Visual Skill Cards (VSCs), a state-conditioned memory representation that binds reusable procedures with applicability cues, visual evidence, and verification signals. SkillLens constructs VSCs from heterogeneous interaction experience through Trace-to-Visual-Skill-Card and, at inference time, retrieves relevant cards and selectively expands only the evidence needed by a fixed visual-language model executor for grounded GUI action prediction. The same representation also supports CardDistill, which uses VSC evidence as privileged teacher context to train a student that acts without runtime card retrieval. Across Multimodal-Mind2Web and WebLINX-BrowserGym, SkillLens improves the frozen GPT-5.4-mini executor by +11.6 points in Step SR and +2.9 points in Overall, respectively; CardDistill further improves the corresponding student-only Qwen3-VL-2B metrics by +12.0 and +3.2 points.