AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

📄 arXiv: 2608.06699v1 📥 PDF

作者: Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

分类: cs.AI, cs.CV

发布日期: 2026-08-07

🔗 代码/项目: GITHUB


💡 一句话要点

提出AgentPatch以解决多模态大语言模型合并中的弱任务修复问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 弱任务修复 模型合并 代理引导 行为关键补丁 能力保留 动态环境

📋 核心要点

  1. 现有的多模态大语言模型在合并时面临弱任务修复和能力不对称保留的挑战,导致合并后性能下降。
  2. 本文提出AgentPatch框架,通过无训练的方式修复合并模型,恢复弱任务信号并保护关键行为。
  3. 实验结果显示,AgentPatch在多个基准测试中有效提升了合并模型的性能,平衡了弱任务恢复与能力保留。

📝 摘要(中文)

Agentic多模态大语言模型(MLLMs)通过规划、工具使用和动态环境中的交互扩展了多模态感知和推理。然而,现有模型通常专门针对特定工具或环境,导致难以整合为单一通用模型。本文提出了Agentic MLLM合并的框架,并识别出两个主要挑战:不对称的能力保留和行为关键遗忘。为此,提出了AgentPatch,一个无训练的粗到细修复框架,通过选择稳定的合并主干,恢复稀释的弱任务特定信号,并应用代理引导的行为关键补丁来恢复关键行为。实验结果表明,AgentPatch在六个基准测试中显著改善了合并模型的性能,缓解了弱任务退化问题。

🔬 方法详解

问题定义:本文旨在解决Agentic多模态大语言模型合并过程中出现的弱任务修复问题。现有方法在合并时,能力保留不均衡,导致弱任务性能下降,同时关键行为的遗忘会影响长时间执行的效果。

核心思路:AgentPatch框架通过无训练的方式进行粗到细的修复,选择稳定的合并主干,恢复弱任务特定信号,并通过代理引导的方式保护关键行为,确保合并后模型的整体性能。

技术框架:AgentPatch的整体架构包括三个主要模块:稳定合并主干选择、弱任务独特残差恢复和行为关键补丁应用。该框架不依赖于路由或集成,生成单一静态检查点。

关键创新:AgentPatch的核心创新在于其无训练的修复机制,能够有效恢复弱任务性能并保护关键行为,与现有方法相比,避免了复杂的训练过程和模型集成。

关键设计:在设计中,AgentPatch采用了弱任务独特残差恢复技术,确保在合并过程中保留重要的任务信号,同时通过明确的能力保护策略来恢复关键行为。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,AgentPatch在六个基准测试中显著改善了合并模型的性能,具体提升幅度达到XX%(具体数据未知),有效缓解了弱任务退化问题,并更好地平衡了弱任务恢复与能力保留。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动驾驶、机器人交互等场景,能够提升多模态大语言模型在动态环境中的适应能力和执行效率。未来,AgentPatch可能推动更通用的智能系统的发展,使其在复杂任务中表现更为出色。

📄 摘要(原文)

Agentic multimodal large language models (MLLMs) extend multimodal perception and reasoning with planning, tool use, and interaction in dynamic environments. Yet current models are specialized for particular tools or environments, complicating consolidation into a single generalist. We formulate Agentic MLLM Merging and identify two challenges: asymmetric capability preservation, whereby capabilities with different interaction complexity are retained unevenly, producing weak tasks after merging, and behavior-critical forgetting, whereby losing decisive actions can derail long-horizon execution. We propose AgentPatch, a training-free coarse-to-fine repair framework. It selects a stable merged backbone, restores diluted weak-task-specific signals through Weak-Task Unique Residual Recovery, and applies an Agent-Guided Behavior-Critical Patch that recovers decisive behaviors under explicit capability protection. AgentPatch produces a single static checkpoint without routing or ensembles. Experiments across six agentic and multimodal benchmarks show that AgentPatch improves diverse merged backbones, alleviates weak-task degradation, and better balances weak-task recovery with the preservation of complementary search and agentic visual processing capabilities. Code is available at https://github.com/ziboshao/AgentPatch.