MentorPulse: Refreshing Cross-Model Latent Guidance for Long-Form Generation

📄 arXiv: 2608.20927v1 📥 PDF

作者: Ziwu Liu, Guozhong Li, Chen Qiu, Weiyang Kong, Panos Kalnis

分类: cs.CL, cs.AI

发布日期: 2026-08-21

备注: 26 pages, 12 figures


💡 一句话要点

提出MentorPulse以解决长文本生成中的静态指导问题

🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长文本生成 跨模型指导 动态刷新 自然语言处理 生成模型

📋 核心要点

  1. 现有的静态指导方法在长文本生成中表现不佳,导致生成质量下降。
  2. MentorPulse通过增量更新内存和动态刷新机制,保持指导信息的新鲜度,从而提升生成效果。
  3. 在多个数据集上,MentorPulse显著缩小了导师与学生之间的性能差距,尤其在长文本生成任务中表现突出。

📝 摘要(中文)

跨模型潜在指导允许一个冻结的大型导师对输入进行编码,而一个冻结的小型学生从生成的信号中生成输出。现有方法保持该信号固定,假设其在输出增长时仍然有效;然而,我们发现这在长文本生成中是失败的。在多轮指令跟随任务中,静态指导使得4B学生的约束满足度比无指导基线低2.5分;每16个token进行一次训练无关的刷新,仅改变内存内容,便能恢复2.0分的增益。我们提出MentorPulse以实用的成本保持指导的新鲜度:它将导师状态压缩到一个限制的槽内存中,增量处理新生成的token,并通过门控交叉注意力更新学生读取的内存,而不重置学生的KV缓存。窗口刷新训练揭示了前缀条件内存的桥梁。在十三个数据集上,MentorPulse在宏观平均上缩小了52.2%的导师-学生差距,超越了C2C、T2T和相同预算的LoRA,尤其在长输出上表现出最大的增益。

🔬 方法详解

问题定义:本论文旨在解决长文本生成中静态指导失效的问题。现有方法假设固定的指导信号在输出增长时仍然有效,但实际效果并不理想,导致生成质量下降。

核心思路:论文提出的MentorPulse方法通过动态刷新指导信号,保持其在生成过程中的有效性。具体来说,它在生成过程中增量更新内存,以适应新生成的token,从而提升生成质量。

技术框架:MentorPulse的整体架构包括三个主要模块:首先是将导师状态压缩到槽内存中;其次是增量处理新生成的token;最后是通过门控交叉注意力更新学生的内存,而不重置KV缓存。

关键创新:MentorPulse的核心创新在于其动态刷新机制,能够在生成过程中实时更新指导信息,与现有静态方法形成鲜明对比。这种设计使得生成过程中的指导信息始终保持相关性和有效性。

关键设计:在实现过程中,MentorPulse采用了窗口刷新训练策略,确保内存更新与生成过程的前缀条件相结合。此外,设计了轻量级的读取模式检查,以预测增益并优化刷新间隔。具体的参数设置和损失函数设计在实验中进行了详细验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,MentorPulse在十三个数据集上缩小了52.2%的导师-学生性能差距,显著超越了C2C、T2T和相同预算的LoRA,尤其在长输出生成任务中表现出最大的增益。这一结果表明,动态刷新机制在提升生成质量方面具有显著效果。

🎯 应用场景

MentorPulse的研究成果在长文本生成、对话系统和多轮指令跟随等领域具有广泛的应用潜力。通过提高生成质量,该方法可以在智能助手、内容创作和教育等多个场景中发挥重要作用,推动自然语言处理技术的发展。未来,随着模型能力的提升,MentorPulse的应用前景将更加广阔。

📄 摘要(原文)

Cross-model latent guidance lets a frozen large mentor encode an input once and a frozen small student generate from the resulting signal. Existing methods keep this signal fixed, assuming it stays useful as the output grows; we show this fails in long-form generation. On multi-turn instruction following, static guidance pushes a 4B student's constraint satisfaction 2.5 points below its no-guidance baseline; a training-free refresh every 16 tokens changes only the memory content and restores a 2.0-point gain over that baseline. We propose MentorPulse to keep guidance fresh at practical cost: it compresses mentor states into a capped slot memory, incrementally processes newly generated tokens, and updates the memory that the student reads through gated cross-attention without resetting the student's KV cache. Windowed Refresh Training exposes the bridge to prefix-conditioned memory. Across thirteen datasets, MentorPulse closes 52.2% of the mentor-student gap on macro average, outperforming C2C, T2T, and equal-budget LoRA, with the largest gains on long outputs. It performs best on all eleven mentor-student pairs from three model families, with margins that narrow as the capability gap grows, and a lightweight read-pattern check predicts the gain before deployment. Measured costs identify refresh intervals that dominate text guidance on long outputs.