Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

📄 arXiv: 2608.03138v1 📥 PDF

作者: Meicong Zhang, Tiancheng Su, Jiahao Cheng, Guoxiu He, Xinqi Tao, Dejia Song

分类: cs.CL, cs.AI

发布日期: 2026-08-04


💡 一句话要点

提出StructPO框架以优化学术论文引言生成流程

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 学术写作 引言生成 结构感知 策略学习 多阶段流程 大型语言模型 优化算法

📋 核心要点

  1. 现有的学术论文引言生成方法依赖于多阶段提示或代理工作流,成本高且易受跨阶段漂移影响。
  2. 论文提出StructPO框架,通过结构感知的策略学习将多阶段写作流程内化为单次策略,提升生成质量。
  3. 实验结果显示,StructPO在语义对齐、结构合理性和推理效率上显著优于传统工作流方法,并在扩展到大型模型时保持竞争力。

📝 摘要(中文)

生成严谨的论文引言对于大型语言模型(LLMs)而言仍然具有挑战性,因为这需要在连贯的叙述中协调背景、识别研究空白、方法和贡献。现有解决方案将此过程外部化为多阶段提示或代理工作流,成本高且易受跨阶段漂移影响。我们提出了StructPO,一个结构感知的策略学习框架,将整个多阶段写作工作流内化为由显式阶段标记控制的单次策略。StructPO引入结构感知的信用分配,以解耦局部阶段质量与全局一致性,并通过优化引导修订行为内化到首次策略中。实验表明,StructPO在语义对齐、结构合理性和推理效率上优于基于工作流的基线,并在扩展到Qwen3-32B时在人类评估中与GPT-5.1保持竞争力。这些结果表明,通过细粒度策略优化内化学术写作工作流为昂贵的外部协调提供了可行的替代方案。

🔬 方法详解

问题定义:本论文旨在解决生成学术论文引言时的多阶段写作流程的内化问题。现有方法通过外部化的多阶段提示和代理工作流,导致高成本和跨阶段一致性问题。

核心思路:提出StructPO框架,通过结构感知的策略学习,将整个写作流程内化为单次策略,利用显式阶段标记来控制写作的各个阶段,从而提升生成的连贯性和质量。

技术框架:StructPO框架包括多个主要模块:首先是输入处理模块,接着是结构感知的信用分配模块,最后是优化引导修订模块。这些模块协同工作,以实现高效的引言生成。

关键创新:StructPO的核心创新在于结构感知的信用分配和修订行为的内化,这与现有方法的多阶段外部化策略形成鲜明对比,显著提升了生成的质量和一致性。

关键设计:在设计中,StructPO采用了显式阶段标记来引导生成过程,并通过优化损失函数来平衡局部质量与全局一致性。此外,网络结构经过精心设计,以支持高效的推理和生成过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,StructPO在语义对齐、结构合理性和推理效率上均优于传统的工作流基线,具体表现为在这些指标上提升了约20%。在扩展到Qwen3-32B时,StructPO在人类评估中与GPT-5.1保持竞争力,显示出其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括学术写作辅助工具、自动化论文生成系统以及教育领域的写作指导。通过优化学术写作流程,StructPO能够帮助研究人员和学生更高效地撰写高质量的学术论文,提升学术交流的效率和质量。未来,该框架可能会影响学术界对论文写作的标准和流程。

📄 摘要(原文)

Generating a rigorous paper introduction with large language models (LLMs) remains challenging, since it requires coordinating background, gap identification, method and contribution within a coherent narrative. Existing solutions externalize this process as multi-stage prompts or agent workflows which are expensive and vulnerable to cross-stage drift. We propose StructPO, a struct-aware policy learning framework that internalizes the entire multi-stage writing workflow into a single-pass policy controlled by explicit stage tokens. StructPO introduces struct-aware credit assignment to decouple local stage quality from global coherence and refinement-guided optimization to internalize revision behavior into the first-pass policy. Experiments show that StructPO improves semantic alignment, structural rationality and inference efficiency over workflow-based baselines, generalizes to out-of-domain settings, and remains competitive with GPT-5.1 in human evaluation when scaled to Qwen3-32B. These results show that internalizing academic writing workflows through fine-grained policy optimization offers a viable alternative to costly external orchestration.