PromptResponse: Optimizing Prompts for LLM Coding Tasks

📄 arXiv: 2608.21074v1 📥 PDF

作者: Erik Thureck, Robert Kühnen, Tim Jacobowitz

分类: cs.CL, cs.AI, cs.HC, cs.SE

发布日期: 2026-08-21

备注: 22 pages, 7 figures, 10 listings


💡 一句话要点

提出PromptResponse以优化LLM编码任务的提示

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 编码任务 提示优化 格式化 性能评估 软件开发 自动化测试

📋 核心要点

  1. 现有方法在使用大型语言模型进行编码任务时,输出对提示的微小变化极为敏感,导致性能不稳定。
  2. 论文提出通过格式化和LLM调优来优化编码任务的提示,探索不同格式对生成代码的影响。
  3. 实验结果显示,使用一致的格式化(尤其是JSON)能提高生成效率和稳定性,而LLM调优反而降低了任务性能。

📝 摘要(中文)

大型语言模型(LLMs)在研究工作流和软件开发中越来越常用,但其输出对输入提示的变化敏感。本文提出了“PromptResponse”,通过控制实验研究编码任务提示的格式化和基于LLM的调优如何影响生成代码的性能、效率和稳定性。使用五种语义相同但语法不同的HumanEval数据集变体进行实验,结果表明一致的格式化(尤其是JSON格式)能显著提高生成效率和语法稳定性,而LLM调优的提示则导致任务性能显著下降。研究最后提供了一系列基于结果的实用建议,并发布了数据集变体和评估流程以供未来研究使用。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在编码任务中对提示变化敏感的问题,现有方法在提示格式化和调优方面存在不足,导致生成代码的性能和稳定性不佳。

核心思路:通过对编码任务提示进行不同格式化(如JSON、Markdown等)和LLM调优,研究其对生成代码性能的影响,提出低成本的格式化方法作为优化手段。

技术框架:整体流程包括数据集准备、提示格式化、模型执行和结果评估。使用五种不同格式的HumanEval数据集变体进行实验,评估生成代码的性能、效率和稳定性。

关键创新:最重要的创新在于发现一致的格式化(特别是JSON格式)能显著提高生成效率和语法稳定性,而LLM调优反而导致性能下降,这与以往的研究结果形成鲜明对比。

关键设计:在实验中,使用了8200次执行的结果进行分析,关注生成代码的语法稳定性和执行效率,强调了格式化的重要性和调优的潜在风险。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,使用一致的格式化(尤其是JSON)能提高生成效率和语法稳定性,性能提升幅度虽小但显著;而LLM调优的提示则导致任务性能显著下降,表明低成本的格式化方法更为有效。

🎯 应用场景

该研究的潜在应用领域包括软件开发、自动化测试和代码生成工具等。通过优化提示格式,开发者可以提高代码生成的效率和稳定性,从而提升整体开发流程的质量和速度。未来,该研究的结果可能推动更多基于LLM的工具和应用的开发。

📄 摘要(原文)

Large language models (LLMs) are increasingly used in research workflows and software development pipelines, yet their output remains sensitive to input prompt variations. This paper presents $\unicode{x00AB}$PromptResponse$\unicode{x00BB}$, a controlled study examining how formatting and LLM-based tuning of coding task prompts affect the resulting code's performance, efficiency, and stability. Using five semantically identical yet syntactically distinct variants of the HumanEval dataset$\unicode{x2014}$baseline, JSON, Markdown, YAML, and an LLM-tuned version$\unicode{x2014}$we had GPT-4o solve its coding problems over 8200$\unicode{x00A0}$executions. Our results show that consistent formatting$\unicode{x2014}$especially JSON$\unicode{x2014}$improves generation efficiency and syntactic stability, with minor gains in task performance. Conversely, the LLM-tuned prompts resulted in significantly degraded task performance without significant improvements in any other dimension. These findings suggest that low-effort reformatting alone can yield measurable improvements, while tuning must account for model alignment. We conclude our work with providing a set of practical recommendations informed by our results as well as releasing our dataset variants and evaluation pipeline for future work.