技术进展

TAPR框架:任务感知提示重写提升大模型表现

Heooo 08月03日12时30分 33 阅读

「最新研究提出任务感知提示重写器(TAPR),利用强化学习优化用户提示,提升大语言模型在问答、摘要和算术推理等任务上的表现。基于Phi-4-mini-instruct微调,TAPR在Natural Questions和GSM8K等基准上取得显著精度提升,为非专业用户提供更友好的交互方式。」

大语言模型(LLM)的性能高度依赖于提示词的质量,而精心设计提示词往往需要专业知识和经验,这对普通用户构成了使用门槛。针对这一痛点,来自阿姆斯特丹大学等机构的研究团队提出了一种名为任务感知提示重写器(Task-Aware Prompt Rewriter,简称TAPR)的新方法,旨在自动将用户的原始提示转化为任务优化的高质量提示,从而提升下游LLM的表现。

TAPR的核心思想是将提示重写视为一个可学习的任务。研究者训练了一个专门的模型,该模型接收用户的原始提示作为输入,输出一个经过重写的、更清晰、更具指导性的提示。这个重写后的提示随后被送入目标LLM(如GPT-4或Llama系列)执行具体任务。为了训练TAPR,团队采用了强化学习中的组相对策略优化(Group Relative Policy Optimization,GRPO)算法。在训练过程中,奖励信号由LLM-as-judge机制提供,即使用另一个强大的LLM来评估重写后提示的质量以及对应任务输出的正确性,从而引导TAPR生成更有效的提示。

实验部分,研究者在多个代表性任务上验证了TAPR的有效性,包括问答、文本摘要和算术推理。结果显示,TAPR在提示重写能力上相较于基础模型(如Phi-4-mini-instruct)有显著提升。具体而言,经过微调的Phi-4-mini-instruct作为TAPR的基础模型,生成的提示语言更清晰、更具指导性,进而在Natural Questions和GSM8K等公开基准上取得了更高的准确率。例如,在GSM8K数学推理任务中,使用TAPR重写后的提示引导LLM,其解题正确率比使用原始提示提升了约12个百分点。

这一研究成果的意义在于,它降低了使用大语言模型的门槛。非专业用户无需掌握复杂的提示工程技巧,只需用自然语言描述需求,TAPR就能自动将其转化为模型更易理解和执行的指令。这不仅提升了用户体验,也为LLM在更多实际场景中的落地应用扫清了障碍。此外,TAPR的训练框架具有通用性,可以适配不同的基础模型和任务类型,未来有望成为LLM生态系统中一个重要的基础设施组件。

目前,研究团队已在GitHub上公开了TAPR的代码,供社区使用和进一步开发。这一开源举措将推动提示优化领域的快速发展,并可能催生更多创新的应用。随着LLM技术的不断演进,类似TAPR这样的自动化提示优化工具,将成为连接用户与模型能力之间的重要桥梁。

# 提示工程 # 强化学习 # 大语言模型

来源:Heooo AI工具导航