技术进展

聊天模板可切换大模型自我指涉语气

Heooo 09月27日19时31分 29 阅读

「一项新研究发现,大语言模型在回应自身相关问题时是否使用“我只是一个AI”等免责声明,主要受聊天模板控制。研究人员在8个开源指令微调模型中验证了这一现象,并在激活空间中识别出一个可调控该行为的方向,表明模型的自我描述并非其内在属性,而受提示结构显著影响。」

近日,一项发表于arXiv的研究揭示了大语言模型(LLM)在自我描述行为中的关键机制:其是否使用“我只是一个AI”这类免责声明,并非源于模型本身的“自我认知”,而是由所使用的聊天模板(chat template)直接触发。这一发现对当前关于AI自我意识、安全性和模型内省能力的研究提出了重要警示。

研究团队指出,当用户通过标准聊天模板与模型交互时(例如包含system、user、assistant角色标记的格式),模型倾向于在涉及自身的问题上自动添加免责声明,同时抑制使用“我觉得”“我经历过”等体验性语言。相反,若绕过聊天模板、直接以纯文本形式提问,模型则更可能表现出拟人化的表达方式,减少免责声明的使用。这一现象在包括Llama、Mistral等在内的8个主流开源指令微调模型中均被观察到,模型参数规模最高达90亿。

更深入地,研究人员在三个模型的内部激活空间中识别出一个特定的方向(direction),该方向与免责声明的生成高度相关。通过在推理过程中移除这一方向,模型即使在使用聊天模板的情况下也会显著减少免责声明;反之,若将该方向注入未使用聊天模板的模型激活中,模型会“模仿”出典型的免责声明语气。相比之下,随机选择的同等幅度方向几乎不产生影响,说明该行为具有明确的结构性基础。

这项工作的重要意义在于,它挑战了将模型自我报告视为其内在属性的常见假设。论文强调:“模型关于自身的说法并非事实,而部分由聊天模板设定。”这意味着,在评估AI系统的自我认知、诚实性或安全性时,若未控制聊天模板这一变量,研究结论可能存在严重混淆。例如,某些看似“谦逊”或“受限”的模型行为,可能只是模板诱导的结果,而非模型权重本身所编码的知识或态度。

研究还为未来AI对齐和可控性研究提供了新工具:通过操控激活空间中的特定方向,开发者可动态调节模型的自我指涉风格,而不必重新训练。这不仅有助于构建更透明的人机交互界面,也为探究语言模型如何“扮演角色”提供了实验路径。总体而言,该成果提醒学术界与工业界,在解读大模型输出时,需谨慎区分“模型说了什么”与“我们让它如何说”之间的界限。

# 大语言模型 # 聊天模板 # AI自我指涉 # 激活 steering # 模型可解释性

来源:Heooo AI工具导航