技术进展

大模型二阶社会推理能力评估新框架

Heooo 09月10日12时03分 45 阅读

「AI对齐研究长期聚焦一阶社会规范,即模型能否判断行为是否被接受。新论文提出评估大模型元规范推理的框架,从情绪评价与行为反应两个维度建模,并发布含450个违规场景的数据集。实测六个模型比人类更倾向预测惩罚,社会距离越远偏差越大。」

人工智能对齐研究长期把注意力放在一阶社会规范上,也就是教会模型分辨哪些行为是社会可接受的、哪些是不可接受的,例如让模型知道偷窃是不被允许的。然而,社会智能并不止于识别规范本身。人们在现实中判断一个越界行为时,还会进一步预期谁会出面干预、以什么方式干预,是公开羞辱、疏远排斥,还是更严厉的惩罚。这类对他人反应的预期被称为元规范,它决定了当社会规则被打破时,人们究竟如何回应。arXiv 上的一篇新论文正是围绕这一层面展开,评估大语言模型在元规范推理上的表现。

论文指出,真正困难的部分在于从一阶规范识别迈向二阶社会推理。识别一条规范是否被违反,更多是静态的知识判断;而预测违规者会受到怎样的对待,需要模型同时理解情绪、关系、身份与情境等多重因素。为此,研究者提出了一个评估大语言模型元规范推理的新框架,并从两个核心维度刻画模型的输出:一是情绪评价,即模型如何判断相关各方在违规情境中的情绪状态;二是行为反应,即模型如何预测各方接下来会采取什么样的行动。

在这一框架之下,论文进一步设计了两类新的分类任务。第一类是预测违规者的自我约束,即当一个人违反规范之后,模型能否判断他会如何自我调节与自我克制。第二类是预测观察者的他者约束,即模型能否判断旁观者会对违规者施加何种规制。这两类任务把社会规范的处理拆分为违规者一侧与观察者一侧,使评估不再停留在模型是否知道规则,而是深入到模型是否理解规则被打破后的社会互动过程。

为支撑上述任务,研究团队构建并公开了一个多视角数据集 NormReact,其中包含 450 个规范违反场景。这些场景由人工标注,覆盖了违规者的性别以及观察者与违规者之间的社会亲密度等变量,并针对情绪与行为反应分别给出标注。多视角的设计意味着同一个违规事件会从不同关系距离、不同人物属性的角度被反复审视,从而检验模型的判断是否会随着社会关系的远近而发生合理变化。

实验结果揭示了一个值得警惕的现象:当前的大语言模型描绘出的社会世界比现实更严苛。在六个模型的评测中,模型系统性地高估了负面制裁的出现概率,在人类预期旁观者不会采取任何行动的情境里,模型依然倾向于预测惩罚或排斥。研究还发现,随着社会距离的增加,模型判断与人类判断之间的一致性持续下降。也就是说,面对关系疏远的人,模型更容易给出偏离真实社会反应的答案。

研究者由此提出担忧:在冲突调解、政策模拟等对规范高度敏感的应用场景中,如果直接依赖这类模型给出判断,可能会得到一幅被扭曲的社会规制图景。这幅图景过度呈现惩罚的一面,却低估了现实世界中普遍存在的宽容、克制以及基于关系亲疏做出的灵活调整。真实的社会规范执行往往是渐进的、有弹性的,而非一律从严。

这项工作也提示了后续研究的方向。一方面,元规范推理需要更细粒度的评测指标,把情绪判断与行为预测分开考察,避免单一准确率掩盖模型在特定维度上的系统性偏差。另一方面,NormReact 这类带有人工标注与社会关系变量的数据集,为分析模型偏差的来源提供了基础,例如偏差究竟来自训练语料中对冲突事件的放大,还是来自模型对社会关系结构的建模不足。对于致力于提升模型社会智能的开发者而言,把二阶社会推理纳入对齐评估体系,可能是让模型判断更贴近真实人类社会反应的重要一步。

# 大语言模型 # AI对齐 # 社会推理 # 数据集

来源:Heooo AI工具导航