技术进展

PAWS:政策驱动的智能体世界模拟数据集

Heooo 09月25日12时03分 32 阅读

「研究者提出 PAWS 数据集,面向政策驱动的智能体世界模拟,覆盖 36 个经验证的经济政策事件、12727 条政策相关新闻与 65291 条有据可查的利益相关方行动。每条行动关联新闻并构建多层事件框架,实体归一化后与每日市场收益对齐,支持智能体模拟回放与评测。」

在金融多智能体模拟研究中,一个长期被忽视的难点是数据:政策干预会通过公共传播、机构决策与利益相关方的响应层层传导,但现有数据集很少能把这条传导链与在时间上对齐的历史证据连接起来。近日提交至 arXiv 的论文提出了 PAWS,即政策驱动的智能体世界模拟,试图为这一空白提供可复用的数据底座。

PAWS 的核心是一套面向金融场景的多智能体模拟数据集,覆盖 36 个经过验证的金融与经济政策事件、12727 条与政策相关的新闻记录,以及 65291 条有明确出处依据的利益相关方行动。每一条行动都被链接到支持它的新闻报道,从而获得可追溯的证据链,而不是孤立的行为标签。这种以来源为锚的组织方式,使数据集既能用于监督式建模,也能用于回放式的智能体评测。

在数据结构上,每条行动由多层事件框架表示,涵盖交互模式、金融行动族与子类型、语义属性,以及面向外部分类体系的条件映射。数据集中的实体被解析为规范化的组织机构,行动则与每日市场收益上下文对齐,从而支持政策与智能体模拟的回放研究。这样的设计让研究者既能按事件维度观察政策传导路径,也能按时间维度还原市场反应,并在此基础上检验智能体决策与真实历史走势的偏差。

标注质量方面,研究团队在 2522 条分层抽样的行动样本上组织了独立评估,由 AI 与人类审查者分别判断交互模式,初始一致率达到百分之八十九点四,剩余分歧随后通过仲裁机制裁定。分层抽样与仲裁流程的组合,为数据集标注的可信度提供了可量化的依据,也为同类多智能体数据集的构建流程提供了参考范式。

论文还给出两个案例研究:2008 年的卖空禁令与 2001 年的十进制报价改革。在新闻密集与新闻稀疏两种情境下,PAWS 都能复原已有文献记载的政策时间线及其对应的市场模式,说明数据集对不同信息密度的场景具备一定适应性,也为跨事件的比较研究留出了空间。

更值得注意的是回放研究揭示的一个问题:整体准确率很高时,模型仍可能完全漏检那些出现频率极低的利益相关方行动。这说明在政策模拟任务中,行动发生的时机识别与概率校准能力,比笼统的准确率指标更能反映智能体的真实水平,也是当前方法亟待突破的核心挑战。对于以稀有事件为关键信号的金融场景而言,这一发现具有普遍的警示意义。

总体来看,PAWS 的价值在于提供一个可审计的基础设施,用于评估智能体影响力、政策响应级联以及行动与结果之间的对齐程度。它将新闻证据、行动事件框架与市场收益数据统一在同一时间轴上,使模拟结果可以被逐条回溯与复核。对于从事多智能体建模、金融事件仿真和智能体评测的研究者而言,这类数据集有望成为后续研究的标准参照之一,也为更严格的智能体行为归因与因果分析打下数据基础。

# 多智能体模拟 # 数据集 # 智能体评测

来源:Heooo AI工具导航