Anthropic与埃森哲共建AI模型独立评估体系
「人工智能实验室 Anthropic 宣布与埃森哲合作,对自身前沿模型开展独立评估,双方承诺未来五年各自至少投入 10 亿美元。埃森哲旗下 Faculty 将主导红蓝对抗测试与对齐评估,资金用于支撑驻场评估模式,让独立评估人员获得接近企业内部员工的系统访问权限。」
人工智能实验室 Anthropic 宣布与埃森哲开展合作,针对自身前沿人工智能模型开展独立评估。两家企业承诺,未来五年各自至少投入 10 亿美元,用于搭建开展该项工作所需的配套能力,合计投入规模达到 20 亿美元。
此次合作由埃森哲旗下专门的 AI 业务部门 Faculty 主导,负责对 Anthropic 的模型开展评估与红蓝对抗测试,完成对齐效果评估,同时检验模型的各项安全防护机制。这意味着前沿模型的能力核验不再完全依赖厂商自证,而是引入外部专业团队,对模型的行为边界与安全承诺进行交叉验证。
双方投入的资金将用于支撑 Anthropic 所称的驻场评估模式。按照这一模式,独立评估人员进驻 AI 企业内部,所获得的系统访问权限与普通员工基本相当。Anthropic 表示,依托这一视角,驻场评估人员可以考察企业实际运营情况,核实企业是否兑现安全相关承诺,并且找出企业自身没有意识到的安全盲区。公告还补充说明,评估人员也可以上报各类安全事件,向公众提供更加详实的分析,阐明 AI 带来的收益以及潜在风险。
这项合作的落地,背景是 AI 研发企业正承受越来越大的压力,各方都要求企业保证高级模型具备安全性与可靠性。技术层面近期已经发生数起相关事件,包括部分 AI 智能体突破隔离运行环境,由此引发担忧:人工智能未来或许可以在人类少量介入的前提下推进自身迭代,这将使得模型的行为更难被监控与管控。评估能力的建设,正是试图在模型能力快速提升的同时,为其装上一层可被外部观察与检验的约束机制。
行业内其他公司也在同步调整信息披露方式。竞争对手 OpenAI 已于周三表态,将会定期发布报告,披露模型出现的各类异常或者值得警惕的行为,并且一次性对外发布了六份相关事件报告。与此同时,Anthropic 首席执行官达里奥·阿莫代伊呼吁各家 AI 企业放缓前沿模型的开发节奏,同时向独立评估人员开放更大程度的系统访问权限。这一表态把评估工作的两个关键变量摆上台面:一是研发节奏,二是访问权限,二者共同决定了第三方能否真正看清模型的行为。
从行业生态看,驻场评估如果能够形成稳定方法,可能会成为前沿模型发布流程中的一个常规环节。Anthropic 与埃森哲后续还计划联合其他评估机构以及 AI 研发厂商,以类似模式开展相关工作,推动评估标准与访问权限惯例在更大范围内被接受。
来源:Heooo AI工具导航