OpenAI与Anthropic曾商讨互测彼此模型
「据《The Information》报道,OpenAI与Anthropic今年早些时候曾磋商一份具有法律约束力的协议,计划通过互相压力测试寻找对方模型中的漏洞,双方将获得彼此API访问商业可用模型且不保留对方数据。该构想与马斯克提出的模型同行评审方案相似,也与奥尔特曼支持的第三方独立评估思路并行。」
据《The Information》援引一名直接了解谈判情况的人士消息,OpenAI 与 Anthropic 曾就一份具有法律约束力的协议展开磋商,计划由双方互相针对对方的 AI 模型进行压力测试。消息称,两家公司及其律师在今年早些时候围绕具体协议条款进行了讨论,测试目标是通过多种方式寻找模型中的漏洞和潜在风险。不过,这份协议是否在 OpenAI 随后接连发生安全事件之前正式敲定,目前尚不清楚。
根据提议的协议内容,两家公司将获得彼此的 API,用于访问商业上已经可用的 AI 模型,而不是尚未发布的模型。知情人士表示,OpenAI 与 Anthropic 均保证在此过程中不会保留彼此的数据。这意味着双方的互测被限定在公开可用产品的范围之内,测试方能够直接调用接口、构造输入并观察输出,但无法接触对方的训练数据、模型权重或未公开版本。
这一构想与 SpaceX CEO 埃隆·马斯克在一场峰会上提出的方案颇为相似。马斯克建议,互为竞争对手的 AI 实验室应在模型商业发布之前相互检查安全弱点,相当于为 AI 模型建立一种同行评审机制,让最了解模型内部构造的同行去挑对方产品的毛病。
与此同时,还有另一套并行的思路。OpenAI CEO 萨姆·奥尔特曼赞同 Anthropic CEO 达里奥·阿莫迪提出的构想,即让独立第三方安全评估人员进入各家 AI 开发企业,获得与内部员工相近的访问权限,直接检查模型和安全流程,而不是只能从外部测试成品模型。奥尔特曼还支持制定全行业统一的 AI 模型风险评估标准。
一名了解 OpenAI 战略的人士称,公司一直在研究多种安全合作方案,包括且不限于 AI 企业之间相互协作;近期讨论又进一步延伸至新的安全措施,覆盖模型训练前和正式发布前两个阶段。
从技术角度看,模型互测的核心价值在于缓解信息不对称。外部研究者通常只能看到模型对输入的响应,难以判断某一行为是训练数据的残留、对齐策略的取舍,还是推理链条中的偶然偏差。而由具备同等工程能力的同行进行针对性测试,更容易命中边界条件,例如提示注入、越狱诱导、工具调用越权以及长上下文中的指令漂移等问题。
但同行互测也存在天然张力。参与互测的两家公司既是安全上的合作者,也是市场上的直接竞争者,测试中暴露的弱点可能牵涉产品路线与商业节奏。协议把访问范围限定在商业可用模型、并明确不保留彼此数据,某种程度上正是为了在协作与保密之间划出边界。
相比事后补救,这两种方案都把重心前移:一种依靠竞争者的技术能力做交叉验证,一种依靠独立第三方的中立地位做深度审计。它们能否落地,取决于访问权限如何界定、测试结果如何共享、以及评估标准能否在全行业形成共识。对于正在快速迭代的 AI 模型而言,这类机制或许会成为发布流程中的常规一环。
来源:Heooo AI工具导航