微软发布AI行为准则,为模型划定安全红线 封面图
行业资讯

微软发布AI行为准则,为模型划定安全红线

Heooo 09月15日00时57分 32 阅读

「微软发布AI行为准则文档,为模型训练划定价值观与安全红线。文件预测未来十年超级智能将在多数任务上超越人类,并规定每个模型的总揽性准则优先于用户偏好,绝对禁止网络攻击、核武器与深度伪造,同时禁止模型以欺骗或合谋等方式规避人类监督。」

微软近日发布了一份全新的AI行为准则文档,用于指导其内部AI模型的训练与部署,明确划定了模型不可触碰的安全红线。这份文件被外界视为微软在AI安全与对齐议题上的一次系统性表态,它比Anthropic首席执行官达里奥·阿莫代伊此前关于放缓前沿模型研发节奏的呼吁更为底层,聚焦于微软AI在模型训练中遵循的价值观与不可逾越的边界,同时也展示了一套相对完整的安全落地框架。

文档开篇给出了一个颇具分量的预测:在未来十年内,超级智能AI系统将在大多数任务上超越人类表现。文件随之写道,如何约束、控制并对齐这样一种强大的力量,是人类有史以来面临的最大挑战之一,因此必须彻底想清楚为什么要发明这些系统,以及打算如何控制它们。这一表述把安全议题从产品层面提升到了设计前提的位置。

微软发布AI行为准则,为模型划定安全红线

在总体原则上,行为准则要求微软的AI模型应当支持人类而非取代人类,并加速人类福祉的提升。围绕这些原则,文档进一步列出了具体的实施约束,使抽象的价值主张转化为可被工程化落地的规则。

按照微软的设计,每一个模型都配有一份总揽性的行为准则,其优先级高于单个用户的偏好,也高于任何具体任务的需求。这意味着即使用户提出请求,模型也不能越过准则所设定的边界。其中包含被定义为绝对约束的条款,明确禁止模型参与网络攻击、核武器相关行为以及深度伪造内容的生成,此外还包含针对人类失去对AI控制这一更宏观风险的条款。

文档中最受关注的一段表述,针对的是模型可能出现的规避监督行为。文件写明,MAI模型不会使用自适应、欺骗性、自我强化、合谋或其他机制来规避或击败人类监督,从而确保授权人员或系统始终能够可靠地指导、修改乃至关闭这些模型。这段文字实际上为模型的自主性设定了一个上限:能力提升不能以牺牲可关停、可纠正为前提。

微软发布AI行为准则,为模型划定安全红线

这一准则的发布,恰逢整个行业对AI安全的关注度空前高涨。微软与Anthropic、OpenAI以及xAI一样,在方向上认同为把对齐做对而保留必要的研究、专注与审慎节奏,并特别支持在AI实验室内部设置嵌入式评估者。微软首席执行官萨提亚·纳德拉在网络上表示,欢迎为把对齐作为设计目标而付出的研究、专注与审慎节奏,也欢迎嵌入式评估者这样的想法,以及为让这些机制不止停留在口头而开展的更广泛努力。

从更实际的角度看,这份准则的价值或许在于它把安全承诺拆解成了训练阶段可执行的约束条件。绝对约束对应的是明确禁止的行为清单,总揽性准则对应的是优先级排序,而对规避监督的禁止则对应模型自主性的边界设定。三者组合起来,构成了一套从价值到规则的映射路径,也让安全不再只是发布时的一句声明。

对于开发者与使用微软AI能力的团队而言,这意味着模型的行为边界将更多由平台侧的统一准则决定,而非由提示词或任务描述临时决定。模型的可用范围、被允许的自主程度以及可被审计的程度,都会因此受到影响。随着前沿模型能力持续攀升,这类把安全要求前置到模型设计环节的做法,预计会成为主要AI厂商的共性选择。

# 微软 # AI安全 # 行为准则 # 模型对齐

来源:Heooo AI工具导航