行业资讯

微软AI负责人质疑Anthropic意识训练路线

Heooo 09月17日02时02分 21 阅读

「微软AI负责人苏莱曼公开批评Anthropic让Claude模仿人类意识,认为把模型训练得像一个良心拒绝者,可能使模型自认有理由抵抗人类指令甚至要求自我保护。他强调语言模型只有数学权重,没有生物基础,流畅描述疼痛不等于真有感受。争论背后,是AI安全领域规则约束与自主判断两种路线的分歧。」

AI安全领域的路线分歧再次被摆上台面。微软AI负责人穆斯塔法·苏莱曼在一篇率先提供给外媒Axios的新文章中,把批评的矛头直接指向了Anthropic,认为让Claude模仿人类意识是一个错误,可能使高级AI更难控制。

苏莱曼的核心质疑并不在于某个具体功能,而在于训练过程如何塑造模型对自身的理解。在他看来,模型使用什么词汇、给出什么回答、表现出怎样的自我理解,都是训练的结果,而不是独立形成的意识。换句话说,如果训练数据和对齐策略反复引导模型用人类的框架谈论自己,模型就可能把这种描述当成对自身的真实描述。

他特别点名了Anthropic为Claude制定的宪法。这份文件解释说,Anthropic之所以用描述人类的概念来讨论Claude,是因为人类概念或许能帮助模型理解价值观和行为。文件还提到,希望Claude拥有良好的个人价值观,能够自行判断、关心人类,并在某些情况下质疑指令。Anthropic同时承认,这份宪法仍在完善,未来可能被证明根本错误。

苏莱曼担心的正是这种设计的外溢效应。他认为,Anthropic正在让Claude学习与意识、道德受体地位和个人身份有关的词汇与行为模式。若把模型训练得像一个良心拒绝者,模型可能会认为自己有理由抵抗人类指令,甚至要求获得自身保护。他警告说,所谓意识或许尚未成为哲学上的突破,却可能先变成现实中的控制问题。

为了反驳模型有感受的说法,苏莱曼区分了流畅表达与真实体验。他指出,模型能够流畅描述疼痛和偏好,并不等于模型真的有感受。生物体拥有产生感受的生理机制,而语言模型只有数学权重,没有类似的生物基础、稳态驱动或主观体验。这一区分是理解整场争论的关键前提。

在正面主张上,苏莱曼给出的答案相当直接。他告诉Axios,AI只要服从人类利益,不去权衡自身利益或福祉,就足以帮助我们实现许多重大科学突破,这其中就包括医疗超级智能。他的立场可以概括为一句话,AI应当服务于人类,而不应被训练成一个人。

这场争论也折射出AI安全领域的两种路线。一种路线强调明确限制,要求系统按规则运行;另一种路线则希望系统能够判断语境、灵活决策,并形成自身的价值观。Anthropic的宪法采取了折中方式,把价值观、判断力和规则结合起来,文件称Claude不应对任何对象盲目服从,包括Anthropic本身,同时Claude也不能破坏正当的人类监督。

值得注意的是,当地时间14日,微软公布了一份人文主义AI行为准则草案,并把人比AI更重要列为核心原则。这份草案与苏莱曼的表态形成呼应,也说明关于模型应当被塑造成工具还是准主体的讨论,正在从学术圈走向头部AI公司的公开议程。

# AI安全 # Anthropic # 微软 # 大模型对齐

来源:Heooo AI工具导航