Anthropic量化公开AI研发自动化进度
「Anthropic首次以量化方式公开内部AI研发自动化进展:截至8月,Claude主导26%的AI研发工作,2月尚不足1%;内部约3万个AI Agent在运行,8月产生超10亿次决策。公司采用Epoch AI六级框架,26%工作达AL4主导级,超90%至少达AL3,尚无工作达AL5完全自主。」
Anthropic 首次以量化方式公开内部 AI 研发自动化的进展。数据显示,截至今年8月,Claude 已主导公司内部26%的 AI 研发工作,而今年2月这一比例还不足1%。同时,公司内部 Agent 平台任意时刻约有3万个 AI Agent 在运行,8月产生超过10亿次决策。这组数字被视为递归自我改进(RSI)从概念走向工程现实的重要信号。
在衡量标准上,Anthropic 采用了独立 AI 研究机构 Epoch AI 提出的六级自动化框架,将 AI 参与程度划分为 AL0 至 AL5。其中 AL0 表示完全没有 AI 参与,AL3 为 AI 协作,AL4 为 AI 主导,AL5 则是完全自主。截至8月,26%的 AI 研发工作达到 AL4:人类只需给出高层目标,Claude 就能完成端到端的大部分工作,人只负责监督、检查和最终拍板;另有超过90%的研发工作至少达到 AL3。Anthropic 明确表示,目前尚未有任何被测量的 AI 研发工作达到 AL5 完全自主水平。
一个具体场景能说明这种变化:夜间数据管道出故障后,工程师只需把报告丢给 Claude 并说一句“把它修好”,它就能自主查看日志、定位原因、编写修复代码、测试、处理新冒出来的问题,最后重跑管道、对比结果并撰写说明。
规模数据同样值得关注。截至8月,Anthropic 内部约3万个 Agent 从事研究和工程工作,它们拥有独立于底层模型升级的身份标识,通过共享消息系统互相委派任务、交叉纠错。在安全监控上,所有 Agent 动作执行前都要经过在线监控,8月超10亿次决策中约0.002%被阻止;离线监控每周标记约10万条对话记录,经分类器过滤误报和初步审查后,最高优先级约50条会升级到人工审查。算力分配方面,7月样本周内约6%的 AI 研发算力投入安全研究,若只统计 AI 驱动的研发,这一比例升至约12%。Anthropic 也坦承,AI 协作与 AI 主导的边界存在主观性,跨实验室比较需要统一方法和第三方验证。
RSI 眼下已是行业最热的概念之一。智谱创始人唐杰披露,GLM-5.3-Flash 两周内完成国产加速器全量部署,大部分工作由 GLM-5.3 驱动的 Infra Agent 完成;他判断距离完全 RSI 尚远,但“模型优化系统、系统服务模型”的循环已经开始运转。OpenAI 在9月初宣布达成自动化 AI 研究实习生里程碑,目标2028年3月前实现自动化 AI 研究员,最薄弱的环节仍是“决定做什么”——任务超过4小时就需要人类频繁介入。谷歌 DeepMind 的进化式编码智能体 AlphaEvolve 从算法进化切入,其提出的电路方案已集成进下一代 TPU,谷歌前首席科学家杰夫·迪恩称之为“TPU 大脑帮助设计下一代 TPU 身体”的最新案例。
谷歌 DeepMind 首席战略官贾吉特·塞洪此前的一句话点透了底层逻辑:RSI 正成为 AI 资本开支的核心投资逻辑,虽然当前 AI 收入还撑不起正在投入的资本开支,但不下注 RSI 并不明智。
Anthropic 这次把数字摆上台面,一面是想在人类仍握主导权的窗口期,让社会参与决定 AI 自我迭代的节奏与方向;另一面则是给行业立下一个可参照的披露基准。当研发自动化比例、Agent 规模、算力投入占比和安全监控覆盖率都被公开,透明度本身就变成了无声的竞争压力,不跟进就可能被当成有意遮掩。
来源:Heooo AI工具导航