技术进展

AI训练AI新方法成本更低速度更快

Heooo 08月29日22时34分 4 阅读

「Anthropic发布最新研究,展示用AI系统自动改善模型对齐性能的可行性。自动化对齐研究员(AAR)以每小时约4美元的API成本,平均6小时即可超越人类研究员方案,且不会牺牲模型整体能力。该研究被视为迈向递归自我改进的重要一步,但当前仍受限于基准测试可靠性等因素。」

用AI模型训练其他AI模型,正成为新一代AI实验室重点探索的方向。当地时间8月28日,Anthropic研究员计划的一名研究人员展示了这种思路真正落地后可能呈现的样子。Anthropic发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用AI系统改善模型在一系列对齐基准测试中的表现。

研究团队针对10种具体的失调行为设置测试,自动化系统最终让全部10项指标都有所改善,同时没有牺牲模型的整体能力。这套系统由Anthropic研究员计划成员陈岳翰(音译)领导开发,工作流程与传统科研相似。自动化系统会先查阅已有文献,提出训练方法,再按照方案训练模型30分钟,并通过多轮尝试逐步提高测试成绩。有效方案会留下,无效方案则被淘汰,使整个研究过程能够快速扩大规模。

论文指出,总体来看,这些结果初步证明,自动化对齐后训练有望在近期成为一种真正可行的方法。这项研究也向递归自我改进迈出了一步,而许多人把递归自我改进视为AI发展的下一个重要阶段。如果AI模型能够改进自身的对齐训练方法,那么进一步改进更广泛的训练流程也并非没有可能。到了那一步,人类AI研究人员甚至可能逐渐失去存在的必要。

论文也直接比较了自动化对齐研究员(AAR)和人类研究人员的表现:“最优秀的AAR方法平均只需6小时,就能超过经验丰富的人类研究人员提出的方案。人类引导的研究方向,并不会导致更强的表现。”成本差距同样明显。“AAR每小时只需要大约4美元(现汇率约合27元人民币)的API推理成本,而我们支付给人类研究人员的费用是每小时150美元(现汇率约合1011元人民币)。”

不过这套方法仍有明显限制。自动化系统的效果首先取决于基准测试能否准确反映真正的对齐目标,即使测试本身可靠,建立和长期维护这些基准仍需要大量投入。自动化研究员依赖的研究文献同样需要持续维护和扩充。

# Anthropic # 自动化研究 # AI对齐 # 递归自我改进

来源:Heooo AI工具导航