行业资讯

图灵奖得主警告AI过度依赖合成数据

Heooo 08月19日15时02分 20 阅读

「图灵奖得主里奇·萨顿在红杉资本播客中警告,AI行业过度依赖合成数据是重大错误。他认为人工生成的数据无法替代真实体验数据,并已创办Oak Lab开发从自身经历学习的AI智能体。科技巨头仍在争抢真实数据,凸显这一争议的紧迫性。」

加拿大计算机科学家、图灵奖得主里奇·萨顿近日在红杉资本播客中发出严厉警告:AI行业越来越依赖合成训练数据,正在把整个行业带向错误方向。当被问及合成数据能否帮助大型语言模型持续扩展时,萨顿直言:“这绝对是个大错误。也许这会成为下一条重要的经验教训。”

所谓合成数据,是指由算法或AI模型人工生成的信息,而非从真实世界中采集的原始数据。随着AI公司不断搜寻互联网及其他新的训练数据来源,合成数据的吸引力日益上升。例如,自动驾驶训练可以使用计算机生成的汽车图像,AI欺诈检测系统则可以借助虚构的银行交易记录进行训练。然而,萨顿认为人工制造的数据并不能充分替代真实数据。

萨顿以人类行为为例指出:“我们不可能为其他人的思想制造合成数据。”他更倾向于使用真实的体验数据,即AI智能体通过与真实环境互动、观察实际发生的事情,并不断从行动结果中学习所获得的信息。他强调:“你无法通过合成数据预测无人机在现实物理世界中会如何与环境互动。”同时,机器人的电机中存在摩擦和磨损等变量,这个世界无比复杂,任何模拟都不过是管中窥豹。

某种程度上,科技巨头也认同萨顿的观点。各大科技公司正在不惜一切代价寻找更多真实数据。OpenAI此前公开寻找大规模、专有的数据集,希望获得那些无法轻易从互联网上获取的数据用于训练AI模型。本周早些时候,谷歌同意支付1000万美元收购已破产的Spirit Airlines内部数据和软件,这也凸显出专有真实数据对于AI训练的价值正在不断提升。

这种理念如今已落地为一家初创企业。上个月,萨顿与他的前学生Khurram Javed共同创办了Oak Lab。这家初创公司正在开发能够持续从自身经历中学习的AI智能体,而不是主要依赖规模庞大、提前整理好的数据集。目前Oak Lab尚未公布融资轮次或投资者信息,但萨顿的加入无疑为该方向增添了重要的行业关注度。

# 合成数据 # 里奇·萨顿 # AI训练

来源:Heooo AI工具导航