技术进展

OpenAI让AI智能体熟练操作电脑

Heooo 08月20日22时02分 27 阅读

「据《商业内幕》报道,OpenAI员工乐观估计公司正接近实现让AI智能体像人类一样熟练操作电脑的目标。其训练方法融合逐帧屏幕截图、真人示范与强化学习,ChatGPT已能快速读取网页底层信息并自主执行数据录入、日程安排等任务,但速度与安全性仍有待提升。」

据《商业内幕》报道,OpenAI员工乐观估计,公司正接近实现自2015年成立以来就设定的目标:让AI智能体像人类一样熟练地操作电脑,尤其是使用浏览器。这一能力被称为电脑操作技术,是OpenAI在通用人工智能道路上的一块重要拼图。

电脑操作团队经理阿里·韦恩斯坦表示:“一旦ChatGPT操作电脑和软件的速度超过你我,就会改变人们默认与电脑交互的方式。”这不仅是效率的提升,更可能重塑人机交互的底层逻辑。

实现这一目标的最大难题之一,是获得足够的训练数据。据哥伦比亚大学AI研究员周宇分析,OpenAI从模型训练初期到后期各个阶段,都加入了专门提升电脑操作能力的数据和训练流程。在最初的大规模基础训练阶段,OpenAI很可能加入了逐帧屏幕截图,让模型提前接触有助于电脑操作的信息;进入后续训练阶段后,开发人员会向模型展示完成特定任务所需的正确操作,例如填写税务表格或完成3D模型所需的一系列电脑操作。

其中一部分训练数据来自真人示范。OpenAI公布2025年版电脑操作功能时曾透露,公司使用过由人类演示任务完成过程的数据集,但未透露最新训练数据的具体情况。周宇指出,这类数据价格昂贵,因为获取困难,且需要大量工作才能整理成可直接用于训练的形式。此外,OpenAI还利用强化学习让模型反复尝试虚拟任务,并奖励成功完成任务的行为,使模型掌握更多“获得过奖励的操作”。

在信息获取方式上,OpenAI也有了显著变革。韦恩斯坦介绍,过去ChatGPT需要反复截取屏幕、分析像素、发送操作指令,再重新截屏分析;而现在,系统在打开网站后可以直接快速读取网页的底层信息,从内存结构、无障碍信息到链接关系都能应对。屏幕截图仍然是工作流程的一部分,用户开启电脑操作功能时需允许ChatGPT录屏,以便系统迅速识别当前显示的内容。这些能力结合后,Codex就能自行测试生成的代码、发现问题并继续修改,形成“完整闭环”。

电脑操作技术的一大价值,在于让ChatGPT智能体能够进入互联网中大量彼此独立的服务和“长尾”网站。从预约网站、企业内部库存系统到社媒平台,许多在线工具原本就是为人类手动点击和输入设计的。已有用户利用这一功能自动处理数据录入、合规任务和日程安排。韦恩斯坦指出,模型能力提高后,越来越能主动发现错误并自行修正,因此更容易把任务做完,也更不容易在网络环境中被无关内容带偏。

不过,周宇认为目前电脑操作技术的速度距离普通消费者期待的水平仍有明显差距:“在训练数据非常充足的有限领域,电脑操作智能体确实可以表现得很好。想让它适应任何网页、任何应用程序和任何操作系统,仍然非常困难。”目前,该功能还不能迅速批量处理邮件回复,浏览社交媒体信息流时也显得较为迟缓。

安全方面,OpenAI CEO萨姆·奥尔特曼曾公开示警:“实用价值很大,潜在风险也同样不小。我们建议只向智能体提供完成任务所必需的最低权限,以降低隐私和安全风险。”OpenAI正在研究“确认策略”,确定AI执行下一步操作前应在何种情况下向用户请求授权。目前的原则是,只要智能体准备向外传输数据或删除内容,就必须先征得用户同意。如何在易用性和安全性之间找到平衡,仍是团队面对的挑战。

詹姆斯·孙和韦恩斯坦希望,随着OpenAI模型继续升级,电脑操作最终能够达到AI编程目前的效率,让AI直接操作网络工具比用户亲自动手更快。詹姆斯·孙表示:“对很多工程师来说,现在已经是让智能体写代码比自己写更快。根本不用权衡,直接让它做就行。我认为电脑操作以后也会越来越接近这种状态。”

# OpenAI # AI智能体 # 电脑操作 # ChatGPT # 强化学习

来源:Heooo AI工具导航