阿里发布Qwen-UI-Agent,全面超越旗舰模型 封面图
技术进展

阿里发布Qwen-UI-Agent,全面超越旗舰模型

Heooo 08月21日14时00分 25 阅读

「阿里巴巴发布GUI智能体基座模型Qwen-UI-Agent,覆盖移动端、电脑端、网页端及深度搜索环境,在多项基准测试中超越GPT、Claude和Gemini系列。真机环境覆盖超100台手机与150款应用,支持命令行操作与批量动作输出,并强化了安全机制与长程任务能力。」

阿里巴巴正式发布全新的GUI智能体基座模型Qwen-UI-Agent,该模型全面覆盖移动端、电脑端、网页端及深度搜索环境,并在多项核心图形用户界面基准测试中全面对标并超越业界多款旗舰模型。这一发布标志着GUI智能体领域进入了一个新的发展阶段。

在移动端基准表现方面,Qwen-UI-Agent展现出强劲实力。在MobileWorld基准上,其得分达到82.1%,分别领先GPT-5.6Sol和Claude Opus4.8达12.0和14.6个百分点;在真实环境基准MobileWorld-Real上,取得92.2%的成绩,超越了Gemini3.1Pro、Claude Opus4.8以及GPT-5.6Sol;在AndroidDaily基准上更是高达97.5%,接近满分表现。这些数据充分证明了该模型在移动端GUI理解与操作方面的领先水平。

阿里发布Qwen-UI-Agent,全面超越旗舰模型

在电脑端与浏览器方面,Qwen-UI-Agent同样表现卓越。其在OSWorld-Verified上达到79.5%,超越GPT-5.5和Gemini3.1Pro;在WebArena上也以73.6%的成绩位列所有对比模型第一。此外,在GUI Grounding的ScreenSpot-Pro测试中取得81.5%的分数,并刷新了其余4个评测基准的SOTA记录。

为了攻克从模拟到真实的落地难题,Qwen-UI-Agent搭建了覆盖100多台真实手机和150多款应用的真机移动环境,用于执行任务构建、轨迹采集、模型训练与评测,并自建了包含400多项任务和100多款应用的MobileWorld-Real真机基准。除了常规的GUI点击操作外,该模型还支持直接执行命令行操作,并在单次决策中批量输出多个动作,其中电脑任务中的CLI动作占比近半,约40%的动作以批量形式输出。

在安全性与长程任务处理方面,Qwen-UI-Agent将安全机制贯穿任务执行的全过程。面对违法或高风险请求,模型会直接拒绝并终止任务;而在面对支付、数据删除、隐私授权等敏感场景时,则会在关键步骤主动停手并向用户说明情况。同时,模型支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境同时rollout,持续攻克高难度的长程任务。这一系列的工程与算法创新,为GUI智能体的可靠应用奠定了坚实基础。

# Qwen-UI-Agent # GUI智能体 # 阿里巴巴

来源:Heooo AI工具导航