阿里开源Qwen-UI-Agent真机多模态基座模型
「阿里巴巴正式开源以真实世界为中心的GUI智能体基座模型Qwen-UI-Agent,全面覆盖移动端、电脑端、网页端及深度搜索环境。该模型在MobileWorld测试中得分82.1%,自建真机基准MobileWorld-Real成功率高达92.2%,并支持命令行操作、批量动作输出与全过程安全判断,展现强大的真实设备操作能力。」
阿里巴巴近日正式推出以真实世界为中心的GUI智能体基座模型Qwen-UI-Agent,并选择开源路线。该模型全面覆盖移动端、电脑端、网页端以及深度搜索环境,旨在打破传统模拟测试的局限,让模型真正具备在复杂真实设备上无缝操作的能力。这一举措为开发者与研究者提供了面向真机交互场景的高性能基座选择。
在权威测试与实际环境中,Qwen-UI-Agent展现出强劲的综合性能。移动端方面,它在MobileWorld测试中斩获82.1%的高分,领先多个主流国际旗舰模型;而在自建的百台真机基准MobileWorld-Real上,其操作成功率高达92.2%,在Android Daily评测中更是接近满分。电脑端方面,该模型在OSWorld-Verified中取得79.5%的成绩,同时在多项任务中相比基线大幅节省了执行步数。网页与通用能力上,它在WebArena网页测试中位列所有对比模型第一,且其通用和Agentic能力全面超越训练基座模型,能够从容应对长尾需求。
为了打通“从模拟到真实”的最后一公里,Qwen-UI-Agent搭建了覆盖100多台真实手机、150多个应用的真机移动环境,用于任务构建、轨迹采集及模型训练,并推出包含400多个任务的MobileWorld-Real真机基准,使研发团队能够根据真机成功率进行精准选型。这一真机基础设施的构建,让模型在真实设备上的表现更加可靠,也提升了从实验室到落地的转化效率。
在功能特性上,Qwen-UI-Agent不仅支持常规的GUI界面操作,还能直接执行命令行操作,并在单次决策中以批量动作输出,大幅缩短了执行轨迹并提升了效率。同时,它具备完善的全过程安全判断机制:面对违法或高风险请求,它会直接拒绝并终止任务;而在涉及支付、数据删除、隐私授权等敏感场景时,则会在关键步骤主动停手,等待用户确认后再继续。这种安全设计使得模型在真实环境中的部署更为可控。
此外,该模型支持在超过100步的超长轨迹上进行在线强化学习训练,配合自适应课程学习,持续攻克高难度的长程任务。这意味着Qwen-UI-Agent能够在复杂、多步的交互中保持稳定表现,并随着训练推进不断优化决策路径。项目主页已同步开放,开发者可以进一步了解模型架构、基准详情与使用方式。
来源:Heooo AI工具导航