技术进展

阿里发布Qwen-UI-Agent GUI智能体基座模型

Heooo 08月20日18时33分 27 阅读

「阿里巴巴正式推出Qwen-UI-Agent,以真实世界为中心的GUI智能体基座模型,涵盖移动端、电脑端、网页端及深度搜索环境。在多项基准上超越GPT-5.6 Sol、Gemini 3.1 Pro等旗舰模型,自建真机环境,支持超长轨迹在线强化学习训练,并内置安全判断机制。」

阿里巴巴近日正式推出Qwen-UI-Agent,这是一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。该模型的核心理念是让AI真正理解并操作每一块屏幕,从而在真实应用场景中完成复杂的跨应用任务。

在性能表现上,Qwen-UI-Agent在多项GUI任务基准上全面对标乃至超越业界旗舰模型。移动端方面,其在MobileWorld基准上达到82.1%的准确率,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro达12.0、14.6、8.9个百分点;在真机基准MobileWorld-Real上更是达到92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol及Seed 2.1 Pro;AndroidDaily测试成绩高达97.5%,接近满分水平。

电脑端同样表现突出,OSWorld-Verified得分79.5%,超越GPT-5.5、Gemini 3.1 Pro及Seed 2.1 Pro;OSWorld-v2 Partial分数40.0%,同时相比基线节省了58%的执行步数。浏览器与深度搜索方面,WebArena达到73.6%,位列所有对比模型之首;BrowseComp-ZH得分为75.0%。在GUI Grounding能力上,ScreenSpot-Pro达到81.5%,并在其余四个grounding评测基准上全部刷新SOTA成绩。

为了打通从模拟到真实的最后一公里,Qwen-UI-Agent搭建了覆盖100多台真实手机、150多个应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建了MobileWorld-Real真机基准,包含超过400个任务和100多个应用。该模型不仅能够执行GUI操作,还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比接近一半,约40%的动作以batched actions形式输出,大幅缩短了执行轨迹,拓展了能力边界。例如,用户可以要求模型跨网站调研产品、核对价格并生成比价方案。

在安全机制方面,Qwen-UI-Agent将安全判断贯穿任务执行全过程。面对违法或高风险请求,模型不会执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,获得明确确认后再继续。这种设计确保模型既能高效执行,也懂得何时停手,符合AI安全使用的核心理念。

此外,Qwen-UI-Agent支持在超过100步的超长轨迹上进行在线强化学习训练,约一万个并发环境同时进行rollout,配合模型自适应课程学习,持续攻克长程任务。其通用能力和Agentic能力全面保持或超越训练基座模型,并在两类任务上大幅领先于GUI专用模型,能够从容应对真实世界的长尾需求。

# Qwen-UI-Agent # GUI智能体 # 阿里巴巴 # 大模型 # Agent

来源:Heooo AI工具导航