阿里发布Qwen-UI-Agent 移动端基准超越GPT 5.6与Claude Opus 4.8
8月20日,阿里巴巴正式推出Qwen-UI-Agent,一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

据官方介绍,Qwen-UI-Agent在多项GUI基准测试中全面对标并超越业界旗舰模型。移动端方面,在MobileWorld基准上达到82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8达12.0和14.6个百分点;在真机基准MobileWorld-Real上达到92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol等模型;在AndroidDaily上更是高达97.5%,接近满分。电脑端方面,在OSWorld-Verified上达到79.5%,超越GPT-5.5、Gemini 3.1 Pro等模型。浏览器与DeepSearch方面,在WebArena上达到73.6%,位列所有对比模型第一。GUI Grounding方面,在ScreenSpot-Pro上达到81.5%,在其余4个评测基准也全部刷新SOTA。

Qwen-UI-Agent搭建了覆盖100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准(400多项任务、100多款应用),打通“从模拟到真实”的最后一公里。GUI操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作——电脑任务中CLI动作占比近半,约40%动作以批量形式输出。
安全机制方面,Qwen-UI-Agent将安全判断贯穿任务执行全过程:面对违法或高风险请求直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,在关键步骤主动停手并向用户说明情况。模型还支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境同时rollout,持续攻克长程任务。

