阿里千问大模型于2026年8月20日正式推出Qwen-UI-Agent,这是一款专为真实设备环境构建的GUI图形界面智能体基座模型,全面支持移动端、PC桌面端、网页应用及深度搜索场景。
该模型的核心突破在于赋予AI直接理解屏幕内容并模拟人类操作的能力,使其能够自然地与各类应用程序和软件交互,成为数字设备上的通用执行终端。
在多项权威基准测试中,Qwen-UI-Agent展现出领先行业的性能表现:移动端标准测试MobileWorld得分为82.1%,基于真实设备运行的MobileWorld-Real达92.2%,日常安卓任务测试AndroidDaily高达97.5%;PC端OSWorld?Verified得分为79.5%,网页交互测试WebArena为73.6%;界面元素精准定位能力ScreenSpot-Pro达到81.5%。多个指标刷新当前最优水平,综合能力已达到并与国际主流旗舰模型持平,部分场景实现超越。
模型依托大规模真实设备环境进行训练,构建了涵盖超百台真机、覆盖150余款主流应用的测试集群,完整打通从仿真推演到实机部署的全链路验证闭环。
安全设计贯穿模型运行始终:对高风险操作请求自动拦截;涉及支付、数据删除、权限授予等敏感行为,必须经用户明确授权后方可继续执行。
操作方式上支持GUI图形界面交互与CLI命令行指令协同工作,可一次性输出多步动作序列;在PC端任务中,近半数流程可调用系统命令行,显著压缩操作路径,提升执行效率。
模型具备超100步长轨迹的在线强化学习能力,训练过程依托上万并发的真实任务环境,结合AutoResearch风格的AI驱动数据飞轮机制,实现任务反馈、优化与迭代的自主闭环。
基于Harness框架,Qwen-UI-Agent具备主动服务意识,支持手机与电脑跨设备任务无缝衔接,并可与深度搜索能力深度融合,将网页信息检索与界面操作有机统一。
其核心使命是攻克大量未开放API的传统软件应用的智能化难题——无需修改原有程序,仅凭视觉理解屏幕即可完成操作,切实拓展智能体在真实世界中的应用广度与落地深度。

评论
更多评论