你手机里那些需要连点十几下才能完成的日常操作——订票、比价、跨App填表——AI终于能替你做了。阿里最新发布的Qwen-UI-Agent在真实手机基准上拿到92.2%,AndroidDaily任务接近满分,移动端多项指标直接超越GPT-5.6和Claude Opus。

一、真机92.2%:AI操作手机为什么这么难

模拟器与真实设备的鸿沟

GUI智能体在模拟器里跑分容易,换到真机就掉链子,这是行业普遍现象。模拟器环境固定、界面干净、响应延迟可预测,而真实设备存在分辨率差异、App版本碎片化、网络抖动、弹窗干扰等变量。阿里团队在技术报告中明确指出,MobileWorld-Real真机基准与MobileWorld模拟器基准之间存在显著性能落差,这正是大多数模型未能跨过的门槛。

Qwen-UI-Agent的真机训练策略

Qwen-UI-Agent的突破在于训练基础设施。团队搭建了包含100台真实手机、150余款应用的测试集群,直接在真机环境上进行数据采集和模型训练。这种"真机优先"的策略让模型在训练阶段就接触到真实设备的噪声和不确定性,而非在模拟器里学完再迁移。技术报告指出,这种训练方式使模型在MobileWorld-Real上达到92.2%,比第二名高出约4个百分点。

数据来源:阿里千问官方技术报告,Hugging Face Papers(https://huggingface.co/papers/2607.28227)

程序员系列表情:整天在群里瞎比比,写代码没见你这么积极

##一、真机92.2%:AI操作

二、移动端碾压GPT-5.6,电脑端也不弱

MobileWorld与OSWorld基准解读

MobileWorld是阿里千问团队发布的移动端GUI智能体评测基准,覆盖订票、比价、跨App填表等真实用户场景,测试模型在复杂多步任务中的执行成功率。AndroidDaily则聚焦日常高频操作,如消息发送、相册管理、设置调整等,更接近普通用户的实际使用习惯。

OSWorld是电脑端GUI智能体的主流评测基准,测试模型在桌面环境下的任务执行能力,包括文件管理、软件操作、网页浏览等场景。OSWorld-Verified是其中的严格版本,要求模型完整完成任务才算成功。

Qwen-UI-Agent在MobileWorld上达到82.1%,在真机基准MobileWorld-Real上达到92.2%,AndroidDaily高达97.5%。电脑端OSWorld-Verified达到79.5%,OSWorld-v2 Partial分数为40.0%。浏览器WebArena达到73.6%,ScreenSpot-Pro界面定位达到81.5%。

与海外旗舰模型的具体差距

移动端方面,Qwen-UI-Agent的82.1%分别领先GPT-5.6 Sol的67.5%和Claude Opus 4.8的62.3%,差距约12至15个百分点。真机基准MobileWorld-Real上,Qwen-UI-Agent的92.2%超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro等海外旗舰模型。

电脑端差距明显缩小。OSWorld-Verified上,Qwen-UI-Agent的79.5%与GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro处于同一梯队,差距在可接受范围内。OSWorld-v2 Partial分数40.0%,相比基线节省58%执行步骤,说明模型在长程任务中的效率优化较为有效。

移动端领先的原因在于训练策略。Qwen-UI-Agent基于100台真实手机、150余款应用构建训练集群,引入用户确认机制保障安全边界,支持CLI命令与GUI操作交错执行,单次批量输出多个动作,并在100步以上超长轨迹上进行在线强化学习。这种真机训练方式让模型在真实设备上的表现远超依赖模拟器训练的海外模型。

电脑端竞争更激烈,海外模型在桌面环境积累更早,数据生态更成熟。Qwen-UI-Agent在电脑端的表现说明阿里在移动端建立了先发优势,但桌面端的追赶仍需时间。

来源:阿里千问官方技术报告

程序员 reaction:BECALSE

##二、移动端碾压GPT-5.6

三、不止点屏幕:CLI与GUI的交错执行

批量动作输出如何缩短执行轨迹

GUI智能体最常见的效率瓶颈不在识别,而在执行节奏。传统方案里,模型每看到一次屏幕状态,就输出一个动作,等待执行结果,再进入下一轮决策。这种单步循环在简单任务上还能跑通,一旦任务步数超过50步,累积的延迟和错误就会指数级放大。

Qwen-UI-Agent的做法是在单次模型响应中批量输出多个动作。这意味着模型可以在一次推理里同时决定「点击搜索框」「输入关键词」「按下回车」这一串连续操作,而不是分三步来回交互。对于需要连续点击、滑动、输入的场景,这种批量输出能把执行轨迹压缩到原来的三分之一到一半。

这种设计并非阿里首创,但关键在于批量动作的边界如何划定。动作之间不能互相依赖,否则批量执行就会出错。Qwen-UI-Agent通过统一动作空间来解决这个问题——GUI操作和CLI命令被映射到同一套输出格式里,模型在生成时就能同时规划界面点击和命令行调用,而不是把它们当作两个独立系统。

命令行操作在电脑任务中的占比

在电脑端任务里,CLI(命令行界面)的占比接近一半。根据阿里发布的报告,约40%的电脑端动作以batched actions形式输出,其中相当一部分是CLI命令而非GUI点击。

这个比例背后有一个很实际的逻辑:很多电脑任务本质上不需要图形界面。查文件、跑脚本、管理进程、处理数据,这些操作在终端里一步就能完成,而在GUI里可能需要点五六次菜单。把CLI纳入统一动作空间,等于给智能体开了一条捷径。

以跨网站调研产品、核对价格、生成比价方案这类任务为例,模型可以先在浏览器里打开多个标签页抓取信息(GUI操作),然后调用终端脚本做数据清洗和对比(CLI操作),最后把结果写回文档。整个过程不需要在界面和命令行之间来回切换,模型自己就能规划好顺序。

这种混合执行模式对长程任务的意义很大。OSWorld-v2的Partial分数达到40.0%,相比基线节省58%执行步骤,批量CLI输出是主要贡献因素之一。不是所有任务都能用CLI替代GUI,但在电脑端,这个替代比例已经高到足以改变效率曲线。

参考资料:Qwen-UI-Agent Technical Report

程序员 reaction:真是够了

##三、不止点屏幕:CLI与GU

四、百步长任务与数据飞轮

在线RL训练如何攻克长程任务

GUI智能体的核心难点不在单步点击,而在长程任务中保持轨迹不偏航。过去多数模型在10步以内表现尚可,超过50步后错误率呈指数上升——一步点错,后续所有操作都建立在错误状态上,最终任务失败。

Qwen-UI-Agent的解法是在超过100步的超长轨迹上进行在线强化学习。技术报告披露,训练时约10000个并发环境同时rollout,配合模型自适应课程学习。这意味着模型不是在一个固定数据集上反复训练,而是在真实任务执行过程中持续获取反馈、调整策略。

自适应课程学习的关键在于难度调度。训练初期,系统优先让模型完成短轨迹任务,建立基础操作能力;随着模型稳定,逐步引入更长、更复杂的任务序列。这种调度方式避免了模型在初期面对高难度任务时因频繁失败而陷入局部最优。

在线RL的另一个优势是环境反馈的实时性。模型在真实设备集群上执行任务,每一步操作都能获得即时状态更新。这种闭环反馈比离线数据集训练更接近真实使用场景,模型学到的策略也更鲁棒。

Agent驱动的数据迭代闭环

数据飞轮是Qwen-UI-Agent区别于早期GUI智能体的重要特征。传统做法是人工标注任务、构建数据集、训练模型,流程线性且迭代缓慢。Qwen-UI-Agent将数据生产本身也自动化,形成持续迭代的闭环。

飞轮的中心是训练数据和模型迭代,外圈包含domain capability bootstrapping、task synthesis、environment synthesis、trajectory collection、judging、failure analysis和next-iteration planning七个环节。系统先用强基础模型分析不同领域所需的知识与能力,生成初始任务集;模型执行后,失败轨迹被自动收集并分析,用于生成下一轮训练数据。

这种设计让数据生产不再依赖人工标注。模型在真实设备上的每一次执行,无论成功还是失败,都能转化为训练信号。失败案例尤其有价值——它们揭示了模型在特定场景下的盲区,指导后续训练重点。

飞轮的另一个关键是judging机制。系统需要判断任务是否真正完成,而不仅仅是模型是否执行了预期动作。这要求judging模块具备任务级理解能力,能够识别「虽然操作路径不同,但目标已达成」的情况。

从工程角度看,数据飞轮的价值在于降低了模型迭代的边际成本。初期需要较多人工介入来构建基础能力,但随着飞轮运转,数据生产逐渐自动化,模型能力提升的瓶颈从数据规模转向任务复杂度和环境真实性。

这一路径的边界在于:飞轮的有效性依赖于真实设备集群的规模和稳定性。100台手机、150余款应用的集群是阿里目前的投入规模,其他团队若缺乏同等基础设施,数据飞轮的转速会显著受限。此外,judging机制的准确性直接影响飞轮质量,错误的judging会导致模型在错误方向上持续迭代。

程序员 reaction:suddenlyfor

##四、百步长任务与数据飞轮##

五、安全边界与可执行判断

GUI智能体走向真实设备,权限控制是绕不过去的硬约束。Qwen-UI-Agent将ask_user动作纳入统一动作空间,支付、登录、验证码等敏感操作必须经过用户确认。这不是能力不足的表现,而是安全边界的一部分。

将敏感操作完全交给模型自动执行,风险远高于人工确认的成本。一旦模型误判,后果可能是资金损失或隐私泄露。ask_user机制在灵活性与安全性之间找到了可接受的平衡点。

对于开发者而言,Qwen-UI-Agent的发布提供了一个可验证的基线。移动端任务若以MobileWorld或AndroidDaily为评估标准,当前旗舰模型的分水岭已清晰可见。若你的应用场景以移动端为主,Qwen-UI-Agent是现阶段值得优先评估的选项;若任务以电脑端复杂工作流为主,OSWorld-Verified上的表现可作为参考,但需结合具体场景验证。

技术报告与模型权重已在Hugging Face开源(arxiv.org/abs/2607.28227),团队主页为tongyi-mai.github.io/Qwen-UI-Agent。

程序员反应图:吃我一招

##五、安全边界与可执行判断GU

五、安全边界:什么时候该问用户

ask_user机制的设计逻辑

GUI智能体真正的考验不是模拟器里的跑分,而是换到真机上还能不能稳定干活。Qwen-UI-Agent在设计上把用户确认动作直接纳入动作空间,这意味着模型在遇到支付、登录、验证码、发送消息等敏感操作时,会主动调用ask_user而非自行完成。

这种设计的核心逻辑是:把不可逆操作的控制权交还给人类。模型可以规划路径、识别界面元素、执行点击,但涉及资金流转或隐私暴露的动作,必须经过用户确认。这并非能力不足的表现,而是安全边界的一部分——把支付、登录、验证码这些动作完全交给模型,才是真正危险的。

从技术实现看,ask_user动作会被插入到执行轨迹中,系统暂停并等待用户输入。用户确认后,模型继续执行后续步骤。这种设计让长程任务在遇到敏感节点时不会盲目推进,而是形成可中断、可审计的执行链。

权限隔离与误操作恢复

把GUI智能体部署到个人设备,权限隔离和误操作恢复会成为决定性问题。Qwen-UI-Agent的论文把用户确认放进动作空间,但真实产品还需要更细的权限模型、可撤销机制、审计日志和任务级风控。

权限隔离的核心在于区分"读"和"写"。模型可以读取屏幕内容、执行搜索、填写表单,但涉及确认支付、发送消息、修改设置等写操作,需要额外的权限校验。误操作恢复则需要系统层面的支持:任务级回滚、操作日志、一键撤销等机制,让模型犯错时有补救路径。

从经验看,当前阶段最务实的做法是分层授权:基础操作(点击、滑动、输入)由模型自主执行;敏感操作(支付、登录、发送)需要用户确认;高风险操作(删除、授权第三方)需要二次确认或完全由用户控制。

程序员 reaction:SalesforceCEosaysengineers

##五、安全边界:什么时候该问用

六、从沙箱到真实设备:GUI智能体的下一步

跨端统一动作空间的意义

Qwen-UI-Agent的一个重要设计是统一动作空间,将GUI操作与CLI命令交错执行。在电脑任务中,CLI动作占比近半,约40%的动作以batched actions形式输出,大幅缩短执行轨迹。

这种设计的意义在于:不同平台有不同的自动化优势。移动端适合GUI交互,电脑端适合CLI命令,网页端适合浏览器自动化。统一动作空间让模型可以根据任务类型选择最优执行路径,而不是被单一交互模式限制。

跨端统一还意味着工作流的连续性。用户可以在手机上发起任务,模型在电脑上继续执行,最终结果返回到手机。这种跨端能力是个人AI助手真正落地的基础。

主动服务与持续工作流的展望

Qwen-UI-Agent引入了轻量级harness层,用于主动发起服务和维持有状态的工作流。相比只响应用户单步指令,这意味着系统希望进一步承担持续执行和主动服务角色。

主动服务的核心是"在正确的时间做正确的事"。比如,用户设定了"每周比价一次"的任务,模型可以在每周固定时间自动执行比价、记录结果、生成报告。这种持续工作流需要模型具备任务记忆、状态维护和触发机制。

但主动服务也带来新的风险:模型可能过度主动、误触发、或在用户不知情时执行敏感操作。因此,主动服务的边界需要明确:用户授权的范围、触发条件的透明度、执行结果的可见性,这三者缺一不可。

从沙箱到真实设备,GUI智能体正在从"能点屏幕"走向"能干活"。Qwen-UI-Agent的92.2%真机基准和97.5%的AndroidDaily分数,证明了这一方向的技术可行性。但真正的考验才刚刚开始:在真实设备上稳定执行长程任务、在敏感操作中守住安全边界、在跨端场景中保持工作流连续,这些才是决定GUI智能体能否真正走进日常的关键。

程序员 reaction:softwaredeveloperswere

##六、从沙箱到真实设备:GUI

上一篇:
查份合同要翻半天?Mistral 新方案让 AI 准确率翻三倍
下一篇:
新文章

分享到这些地方