2026年3月29日 · 阅读 —
从2B到235B全开源!阿里GUI-Owl-1.5,重新定义多平台GUI智能体
从2B到235B全开源!阿里GUI-Owl-1.5,重新定义多平台GUI智能体
凌晨两点,桌面、手机、浏览器三个窗口一起开着,任务却卡在同一件事上:一个看起来很简单的操作,换个平台就开始变脸。手机上能点,电脑上找不到;浏览器里正常,切到移动端就失焦;你以为是在调一个模型,实际上是在跟三个世界打架。GUI 智能体这几年火得很快,但真往实战里放,最先露馅的往往不是模型不够大,而是数据不够真、平台不够全、能力不够完整。
阿里通义实验室这次放出来的 GUI-Owl-1.5,核心就不是“再做一个会点按钮的 Agent”,而是想把这件事从根上重做一遍。它直接把模型家族拉到了 2B 到 235B 的跨度,还分成 instruct 和 thinking 两种模式,摆明了不是只给实验室演示用,而是想把边缘实时交互、复杂任务规划、云边协同这些活一并接住。说白了,它想解决的不是单点聪明,而是整条 GUI 工作流别掉链子。
一、它到底想解决什么问题
GUI 智能体真正难的地方,通常不是“能不能点”,而是“能不能在真实世界里稳定地把事做完”。挑战主要卡在三处:一是真实 GUI 操作轨迹贵,采集慢,规模根本铺不开;二是多平台环境差异太大,桌面、移动、Web 不是一个语法;三是一个能打的 Agent 不能只会点击,还得会工具调用、记忆、多智能体协作,最好还得能在复杂任务里保持脑子不短路。
GUI-Owl-1.5 的思路很直白:别再把 GUI Agent 当成“看图点点点”的小玩具,得把它当一个真正的原生智能体来训。也就是,输入不只是截图和指令,输出不只是一个动作,而是带解释、带执行、带上下文管理的一整套决策。这个方向其实挺现实,因为真到生产里,用户不会给你温柔的单步任务,系统也不会永远保持同一种界面状态,Agent 不学会适应,就只能在 demo 里漂亮一下。
它最值钱的地方,不在于“有个新名字”,而在于它把 GUI 智能体这件事拆成了可训练、可扩展、可跨平台迁移的工程问题。这个拆法一旦成立,后面很多能力才有机会真正长出来。
二、它的骨架是什么样
GUI-Owl-1.5 所在的 Mobile-Agent-v3.5 框架,本质上是在把 GUI 任务建模成一个多轮交互的决策过程。每一轮,Agent 都会看见当前截图,也会拿到用户指令,然后同时产出两样东西:一个自然语言的行动结论,用来解释和总结;一个结构化工具调用,用来真正执行。这个设计挺像一个靠谱同事的工作方式:先说自己打算干什么,再把事干了,而不是闷头乱点。
为了处理长序列任务,它还用了分层上下文压缩。最近几轮的完整多模态历史会保留,更早的内容就压成纯文本摘要。这个动作看着朴素,其实很要命。GUI 任务最怕什么?最怕上下文越滚越大,模型像个开了十几个群的群主,前面说过什么早忘了,后面还在硬装镇定。能把历史保留住,又不把上下文撑爆,这一步是能不能走长任务的分水岭。
换句话说,这套骨架不是为了炫技,而是为了让 Agent 在真实操作里不至于丢三落四。很多 GUI Agent 一上来就喜欢讲“自我反思”“任务规划”,结果点个窗口都能迷路。GUI-Owl-1.5 至少是先把底盘搭稳了,再往上加能力。
三、数据这块,它是怎么补的
这种模型最难的地方,永远是数据。你想让它会干活,就不能只喂一堆静态截图,那种东西离真实操作太远了。GUI-Owl-1.5 这次走的是混合数据飞轮:一头连模拟环境,一头连云端沙箱。模拟环境负责生成高频、复杂、甚至有点恶心人的原子操作,比如弹窗、验证码、多窗口切换这些;云端沙箱负责采集真实设备上的轨迹,让数据别只活在理想状态里。
它在定位数据上也没偷懒。除了从轨迹里提取定位样本,还从教程字幕里挖问答,再用挑战性 App 合成、多窗口高分辨率合成去补复杂场景;甚至还会主动生成不可行查询,也就是负样本,逼模型别总以为所有指令都能爽快地执行。这个思路很工程,甚至有点坏,但很有效。模型要是真没见过“这条路走不通”,一到真实环境里就容易上头。
轨迹数据的采集更狠。它不是单一来源,而是四路并进:一条是基于 DAG 的人工任务合成,把原子子任务和任务流转关系先定下来;一条是让智能体在真实设备上跑这些任务,再通过检查点验证每一步;一条是让人类专家补那些自动化方法啃不动的困难任务;最后一条是基于 Web 渲染的虚拟环境,用脚本或 RPA 批量生成 100% 正确的轨迹。这样拼起来,才像一个能训练 Agent 的数据工厂,而不是一个只有论文味的演示间。
四、能力增强这块,它加了什么
一个强 GUI Agent 光会执行不够,得有知识、得会反思、得懂协作。GUI-Owl-1.5 在这块做了三层增强。第一层是 GUI 知识注入:从官方文档、论坛、问答平台里抓知识,做成 QA 和 VQA 数据,补模型的常识底盘;再往前一步,还让模型学会预测“点了这个之后界面会怎么变”,也就是做 world modeling。这个动作很关键,因为 GUI 不是静态图片,操作一旦发生,状态就变了,模型不理解变化,后面全是瞎忙。
第二层是统一的思维链合成。它不是只训练“看见什么点什么”,而是给所有轨迹都补上思维过程:观察、记忆管理、进度反思、工具调用推理,一条链串下来。这个就像给一个原本只会执行的人,硬生生补上复盘习惯。不是为了把模型训练得更会装,而是让它在长任务里别那么容易失忆、失控、失去方向。
第三层是多智能体协作。数据收集里直接引入了管理者、工作者、反思者、记录者这些角色,任务拆开来跑。这个设计挺聪明,因为 GUI 世界里,很多事本来就不是一个脑子全包的。有人负责规划,有人负责执行,有人负责验收,有人负责记忆,最后组合起来才像一个靠谱团队。模型如果只在单人模式里见过世界,真到复杂协作时就容易一脸懵。
五、训练范式为什么也值得看
这类模型最后能不能站住,还是看训练。GUI-Owl-1.5 的训练分三段:预训练、监督微调、强化学习。前两段大家都熟,真有意思的是最后一段,它用了一个叫 MRPO 的环境 RL 扩展框架,专门处理多平台冲突和长序列训练效率低的问题。这个问题在 GUI 场景里很典型:手机、PC、Web 的状态差异大,任务链又长,不把 RL 这块处理好,模型很容易学得散。
我觉得这部分最重要的信号不是“又发明了一个缩写”,而是它终于认真承认:多平台 GUI 智能体不是单一环境里的小游戏,它是一个跨平台、跨状态、跨任务链的系统工程。训练如果还按单平台、单视角、单动作来,那最后出来的东西,大概率还是只适合做 demo。GUI-Owl-1.5 至少在训练方式上,是朝着“真能干活”去的。
六、这次开源意味着什么
从 2B 到 235B 的全开源,不只是给了一个模型列表,更像是把一整套多平台 GUI 智能体的训练思路摆到了台面上。对于边缘设备,2B 这种小模型可以负责高频实时交互;对于复杂任务,235B 这种大模型可以做规划和反思;中间还可以走云边协同。这个结构很像现实里的工程队伍:小兵跑腿,主将决策,中间通过清晰的上下文和任务分工串起来。
更关键的是,它在 20 多个 GUI 基准上拿到了开源模型的 SOTA。这不代表问题都解决了,但至少说明,原生多平台 GUI Agent 已经不是“未来概念”,而是开始进入可比较、可复现、可迭代的阶段了。对整个 GUI 智能体方向来说,这个信号比单纯的参数规模更重要。模型能开源,思路能复用,才有可能真的往外扩。
变更摘要(改了什么)
这版没有把 GUI-Owl-1.5 写成单纯的论文摘要,而是把重点往“为什么它值得看”上收了收。原始内容里那些数据、框架、训练流程都保留了,但表达上更像一篇可直接收进知识库的技术分享:先说痛点,再讲骨架、数据、能力增强和训练范式,最后落到开源意味着什么。
同时把抽象的技术点往场景里压了一点,比如多平台切换、上下文压缩、负样本、云边协同这些东西,都用更像真人说话的方式讲出来了。这样读起来不会像一份“论文速记”,而更像一个做工程的人在边看边复盘。
风险点(哪里可能翻车)
这篇最容易翻车的地方,是模型名、数据集名、分数太多,稍不注意就会变成信息堆砌。GUI 方向本来就很吃细节,但一旦细节没有节奏,读者就只会记住一堆数字,不会记住主线。另一个风险是,模型能力写得太满,容易让人误以为“多平台 GUI 智能体已经很成熟了”,但实际离真正稳定的产品化还差一段。
回滚方案(怎么撤)
如果你觉得这一版还是偏重,最稳的撤法就是把中间关于数据流水线和训练范式的细节再压一点,只保留“为什么 GUI 智能体难、GUI-Owl-1.5 怎么拆问题、它开源意味着什么”这三段。这样内容会更利落,也更适合快读。
行动清单(读完怎么做)
如果你做 GUI Agent、自动化测试、RPA 或多平台交互相关的工作,先重点看它怎么做数据飞轮、怎么做上下文压缩、怎么把单智能体和多智能体数据一起训。再回头对照你自己的项目,看缺的是数据、能力,还是训练范式。别急着追参数规模,先把自己这条链路上的短板找出来,才知道该学哪一段。
封面3要点
- 多平台 GUI 智能体开源
- 数据飞轮 + RL 扩展
- 从点点点到完整协作
推荐标签
#GUI智能体 #多平台Agent #视觉语言模型 #自动化测试 #RPA #MobileAgent #阿里通义 #开源模型 #Agent工作流 #AI工具调用
爆款标题备选(任选其一)
- 从2B到235B全开源,GUI智能体这次真卷起来了
- 阿里 GUI-Owl-1.5,把多平台 GUI 智能体又往前推了一截
- GUI 智能体别只会点点点,GUI-Owl-1.5 把协作也补上了
- 多平台 GUI 智能体,为什么阿里这次值得认真看
- 2B 到 235B 全开源,GUI-Owl-1.5 到底强在哪
- GUI-Owl-1.5 不是换皮,它是在重做 GUI 智能体底座
- 这次开源的,不只是模型,是一整套 GUI 智能体方法
- GUI 智能体真正难的,根本不是“会不会点击”