从12%到90.2%:OSWorld两年半曲线背后,Agent技术路线正在发生什么变化?

数据来源:OSWorld 官方榜单(截至 2026 年 9 月 10 日)
关键词:OSWorld、实在Agent、实在智能、Agentic Framework、Computer Use Agent

一、一条被忽略的曲线

如果把 OSWorld 榜单从 2024 年初拉到 2026 年 9 月,会看到一条几乎不像真的曲线:

  • 2024 年 4 月:OSWorld 论文发布,人类成功率 72.36%,最好的模型只有 12.24%。论文作者的结论是:当前 VLM Agent 在 GUI grounding 和操作知识上存在"显著缺陷"。
  • 2025 年中:Agentic framework 开始发力,agent s2.5、GTA1、CoACT-1 等把成绩推到 50%–60% 区间。
  • 2026 年 7 月 25 日:实在智能的 实在Agent90.2%(325.59/361) 登顶榜单,成为第一个突破 90% 的 Agentic framework。
  • 2026 年 8 月:Anthropic 的 claude-fable-5[1m] 以 86.0% 紧随其后,Pointer Agent w/ Opus 4.7 以 83.6% 位列第三。

两年半时间,从 12.24% 到 90.2%,提升了 7 倍以上。这不是某一家公司的胜利,而是一条技术路线从"端到端 VLM"转向"Agentic framework + 专用模型 + 工程化执行"的集体跃迁。

本文试图回答三个问题:

  1. 这两年半里,榜单上到底发生了什么?
  2. 实在Agent 的 90.2% 意味着什么?
  3. Agent 技术路线正在往哪个方向走?

在这里插入图片描述


二、先把 OSWorld 说清楚:它为什么难

OSWorld 由香港大学、Salesforce Research、CMU、University of Waterloo 联合提出,是第一个面向多模态 Agent 的可扩展真实计算机环境,支持 Ubuntu、Windows、macOS 三大操作系统。

它的核心特点:

维度OSWorld
任务数369(8 个 Google Drive 任务可排除,实际 361)
执行环境真实计算机环境(非模拟)
多模态支持
跨应用任务
中间初始状态
基于执行的评估函数134 个

与 WebArena、Mind2Web、GAIA 等 benchmark 不同,OSWorld 的任务是跨应用、开放式、带真实文件 I/O 的。比如:

  • 在 Chrome 里查资料,把结果整理进 LibreOffice Calc,再通过 Thunderbird 发出去;
  • 在 GIMP 里处理图片,保存到指定目录,再用 VLC 播放验证;
  • 在 VS Code 里修改配置,然后到 OS 层面验证文件权限。

这正是"Computer Use"最真实的形态:不是单点问答,而是长链路、多应用、带状态的操作流。

也正因如此,2024 年论文里的 12.24% 才显得刺眼——人类能完成 72.36%,最好的模型连人类的六分之一都不到。


三、两年半榜单演进:四个阶段

阶段一:2024 年——"端到端 VLM"的至暗时刻

2024 年 OSWorld 论文发布时,基线模型包括 GPT-4V、Gemini、Claude 等。结果:

  • 最好模型:12.24%
  • 人类:72.36%
  • 主要失败原因:GUI grounding(找不到控件)+ 操作知识缺失(不知道下一步该干嘛)

这一阶段的典型思路是:把截图喂给 VLM,让模型直接输出鼠标键盘动作。问题是:

  • 截图分辨率一高,token 爆炸;
  • UI 布局稍有变化,模型就懵;
  • 长链路任务里,历史上下文一长,模型就开始"幻觉操作"。

论文里有一句很关键的结论:“Current VLM agents are not robust to UI layout and noise.”

阶段二:2025 年中——Agentic framework 崛起

2025 年 7 月前后,榜单开始出现一批 Agentic framework

  • agent s2.5 w/ o3:56.0%(Max Steps 100)
  • GTA1 w/ o3:53.1%
  • CoACT-1:60.8%(Max Steps 150)
  • Jedi-7B w/ o3:51.0%

这一阶段的核心变化是:不再让一个模型端到端干完所有事,而是拆成"规划器 + 执行器 + 验证器"

典型架构:

Planner(GPT/o3/Claude)→ 拆解任务
    ↓
Grounder(专用 GUI 模型 / A11y tree)→ 定位控件
    ↓
Executor(鼠标键盘 API)→ 执行动作
    ↓
Verifier(截图/文件校验)→ 确认结果

同时,A11y tree(无障碍树) 开始被大量使用。相比纯截图,A11y tree 提供了结构化的控件信息,极大缓解了 GUI grounding 问题。榜单上标注 “Used additional a11y tree” 的条目,成绩普遍高于同模型纯截图方案。

阶段三:2025 年底–2026 年初——专用模型 + 多轮重试

这一阶段出现了几个关键趋势:

  1. 专用 GUI 模型崛起:Holo3-35B-A3B(H Company)以 80.4±2.2% 排在第 8,是排名最高的 Specialized model;UI-TARS-2、GUI-Owl-1.5、OpenCUA 等专用模型也在快速迭代。
  2. Multiple rollout(多轮重试):agent s3 w/ Opus 4.5 + GPT-5 bBoN (N=10) 用 10 次采样投票,把成绩推到 72.6%。
  3. Max Steps 成为关键变量:同一模型,Max Steps 从 15 → 50 → 100,成绩差距巨大。比如 claude-sonnet-4-5,Max Steps 15 时 42.9%,50 时 58.1%,100 时 62.9%。

这说明:Agent 的能力上限,不仅取决于模型本身,还取决于工程化执行框架

阶段四:2026 年中——90% 时代

2026 年 7 月 25 日,实在智能的 实在Agent90.2% 登顶。紧随其后:

排名模型/Agent类型成功率
1实在Agent(实在智能)Agentic framework90.2%
2claude-fable-5[1m]General model86.0%
3Pointer Agent w/ Opus 4.7Agentic framework83.6%
4claude-opus-5[1m]General model83.4%
5Coasty CUA v1General model82.8%
6Pointer Agent w/ Sonnet 4.6Agentic framework81.5%
7Muse Spark 1.1General model80.7%
8Holo3-35B-A3BSpecialized model80.4±2.2%
9OpenAPA w/ gemini-3.1-proAgentic framework78.3%
10VLAA-GUI w/ Opus 4.5Agentic framework76.3%

前 10 名中,Agentic framework 占 5 席,General model 占 4 席,Specialized model 占 1 席。 但第一名是 Agentic framework,且领先第二名 4.2 个百分点。


四、实在Agent 的 90.2%:拆开看意味着什么

实在Agent 的成绩单:

总分:325.59 / 361 = 90.2%
Max Steps:100
Runs:1
Type:Agentic framework

分应用看:

应用成功/总数成功率
chrome35.93/4678.1%
gimp24.0/2692.3%
libreoffice_calc46.0/4797.9%
libreoffice_impress42.96/4791.4%
libreoffice_writer22.0/2395.7%
multi_apps78.81/9384.7%
os24.0/24100%
thunderbird13.0/1586.7%
vlc16.89/1799.4%
vs_code22.0/2395.7%

几个关键观察:

  1. OS 层任务 100% 完成:说明实在Agent 在文件系统、系统设置、进程管理等底层操作上非常稳。
  2. LibreOffice 系列全部 90%+:Calc 97.9%,Writer 95.7%,Impress 91.4%。办公套件是 OSWorld 的重头戏,也是企业场景的核心。
  3. Chrome 是最大短板(78.1%):网页环境动态性强、DOM 变化多,即使是 90% 级别的 Agent 也会在这里丢分。
  4. multi_apps 84.7%:跨应用任务仍然是最难的类别之一,但已经比 2025 年的 50%–60% 好太多。

90.2% 意味着什么? 人类在 OSWorld 上的 baseline 是 72.36%。实在Agent 不仅超过了人类 baseline,而且超出了近 18 个百分点。当然,人类 baseline 是 2024 年测的,且并非"熟练用户",但这仍然是一个标志性节点:在标准化、可执行评估的计算机任务上,Agent 已经达到甚至超过普通人类水平。


五、技术路线正在发生什么变化?

把两年半的曲线拆开,可以看到四条清晰的技术路线变迁。

变化一:从"端到端 VLM"到"Agentic framework"

2024 年的主流思路是:一个 VLM 吃截图,输出动作。2026 年前 10 名里,Agentic framework 占了一半,且第一名就是 Agentic framework。

原因很简单:Computer Use 是长链路、多步骤、带状态的任务,端到端模型很难在 100 步内保持一致性。拆成"规划–定位–执行–验证"后,每一步都可以用最适合的模型/工具,容错率大幅提升。

变化二:从"纯截图"到"多源输入融合"

OSWorld 论文里有一条分析结论:“Longer text-based trajectory history context improves performance, unlike screenshot-only history.”

翻译一下:光喂截图不够,还得喂文本历史

2026 年的头部 Agent 普遍采用多源输入:

  • 截图(视觉)
  • A11y tree(结构)
  • 文本历史(上下文)
  • 文件系统状态(环境)
  • 甚至代码执行结果(验证)

实在Agent 作为 Agentic framework,大概率也是多源融合路线。纯截图方案在 Chrome 这种动态环境里很容易崩,而多源融合能显著提升鲁棒性。

变化三:从"通用模型"到"通用模型 + 专用模型"混合

前 10 名里,Holo3-35B-A3B 是唯一的 Specialized model,但它以 80.4% 排在第 8,超过了 Claude Sonnet 4.6(72.1%)和 Kimi K2.6(73.1%)。

这说明:专用 GUI 模型在特定任务上已经能和通用大模型掰手腕。未来的主流架构很可能是:

通用模型(Planner) + 专用模型(Grounder) + 工程化执行框架

实在Agent 作为 Agentic framework,其背后很可能也是这种混合架构。

变化四:从"单次执行"到"多轮重试 + 验证"

agent s3 w/ Opus 4.5 + GPT-5 bBoN (N=10) 用 10 次采样投票,把成绩推到 72.6%。虽然实在Agent 是 Runs: 1,但头部 Agent 普遍在工程化层面加入了:

  • 多轮重试(retry)
  • 自我验证(self-verification)
  • 中间状态检查(checkpoint)
  • 失败回滚(rollback)

这些工程化手段,不改变模型本身,但能显著提升最终成功率


六、实在Agent 的工程含义:90% 之后,拼什么?

当第一名达到 90.2%,第二名 86.0%,第三名 83.6% 时,竞争焦点已经不再是"能不能做",而是"做得稳不稳、快不快、便宜不便宜"。

几个值得关注的方向:

  1. Chrome 场景仍是硬骨头:实在Agent 在 Chrome 上 78.1%,是唯一低于 80% 的应用类别。网页动态性、DOM 变化、登录态、反爬,都是现实难题。
  2. multi_apps 是下一个战场:84.7% 的跨应用成功率已经很高,但企业场景里跨应用工作流才是核心。谁能把 multi_apps 做到 90%+,谁就能真正落地。
  3. Max Steps 的效率问题:100 步是当前主流上限,但步数越多,token 成本越高。下一步的竞争可能是"用更少步数达到同样成功率"。
  4. Runs 的稳定性:实在Agent 是 Runs: 1,Holo3-35B-A3B 是 Runs: 2(80.4±2.2%)。单次 90.2% 和多次平均 90.2% 是两回事。稳定性将成为下一阶段的关键指标。

七、写在最后

OSWorld 榜单从 12.24% 到 90.2%,用了两年半。

这条曲线背后,不是某一个模型的胜利,而是Agent 技术路线从"端到端 VLM"转向"Agentic framework + 多源输入 + 专用模型 + 工程化执行"的集体跃迁

实在Agent 的 90.2% 是一个标志性节点:它证明在标准化、可执行评估的计算机任务上,Agent 已经可以达到甚至超过普通人类水平。

但 90% 之后,真正的挑战才刚刚开始:

  • Chrome 动态环境
  • 跨应用长链路
  • 单次执行的稳定性
  • 成本与效率的平衡

下一个两年半,值得期待。


参考资料

  1. OSWorld 官方榜单:https://os-world.github.io/
  2. Xie et al., OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments, arXiv:2404.07972
  3. OSWorld-Verified 更新说明(2025-07-28)
  4. 实在智能官方技术资料

免责声明:本文数据均来自 OSWorld 官方公开榜单,截至 2026 年 9 月 10 日。榜单持续更新中,请以官方最新数据为准。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值