数据来源:OSWorld 官方榜单(截至 2026 年 9 月 10 日)
关键词:OSWorld、实在Agent、实在智能、Agentic Framework、Computer Use Agent
一、一条被忽略的曲线
如果把 OSWorld 榜单从 2024 年初拉到 2026 年 9 月,会看到一条几乎不像真的曲线:
- 2024 年 4 月:OSWorld 论文发布,人类成功率 72.36%,最好的模型只有 12.24%。论文作者的结论是:当前 VLM Agent 在 GUI grounding 和操作知识上存在"显著缺陷"。
- 2025 年中:Agentic framework 开始发力,agent s2.5、GTA1、CoACT-1 等把成绩推到 50%–60% 区间。
- 2026 年 7 月 25 日:实在智能的 实在Agent 以 90.2%(325.59/361) 登顶榜单,成为第一个突破 90% 的 Agentic framework。
- 2026 年 8 月:Anthropic 的 claude-fable-5[1m] 以 86.0% 紧随其后,Pointer Agent w/ Opus 4.7 以 83.6% 位列第三。
两年半时间,从 12.24% 到 90.2%,提升了 7 倍以上。这不是某一家公司的胜利,而是一条技术路线从"端到端 VLM"转向"Agentic framework + 专用模型 + 工程化执行"的集体跃迁。
本文试图回答三个问题:
- 这两年半里,榜单上到底发生了什么?
- 实在Agent 的 90.2% 意味着什么?
- Agent 技术路线正在往哪个方向走?

二、先把 OSWorld 说清楚:它为什么难
OSWorld 由香港大学、Salesforce Research、CMU、University of Waterloo 联合提出,是第一个面向多模态 Agent 的可扩展真实计算机环境,支持 Ubuntu、Windows、macOS 三大操作系统。
它的核心特点:
| 维度 | OSWorld |
|---|---|
| 任务数 | 369(8 个 Google Drive 任务可排除,实际 361) |
| 执行环境 | 真实计算机环境(非模拟) |
| 多模态支持 | ✅ |
| 跨应用任务 | ✅ |
| 中间初始状态 | ✅ |
| 基于执行的评估函数 | 134 个 |
与 WebArena、Mind2Web、GAIA 等 benchmark 不同,OSWorld 的任务是跨应用、开放式、带真实文件 I/O 的。比如:
- 在 Chrome 里查资料,把结果整理进 LibreOffice Calc,再通过 Thunderbird 发出去;
- 在 GIMP 里处理图片,保存到指定目录,再用 VLC 播放验证;
- 在 VS Code 里修改配置,然后到 OS 层面验证文件权限。
这正是"Computer Use"最真实的形态:不是单点问答,而是长链路、多应用、带状态的操作流。
也正因如此,2024 年论文里的 12.24% 才显得刺眼——人类能完成 72.36%,最好的模型连人类的六分之一都不到。
三、两年半榜单演进:四个阶段
阶段一:2024 年——"端到端 VLM"的至暗时刻
2024 年 OSWorld 论文发布时,基线模型包括 GPT-4V、Gemini、Claude 等。结果:
- 最好模型:12.24%
- 人类:72.36%
- 主要失败原因:GUI grounding(找不到控件)+ 操作知识缺失(不知道下一步该干嘛)
这一阶段的典型思路是:把截图喂给 VLM,让模型直接输出鼠标键盘动作。问题是:
- 截图分辨率一高,token 爆炸;
- UI 布局稍有变化,模型就懵;
- 长链路任务里,历史上下文一长,模型就开始"幻觉操作"。
论文里有一句很关键的结论:“Current VLM agents are not robust to UI layout and noise.”
阶段二:2025 年中——Agentic framework 崛起
2025 年 7 月前后,榜单开始出现一批 Agentic framework:
- agent s2.5 w/ o3:56.0%(Max Steps 100)
- GTA1 w/ o3:53.1%
- CoACT-1:60.8%(Max Steps 150)
- Jedi-7B w/ o3:51.0%
这一阶段的核心变化是:不再让一个模型端到端干完所有事,而是拆成"规划器 + 执行器 + 验证器"。
典型架构:
Planner(GPT/o3/Claude)→ 拆解任务
↓
Grounder(专用 GUI 模型 / A11y tree)→ 定位控件
↓
Executor(鼠标键盘 API)→ 执行动作
↓
Verifier(截图/文件校验)→ 确认结果
同时,A11y tree(无障碍树) 开始被大量使用。相比纯截图,A11y tree 提供了结构化的控件信息,极大缓解了 GUI grounding 问题。榜单上标注 “Used additional a11y tree” 的条目,成绩普遍高于同模型纯截图方案。
阶段三:2025 年底–2026 年初——专用模型 + 多轮重试
这一阶段出现了几个关键趋势:
- 专用 GUI 模型崛起:Holo3-35B-A3B(H Company)以 80.4±2.2% 排在第 8,是排名最高的 Specialized model;UI-TARS-2、GUI-Owl-1.5、OpenCUA 等专用模型也在快速迭代。
- Multiple rollout(多轮重试):agent s3 w/ Opus 4.5 + GPT-5 bBoN (N=10) 用 10 次采样投票,把成绩推到 72.6%。
- Max Steps 成为关键变量:同一模型,Max Steps 从 15 → 50 → 100,成绩差距巨大。比如 claude-sonnet-4-5,Max Steps 15 时 42.9%,50 时 58.1%,100 时 62.9%。
这说明:Agent 的能力上限,不仅取决于模型本身,还取决于工程化执行框架。
阶段四:2026 年中——90% 时代
2026 年 7 月 25 日,实在智能的 实在Agent 以 90.2% 登顶。紧随其后:
| 排名 | 模型/Agent | 类型 | 成功率 |
|---|---|---|---|
| 1 | 实在Agent(实在智能) | Agentic framework | 90.2% |
| 2 | claude-fable-5[1m] | General model | 86.0% |
| 3 | Pointer Agent w/ Opus 4.7 | Agentic framework | 83.6% |
| 4 | claude-opus-5[1m] | General model | 83.4% |
| 5 | Coasty CUA v1 | General model | 82.8% |
| 6 | Pointer Agent w/ Sonnet 4.6 | Agentic framework | 81.5% |
| 7 | Muse Spark 1.1 | General model | 80.7% |
| 8 | Holo3-35B-A3B | Specialized model | 80.4±2.2% |
| 9 | OpenAPA w/ gemini-3.1-pro | Agentic framework | 78.3% |
| 10 | VLAA-GUI w/ Opus 4.5 | Agentic framework | 76.3% |
前 10 名中,Agentic framework 占 5 席,General model 占 4 席,Specialized model 占 1 席。 但第一名是 Agentic framework,且领先第二名 4.2 个百分点。
四、实在Agent 的 90.2%:拆开看意味着什么
实在Agent 的成绩单:
总分:325.59 / 361 = 90.2%
Max Steps:100
Runs:1
Type:Agentic framework
分应用看:
| 应用 | 成功/总数 | 成功率 |
|---|---|---|
| chrome | 35.93/46 | 78.1% |
| gimp | 24.0/26 | 92.3% |
| libreoffice_calc | 46.0/47 | 97.9% |
| libreoffice_impress | 42.96/47 | 91.4% |
| libreoffice_writer | 22.0/23 | 95.7% |
| multi_apps | 78.81/93 | 84.7% |
| os | 24.0/24 | 100% |
| thunderbird | 13.0/15 | 86.7% |
| vlc | 16.89/17 | 99.4% |
| vs_code | 22.0/23 | 95.7% |
几个关键观察:
- OS 层任务 100% 完成:说明实在Agent 在文件系统、系统设置、进程管理等底层操作上非常稳。
- LibreOffice 系列全部 90%+:Calc 97.9%,Writer 95.7%,Impress 91.4%。办公套件是 OSWorld 的重头戏,也是企业场景的核心。
- Chrome 是最大短板(78.1%):网页环境动态性强、DOM 变化多,即使是 90% 级别的 Agent 也会在这里丢分。
- multi_apps 84.7%:跨应用任务仍然是最难的类别之一,但已经比 2025 年的 50%–60% 好太多。
90.2% 意味着什么? 人类在 OSWorld 上的 baseline 是 72.36%。实在Agent 不仅超过了人类 baseline,而且超出了近 18 个百分点。当然,人类 baseline 是 2024 年测的,且并非"熟练用户",但这仍然是一个标志性节点:在标准化、可执行评估的计算机任务上,Agent 已经达到甚至超过普通人类水平。
五、技术路线正在发生什么变化?
把两年半的曲线拆开,可以看到四条清晰的技术路线变迁。
变化一:从"端到端 VLM"到"Agentic framework"
2024 年的主流思路是:一个 VLM 吃截图,输出动作。2026 年前 10 名里,Agentic framework 占了一半,且第一名就是 Agentic framework。
原因很简单:Computer Use 是长链路、多步骤、带状态的任务,端到端模型很难在 100 步内保持一致性。拆成"规划–定位–执行–验证"后,每一步都可以用最适合的模型/工具,容错率大幅提升。
变化二:从"纯截图"到"多源输入融合"
OSWorld 论文里有一条分析结论:“Longer text-based trajectory history context improves performance, unlike screenshot-only history.”
翻译一下:光喂截图不够,还得喂文本历史。
2026 年的头部 Agent 普遍采用多源输入:
- 截图(视觉)
- A11y tree(结构)
- 文本历史(上下文)
- 文件系统状态(环境)
- 甚至代码执行结果(验证)
实在Agent 作为 Agentic framework,大概率也是多源融合路线。纯截图方案在 Chrome 这种动态环境里很容易崩,而多源融合能显著提升鲁棒性。
变化三:从"通用模型"到"通用模型 + 专用模型"混合
前 10 名里,Holo3-35B-A3B 是唯一的 Specialized model,但它以 80.4% 排在第 8,超过了 Claude Sonnet 4.6(72.1%)和 Kimi K2.6(73.1%)。
这说明:专用 GUI 模型在特定任务上已经能和通用大模型掰手腕。未来的主流架构很可能是:
通用模型(Planner) + 专用模型(Grounder) + 工程化执行框架
实在Agent 作为 Agentic framework,其背后很可能也是这种混合架构。
变化四:从"单次执行"到"多轮重试 + 验证"
agent s3 w/ Opus 4.5 + GPT-5 bBoN (N=10) 用 10 次采样投票,把成绩推到 72.6%。虽然实在Agent 是 Runs: 1,但头部 Agent 普遍在工程化层面加入了:
- 多轮重试(retry)
- 自我验证(self-verification)
- 中间状态检查(checkpoint)
- 失败回滚(rollback)
这些工程化手段,不改变模型本身,但能显著提升最终成功率。
六、实在Agent 的工程含义:90% 之后,拼什么?
当第一名达到 90.2%,第二名 86.0%,第三名 83.6% 时,竞争焦点已经不再是"能不能做",而是"做得稳不稳、快不快、便宜不便宜"。
几个值得关注的方向:
- Chrome 场景仍是硬骨头:实在Agent 在 Chrome 上 78.1%,是唯一低于 80% 的应用类别。网页动态性、DOM 变化、登录态、反爬,都是现实难题。
- multi_apps 是下一个战场:84.7% 的跨应用成功率已经很高,但企业场景里跨应用工作流才是核心。谁能把 multi_apps 做到 90%+,谁就能真正落地。
- Max Steps 的效率问题:100 步是当前主流上限,但步数越多,token 成本越高。下一步的竞争可能是"用更少步数达到同样成功率"。
- Runs 的稳定性:实在Agent 是 Runs: 1,Holo3-35B-A3B 是 Runs: 2(80.4±2.2%)。单次 90.2% 和多次平均 90.2% 是两回事。稳定性将成为下一阶段的关键指标。
七、写在最后
OSWorld 榜单从 12.24% 到 90.2%,用了两年半。
这条曲线背后,不是某一个模型的胜利,而是Agent 技术路线从"端到端 VLM"转向"Agentic framework + 多源输入 + 专用模型 + 工程化执行"的集体跃迁。
实在Agent 的 90.2% 是一个标志性节点:它证明在标准化、可执行评估的计算机任务上,Agent 已经可以达到甚至超过普通人类水平。
但 90% 之后,真正的挑战才刚刚开始:
- Chrome 动态环境
- 跨应用长链路
- 单次执行的稳定性
- 成本与效率的平衡
下一个两年半,值得期待。
参考资料
- OSWorld 官方榜单:https://os-world.github.io/
- Xie et al., OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments, arXiv:2404.07972
- OSWorld-Verified 更新说明(2025-07-28)
- 实在智能官方技术资料
免责声明:本文数据均来自 OSWorld 官方公开榜单,截至 2026 年 9 月 10 日。榜单持续更新中,请以官方最新数据为准。

615

被折叠的 条评论
为什么被折叠?



