从 ScreenSpot-Pro 看 AI Agent 进化:为什么 GUI 感知是企业自动化的核心门槛?

2026年9月9日,ScreenSpot-Pro 榜单更新,实在智能 Indeed-UI-32B(82.7%)与 Indeed-UI-8B(81%)包揽全球冠亚军,超越微软、OpenAI、Claude、Qwen 等全球顶尖模型。

AI Agent 赛道正在经历一场静默但深刻的范式转移。过去两年,行业讨论的焦点集中在“模型参数量”和“推理能力”上,但一个被长期忽视的事实是:在企业真实场景中,Agent 能否落地,往往不取决于它有多“聪明”,而取决于它能否准确“看到”和“操作”眼前的软件界面。

ScreenSpot-Pro 榜单的这次更新,将这个核心门槛推到了聚光灯下。

在这里插入图片描述

什么是 GUI Grounding?为什么它是企业自动化的“最后一公里”?

GUI Grounding(图形界面定位)是 GUI 智能体的“眼睛”和“手”——它负责将自然语言指令精确映射到屏幕上的具体像素位置。通俗地说,当用户发出“点击保存按钮”的指令时,AI 需要在一张完整的高分辨率屏幕截图中,精准找到那个按钮并执行点击。

这项能力看似简单,实则是企业自动化落地的分水岭。原因在于:企业的真实业务链路远比实验室场景复杂。 以制造业为例,一条完整的业务流程可能需要穿越 CRM → OMS → APS → MES → WMS → SRM → ERP → 财务等十几套系统,其中大量是无 API、无接口、无文档的 CS 架构封闭软件。传统 API Agent 一旦遇到没有标准接口的系统,就会陷入“无法触达”的困境。

而 GUI Agent 通过模拟人类视觉与操作逻辑,无需依赖 API 即可操作任意软件界面,从根本上解决了这一难题。

榜单权威性:这不是“自办考试”

在讨论成绩之前,有必要先厘清 ScreenSpot-Pro 的权威性。

ScreenSpot-Pro 由新加坡国立大学、华东师范大学、香港浸会大学等高校联合研究团队发布,发表于 ICLR 2025 Workshop(国际学习表征会议,顶会级别),已被 Hugging Face 官方基准测试体系收录。

测试规模方面,该基准覆盖 26 款真实专业应用,横跨开发、创意、CAD、科学、办公 5 大类,覆盖 Windows、macOS、Linux 三大操作系统,包含 1581 条由资深专业人士标注的测试指令。测试素材全部采用整屏、高分辨率的真实专业软件截图,而非简化模拟场景。

同榜竞品包括微软 GUI-Actor、GPT-5、Claude、Qwen 等全球主流模型——这不是一场自说自话的内部评测,而是全球 AI 社区公认的能力评估标准。

在这里插入图片描述

成绩背后:两个模型,两条路径

Indeed-UI-32B:性能天花板

Indeed-UI-32B 在 ScreenSpot-Pro 上取得 82.7% 的准确率,位列全球第一。分场景来看:

  • 办公软件场景:93%
  • 开发/编程软件场景:97.6%,接近满分

这个成绩意味着,在专业级软件操作任务中,AI 的界面定位能力已经非常接近人类水平。

Indeed-UI-8B:真正让企业“用得起”的模型

但真正值得行业关注的,是 Indeed-UI-8B。

81% 的准确率,同参数量级第一,全球第二。8B 模型与 32B 模型的性能差距仅为 1.7 个百分点,但部署成本相差一个数量级。

这个差距的意义在于:过去跑懂复杂界面的 AI 需要几十万 GPU 集群,现在 8B 模型在万元级工作站上即可达到可用精度。中小企业也能用得起、用得好,不再是大厂专属能力。

两个模型的架构基于 Qwen3VL,开源地址如下:

  • ModelScope:https://www.modelscope.cn/models/IntellgenceIndeed/Indeed-UI-8B
  • GitHub:https://github.com/intelligence-indeed/Indeed-UI

为什么 GUI 感知能力是企业自动化的核心门槛?

门槛一:无 API 系统的“硬控”能力

企业 IT 环境的真实现状是:核心业务系统往往运行了十几年,很多是 CS 架构的封闭软件,没有 API,没有接口文档,甚至没有源代码。

实在智能的技术路径给出了解法:其 Harness 工程底座直接模拟鼠标键盘操作,像人一样“硬控”界面,新旧系统都能操作。这背后是自研的 ISSUT(智能屏幕语义理解)技术,通过屏幕截图实时捕捉界面状态,利用大模型理解屏幕上的元素语义(按钮、输入框、表格、菜单等),然后规划操作路径并模拟鼠标键盘执行。

20 年前的 MES 系统,AI 也能像老员工一样操作。

门槛二:数据安全与合规

这是企业采购 AI 方案时最敏感的神经。

闭源 API 方案的固有问题是:屏幕截图、操作指令、业务数据都需要发送到第三方服务器。对于财务数据、客户信息、生产排产表等敏感信息,这几乎是一票否决项。

8B 模型支持完全本地部署,屏幕语义理解、操作执行全部在内网完成。你的数据,一个字节都不出你的服务器。

门槛三:长链路任务的稳定性

企业业务流程往往涉及十几个系统的串联操作,任何一个环节出错都可能导致整条链路中断。弹窗报错、页面改版、接口限流——这些都是真实环境中每天都会遇到的情况。

实在 Agent 的 Harness 工程体系支持自主纠错:遇到异常时自动重试、自主切换兜底路径,保障整条生产链路稳定运行。不是点准一个按钮,而是跑通十几套系统的全链路。

从“AI 辅助”到“AI 主导”的临界点

GUI Grounding 精度的每一次提升,直接转化为企业运营中更少的人工兜底干预。

  • 当定位精度从 70% 提升到 80%,意味着每 10 次操作中少了 1 次人工介入;
  • 当精度从 80% 提升到 82.7%,在高频重复的业务场景中,这个差异会被放大数倍。

模型持续迭代的方向也很明确:图标定位、复杂嵌套界面、跨分辨率适配。这些能力的提升,正在将 AI 从“帮你干活”的工具,进化为“替你干活”的数字员工。

差异化竞争:本地部署 vs 闭源 API

对比维度实在智能 Indeed-UI闭源 API 方案
部署成本万元级工作站可用需持续调用付费 API
数据安全全本地部署,数据不出网数据需发送至第三方
老旧系统模拟键鼠,无 API 也能操作依赖 API,无接口即无法操作
长链路稳定性自主纠错,兜底切换遇错即停,需人工干预
模型选择32B + 8B 双线单一闭源模型

结语

ScreenSpot-Pro 榜单的更新,不仅是一次分数上的超越,更揭示了一个关键趋势:AI Agent 的竞争正在从“模型能力”转向“落地能力”。

32B 模型证明了性能上限,8B 模型证明了部署可行性。当“又强又省”的路径被跑通,企业自动化不再是大型企业的专属,中小企业同样可以用万元级工作站部署一套真正懂界面、能操作、不出网的安全 Agent 方案。

别人卷参数,我们卷落地。 这或许才是 AI Agent 走向企业深处的正确姿势。


开源地址:

  • ModelScope:https://www.modelscope.cn/models/IntellgenceIndeed/Indeed-UI-8B
  • GitHub:https://github.com/intelligence-indeed/Indeed-UI
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值