AI Agent分数爆表?缩放一下浏览器试试

AI Agent分数爆表?缩放一下浏览器试试

六月 22, 2026 ai agents computer use models gui grounding machine learning benchmarks web automation vibe hosting ai development

浏览器缩放到70%会怎样?一个让AI Agent现原形的简单测试

有个实验,你现在就能做。

随便选一个号称最先进的GUI Agent,让它操作一个你熟悉的网站,然后把浏览器缩放比例调到70%。页面布局完全没变,按钮还在老位置,文字只是变小了。

模型八成会出错。

这不是什么刁钻的边界情况。这恰恰暴露了AI基准测试和真实生产环境之间那道看不见的鸿沟。如果你正在做AI浏览器助手、自动化爬虫,或者下一代的电脑操控Agent,理解这个差距就特别重要。

基准测试的假象

先说清楚那些数字到底意味着什么。现在主流的GUI模型在ScreenSpot-v2这类基准测试上动不动就90%+的准确率。开发者在选型的时候,看到这个数字很容易就觉得"这个问题已经解决了,视觉感知不再是瓶颈"。

问题在于,这些数字背后藏着什么。

ScreenSpot-v2跟大多数GUI基准测试一样,测试的都是固定截图。同一张页面,同一种渲染方式,每次都一样。但真实网站可不是这么玩的——用户会缩放,团队会改版,深色模式会改变颜色关系,不同浏览器对同样的CSS渲染结果也不完全一样。

模型并没有学会应对变化,它只是学会了认出特定的截图。那些高分本质上测的是记忆能力,而不是真正的视觉理解能力。

GUI-Perturbed(来自Fig公司)的研究者就想量化一件事:基准测试的高分在面对日常变化时,到底还能剩下多少。他们的方法是沿着可控的维度系统性地干扰视觉场景,然后测量准确率下降了多少。结果让所有做生产级电脑操控系统的人都该睡不着觉。

三重对齐问题

在看具体结果之前,先说说GUI grounding到底需要什么。当模型看到一张截图,收到"点击提交按钮"这样的指令时,三种不同的对齐需要同时发生:

视觉对齐——听起来简单,就是把像素模式和界面元素匹配起来。按钮有特定的形状、颜色、大小,模型得能认出来。

功能对齐——理解这个元素实际上是干什么的。输入框和展示用的文字标签看起来不同,可点击的按钮和静态图标也不是一回事,虽然它们可能共享某些视觉特征。

几何对齐——处理空间关系。"搜索栏上方的按钮"或者"标签右侧的表单字段",需要理解各个元素之间的相对位置,而不只是它们长什么样。

关键问题来了:大多数基准测试把三种对齐混在一起打分。当模型得分85%的时候,你根本不知道它是三项全对,还是视觉满分但几何完全瞎蒙。失败模式不同,对应的解决方案也不同。

模型到底哪里不行

GUI-Perturbed的测试方法对每个对齐轴都做了独立压力测试。结果揭示了一个脆弱性的层级:

空间指令是最致命的短板

这是最关键的问题。当指令从"点击提交按钮"变成"点击联系表单上方的按钮",准确率直接掉了27到56个百分点——具体看用哪个模型。掉27个点已经够呛了,掉56个点的话,任何生产环境都不用玩了。

模型能直接命名某个按钮的时候没问题,让它推理那个按钮在空间中的位置,表现就崩了。

这对实际应用影响很大,因为自然语言指令里经常包含空间描述。"往下滚然后点击表单"或者"选择标题下面的选项",都是人类描述任务时很自然的方式。但这些指令在现有模型上几乎立刻就会失效。

视觉干扰比想象中影响更大

开头那个缩放实验不是个例。把浏览器缩放到70%,三个测试模型的准确率都会下降2到6个点。不算灾难性,但想想这意味着什么:模型学会的是在特定尺度下识别元素,尺度一变,它校准好的那套就失灵了。

现实中的用户会缩放,不同显示器的默认DPI设置不一样,同一个网页应用在不同设备上渲染出来的物理尺寸也不同。这些都是日常操作,不是什么对抗性环境。

更让人担忧的是这揭示了模型到底是怎么学习的。它们没有像人类那样建立尺度不变的表现形式,它们只是在记忆训练时看到的那种分辨率下的外观。

思维链推理有取舍

在行动前加一步推理,对复杂的关联任务有帮助,但对简单的直接任务反而拖后腿。模型得学会判断什么时候该想、什么时候该直接做。

这就带来了实际的部署难题。你不能一股脑在所有地方都开思维链,你需要要么一个路由器来判断什么时候该想,要么一个在两种模式上都真正擅长的模型。现有的模型看起来会在简单任务上想太多。

后训练到底能带来什么

最让人清醒的发现是:更多的GUI专项后训练并不能解决这些问题。

三个测试模型用的是同一个基础检查点,但经过不同程度GUI微调。额外的训练提高了固定场景基准测试的分数,但没有提升对视觉干扰、空间推理或缩放敏感度的鲁棒性。

这意味着后训练带来的基准测试分数提升可能部分是虚假的——模型只是在测试分布上表现更好,而不是在底层任务上真的变强了。它们更精准地拟合了基准测试,却没有建立可泛化的能力。

对于正在评估模型或在其上构建应用的团队来说,这是一个关键的区别。"ScreenSpot-v2上达到92%"告诉你的是模型能在截图里认出GUI元素。它没告诉你的是,它能不能处理真实网页浏览中的各种变化。

给开发者的建议

如果你在基于电脑操控Agent构建应用,从这个研究可以得出几点:

你的生产环境会比评测环境更难。 如果你只在固定的页面上测试,那测的根本不是系统在生产环境的表现。建议把干扰测试纳入你的评测流程——在不同缩放级别、CSS变体、改版后的页面上跑你的任务试试。

空间指令处理需要特别关注。 如果你的应用用的是包含空间描述的自然语言指令,现有的通用模型会力不从心。可以考虑限制指令格式、加一个显式的坐标预测备选方案,或者用专门的模型处理空间推理这类子任务。

监控改版带来的断裂。 目标网站改版之后,你的Agent准确率可能会突然下降——不是因为模型变差了,而是因为它遇到了之前没见过的一种视觉配置。建议缓存元素定位策略,同时监控漂移情况。

未来会怎样

这个研究不是说电脑操控Agent没用。它说的是,这个领域需要更好的方式来衡量真正重要的东西:鲁棒性,而不是基准测试成绩。

好消息是问题现在已经是可见的、可测量的。GUI-Perturbed的测试方法提供了一种沿特定轴对模型进行压力测试的方式。如果你正在构建或采购这类系统,要求看抗干扰评测结果,而不只是静态基准分数。

三重对齐问题——视觉、功能和几何理解的协同工作——是真实存在的,也是可以解决的。解决了这个问题,才能解锁下一代真正可靠的AI Agent,让它们在用户所处的那个混乱、多变的世界里正常工作。

现在,先把那些90%+的基准分数当作起点,而不是终点。当用户的AI助手能在缩放到70%的浏览器里正常工作的时候,他们会感谢你的。

Read in other languages:

RU BG EL CS UZ TR SV FI RO PT PL NB NL HU IT FR ES DE DA EN