AI写代码真的更快了?测评数据可能骗了你
AI 模型的分数越来越高,但你的工作效率真的变了吗?
每隔几周,就会有一个新的 AI 模型刷屏。SWE-bench 涨了 50%,HumanEval 通过率飙到 95%。Twitter 上一片沸腾,好像软件工程的未来又双叒叕来了。
但我在一线干久了,心里清楚一件事:benchmark 和真正的生产力,完全是两码事。
"变强了"和"对我有用",不是一回事
我不是要泼冷水。这些模型确实厉害,我现在天天用,改 bug、写文档、做原型都离不了它们。
但"分数更高"和"彻底改变工作方式",中间隔着一道鸿沟。
这道鸿沟,我跨越过一次。某次模型更新之后,我突然不再把 AI 当成一个高级的自动补全工具,而是开始把它当成一个合作者。我交给它一个明确范围的任务,它去研究代码库,问几个澄清问题,然后把东西交付给我。交互模式从"问-答"变成了"问-协作-迭代"。
有意思的是,接下来几个月我回头看自己的产出,生产力曲线的拐点恰好就是那次交互模式的转变——而不是之后那些月月刷新的 benchmark 数据。
为什么 benchmark 测不出你真正在干什么
现有的编程 benchmark,基本都在测:孤立的、定义清晰的、有标准答案的任务。修这个 bug、写这个函数、完成这个 PR。
但你真实的工程工作完全不是这样。是模糊的需求、跨团队的依赖、行为没人写文档的老代码、是那种需要理解业务背景才能做的决策——而这些背景,模型根本不可能有。
好消息是,有的研究团队开始注意到这个差距了。新的 benchmark 会故意藏掉一些信息,逼模型主动提问,看它能不能意识到自己缺了什么,而不是在那儿自信满满地瞎编答案。这是往对的方向走了一步,但整体来说还早。
选工具,看的不是分数
如果你在给团队评估 AI 工具,问题不应该是"这个模型在 X benchmark 上拿了多少分",而是"这个工具真的改变了团队的工作方式吗?"
我们 NameOcean 一直在思考这个问题,提出了一个概念叫 Vibe Hosting——怎么做出真正放大开发者能力的工具,而不是单纯秀肌肉。
这个区别很重要。一个在生成代码片段这件事上稍微强一点的工具,算不上革命。但一个能改变你迭代速度、debug 工作流、探索架构方案能力的工具?那完全不是一个级别的东西。
关于范式转移
我不是说要忽视进步。模型确实在变强,能解决的问题更难了,能处理的上下文更多了,低级错误也少了。这些都是实打实的提升。
但如果你在等下一次 benchmark 的跃升来带来生产力的质变,你可能看错了方向。上一次让我感觉工作真的不一样了,是交互模式变了,而不是分数往上涨。
下一次真正的拐点,可能要等到协作方式本身再次升级——更强的上下文窗口、更长的推理链条、更聪明的 agent 调度。在那之前,边际提升会一直有,但变革性的进步,也许已经暂时到头了。
当然,也可能只是我的参照系在重新校准。不管怎样,我们得诚实地面对自己在测什么。
最后说几句
下次再看到 benchmark 的新闻,先问自己:这是代表一种新的工作方式,还是只是把本来就能做到的事做得稍微好一点?
这个区别,也许比那个数字本身重要得多。
你的基础设施值得配上真正贴合你工作方式的工具。不是 benchmark 告诉你应该用的那种。