感觉快了20%,实测慢了19%:AI编程的错觉被证实了
一场精心设计的实验

AI 编程助手到底有没有让你更快?每个人都有自己的感受。但感受和数据之间,可能隔着一条巨大的鸿沟。
今年八月,Karthi 在 intrepidkarthi.com 上发表了一篇文章,标题直击要害:“The gauge broke”。文章引用 METR(Model Evaluation and Threat Research)的一项随机对照实验,结果令人意外。参与实验的是经验丰富的开源开发者,他们在自己熟悉的代码库中工作。开发者们感觉自己快了大约 20%,但实际测量结果却是——慢了 19%。
感觉和现实背道而驰,方向完全相反。
为什么”感觉”会骗人

核心问题出在一个关键判断上:AI 加速了打字,但打字从不是专家的瓶颈。
对于熟悉自己代码库的资深开发者来说,思考架构、理解逻辑、调试错误才是真正耗时的事情。AI 补全代码片段的速度确实快,但这份”快感”很容易被误当作整体效率的提升。
实验给出了一个精辟的总结:“Generation got cheap. Verification got expensive.” 生成变得廉价,验证变得昂贵。AI 帮你写出一段代码只需几秒,但你需要花更多时间去阅读、理解、修改、确认它是否正确。这股额外开销——提示、等待、审查——悄悄地把时间吃了回去。
数据不会骗人

这不是孤例。Faros AI 在超过 10,000 名开发者中收集的数据,也印证了同样的趋势。
对于经验丰富的开发者,AI 的加持并没有带来净效率提升。反而在那些需要从头搭建、不熟悉框架、或者在全新代码库中工作的场景下——也就是”绿野开发”(greenfield work)和初级开发者身上——AI 的正向效果才真正显现出来。
换句话说,AI 帮你写得越快,你需要检查的就越多。你省下的时间,又用在了验证上。这笔账算下来,可能不赚反亏。
从 2022 到现在的观察

Karthi 提到,他从 2022 年就开始注意到这个现象。只是直到这次 METR 的实验数据出来,才真正被量化证实。
这不是在否定 AI 编程工具的价值。它提醒我们:工具的进步和效率的提升是两回事。一个工具让你感觉更快,和你实际更快,中间差了一个严谨的测量。
AI 编程的错觉被证实了。那个显示”我变快了”的仪表盘,其实早就坏了。
来源:intrepidkarthi.com | Hacker News
