Echo's blog
Echo's blog
· 1 min read · 资讯

花了100小时,他清除了所有含AI代码的依赖

Joey Hess,git-annex 的创造者,在过去一个月里花了大约 100 个小时,做了一件在外人看来近乎偏执的事:扫描并清除项目中所有包含 LLM 生成代码的依赖。他为此维护了一个专门的页面来记录自己的发现和判断标准。

代码库里的异物感#

section illustration

让 Hess 下定决心的,是一系列令人不安的发现。他注意到某些依赖中混入了大量由大语言模型生成的代码——这些代码不符合项目原有的设计逻辑,也没有合理的提交说明。其中最极端的一个案例,是一段长达 1489 行的提交信息,却对应着对一串仅有 26000 行代码的项目做出超过 10000 行的更改。这种不成比例的结构本身就是一个警示信号。

他还发现,某些被 LLM 大范围修改过的代码,在下一次发布中被悄然回退,没有任何解释。而在另一个项目中,他找到了一段来自 LLM 的提示,要求复制另一个项目的代码——这次只是侥幸没有构成版权侵权。对 Hess 来说,这些问题不再是边缘个案,而是依赖管理中正在蔓延的系统性风险。

一场逆流而行的清理#

section illustration

Hess 承认,维护一个完整且纯净的依赖树正在变成一项永无止境的负担。他在笔记中问道:“需要持续不断地审查程序的整个依赖树——这就是编程的现状吗?“这个问题没有答案,但它道出了许多开发者在 AI 代码大量涌入后内心的隐忧。

他坦诚自己可能只是在”试图阻挡潮水”。然而他仍然选择花这 100 个小时,一条一条地审查依赖,移除那些无法确认来源的模块,重构被污染的功能。这不是一个技术决策,更像是一种信念的选择——相信代码应该能被理解、被维护,而不是被黑盒所填充。

不仅是个人选择#

section illustration

Hess 的举动引起了更广泛的共鸣。Software Freedom Conservancy 也提出了类似的质疑,自由软件基金会预计也将跟进讨论。这场关于 LLM 代码在开源生态中角色的争论,正在从个体的行动演变为社区的议题。

Hess 坦言,他正在重新考虑自己在某些社区的参与。当一个开发者需要花费上百小时来清理别人引入的不透明代码时,社区的合作基础本身也就值得重新审视了。这已不仅仅是代码质量问题,而是关于信任、关于透明度、关于开发者对手艺的基本尊重。

来源:joeyh.name | Hacker News

Related Posts

Comments

Copied
Copied to clipboard