Echo's blog
Echo's blog
· 1 min read · 资讯

大模型已经变成一团乱麻了

Ian Barber 写了一篇文章,标题就让人忍不住点进去看:LLM 现在已经变得复杂了。

不是那种”哇新模型好厉害”的复杂,而是”以前干干净净的 Transformer 结构,现在被各种补丁和插件搞得面目全非”的复杂。

从简洁到乱麻#

回想一下 2022 年。那会儿的 LLM 架构干净得像一张白纸:一堆重复的 Transformer 模块堆起来,一个接一个,每条数据的路径清晰可见。你打开任何一个大模型的架构图,都能用一句话说清楚它在干什么。

现在你再打开一张现代大模型的架构图——你可能连图都要看好几秒才能找到入口在哪。

Seb Raschka 维护了一个模型架构画廊,Barber 用它来对比了 Llama 3 和 Nemotron 3 Ultra 两代模型。对比结果是什么?2022 年的模型像宜家家具的说明书,2026 年的模型像一栋老房子的水电线路图。

每一步优化都留下了痕迹#

为什么会变成这样?答案很简单:每个性能问题都被解决了,但每个解决方案都带来了新的复杂度。

Attention 还是核心,但不再是那个单一的”注意力机制”了。现在模型里塞着各种变种:分组查询、压缩注意力、稀疏注意力、线性注意力、滑动窗口注意力——每一种都是为了解决某个特定场景下的效率问题引入的。

MoE(混合专家)在 FFN 层加了选择性路由。然后人们发现这个方法不错,开始把路由扩展到注意力层、残差流——路由的路由。视觉和音频编码器从外挂变成了深层集成。模型横跨多个 GPU 做推理,通信开销在模型中间划出了新的边界。

每项优化单独看都合情合理。但加在一起,就变成了技术债务的教科书案例。

效率从优化变成了必需品#

Barber 提到一个关键洞察:推荐系统经历过同样的演变。推荐系统在 10 年时间里基本保持两塔结构的简洁,然后复杂度缓慢爬坡——不是因为工程师喜欢复杂,而是因为每个新需求都要求新的效率优化,而每个优化都在结构上留下了疤痕。

LLM 正在走同样的路。区别在于,LLM 的复杂度爬坡速度快了 10 倍。

现在你没法随便换一个 Attention 变种了——因为原生实现经过深度优化和融合,换一个变种性能就暴跌。你想测试一个新想法,必须先做一个能用的、部分优化的版本。这个”先做出来看值不值得”的迭代成本,正在杀死很多研究探索。

出路在哪里#

Barber 提到了一个令人振奋的进展:PyTorch 的 FlexAttention。它把一整类注意力操作抽象出来,通过 Triton 模板自动生成优化内核。你可以在几乎不影响性能的前提下自由探索注意力变种。

这听起来像是一小步,但方向是对的——设计优先考虑组合性和可验证性,而不是在每个特性上都手工调优融合。

Andrej Karpathy 最近加入了 Anthropic,部分目标就是开发自动化的前沿研究循环。但正如他过去几年一直在展示的:把架构精简到本质,让它们可组合,这件事本身的重要性不亚于构建一个聪明的智能体系统。

在 AI 变得越来越复杂的今天,保持结构和思路的简洁,本身就是一个需要刻意练习的能力。

来源:Hacker News

Related Posts

Comments

Copied
Copied to clipboard