Echo's blog
Echo's blog
· 1 min read · 资讯

LLM 已经变得很复杂了

从干净的 Transformer 到意大利面#

simple_to_complex

回到 2022 到 2023 年,LLM 的世界还相当单纯。你翻开任何一篇论文,看到的基本都是重复堆叠的 Transformer 模块,干净的层叠结构,清清楚楚的输入输出。那时你只需要理解多头注意力、前馈网络、层归一化,就能大致读懂一个模型的架构。整个技术栈像是一块清晰的乐高拼图,块与块之间边界分明。

到了 2026 年,事情已经完全不同了。注意力机制本身就已经长成了一棵枝繁叶茂的演化树:分组查询注意力、压缩注意力、稀疏注意力、线性注意力、滑动窗口注意力……每种都有自己的适用场景和取舍。前馈层也不再是单纯的矩阵乘法,混合专家架构把稀疏路由引入了每一层,而这仅仅是开始。如今路由机制已经蔓延到注意力模块甚至残差流当中,一切都在被动态编排。视觉和音频编码器也早已从当年的”外挂配件”变成了模型内部的一等公民,与文本信息交织在一起。而当你试图在推理时将模型分布到多张 GPU 上,通信算子又成了新的边界约束。曾经那个干净的 Transformer,如今成了一盘精致的意大利面。

推荐系统的前车之鉴#

recsys_parallel

如果你觉得这种复杂化的轨迹似曾相识,那说明你的感觉没错。推荐系统在过去十年里走过了几乎一模一样的道路:起初是简单的矩阵分解,然后是深度特征交叉,接着是海量特征工程、多目标优化、实时训练管线、模型压缩、在线学习——每一步都在引入新的复杂度,而每一层复杂度都曾被认为是”必要的优化”。

现在 LLM 正在重演这段历史。性能优化的紧迫性和维持系统可用性的刚性需求之间的缝隙已经变得极其狭窄。你没办法再靠”手动融合”几个算子就指望获得可观的效率提升——这种粗放式的优化策略在今天需要投入的时间和精力,已经远超大多数团队的承受范围。PyTorch 社区推出的 FlexAttention 正是这种压力的直接产物:它将一整类注意力操作抽象为可组合的原型,通过 Triton 模板自动生成内核,并且在设计上就保证了前端的可验证性。这不是锦上添花,而是生存必需品。

无法跳过的复杂度税#

complexity_tax

Karpathy 加入 Anthropic 的一个重要动机是开发自动化研究循环——这本身就是一种对当下复杂度的回应:当模型架构的细节已经多到超出单个研究者的脑容量时,你需要系统来辅助思考和探索。今天的 LLM 开发者面对的不再是”理解一个模型”这个单一任务,而是要在注意力变体、路由策略、多模态融合、分布式通信、计算效率、训练稳定性这些相互纠缠的维度之间做出权衡。

能够把架构剪裁到本质,比搭一个漂亮的 agent 框架更重要。这种能力不是靠直觉就能获得的,它需要你在所有那些”意大利面”般的细节中保持对核心问题的判断力。技术演进的速度奖励那些能驾驭复杂的人,同时也惩罚那些试图绕过复杂的人。复杂度不是 bug,它是这一代技术发展中我们不得不支付的账单。

来源:Hacker News

Related Posts

Comments

Copied
Copied to clipboard