谷歌的Gemma 4 12B小模型大野心
这些年 AI 圈有个执念:模型越大越好。参数从几十亿吹到几千亿,训练算力从几千张卡堆到几万张卡。如果模型尺寸是唯一标准,那比赛早该结束了。
但谷歌最新发布的 Gemma 4 12B 走了一条完全不同的路。
12B 的小家伙
12B 参数,在今天这个动辄上千亿的 AI 世界里,只能算个”小家伙”。但它的配置单很有意思:多模态(能看图片也能理解文字)、无编码器(encoder-free)、统一架构。它不需要一个单独的视觉编码器来处理图片,而是直接把像素当成输入序列,和其他文本一样对待。
这是一种更简洁、更接近人类感知方式的设计。你看到一张图的时候,你不会先把它”翻译”一遍再理解,你就是直接看到了。
无编码器架构的取舍
这个设计选择有它的代价。传统的多模态模型通常会用一个专门的视觉编码器(比如 ViT)来把图片切成小块、转成向量,然后喂给语言模型。分开处理的好处是每个部分都可以专精,坏处是架构复杂、推理效率低、而且视觉编码器和语言模型之间的信息传递总会有损耗。
无编码器架构就是用原生的像素数据直接训练,模型自己去学会”看”。简化带来的代价是训练更难、数据需求更大,但一旦训练好,推理速度和简洁性就远超传统方案。
开源策略的阳谋
更值得注意的是,Google 把它做成了开源模型。这意味着你可以在自己的电脑上跑它,不用调 API 不用付 token 费。Gemma 4 12B 能在单张消费级 GPU 上运行,32GB 显存够用。这对开发者来说是非常务实的门槛。在过去,多模态意味着至少需要几张 A100 才能启动,现在你桌上的 RTX 4090 就够了。
从商业角度看,这种做法很聪明。OpenAI 和 Anthropic 的模型越做越大、越做越贵,谷歌却在开源市场里投下一颗小型但能打的棋子。你作为开发者,当你可以在本地跑一个开源的、多模态的、不断更新的模型时,为什么还要每个月付几十美元给 API 服务呢?
小模型的大未来
当然,12B 参数在面对复杂推理任务时肯定不能和 GPT-4 级别的模型比。但对于大多数实际应用场景——图像描述、文档理解、简单推理——它已经绰绰有余。
AI 的下一个战场,可能不是在”谁造了最大的模型”,而是在”谁能造出最好用的小模型”。
来源:Google AI Blog | Hacker News
