Echo's blog
Echo's blog
· 1 min read · 资讯

DeepSeek自己造芯片了:推理专用,瞄准后训练时代的算力缺口

DeepSeek 的 V4 模型马上就要正式发布了,但比模型本身更值得关注的,是它正在做的一件底层的事。

据三位知情人士透露,这家中国 AI 创业公司正在开发自己的 AI 芯片。这颗芯片不是为训练大模型准备的,而是专门用于推理,也就是模型训练好之后真正对外提供服务的那部分算力。项目大约一年前启动,招聘也始终保持低调。

从堆 GPU 到造芯片,中间只隔了一次库存焦虑#

插图

DeepSeek 此前并非没有家底。制裁窗口期里,它囤积了数万台 Hopper 架构的 NVIDIA GPU。靠着这批芯片,它训练出了 V3、R1,也把模型成本打到让整个行业重新算账。

但这些库存是有限的,而且正在消耗。当一家公司的核心资产是算力时,算力供应链的任何风吹草动都会变成战略问题。自己设计芯片,是把控制权往回拉一步。

这不是什么新鲜剧本。云厂商和 AI 实验室绕过通用 GPU、走向定制芯片的路径,谷歌 TPU、亚马逊 Trainium、微软 Maia 都走过。DeepSeek 的差别在于,它不是一个云服务平台,而是一个模型公司,它造芯的理由更集中:让自家模型跑得更快、更便宜、更少受制于人。

推理芯片和训练芯片,其实是两种产品#

插图

很多人会把 AI 芯片混为一谈,但训练芯片和推理芯片的设计目标并不相同。

训练追求极高的浮点算力和显存带宽,需要把海量参数同时加载、反复更新,所以 NVIDIA 的 H100、B100 会把 Tensor Core 和 HBM 堆到极致。推理则更看重能效比、延迟和并发成本,模型权重固定后,真正要优化的是每块钱、每瓦电能产出多少 token。

DeepSeek 选择从推理切入,也符合当前行业的趋势。模型训练成本虽然惊人,但推理是增长更快的部分。每一次 API 调用、每一次搜索增强、每一次智能体行动,背后都是推理。把这部分算力掌握在自己手里,意味着把模型商业化最关键的成本结构掌握在手里。

消息人士说,这款芯片可能还要一段时间才能流片量产。但方向已经明确:DeepSeek 不想只做模型层面的效率优化,它想重新定义模型运行其上的硬件。

转用华为 Ascend,是为自研芯片铺路#

插图

其实 DeepSeek 已经在为”去 NVIDIA”做另一手准备。

今年 4 月,它发布了适配华为 Ascend 芯片的 V4 模型;华为也确认,Ascend 处理器参与了轻量版 V4-Flash 的训练。这意味着 DeepSeek 的团队已经在熟悉国产 AI 芯片的架构、编译栈和集群调度。

从 NVIDIA Hopper 到华为 Ascend,再到未来的自研芯片,这是一条递进路线。Ascend 让 DeepSeek 学会在非 NVIDIA 生态上跑模型,自研芯片则让它可以按自己的模型结构去裁剪硬件。前一步解决”能不能跑”,后一步解决”能不能为 DeepSeek 量身定制”。

真正的硬仗在模型之外#

插图

V4 正式版预计 7 月中旬发布,届时 DeepSeek 会再次证明自己能用更低的成本训练出竞争力极强的模型。但更长线的较量,发生在模型权重之外。

算力、芯片、供应链,这些才是真正决定一家 AI 公司能走多远的基础设施。DeepSeek 正在把战场从软件效率扩展到硬件自主权。如果它的推理芯片最终落地,价格战的底层逻辑都会被改写:不是因为别人的芯片更便宜,而是因为自己的芯片就是为这个模型而生。

当所有人都在讨论模型参数和训练成本时,DeepSeek 已经在悄悄布局下一个十年的入口。那枚推理芯片,可能就是它最重要的下一张牌。

来源:Reuters | Hacker News

Related Posts

Comments

Copied
Copied to clipboard