小米MiMo把1万亿参数模型跑到了每秒1000字
每秒一千个字是什么概念
你正在读的这句话,大概需要两秒钟看完。而一个 1 万亿参数的大模型,现在可以在这一瞬间写出五百句同样的内容。每秒一千个 token,用人类能理解的方式来类比,就是它在一秒内完成的东西,你一个人读都要读一整天。
这不是什么科幻场景。这是小米 MiMo 昨天发布的 V2.5 Pro UltraSpeed 版本交出的实打实成绩。
小米和一家叫 TileRT 的公司在自家博客上公布了这一成果:在商品化 GPU 上,把 1T 参数模型的推理速度推到了每秒 1000 个 token 以上。不是靠定制的神级芯片,不是靠昂贵的专门硬件,而是在你也能买到的普通 GPU 上做到的。
当推理速度变成一种新的智能
在 AI 领域,有一个被很多人忽略的事实:模型的 “聪明程度” 不只看参数多少,还看它说话多快。
传统上,你遇到一个问题,向模型发出一段指令,然后等它输出答案。如果模型太慢,你只能祈祷一次猜对。但如果它快到了一定程度,情况就完全变了——你可以同时让它跑好几条思考路径,把每一条的结果互相比对、自动纠错,然后选出最靠谱的那一个。用速度换深度,用算力换推理质量。
1000 tps 这个阈值,刚好跨过了这条线。它意味着一个万亿参数的旗舰模型,终于可以进入”实时决策”的场景了:高频交易的信号生成、反欺诈的毫秒级拦截、智能竞价的实时出价。在每一秒都在烧钱或者每一秒都有人在被欺诈的场景里,速度就是生命。
还有一个也许更直接的场景:手术辅助影像分析。当外科医生在一张 CT 图像上寻找病灶的时候,多等一秒钟,就是真实的风险。如果 AI 能在医生切下去之前完成分析、给出标注,那这 1000 tps 就不再只是技术指标了。
不走寻常路的优化路径
目前行业里要做到这种级别的推理速度,主流方案是靠专用硬件。Cerebras 用晶圆级集成,Groq 用纯片上 SRAM 自研芯片,都是”硬件换速度”的路子。小米和 TileRT 选择的路线不一样——他们通过模型-系统协同优化,在普通 GPU 上跑出了更夸张的结果。
模型侧的核心是两层优化:第一层是 FP4 量化——把模型参数的精度从通常的 16 位降到 4 位,模型尺寸直接缩到原来的四分之一,内存带宽的压力骤减。第二层是 DFlash 投机解码——一种基于块级掩码并行预测的技术,让模型每次验证的推测更长,不需要一卡一顿地逐个生成。
系统侧则由 TileRT 负责,针对这些新型的量化算法和推测解码流水线,做了一套编译引擎和计算内核的深度定制。
免费试用两周,但限名额
UltraSpeed 版从今天开始开放申请,试用窗口只到 6 月 23 日。价格是普通版的三倍,但速度是十倍。小米自己也说了”3 倍价格,10 倍产出”。
不过目前资源有限,需要通过申请才能使用,而且每个账户每天只能排队 10 次,每次最长 30 分钟。这种”想用但用不到”的稀缺感,倒是跟整个 AI 行业目前的算力焦虑如出一辙——大家不缺模型,缺的是能跑得动模型的硬件。
而小米这次证明了一件事:有时候你不缺硬件,你只是缺更好的软件。
来源:Hacker News | MiMo Blog
