Om AI赵天成:五年坚守物理AI,反向押注「流式」未来
监控画面里有人违规停车、烟雾升起,一个从未见过监控场景的多模态模型,却压过了在监控数据上练了多年的小模型老将。2023 年的这次「无心插柳」,让赵天成确信:多模态训练能够给物理开放世界带来真正的泛化性。
彼时,整个行业正为大语言模型疯狂。三年后,当初那个多模态模型进化成了 VLX,全球首个面向物理 AI 的端侧流式多模态模型系列。
一个反共识的判断

2019 年,赵天成从 CMU 语言技术所博士毕业。他的导师 Maxine Eskenazi 是对话系统的开山鼻祖,90 年代做出全球第一个实用化对话智能体;他本人则在 2016 年率先用神经网络把延续 20 年的系统改造成端到端生成式模型。
学术教职或大厂顶薪都唾手可得,他却选择回国创业,而且选了一条几乎无人理解的路:不做纯文本大模型,死磕「视觉 + 语言」的流式多模态。行业主流是「离线抽帧」,把视频切成一帧帧图片处理;赵天成从一开始就要让视频像水流一样持续进入模型,AI 自己一直看,不用等人提问。
这个判断来自他在 CMU 参与的雅虎多模态智能体项目。他说,那一刻意识到多模态的上限高得多,「它真的让你感觉这是一个活物,而不只是一个对话的系统」。
五年坚守,AI 赛道换了三四轮

从文本生成到文生图,从 VLA 到世界模型,AI 风口换了三四轮。2023 年大语言模型爆火,有人拉他:「你以前不也搞语言模型,为什么不出来做?」资本和同行一次次劝他转方向、更快变现。
「我们的东西,在物理 AI 之前一直没有成为最火的东西。」赵天成坦言团队里也有人离开,但核心伙伴留了下来,围绕 V 和 L 持续产出。五年后,AI 行业从追逐云端数字智能转向落地物理世界,2026 年上半年全球物理 AI 融资已超 64 亿美元。
风口终于转到了他早在等待的方向。VLX 也在产业侧完成商业闭环:机器人、无人机、可穿戴设备、安防摄像头、AI PC 等终端,从被动执行指令走向主动适应场景。
VLX 为端侧而生的流式架构

VLX 首次在端侧打通「持续感知 + 精准定位 + 行动决策」的完整物理 AI 闭环。Flow、Seek、Go 三层不是三个独立模型,而是同一条视频流上不可分割的能力层。
赵天成把物理 AI 的必备能力拆成四块:语义、几何、决策、预测。VLX 的 X,代表它们都将被纳入同一条技术路线。
为了让模型原生适配端侧,团队从 Day 1 就按端侧算力约束设计架构。流式多模态能自动抓重点、快速响应,避免把视频硬塞进文本 token 带来的笨重交互。
当长期主义遇上产业拐点

Om AI 联汇已经形成三个闭环:模型闭环、数据闭环、商业闭环。百万级真实业务场景持续回流端侧数据,反哺模型迭代;营收以亿为单位,完成 PMF 验证。
赵天成的策略是「一脑多形」:先用 IoT 摄像头、AI PC 等成熟终端积累经验,再迁移到无人机和可穿戴设备,让机器狗一出世就站在百万级摄像头的经验之上。
2026 年夏天,产业需求曲线与技术积累曲线交汇。这个关于判断力与定力的商业样本说明:在剧变的 AI 时代,抵达终局的人不一定跑得最快,但要比市场更早看见未来,并且从不偏离方向。
来源:36 氪
