黄仁勋的26分钟访谈:下一代操作系统,藏在Agent的Harness里
26 分钟的访谈,黄仁勋一个字都没提 GPU。这位全球最炙手可热的芯片公司掌门人,把全部时间花在了另一个话题上:程序员应该从写代码转向造 Agent。
这个转变的关键词,叫 Harness。
在黄仁勋的定义里,Harness 不是某个具体的框架或工具,而是围绕大模型运行时搭建的一整套系统:Prompt 管理、工具说明、记忆存储、上下文调度、任务拆分、重试策略、评测体系和权限控制。模型负责推理,Harness 负责把推理组织成可以验收的工作。
这个定义本身就透着一种紧迫感。如果你还在纠结模型选哪家、参数调多大,Harness 的视角会告诉你:模型是内核,Harness 才是操作系统。
0.01 的差距与 10 倍的成本落差

LangChain 团队用 Nemotron 3 Ultra 跑了一组实验。没有重新训练模型权重,只调整了系统 Prompt、工具描述和中间件配置。结果 Deep Agents 评测分数从原始状态追到 0.86,最高分的闭源模型是 0.87。差距只有 0.01。
但真正让业界震动的不是那 0.01,而是成本。单次评测成本从 43.48 美元降到了 4.48 美元,便宜了将近 10 倍。模型能力几乎相同,但运行环境的优化直接把成本砍掉了一个数量级。
黄仁勋说,这种成本下降会彻底改变开发方法。便宜带来的第一项能力是”多试”,可以同时比较不同的模型、Prompt、工具和重试策略。第二项是”常测”,把评测放进日常开发和生产监控,而不是等到上线前才补课。第三项才是”多部署”,用同样的成本覆盖更多场景。
成本曲线的拐点,往往比技术曲线的拐点来得更早也更猛烈。当评测便宜到可以按天跑,模型迭代的速度就不再受限于算力预算,而取决于团队的工程能力。
程序员的角色迁移:从写逻辑到造系统

黄仁勋抛出了一个更激进的判断:未来的公司会把越来越多能力建在 Harness 上,而不是写在传统的业务代码里。这意味着开发者的主战场正在转移,从应用层的逻辑编写,下沉到 Agent 运行时的系统设计。
这对团队的技能结构提出了全新要求。以前需要一个团队来维护数据库、API 接口和前端页面,现在可能需要一个团队来设计 Prompt 模板、管理工具链、构建评测流水线、配置权限策略。Harness 的复杂度不会比传统后端低,只是复杂度的维度完全不同。
他特别提到了一个安全原则:Agent 不应该直接拿到长期密钥。更合理的方式是由运行时根据当前任务和策略临时注入权限。这不是可选的增强功能,而是 Agent 系统的基本安全模型。一个能调用数据库、发送邮件、执行代码的 Agent,如果没有精细的权限隔离,后果不堪设想。
这也解释了为什么黄仁勋把 Harness 称为”操作系统”。就像 Windows 管理着硬件资源的分配和访问权限,Harness 管理着 Agent 可以调用什么工具、访问什么数据、执行什么操作。它是 Agent 世界里的资源调度层。
从模型竞赛到系统竞赛的拐点

过去两年,AI 行业的竞争主线是模型:谁的参数更大、谁的基准分更高、谁的上下文窗口更长。黄仁勋这次访谈释放的信号是:模型竞赛还在继续,但真正的差异化正在转移到 Harness 层。
谁能用更低的成本让同样的模型完成更复杂的任务,谁就能在 Agent 时代占据先机。这不再是谁的 GPU 更多的问题,而是谁的系统工程更好的问题。评测体系、工具链管理、权限控制、记忆机制,这些组件的质量决定了 Agent 的实际产出。
对于开发者来说,这是一个需要重新定义”能力边界”的时刻。模型的能力天花板由训练数据和架构决定,但 Agent 的实际表现,很大程度上由 Harness 决定。同一个模型在不同的 Harness 配置下,可以表现得判若两人。
黄仁勋用了 26 分钟没有聊芯片,只聊了软件应该怎么写。这或许才是这次访谈最值得关注的地方:当卖 GPU 的人告诉你,竞争力不在 GPU 上了,你应该认真听一听。
来源:AI 唱反调
