推理吞掉了 AI:Jeff Dean 和 Bill Dally 给出的硬件路线图
GTC 2026 上,Jeff Dean 和 Bill Dally 说了句大实话:现在真正难的是推理,不是训练。卡脖子的地方是数据搬运,硬件得围绕片上互联和专用链路重新设计,才能撑起每秒上万 token 的智能体。
6 months ago
TL;DR:
- 推理已经吃掉数据中心 90% 的电,训练那点负载根本不算什么
- 瓶颈不在算力——是数据在芯片里外搬来搬去的开销
- AI Agent 要跑起来,单用户得做到每秒 10,000 到 20,000 token
- 训练可能要变:从死磕静态数据集,转向让模型在环境里边干边学
标题
Jeff Dean 和 Bill Dally:现在真正难的是推理,不是训练
摘要
推理成了 AI 的主力负载,功耗和工程难度都甩开训练一大截。 两位在 GTC 2026 讲了几个要点:
- 资源占用:推理吃掉数据中心 90% 的电。训练是偶尔干一票的活,推理是 7×24 小时在跑。
- 真正的瓶颈:不是算力不够,是数据搬运太贵——片上互连、芯片间链路的带宽和延迟才是卡点。
- 性能门槛:要让自主 Agent 跑得动,单用户每秒 10,000 到 20,000 token 是必须过的坎。
- 怎么做:重做片上通信架构、上专用互连(PHY 和链路都要改),用分工式硬件处理推理流水线的不同阶段。
- 训练会变:从喂静态数据集,转向"在环境里学"的主动训练,解决数据不够用和泛化差的问题。
关键信息速览
| 维度 | 结论 | | --- | --- | | 负载格局 | 推理长期是大头,功耗和规模都比训练大得多 | | 性能门槛 | 单用户 10k–20k token/s,不然 Agent 跑不起来 | | 主要瓶颈 | 数据搬运成本,不是裸算力 |
分析
为什么推理吞掉了 AI?
- 训练是低频事件,几个月干一次;推理是持续在线的服务,用户数和 Agent 数一上来,调用量直接爆炸。
- 自主 Agent 需要低延迟、高吞吐的"连续行动能力",token/s 必须上一个量级。
瓶颈在数据搬运,算力反而不是问题
- 多个来源的技术分析都指向同一个结论:带宽、延迟、能效在片上互联和跨芯片链路这里卡住了。
- 可行的解法反复出现:tile 化设计、简化 PHY、专用互连协议、拓扑优化。
硬件路径(推理优先)
- 片上通信重构:缩短关键路径、让计算靠近数据、减少跨层搬运。
- 定制互连:根据推理流量特征部署专用链路和协议栈。
- 流水线分工:用异构硬件匹配不同算子和阶段,别指望一种芯片包打天下。
竞争格局
- NVIDIA 和 Google(TPU 那套)都在加速推理硬件演进,围绕带宽、互连、能效展开竞争。
- 谁的架构真正"推理优先",谁在规模化 Agent 场景里就占优势。
训练范式可能要变
- Dean 提到"主动训练":让模型在环境里交互,自己生成训练信号。
- 如果成了,对静态语料的依赖会下降,和 Agent 化趋势相互加强。
一个实践细节
- NVIDIA 已经在芯片设计里用上了 LLM(比如 Chip NeMo),工具链正在反哺下一代硬件。
影响评估
- 重要性:高
- 类别:技术洞察 / AI 研究 / 行业趋势
判断: 这是"推理优先"硬件叙事的早期阶段。专注片上通信、定制互连、推理流水线分工的团队最有优势。谁先逼近 10k–20k token/s 的目标,谁在接下来的 Agent 放量中就能拿到结构性先发优势。