avatar

推理吞掉了 AI:Jeff Dean 和 Bill Dally 给出的硬件路线图

GTC 2026 上,Jeff Dean 和 Bill Dally 说了句大实话:现在真正难的是推理,不是训练。卡脖子的地方是数据搬运,硬件得围绕片上互联和专用链路重新设计,才能撑起每秒上万 token 的智能体。

avatar
6 months ago

TL;DR:

  • 推理已经吃掉数据中心 90% 的电,训练那点负载根本不算什么
  • 瓶颈不在算力——是数据在芯片里外搬来搬去的开销
  • AI Agent 要跑起来,单用户得做到每秒 10,000 到 20,000 token
  • 训练可能要变:从死磕静态数据集,转向让模型在环境里边干边学

标题

Jeff Dean 和 Bill Dally:现在真正难的是推理,不是训练

摘要

推理成了 AI 的主力负载,功耗和工程难度都甩开训练一大截。 两位在 GTC 2026 讲了几个要点:

  • 资源占用:推理吃掉数据中心 90% 的电。训练是偶尔干一票的活,推理是 7×24 小时在跑。
  • 真正的瓶颈:不是算力不够,是数据搬运太贵——片上互连、芯片间链路的带宽和延迟才是卡点。
  • 性能门槛:要让自主 Agent 跑得动,单用户每秒 10,000 到 20,000 token 是必须过的坎。
  • 怎么做:重做片上通信架构、上专用互连(PHY 和链路都要改),用分工式硬件处理推理流水线的不同阶段。
  • 训练会变:从喂静态数据集,转向"在环境里学"的主动训练,解决数据不够用和泛化差的问题。

关键信息速览

| 维度 | 结论 | | --- | --- | | 负载格局 | 推理长期是大头,功耗和规模都比训练大得多 | | 性能门槛 | 单用户 10k–20k token/s,不然 Agent 跑不起来 | | 主要瓶颈 | 数据搬运成本,不是裸算力 |

分析

为什么推理吞掉了 AI?

  • 训练是低频事件,几个月干一次;推理是持续在线的服务,用户数和 Agent 数一上来,调用量直接爆炸。
  • 自主 Agent 需要低延迟、高吞吐的"连续行动能力",token/s 必须上一个量级。

瓶颈在数据搬运,算力反而不是问题

  • 多个来源的技术分析都指向同一个结论:带宽、延迟、能效在片上互联和跨芯片链路这里卡住了。
  • 可行的解法反复出现:tile 化设计、简化 PHY、专用互连协议、拓扑优化。

硬件路径(推理优先)

  • 片上通信重构:缩短关键路径、让计算靠近数据、减少跨层搬运。
  • 定制互连:根据推理流量特征部署专用链路和协议栈。
  • 流水线分工:用异构硬件匹配不同算子和阶段,别指望一种芯片包打天下。

竞争格局

  • NVIDIA 和 Google(TPU 那套)都在加速推理硬件演进,围绕带宽、互连、能效展开竞争。
  • 谁的架构真正"推理优先",谁在规模化 Agent 场景里就占优势。

训练范式可能要变

  • Dean 提到"主动训练":让模型在环境里交互,自己生成训练信号。
  • 如果成了,对静态语料的依赖会下降,和 Agent 化趋势相互加强。

一个实践细节

  • NVIDIA 已经在芯片设计里用上了 LLM(比如 Chip NeMo),工具链正在反哺下一代硬件。

影响评估

  • 重要性:高
  • 类别:技术洞察 / AI 研究 / 行业趋势

判断: 这是"推理优先"硬件叙事的早期阶段。专注片上通信、定制互连、推理流水线分工的团队最有优势。谁先逼近 10k–20k token/s 的目标,谁在接下来的 Agent 放量中就能拿到结构性先发优势。