推論がAIの本丸になった:Jeff DeanとBill Dallyが語るハードウェアの作り直し
GTC 2026で両者が指摘したのは、AIの主戦場が学習から推論に移ったという現実。ボトルネックは計算能力ではなくデータの移動で、ハードウェアの根本的な再設計が避けられない。
6 months ago
TL;DR:
- データセンター電力の最大90%は推論が食っている。学習ではない
- チップの計算性能より、データをどう動かすかが律速になっている
- AIエージェントが実用になる目安は、ユーザーあたり1万〜2万トークン/秒
- 今後の学習は静的データセットから、環境とやりとりしながら学ぶ方向へ向かうかもしれない
見出し
Jeff DeanとBill Dallyの結論:難しいのは「学習」じゃなく「推論」
要旨
- 推論がAIインフラの中心になった:NVIDIAのGTC 2026で、Google DeepMindのJeff DeanとNVIDIAのBill Dallyが話したのは、推論がAIワークロードの大部分を占め、データセンター電力の最大90%を消費しているという現実。
- 計算能力よりデータ移動が問題:生の演算性能は足りている。オンチップ通信やメモリ間のデータ転送が遅い。
- ハード設計をやり直す必要がある:オンチップ・ネットワークの再設計、カスタム相互接続、推論パイプラインの段階別に最適化した異種ハードの組み合わせ。
- 目標性能:ユーザーあたり1万〜2万トークン/秒。これが達成できれば、エージェントが長時間の自律タスクを実行できるようになる。
- 学習のやり方が変わる:Deanは、静的データを食わせる方式から、環境とやりとりしながら訓練信号を自分で作る「能動学習」への移行を示唆した。
背景
- 需要の構造が違う:
- 学習は時々やるもの。推論は常時、大量のユーザーに対して発生する。
- エージェント化が進むと、低レイテンシと高スループットの両方が必要になる。
- 技術的なボトルネック:
- **データ移動(オンチップ、メモリ、インターコネクト)**が支配的な制約。
- タイル化設計、PHYの単純化、カスタムリンクなどが繰り返し提案されている。
課題と方向性の整理
| 領域 | 現状の課題 | 提示された方向性 | |---|---|---| | オンチップ通信 | 帯域/レイテンシが演算ユニットを遊ばせる | NoC再設計、タイル化、データ近接性の強化 | | メモリ/インターコネクト | 転送のエネルギーと待ち時間が膨らむ | カスタム相互接続、簡素化したPHY | | 推論パイプライン | 単一ハードでの一括処理は効率が悪い | ステージ別に最適化した異種ハードの組み合わせ | | 目標KPI | 今のスループットではエージェント要件を満たせない | 1万〜2万トークン/秒/ユーザー |
競争の構図
- NVIDIA vs Google(TPU):両陣営とも推論最適化に舵を切った。焦点は演算密度ではなくデータ経路をいかに短くするか。
- 設計の内製化:
- NVIDIAはLLM(Chip NeMoなど)を使って、チップ設計プロセス自体を加速しようとしている。
何が言えるか
- 投資対効果が大きいのは推論向けアーキテクチャ:学習特化だけでは、稼働電力と需要の現実に合わない。
- エージェント時代のSLOを再定義する必要がある:トークン/秒/ユーザーのスループット指標が最重要KPIになる。
- データ起点から環境起点へ:静的データが枯渇しつつある局面で、能動学習は有力な選択肢。
押さえておくべきポイント
- 推論が電力・コストの大部分を占める。最適化すべきは計算ではなくデータ移動。
- KPIは1万〜2万トークン/秒/ユーザー。これがエージェントの実用境界。
- ハードは「パイプライン分解×異種最適化」が前提設計になる。
影響評価
- 重要度: 高
- カテゴリ: テクニカルインサイト / AI研究 / 産業トレンド
結論: 推論最適化はすでに本番。先に動いた者が有利。ハード・システム・コンパイラを作る側と中長期投資家に優位性がある。短期トレードの観点ではテーマ選別が鍵だが、参入タイミングとしてはまだ早い。