avatar

推論がAIの本丸になった:Jeff DeanとBill Dallyが語るハードウェアの作り直し

GTC 2026で両者が指摘したのは、AIの主戦場が学習から推論に移ったという現実。ボトルネックは計算能力ではなくデータの移動で、ハードウェアの根本的な再設計が避けられない。

avatar
6 months ago

TL;DR:

  • データセンター電力の最大90%は推論が食っている。学習ではない
  • チップの計算性能より、データをどう動かすかが律速になっている
  • AIエージェントが実用になる目安は、ユーザーあたり1万〜2万トークン/秒
  • 今後の学習は静的データセットから、環境とやりとりしながら学ぶ方向へ向かうかもしれない

見出し

Jeff DeanとBill Dallyの結論:難しいのは「学習」じゃなく「推論」

要旨

  • 推論がAIインフラの中心になった:NVIDIAのGTC 2026で、Google DeepMindのJeff DeanとNVIDIAのBill Dallyが話したのは、推論がAIワークロードの大部分を占め、データセンター電力の最大90%を消費しているという現実。
  • 計算能力よりデータ移動が問題:生の演算性能は足りている。オンチップ通信やメモリ間のデータ転送が遅い。
  • ハード設計をやり直す必要がある:オンチップ・ネットワークの再設計、カスタム相互接続、推論パイプラインの段階別に最適化した異種ハードの組み合わせ。
  • 目標性能:ユーザーあたり1万〜2万トークン/秒。これが達成できれば、エージェントが長時間の自律タスクを実行できるようになる。
  • 学習のやり方が変わる:Deanは、静的データを食わせる方式から、環境とやりとりしながら訓練信号を自分で作る「能動学習」への移行を示唆した。

背景

  • 需要の構造が違う:
    • 学習は時々やるもの。推論は常時、大量のユーザーに対して発生する。
    • エージェント化が進むと、低レイテンシと高スループットの両方が必要になる。
  • 技術的なボトルネック:
    • **データ移動(オンチップ、メモリ、インターコネクト)**が支配的な制約。
    • タイル化設計、PHYの単純化、カスタムリンクなどが繰り返し提案されている。

課題と方向性の整理

| 領域 | 現状の課題 | 提示された方向性 | |---|---|---| | オンチップ通信 | 帯域/レイテンシが演算ユニットを遊ばせる | NoC再設計、タイル化、データ近接性の強化 | | メモリ/インターコネクト | 転送のエネルギーと待ち時間が膨らむ | カスタム相互接続、簡素化したPHY | | 推論パイプライン | 単一ハードでの一括処理は効率が悪い | ステージ別に最適化した異種ハードの組み合わせ | | 目標KPI | 今のスループットではエージェント要件を満たせない | 1万〜2万トークン/秒/ユーザー |

競争の構図

  • NVIDIA vs Google(TPU):両陣営とも推論最適化に舵を切った。焦点は演算密度ではなくデータ経路をいかに短くするか。
  • 設計の内製化:
    • NVIDIAはLLM(Chip NeMoなど)を使って、チップ設計プロセス自体を加速しようとしている。

何が言えるか

  • 投資対効果が大きいのは推論向けアーキテクチャ:学習特化だけでは、稼働電力と需要の現実に合わない。
  • エージェント時代のSLOを再定義する必要がある:トークン/秒/ユーザーのスループット指標が最重要KPIになる。
  • データ起点から環境起点へ:静的データが枯渇しつつある局面で、能動学習は有力な選択肢。

押さえておくべきポイント

  • 推論が電力・コストの大部分を占める。最適化すべきは計算ではなくデータ移動。
  • KPIは1万〜2万トークン/秒/ユーザー。これがエージェントの実用境界。
  • ハードは「パイプライン分解×異種最適化」が前提設計になる。

影響評価

  • 重要度: 高
  • カテゴリ: テクニカルインサイト / AI研究 / 産業トレンド

結論: 推論最適化はすでに本番。先に動いた者が有利。ハード・システム・コンパイラを作る側と中長期投資家に優位性がある。短期トレードの観点ではテーマ選別が鍵だが、参入タイミングとしてはまだ早い。