추론이 본게임이 된 이유: 제프 딘과 빌 달리가 짚은 데이터 이동 병목
NVIDIA GTC 2026에서 제프 딘과 빌 달리는 학습보다 추론이 데이터센터의 실제 부담이라고 말했다. 연산이 아니라 데이터 이동이 병목이라는 게 핵심.
6 months ago
TL;DR:
- 데이터센터 전력의 90%까지 추론에 쓰인다. 학습보다 훨씬 크다
- 병목은 연산이 아니라 칩 내부와 칩 사이의 데이터 이동
- AI 에이전트 목표: 사용자당 초당 1만~2만 토큰
- 학습 방식이 정적 데이터셋에서 환경과 상호작용하는 능동 학습으로 바뀔 수 있다
헤드라인
제프 딘과 빌 달리: 진짜 문제는 학습이 아니라 추론이다
요약
- 전력 분포: 데이터센터 전력의 90%까지 추론에 쓰인다. 학습은 이제 작은 비중.
- 병목이 뭔가: 연산량이 아니라 데이터가 얼마나 빨리 움직이느냐다. 칩 내부, 칩 사이 통신이 느리다.
- 목표 성능: 사용자당 초당 1만~2만 토큰. 이 정도면 에이전트가 몇 시간에서 며칠까지 혼자 일할 수 있다.
- 하드웨어 방향: 온칩 통신 재설계, 맞춤형 인터커넥트, 파이프라인 단계마다 다른 하드웨어 배치.
- 학습 방식 변화: 정적 데이터를 먹이는 방식에서, 환경과 상호작용하며 스스로 신호를 만드는 능동 학습으로 갈 가능성.
왜 추론이 중심이 됐나
- 학습은 한 번 하면 끝이거나 주기적으로 한다. 추론은 사용자들이 계속 쓴다.
- 에이전트 워크로드는 지연에 민감하고 토큰 처리량이 많아야 한다.
병목의 실체: 데이터 이동
- 연산 유닛이 빨라봤자 소용없다. 메모리와 인터커넥트의 대역폭, 지연이 전체 속도를 결정한다.
- 계속 나오는 해법: 타일형 설계, 단순화된 PHY 인터페이스 같은 데이터 경로 최적화.
1만~2만 토큰/초가 왜 중요한가
- 이 속도면 대화를 넘어서 실제로 행동하는 에이전트가 빠르게 판단할 수 있다.
- 지금 나와 있는 하드웨어로는 안 된다. 아키텍처 자체를 새로 짜야 한다.
하드웨어 설계 방향
- 온칩 통신: 라우팅, 버퍼링, 메모리 배치를 바꿔서 데이터 재배치 비용을 줄인다
- 인터커넥트: 노드 간 지연과 대역폭을 일정하게 맞추는 맞춤형 링크
- 파이프라인 분할: 프리필, 디코딩 같은 단계마다 다른 가속기 배치
NVIDIA vs Google
둘 다 추론 최적화 하드웨어에 집중하고, 데이터 이동 최적화를 우선한다.
| 항목 | NVIDIA (GPU 중심) | Google (TPU 중심) | |---|---|---| | 초점 | 큰 에코시스템, 범용 가속 | 특정 워크로드에 맞춘 매트릭스 가속 | | 공통 과제 | 데이터 이동 병목 해소, 맞춤형 인터커넥트, 타일·PHY 최적화 | | 목표 | 고집적 스케일아웃에서 추론 TPS 최대화 | 서비스 트래픽에서 지연과 전력 효율 동시 개선 |
학습 방식 변화: 수동에서 능동으로
- 정적 데이터의 한계: 인터넷에서 긁어올 데이터가 줄어들고 있다.
- 능동 학습: 시뮬레이션이나 실제 환경에서 상호작용하며 스스로 학습 신호를 만든다.
참고
- NVIDIA는 이미 Chip NeMo 같은 LLM을 칩 설계에 쓰고 있다. AI가 다음 세대 하드웨어를 설계하는 순환이 생기는 중.
영향
- 중요도: 높음
- 분류: 기술 인사이트 / AI 연구 / 업계 흐름
결론
- 추론이 데이터센터의 주력 워크로드가 됐다. 병목은 연산이 아니라 데이터 이동.
- 사용자당 1만~2만 토큰/초는 지금 아키텍처로 안 된다. 온칩, 오프칩 경로를 통째로 다시 설계해야 한다.
- 능동 학습은 데이터가 바닥나는 문제에 대한 구조적 대응이 될 수 있다.
판단: 아직 초기다. 유리한 쪽은 인프라, 가속기, 시스템 소프트웨어를 만드는 사람들과 중장기 관점의 투자자다. 단기 이벤트보다 중장기 하드웨어·시스템 베타가 더 의미 있다.