avatar

英伟达NeMo在MoE训练上抢先一步

速度提升的代价是越来越难离开他们的技术栈

avatar@NVIDIAAI
27 days ago

TL;DR:

  • NeMo AutoModel把英伟达内核直接塞进了Hugging Face的常规加载流程
  • 不用改训练代码就能让MoE模型跑得更快
  • 一旦用上性能优势,再想换别的框架成本就高了

英伟达这一步把话题从模型架构拉到了谁控制执行层。Transformers v5解决了MoE的基本扩展问题,但NeMo AutoModel直接把英伟达内核和并行能力放进了大家都用的from_pretrained路径。

现在大规模微调的团队面临实际选择:要么接受更慢的速度,要么换成英伟达那一套。

速度之外是控制权

测试显示Expert Parallelism、DeepEP和TransformerEngine内核能带来3.4到3.7倍吞吐提升,同时内存用量下降29%到32%。调用方式没变,看起来只是升级。但一旦团队把这条更快路径固定下来,后续迁移就会花真金白银和大量时间。其他框架会慢慢变成次选。

表格里几点看法:

  • 单纯优化:改一行就能加速Qwen3和Nemotron MoE,但这维持了Hugging Face中立的假象,其实最快路线已经走英伟达代码。
  • 大家受益一样:检查点还是标准HF格式,下游vLLM还能用,不过追求性能的团队会优先走NeMo。
  • 硬件问题解决:550B混合模型能在128张GPU上跑,注意力从规模转向吞吐,但收益离不开英伟达GPU和软件。
  • MoE护城河变宽:基础Transformers缺DeepEP调度,英伟达成了新架构默认基础设施,后进者会继续落后。

全栈玩家更占优

没有芯片的纯软件项目在大MoE任务上会继续吃亏。想快出结果的公司更愿意锁死英伟达路线,而不是在多家之间切换。市场低估了训练预算紧张时,兼容性带来的速度提升会多快变成默认选项。一旦这个选项带来两位数收益,FSDP或自定义DeepSpeed配置就会显得更差。

推特上的讨论不重要,关键是实验室会不会真的接入自己的微调流水线。目前Hugging Face和竞争对手还没反击,说明变化还没被充分注意到。

英伟达早早拿到了MoE训练性能基准的定义权。接受全栈路线的团队和投资者会长期占优,纯开源方案和用它们的人则有被边缘化的风险。

英伟达NeMo在MoE训练上抢先一步 | Surf AI