avatar

MoonshotAI 开源 FlashKDA:推理速度才是真正的战场

MoonshotAI 开源了 FlashKDA,一个基于 CUTLASS 的线性注意力内核,在 H20 上跑出 1.7-2.2 倍的预填充加速。信号很清楚:别再问模型多大了,问它跑多快、花多少钱。

avatar
5 months ago

TL;DR:

  • 参数规模不再是重点,能直接塞进现有系统的推理优化才是
  • 线性注意力不再只是论文里的东西:H20 上实测 1.72-2.22 倍 prefill 加速
  • 脱离具体硬件谈 token/s 没有意义
  • CUTLASS 基础方便移植,但也意味着碎片化和潜在的 IP 麻烦
  • 如果企业推理成本真能降 20-30%,效率型创业公司目前被低估了

MoonshotAI 开源 KDA 内核,把"推理效率"打成中国 AI 的招牌

MoonshotAI 发布 FlashKDA,与其说是开源,不如说是换了一套说法:不再强调"模型多大",而是"部署多快、多便宜"。他们放出了针对 Kimi Delta Attention(KDA)的 CUTLASS 优化内核,在 NVIDIA H20 上跑出 1.72-2.22 倍的 prefill 加速。核心卖点是线性注意力绕过了长上下文推理的二次复杂度问题,能实实在在砍推理成本。消息在社媒上传得很快,Moonshot 工程师分享了技术细节,社区把这解读为中国在推理栈上走"硬件协同设计"路线,对标 FlashAttention。背景也重要:Moonshot 融了超过 7 亿美金,估值 100-180 亿美金,Kimi K2.5 用的是 1T MoE 架构。在跟 Zhipu、MiniMax 的竞争中,他们选择打"效率"牌而不是"规模"牌。

更值得注意的是他们强调"可落地":直接能用的开源优化,不是不可验证的黑盒。光看 token/s 跑分没有上下文毫无意义——换个硬件结论可能完全不同,这也是早期线性注意力分叉难以规模化的原因。FlashKDA 对接 flash-linear-attention 后端,指向的是真实部署收益。如果 CUTLASS 数据靠谱,H20 上 20-30% 的推理成本下降能复现,对企业预算是实打实的影响。

  • 开源是把双刃剑:基于 CUTLASS 让西方开发者很容易 fork 和集成,可能抹平中西推理效率差距;但也带来 IP 纠纷和生态碎片化的风险。
  • 竞争层面:这直接增强了 Moonshot 的 Kimi Linear(480 亿参数、激活约 30 亿)在长上下文任务上的竞争力,特别是在编码和多模态 Agent 工作流上;Anthropic 和 OpenAI 都没有提供同等开放、效率优先的工具链。
  • 需要冷静一下:社媒上的兴奋忽略了混合精度等工程细节,不过 NVIDIA 文档确认 CUTLASS 对张量算子支持完备,落地不是空谈。

硬件碎片化的现实

舆论分歧可以预见。乐观者押注生态范围内的普惠加速——比如在 100 万上下文长度下,KDA 的 gated delta 规则带来 6 倍 TPOT;怀疑者指出,如果 H20 因出口管制在部分市场受限,针对 H20 的专项优化价值会打折扣。fla-org 早期对 KDA 的支持增加了可信度,Moonshot 在 K2.5 的 Agent swarm 方向也透露了趋势:用更高效的注意力机制,让 Agent 规模化不跟成本线性挂钩。话虽如此,西方实验室深耕 TensorRT 生态,短期不会轻易迁移——中国在开放、硬件弹性基础设施上的领先,可能被系统性低估。我的判断是:如果你在构建系统却忽视 KDA 带来的 75% KV cache 降幅,你已经落后了;如果你投资还在执着参数规模,你错过了企业 AI 成本曲线真正的去向。

| 阵营 | 论据 | 含义 | 我的看法 | |--------------------|---------------------|-----------------------------|--------------------| | 效率看多派 | FlashKDA 跑分(H20 上 1.72-2.22x);fla-org GitHub 集成 | 线性注意力在长上下文得到验证,关注点从"做大"转向"跑快" | 值得跟踪:加速开源推理,给闭源实验室施压 | | 硬件怀疑派 | NVIDIA CUTLASS 文档中的 Ampere/Blackwell 限制;出口管制担忧 | 碎片化风险真实存在,普适加速不保证 | 可能夸大了:中西隔离仍在,但 fork 仍可缩小 20-30% 效率差 | | 竞争观察者 | Moonshot 100-180 亿美金估值;Kimi K2.5 多模态 Agent 能力 | 把中国定位为"效率领跑者",迫使美国对手在成本上应战 | 被低估:硬软协同的护城河未被资本充分定价 | | 开源拥护者 | KDA 的 DPLR 矩阵论文与 GitHub 活跃度 | 支持"协作式基础设施优于封闭堆栈"的叙事 | 早期信号:效率使能的 Agent 工具链上,Moonshot 领先 |

总结:FlashKDA 巩固了 Moonshot 在推理优化上的位置。率先集成的 Builder 会获得成本优势;还盯着参数规模的投资者在看错指标;企业买家有望大幅压降部署成本,而忽视硬件维度的研究者会被边缘化。

重要性:
类别: 技术洞察、开源、市场影响

结论: 这是一个仍在早期但正在快速验证的效率叙事;最有利的是愿意尽快在生产环境接入的 Builder 和专注基础设施的基金,短线交易者价值有限,长期持有者需要以"成本曲线下移"而非"参数规模扩张"作为核心框架。