AI资讯 / Agent

Agent / 分析

Cursor 开源 MoK 引发推理工程新争论

Latent Space

在 Latent Space 推理工程大师课播客中,一场关于 Megakernel 技术命运的辩论引发广泛关注。工程师 Ali 认为,Megakernel 虽然理论上优雅,但在实际生产环境中往往跑不过 TensorRT-LLM 等模块化方案,原因在于融合超大内核的复杂度极高,且张量并行场景下的非线性操作仍需跨 GPU 通信,融合本身无法绕开这一物理约束。NVIDIA Rubin 架构引入的 tile 级依赖触发机制,被认为从硬件层面进一步削弱了 Megakernel 的核心价值主张。然而就在这场争论发酵之际,Cursor 于 2026 年 8 月 4 日开源了 Mixture of Kittens(MoK)——一个专为 NVL72 设计的 MoE 训练 Megakernel,将专家混合的通信与计算全部融合进单一确定性内核,相比最强公开基线速度提升最高 2.37 倍,整体 token 吞吐量提升约 41%。这一结果表明,Megakernel 在特定场景下仍具备不可忽视的工程价值,技术路线之争远未终结。

Latent Space 播客近期举办的推理工程大师课中,工程师 Ali 对 Megakernel 技术发表了明确的悲观判断。他指出,Megakernel 的核心逻辑是将多个内核融合为一,以减少启动开销和内核间的重叠等待。然而在实际工程中,这种融合的复杂度极高,即便花费两个月时间手写一个 6.7 万行的前向传播融合内核,最终也往往因为难以针对每个子组件单独优化而败给模块化方案。

张量并行场景下的物理约束是 Megakernel 面临的另一道难关。Ali 解释道,当矩阵被拆分到多块 GPU 上时,softmax 等非线性操作需要汇聚来自所有 GPU 的部分结果,这意味着即使拥有完美的融合内核,GPU 之间的通信依然无法省略。这一约束并非软件层面可以绕开的问题,而是分布式推理的基本物理限制,使得 Megakernel 的收益空间大打折扣。

NVIDIA Rubin 架构的发布为这场争论增添了新的变量。NVIDIA 工程师 Kyle Kranen 公开介绍了 Rubin 的 tile 级依赖触发机制:只要某个操作所需的数据就绪,对应的内核便可立即启动,无需等待整个前序内核完成。这一设计从硬件层面解决了此前推动内核融合的核心动机之一——内核间的流水线阻塞问题,被部分工程师解读为 NVIDIA 在架构层面主动压缩了 Megakernel 的生存空间。

然而就在悲观论调甚嚣尘上之际,Cursor 于 2026 年 8 月 4 日开源了 Mixture of Kittens(MoK),直接用实验数据回应了这场争论。MoK 是一个专为 NVIDIA NVL72 集群设计的 MoE 训练 Megakernel,将专家混合架构中所有的通信与计算操作融合进单一的、完全确定性的内核。该项目由 Ben Spector 的 Megakernel 论文共同作者 Stuart Sul 主导,隶属于 Dan Fu 的研究团队。

MoK 的基准测试结果颇为亮眼:相比当前最强的公开基线,推理速度最高提升 2.37 倍,整体 token 吞吐量提升约 41%。Cursor 表示,在规模化部署场景下,这一效率提升可转化为数十亿美元量级的算力成本节省。这一数字使得「Megakernel 已死」的论断显得过于草率,也说明在特定硬件配置和模型架构组合下,深度融合策略仍然具备显著的工程价值。

这场争论折射出当前 AI 推理工程领域的深层张力:通用模块化方案与针对特定硬件深度定制的融合方案之间,并不存在放之四海而皆准的答案。随着 NVIDIA Rubin 等新架构持续演进,以及 MoE 等新型模型结构带来的全新通信模式,推理内核的最优设计路线仍将是一个动态变化的开放问题,工程师们的争论也将随之延续。

要点

  • Megakernel 在通用生产环境中面临真实挑战:张量并行下的跨 GPU 通信约束无法通过内核融合消除,模块化方案在多数场景下更易优化。
  • NVIDIA Rubin 的 tile 级依赖触发机制从硬件层面削弱了内核融合的部分核心动机,但并未完全封闭 Megakernel 的应用空间。
  • Cursor 开源的 MoK 在 NVL72 上实现最高 2.37 倍加速和 41% 吞吐量提升,证明针对特定架构深度定制的 Megakernel 仍具备显著工程价值。
  • MoE 架构的通信与计算融合是 Megakernel 当前最具潜力的应用场景之一,与通用 Transformer 推理的情况存在本质差异。
  • 推理内核的最优设计路线高度依赖硬件代际、模型架构和部署规模,不存在一刀切的结论。
查看原始来源

原始标题:[AINews] Megakernels are so dead and so back

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。