AI资讯 / 模型

模型 / 官方

基于 CUTLASS 的高性能 Kimi Delta Attention 推理内核

Moonshot AI GitHub

Moonshot AI 在 GitHub 上正式开源 FlashKDA,这是一套基于 CUTLASS 构建的高性能 Kimi Delta Attention(KDA)CUDA 内核库。FlashKDA 专为 NVIDIA Hopper 及更新架构(SM90+)优化,要求 CUDA 12.9 及以上版本与 PyTorch 2.4 及以上版本。该库可作为 flash-linear-attention 框架的后端自动调度,用户只需安装 flash-linear-attention 0.5.0 及以上版本,即可通过 chunk_kda 接口透明调用 FlashKDA 内核,无需修改现有代码。内核 API 支持可变长度批处理、循环状态传递、多种门控参数配置等特性,当前要求 K 与 V 维度均为 128。项目已获得超过 1100 个 Star 与 102 次 Fork,并附有针对 H20 和 GB200 硬件的详细性能基准报告,以及完整的正确性测试套件。

Moonshot AI 于 2026 年正式开源 FlashKDA,全称 Flash Kimi Delta Attention,是一套专为 Kimi 模型中 Delta Attention 机制设计的高性能 CUDA 内核库。该项目基于 NVIDIA 的 CUTLASS 模板库构建,充分利用 Hopper 架构(SM90)及以上 GPU 的硬件特性,旨在大幅提升 KDA 算子在推理阶段的计算效率。项目在发布后迅速获得社区关注,GitHub 上已积累超过 1100 个 Star。

FlashKDA 的核心优势在于与 flash-linear-attention 框架的深度集成。安装完成后,FlashKDA 会作为 chunk_kda 算子的后端被自动调度,用户无需修改任何业务代码。若需回退至原有 Triton 路径,只需将环境变量 FLA_FLASH_KDA 设置为 0 即可。调试时,通过配置 Python 日志级别为 INFO,可实时查看后端调度命中或拒绝的详细原因,便于排查兼容性问题。

在内核 API 设计上,FlashKDA 提供了 flash_kda.fwd 前向接口,支持 Query、Key、Value、Gate 等标准注意力参数,同时引入了 A_log、dt_bias、lower_bound 等 Delta Attention 特有的门控参数。接口支持可选的初始循环状态与最终循环状态传递,状态张量可接受 bf16 或 fp32 格式。此外,通过 cu_seqlens 参数可实现变长序列的批处理,适应不同长度输入混合推理的场景。

FlashKDA 提供了针对 NVIDIA H20 与 GB200 两款硬件平台的详细性能基准报告,分别记录于 BENCHMARK_H20.md 与 BENCHMARK_GB200.md 文件中。测试套件方面,项目包含 test_fwd.py 正确性测试,通过与 PyTorch 参考实现及 flash-linear-attention 的精确对比来验证内核输出的准确性。开发者还可通过 setup_clangd.sh 脚本快速配置 CUDA/C++ 源码的 IntelliSense 支持,提升开发体验。

FlashKDA 采用 MIT 许可证开源,支持通过指定 FLASH_KDA_CUDA_ARCHS 环境变量来编译特定或全部支持的 GPU 架构,方便构建通用发行包与 CI 流水线集成。该项目由 Yutian Chen、Zhiyuan Li、Yucheng Wang 和 Ming Wei 共同开发,并于 2026 年 4 月发布了详细的设计决策深度解析博客,系统介绍了 FlashKDA v1 背后的技术选型与工程权衡,为研究者和工程师提供了重要参考。

要点

  • FlashKDA 是 Moonshot AI 开源的高性能 Kimi Delta Attention CUDA 内核库,基于 CUTLASS 构建,专为 SM90 及以上 GPU 架构优化。
  • 该库可作为 flash-linear-attention 框架中 chunk_kda 算子的后端自动调度,支持一键回退至 Triton 路径,集成成本极低。
  • 内核 API 支持可变长度批处理、循环状态传递及多种门控参数配置,当前要求 K 与 V 维度均为 128。
  • 项目附有 H20 与 GB200 两款硬件平台的性能基准报告及完整正确性测试套件,工程可靠性有保障。
  • FlashKDA 采用 MIT 许可证,支持多架构编译,适合生产环境部署与 CI 流水线集成。
查看原始来源

原始标题:MoonshotAI/FlashKDA — FlashKDA: high-performance Kimi Delta Attention kernels

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。