核心信息

MachGen 开源了其面向 NVIDIA Blackwell 的 WC Attention 变体,宣称在 B200 上针对 MiniMax H3 等模型的速度约为 BF16 FlashAttention 的两倍。团队还在原论文基础上做了额外改进,性能再提升超过 20%,同时保持在生产环境稠密注意力内核的 30% 以内。

要点

  • 在 B200 上针对 MiniMax H3 等模型宣称约为 BF16 FlashAttention 两倍的速度
  • 在原论文之上做出改进,性能进一步提升超过 20%
  • 性能已处于生产环境稠密注意力内核的 30% 以内
  • 所需资源显著更少[原文此处截断]
  • 已以开源形式发布