AI资讯 / 产业

产业 / 媒体

英伟达Blackwell GB300刷新MoE预训练纪录,每GPU算力达1648 TFLOPs

IT之家

英伟达昨日发布博文,宣布其Blackwell GB300系统在MoE预训练中刷新世界纪录,每GPU算力达1648 TFLOPs。该系统使用256块GPU预训练DeepSeek-v3 671B模型,在相同任务上以更少硬件实现同等性能。英伟达通过模拟超25万种配置,发现38项重大优化,累计进行140万小时GPU测试。相比2025年11月测试结果,性能提升50%,较上一代GB200实现约3倍跃升。

英伟达昨日发布博文,宣布其Blackwell GB300系统在MoE预训练中创下世界纪录,每GPU算力达1648 TFLOPs。MoE是一种机器学习模型架构,将大型模型分割为多个更小的专家子网络,每次推理或训练时仅激活其中一部分,旨在以更低计算成本实现更大模型容量。

在最新博文中,英伟达表示使用256块GPU预训练DeepSeek-v3 671B模型,GB300 NVL72实现了每GPU吞吐1648 TFLOPs的全新世界纪录。在相同训练任务上,GB300 NVL72用更少的GPU硬件达到了相同的性能,展示了其高效能优势。

英伟达透露,在过去6个多月时间里,通过模拟超过25万种不同配置,为Blackwell摸索发现了38项重大优化方案,累计进行了140万小时的GPU优化测试。这些优化显著提升了系统性能。

与2025年11月的预训练测试结果相比,GB300 NVL72系统性能优化提升50%。与上一代GB200每GPU 606 TFLOPs的成绩相比,GB300实现了约3倍的性能跃升,标志着AI训练效率的重大突破。

要点

  • 英伟达Blackwell GB300在MoE预训练中每GPU算力达1648 TFLOPs,创下世界纪录。
  • 使用256块GPU预训练DeepSeek-v3 671B模型,以更少硬件实现相同性能。
  • 通过模拟超25万种配置,发现38项优化方案,累计140万小时GPU测试。
  • 性能较2025年11月测试提升50%,较上一代GB200提升约3倍。
查看原始来源

原始标题:DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。