# 英伟达 GB300 NVL72 刷新 DeepSeek-v3 预训练纪录，每 GPU 算力达 1648 TFLOPs

- 来源：IT之家（RSS）
- 发布时间：2026-07-22 14:20
- AIHOT 分数：48
- AIHOT 链接：https://aihot.virxact.com/items/cmrvq2os1001pbi8570g0f7vy
- 原文链接：https://www.ithome.com/0/980/018.htm

## AI 摘要

英伟达用 256 块 GPU 预训练 DeepSeek-v3 671B 模型，实现每 GPU 吞吐 1648 TFLOPs 的世界纪录。该成绩较 2025 年 11 月的 1088 TFLOPs 提升 50%，较上一代 GB200 的 606 TFLOPs 提升约 3 倍。

## 正文

IT之家 7 月 22 日消息，英伟达昨日（7 月 21 日）发布博文，宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录，每 GPU 算力达 1648 TFLOPs（每秒万亿次浮点运算）。

IT之家注：MoE（混合专家模型）是一种机器学习模型架构。它将大型模型分割为多个更小的“专家”子网络，每次推理或训练时仅激活其中一部分。该架构旨在以更低的计算成本实现更大规模的模型容量，常用于大语言模型以提升效率。

模型预训练是指在大规模无标注数据集上，利用自监督学习方法让模型初步掌握通用的语言规律、视觉特征或常识。

在最新博文中，英伟达表示：

使用 256 块 GPU 预训练 DeepSeek-v3 671B 模型，GB300 NVL72 实现了每 GPU 吞吐 1648 TFLOPs 的全新世界纪录。在相同训练任务上，GB300 NVL72 用更少的 GPU 硬件，达到了相同的性能。

英伟达表示在过去 6 个多月时间里，通过模拟超过 25 万种不同配置，为 Blackwell 摸索发现了 38 项重大优化方案，累计进行了 140 万小时的 GPU 优化测试。

相比较 2025 年 11 月的预训练测试（1088 TFLOPs）结果，GB300 NVL72 系统性能优化提升 50%。

与上一代 GB200 每 GPU 606 TFLOPs 的成绩相比，GB300 实现了约 3 倍的性能跃升。
