Bitget App
交易“智”变
快捷买币行情交易合约理财AI广场更多
Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍

华尔街见闻华尔街见闻2026/07/22 08:25
作者:华尔街见闻

英伟达正以持续的软件栈优化延长Blackwell平台的生命周期,同时为下一代Rubin架构的规模化落地蓄力。

在新一代Rubin平台加速部署的背景下,英伟达披露,仅用三个月时间,便将GB200 NVL72在运行DeepSeek R1 0528模型时的每兆瓦算力吞吐量(TPS/MW)提升了4倍。这一成果源自英伟达在四个月内完成的38项重大优化,背后支撑为逾25万次模拟配置测试及累计140万GPU小时的优化验证。

与此同时,GB300"Blackwell Ultra"平台在AI训练基准测试中持续刷新纪录。256卡规模下,GB300 NVL72在DeepSeek-V3 671B预训练任务中以每GPU 1648 TFLOPs的成绩创下历史最高纪录,较GB200的606 TFLOPs提升约3倍,且该指标在过去六个月内已累计提升1.5倍。

GB200能效大幅跃升,优化覆盖90%以上模型

英伟达表示,针对GB200 NVL72平台的系列优化,使其在运行DeepSeek R1 0528(1K输入/1K输出配置)时,每兆瓦算力吞吐量在三个月内实现4倍增长。

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍  image 0

支撑这一提升的,是英伟达在四个月内完成的38项重大优化迭代。这些优化经由超过25万次模拟配置筛选,并累计消耗140万GPU小时进行实测验证。英伟达特别指出,其中逾90%的优化成果可跨模型复用,适用于其AI产品组合中的其他模型,而非专为单一任务量身定制。

这意味着,现有数据中心客户无需更换硬件,即可通过软件升级获得显著的能效收益——这对于算力成本高度敏感的超大规模云厂商和企业客户而言,具有直接的经济价值。

GB300刷新训练纪录,六个月性能提升1.5倍

在AI训练侧,GB300 NVL72同样展现出强劲的性能势头。在256卡规模下,基于Megatron Core框架对DeepSeek-V3 671B模型进行预训练,GB300 NVL72实现了每GPU 1648 TFLOPs的吞吐量,较此前GB200的606 TFLOPs提升约3倍,并创下该任务的全球最高纪录。

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍  image 1

值得关注的是,这一数字并非静止的硬件极限。GB300 NVL72在Megatron Core框架下的表现,已从2025年11月的1088 TFLOPs/GPU增长至2026年6月的1648 TFLOPs/GPU,六个月内累计提升约1.5倍。

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍  image 2

在主流AI框架的协同优化方面,英伟达与PyTorch及JAX社区的深度合作同样带来显著增益。在TorchTitan(PyTorch原生训练栈)上,GB300 NVL72对DeepSeek-V3 671B的训练性能,相较未优化基线配置提升6倍,从199 TFLOPs/GPU跃升至1197 TFLOPs/GPU。JAX框架下的提升幅度更为突出,截至2026年7月,每GPU吞吐量达到4082 Tokens/s,对应1025 TFLOPs/GPU,较2026年1月的418 Tokens/s提升约10倍。

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍  image 3

扩展效率接近理论上限,800 Gb/s网络是关键

大规模训练场景下的扩展效率,历来是衡量AI基础设施实用性的核心指标之一。英伟达披露,在256至1024卡的扩展区间内,GB300 NVL72在三大主流框架下均维持了接近理论上限的扩展效率:Megatron Core达到98.5%,TorchTitan与JAX均达到97%。

英伟达将这一扩展表现归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片。高速互联直接决定了多机训练中的通信开销,进而影响整体扩展效率,该网络能力被视为支撑上述跨框架高效率表现的核心基础设施组件。

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍  image 4

Rubin平台加速落地,Blackwell优化仍在持续

上述优化进展发布之际,英伟达下一代Vera Rubin平台已进入全球部署阶段。据报道,Vera Rubin NVL72在Token吞吐量上相较Blackwell实现约10倍提升,GB200 NVL72约为80,000 Tokens/s,而Vera Rubin NVL72在同等150MW功耗下可达800,000 Tokens/s。

然而,Blackwell平台已在全球无数数据中心完成部署,英伟达的策略与此前Hopper世代如出一辙——在新平台推进的同时,持续通过软件优化挖掘已部署硬件的潜力。这一做法不仅延长了现有客户的硬件投资回报周期,也强化了英伟达在AI基础设施生态中的平台黏性。对于市场而言,英伟达在Blackwell与Rubin双线并进的格局下,正逐步构筑起竞争对手难以在短期内逾越的软件护城河。

0
0

免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。

你已了解市场,是时候开始交易了!
Bitget支持一站式交易加密货币、股票和黄金等。
立即交易!

你也可能喜欢

超级周热点前瞻:美英日利率决议

汇通财经2026/09/11 15:39
超级周热点前瞻:美英日利率决议

美国消费者信心意外大跌 9月指数降至47.8 通胀预期跳升至4.6%

随着汽油价格上涨以及贸易紧张局势再度升温,美国消费者对生活成本的担忧进一步加剧

智通财经2026/09/11 14:54
美国消费者信心意外大跌 9月指数降至47.8 通胀预期跳升至4.6%

资金流向大分化! 美股基金净流出创年内新高,Astra狂潮之下科技主题逆势吸金

由于伊朗战争,美国股票基金在截至9月9日的一周内面临巨大的抛售压力​推高油价,加剧通胀担忧‌以及借贷成本高企相关问题。

智通财经2026/09/11 14:25
资金流向大分化! 美股基金净流出创年内新高,Astra狂潮之下科技主题逆势吸金