英伟达的Blackwell GB300与GB200图形处理器凭借持续的技术优化,在各项人工智能工作负载中持续展现出领先性能。随着新一代AI平台在全球范围内陆续部署,外界或许曾推测英伟达会将重心转移至鲁宾架构,但事实证明,已在无数数据中心投入实战的Blackwell系列同当年的Hopper架构一样,仍在通过软件持续升级释放惊人潜力,其中GB300更是不断在人工智能运算任务中创下性能新高。
RkP g&R;i
,W"Q)cL 根据英伟达官方公布的数据,针对Blackwell平台进行的持续优化大幅提升了整体性能与能效比。在仅短短3个月的时间内,英伟达在运行DeepSeek R1 0528-1K/1K工作负载的同一套GB200 NVL72配置上,将每兆瓦吞吐量提升了4倍之多。在此期间,该公司通过运行超过25万种模拟配置,为Blackwell平台增添了38项重大优化,累计耗费了140万个GPU测试小时。值得一提的是,超过90%的优化成果均可适用于其他人工智能模型,这充分彰显了英伟达在全新平台逐步普及之际,依然对既有AI平台保持着深度投入的承诺。
Y%OE1F$6NN
|pk1pV | 另一方面,英伟达旗下的GB300“Blackwell Ultra”平台则在人工智能训练领域持续占据主导地位。在使用256张GPU运行DeepSeek-V3 671B模型时,其Megatron Core核心创下了每张GPU高达1648太洛普斯的惊人记录,实现了相比GB200 606太洛普斯的3倍性能飞跃。利用GB300 NVL72对DeepSeek-V3 671B进行预训练,能够以世界纪录般的每GPU 1648太洛普斯运行效率,让相同的训练任务仅需极少部分的硬件规模便能达成既定性能。同时,相同的GB300 NVL72系统在经过持续优化后,其性能在过去6个月内也实现了高达1.5倍的增长。
QU0K'4Yx5j Zn&S7a>7 此外,英伟达还与PyTorch以及JAX开源社区展开了深度合作,推动各项优化成果在其人工智能产品矩阵中全面落地。在利用PyTorch原生训练栈TorchTitan运行DeepSeek-V3 671B模型时,Blackwell Ultra机架在没有任何初始优化的基础上实现了高达6倍的性能提升。JAX框架则取得了更为显著的增长,其速度飙升至每GPU 1025太洛普斯,单GPU吞吐量最高可达每秒4082个Token,相较于今年1月份的基准实现了10倍的性能飞跃。
l%@>)%LA
Qe<DX"
WMfu5x7e4
8d.5D&
to@ O
H/m -$;cF3 不仅如此,英伟达还在面向预训练的所有主流框架中,实现了从256到1024张GPU的世界级扩展性能。在达到1024张GPU的规模时,Megatron Core能够保持高达98.5%的扩展效率,而TorchTitan与JAX框架的扩展效率也维持在97%的水平。支撑这一卓越扩展表现的核心组件,正是集成在每个NVL72机架内部的英伟达800Gb/s横向扩展网络芯片。从模型训练到推理部署,英伟达正不断在人工智能领域树立全新标杆,而在鲁宾平台已经登场并带来更大性能增益的背景下,其他竞争对手无疑面临着不小的追赶压力。
bf]W_I]B