
在新一代Rubin架构平台逐步推进落地的背景下,英伟达现役Blackwell架构AI硬件依旧保持强劲性能迭代节奏。旗下Blackwell GB300与GB200 GPU凭借持续的软件优化与技术打磨,持续领跑各类AI算力负载任务,其中GB300平台再度突破性能上限,成功刷新混合专家模型(MoE)预训练领域的全球算力纪录,持续夯实英伟达在高端AI训练市场的主导地位。
尽管行业目光逐步聚焦英伟达全新Rubin架构,但已经大规模部署于全球数据中心的Blackwell系列,延续了上代Hopper架构的迭代优势,依靠持续的软件生态升级不断释放硬件潜能。英伟达官方披露,团队针对Blackwell平台开展了大规模系统性优化,在短短三个月内,依托同一套GB200 NVL72硬件配置运行DeepSeek R1 0528 - 1K/1K负载任务,将系统每兆瓦吞吐量提升至原先的4倍。

此次性能飞跃源自海量技术迭代积累,英伟达累计模拟测试超25万种硬件配置方案,为Blackwell平台落地38项核心重大优化,整体测试算力投入高达140万个GPU运行小时。值得关注的是,本次超90%的优化成果具备高度通用性,可广泛适配各类AI模型训练场景,体现出英伟达对现役成熟AI平台的持续深耕与长期技术投入。
定位高端旗舰的Blackwell Ultra GB300平台,成为本次算力突破的核心载体,在大模型预训练领域交出标杆级性能表现。在256卡GPU集群运行DeepSeek-V3 671B超大模型的测试场景中,依托Megatron Core核心架构,GB300单GPU算力峰值达到1648 TFLOPs(太洛普斯),相较上代GB200平台606 TFLOPs的单卡性能,实现近三倍跨越式提升。借助GB300 NVL72系统的超强算力,同等规模的大模型预训练任务,仅需更少硬件集群即可达成目标性能,大幅降低超算部署成本与资源消耗。同时,该套系统在过去六个月的持续优化迭代中,整体性能再度提升1.5倍,迭代潜力持续释放。




英伟达通过深度联动主流开源框架生态,全方位释放Blackwell平台硬件实力。官方深度携手PyTorch、JAX两大主流开源社区,推动全系优化成果全面落地适配。基于PyTorch原生训练栈TorchTitan运行DeepSeek-V3 671B模型时,Blackwell Ultra机架无需初始专项优化,即可实现6倍的性能提升;而JAX框架的优化效果更为突出,单GPU算力峰值突破1025 TFLOPs,单卡Token吞吐量最高可达每秒4082个,相较今年1月基准性能实现10倍飞跃。
除单卡性能突破外,Blackwell平台的大规模集群扩展能力同样达到行业顶尖水平。目前该平台已实现主流预训练框架下256卡至1024卡的世界级高效扩展,多卡协同稳定性拉满。其中1024卡超大规模集群场景下,Megatron Core扩展效率高达98.5%,TorchTitan与JAX框架的集群扩展效率也稳定维持在97%的高位水准。
强悍的集群扩展能力,得益于NVL72机架内置的英伟达800Gb/s高速横向扩展网络芯片,通过极致的网络传输效率,有效降低多卡协同损耗,保障超大集群算力高效释放。从模型预训练到实际推理部署,英伟达持续刷新AI算力行业标杆。即便全新Rubin平台即将登场,Blackwell系列的持续性能突破,也进一步拉高了行业算力门槛,让竞品面临更大的技术追赶压力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“早讯网”用户上传并发布,本平台仅提供信息存储服务。
本站所有图片由云图床提供储存服务。

发表评论 取消回复