快科技7月22日消息,英偉達宣布Blackwell GB300刷新MoE預訓練世界紀錄。使用256塊GPU訓練DeepSeek-v3 671B模型,每GPU吞吐達1648 TFLOPs。
相比去年11月的1088 TFLOPs,GB300性能優化提升50%。與上一代GB200的606 TFLOPs相比,實現了約3倍的性能躍升。
![]()
![]()
這一成績來之不易。英偉達在過去6個多月模擬了超過25萬種配置,為Blackwell摸索出38項重大優化方案,累計進行了140萬小時的GPU測試。
![]()
需要提及的是,MoE即混合專家模型,將大模型分割為多個專家子網絡。每次推理或訓練僅激活其中一部分,以更低計算成本實現更大模型容量,是當前大語言模型的主流架構。
![]()
GB300 NVL72用更少的GPU硬件就達到相同訓練性能。這意味著AI訓練成本將進一步下降,對大模型廠商是實實在在的利好。
英偉達表示通過系統級優化的持續挖掘,Blackwell架構仍有性能提升空間。這輪優化成果將直接惠及所有使用GB300的AI訓練集群。
對DeepSeek這類大模型廠商而言,GB300帶來的算力提升意味著更短訓練周期和更低成本。1648 TFLOPs的單GPU算力足以支撐更大規模模型的快速迭代。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.