本文來源:時代周報 作者:朱成呈
今年WAIC,“超節點”在現場火了。
走進世博展覽館,華為、阿里巴巴、百度、中興通訊、中科曙光、天數智芯、沐曦股份、摩爾線程等國產算力廠商,幾乎都把各自最新的超節點產品擺在展臺最顯眼的位置。
一排排沒有屏幕的黑色機柜,成為最引人關注的展品之一。
![]()
真武M890×磐久AL128超節點 時代周報記者攝
時代周報記者注意到,中科曙光帶來全國產十萬卡AI超集群"曙光8000(登峰)",阿里巴巴展示"真武M890×磐久AL128超節點",中興通訊推出OEX超節點,百度帶來天池512超節點,沐曦股份展示曦景S600超節點,壁仞科技發布支持1024卡Scale-up擴展的下一代NPO光互連分布式解耦架構超節點,華為則首次線下展示1024卡昇騰950超節點真機。
這些外觀并不起眼的黑色機柜前,許多觀眾舉著手機排隊拍照,不少廠商甚至安排機器人在機柜旁互動,讓原本冰冷的算力設備成為展會"打卡點"。
這種變化并非偶然。過去幾年,AI產業競爭更多集中在單顆芯片的算力、功耗和制程;而隨著大模型訓練和推理邁入萬卡、十萬卡時代,行業開始意識到,僅有高性能芯片已經不足以支撐模型持續擴張。如何將數百、數千甚至上萬張AI卡高效連接,并通過網絡、軟件和調度系統充分釋放集群性能,正成為新的競爭重點。
換句話說,AI產業競爭正逐漸從芯片本身,轉向芯片之上的系統能力。
這一趨勢同樣體現在大會官方評選中。今年WAIC三項"鎮館之寶"均與超節點相關,分別為中科曙光AI超集群"曙光8000(登峰)"、阿里巴巴"真武M890×磐久AL128超節點"以及中興通訊"OEX超節點"。
在業內人士看來,這不僅意味著幾款產品獲得認可,更意味著國產AI算力競爭正在進入新的階段。
"隨著大模型加快進入各類業務場景,算力需求正從訓練進一步擴展至推理和邊端計算。峰值性能仍是重要指標,但產品的實際表現,越來越取決于芯片、軟件、集群和應用之間的協同效率。"天數智芯副總裁鄒翾在WAIC期間表示。
“單卡時代”過去了?
如果說過去AI產業競爭比拼的是發動機,那么如今比拼的更像是一整套動力系統。
隨著模型參數規模持續增長,先進大模型訓練往往需要數萬張GPU協同運行。此時,真正影響訓練效率的,不再只是單顆GPU性能,而是整個系統如何組織這些GPU完成高效協同計算。
![]()
曦景S600超節點 時代周報記者攝
業內通常將通過高速互連,將數百甚至上千張AI卡組織成統一計算資源池的系統稱為"超節點"。例如,摩爾線程MTT C256 超節點,就是用一層scale-up網絡把256張GPU變成一臺數據中心級計算機。
不過,超節點遠非簡單地將大量GPU堆疊在一起。一名摩爾線程現場工作人員向時代周報記者表示,“我們通過高效液冷散熱、三盲插設計、完善的RAS機制和集群管理系統,來保障超節點在大規模部署下的穩定性和可維護性。這是基于真實萬卡級訓練經驗沉淀下來的產品化能力,而非單純的概念堆砌。”
不同廠商也在嘗試不同的系統方案。天數智芯現場工作人員向時代周報記者稱,天數超節點面向大模型訓練與高并發推理場景,以國產通用GPU為核心,實現144芯高速全互聯,通過高帶寬互聯、統一資源調度和軟硬件協同優化,提供穩定、可靠、可擴展的高質量算力。
阿里云現場方面,一名工作人員則表示,磐久AL128超節點服務器是阿里云面向AI大模型時代打造的硬件基座,單柜集成128顆芯片,通過自研ALink互連架構,最大化GPU集群的協同計算效率。
在摩爾線程高級副總裁董龍飛看來,超節點要解決的是在一個大的系統里,如何把一個更大的模型,更大的上下文窗口放進來,還可以更快的推理出來。因為推理的速度慢了之后,調用工具就非常慢,超節點主要是為解決這個問題。
業內人士呼吁算力產業開放
相比單顆芯片,超節點競爭涉及的環節更多,也更加依賴產業鏈協同。
天數智芯副總裁宋煜認為,對通用GPU而言,實驗室指標能夠反映部分性能,但客戶業務中的長期運行,更能檢驗產品在復雜負載和系統協同下的實際能力。算力能否轉化為效率改善、成本下降和資源利用率提升,是衡量其產業價值的重要標準。
這意味著,行業評價標準也正在發生變化。
過去,人們關注TOPS、TFLOPS等芯片參數;如今,更關注訓練吞吐率、網絡時延、GPU利用率、集群穩定性以及整體擁有成本等系統指標。
由于一套成熟的超節點涉及芯片、交換網絡、光互連、液冷、軟件平臺等多個環節,僅依靠一家企業已很難完成全部能力建設,開放生態因此成為國產算力發展的另一條主線。
![]()
中興OEX超節點 時代周報記者攝
今年WAIC期間,中興通訊聯合壁仞科技、沐曦股份、燧原科技、天數智芯等合作伙伴,共同推出基于OEX+dOCS架構的國產高性能Matrix超節點,正是這一趨勢的體現。
曦智科技創始人、董事長沈亦晨認為,當前最亟需補強的,是在龐大算力產業鏈中構建真正開放的產業生態,使計算、存儲、交換、軟件、應用等各環節的優秀企業最大化發揮各自優勢,共同驅動中國算力基礎設施的升級。
如果說芯片時代,比拼的是單點技術突破,那么系統時代,比拼的則是整個產業鏈的協同能力。
而超節點,也只是更大規模AI基礎設施的起點。
“超節點更多是一個高密度的計算單元,把大量AI加速卡通過高速互連組織在一起,相當于把一臺‘超級服務器’做得更強。”一名中科曙光技術工程師向時代周報記者解釋,而超集群是在超節點基礎上,通過高速網絡把成百上千個超節點連接起來,實現十萬卡級資源統一調度和協同運行,是一個完整的AI基礎設施系統。
該技術工程師進一步指出,真正的挑戰不在節點內部,而在節點之間。隨著集群規模從千卡、萬卡走向十萬卡,跨節點通信會成為影響訓練效率和系統穩定性的關鍵因素。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.