文/海峰看科技
當(dāng)我們談?wù)揂I時(shí),目光總是不自覺地投向GPU的算力參數(shù)、大模型的參數(shù)量級(jí),卻常常忽略了一個(gè)決定AI集群真實(shí)效能的關(guān)鍵因素--網(wǎng)絡(luò)。在AIGC全面爆發(fā)、大模型加速落地的今天,沒有高性能的智算網(wǎng)絡(luò),再強(qiáng)的GPU集群也只是一堆孤立的計(jì)算單元。
為什么很多企業(yè)砸下重金建設(shè)的智算集群,規(guī)模上去了但實(shí)際訓(xùn)練效率卻跟不上?為什么網(wǎng)絡(luò)故障會(huì)成為大模型訓(xùn)練中最拖后腿的因素?帶著這些問題,讓我們一起看看聯(lián)想如何將網(wǎng)絡(luò)從數(shù)據(jù)搬運(yùn)工打造成算力放大器。
算力狂飆時(shí)代,網(wǎng)絡(luò)才是真正的天花板
過去三年,AIGC帶來了算力需求的指數(shù)級(jí)增長。從千億參數(shù)的通用大模型到萬億參數(shù)的行業(yè)垂類模型,從AI推理的規(guī)模化落地到科學(xué)計(jì)算的復(fù)雜運(yùn)算,智算中心已經(jīng)從可選建設(shè)變成了數(shù)字經(jīng)濟(jì)的剛需基建。
一組數(shù)據(jù)足以說明市場(chǎng)的火爆程度:2021-2026年,中國200G/400G以太網(wǎng)交換機(jī)市場(chǎng)規(guī)模年復(fù)合增長率高達(dá)51%,從2021年的4.4億元將快速增長至2026年的47.9億元,五年增長近11倍。
這背后,是數(shù)據(jù)中心流量結(jié)構(gòu)的根本性變化--東西向流量(數(shù)據(jù)中心內(nèi)部服務(wù)器之間的橫向數(shù)據(jù)傳輸,區(qū)別于用戶訪問服務(wù)器的南北向流量)占比超過85%,傳統(tǒng)網(wǎng)絡(luò)架構(gòu)早已不堪重負(fù)。
所以智算網(wǎng)絡(luò)必須滿足四大核心要求:高帶寬、低時(shí)延、低成本、高密度。簡(jiǎn)單來說,網(wǎng)絡(luò)是架構(gòu)基礎(chǔ),網(wǎng)絡(luò)越強(qiáng),算力才越強(qiáng);算力越強(qiáng),AI回報(bào)越高。然而,現(xiàn)實(shí)情況卻不容樂觀。Meta公布的OPT-175B模型訓(xùn)練日志顯示,在56天的訓(xùn)練周期里,出現(xiàn)了50多次斷點(diǎn),最長的3次連續(xù)訓(xùn)練時(shí)間只有2.8天、2天和1.5天,訓(xùn)練業(yè)務(wù)故障平均間隔時(shí)間僅3天。而在Llama3的訓(xùn)練中,16K H100 GPU在54天的預(yù)訓(xùn)練過程中發(fā)生了419次意外故障,平均每3小時(shí)就有一次中斷。
更值得關(guān)注的是,雖然網(wǎng)絡(luò)故障只占所有故障的10%左右,但網(wǎng)絡(luò)故障的恢復(fù)時(shí)間卻是最長的。上海AI LAB發(fā)表在NSDI 24(網(wǎng)絡(luò)系統(tǒng)領(lǐng)域頂級(jí)學(xué)術(shù)會(huì)議)的論文指出,GPU服務(wù)器相關(guān)故障占比高,但網(wǎng)絡(luò)故障一旦發(fā)生,往往需要數(shù)小時(shí)甚至數(shù)天才能恢復(fù),對(duì)訓(xùn)練進(jìn)度的影響最為致命。
這正是當(dāng)前智算建設(shè)中普遍存在的剪刀差現(xiàn)象:企業(yè)投入巨資購買了最先進(jìn)的GPU,卻因?yàn)榫W(wǎng)絡(luò)瓶頸導(dǎo)致算力利用率不足30%。AI時(shí)代的算力競(jìng)爭(zhēng),本質(zhì)上是網(wǎng)絡(luò)效率的競(jìng)爭(zhēng)。真正卡住集群效率的,往往是看不見的網(wǎng)絡(luò)延遲與穩(wěn)定性。
硬核技術(shù)創(chuàng)新,破解智算網(wǎng)絡(luò)卡脖子難題
面對(duì)智算網(wǎng)絡(luò)的諸多挑戰(zhàn),聯(lián)想通過多年技術(shù)積累,持續(xù)打造從硬件到軟件的全棧解決方案。
依托IB網(wǎng)絡(luò)與以太網(wǎng)雙架構(gòu)并行的完整硬件產(chǎn)品矩陣,聯(lián)想打造出端到端一體化的智算網(wǎng)絡(luò)全棧方案,覆蓋從服務(wù)器、存儲(chǔ)、數(shù)據(jù)網(wǎng)絡(luò)到統(tǒng)一管控平臺(tái)的完整鏈路,能夠按需適配不同規(guī)模的算力集群,支持快速部署、開箱即用,全面覆蓋AI訓(xùn)練、訓(xùn)推一體、HPC科學(xué)計(jì)算等多元業(yè)務(wù)場(chǎng)景。
在多機(jī)互聯(lián)的產(chǎn)品布局上,聯(lián)想雙架構(gòu)并行的模式可充分匹配不同算力集群的建設(shè)需求:AI/HPC服務(wù)器側(cè)形成了全場(chǎng)景產(chǎn)品陣列,包含聯(lián)想問天 WA7780 G3 AI大模型訓(xùn)練服務(wù)器、聯(lián)想問天 WA5480 G3 AI訓(xùn)推一體服務(wù)器等,覆蓋從大規(guī)模訓(xùn)練到輕量化推理的全場(chǎng)景計(jì)算需求;數(shù)據(jù)網(wǎng)絡(luò)交換機(jī)側(cè)則搭建了梯度完整的交換機(jī)組網(wǎng)體系,涵蓋400G/800G IB網(wǎng)絡(luò)交換機(jī)、400G核心交換機(jī)、100G匯聚交換機(jī)等多檔位產(chǎn)品,可靈活支撐從幾十張卡到上萬張卡的不同規(guī)模集群組網(wǎng)。
本次重磅發(fā)布的新一代旗艦AI交換機(jī)--聯(lián)想問天 NE8780-128QC2XS,正是這套全棧解決方案能力最核心的硬件載體。該產(chǎn)品搭載博通最新5nm工藝Tomahawk5芯片,交換容量高達(dá)102.4Tbps,包轉(zhuǎn)發(fā)率達(dá)21000Mpps,性能較上一代產(chǎn)品翻倍。其配備128個(gè)400G端口+2個(gè)10G SFP+專用監(jiān)控端口,解決傳統(tǒng)千兆帶外端口無法滿足智算場(chǎng)景精細(xì)化運(yùn)維采樣需求的痛點(diǎn),在8K規(guī)模組網(wǎng)中可大幅減少交換機(jī)設(shè)備投入,有效降低智算中心的整體組網(wǎng)建設(shè)成本與日常運(yùn)維復(fù)雜度。
![]()
在完整的產(chǎn)品矩陣與核心硬件能力之上,聯(lián)想還通過三大核心技術(shù)創(chuàng)新,從根本上破解了智算網(wǎng)絡(luò)的性能與穩(wěn)定性難題。
首先,負(fù)載均衡:讓每一條高速公路都跑滿。傳統(tǒng)的ECMP(等價(jià)多路徑路由,傳統(tǒng)網(wǎng)絡(luò)中最常用的負(fù)載均衡技術(shù))負(fù)載均衡就像紅綠燈,只能根據(jù)目的地粗略分流,很容易出現(xiàn)一條路堵死,另一條路空著的情況。為了解決這個(gè)問題,聯(lián)想經(jīng)歷了三代技術(shù)演進(jìn):
- 一是RALB(逐包負(fù)載均衡技術(shù)),逐包負(fù)載加網(wǎng)卡亂序重組,就像把一輛大卡車拆成多個(gè)小包裹分別運(yùn)輸,到達(dá)目的地后再重新組裝,但這種方式依賴網(wǎng)卡的特殊能力,適用范圍較窄;
- 二是AILB(端口級(jí)路徑規(guī)劃負(fù)載均衡技術(shù)),端口級(jí)的路徑規(guī)劃,等于提前給每輛車規(guī)劃好固定路線。在交通流量固定的情況下效率很高,但如果路線突然變化,就容易出現(xiàn)擁堵;
- 三是ENLB(端網(wǎng)協(xié)同負(fù)載均衡技術(shù)),端網(wǎng)協(xié)同的負(fù)載均衡,這是聯(lián)想目前最先進(jìn)的方案。它結(jié)合前兩種技術(shù)的優(yōu)點(diǎn),先把單個(gè)網(wǎng)卡的流拆成多個(gè)QP(隊(duì)列對(duì),RDMA 遠(yuǎn)程直接內(nèi)存訪問通信的基本單位),再通過交換機(jī)的特殊算法進(jìn)行智能散列。
ENLB就像一個(gè)智能交通指揮系統(tǒng),能夠?qū)崟r(shí)根據(jù)路況調(diào)整車流。測(cè)試數(shù)據(jù)顯示,在64M~512M數(shù)據(jù)量區(qū)間,ENLB的性能比傳統(tǒng)AR(自適應(yīng)路由)方案快10%。更重要的是,當(dāng)4條上行鏈路中斷1條時(shí),Allreduce(分布式訓(xùn)練中最核心的集合通信操作,用于所有GPU之間同步梯度數(shù)據(jù))帶寬僅下降13%,而傳統(tǒng)方案會(huì)下降50%以上。
其次,雙平面組網(wǎng):打造永不堵車的算力大動(dòng)脈。聯(lián)想采用了IB(InfiniBand,一種專為高性能計(jì)算設(shè)計(jì)的低延遲高速網(wǎng)絡(luò))網(wǎng)絡(luò)與以太網(wǎng)并存的異構(gòu)互聯(lián)架構(gòu),能夠完美適配從幾十張卡的小規(guī)模推理集群到上萬張卡的大規(guī)模訓(xùn)練集群。在此基礎(chǔ)上,聯(lián)想推出雙平面組網(wǎng)技術(shù),相當(dāng)于在城市里修建了兩條平行的高速公路,平時(shí)分流行駛,一條路出現(xiàn)故障時(shí),另一條路可以立即接管全部流量。
更令人驚喜的是聯(lián)想的ARP(地址解析協(xié)議,用于將IP地址轉(zhuǎn)換為MAC物理地址)鏡像去堆疊技術(shù)。傳統(tǒng)的堆疊技術(shù)需要兩臺(tái)交換機(jī)之間用專用線纜連接,浪費(fèi)了寶貴的端口資源。而聯(lián)想的技術(shù)無需修改服務(wù)器內(nèi)核,也不需要交換機(jī)之間的物理連接,就能實(shí)現(xiàn)網(wǎng)卡端的高可靠接入。這不僅讓二級(jí)組網(wǎng)的規(guī)模翻倍,還降低了40%的組網(wǎng)成本。
最后,端側(cè)逃生:秒級(jí)恢復(fù),讓訓(xùn)練永不中斷。大模型訓(xùn)練動(dòng)輒需要數(shù)周時(shí)間,一次意外中斷就可能導(dǎo)致幾天的算力白費(fèi)。聯(lián)想的端側(cè)逃生技術(shù)徹底解決了這個(gè)痛點(diǎn),它會(huì)提前為每條通信路徑計(jì)算好備用路線,一旦主路徑出現(xiàn)故障,能夠在秒級(jí)內(nèi)自動(dòng)切換到備用路徑,上層應(yīng)用完全無感知。
以前網(wǎng)絡(luò)故障需要幾十分鐘甚至幾小時(shí)才能恢復(fù),現(xiàn)在只需要幾秒鐘。通過這項(xiàng)技術(shù),網(wǎng)絡(luò)導(dǎo)致的訓(xùn)練中斷率降低了90%以上。
全生命周期服務(wù),讓AI落地不再有門檻
再好的技術(shù)和產(chǎn)品,最終都要通過服務(wù)落地。聯(lián)想的交鑰匙工程和全生命周期服務(wù)能力,展示聯(lián)想如何通過服務(wù)與硬件的協(xié)同,幫助企業(yè)快速、低成本落地AI應(yīng)用。
聯(lián)想打造了全國最大的智能化服務(wù)交付體系:24000多名認(rèn)證工程師覆蓋全國1-6級(jí)城市,北京、上海兩大核心備件庫加上1400多個(gè)前置備件庫,能夠?qū)崿F(xiàn)7×24小時(shí)響應(yīng)。無論是貴州、甘肅還是內(nèi)蒙的偏遠(yuǎn)數(shù)據(jù)中心,聯(lián)想工程師都能在最短時(shí)間內(nèi)到達(dá)現(xiàn)場(chǎng)。
- 在部署效率方面,聯(lián)想的智能運(yùn)維系統(tǒng)將千卡集群的交付時(shí)間從3周縮短到1天。通過配置自動(dòng)化、自動(dòng)巡檢和自動(dòng)驗(yàn)收,實(shí)現(xiàn)設(shè)備0配置上線,大大降低部署門檻和人為錯(cuò)誤;
- 在運(yùn)維方面,聯(lián)想的智能運(yùn)維平臺(tái)基于Telemetry(遙測(cè)技術(shù),一種實(shí)時(shí)、高精度的網(wǎng)絡(luò)數(shù)據(jù)采集技術(shù))技術(shù)實(shí)現(xiàn)了秒級(jí)遙測(cè),能夠?qū)崟r(shí)監(jiān)控設(shè)備、接口、隊(duì)列甚至流級(jí)別的狀態(tài)。通過AI算法進(jìn)行故障預(yù)測(cè)和根因分析,將故障定位時(shí)間從原來的6-12小時(shí)縮短到3分鐘。
智算網(wǎng)絡(luò),AI競(jìng)爭(zhēng)的下半場(chǎng)
智算網(wǎng)絡(luò)不只是算力的配套設(shè)施,也是釋放AI生產(chǎn)力的高速引擎。從聯(lián)想問天系列交換機(jī)的硬件迭代,到ENLB、雙平面組網(wǎng)等技術(shù)突破,再到覆蓋全生命周期的服務(wù)交付體系,聯(lián)想把網(wǎng)絡(luò)從被動(dòng)的數(shù)據(jù)搬運(yùn)通道,變成了主動(dòng)的算力放大器,并幫助客戶解決了集群利用率低、訓(xùn)練不穩(wěn)定、部署運(yùn)維難的核心痛點(diǎn)。
隨著智能體時(shí)代全面到來,行業(yè)大模型、多模態(tài)應(yīng)用將進(jìn)一步爆發(fā),智算網(wǎng)絡(luò)也會(huì)向更高帶寬、更低時(shí)延、更智能運(yùn)維的方向持續(xù)演進(jìn)。面向未來,聯(lián)想將持續(xù)深耕智算網(wǎng)絡(luò)領(lǐng)域,依托全棧方案能力與全域服務(wù)體系,賦能各行業(yè)AI應(yīng)用落地,攜手產(chǎn)業(yè)伙伴共建智能體時(shí)代的高效算力底座。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.