文/海峰看科技
過去兩年,超節點幾乎成了AI算力圈的頂流概念。但真正被它改寫命運的,可能不是大模型,而是那些安靜跑在機房里的成千上萬臺普通服務器。
如果說智算超節點是給AI打造的超級跑車,那通算超節點,則是讓成千上萬臺普通服務器也能跑上高速的關鍵引擎。而現在,一份白皮書想把這臺引擎,正式推出到公眾視野。
7月19日,在2026世界人工智能大會期間,由鵬城實驗室、全球計算聯盟聯合數十家產學研單位共同編制的《超節點定義與實踐白皮書》正式發布。
![]()
它最關鍵的一點,是沒有把超節點局限在智算領域,而是像一本通算架構升級指南,系統定義通算超節點的標準與實踐路徑,補上了通用計算架構升級的關鍵拼圖。
通算超節點不是對傳統通用計算的局部性能優化,而是一次底層邏輯的更新:它終結了延續二十年“以單臺服務器為資源邊界、靠橫向堆疊換取增長”的規模紅利邏輯,以全局資源池化與內存語義互聯,將數據流動效率確立為通用計算新的增長內核。
而鯤鵬超節點的規模化落地實踐,既是這一新范式的首個產業成熟樣本,也為通智融合時代的統一算力底座,完成關鍵的架構預演。
紅利見頂:通算架構破局,不是選擇題而是必答題
過去二十年,通用計算沿著Scale Out(橫向擴展)的分布式路線高速發展,簡單說,就是人多力量大——通過網絡將大量服務器連接成集群,靠堆疊算力支撐起云計算、大數據、互聯網的爆發。這在算力需求野蠻生長的年代,是成本最低、見效最快的方案。
但走到今天,這條路的天花板已經清晰可見。
從硬件層面看,傳統性能紅利早已觸頂。無論是單核主頻還是核心數量,提升幅度都變得像擠牙膏,單代CPU的性能增益十分有限。而成本端的壓力還在持續加碼:盡管每核成本隨工藝迭代持續下降,但內存成本始終居高不下,甚至進入快速上漲通道。
根據Counterpoint數據,64GB DIMM 內存價格從2025年第三季度到2026年第一季度已上漲3.5倍,預計到2026年第三季度累計漲幅將達5倍。算力增長疲軟疊加核心存儲成本大幅攀升,最終導致通用計算整體的投入產出比持續走低。
比硬件紅利消退更致命的是架構層面的瓶頸。
通用計算長期奉行分層解耦思路,這就像公司部門墻厚重,跨部門協作層層審批,數據在服務器節點間交互必須經過完整的網絡協議棧,多次拷貝、多次中斷,好比寄一個快遞,每經過一個中轉站都要開箱檢查、重新打包。而且集群規模越大,通信損耗占比越高,數據庫、大數據等場景的性能線性度下降,很多時侯新增的服務器算力都被通信開銷“吃掉了”。
真正把傳統架構邊界擊穿的,是新業務形態。
一方面是云虛擬化長期存在的頑疾:內存碎片化。就像停車場里總空位夠,但每輛車留下的零碎空隙無法再停一輛車,導致大量內存閑置浪費。
另一方面,生成式AI普及重構搜推廣等核心業務,長序列推理、大規模KV Cache(鍵值緩存)、跨容器高頻RPC(遠程過程調用)等需求,對數據流動效率提出的要求近乎苛刻。可以把RPC理解為外賣小哥在不同小區門禁之間反復穿梭,一旦路網不暢,訂單就會超時。
當核心矛盾從算力總量不夠變成數據流動效率不足,再靠堆疊服務器已無濟于事。
此時,打破傳統服務器的物理邊界,將高速互聯技術引入通用計算集群,構建全局池化的通算超節點,就成了破局的必由之路。
場景驗證:鯤鵬通算超節點的落地價值,都是真金白銀
按照《超節點定義與實踐白皮書》的明確定義,通算超節點以全局內存統一編址為核心特征,通過內存語義跨節點訪問與超高帶寬、超低時延互聯,將分散的通用服務器融合為邏輯一體的分布式緊耦合計算系統。而TaiShan 950 SuperPoD作為業界首個規模化落地的通算超節點,正是嚴格遵循上述架構標準打造的產業樣本。
之所以鯤鵬能率先拿出可落地的通算超節點方案,在于它既突破傳統服務器的架構邊界,又沒有走推倒重來的激進路線,是當前產業環境下可行性與先進性平衡得最好的路徑。
鯤鵬超節點的領先性主要體現在三個層面:一是全棧協同的性能優勢,從鯤鵬處理器指令集到openEuler操作系統與上層開源組件全棧打通,讓內存語義訪問、百納秒級低時延成為業務能調用的真實性能;二是平滑演進的落地優勢,保留標準服務器形態、兼容PCIe現有生態,無需大規模改造機房與重構業務代碼,拉低架構升級成本;三是面向未來的延展優勢,讓通算超節點具備向通智融合演進的能力,為后續承載其它業務筑牢底座。
可喜的是,在通用計算的幾大核心場景,鯤鵬超節點的價值已經得到驗證。
其一:搜推廣,從四級緩存瓶頸到全鏈路低時延躍升。
生成式推薦已成為電商廣告的核心升級方向,但傳統四級緩存架構層級復雜、遠端訪問時延高,疊加跨服務RPC通信損耗占比超30%,成為業務增收提效的核心瓶頸。
京東攜手華為基于鯤鵬超節點重構算力底座,依托靈衢互聯構建百TB級全內存KVCache共享資源池,全面替代傳統四級緩存;同時通過URMA技術旁路TCP協議棧,大幅削減容器間通信開銷。
經京東618大促實戰驗證,KVCache跨節點檢索TP99時延降低80%,RPC通信TP99時延降低40%,業務全鏈路時延整體縮短8%,釋放的時延余量可支撐更長用戶行為序列與更大參數模型落地,每優化1ms時延即可撬動數千萬元年營收增量。
其二:云虛擬化,從資源碎片化到全局彈性調度。
傳統云虛擬化受單服務器物理邊界限制,行業內存整體分配率普遍僅80%,資源碎片化、配比僵化等問題長期存在,既造成內存閑置浪費,也無法承載大內存高端業務。
鯤鵬通算超節點依托靈衢互聯獨有的超大帶寬與超低時延能力,實現跨節點內存借用與內存共享,通過全局內存池化給出系統性解法。
一是內存分配效率實現行業級躍升:內存整體分配率從行業常規的80%提升至95%。在當前內存價格持續走高的產業背景下,同等硬件投入下有效可調度內存容量提升近兩成,直接為客戶節省內存采購成本,顯著提升單柜資源的產出收益。
二是業務承載邊界大幅拓寬:突破單臺服務器3T物理內存的上限,可支撐最大6T的超大內存云實例,覆蓋EDA、金融量化等高價值高端場景,幫助客戶拓展商業空間。
其三:數據庫,從線性度瓶頸到多寫架構突破。
數據庫是對數據交互時延最敏感的通算場景。傳統架構跨節點事務同步要經過網絡協議棧,開銷占比最高超過33%,一寫多讀架構的線性度常不足70%。
鯤鵬通算超節點的全局內存池,可以構建跨節點的共享緩沖池,大幅減少磁盤IO;低時延的內存語義通信,能顯著加速日志同步和分布式事務處理;針對電商大促、游戲開服等寫密集場景,還能基于高速互聯實現多寫架構,消解單點瓶頸。
從落地數據來看,通算超節點可讓數據庫TP(事務處理)性能提升20%,AP(分析處理)性能提升50%,RTO(恢復時間目標)可從傳統30秒以上降至6秒以內,大幅提升系統可靠性。對金融、運營商等對數據庫穩定性和性能要求極高的行業帶來極大的價值。
在大數據與分布式存儲兩大底層基礎設施場景,鯤鵬通算超節點同樣釋放出明確的價值增益。大數據場景下,鯤鵬通算超節點依托內存彈性共享與高速互聯優化數據混洗效率,將集群資源利用率提升至60%,整體處理性能提升20%;分布式存儲場景中,鯤鵬通算超節點通過SSU(存儲服務單元)池化互聯打通跨節點存儲資源,將SSD帶寬利用率提升至60%,IOPS提升25%-35%,數據重構速度提升6倍,推動存儲架構向以數據為中心演進。
筆者觀察:鯤鵬超節點打造通算架構升級范本
在筆者看來,真正具備產業落地價值的通算超節點,必須同時滿足四大核心特質:分布式緊耦合架構、原生內存語義訪問、全局資源池化共享、體系化高可靠能力。這是通算超節點區別于傳統網絡優化的本質邊界,也是架構升級能否真正兌現效率紅利的核心標尺。
TaiShan 950 SuperPoD作為業界首個落地的通算超節點,完整契合上述標準。它保留通用服務器形態、全面兼容現有PCIe生態,依托靈衢互聯實現體系化能力突破:以全互聯直連拓撲構建緊耦合算力域,原生支持跨節點內存借用、共享與內存語義直訪;同時打通DPU、SSU等異構資源池化對等訪問,搭配單節點故障快速切換的高可靠設計,無需改造機房即可實現架構級效率躍升。
![]()
Agentic AI超節點參考架構
此次白皮書發布,是超節點技術從廠商實踐走向產業標準化的重要里程碑。它意味著超節點不再只是AI大模型的專屬方案,而是通用計算架構升級的通用路徑。鯤鵬作為通算超節點的先行探索者,其落地實踐已經驗證這條路線的可行性與商業價值。
硬件堆疊終有盡,架構生長自無涯。未來,隨著產業生態逐步完善與標準化持續推進,通算超節點有望從頭部客戶選擇變成主流配置,成為下一代通用算力基礎設施的標配。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.