允中 發自 凹非寺
量子位 | 公眾號 QbitAI
這幾天,全網被WAIC“霸屏”,從具身智能到國產算力,這場一年一度的AI盛典,同樣吸引了科技圈所有目光。
今年WAIC堪稱是國產芯片和算力企業的斗秀舞臺,108款芯片、超200款智算產品齊聚上海。除了全員大集合外,我們還看的一個明顯的變化:
過去各家比的是”我這顆芯片算力多少”,單卡性能多么牛;而今年,提到最多的是“系統創新”與“高效協同”。換言之,單卡比拼的時代已落下帷幕,大規模計算系統性能的較量即將開啟。
算力芯片群星閃耀,我們也發現了一顆“不走尋常路”的新星(芯)。
浦東張江,太初(杭州)集成電路有限公司(“太初元碁”)展位里外圍滿了人,拋開展位處于主通道上的地理位置不談,更吸引目光的,是一臺大型超節點集群,號稱“超智融合”的計算系統,旁邊剛揭幕的自研芯片——標簽寫著:異構眾核,雙模設計。
![]()
先拼架構,再談單卡
“算力產業已從單卡性能比拼進入系統級競爭階段。”太初元碁CEO楊晉喆如是說。
這話不是場面話。模型參數突破萬億級,Agent和AI4S對CPU-GPU協同的要求越來越高,單純堆算力的邊際收益正在遞減。降低單位算力成本,才是當下真正的核心命題。
這個判斷與整個行業的演進方向一致。今年WAIC上,華為展出了Atlas 950 SuperPoD超節點,沐曦發布“曦景”S系列超節點,阿里平頭哥也拿出了真武M890×磐久AL128超節點。
國盛證券在近期研報中直接點明:國產超節點迎來量產元年,算力競爭范式正從單點峰值性能全面轉向系統級全棧效率的比拼。
![]()
太初元碁給出的技術答案是HCU異構融合計算架構。核心思路是把CPU和AI算力核放在同一條高速總線上,支持M:N可重構配比——CPU負責Agent調度和數據預處理,XPA算力陣列專注大模型推理計算,再配合共享分級存儲,實現冷熱數據動態調度。
翻譯成大白話:一塊芯片里塞了兩類“大腦”,一個管調度協調,一個管高強度計算,兩者還能按需調配比例。這種設計的好處在于,面對不同負載時不用“大炮打蚊子”,也不用“小馬拉大車”,算力分配可以動態匹配。
為什么異構眾核成了必選項?
這得從Agentic AI時代的算力需求變化說起。
傳統AI訓練和推理集群通常采用“單路CPU搭配4至8顆GPU”的固定配置,CPU長期充當算力宿主,僅負責任務下發、數據調度與GPU資源托管。
進入Agentic AI智能體時代,智能體需要自主完成任務拆解、工作流編排、外部工具調用、長期記憶管理全閉環運行,CPU在規劃、決策、交互類通用計算中的算力權重與負載占比出現結構性顯著提升。
AMD CEO蘇姿豐在2026年Q1財報電話會上透露,單個計算節點中CPU與GPU的數量正從過去的一對多,逐步趨近一比一,未來甚至可能出現CPU數量多于GPU的情況。
阿里云的判斷也類似:Agent“有狀態調度+無狀態執行”的混合模式,對資源精細化管控提出了更高要求,算力系統的優化重心正全面由單卡峰值性能轉向CPU-GPU的高效協同。
太初元碁的HCU架構,本質上是在芯片層面提前響應了這個趨勢。把CPU和AI核放在同一條高速總線上,相比傳統“CPU+獨立加速卡”的分離架構,I/O損耗更低,協同效率更高。
一顆芯片可打兩份工
基于HCU架構,太初元碁發布了新一代國產AI自研芯片T2 Ultra。最值得看的正是它的雙模式設計。
T2 Ultra有兩種工作模式:自主計算模式下,芯片可以獨立承擔完整計算任務;加速模式下,則配合主機協同工作。
這意味著同一顆芯片,既能作為獨立算力節點部署在邊緣或中小規模場景,也能作為加速卡插進大型集群里當”算力引擎”。
具體再看T2 Ultra的性能參數,HPC算力(FP64)為38 TFLOPS,可滿足科學計算需求;FP4算力則高達4800 TFLOPS(稀疏算力),FP16算力1200 TFLOPS(稀疏算力)應對各種AI訓推場景,原生支持FP64至FP4、實現全精度覆蓋。
對于客戶來說,這種靈活性的實際價值在于:不用為不同場景采購不同硬件,一套芯片體系覆蓋多種部署需求,采購和運維成本都能壓下來。
在國產AI芯片普遍面臨“量產難、落地更難”的當下,能不能讓客戶用得起來、用得起,比紙面參數重要得多。
不只是跑大模型
如果說T2 Ultra是“心臟”,那元碁HyperIntelliX超智融合計算系統就是整個“身體”,定位為面向 AI+AI4S 的全國產智算+超算融合計算平臺。
![]()
值得注意的是,HyperIntelliX不只是跑大模型,同樣也能在AI4S領域發揮價值。針對AI4S領域,太初元碁同步披露了相關落地成果:
全球氣象預測可視化系統、TecoQSim量子經典模擬器、大規模虛擬藥物篩選——覆蓋氣象、量子計算、生物醫藥三個方向。
多數國產AI芯片目前還停留在“跑通大模型推理”的階段,能同時支撐AI和AI4S雙線任務的平臺并不多見。
![]()
這個定位有其行業背景。AI4S(AI for Science)對算力的需求與純AI推理不同:科學計算通常需要高并發、大吞吐、長時任務,且對雙精度計算能力有硬性要求。
太初元碁團隊有三次獲得高性能計算領域國際最高獎項“戈登·貝爾獎”的積淀,在超算領域的經驗為其切入AI4S提供了技術底氣。
生態遷移:國產芯片真正的硬骨頭
俗話說“是騾子是馬,拉出來遛一遛”,硬件再強,也得有人用,才能談得上“可用”,進而朝“好用”轉變。
太初元碁WAIC期間發布了兩款生態產品,直指國產芯片最頭疼的“遷移成本”問題。
人工智能開發者社區2.0完成了對Megatron-LM、DeepSpeed、飛槳PaddleHelix、PyTorch、vLLM等主流訓練與推理框架的適配,提供從模型分析、遷移、算子開發到性能優化、精度調試的全流程工具鏈。
![]()
新一代國產AI4S計算平臺,針對科學計算高并發、大吞吐、長時任務的特點做了專項優化。
這個自主研發的一站式科研創新平臺,面向氣象預測、生物醫藥、量子力學、化學材料、流體力學等前沿科學領域,全面兼容龍芯、申威、飛騰、x86等國內外主流CPU,提供自研編程模型和涵蓋通用算子與科學計算專用加速庫。
同時深度適配 PyTorch、JAX、飛槳、MindSpore 等主流框架,并配套 DevKit 開發套件,支持算子生成、編譯優化與性能分析,有效降低算子開發門檻與性能調優難度。
![]()
依托平臺軟硬協同的全棧能力,太初元碁與清華大學、湖南大學、山東大學、百度、東潤等高校和行業伙伴展開深度合作,在氣象預報、量子模擬、基因分析、材料仿真、流體計算等領域打造一系列高效、精準的科研解決方案,助力科研與產業級科學計算高效落地,實現以中國芯,解科學題。
太初元碁的邏輯很清楚:芯片是入場券,生態才是護城河。
這個判斷切中了國產芯片的共性痛點。當前主流框架和算子庫深度綁定CUDA生態,模型向國產算力遷移流程復雜、開發成本高、周期長。行業調研顯示,完整適配周期約需3-6個月,其中約60%的工作量集中在性能調優階段。
國產芯片生態建設目前分為兩大路線:一條是主打GPGPU路線,追求與英偉達的CUDA兼容,如寒武紀通過自研Bangware軟件棧實現CUDA兼容,遷移成本降低約70%;另一條是以華為MindSpore為代表的自主生態,試圖在英偉達生態圈外建立獨立生態圈。
太初元碁的路線更接近前者,通過多元化開發范式支持PyTorch、vLLM等主流框架快速遷移,滿足80%-90%主流場景適配需求。
進一步深挖其長期以來在國產化生態搭建方面的嘗試,我們發現,不管是公開信息顯示的累計超40款AI大模型的即發即適配,還是太初元碁聯合百余所高校、科研機構、企業等推動算力落地——
例如與清華大學研發Teco-QSim量子經典模擬器;攜手量旋科技,打造“量子-超算-智算”超智融合平臺;率先完成清醒異RiverONE模型適配及龍芯平臺驗證;為清華大學智能產業研究院AtomWorld 原子世界模型提供512節點全液冷架構的硬件基礎;與百度螺旋槳、神威數智團隊成功復現AlphaFold3模型;聯合湖南大學發布首個顯式建模DNA雙鏈動態交互的基因組語言模型CrossDNA;與山東大學高性能計算團隊完成分子對接方法優化,構建大規模藥物篩選全流程方案;聯合百度飛槳為百家企業提供 AI for Science端到端方案;聯合百度科學計算團隊打造國產氣象一體機,支持逐時動態推演與臺風路徑軌跡精準識別;與東潤環能達成戰略合作,實現訓練吞吐與推理QPS的雙提升;深度適配上海人工智能實驗室的書生Intern-S1 AI4S多模態大模型,并聯合開展AI4S生態賽事等等。
都直接指向一個核心問題:生態不斷加碼擴容。
![]()
聊完技術底層講安全
由河南空港智算中心、瑞萊智慧、太初元碁、安勢信息、清源智契、典樞科技、數安信七家單位聯合打造的全域大模型安全系統,同步在WAIC發布。
![]()
瑞萊智慧CTO徐世真現場拆解了整套框架:底層是國產可信算力底座,核心是一體化大模型安全評測治理平臺,上層構建大模型安全測評、數據合規、數據安全、軟件供應鏈安全等多種安全系統,頂層配套獨立AI安全教育實訓中心。
這看起來像是“補丁式”的安全附件,但在當前的行業語境下,它可能是整場發布會中最務實的一環。大模型正在加速進入政務、金融、醫療等敏感領域,安全問題不是“要不要做”的問題,而是“不做就沒法落地”的硬門檻。
看似斗秀 實為國產算力的一次大考
WAIC 2026與其說是一次國產算力“百花斗艷”舞臺,不如將其看成面向國產算力的一次大考。而當我們把太初元碁的發布放在整個國產芯片版圖里看,會更清晰一些。
華為昇騰950PR已經量產,FP4精度算力達1.56PFLOPS,2026年出貨目標上調至150-200萬顆;寒武紀思元590在DeepSeek推理場景中效率已超越H20,2025年全年營收64.97億元,同比增長453%;沐曦股份登陸科創板,市值一度突破2800億元;海光信息深算DCU已與365款主流大模型適配。
太初元碁的差異化在于:它想做的不是某一顆芯片的替代者,而是一整套AI基礎設施的構建者。
從底層HCU架構支撐的T2 Ultra芯片與HyperIntelliX系統,到中層開發者社區2.0與AI4S計算平臺,再到上層七家聯合的全域大模型安全體系——三層之間不是簡單疊加,而是相互支撐的體系。
![]()
但挑戰同樣明顯。國產AI芯片市場正從“政策驅動”向“市場驅動”深層轉型,頭部3-5家占據80%+份額的洗牌窗口即將開啟。
對于太初元碁而言,能否在萬卡集群、十萬卡集群的規模化部署中證明系統穩定性,能否在生態遷移成本上持續降低開發者門檻,將是決定其能否從“可用”走向“好用”的關鍵。
國產算力走到今天,早已過了靠單點參數刷存在感的階段。真正的較量,是體系化能力與生態協同效率的綜合比拼。
WAIC 2026的展臺已經說明:大家比的不再是“我有多強”,而是“我的系統有多完整”、“我能不能落地更多場景”。畢竟,只有真正走完產業閉環落地,未來才能接著“活下去”。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.