![]()
2018年清微智能正式成立,2019年便實現國內可重構芯片先行量產。此后幾年,大模型爆發,算力需求陡增,先進制程、HBM、高速互聯和軟件生態成為競爭焦點。但到了今天,單靠“堆參數”的增長公式,已經很難回答所有問題。
今年WAIC 2026,清微智能再發新品,首秀可重構計算3.0技術、RAISA軟件棧及supernode 4096超節點系統。半導體產業縱橫對話清微智能聯合創始人、CTO歐陽鵬,想要在WAIC 2026期間探討:當AI芯片行業仍然習慣用更先進制程、更大顯存、更高峰值算力來衡量競爭力時,國產AI芯片能不能依靠架構創新,走出另一種算力增長方式?
01
GPU之外,AI芯片路線開始分流
GPU不會輕易失去AI計算的中心位置。英偉達的優勢也早已超出一顆GPU,CUDA、NVLink、服務器、機柜和開發者生態共同構成了一套完整的算力體系。但AI對于芯片要求正在變高和多元化。歐陽鵬在采訪中談到了一個先后關系:“GPU是先有芯片,后有人工智能。GPU最早服務圖形計算,后來憑借并行計算能力進入AI市場。非GPU芯片則更多是在AI出現以后,圍繞矩陣計算、數據流動和模型負載重新設計。”這種差別在推理和Agent階段變得更加明顯。模型可能只訓練幾次,推理卻會發生億萬次;一個Agent任務還會連續觸發規劃、搜索、模型調用和工具執行。客戶關心的不只是峰值算力,還有顯存利用率、數據搬運、響應延遲、功耗以及單Token成本。
正是在這樣應用場景的推動下,全球頭部AI公司已經開始重新分配算力負載。谷歌的TPU發展到第七代,最新一代Ironwood專門面向推理設計。按照谷歌披露的數據,Ironwood可以組成包含9216顆芯片的Pod,提供42.5 ExaFLOPS算力,單位功耗性能達到上一代的兩倍,Gemini 2.5和AlphaFold都運行在TPU上。當然這并不意味著GPU正在被替代,而是不同負載開始尋找更合適的硬件。訓練需要GPU的通用性和成熟生態,大規模推理、推薦等負載則越來越適合專門優化的芯片。非GPU架構已經從邊緣場景進入大模型訓練和推理,性能、能效和集群規模也開始得到驗證。
固定功能的AI芯片雖然效率高,卻很難跟上模型變化。一顆芯片從設計到量產需要數年,等硬件做出來,算法可能已經換了一輪。產業需要一種介于GPU與固定ASIC之間的架構:既能提高AI計算效率,又可以適應算法變化。可重構計算,瞄準的正是這個位置。
02
從清華出發,可重構走了二十年
清微智能的可重構技術,起點是清華大學。
2018年,清微智能成立,可重構計算從學校走向產業。2019年,第一顆可重構處理器實現量產;2024年,首款云端AI芯片TX81問世。談及清微智能為何選擇這樣的一條路線時,歐陽鵬說得很直接:“如果只是跟隨別人,別人的起點很可能就是你的天花板。特別是在工藝制程和供應鏈條件不同的情況下,做一模一樣的東西,很難獲得市場競爭力。”
我們進一步了解到,清微智能的可重構3.0技術由可重構計算架構、三維存算融合和算力網格組成,分別對應AI計算中的效率墻、存儲墻和互聯墻。可重構架構減少通用控制帶來的計算損耗,提高硬件有效利用率;三維存算融合讓存儲更靠近計算單元,減少模型參數、激活值和KV Cache的搬運距離;算力網格通過Mesh、Torus等拓撲連接多顆芯片,降低大規模集群中的通信損耗。也正是三者的組合,形成了清微智能技術路線的優勢:既保留接近專用芯片的計算效率,又能適應不同模型;既提高單顆芯片的訪存效率,又把擴展能力延伸到千卡集群。
對新架構芯片來說,一顆芯片從實驗室走進智算中心,需要編譯器、框架、服務器、網絡和應用企業共同參與。GPU已經擁有成熟產業鏈,新架構必須在軟硬件協同中補齊這些能力。圍繞可重構計算,清微智能從開始就立足產業,花很大精力推動技術發展與應用普及,搭建了“1+2+X”平臺化創新協同體系,牽頭建設新架構智能芯片技術北京市重點實驗室、北京市可重構算力軟硬件協同技術創新中心和可重構芯片應用研究院,并聯合清華大學、北京智源人工智能研究院及產業鏈企業開展技術攻關、成果轉化和標準制定。
清微智能的布局也很有前瞻性,對3D芯片的研究也早于這一輪先進封裝熱潮。 歐陽鵬在采訪中提到:“我們從2019年就開始布局這條線。當時國內相關設備和工程條件尚不完備,這一方向也一度被認為過于超前。清微智能仍然堅持推進這項前沿技術,是因為團隊判斷將芯片連接從二維擴展到三維,有可能帶來量級上的性能提升。”
03
參數之后,生態與Token才是硬仗
堅定了這條路線,清微智能持續攻堅,通過產品快速迭代,讓應用走向產業并實現了規模化落地。
![]()
從產品布局來看,清微智能的可重構計算已經從1.0、2.0發展到此次發布的3.0,下一步將進入面向晶圓級計算的4.0;產品則從支持數據流和網格計算的TX81,演進到支持三維計算的TX82,再到規劃中的晶圓級芯片。
清微智能此次在WAIC 2026首秀的TX82,是一顆基于可重構計算3.0的3D芯片,由一顆邏輯芯片與四顆存儲芯片組成。與上一代相比,TX82將計算精度更豐富,算力更高,互聯帶寬也更高。歐陽鵬用了一個直觀的比喻:“3D芯片相當于把原來二維平面的連接變成三維連接,相當于從單車道變成四車道。”
![]()
單顆芯片之外,清微智能還將展示千卡超節點。清微智能的REX81 Supernode集成4096顆TX81芯片,通過2D-Torus拓撲和芯片直連通道組成千卡量級系統,算力突破每秒500千萬億次。歐陽鵬介紹:“超節點,就是把眾多芯片緊耦合在一起,像一個單一節點一樣工作。”據了解,這套方案減少了傳統集群中的交換節點,清微智能給出的互聯成本降幅約為90%。
從生態建設來看,AI芯片的參數決定能不能進場,生態決定客戶能不能用,Token成本決定產品能不能規模化。圍繞TX81,清微智能已經形成計算模組、REX1032服務器、REX81 Supernode和RAISA軟件棧。RAISA適配PyTorch、vLLM、SGLang等主流框架,支持CUDA生態算子遷移和Triton編程。目前,清微智能已經完成DeepSeek、智譜GLM、通義千問等超過200個模型的適配。作為FlagOS卓越共建單位,清微智能還參與國產AI軟件生態和新架構算子庫建設。對于非GPU芯片,軟件生態不是產品發布后的附加項,而是硬件能否被客戶使用的前提。算子庫越完整,模型遷移和部署成本越低,新架構才越容易進入現有智算中心。目前,清微智能產品已經在國家級、區域級及商業化智算中心中獲得部署,包括“東數西算”工程項下的運營商項目,并參與北京市智算中心建設。
從應用落地來看,清微智能披露,全國算力部署及在建規模已達5000P。如果說5000P說明的是項目交付進度,市場排名則提供了橫向坐標。據IDC統計,2025年上半年,清微智能在國內主要可商用AI加速卡出貨量中排名第六,進入國產算力第一梯隊。對于一家采用非GPU架構的企業,這一排名意味著可重構計算已經不再停留在少數試點,而是開始進入規模采購和商業部署。累計3000萬顆端側芯片出貨,證明的是規模化量產能力;5000P的部署規模,證明的則是清微智能已經開始進入云端算力市場。
04
從千卡集群走向全國算力網
截至2026年3月底,我國智能算力規模已經達到1882 EFLOPS(FP16),約為上年同期的2.5倍。算力規模快速增長后,產業面對的問題已經不只是“建多少”,還有不同地區、不同架構的算力能否被統一調度和充分使用。
“東數西算”也從數據中心布局走向算力協同。全國算力一張網,實際要解決的是如何把合適的任務送到合適的算力上。這張網不可能只運行一種GPU。面對已經部署的GPU及多種國產AI芯片,模型能否跨架構遷移,算力能否被識別、計量和調度,將決定它們能否真正進入國家算力基礎設施。歐陽鵬把這種關系比作汽車:“可重構計算只是一種底層技術,就像車可以燒油,也可以用電,但對用戶來說還是一輛車。”底層架構可以不同,開發者的框架、接口和使用習慣不能全部推倒重來。而在技術打通上,清微智能已經完成了。
目前,清微智能已經在北京、河北、江蘇、安徽等省市落地智算項目,并參與內蒙古、新疆等“東數西算”項目建設。可重構架構負責適應不同模型和任務,算力網格負責擴大集群規模,RAISA和FlagOS則用于降低模型遷移成本。但接入機房不等于成為基礎設施。集群穩定性、算力利用率和單Token成本,才決定這些算力能否被長期使用。國產芯片也需要從“可用”繼續走向“好用”,再到易用。
05
結語
對于未來三到五年AI的發展,歐陽鵬判斷:“訓練和推理都會繼續快速增長,其中推理會增長得更多。AI芯片也一定會走向多元,過去由GPU主導的格局會發生變化,非GPU芯片會獲得越來越大的市場空間。”中國AI芯片需要GPU,也需要可重構、數據流等原創架構。算力自主不能只理解為用一顆國產芯片換一顆進口芯片,還要讓中國企業擁有定義芯片、組織系統和建設生態的能力。
回看清微智能的發展,它實際上完成了三次跨越:從論文走向芯片,從芯片走向系統,再從系統走向智算基礎設施。第一次考驗原創能力,第二次考驗工程能力,第三次考驗的則是組織產業鏈、建設軟件生態和服務大規模客戶的能力。從可重構計算1.0到4.0,從TX81到TX83,清微智能的產品路線背后始終貫穿著同一個判斷:當制程無法解決所有問題,架構就必須承擔更多責任。
清微智能真正要做的,也不只是再增加一家國產AI芯片供應商,而是讓一條由中國團隊定義的計算架構,成為可以量產、可以部署、可以進入基礎設施的長期選擇。如果這條路最終走通,中國AI芯片得到的將不只是一支奇兵,而是一個屬于自己的算力坐標。
【AI疊變】第三期:清微智能。成立于2018年7月,總部位于北京。清微智能專注于高性能AI算力芯片的研發與產業應用,是我國創新架構AI芯片的領軍企業,成立至今持續深耕可重構數據流架構的技術路線,關鍵技術為可重構計算陣列、三維存算融合、算力網格。在云端算力產品領域,清微智能推出面向大模型訓練與推理的TX8系列產品,兼具高能效、高帶寬與高密度的混合算力。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.