谷歌在 2016 年公開(kāi) TPU 時(shí),外界對(duì)它的理解還很簡(jiǎn)單,這是一顆為了深度學(xué)習(xí)而生的專用芯片。彼時(shí),AI 的主戰(zhàn)場(chǎng)仍是訓(xùn)練,GPU 憑借通用性和成熟生態(tài)占據(jù)絕對(duì)優(yōu)勢(shì)。
十年后,大模型進(jìn)入推理密集期,智能體反復(fù)調(diào)用模型,長(zhǎng)上下文帶來(lái)更重的輸入負(fù)載,算力的衡量方式也更關(guān)注單位token的性價(jià)比。
這一變化正傳導(dǎo)到國(guó)內(nèi)市場(chǎng)。國(guó)產(chǎn)大模型快速迭代,DeepSeek、Qwen、GLM 等模型持續(xù)更新,國(guó)產(chǎn)芯片廠商也在尋找更具體的落點(diǎn),芯片能否適配模型,集群能否穩(wěn)定運(yùn)行,調(diào)用成本能否被客戶接受。
在 WAIC 期間,中昊芯英發(fā)布第二代自研 TPU 芯片“須臾”,并宣布華東地區(qū)首個(gè)國(guó)產(chǎn) TPU 智算千卡集群在杭州落成。
![]()
TPU 又被推到臺(tái)前,原因是推理成本
大模型訓(xùn)練依然昂貴,但訓(xùn)練是一段相對(duì)集中的投入,推理則是一筆持續(xù)發(fā)生的成本賬。
用戶每一次與AI的交互,背后都在消耗 Token,智能體的出現(xiàn)進(jìn)一步放大了這一過(guò)程。一項(xiàng)任務(wù)可能包含多輪檢索、多次調(diào)用模型和連續(xù)生成,輸入 Token 與輸出 Token 的比例也可能相差很大。
中昊芯英創(chuàng)始人、CEO 楊龔軼凡提到,當(dāng)前大模型推理正在走向 PD 分離,所謂 PD 分離,是將模型處理輸入內(nèi)容的 Prefill 階段,與逐 Token 輸出內(nèi)容的 Decode 階段拆開(kāi)調(diào)度。前者需要快速處理大量上下文,后者更看重持續(xù)輸出和低延遲。把兩種任務(wù)放在同一套資源里運(yùn)行,容易出現(xiàn)資源閑置或排隊(duì),拆開(kāi)之后,集群可以圍繞不同負(fù)載進(jìn)行更細(xì)致的配置。
這也是 TPU 再次獲得關(guān)注的原因。GPU 最初為圖形渲染設(shè)計(jì),后來(lái)憑借強(qiáng)大的并行計(jì)算能力成為 AI 訓(xùn)練的核心硬件,TPU 則從一開(kāi)始就瞄準(zhǔn)深度學(xué)習(xí)中的張量計(jì)算,它犧牲了一部分通用性,換取在特定任務(wù)中的計(jì)算密度和能效表現(xiàn)。谷歌將 TPU 用于自身數(shù)據(jù)中心和云服務(wù),已經(jīng)證明專用架構(gòu)可以在大規(guī)模 AI 負(fù)載中找到位置。
國(guó)內(nèi)的情況更復(fù)雜,GPU 生態(tài)長(zhǎng)期占據(jù)主導(dǎo),CUDA 工具鏈和開(kāi)發(fā)習(xí)慣構(gòu)成了很高的遷移門(mén)檻。國(guó)產(chǎn) TPU 要進(jìn)入市場(chǎng),既要解決芯片本身的性能問(wèn)題,也要回答開(kāi)發(fā)者如何遷移、模型如何適配、客戶如何調(diào)用的問(wèn)題。
須臾是中昊芯英的第二代產(chǎn)品,據(jù)悉,這款芯片混合精度浮點(diǎn)算力達(dá)到 896TFLOPS,8-bit 推理算力達(dá)到 1792TOPS,整體性能約為上一代芯片的三倍,單芯片額定功耗為 600W。
中昊芯英聯(lián)合創(chuàng)始人、CTO 鄭瀚尋將性能提升歸因于幾項(xiàng)硬件調(diào)整:計(jì)算流水線重構(gòu),雙芯粒同基板封裝,以及片上存儲(chǔ)容量和帶寬提升。中昊芯英稱,目前已經(jīng)完成 Qwen、DeepSeek、GLM 等主流開(kāi)源模型的基礎(chǔ)適配,并能在新模型發(fā)布后較快跑通流程。
基礎(chǔ)適配和商業(yè)化效果之間仍有距離,要把模型的吞吐量、延遲和成本調(diào)到可用水平,往往需要圍繞算子、編譯工具和調(diào)度策略持續(xù)優(yōu)化,國(guó)產(chǎn) AI 芯片行業(yè)常說(shuō)“從可用到好用”,背后說(shuō)的正是這段漫長(zhǎng)的過(guò)程。
千卡集群落地杭州,國(guó)產(chǎn)TPU接受檢驗(yàn)
此次落成的杭州國(guó)產(chǎn) TPU 千卡集群,由杭州電信、中興通訊和中昊芯英共同建設(shè),面向大模型訓(xùn)練、推理和科學(xué)計(jì)算等場(chǎng)景提供算力服務(wù),它也是中國(guó)電信體系內(nèi)首個(gè)大規(guī)模國(guó)產(chǎn) TPU 集群部署項(xiàng)目。
運(yùn)營(yíng)商正在經(jīng)歷角色變化,過(guò)去,客戶租用的是服務(wù)器、存儲(chǔ)和帶寬;現(xiàn)在,越來(lái)越多企業(yè)希望直接獲得模型調(diào)用能力,或按照 Token 購(gòu)買(mǎi)服務(wù)。
杭州電信并沒(méi)有將 TPU 視為唯一選擇,其現(xiàn)有布局中同時(shí)包含 GPU 算力池,也在探索其他國(guó)產(chǎn)芯片路線。未來(lái)的智算中心很可能長(zhǎng)期保持異構(gòu)狀態(tài),芯片架構(gòu)各自承擔(dān)擅長(zhǎng)的任務(wù),運(yùn)營(yíng)商負(fù)責(zé)將底層資源組織成面向用戶的服務(wù)。
這種模式對(duì)集群調(diào)度提出了更高要求。杭州電信方面透露,經(jīng)過(guò)數(shù)月軟硬件調(diào)優(yōu),TPU 集群的 Token 輸出效率較年初提升超過(guò) 10 倍。這個(gè)數(shù)據(jù)是系統(tǒng)優(yōu)化的結(jié)果,模型版本、算子實(shí)現(xiàn)、服務(wù)器配置、網(wǎng)絡(luò)帶寬和調(diào)度方式,都會(huì)影響最終能交付多少有效 Token。
中興通訊承擔(dān)網(wǎng)絡(luò)和系統(tǒng)集成能力,千卡集群向萬(wàn)卡規(guī)模擴(kuò)展時(shí),芯片之間的連接會(huì)迅速成為瓶頸。計(jì)算能力提升得越快,通信、存儲(chǔ)和散熱越容易拖住整體效率,這都是智算中心走向規(guī)模化后繞不開(kāi)的問(wèn)題。
谷歌 TPU 的經(jīng)驗(yàn)說(shuō)明,專用芯片的價(jià)值往往建立在完整的軟硬件體系之上,對(duì)于國(guó)內(nèi)廠商而言,芯片研發(fā)、量產(chǎn)交付和軟件生態(tài)仍需同步推進(jìn)。(本文首發(fā)于鈦媒體APP,文|TechPulse,作者 | 張帥,編輯 | 蓋虹達(dá))
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.