- 克雷西 發(fā)自 上海
量子位 | 公眾號(hào) QbitAI
先說一件有意思的事。
就在今天的WAIC論壇上,MiniMax和階躍星辰,同時(shí)出現(xiàn)在了一家AI Infra公司的論壇現(xiàn)場(chǎng),前者參加戰(zhàn)略合作簽約,后者發(fā)布主旨演講。
![]()
苗頭其實(shí)更早就出現(xiàn)了。4個(gè)月前的中關(guān)村論壇上,智譜張鵬和Kimi楊植麟就曾與這家公司聯(lián)合創(chuàng)始人兼CEO同框,參與圓桌論壇,并被現(xiàn)場(chǎng)點(diǎn)名該公司已為Kimi、智譜提供服務(wù)。
![]()
四家國(guó)產(chǎn)頭部基模公司,先后跟同一家AI Infra達(dá)成了深度合作。開句玩笑話——集齊四家,就可以召喚神龍了。
這家AI Infra公司,正是無問芯穹
這個(gè)身位有點(diǎn)像「電池領(lǐng)域的寧德時(shí)代」——造車的人可以「兄弟登山,各自努力」,但電池這一層,繞不開就是繞不開。無問芯穹想做的,就是大模型時(shí)代的共同選擇
問題也因此變得更有趣了:
他們到底看中了這家公司什么?
答案要從兩頭找。
需求端,2026年推理開始反超訓(xùn)練,成為AI算力消耗的主戰(zhàn)場(chǎng),推理成本兩年降了280倍,企業(yè)的AI總支出卻沒降反升,中國(guó)日均Token調(diào)用量已經(jīng)突破140萬億,一年漲了四成,需求呈指數(shù)級(jí)往上沖。
供給端卻完全是另一副面孔。物理算力的擴(kuò)產(chǎn)邏輯還是線性的,多修幾個(gè)機(jī)房、多買幾張卡,缺口卻在三五年內(nèi)都填不平。
一邊指數(shù)增長(zhǎng),一邊線性爬坡,中間那道口子,就是無問芯穹想站進(jìn)去的位置。
更難的是,模型部署得好不好,外人很難判斷。
一個(gè)請(qǐng)求發(fā)下去,模型正常回復(fù)了,但輸出的精度可能已經(jīng)悄悄掉了三成,這種問題常規(guī)監(jiān)控查不出來。
等到用戶在業(yè)務(wù)里察覺到不對(duì)勁,模型的招牌已經(jīng)砸了。
這道看不見的門檻,才會(huì)真正決定哪家供應(yīng)商能留在牌桌上。
為什么國(guó)產(chǎn)大模型優(yōu)選無問芯穹?
Token經(jīng)濟(jì)全面爆發(fā)以來,推理需求正在加速,算力缺口也在持續(xù)擴(kuò)大。
但MaaS這門生意的門檻,比外界想象的高得多。
Kimi、智譜、MiniMax、階躍星辰為什么都點(diǎn)了頭,自然有他們自己的算盤,但本質(zhì)上是同時(shí)把三件事押了上去——
比如:模型效果會(huì)不會(huì)打折,成本燒不燒得起,出了問題穩(wěn)不穩(wěn)得住。
先說效果
前面提到的那種隱蔽滑坡,是這個(gè)行業(yè)最讓人頭疼的地方。
有第三方供應(yīng)商部署模型后,精度比原廠掉了30%,客戶自己甚至察覺不到,直到業(yè)務(wù)指標(biāo)開始下滑才回頭排查。
無問芯穹在這件事上的做法,是定了一套準(zhǔn)入測(cè)試標(biāo)準(zhǔn)。
這套標(biāo)準(zhǔn),會(huì)從工具調(diào)用的一致性,到推理模式的精度對(duì)齊,逐項(xiàng)進(jìn)行核驗(yàn),每一個(gè)新模型上架前都要過這道關(guān)。
結(jié)果是,客戶無論走無問芯穹還是原廠API,體驗(yàn)幾乎感覺不到差別。
再來是成本
無問芯穹在今年WAIC官宣了一項(xiàng)自研的硬技術(shù)——跨集群異構(gòu)PD分離。
![]()
大模型推理里的Prefill和Decode是兩個(gè)負(fù)載完全不同的階段,硬件需求也不一樣,拆開部署能讓不同類型的芯片各自干最擅長(zhǎng)的事。
但拆到不同機(jī)房后,會(huì)撞上一個(gè)新問題。
PD分離之后,需要在異構(gòu)芯片之間用廣域網(wǎng)以太網(wǎng)傳輸KV Cache,面臨著帶寬低、延遲高的情況,等于兩個(gè)接力選手各自都跑得很出色,但在交棒的時(shí)候,卻掉了鏈子。
為此,無問芯穹首先把Decode實(shí)例設(shè)計(jì)的Radix Cache技術(shù),創(chuàng)新性地遷移到了這套跨集群架構(gòu)里,讓傳輸?shù)臄?shù)據(jù)量直接降低一個(gè)數(shù)量級(jí)。
接著,他們又首創(chuàng)了PDD架構(gòu),把傳統(tǒng)的PD鏈路拆成P、RelayDecode、MainDecode三級(jí)。
![]()
遇到傳輸延遲高的請(qǐng)求,RelayDecode先頂上去把Token吐給用戶,用戶完全感覺不到這段實(shí)際長(zhǎng)達(dá)數(shù)十秒的延遲,等數(shù)據(jù)傳完,再無縫切給MainDecode接手。
實(shí)測(cè)顯示,該架構(gòu)在首Token延遲(TTFT)降低51.5%的同時(shí),單Token成本可降低37.5%。
最后是穩(wěn)定性
集群規(guī)模一大,故障往往藏得很深。
大模型推理背后要管理數(shù)十上百個(gè)集群,扛住全國(guó)每天上T規(guī)模的流量分發(fā),服務(wù)器一旦宕機(jī),靠人盯著屏幕根本來不及反應(yīng)。
無問芯穹這次發(fā)布了“智算集群運(yùn)維智能體系統(tǒng)”,能夠端到端地解決實(shí)際生產(chǎn)場(chǎng)景中的運(yùn)維難題,7×24小時(shí)全天候值守,讓智算集群的運(yùn)維從“人找問題”轉(zhuǎn)變?yōu)椤皢栴}找人”,和“問題自己解決”,實(shí)現(xiàn)了運(yùn)維人效提升5倍以上,關(guān)鍵故障處理效率提升6倍。
前店后廠一中心,構(gòu)建系統(tǒng)競(jìng)爭(zhēng)力
三件事都解決了,僅僅只是構(gòu)成了Token工廠這一層的地基。
無問芯穹真正要交出去的答卷,是把算力、Token、生產(chǎn)力串成一個(gè)完整的系統(tǒng),對(duì)應(yīng)它自己提出的那個(gè)公式——
AI生產(chǎn)力 = 智能資源規(guī)模 × Token轉(zhuǎn)化效率 × AI生產(chǎn)力轉(zhuǎn)化效率。
![]()
一中心,指的是「算力集散中心」,即Agentic Infra自主式基礎(chǔ)設(shè)施平臺(tái)。
國(guó)產(chǎn)芯片生態(tài)天然碎片化,無問芯穹把散落各處的算力資源統(tǒng)一匯聚、彈性調(diào)度、按需利用,為模型與應(yīng)用層筑牢充足、穩(wěn)定、可擴(kuò)展的算力底座。核心目標(biāo)非常明確:實(shí)現(xiàn)智能資源規(guī)模最大化。
這個(gè)集散中心已部署觸達(dá)37000P算力,覆蓋接入16種主流芯片
![]()
跨集群強(qiáng)化學(xué)習(xí)的挑戰(zhàn),同樣是在這一層被啃下來的。無問芯穹認(rèn)為,在Post-training的Scaling Law持續(xù)發(fā)展的當(dāng)下,強(qiáng)化學(xué)習(xí)成為解鎖智能的關(guān)鍵。
其算力需求的硬件種類更加復(fù)雜,規(guī)模量級(jí)也更加龐大,基于異構(gòu)和超大算力規(guī)模的雙重剛需,跨集群強(qiáng)化學(xué)習(xí)因此成為智能規(guī)模化及持續(xù)進(jìn)化的新錨點(diǎn),這也是無問芯穹Agentic Infra自主式基礎(chǔ)設(shè)施平臺(tái)重點(diǎn)布局與攻克的核心場(chǎng)景。
無問芯穹把網(wǎng)絡(luò)、平臺(tái)、框架三層的優(yōu)化貫穿到底,成功實(shí)現(xiàn)了跨域強(qiáng)化學(xué)習(xí)訓(xùn)練連續(xù)一周0中斷穩(wěn)定運(yùn)行,讓大規(guī)模跨域強(qiáng)化學(xué)習(xí)不僅可以“跑得通”,還能“跑得快、跑得穩(wěn)”。
![]()
未來,無問芯穹還將針對(duì)并行策略、通信融合、智能算子、極致容錯(cuò)等核心技術(shù)持續(xù)深耕,將跨域計(jì)算資源的支撐規(guī)模,持續(xù)拓展至十萬卡級(jí)以上。
后廠,也就是「Token工廠」,即Agentic MaaS大模型服務(wù)平臺(tái)。
這是前面講的效果、成本、穩(wěn)定性三重優(yōu)勢(shì)真正兌現(xiàn)的地方,核心思路是“在規(guī)模之上向效率要產(chǎn)能”,也是一整套從網(wǎng)關(guān)、路由到底層推理實(shí)例的完整服務(wù)技術(shù)棧,“層層可優(yōu)化、處處有增量”。
在這個(gè)「工廠」里,除了上文提到的新技術(shù)“跨集群異構(gòu)PD分離架構(gòu)”,無問芯穹還和多家頭部大模型公司深度合作,在真實(shí)業(yè)務(wù)場(chǎng)景里持續(xù)打磨推理效率和服務(wù)穩(wěn)定性,業(yè)務(wù)規(guī)模又反過來推動(dòng)技術(shù)迭代得更快。
![]()
公司官宣:截至7月,無問芯穹Agentic MaaS平臺(tái)的日均Token調(diào)用量,較去年12月漲了40倍。
它還與上海移動(dòng)聯(lián)合打造了“天問”模型服務(wù)門戶,聯(lián)合觀猹做了一個(gè)面向開發(fā)者的「TokenDance」,對(duì)標(biāo)OpenRouter。
前店,是把攢下的能力覆蓋千行百業(yè)的「AI生產(chǎn)力商店」,即Agentic Infra行業(yè)解決方案。
這套解決方案已覆蓋文娛游戲、醫(yī)療健康、法律終端、能源電力等多個(gè)行業(yè)領(lǐng)域,把技術(shù)勢(shì)能全面轉(zhuǎn)化為各行業(yè)能用、好用、可復(fù)用的落地價(jià)值。
比如:和VAST做了3D游戲解決方案,幫上海瑞金醫(yī)院探索醫(yī)療大模型的落地場(chǎng)景,給幾家律所做了AI合伙人產(chǎn)品,還在和南方電網(wǎng)琢磨智算中心的能耗預(yù)測(cè)。
在支撐千行百業(yè)智能升級(jí)的另一面,無問芯穹也持續(xù)將智能體的能力應(yīng)用到AI Infra本身。
![]()
公司打造了一套基礎(chǔ)設(shè)施智能體蜂群,目前已包含——
- 面向用戶的平臺(tái)管家智能體系統(tǒng):可以獨(dú)立解決80%日常問題,剩下20%深度問題再轉(zhuǎn)交對(duì)應(yīng)垂類Agent;
- 面向集群的運(yùn)維智能體系統(tǒng):讓智算集群的運(yùn)維從“人找問題”轉(zhuǎn)變?yōu)椤皢栴}找人”,和“問題自己解決”。可實(shí)現(xiàn)運(yùn)維人效提升5倍以上,關(guān)鍵故障處理效率提升6倍;
- 面向芯片的算子生成智能體系統(tǒng):可在真實(shí)編譯試錯(cuò)與知識(shí)沉淀中持續(xù)自迭代,穩(wěn)定交付可直接落地的高質(zhì)量工業(yè)級(jí)算子。在GLM 5.2模型的實(shí)測(cè)中,對(duì)比行業(yè)基線該系統(tǒng)在NVIDIA旗艦卡中實(shí)現(xiàn)了端到端7.3%的性能提升,在AMD旗艦卡中,更帶來39%的整體性能躍升。
三塊拼在一起,前店在各行業(yè)里攢下的經(jīng)驗(yàn),會(huì)反過來優(yōu)化后廠的推理策略和一中心的調(diào)度,三者互相反哺。
Token只是入口
如果只把無問芯穹理解成一家賣Token的公司,會(huì)漏掉它完整的商業(yè)模式。
「Token工廠」只是入口,它真正在鋪的,是面向Agent時(shí)代推出的「前店后廠一中心」的完整Agentic Infra戰(zhàn)略布局
這些方向拼在一起,才是它想講的完整故事。
這套故事有沒有說服力,上文提到的深度合作方是最直接的佐證。
把目光放到海外,無問芯穹對(duì)標(biāo)的是Baseten、Together AI、Fireworks AI,估值都在130億到150億美元區(qū)間。
但這三家的底層都建在英偉達(dá)單一生態(tài)之上,而無問芯穹面對(duì)的是一個(gè)遠(yuǎn)比海外碎片得多的國(guó)產(chǎn)芯片生態(tài),也因此把多元異構(gòu)和更完整的架構(gòu)布局,做成了自己的護(hù)城河。
回到開頭那個(gè)問題——這幾家頭部模型廠,為什么都在Infra這件事上點(diǎn)了頭——答案可能并沒有那么復(fù)雜。
懂算力、懂模型結(jié)構(gòu)、懂訓(xùn)推優(yōu)化、懂應(yīng)用場(chǎng)景,這四件事同時(shí)做到,就是這條賽道真正稀缺的能力。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.