![]()
新智元報(bào)道
![]()
「你已達(dá)到使用上限,請(qǐng)等待額度重置。」
用過(guò)Claude Code、Codex 的人,大概都被這行字噎過(guò)。bug剛修到一半,彈窗一出,全停了。
如今你把活整件甩給Agent,它替你干、也替你燒錢(qián),每一次調(diào)用都在按Token結(jié)算。
Token,儼然成了這個(gè)時(shí)代最像「貨幣」的東西。
有意思的是,這「貨幣」還在瘋狂貶值:過(guò)去一年,單個(gè)Token的生產(chǎn)成本被硬生生打下來(lái)10倍。
是誰(shuí),在哪兒,把它造得這么便宜?答案藏在一層你從不打開(kāi)、卻天天在用的地基里。
就在今年的WAIC上,無(wú)問(wèn)芯穹一口氣亮出了「前店后廠一中心」,一整套完整的Agentic Infra戰(zhàn)略布局:
算力集散中心(一中心):Agentic Infra自主式基礎(chǔ)設(shè)施平臺(tái);
Token工廠(后廠):Agentic MaaS大模型服務(wù)平臺(tái);
AI生產(chǎn)力商店(前店):Agentic Infra行業(yè)解決方案。
![]()
不是「Token 工廠」,是Agentic Infra
2025年,無(wú)問(wèn)芯穹率先在業(yè)內(nèi)喊出了Agentic Infra。不到一年時(shí)間,這個(gè)詞已經(jīng)成了行業(yè)里的「標(biāo)配」。
可仔細(xì)看,如今多數(shù)廠商做的「Agentic」,不過(guò)是在傳統(tǒng)基礎(chǔ)設(shè)施上加了一個(gè)Agent入口。
但這樣做根本撐不起真正的智能體時(shí)代。當(dāng)海量并發(fā)請(qǐng)求一擁而上,光靠一個(gè)新入口,底層系統(tǒng)很容易就崩了。
真正的解法,得往更深處走。今年6月,兩家海外Cloud公司各自提出的解法,與無(wú)問(wèn)芯穹隔海共同呼應(yīng)了「Agent時(shí)代到底需要怎樣的AI基礎(chǔ)設(shè)施」這個(gè)命題。
首先,是CoreWeave發(fā)布了一款服務(wù)于「AI研究與迭代」的智能體——ARIA。它能夠自主分析實(shí)驗(yàn)數(shù)據(jù)、提煉洞察并驅(qū)動(dòng)持續(xù)改進(jìn)。這意味著CoreWeave正式從單純的「算力提供商」升級(jí)為「算力+AI自動(dòng)化研發(fā)」的綜合平臺(tái)。
其次,是Fireworks AI發(fā)布帶強(qiáng)化學(xué)習(xí)的端到端平臺(tái)——Training Agent。用戶只需描述任務(wù),智能體就能自動(dòng)選模型、跑超參掃描、寫(xiě)評(píng)估、部署模型。
而無(wú)問(wèn)芯穹的解題思路是——讓整座基礎(chǔ)設(shè)施自己變成一個(gè)會(huì)干活的Agent。
在他們看來(lái),真正完整的Agentic Infra至少得同時(shí)邁過(guò)三道坎:
全鏈路:撐得起從算力到Token再到生產(chǎn)力的整條鏈,用全棧優(yōu)化提升基礎(chǔ)設(shè)施系統(tǒng)性能;
AI原生:能用AI改進(jìn)AI基礎(chǔ)設(shè)施本身,不僅服務(wù)人類(lèi)用戶,還針對(duì)智能體這類(lèi)數(shù)字用戶的需求做改造;
全覆蓋:訓(xùn)練、強(qiáng)化學(xué)習(xí)、推理全流程覆蓋,穩(wěn)固更多樣化的技術(shù)優(yōu)勢(shì),同時(shí)攜手行業(yè)百業(yè)的客戶,賦能降本提效。
無(wú)問(wèn)芯穹把這三件事,收進(jìn)了一道乘法公式:
AI生產(chǎn)力 = 智能資源規(guī)模 × Token 轉(zhuǎn)化效率 × AI 生產(chǎn)力轉(zhuǎn)化效率。
公式里的三個(gè)變量,正好對(duì)上「前店后廠一中心」三塊業(yè)務(wù)。并且在相乘之后,還首尾相接地成了一個(gè)閉環(huán)。
一中心:把散在各地的算力,聚成一股
第一個(gè)變量,是智能資源規(guī)模。
如今,算力的胃口,早就漲得比供給快。可光靠買(mǎi)卡、堆算力,既燒錢(qián)又追不上。
真正的出路,是把已經(jīng)散在各地、型號(hào)不一的存量算力盤(pán)活,聚成一股能用的力量。
為此,無(wú)問(wèn)芯穹的「算力集散中心」主要做了兩件事。
第一,是面向大模型的異構(gòu)集群跨域訓(xùn)練系統(tǒng)。
超遠(yuǎn)距離聚合:聯(lián)合中國(guó)電信,完成國(guó)內(nèi)首例超4000公里距離的大模型跨域混訓(xùn),在新疆哈密與廣東深圳兩地集群間,實(shí)現(xiàn)聯(lián)合訓(xùn)練性能提升165%。
多數(shù)據(jù)中心聚合:聯(lián)合4個(gè)不同代際、不同型號(hào)的GPU集群,聯(lián)合訓(xùn)練70B參數(shù)大模型,四集群協(xié)同性能提升41%。
混合云算力聚合:實(shí)現(xiàn)本地私有集群與公有云算力的安全互通混訓(xùn),不僅將整體性能提升了68%,而且還治好了企業(yè)「自己的卡不夠用、云上的卡卻閑得發(fā)慌」的問(wèn)題。
到今天,這套系統(tǒng)已在全國(guó)部署觸達(dá)超37000P算力、覆蓋16種主流芯片。
第二,是跨集群強(qiáng)化學(xué)習(xí)。
強(qiáng)化學(xué)習(xí)正成為這一輪智能躍遷的勝負(fù)手,所需要的算力規(guī)模顯著增大,動(dòng)輒千卡甚至萬(wàn)卡起步的體量,并不是每個(gè)機(jī)房都能塞得下的。
然而,想要同時(shí)利用多個(gè)集群,就不得不面臨機(jī)房之間通信和故障的瓶頸。
![]()
對(duì)此,無(wú)問(wèn)芯穹的做法是從網(wǎng)絡(luò)、平臺(tái)到框架一層層優(yōu)化,把跨域通信的效率整整提高了三到四倍,實(shí)現(xiàn)通信開(kāi)銷(xiāo)100%全掩蓋。
再配一套故障無(wú)感的訓(xùn)練機(jī)制,它硬是讓跨域強(qiáng)化學(xué)習(xí)訓(xùn)練,連著跑了整整一周都沒(méi)斷。
無(wú)問(wèn)芯穹聯(lián)合創(chuàng)始人兼CEO夏立雪今天在發(fā)布會(huì)現(xiàn)場(chǎng)表示,隨著強(qiáng)化學(xué)習(xí)規(guī)模需求的持續(xù)提升,無(wú)問(wèn)芯穹還將針對(duì)并行策略、通信融合、智能算子、極致容錯(cuò)等核心技術(shù)持續(xù)深耕,「未來(lái)會(huì)將跨域計(jì)算資源的支撐規(guī)模拓展至十萬(wàn)卡級(jí)以上,支撐下一代Agentic AI 的在線進(jìn)化。」
但把算力聚起來(lái)只是第一步。真正讓「一中心」配得上「自主式」三個(gè)字的,是它開(kāi)始自己管自己。
無(wú)問(wèn)芯穹今天發(fā)布了一項(xiàng)與基礎(chǔ)設(shè)施自我優(yōu)化和進(jìn)化直接相關(guān)的「前店」解決方案:基礎(chǔ)設(shè)施智能體蜂群。
首先看「平臺(tái)管家智能體系統(tǒng)」和「智算集群運(yùn)維智能體系統(tǒng)」。
舉個(gè)例子,一個(gè)「平臺(tái)管家」智能體如今成了整個(gè)基礎(chǔ)設(shè)施智能體蜂群的統(tǒng)一入口。
你直接交代一句「幫我看看昨天哪些訓(xùn)練任務(wù)失敗了」,它便會(huì)順著日志、監(jiān)控、任務(wù)事件一路查下去,并且獨(dú)立解決80%的日常問(wèn)題。剩下20%的深度問(wèn)題,則會(huì)再轉(zhuǎn)交對(duì)應(yīng)的垂類(lèi)智能體。
比如,碰到棘手的集群運(yùn)維難題,專(zhuān)門(mén)的智算集群運(yùn)維智能體系統(tǒng)就會(huì)接手。這是一個(gè)7×24小時(shí)全天候值守的「運(yùn)維專(zhuān)家團(tuán)」,能端到端地完成告警閉環(huán)處置。定位到根因后,它們會(huì)直接擬好修復(fù)方案,并問(wèn)你要不要一鍵重建。
![]()
經(jīng)過(guò)大規(guī)模生產(chǎn)環(huán)境驗(yàn)證,這套運(yùn)維智能體系統(tǒng)可實(shí)現(xiàn)運(yùn)維人效提升5倍以上,關(guān)鍵故障處理效率提升6倍。
這不僅為大規(guī)模GPU訓(xùn)練與推理業(yè)務(wù)提供了更加穩(wěn)定、高效的基礎(chǔ)設(shè)施保障,也讓運(yùn)維人力能夠被真正解放出來(lái)。
![]()
比運(yùn)維更硬核的,是高性能算子生成智能體系統(tǒng)KernelMind。它直接用AI造出面向不同芯片的高性能算子,可在真實(shí)編譯試錯(cuò)與知識(shí)沉淀中持續(xù)自迭代,穩(wěn)定交付工業(yè)級(jí)算子。
在GLM 5.2模型的實(shí)測(cè)中,對(duì)比行業(yè)基線,KernelMind在NVIDIA旗艦卡中實(shí)現(xiàn)了端到端7.3%的性能提升,在AMD旗艦卡中更是帶來(lái)了39%的整體性能躍升。
放以前,這一步得靠頂尖專(zhuān)家一行行手搓才行。
后廠:把推理成本,一年打下來(lái)10倍
第二個(gè)變量,是Token轉(zhuǎn)化效率。
對(duì)于后廠來(lái)說(shuō),核心命題只有一個(gè):極致效率服務(wù)Token的規(guī)模化、高質(zhì)量生產(chǎn)。
這背后,其實(shí)是整個(gè)AI產(chǎn)業(yè)的一次重心轉(zhuǎn)移。
過(guò)去三年,大家拼的是誰(shuí)堆的卡多、訓(xùn)的模型大;可當(dāng)Agent鋪開(kāi)之后,戰(zhàn)場(chǎng)就從「訓(xùn)練」大規(guī)模擴(kuò)展到了「推理」。決定誰(shuí)能真正賺錢(qián)的是海量調(diào)用之下,每個(gè)Token的成本能壓到多低。
模型推理時(shí),不同階段對(duì)設(shè)備的要求完全不同——Prefill瘋狂吃算力;Decode極度吃通信和延遲。
對(duì)此,無(wú)問(wèn)芯穹的答案,是它首創(chuàng)的「跨集群異構(gòu)PD分離架構(gòu)」(Prefill-RelayDecode-MainDecode,PDD)。
![]()
也就是,把Prefill和 Decode這兩步徹底拆開(kāi),分別丟到不同機(jī)房、不同廠商的芯片上去跑。誰(shuí)擅長(zhǎng)算就專(zhuān)心算,誰(shuí)擅長(zhǎng)低延遲輸出就專(zhuān)心輸出,各盡其能。
而基于以太網(wǎng)的KV Cache跨集群傳輸,需要解決帶寬和延遲瓶頸兩大難題。
![]()
帶寬這一關(guān),它靠一次技術(shù)遷移解決。通過(guò)把原本用于Decode實(shí)例重復(fù)前綴存儲(chǔ)去重的Decode Radix Cache技術(shù),創(chuàng)新性地遷移至跨集群異構(gòu)PD分離架構(gòu)之中,將跨集群的KV Cache傳輸數(shù)據(jù)量降低了一個(gè)數(shù)量級(jí)。
延遲這一關(guān),它首創(chuàng)了PDD三級(jí)分離架構(gòu)。遇到傳輸要耗上數(shù)十秒的請(qǐng)求,先由極少量機(jī)器上的RelayDecode搶先向用戶輸出Token,用戶端因此感受不到這段傳輸延遲;等數(shù)據(jù)傳輸完成,再把輸出任務(wù)無(wú)縫切換給MainDecode。
實(shí)測(cè)顯示,首Token延遲(TTFT)直接降低了51.5%,單Token成本再降37.5%。
結(jié)合一系列技術(shù)優(yōu)化,無(wú)問(wèn)芯穹的單位Token推理成本,硬是在一年內(nèi),整整降了10倍。未來(lái),仍有10倍的下降空間。
正如夏立雪在現(xiàn)場(chǎng)所總結(jié)的:6月的GTC大會(huì)上,黃仁勛展示了英偉達(dá)的「算力即收入」曲線。無(wú)問(wèn)芯穹的Token工廠,則希望用「優(yōu)化即利潤(rùn)」的增長(zhǎng)飛輪,向推理時(shí)代交出Token效率的答卷。
![]()
Token按量賣(mài)是收入,每一分技術(shù)優(yōu)化省下的成本,不用降價(jià)讓利,直接沉淀成毛利;省得越狠,賺得越多。
如今他們深度合作的模型廠名單中,幾乎涵蓋了國(guó)產(chǎn)大模型的半壁江山——Kimi、智譜、MiniMax、階躍星辰等。
這些公司的模型能力在持續(xù)提升,模型越強(qiáng),能接的任務(wù)就越多,推理調(diào)用量自然跟著指數(shù)級(jí)增長(zhǎng)。
截止今年7月,無(wú)問(wèn)芯穹Agentic MaaS平臺(tái)日均Token調(diào)用量較年初增長(zhǎng)約40倍。
飛輪,已經(jīng)高速轉(zhuǎn)起。
前店:把能力,做成一套工業(yè)級(jí)方案
第三個(gè)變量,是AI生產(chǎn)力轉(zhuǎn)化效率。
在服務(wù)客戶的實(shí)踐中,無(wú)問(wèn)芯穹發(fā)現(xiàn)了一條關(guān)乎AI落地生死的關(guān)鍵定律:
相同的業(yè)務(wù)效果,若置于不同的推理路徑、模型規(guī)模與芯片組合之下,Token成本竟天差地別——這一差距,正深刻制約著大模型從技術(shù)驗(yàn)證走向真實(shí)生產(chǎn)力的躍遷。
為此,無(wú)問(wèn)芯穹推出了 “AI生產(chǎn)力商店”——Agentic Infra行業(yè)解決方案,以底層智能基礎(chǔ)設(shè)施之力,助力行業(yè)客戶打通降本增效的“最后一公里”。
截至目前,無(wú)問(wèn)芯穹已深入文娛游戲、醫(yī)療健康、法律終端、能源電力等多個(gè)垂直行業(yè),和Tripo AI、上海瑞金醫(yī)院、南方電網(wǎng)等伙伴共同打磨領(lǐng)域生產(chǎn)力方案,賦能千行百業(yè)重塑AI效能邊界。
當(dāng)算力、Token、生產(chǎn)力,這條鏈到前店才算真正閉合——那些從芯片里一點(diǎn)點(diǎn)擠出來(lái)、又被后廠壓到極便宜的Token,最終都在真實(shí)業(yè)務(wù)里,變成了看得見(jiàn)的生產(chǎn)力。
下一站,是物理世界
講到這兒,都還是數(shù)字世界里的事。
可當(dāng)所有智能都跑在云端的數(shù)據(jù)中心里,AI基礎(chǔ)設(shè)施就真的到頭了嗎?
無(wú)問(wèn)芯穹的答案是沒(méi)有。
因?yàn)樵谖锢硎澜缰校呱碇悄艿腟caling Law同樣需要高效率、大規(guī)模的基礎(chǔ)設(shè)施支持。
![]()
于是無(wú)問(wèn)芯穹今天公布了首個(gè)面向大規(guī)模具身任務(wù)的云邊端一體化管理與調(diào)度平臺(tái),首次把云端GPU集群、邊緣算力節(jié)點(diǎn)和機(jī)器人真機(jī)設(shè)備統(tǒng)一接入,支持訓(xùn)練、數(shù)據(jù)采集、評(píng)測(cè)和真機(jī)執(zhí)行等多種具身任務(wù)的統(tǒng)一編排運(yùn)行。
訓(xùn)練側(cè),是RLinf V0.3大規(guī)模真機(jī)強(qiáng)化學(xué)習(xí)框架。
由于訓(xùn)練機(jī)器人,得靠一大批真機(jī)同時(shí)上場(chǎng)。但沒(méi)電、故障、掉網(wǎng)這些狀況,很容易讓某臺(tái)設(shè)備突然退出。而只要掉了一臺(tái),整場(chǎng)訓(xùn)練就可能直接崩掉、從頭再來(lái)。
為了解決這個(gè)問(wèn)題,RLinf首創(chuàng)了HotSwarm與端云協(xié)同訓(xùn)練模式。這就像給運(yùn)行中的服務(wù)器熱插拔硬盤(pán),真機(jī)在訓(xùn)練時(shí)因?yàn)橐馔饣蛘吖收蠈?dǎo)致反復(fù)接進(jìn)來(lái)、又掉出去,前后上下線超過(guò)1000次,訓(xùn)練照樣零中斷。
推理側(cè),則交給專(zhuān)攻機(jī)器人端側(cè)的Mizar-Robo。
機(jī)器人身上的算力和電量十分有限。大模型想跑得動(dòng)、還得跑得快,只能從流水線調(diào)度、算子內(nèi)核、量化壓縮到計(jì)算圖一層層榨。
在與自變量機(jī)器人WALL-OSS系列模型的聯(lián)合優(yōu)化部署中,推理性能提升了7.14倍,端側(cè)推理時(shí)延從500ms壓縮至70ms,降幅達(dá)86%。
而這,正是「前店后廠一中心」最自然的延伸:從數(shù)字世界,一路走到物理世界。
他們要立的,是AI的地基
行業(yè)狂飆熱炒到今天,聚光燈幾乎全打在最聰明的那顆「大腦」上。
至于托著這一切的地基,反倒成了最沒(méi)人在意的一層。
可真正決定這場(chǎng)智能革命能走多遠(yuǎn)、能滲透多深的,恰恰是這層地基。
大腦再聰明,如果底下的算力調(diào)不動(dòng)、如果生成的Token太貴企業(yè)用不起、如果系統(tǒng)三天兩頭宕機(jī),再宏大的AGI愿景也無(wú)法落地。
無(wú)問(wèn)芯穹在WAIC 2026上交出的這份答卷,不是又一款產(chǎn)品,也不是又一項(xiàng)具體的API服務(wù),而是一整套會(huì)自己迭代的地基。
它越是讓你感覺(jué)不到它的存在,說(shuō)明它運(yùn)轉(zhuǎn)得越完美。
而當(dāng)同一套地基,能同時(shí)托住數(shù)字世界里如洪流般飛奔的Token,和物理世界里邁出第一步的機(jī)器人時(shí),它就是整個(gè)智能時(shí)代前進(jìn)的底盤(pán)。
所有的智能,最終都要從這樣一層地基上長(zhǎng)出來(lái)。
![]()
正如夏立雪在現(xiàn)場(chǎng)說(shuō)的:「讓智能無(wú)所不能,是AGI,而讓智能無(wú)處不在,是AGI Infra。」
他們?cè)赪AIC上按下的,正是讓這層地基自我優(yōu)化與進(jìn)化的那個(gè)開(kāi)關(guān)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.