![]()
新智元報道
![]()
Agentic AI,應該運行在什么樣的計算底座上?
幾天過去,WAIC 2026上最擁擠的概念之一——Agent Computer——開始從展臺上的新鮮感,變成一道真正的工程題。
讓一臺設備在本地跑起大模型,已經不算最難的部分。更難的是,當Agent要持續(xù)讀取文件、保留記憶、調用工具,并在后臺長期運行時,芯片能否在功耗、延遲和成本的約束下保持穩(wěn)定。
這會改寫端側芯片的評價方式。TOPS、模型參數和每秒Token仍然重要,但如果內存帶寬跟不上、CPU與NPU協(xié)同不順、軟件棧無法維持任務狀態(tài),再漂亮的峰值也可能只夠完成一次Demo。
我們注意到,本周,新加坡公司Acrab舉行了一場線上發(fā)布會,并發(fā)布了Agent Box,這也許給出了一個可供拆解的樣本。
在這場發(fā)布會里,這家AI Infra公司把Prefill、統(tǒng)一內存、CPU-NPU異構協(xié)同和Agent編排同時擺上了臺面。
這些關鍵詞指向同一個判斷:端側AI正在從「運行一個模型」,走向「長期運行一套智能系統(tǒng)」。
芯片要解決的,也不再只是算力夠不夠,而是數據如何流動、任務如何調度、軟硬件如何持續(xù)協(xié)同。
所以,當WAIC的熱鬧和新品發(fā)布、行業(yè)趨勢逐漸沉淀下來,真正值得追問的問題反而更清楚了:當Agent從一次調用變成持續(xù)工作之后,端側芯片究竟要重做什么?
![]()
從一次推理到持續(xù)工作
Agent改變了端側負載
聊天機器人通常完成一輪問答。Agent接到一個任務后,可能先搜索資料、讀取文件,再調用代碼、瀏覽器、日歷或辦公軟件;完成一部分后檢查結果,保留任務狀態(tài),等待下一次觸發(fā)。一次任務往往涉及多輪模型調用,也會在不同模型、工具和應用之間反復切換。
Acrab在發(fā)布會中展示了一個相對完整的任務流程:用戶提出想為孩子制作一份太空主題禮物,系統(tǒng)繼續(xù)給出創(chuàng)意、協(xié)助選擇方案、調用相關工具并跟進制作進度;當環(huán)境里出現新的狀況,它又可以連接其他智能設備進行處理。
這段演示的意義不在于某一次回答有多聰明,而在于一句自然語言能否被轉化為一串連續(xù)動作。對于計算系統(tǒng)來說,Agent不再只是「調用一次模型」,而是在模型、數據、軟件和設備之間持續(xù)切換。
這種工作方式首先放大了端云之間的分工。
單次推理的費用可能不高,但調用變得高頻、持續(xù)之后,Token就會從技術指標變成真實賬單;一次網絡等待對聊天影響有限,放進多步任務中卻會逐層累積;Agent要掌握更完整的個人上下文,數據反復往返云端,也會擴大暴露面。
因此,端側和云端并不是非此即彼。更加現實的結構是:高頻、隱私敏感、需要快速響應和長期保持狀態(tài)的任務盡可能留在本地;超過設備能力邊界的復雜推理,再調用云端資源。
真正的變化在于,端側不再只承載一次模型推理,而要承載一套不能輕易中斷的智能系統(tǒng)。
它既要運行大模型,也要處理長上下文、多任務和工具調用;性能必須足夠強,功耗和成本又不能失控,Runtime、工具鏈和Agent生態(tài)也必須同時跟上。
端側大模型解決的是模型能不能裝進設備,Agentic AI要解決的,則是模型、記憶、工具和應用能不能在設備里長期協(xié)同。
![]()
只堆NPU不夠
CPU、內存和軟件棧必須一起重做
過去在CPU或SoC里增加一塊NPU,就能讓終端多出語音識別、圖像處理等AI能力。但當Agent從附加功能變成設備的核心,簡單增加峰值算力已經不夠。
原因在于,Agent并不是一條固定的神經網絡推理鏈路。大規(guī)模并行計算適合交給NPU,任務拆解、條件判斷、系統(tǒng)調度、工具調用、異常處理和多系統(tǒng)協(xié)作,則高度依賴CPU。任務路徑越動態(tài),CPU與NPU之間的協(xié)調就越重要。
Acrab CEO Ken Phua將這種變化概括為:「CPU再次回到AI時代的中心。」
在他的判斷中,AI正在進入異構計算環(huán)境,執(zhí)行效果不只取決于NPU性能,更取決于CPU與NPU能否無縫協(xié)同。
這也是Acrab少數值得展開的團隊線索。
Ken Phua曾在Arm UK帶領亞太應用工程團隊,并參與全球IP策略制定,之后擔任Arm China聯(lián)席CEO。
這段經歷的意義并不只是行業(yè)履歷,而是解釋了這家公司為什么會從CPU架構、異構計算和真實應用需求的交叉位置,重新定義Agent工作負載。
Acrab沒有把GΞLIX 1定義為一顆傳統(tǒng)AI處理器,而是將它作為端側AI時代的計算平臺。
硬件側以GΞLIX 1為核心;軟件側覆蓋大模型、優(yōu)化后的Runtime、完整工具鏈,以及連接模型、工具、設備和服務的Agent編排層;在此基礎上,公司還提供面向典型場景的Agent參考設計,幫助開發(fā)者和生態(tài)伙伴更快構建應用。
Agent Box則是這套軟硬件平臺第一次以完整產品形態(tài)出現。它被定義為Personal AI Center,可以在本地運行千億參數級模型,即使沒有網絡連接,也能保持核心能力。
Acrab取自Agentic Compute、Reasoning、Action與Brain的首字母,也恰是天文學中一個多恒星系統(tǒng)的名字——正如其設計哲學:讓不同的計算單元,像恒星系統(tǒng)一樣協(xié)同運轉。
公司以此為目標,為Agent打造一顆能思考與行動的大腦,構筑下一代計算平臺。
總部位于新加坡的Acrab,已累計融資超過3.5億美元,投資方包括淡馬錫旗下全球風投平臺Vertex(祥峰投資)、新加坡知名科技投資機構K3 Ventures等。
其第一代計算平臺GΞLIX已經在要求嚴苛的真實部署環(huán)境中完成驗證,目前正走向首次行業(yè)導入和規(guī)模化生產。
融資可以為重工程購買時間,但真正決定路線能否成立的,仍然是系統(tǒng)能否交付。
從這個角度看,「CPU重新回到中心」并不意味著NPU不再重要。
恰恰相反,它意味著AI計算已經復雜到,無法再依靠一顆孤立的加速器解決所有問題。
![]()
700 TOPS之外
Prefill和數據通路決定真實體驗
很多時候,大模型推理的瓶頸并不只是計算單元不夠快,而是數據來不及送到計算單元。
芯片即使擁有很高的峰值算力,如果內存帶寬跟不上,NPU仍然要停下來等待。
Agent會進一步放大數據搬運問題。它需要頻繁讀取歷史記錄,在不同模型和軟件之間傳遞數據,并持續(xù)保存任務狀態(tài)。每一次復制都會增加延遲和功耗,任務運行得越久,系統(tǒng)設計的重要性就越高。
GΞLIX 1的設計重點,正是把模型需要的數據盡量留在距離計算單元更近的位置,并減少CPU、NPU、內存和不同操作系統(tǒng)之間的來回搬運。
按照Acrab公開的架構,GΞLIX 1提供大于700 TOPS的AI算力和273GB/s的統(tǒng)一內存帶寬,芯片內部配置8MB L1 Cache、帶寬達到768GB/s的共享L2 Cache、四顆并行NPU核心,以及針對Attention計算設計的專用加速模塊。
Acrab稱,后者可以將相關計算效率提高到三倍。
![]()
更大的片上緩存,可以讓關鍵數據離計算單元更近;共享L2 Cache讓參數和中間特征在計算單元之間高效共享;統(tǒng)一內存架構則減少模型、操作系統(tǒng)和應用之間不必要的數據復制。
Acrab還采用多系統(tǒng)統(tǒng)一內存架構,讓不同操作系統(tǒng)更高效地共享內存。對于只運行一個模型的設備,這可能只是效率優(yōu)化;對于需要不斷跨應用、跨工具工作的Agent,它會直接影響任務能不能順暢推進。
這也解釋了為什么Acrab把Prefill放到發(fā)布會的中心位置。Agent在引入新文件、恢復任務狀態(tài)或更新上下文時,往往需要再次處理新增信息。任務鏈越長,Prefill效率對整體體驗的影響就越明顯。
在Acrab披露的一組自測中,GΞLIX 1運行260億參數Gemma模型,使用40K KV Cache和1萬Token輸入,Prefill速度超過每秒1416個Token;在相同負載下,其表現是某主流通用桌面平臺的7倍以上。
Acrab還將GΞLIX 1與一款同類桌面級AI計算平臺放在同一測試框架下比較。
數據顯示,GΞLIX 1在Prefill和Decode兩項核心指標上進入相近的性能區(qū)間,同時呈現出更低的功耗和更具競爭力的整機成本。
Acrab選擇強調Prefill和數據通路,本身說明了一種產品取向:端側Agent芯片不能只追求模型輸出得有多快,還要解決模型能否快速讀懂長上下文、恢復任務狀態(tài)并開始工作。
用戶不會關注一條推理鏈路內部經過了多少層緩存,也不會在每次交互前查看TOPS。用戶真正感受到的只有三件事:它能否迅速理解、能否持續(xù)運行,以及擁有它是否足夠劃算。
從芯片到平臺
真正的競爭在參數之外
今年WAIC出現的Agent Computer、個人AI中心和企業(yè)端側設備,還沒有形成統(tǒng)一的產品形態(tài)。
家庭場景更強調個人記憶、內容和設備協(xié)同,企業(yè)場景更看重知識庫、文件處理和內部數據安全。不同客戶對模型大小、內存容量、功耗和接口的要求差別很大。
終端越碎片化,計算平臺就越難做。一顆芯片很難只靠參數覆蓋所有場景,還需要提供Runtime、模型適配、開發(fā)工具和Agent框架,幫助客戶把底層算力轉化為能夠交付的產品。
這也是Agentic AI芯片比普通推理芯片多出來的一道題:芯片性能決定模型能不能運行,軟件棧決定開發(fā)者能不能把它用起來,Agent生態(tài)則決定設備最終能夠完成什么任務。任何一層缺失,都可能讓一顆參數漂亮的芯片停留在Demo階段。
Acrab試圖把這些環(huán)節(jié)同時抓在手里。好處是產品定義更加完整,風險也很直接:戰(zhàn)線很長。
芯片要證明性能、穩(wěn)定性和規(guī)模化交付能力,軟件棧要追上模型的快速迭代,Agent編排層還要兼容不斷變化的工具和應用。個人文件和長期記憶留在本地之后,權限隔離、插件安全和操作審計也必須同步解決。
因此,Acrab能否成為Agentic AI時代的計算平臺,最終不取決于發(fā)布會上跑出了多少Token,也不取決于Agent Box能夠演示多少個任務。
更關鍵的驗證是:開發(fā)者能否在這套平臺上快速做出產品;Agent連續(xù)工作數小時之后,性能、功耗和穩(wěn)定性能否同時成立;當模型和Agent框架繼續(xù)變化時,底層軟硬件能不能跟上。
架構創(chuàng)新決定一家芯片公司的能力上限,工程化和生態(tài)則決定這個上限能不能變成訂單。
![]()
WAIC上密集出現的新終端,說明行業(yè)正從「把大模型跑起來」走向「讓Agent持續(xù)工作」。前一階段比算力、內存和模型大小;下一階段還要解決長上下文、個人記憶、工具調用與多任務協(xié)同。
Acrab押注的正是這一變化。
Agent Box不是終點,而是一次平臺能力的公開測試。
端側芯片需要「重做」,不是因為TOPS不重要,而是Agent正把計算從峰值數字變成長期運行的系統(tǒng)能力。它能否成立,最終要看這套芯片、軟件和終端能否進入真實工作流。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.