![]()
本文工作由伊利諾伊大學(xué)厄巴納 - 香檳分校(UIUC)DREAM Lab 團(tuán)隊(duì)完成。通訊作者 Haohan Wang 教授為 UIUC 信息科學(xué)學(xué)院教授、DREAM Lab 負(fù)責(zé)人,研究方向包括可信人工智能、大語(yǔ)言模型與多智能體系統(tǒng)。
![]()
- 論文標(biāo)題:Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems
- 論文鏈接:https://arxiv.org/pdf/2602.03695
- 實(shí)驗(yàn)室網(wǎng)址:https://dream.ischool.illinois.edu/
背景與動(dòng)機(jī)
多智能體系統(tǒng)(Multi-Agent Systems,MAS)展示了令人印象深刻的能力:一個(gè)模型負(fù)責(zé)提出方案,另一個(gè)模型進(jìn)行批評(píng),還有模型承擔(dān)投票、規(guī)劃或執(zhí)行。通過(guò)角色分工和多輪協(xié)作,系統(tǒng)能夠解決單個(gè)模型難以穩(wěn)定完成的數(shù)學(xué)推理、代碼生成和知識(shí)問(wèn)答任務(wù)。
![]()
一個(gè) MAS 的例子。出自我們 team 的 TMLR survey paper:Chen, K., Wang, P., Yu, Y., Zhan, X., & Wang, H. (2025). Large language model-based data science agent: A survey. arXiv preprint arXiv:2508.02744.
但這種能力背后,存在一個(gè)容易被忽略的工程問(wèn)題:今天的大多數(shù) MAS 都是圍繞具體任務(wù)手工搭建的。面對(duì)一個(gè)新問(wèn)題,研究者往往需要重新定義 Agent 角色、重新設(shè)計(jì)提示詞、重新規(guī)定消息的傳遞順序,并不斷調(diào)試協(xié)作協(xié)議。換一個(gè)數(shù)據(jù)集、一個(gè)模型,甚至一個(gè)任務(wù)表述,原來(lái)的架構(gòu)就可能需要大幅修改。
這與現(xiàn)代深度學(xué)習(xí)的發(fā)展路徑形成了鮮明對(duì)比。構(gòu)建卷積神經(jīng)網(wǎng)絡(luò)時(shí),我們不會(huì)為每一個(gè)視覺(jué)任務(wù)重新發(fā)明卷積;搭建 Transformer 時(shí),也不需要從頭設(shè)計(jì)注意力機(jī)制。成熟的神經(jīng)網(wǎng)絡(luò)之所以能夠快速演進(jìn),部分原因正是研究社區(qū)找到了卷積、注意力、殘差連接等可復(fù)用的基礎(chǔ)構(gòu)件。
那么,多智能體系統(tǒng)是否也能擁有類(lèi)似的抽象形式呢?是否可以把復(fù)雜的 Agent 工作流拆解成少量穩(wěn)定、通用的計(jì)算單元,再像搭樂(lè)高一樣,將它們按需組合起來(lái)呢?
Agent Primitives 給出的答案是:多智能體系統(tǒng)也可以擁有自己的「基礎(chǔ)模塊」。
從「復(fù)用 Agent」到「復(fù)用協(xié)作模式」
Agent Primitives 的出發(fā)點(diǎn),是重新審視 MAS 中什么才是真正應(yīng)該被復(fù)用的對(duì)象。傳統(tǒng)方法通常把一個(gè) Agent 看成原子單元:它擁有固定身份、固定提示詞,并在系統(tǒng)中承擔(dān)一個(gè)預(yù)先規(guī)定的角色。但「數(shù)學(xué)專(zhuān)家」、「代碼審查員」或「規(guī)劃者」這些角色,本身往往與任務(wù)高度綁定,很難直接遷移。
論文觀察到,盡管不同 MAS 的角色名稱(chēng)和流程看起來(lái)五花八門(mén),它們內(nèi)部反復(fù)執(zhí)行的計(jì)算模式卻高度相似:有的系統(tǒng)讓模型生成答案后進(jìn)行自我審查;有的系統(tǒng)并行生成多個(gè)候選,再通過(guò)比較達(dá)成共識(shí);還有的系統(tǒng)先把復(fù)雜目標(biāo)拆成計(jì)劃,再逐步執(zhí)行。
因此,論文不再把 Agent 當(dāng)作最小構(gòu)件,而是進(jìn)一步向下拆解,把這些反復(fù)出現(xiàn)的內(nèi)部計(jì)算模式抽象為 Agent Primitives,即面向大語(yǔ)言模型多智能體系統(tǒng)的、可復(fù)用的潛在構(gòu)件。
基礎(chǔ)的 Primitives
論文實(shí)例化了三類(lèi)基礎(chǔ) primitive。它們并非試圖窮盡所有協(xié)作方式,而是從現(xiàn)有 MAS 中提煉出三種高頻、互補(bǔ)的計(jì)算結(jié)構(gòu)。
Review Primitive:
把「生成 — 批評(píng) — 修正」變成通用循環(huán)
Review Primitive 對(duì)應(yīng)的是多智能體系統(tǒng)中最常見(jiàn)的迭代改進(jìn)模式。模型先形成一個(gè)候選解答,隨后對(duì)其中的推理漏洞、事實(shí)錯(cuò)誤或?qū)崿F(xiàn)缺陷進(jìn)行審查,再依據(jù)反饋更新答案。這個(gè)過(guò)程可以重復(fù)進(jìn)行,直到輸出趨于穩(wěn)定。
它的價(jià)值不只是增加一次「請(qǐng)檢查答案」的提示。通過(guò)把審查與修正封裝成獨(dú)立 primitive,系統(tǒng)可以在數(shù)學(xué)證明、代碼調(diào)試、開(kāi)放域問(wèn)答等任務(wù)中復(fù)用同一種計(jì)算結(jié)構(gòu),而無(wú)需為每個(gè)任務(wù)重新設(shè)計(jì)一套 critic 和 refiner。
Voting & Selection Primitive:
在多個(gè)候選中形成共識(shí)
當(dāng)一個(gè)問(wèn)題存在多條合理推理路徑時(shí),單次生成容易受到采樣波動(dòng)影響。Voting & Selection Primitive 讓系統(tǒng)并行探索多個(gè)候選,再對(duì)這些潛在表示進(jìn)行比較、聚合和選擇。
傳統(tǒng)投票通常依賴(lài)最終文本答案:先把每條推理完整解碼,再通過(guò)字符串匹配或額外提示進(jìn)行選擇。相比之下,該 primitive 直接作用于內(nèi)部潛在表示,使系統(tǒng)能夠保留候選方案中更豐富的語(yǔ)義和推理信息,而不是只依據(jù)已經(jīng)壓縮成文本的結(jié)果做決定。
Planning & Execution Primitive:
將高層規(guī)劃與底層執(zhí)行分離
復(fù)雜任務(wù)往往不是「想得更多」就能解決,而是需要先確定做什么,再?zèng)Q定如何做。Planning & Execution Primitive 把高層任務(wù)分解和低層步驟執(zhí)行拆開(kāi):規(guī)劃階段建立整體路線,執(zhí)行階段圍繞子目標(biāo)逐項(xiàng)完成,并把中間狀態(tài)繼續(xù)傳遞。
這種分離可以降低模型在長(zhǎng)任務(wù)中同時(shí)維護(hù)全局目標(biāo)與局部細(xì)節(jié)的負(fù)擔(dān),也讓同一個(gè)規(guī)劃結(jié)構(gòu)能夠適配數(shù)學(xué)推導(dǎo)、程序編寫(xiě)與多階段問(wèn)答等不同問(wèn)題。
繞過(guò)自然語(yǔ)言瓶頸
僅僅把工作流命名為 primitive,還不足以解決現(xiàn)有 MAS 的根本局限。大多數(shù)多智能體系統(tǒng)通過(guò)自然語(yǔ)言交換信息:一個(gè) Agent 把內(nèi)部思考解碼成文本,另一個(gè) Agent 再讀取文本并重新編碼。每經(jīng)過(guò)一輪,信息都要經(jīng)歷一次「潛在表示 — 文本 — 潛在表示」的轉(zhuǎn)換。
這種方式直觀、可讀,卻也代價(jià)高昂。文本解碼會(huì)丟失內(nèi)部表示中的細(xì)粒度信息;長(zhǎng)鏈路交互會(huì)不斷積累噪聲和誤差;重復(fù)生成與讀取大量文本,則帶來(lái)可觀的 token 開(kāi)銷(xiāo)和推理延遲。系統(tǒng)中的 Agent 越多、協(xié)作輪數(shù)越長(zhǎng),這種通信瓶頸越明顯。
Agent Primitives 讓 primitive 內(nèi)部直接通過(guò) Key-Value Cache(KV Cache)進(jìn)行潛在通信。KV Cache 原本用于保存 Transformer 已處理 token 的注意力狀態(tài),避免自回歸生成時(shí)重復(fù)計(jì)算。論文進(jìn)一步把它作為 primitive 之間傳遞內(nèi)部信息的載體,使后續(xù)模塊能夠直接繼承前序計(jì)算形成的潛在狀態(tài),而不必先將其完整解碼為自然語(yǔ)言。
在連接不同階段的 KV Cache 時(shí),系統(tǒng)還需要處理位置編碼的一致性。論文通過(guò)旋轉(zhuǎn)位置編碼(RoPE)的重新編碼與對(duì)齊,使來(lái)自不同計(jì)算階段的緩存能夠被后續(xù)模塊正確接續(xù)。由此,多個(gè) primitive 不只是概念上可以組合,在模型內(nèi)部的計(jì)算狀態(tài)層面也能夠真正「插接」起來(lái)。
論文用實(shí)驗(yàn)證明了利用自然語(yǔ)言處理時(shí),長(zhǎng)上下文中的任務(wù)遺忘:在長(zhǎng)上下文的開(kāi)頭、中間或結(jié)尾注入一條輔助指令,比較兩種通信方式能否在完成原始任務(wù)的同時(shí)保留新增約束。結(jié)果顯示,當(dāng)指令位于上下文中間時(shí),自然語(yǔ)言通信的指令遵循率驟降至 15.6%,而 KV Cache 通信仍達(dá)到 73.3%。
![]()
論文進(jìn)一步考察了通信噪聲對(duì)多智能體協(xié)作的影響。具體而言,研究者在數(shù)學(xué)推理歷史中逐步插入來(lái)自其他問(wèn)題的無(wú)關(guān)推理句子,以模擬 Agent 交互過(guò)程中不斷累積的噪聲。實(shí)驗(yàn)結(jié)果顯示,當(dāng)插入 3 條無(wú)關(guān)句子時(shí),自然語(yǔ)言通信的準(zhǔn)確率已下降至 73%;當(dāng)噪聲增加到 10 條時(shí),準(zhǔn)確率進(jìn)一步降至 47%。相比之下,KV Cache 通信在相同設(shè)置下仍能分別保持 100% 和 93% 的準(zhǔn)確率。
![]()
上述結(jié)果表明,相較于自然語(yǔ)言通信,基于 KV Cache 的潛在通信能夠更完整地保留前序推理狀態(tài),并顯著降低無(wú)關(guān)信息在多階段交互中的累積影響,從而提升多智能體系統(tǒng)在噪聲環(huán)境下的通信穩(wěn)定性與推理魯棒性。
誰(shuí)來(lái)決定如何搭這些「積木」?
有了可復(fù)用構(gòu)件,下一個(gè)問(wèn)題是:面對(duì)一個(gè)新查詢(xún),系統(tǒng)應(yīng)該選擇哪種 primitive,又應(yīng)該以什么順序組合?如果仍然由人手工指定,架構(gòu)設(shè)計(jì)的負(fù)擔(dān)并沒(méi)有真正消失。
為此,論文引入了一個(gè)自動(dòng)化的 LLM Organizer。Organizer 首先分析當(dāng)前查詢(xún)的性質(zhì)與難點(diǎn),再?gòu)?primitive 集合中選擇合適的模塊并組織執(zhí)行流程。例如,需要驗(yàn)證和修正的任務(wù)可以調(diào)用 Review;存在多種候選路徑的問(wèn)題可以加入 Voting & Selection;長(zhǎng)程復(fù)雜任務(wù)則更適合先使用 Planning & Execution,再對(duì)局部結(jié)果進(jìn)行審查。多個(gè) primitive 也可以串聯(lián)或嵌套,形成更完整的 MAS。
Organizer 的決策由一個(gè)輕量級(jí) Knowledge Pool 提供參考。Knowledge Pool 記錄過(guò)去任務(wù)中成功的 primitive 配置,讓系統(tǒng)能夠利用已有經(jīng)驗(yàn),而不是針對(duì)每個(gè)新查詢(xún)從零開(kāi)始搜索。隨著成功配置不斷積累,構(gòu)建 MAS 逐漸從「手工設(shè)計(jì)一條固定工作流」,轉(zhuǎn)變?yōu)椤父鶕?jù)問(wèn)題動(dòng)態(tài)檢索并組合基礎(chǔ)構(gòu)件」。
方法框圖
完整框架如下圖所示。Organizer 根據(jù)用戶(hù)查詢(xún)和 Knowledge Pool 中的歷史經(jīng)驗(yàn)選擇并組合 primitives;Review、Voting and Selection、Planning and Execution 分別封裝三類(lèi)可復(fù)用協(xié)作模式;所有 primitive 的內(nèi)部協(xié)調(diào)均通過(guò) KV Cache 完成,并對(duì)外保留與普通 LLM Agent 一致的接口。
![]()
實(shí)驗(yàn)結(jié)果
論文在數(shù)學(xué)、代碼和知識(shí)問(wèn)答等八個(gè)基準(zhǔn)、五種大語(yǔ)言模型骨干上進(jìn)行了系統(tǒng)評(píng)估。實(shí)驗(yàn)關(guān)注的不只是最終準(zhǔn)確率,也同時(shí)比較 token 使用、推理延遲、相對(duì)單智能體的額外開(kāi)銷(xiāo),以及跨模型骨干的穩(wěn)定性。
![]()
從具體任務(wù)來(lái)看,Primitives-based MAS 在數(shù)學(xué)推理、代碼生成和知識(shí)問(wèn)答上均取得了穩(wěn)定提升,并且沒(méi)有出現(xiàn)傳統(tǒng) MAS 方法在部分任務(wù)上提升、在另一些任務(wù)上明顯退化的情況。更重要的是,這種性能增益并不是依靠無(wú)限增加 Agent 數(shù)量或生成更長(zhǎng)的交互文本獲得的。綜合準(zhǔn)確率、token 消耗、推理延遲和跨模型表現(xiàn),可以將 Agent Primitives 的主要實(shí)驗(yàn)結(jié)果概括如下:
![]()
這些數(shù)字揭示了一個(gè)重要事實(shí):多智能體協(xié)作并不必然意味著數(shù)倍乃至數(shù)十倍的推理成本。傳統(tǒng) MAS 的高開(kāi)銷(xiāo),很大一部分來(lái)自重復(fù)文本生成和冗長(zhǎng)通信,而不完全來(lái)自解決問(wèn)題本身所需的有效計(jì)算。當(dāng)協(xié)作被重新組織為潛在空間中的模塊化計(jì)算后,系統(tǒng)可以在保留性能增益的同時(shí),把額外成本控制在更接近單智能體推理的范圍內(nèi)。
走向可組合的智能系統(tǒng)
今天構(gòu)建 MAS,仍然很像早期編寫(xiě)神經(jīng)網(wǎng)絡(luò):大量能力被寫(xiě)死在具體架構(gòu)中,每個(gè)新任務(wù)都需要重新搭建。Agent Primitives 提出了一條不同的路線 —— 把角色背后的協(xié)作規(guī)律抽離出來(lái),封裝為潛在空間中的標(biāo)準(zhǔn)構(gòu)件,再由 Organizer 根據(jù)任務(wù)動(dòng)態(tài)組合。
如果這種思路進(jìn)一步成熟,未來(lái)開(kāi)發(fā)者面對(duì)復(fù)雜任務(wù)時(shí),或許不必先問(wèn)「我需要設(shè)計(jì)幾個(gè) Agent、分別寫(xiě)什么 prompt」,而可以先問(wèn):「這個(gè)問(wèn)題需要哪些基礎(chǔ)計(jì)算模式,它們應(yīng)該怎樣連接?」
從重復(fù)造輪子,到復(fù)用基礎(chǔ)模塊;從文本消息驅(qū)動(dòng)的固定團(tuán)隊(duì),到潛在狀態(tài)連接的動(dòng)態(tài)系統(tǒng),這正是 Agent Primitives 希望推動(dòng)的范式轉(zhuǎn)變。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.