市面上已有幾十種Agent記憶方案,有的基于向量檢索,有的基于知識圖譜,有的靠定期總結(jié)“壓縮”對話,有的則完全依賴模型自身的上下文窗口。它們各有各的說法,但在系統(tǒng)層面,到底哪種方案靠得住?哪種方案在你的工作負(fù)載下既不貴又準(zhǔn)?
如果你正糾結(jié)于這個問題,那么上海交通大學(xué)和清華大學(xué)最近聯(lián)合發(fā)表的一篇論文一定值得你看一看:
![]()
這篇論文研究覆蓋了12種具代表性的Agent記憶系統(tǒng)、5類workloads、11個數(shù)據(jù)集,研究者把記憶系統(tǒng)當(dāng)成一個數(shù)據(jù)管理系統(tǒng)來拆解、測試、定量比較,還做了大量細(xì)粒度消融實(shí)驗(yàn)。
![]()
本文將圍繞他們的核心發(fā)現(xiàn)展開。我們不談概念,只談現(xiàn)象、數(shù)據(jù)和可復(fù)現(xiàn)的結(jié)論。
五個關(guān)鍵問題,12個系統(tǒng),11個數(shù)據(jù)集
研究者在統(tǒng)一測試平臺上運(yùn)行了12個具代表性的記憶系統(tǒng) + 2個基線(純長上下文、Embedding RAG),覆蓋三類典型場景:
LoCoMo:長對話QA,考察事實(shí)召回、時序推理、開放域記憶;
LongMemEval:跨會話記憶,要求系統(tǒng)能把散落在多個會話中的事實(shí)關(guān)聯(lián)起來;
DB-Bench(來自LifelongAgentBench):模擬數(shù)據(jù)庫操作場景,考察記憶系統(tǒng)是否支持有狀態(tài)的過程執(zhí)行(INSERT/UPDATE依賴鏈)。
評測圍繞五個RQ(研究問題)展開。以下是參與測試的12個記憶框架:
![]()
圖結(jié)構(gòu)類型(Zep、Memo、Cognee):用節(jié)點(diǎn)和邊建模實(shí)體間關(guān)系,支持沿關(guān)系追溯。Zep額外維護(hù)時間有效性標(biāo)志,適合審計事實(shí)變化軌跡;Cognee在圖上疊加社區(qū)摘要,適合跨會話聚合同一主題。
層次結(jié)構(gòu)類型(MemTree、Letta):MemTree用動態(tài)樹組織記憶,葉子存細(xì)節(jié)、祖先存摘要,查詢時做全局相似度匹配,適合“先定位場景再查細(xì)節(jié)”的負(fù)載。Letta做兩級存儲——核心記憶(上下文內(nèi))加外存(向量庫),LLM通過函數(shù)調(diào)用主動換頁,適合上下文窗口受限的部署。
扁平輕量類型(LightMem、SimpleMem、Mem0):LightMem做追加式向量寫入和最近鄰搜索,延遲最低。SimpleMem在向量之外維護(hù)BM25和SQL謂詞索引,并引入LLM做查詢意圖規(guī)劃。Mem0寫入時抽取獨(dú)立事實(shí)存入向量庫,適合用戶畫像維護(hù),但更新場景表現(xiàn)脆弱。
復(fù)合多引擎類型(MemOS、MemoryOS、A-MEM、MemoChat):MemOS定義統(tǒng)一數(shù)據(jù)對象MemCube,底層委托給多個專用后端,在LoCoMo精確匹配上排第一。MemoryOS融合稠密和稀疏檢索,用Heat值做優(yōu)先級淘汰。A-MEM用KNN錨點(diǎn)后做局部圖遍歷,支持稠密-稀疏融合權(quán)重調(diào)節(jié)。MemoChat把結(jié)構(gòu)化JSON記憶塊直接放在上下文里,不依賴外部數(shù)據(jù)庫,適合話題集中的長對話。
![]()
下面我們直接看結(jié)論。
RQ1:不同系統(tǒng)在不同workload下都有效嗎?
結(jié)論:沒有一種系統(tǒng)能通吃所有場景。最佳選擇取決于你的任務(wù)瓶頸。
![]()
LongMemEval(跨會話聚合、事件順序推理):圖/時序組織型系統(tǒng)領(lǐng)先。Zep的LLM Judge準(zhǔn)確率達(dá)到48.0,Cognee的ROUGE-L F1達(dá)到35.3。
LoCoMo(長對話中精確事實(shí)定位):混合過濾/粗到精路由的系統(tǒng)更優(yōu)。MemOS的Exact Match達(dá)到11.5。
DB-Bench(狀態(tài)變更依賴鏈):保留完整交互軌跡的系統(tǒng)更強(qiáng)。純長上下文基線的EM達(dá)到48.20,MemoChat的任務(wù)成功率高達(dá)55.40。
研究者的判斷是:強(qiáng)記憶系統(tǒng)不是靠某一種“萬能表示”,而是取決于它能否在正確的抽象層級上保留關(guān)鍵證據(jù)。
RQ2:記憶系統(tǒng)檢索證據(jù)有多準(zhǔn)?
研究者專門評估了“檢索到標(biāo)注的黃金證據(jù)”的準(zhǔn)確率,而不是下游答案生成。
![]()
幾個有意思的現(xiàn)象:
- SimpleMem在Recall@1上最高(39.0%),說明它最擅長把最相關(guān)的那一條證據(jù)頂?shù)阶钋懊妫?/li>
但隨著需要的證據(jù)數(shù)量增加(Recall@5/10),A-MEM和MemTree明顯更強(qiáng)(A-MEM達(dá)到69.5/85.9),而且隨證據(jù)時間距離增大,衰減更緩慢;
- 普通Embedding RAG在短期證據(jù)上還不錯,一旦證據(jù)距離拉大,掉得很快。
研究者歸納為三種不同的檢索行為:
壓縮型記憶:擅長快速定位單條高相關(guān)事實(shí);
鏈接/層次化記憶:擅長把分散的、跨會話的證據(jù)組裝起來;
純稠密檢索:只在證據(jù)離當(dāng)前上下文較近時有效。
對你選型的啟示:如果你的業(yè)務(wù)場景經(jīng)常需要“把幾條散落在不同時間點(diǎn)的信息拼起來回答問題”,那就要優(yōu)先考慮帶顯式結(jié)構(gòu)(圖或樹)的記憶系統(tǒng),而不是只看Recall@1高的方案。
RQ3:動態(tài)更新下還穩(wěn)嗎?
研究者做了兩件事:一是測試“知識修正后能否正確回答時效性問題”,二是替換底層LLM看行為是否穩(wěn)定。
![]()
關(guān)鍵發(fā)現(xiàn):
圖/關(guān)系組織的記憶在直接事實(shí)修正上最可靠(Zep在Knowledge Update上Substring EM達(dá)44.4);
時序推理(要求區(qū)分“舊版本”和“新版本”) 上,Cognee最強(qiáng)(ROUGE-L F1 35.8);
對“當(dāng)前有效狀態(tài)”的精確查詢,MemOS的EM最高(8.9)。
穩(wěn)定性方面:替換LLM骨干(從較弱到較強(qiáng)模型)會整體提升答案質(zhì)量,但哪種記憶方案更優(yōu)的順序幾乎不變。這說明:判斷“哪個事實(shí)是當(dāng)前有效的”這件事,主要取決于記憶系統(tǒng)的組織方式,而不是LLM的推理能力。 強(qiáng)模型只是把已經(jīng)定位好的證據(jù)表達(dá)得更好,并不能彌補(bǔ)記憶層對時間狀態(tài)的錯誤保留。
![]()
RQ4:長周期下會退化嗎?
研究者分別測量了隨著上下文長度增長、跨會話數(shù)量增長、證據(jù)時間距離增長,系統(tǒng)性能如何變化。
![]()
統(tǒng)一結(jié)論:當(dāng)時間或距離拉長時,真正的問題不是“記不住更多東西”,而是“表示方式是否還能把遠(yuǎn)距離事實(shí)與當(dāng)前查詢連接起來”。
- 純長上下文方法在LongBench上從Short桶(42.6)掉到Medium(19.0),證明單純堆上下文在引入干擾項(xiàng)后快速惡化;
- 在LoCoMo上,Embedding RAG從證據(jù)距離最近時的37.1跌到最遠(yuǎn)時的7.4,而Cognee、MemOS、MemoryOS衰減幅度小得多;
跨會話場景(LongMemEval)也呈現(xiàn)同樣規(guī)律:保留實(shí)體-事件-時間關(guān)系的系統(tǒng),退化明顯更慢。
研究者測量了平均操作延遲/query(含構(gòu)建+查詢) 以及標(biāo)準(zhǔn)化效用。
![]()
結(jié)論很直白:結(jié)構(gòu)的豐富度本身不是成本高的原因,“維護(hù)范圍”才是。
- LightMem和MemTree處于最強(qiáng)的性價比前沿。LightMem用3.67秒達(dá)到48.3歸一化效用;MemTree用15.9秒達(dá)到63.5。
- 高效用系統(tǒng)會明顯變貴:MemoryOS達(dá)到82.0效用需要28.6秒,Cognee和Zep超84效用分別需要116.5秒和155.1秒。
- 在LongBench這類長上下文workload下,差距更加極端:LightMem 17.3秒,MemTree 116.7秒,而MemoryOS、A-MEM等上升到400-550秒級別。
研究者的判斷非常明確:如果維護(hù)操作需要反復(fù)重組全局狀態(tài),那么再好的組織效果也會被成本抵消。
消融實(shí)驗(yàn):什么設(shè)計真正起作用
端到端對比只能看出系統(tǒng)間的差異,但說不清是哪個模塊導(dǎo)致的。研究者做了大量“單模塊變異”實(shí)驗(yàn),這里提煉幾個直接可用的結(jié)論。
M1:表示與存儲 — 保留原始內(nèi)容比抽象更重要 ![]()
LightMem的
User-Only Raw在LoCoMo上Answer F1 38.9,EM 24.2;User-Only Summary驟降到15.6和8.5。User-Only Compressed(去除填充詞但保留原始措辭)在LoCoMo上幾乎不降(38.6/23.6),但在LongMemEval上從26.0 Substring EM降到10.7。- MemTree的深層設(shè)置相對于扁平設(shè)置僅帶來微弱增益(18.7 vs 18.2 EM,31.2 vs 30.7 F1)。
取走的信息,再好的結(jié)構(gòu)也找不回來。 抽象和層次化能改善導(dǎo)航,但不能恢復(fù)在表示階段丟棄的細(xì)節(jié)。
M2:提取 — 覆蓋保存比選擇性提取更穩(wěn)定 ![]()
- MemoChat的啟發(fā)式話題分割在LongMemEval上明顯優(yōu)于LLM話題分割(10.7 vs 7.3 Substring EM),LoCoMo幾乎持平。
MemOS的
Fast Memorize在LoCoMo上遠(yuǎn)超Fine Memorize(25.5 vs 2.5 EM),盡管在后者的LongMemEval上略低。LightMem的
Hybrid Raw(同時存用戶和助手)在LoCoMo上略優(yōu)于User-Only Raw(25.5 vs 24.2 EM),LongMemEval幾乎持平。
研究者的建議是:寫入時保守一些,保留更多上下文;篩選和過濾盡量推遲到查詢時再做。 過早的細(xì)節(jié)丟棄會損害組合推理能力。
M3:檢索與路由 — 規(guī)劃和平衡融合有效,額外反思無增益 ![]()
A-MEM的
Hybrid-Balanced優(yōu)于Hybrid Sparse-Leaning(24.6 vs 23.0 Answer F1,27.5 vs 24.3 Substring EM)。SimpleMem的
Planning Only優(yōu)于No Planning,且優(yōu)于Planning + Reflect(20.7 vs 18.7 vs 20.0 Answer F1,90.6 vs 86.4 vs 88.6嚴(yán)格召回)。
結(jié)論是:適度的結(jié)構(gòu)加入(融合、查詢規(guī)劃)有效;但一旦路由路徑確定,額外反思主要增加開銷而不帶來收益。
M4:維護(hù) — 保守合并優(yōu)于延遲刷新和過粗摘要 ![]()
MemoryOS的
Conservative-Merge比默認(rèn)略好(23.5 vs 23.2 Answer F1,22.8 vs 22.4 Substring EM);Delayed-Flush顯著下降(20.6/19.5);- MemoChat強(qiáng)制單話題摘要低于默認(rèn)多話題合并。
研究者建議:維護(hù)應(yīng)選擇性合并,既不要不及時寫入(延遲刷新導(dǎo)致查詢時證據(jù)碎片化),也不要過度壓縮(過粗摘要丟失稀疏但有用的線索)。
九個可落地的發(fā)現(xiàn)
研究者在論文里總結(jié)了九條發(fā)現(xiàn),每條都是可直接用于決策的判斷:
Finding 1(workload對齊):強(qiáng)記憶系統(tǒng)不是由單一表示定義的,而是由它是否匹配任務(wù)瓶頸定義的。跨會話推理選關(guān)系/時序感知;長語義對話選粗到細(xì)過濾;有狀態(tài)執(zhí)行選保留交互軌跡。
Finding 2(證據(jù)組織優(yōu)先于排序):檢索質(zhì)量更取決于“能否把分散證據(jù)組裝起來”,而不是“第一條有多準(zhǔn)”。顯式結(jié)構(gòu)(鏈接或?qū)蛹墸┰谧C據(jù)分散或時間距離大時最有用,純稠密檢索只在短期訪問時有效。
Finding 3(時序更新是管線問題,不是模型能力問題):可修正性要內(nèi)建于表示層(讓新事實(shí)綁定到同一實(shí)體/事件),而不是作為無差別文本追加。LLM規(guī)模提升只應(yīng)該在定位成功后幫助表達(dá),而不能作為解決陳舊/沖突記憶的主要手段。
Finding 4(長周期靠“分層抽象”,不靠“存更多”):多視角過濾幫助處理干擾項(xiàng);關(guān)系感知索引幫助跨多輪/多會話;粗到細(xì)摘要幫助先定位相關(guān)會話再解析局部細(xì)節(jié)。
Finding 5(成本由維護(hù)范圍決定,非結(jié)構(gòu)類型決定):局部化更新/搜索給出最強(qiáng)性價比;豐富組織只在避免全局重算時有凈收益,否則會被成本抵消。
Finding 6(表示層保留原始內(nèi)容最重要):抽象/層次化可以提升導(dǎo)航能力,但不能恢復(fù)已被丟棄的信息。精確召回場景下,保留原文本比任何摘要都更可靠。
Finding 7(寫時保持覆蓋,不要過早過濾):粗粒度分段、有限重寫、同時存儲用戶和助手消息,都能提升下游可回答性。精確抽取帶來的表面指標(biāo)提升,往往以犧牲組合推理為代價。
Finding 8(檢索改進(jìn)來自針對性結(jié)構(gòu),非堆疊復(fù)雜度):適度混合融合效果好;輕量規(guī)劃對約束型查找有效;路徑指定后加反思收益有限,主要增加開銷。
Finding 9(維護(hù)取“平衡更新”,不取“激進(jìn)合并”或“延遲沖刷”):保守集成保留跨輪次關(guān)聯(lián);延遲沖刷使近期證據(jù)在查詢時仍碎片化;過粗摘要掩蓋稀疏但有價值的線索。
研究者給Agent記憶下了一個精確的定義:它是一個持久化數(shù)據(jù)管理基礎(chǔ)設(shè)施,而非無狀態(tài)的RAG檢索器。區(qū)別在于狀態(tài),記憶需要寫入、更新、沖突解決和生命周期管理,而RAG不需要。基于這一定義,研究者把記憶系統(tǒng)拆成四個模塊:表示、提取、檢索、維護(hù)。這是整篇論文的分析骨架,也是你評估任何記憶方案時可以套用的思維框架。
未來已來,有緣一起同行!
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.