![]()
作者介紹:李旭浚、鄭克寒等來自清華大學計算機科學與技術系,研究方向包括 LLM Agent、大語言模型強化學習和測試時學習。
當大模型 Agent 被部署到工具調用、長程任務和開放環(huán)境中,一個關鍵問題會隨之出現(xiàn):能否在不更新模型參數(shù)的情況下,將執(zhí)行經驗沉淀下來,并在下一次做得更好?
「技能演化」(skill evolving)正是這樣的測試時學習范式。Agent 執(zhí)行任務后,系統(tǒng)從軌跡中總結可復用技能,比如工具調用流程、API 前置條件或領域操作經驗;之后再遇到相似任務,這些技能會被檢索出來,作為上下文提供給 Agent。但現(xiàn)有流程本身通常是靜態(tài)的:抽取、重構、修訂和過濾技能的策略往往由人工預先寫死。既然技能可以從執(zhí)行經驗中演化出來,那么「產生技能的算法」是否也可以在測試時繼續(xù)演化?
清華大學與華為基礎模型部的研究者在論文中給出了答案:HiSME,一個輕量級的層次化技能元演化框架。它不更新底層 LLM 參數(shù),而是在文本空間中同時優(yōu)化兩類對象:面向任務執(zhí)行的技能,以及面向技能生成與維護流程的「元技能」(meta-skills)
![]()
- 論文標題:You Live More Than Once: Towards Hierarchical Skill Meta-Evolving
- 論文鏈接:https://arxiv.org/abs/2605.28390
靜態(tài)技能演化的缺口
靜態(tài)技能演化有兩個痛點。第一,它很難適配不同場景:例如,工具調用強調 API 參數(shù)和狀態(tài)追蹤,而開放世界 embodied task 更依賴長程動作組合與失敗恢復,單一固定策略難以兼顧。第二,它的維護成本沒有保證。如果演化算法存在系統(tǒng)性偏差,系統(tǒng)就會反復生成低質量技能,再投入額外成本進行修復、回滾或過濾。
![]()
圖1:靜態(tài)技能演化算法的兩類問題
HiSME 的核心觀點是:技能演化可以被看作對 Agent 測試時邊際性能收益的優(yōu)化。在不改變模型參數(shù)的前提下,技能庫為固定執(zhí)行器提供額外經驗;而如果技能演化算法本身不是最優(yōu)的,它與理想演化算法之間仍存在更高階的邊際收益,可以繼續(xù)從測試時經驗中挖掘。
![]()
圖2:從技能演化到元技能演化:邊際效用的進一步挖掘
HiSME:對「經驗沉淀機制」再做一層經驗沉淀
HiSME 把整個系統(tǒng)分成三個層次:軌跡、技能和元技能。
第一層是 Agent 執(zhí)行任務產生的軌跡。系統(tǒng)根據成功率、正確性、計算開銷等效用指標評價軌跡,并從中抽取可復用技能。無論一次軌跡成功還是失敗,只要系統(tǒng)能夠評價它,就可能沉淀出「以后應該怎么做」或「以后不應該怎么做」的經驗。
第二層是技能演化。HiSME 設計了一套完整的演化框架,使用 extractor 從單條軌跡中發(fā)現(xiàn)候選技能,使用 refactorer 從多條相似軌跡或已有技能中抽象共享結構。為避免技能庫被噪聲污染,它還通過 bundle tester、credit assigner、refiner 和 filter 檢查技能契約、分配后驗信用,并據此修訂、禁用或保留技能。
同樣,只要系統(tǒng)能夠評價 skill,就可能沉淀出「以后該怎么提煉或修改 skill」的經驗。HiSME 對 skill 的評價主要關注兩個維度。第一個是有效性:某個 skill 被提供給 Agent 后,后續(xù)軌跡的效用是否真的提高。第二個是復用性:這個 skill 是否會在后續(xù)任務中被頻繁檢索或調用。有效但不可復用的經驗,同樣需要不斷完善;經常被檢索但帶來負反饋的技能,則需要收窄觸發(fā)條件、重寫接口,甚至直接丟棄。
第三層就是元技能演化。HiSME 不只記錄「某個 skill 好不好」,還會記錄它由哪個算法角色產生或修改:是 extractor 從單條軌跡中抽取的,還是 refactorer 從多條軌跡中歸納的,或是 refiner 在維護階段修繕的。當 skill 后續(xù)積累了有效性和復用性反饋,系統(tǒng)就能反過來評價對應的演化策略,通過專門的 meta refiner 部件進行總結,沉淀成 meta skill。
這類 meta skill 更像面向算法角色的方法論,即 rules-of-thumb prompts。例如,extractor 可能學到:不要僅憑表層情緒詞抽取 workflow,除非它對應可驗證狀態(tài)、API 前置條件或跨輪依賴;refiner 可能學到:技能誤觸發(fā)時,應優(yōu)先收窄 trigger condition。這些元技能會被寫回 skill extractor、refactorer 和 refiner 的 prompt 中,讓后續(xù)技能演化算法根據測試時反饋調整策略。
這也是 HiSME 的輕量之處:把元經驗以簡單的文本規(guī)則維護起來,并作為上下文指導后續(xù)演化。
![]()
圖3:HiSME 的層次化技能元演化流程
實驗:性能提升,也學到了可遷移的演化策略
論文在 BFCL-v3 multi-turn base 和 MineDojo 上進行了驗證。前者關注多輪工具調用,后者關注 Minecraft 開放世界中的長程 embodied interaction。除無技能基線和靜態(tài)演化基線 SkillX 外,實驗還加入了 AWM、Memento 兩個 test-time learning 基線,以比較不同測試時學習范式之間的取舍。
![]()
從主要結果看,HiSME 在兩個榜單上都表現(xiàn)出穩(wěn)定優(yōu)勢。相比無技能基線、靜態(tài)技能演化方法,以及 AWM、Memento 等 test-time learning 基線,HiSME 的收益來自更善于生成、修訂和篩選技能的演化流程。尤其在 MineDojo 這類長程交互任務上,HiSME 還體現(xiàn)出明顯的 token 開銷優(yōu)勢:高質量 skill 減少了無效探索、失敗恢復和重復重試,讓 Agent 更快找到可執(zhí)行路徑。
消融實驗顯示,refactorer 是關鍵組件之一。可復用結構往往不是單條軌跡中孤立出現(xiàn)的靈感,而需要跨軌跡證據來支撐;extractor、refiner 和 credit filter 也共同構成了技能生成與維護的閉環(huán)。
![]()
論文還對算法的演化過程進行了具體的統(tǒng)計分析。研究者在訓練中定期保存中間技能庫,并在測試集上重新評估。可以看出,隨著訓練任務增加,HiSME 與 HiSME-static 都能逐步改善技能庫,但 HiSME 在大多數(shù)中間階段保持了更高的測試表現(xiàn),說明元演化能夠在技能生成、修訂和過濾的過程中持續(xù)改善策略。
![]()
credit 分析進一步解釋了這種優(yōu)勢:隨著訓練推進,HiSME 產生的 helpful skill 占比提升,harmful skill 占比得到控制;元演化能把后續(xù)反饋寫回技能抽取和維護流程,減少重復產生錯誤技能模式的情況。
![]()
為了驗證算法不僅能產出高質量技能,還能沉淀出良好的元技能庫,論文進行了 meta-test:把一次 HiSME 運行中學到的元技能凍結下來,作為新一輪靜態(tài)技能演化的初始化規(guī)則。結果顯示,static from meta 顯著優(yōu)于 static from scratch,并接近完整 HiSME,說明元技能本身也具有較高質量和一定的遷移性。
![]()
從 Skill 到 Harness:下一步是自動駕馭工程
HiSME 的意義不只在于 benchmark 分數(shù)。它更像是在提出一種 Agent 系統(tǒng)優(yōu)化范式:測試時學習不必只發(fā)生在模型參數(shù)中,也不必只停留在經驗庫中;圍繞模型運行的外部 harness,包括提示詞、工具路由、記憶、評測器、技能庫維護策略,都可能成為可演化對象。
由此可以引出兩個方向。其一是 Learning to Evolve:把文本化元技能與輕量參數(shù)學習結合,讓系統(tǒng)同時學習經驗內容和演化能力。其二是 Automatic Harness Engineering:針對不同模型和任務,自動調整外部駕馭系統(tǒng),讓 Agent 在部署后形成更適合自己的工作方式。
![]()
對于越來越復雜的 Agent 系統(tǒng)來說,真正困難的也許不只是「讓模型做對一次任務」,而是讓它在真實反饋中判斷:哪些經驗值得保留,哪些規(guī)則應該收窄,哪些失敗模式說明演化算法本身需要改變?
HiSME 的回答是:讓 Agent 活不止一次,也讓它的學習方式本身有機會被學習。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.