Self-Harness團隊 投稿
量子位 | 公眾號 QbitAI
讓AI自己改自己的Agent Harness,這事已經被頂級Agent社區注意到了。
上海人工智能實驗室團隊提出的Self-Harness,近期被LangChain CEO、聯合創始人Harrison Chase轉發,也被前OpenAI副總裁Lilian Weng收進自進化Agent相關博客。
它盯上的不是換模型,而是Agent外層那套Harness。
做法很直接。模型先檢查自己的運行軌跡,從失敗里挖出模式,再提出有邊界的Harness修改,最后交給回歸測試決定要不要采納。
實驗結果顯示,在Terminal-Bench-2.0上,底層模型、工具環境和評測協議都保持不變,只改Harness,三個模型后端都拿到了held-out提升。
其中Qwen3.5-35B-A3B總提升達到104%,MiniMax M2.5和GLM-5分別提升28%和24%。
論文和項目已經公開,文末附鏈接。
![]()
△LangChain CEO/co-founder Harrison Chase轉發Self-Harness
讓Harness自己進化
Agent Harness可以理解為包在模型外層的一套運行裝置,覆蓋系統提示詞、工具使用規則、驗證器、運行時控制策略和輕量middleware。
在多輪工具任務里,它決定Agent怎么調用工具,什么時候停,失敗后怎么恢復,產物又該如何驗證。
過去,這套東西主要靠工程師手調。要讀大量執行軌跡,找失敗原因,改提示詞或工具規則,再反復跑benchmark。
模型越多、任務越雜,Harness就越難繼續按“一模型一套人工調參”的方式擴展。
![]()
△三種Harness改進范式:人工改、強模型外援改,以及Self-Harness讓模型基于自身軌跡改
Self-Harness怎么工作
換到Self-Harness,流程被壓成三步。先挖弱點,再提改法,最后跑回歸。
Weakness Mining:從失敗軌跡挖弱點
系統先讓當前Harness驅動固定模型完成一批任務,記錄完整執行軌跡、工具調用和評測結果。
失敗樣本不會被當成孤例處理。Self-Harness會結合驗證器反饋、Agent行為和失敗之間的因果關系,把可復用的失敗機制聚起來。
這樣,“某個任務沒過”會變成“這一類失敗可能來自同一種Harness缺陷”。比如缺少最終產物、重復執行無效命令、工具報錯后不恢復,或者探索太久卻遲遲不進入實現。
Harness Proposal:提有邊界的改法
拿到結構化失敗證據后,同一個模型會切換成proposer,針對已挖出的失敗機制提出候選Harness edit。
這些edit只能落在預先聲明的可編輯表面上,不能把整個Agent控制架構推倒重來。
每個提案都要說明想改變哪種行為,可能帶來什么回歸風險,以及為什么可能修好當前失敗模式。
Proposal Validation:用回歸測試拍板
候選Harness會在同一評測協議下重跑,并和當前Harness對比。
接受規則很保守。held-in或held-out至少一個split要提升,另一個split不能退化,才會進入下一代Harness。
這也是它和普通“自動改prompt”的差別。Self-Harness不讓模型憑感覺拍板,而是把每一次改動都放進可記錄、可復現、可回退的評測閉環里。
![]()
△Self-Harness自改進閉環,包括弱點挖掘、修改提案和回歸驗證
不換模型,只改外層也能漲
論文在Terminal-Bench-2.0上做了系統評測。
Terminal-Bench-2.0是一個多輪智能體benchmark,任務運行在容器化終端環境中,覆蓋文件管理、命令執行、錯誤恢復、產物驗證等真實工具使用能力。
在固定模型、工具集、任務環境和評測配置的前提下,Self-Harness只改Harness。結果三個模型都出現提升。
MiniMax M2.5總提升28%,Qwen3.5-35B-A3B總提升104%,GLM-5總提升24%。
這組結果的重點不是又換了一個更強模型,而是在同一個模型外面,Harness本身也可以被搜索、驗證和迭代。
![]()
△Terminal-Bench-2.0結果,三個模型后端在Self-Harness后均獲得held-out提升
更重要的是,每個候選修改都經過held-in和held-out回歸測試。
換句話說,Self-Harness不是堆更長的提示詞,而是在一次次驗證門控后,只留下真的帶來收益、又沒有明顯回退的Harness edits。
![]()
△Qwen3.5 Self-Harness進化路線,通過多輪驗證門控保留有效edits
不同模型暴露出不同弱點
Self-Harness的另一個觀察更像工程現場。不同模型不是同一種失敗。
MiniMax M2.5:找到線索后遲遲不交付
在初始Harness下,MiniMax M2.5有時會持續探索數據集。即使已經找到關鍵元信息,也遲遲不創建評測所需的答案文件,最后因為缺少產物或超時失敗。
Self-Harness保留的修改會鼓勵Agent更早識別必需輸出,先創建初始產物,并在工具調用過長時轉向具體實現和驗證。
Qwen3.5-35B-A3B:工具失敗后容易陷入循環
Qwen3.5-35B-A3B的常見問題,是工具失敗后進入重復編輯、重復覆蓋或重復命令循環,甚至在停止前刪除評測必需文件。
Self-Harness為它引入依賴預檢查、失敗后產物恢復、避免完全相同命令重試,以及由工具錯誤觸發的artifact-focused提醒。
![]()
△Qwen3.5保留下來的code-level Harness edits,集中在依賴預檢查、產物恢復和重試約束。
GLM-5:更需要管住shell狀態和節奏
GLM-5暴露出的弱點更集中在shell會話狀態,以及從探索切到實現的時機。
改進后的Harness會提醒Agent在修改環境變量、安裝工具或調整路徑后,確認這些變化能跨命令持續可用。當長時間探索還沒有形成產物時,系統也會推動它轉向實現與測試。
這說明Self-Harness不只是給所有模型加一段通用提示。它會根據每個模型在真實軌跡中暴露出的弱點,生成并篩選適合它的Harness改動。
為什么會引起關注
Agent越來越像跑在工具環境里的系統,而不是只回答單輪問題的模型。
在這種設定里,模型能力只是一部分。外層Harness決定它是否知道何時調用工具,如何從錯誤中恢復,是否保留正確產物,退出前有沒有做驗證。
過去,Harness工程更像經驗活。Self-Harness給出的方向是,讓模型自己參與這套經驗的挖掘和改寫,但最終仍由評測而不是自評來拍板。
它沒有證明“Agent可以完全自己進化”,也沒有繞過benchmark范圍。論文里的結果主要來自Terminal-Bench-2.0和固定模型后端。
但作為一個自進化Agent的組件,它給出了比較清楚的邊界:改什么,怎么改,怎么驗,什么時候拒絕。
研究團隊
該工作來自上海人工智能實驗室團隊,論文題為Self-Harness: Harnesses That Improve Themselves。
從現有文檔看,團隊公開了論文和項目地址,讀者可以查看具體實驗設置、Harness edits和代碼。
論文:https://arxiv.org/abs/2606.09498
項目地址:https://github.com/qzzqzzb/Self-Harness
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.