![]()
作者|Ado
微信| Ado__rs
7月2日,字節 Seed 發布了一個 Agent評測項目 EdgeBench。看起來又是一個 benchmark,但它問了一個其他榜單不問的問題。
![]()
給模型一道題,做對了得分,做錯了不得分。這是絕大多數 benchmark 現在的工作方式,越來越像高考。
但真實世界里,人不是這么用 AI 的。
你不會給 Claude Code出一道題然后等它交卷。你會給它一個項目、一個代碼庫、一批數據,然后它在那里折騰好幾個小時,探索、犯錯、讀反饋、修正、再試。你更關心的是它浸泡在現實任務環境里一段時間之后,能不能比剛進來時更強。
但當前的 benchmark 幾乎測不出這些東西。它們測量的是靜態能力,模型被凍結的那一刻就知道的東西。至于從反饋里持續進步的能力、在長周期里積累經驗的能力、在陌生環境里摸索出方向的能力,全在盲區里。
EdgeBench 的切口就是把盲區里的東西放進評測,解答一個問題:把Agent扔進一個陌生環境,12小時后,你能變強多少?
![]()
![]()
134個任務橫跨六大領域:科學/ML、軟件工程、組合優化、專業知識工作、形式化數學、交互式游戲
為此,Seed 團隊搭了一個叫 EdgeBench 的實驗平臺。這是一個環境學習觀察艙。134 個任務,每個任務設計合約讓 Agent 至少跑 12 小時。
它的設計圍繞四個核心維度展開:
![]()
5 個前沿模型(Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DeepSeek-V4-Pro)在上面總共跑了約 38,000 小時。
經費在燃燒。但最終的結果價值巨大:
他們找到了 Agent 的 Scaling law。
1
四個發現:公式、路徑、本質、速度
1 )agent學習有一條被寫死的數學公式
![]()
134 個任務平均:5 個模型的學習曲線被 log-sigmoid 函數高精度擬合
這是全篇論文的“靈魂發現”。
此前我們大多默認環境學習是一件混亂的事,不同任務、不同模型、不同策略,規律自然也不同。但他們的數據給出了意料之外的答案:
134 個任務的平均學習曲線,被同一個函數以 R2 = 0.998 的精度精確擬合。
R2 = 0.998 是什么意思? 在人機交互和復雜系統研究里,你能看到 R2 = 0.3 就已經敢寫論文了。0.998 本質上不是一個"擬合問題",這是一個發現。如果我知道一個 Agent 前兩小時的進步速度,在任務集合的平均意義上,我就能比較準確地預測它 12 小時后的水平。
曲線展示被測模型的學習體感大致都是:一開始慢、找到感覺后爆發、接近天花板時又放緩。這和任何有過深度學習或深度工作經驗的人的體驗完全吻合。
而且,這個規律跨尺度成立:無論是 12 小時、28 小時還是 72 小時的實驗窗口,擬合精度全部保持在 R2 ≥ 0.993。跨領域也成立:六大任務家族各自擬合,R2 在 0.972 到 0.998 之間。
2)沒有“標準”的成長路徑
這個發現更有實際意義。
把 134 個任務的單任務學習曲線拉開來看,你會發現一件反直覺的事:雖然平均曲線是漂亮的 log-sigmoid,但單條曲線之間差別極大。
![]()
- 有的任務:Agent 一上來就穩步提升,曲線干凈
- 有的任務:前幾個小時紋絲不動,突然在某個時刻分數跳升
- 有的任務:先漲后跌再漲
- 有的任務:一開始快速上升,然后進入漫長的平臺期
不同的學習策略和試錯范式,在同一個評分框架下會產生截然不同的成長路徑。
Agent不只是“學得快”和“學得慢”的區別。它們在怎么學上有本質差異,如果是只看最終分數而不看過程的評測方式,就完全抹平了這個維度。論文的解釋是,任務是一張能力圖,學習是解鎖前沿向外擴張,在對數時間上走一條logistic曲線。單任務節點少所以鋸齒,任務夠多平均后S形浮現。論文標題里那個scaling law,指的就是這條曲線。
3)“重新理解問題”創造真進步
![]()
有經驗 vs 無經驗對比:連續運行積累經驗比 6 次獨立重啟多出 6.9 分的顯著優勢
同一個模型(Opus 4.8),同樣的 12 小時預算:
- 方案 A:讓它連續跑 12 小時,所有中間產物、錯誤記錄、已驗證假設全部保留
- 方案 B:拆成 6 次獨立的 2 小時跑,每次清空所有狀態,只保留最佳結果
12 小時后,方案 A 比方案 B 多了 6.9 分(百分制)。而且兩條曲線從一開始就分道揚鑣。
這說明進步不是靠運氣多試出來的,而是靠經驗積累出來的。
值得關注的是實驗中的引力波重建案例研究。GPT-5.5 在這個任務上跑了 12 小時,提交了 224 次,但真正推動最佳成績進步的只有 27 次提交。
每一次突破都不是因為"多跑了一個實驗",而是因為 Agent 對問題本身的理解發生了質變。它把模糊的目標逐步拆解為可搜索的子問題,從反饋中重新定義了"什么是更好的方向"。
4)學習速度本身正在被“學習”
![]()
這個發現可能是跟產業關系最緊密的一個。
實驗挑了一組所有模型“起跑線相近”的任務(首次嘗試都在 6.87 分左右),然后測量每個模型在 2 小時交互后能進步多少。
結果:從 2025 年 9 月的GPT-5-Codex到 2026 年 4 月的GPT-5.5,221 天內學習效率提升了 約 8 倍,約每 3 個月翻一番。
后期模型的有效提交率在上升,但提交次數不一定更多。換句話說,不是更勤快,而是每次動手更有效。這和工程實踐的直覺一致,高級工程師不一定比初級工程師寫更多行代碼,但更少做無用功。
AI 的能力越來越像“知識”,但"學會新東西"的能力本身,也在以驚人速度進化,而且這個速度比靜態知識增長更有決定性。
1
評測環境本身,和EdgeBench同樣有價值
EdgeBench 看起來像一個模型排行榜,但它測到的不是裸模型能力,而是 Agent 系統能力。
不同模型跑在不同的執行框架上。Claude Opus 4.8 使用 Claude Code 加 1M 上下文窗口,GPT-5.5 使用 Codex 加 256K 緊湊窗口。最后的分數,既包含模型本身的能力,也包含上下文管理、工具調用、反饋處理和執行框架的影響。
這反而接近真實部署。現實中的 Agent 從來不是一個孤立模型,而是模型、工具、工作流和反饋系統的組合。EdgeBench 真正衡量的,是這個組合系統能不能在長程任務里持續推進。
但這也意味著,榜單不能被粗暴理解成基礎模型排名。它更像是在比較不同 Agent 系統的長期工作能力。
把EdgeBench和主流 benchmark 放在一起看,差距會更清楚:
![]()
傳統 benchmark 是“靜態快照”,EdgeBench 是“動態軌跡”。它們不是在同一個維度上競爭。
但這個新維度不是沒有代價的,背后是巨大的資源消耗。
和EdgeBench同樣讓我印象深刻的東西,是把這個實驗環境搭起來意味著什么。
先說一組容易被忽略的賬。134 個任務,每個任務平均消耗 57.2 小時的人類專家時間,最長的單個任務投了 320 小時。即使按最低標準估,光任務構建這一項就投入了 7,500 小時以上的人力;然后是運行成本,5 個模型,每個模型在每個任務上跑 3 次,加上延長至72小時以上的運行,每次 12 小時,總計約 38,000 小時的 Agent 交互時長,對應的是天文數字的 API 調用和算力消耗。
這個成本門檻本身就意味著,長程 Agent 評測不是隨便一個團隊就能入場的方向。
再看工程細節。論文的附錄記錄了在開發過程中被 Agent 攻破的各種漏洞:有 Agent 在流體力學任務中通過 400+ 次提交反推出了隱藏測試數據的答案;有 Agent 發現反作弊檢查對 baseline/ 目錄豁免,于是把代碼塞進那條“免檢通道”里交卷。這些案例暴露了一個深層的矛盾:想要測出“學習能力”,就必須給 Agent 足夠的反饋;但反饋給得越多,就越可能被 Agent 當成預言機來利用。
EdgeBench 的解決方案是物理隔離:工作容器和裁判容器分開,裁判打完分就銷毀,防止Agent“作弊”:
![]()
EdgeBench 的雙環反饋機制:左邊是 Agent 可以自由探索的工作容器,右邊是隱藏裁判,提交后才返回權威評分
- 工作容器:Agent 在里面隨便折騰,編譯器、調試器、日志、文檔全都有,但沒有“隱藏答案”
- 裁判容器:Agent 提交工件后,裁判用隱藏測試數據和私有評分標準來打分,打完容器立刻銷毀
這個設計很講究,本質上是在模擬“考場密封”和“雙盲評審”的機制。把這個從工程層面做對,難度比設計題目本身大得多。這套雙容器框架有自己的名字,SForge。字節把它連同134個任務中的51個一起開源了,構建環境的門檻還留在原地,使用它的入口已經打開。
在做 benchmark 的人看到這,大概都會有一種“原來你們也被Agent坑過”的共鳴。
這也是為什么 EdgeBench 讓我感覺它不是“一個新的 benchmark ”,更多是一種新的軟件評測系統。
它本質上是一個可觀測的 Agent 運行環境。你把它當成“Agent 的 profiler”,可能比“一個新 benchmark”更準確。
把這個視角拉回到行業:當前大部分 Agent 評測還停留在“在某個測試集上一次性跑分”的階段。EdgeBench 花了這么大代價搭一個長程實驗裝置,它想回答的問題其實很簡單,但很重要。
1
字節自己的“AI下半場”
EdgeBench是一個讓人重新想問題的理由。
長程任務和短 benchmark 之間的差別,不是時間拉長了,而是暴露出來的問題完全不同。一個只跑 10 分鐘的 benchmark,Agent的行為是可以預期的:讀題、思考、輸出、結束。不會出什么幺蛾子。但當你把時間拉到 12 小時,麻煩就多了。Agent 會在方向正確的前提下慢慢跑偏,修好一個模塊的同時搞崩另一個;會看不懂用戶的反饋,把一個錯誤信號誤讀成另一個方向,然后在錯誤的路上持續投入幾小時。
退一步想“是不是方向錯了”,當前的 Agent在這方面還有欠缺。這些問題在短 benchmark 里很難被觀測到,但在真實環境中,件件致命。
因此,EdgeBench 的價值就是把 Agent 評測的標準從“會不會做”推進到了“會不會持續做、學習、再做”。這兩個問題之間,隔著一次評測范式的代際跨越。
對評測的范式的重新思考,總讓人想到目前在騰訊負責模型的姚順雨曾提出的“AI下半場”的判斷,某種程度上,EdgeBench 就是字節自己版本的“AI下半場”。
EdgeBench 把“Agent在環境里越跑越強”這個直覺變成了可測量的學習曲線。邏輯是同構的,只是這次尺度不再是參數和算力,而是時間和反饋。
未來 AI 公司爭奪的核心資源,不只是數據和算力,還有能讓模型反復試錯、持續進化的環境。
![]()
點個“愛心”,再走 吧
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.