![]()
你可能已經在各種 benchmark 榜單上看過 GUI Agent 的 "大勝" 了。
OSWorld 上 70%+ 的成功率、網頁操作幾乎封神、連寫個郵件發個文件都不成問題。各家發布會 PPT 一片飄紅,仿佛 AI 馬上就要接管你的電腦。
但我最近讀到一篇論文,感覺它把這層濾鏡狠狠摘掉了。
當有人把賽場從 “Chrome + Office” 搬到 FreeCAD、QGIS、剪映、KiCad、Blender 這些真正干活的軟件里,結果一下子變得非常誠實:56 款專業軟件、338 個真實工作流、平均 100 步以上的操作鏈條,就連最強的 Gemini 3.1 Pro 和 Kimi K2.6,pass@3 成功率也只有 41% 左右,單次平均通過率只有 30% 出頭。
這場考試的名字叫Workflow Gym,來自字節Seed評測團隊,于6月上旬公開。
![]()
- 論文標題:Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields
- 論文主頁:https://huggingface.co/papers/2606.11042
- 項目鏈接:https://workflow-gym.github.io/
- ArXiv 論文:https://arxiv.org/abs/2606.11042
讀完論文我最大的感受是:這不是又一個 "數字更大" 的 benchmark ,這是把 GUI Agent 從熱身賽拉到了正賽。
之前的考場,太友好了
我先回顧下目前已有的 GUI Benchmark。
OSWorld 覆蓋 8 款軟件,以 Chrome、VS Code、LibreOffice 為主,任務平均幾分鐘就能完成;PC-Eval 也是 8 款,集中在 Word、Excel、郵件、計算器這類日常辦公場景;AmbiBench 雖然覆蓋 25 款應用,但全部是移動端,更多停留在點外賣、發微信這類任務上;GUI-360 則直接鎖定在微軟三件套。
但問題在于,當我看到 “成功率 75%” 這種數字時,很容易產生一種錯覺:好像 AI 已經快能替人上班了,好像我們已經無限逼近 AGI 時代了。
可真實情況并不是這樣。
真正產生經濟價值的工作,不只是讓 AI 在 Chrome 里填表單,也不只是讓 AI 在 Excel 里做求和。真正的工作往往發生在復雜流程里,發生在工業級的專業軟件里。
比如,在 FreeCAD 里畫機械零件,在 QGIS 里疊圖層做地理分析,在 KiCad 里畫電路板,在剪映里剪一段 8 秒的視頻并精確到幀地加三個疊化轉場,在 GNU Radio 里搭信號流圖。
這些任務有一個共同特征:專業軟件、長鏈條、強約束、硬驗收。對就是對,錯就是錯,沒有 “差不多就行”。
而這些,恰恰是過去大多數 GUI benchmark 沒有充分覆蓋到的地方。
Workflow Gym 到底考什么
Workflow Gym 的設計思路,用體育類比最容易講清楚。
如果說 OSWorld 更像是在測 100 米短跑,看你起跑反應快不快、單個動作準不準,那 Workflow Gym 更像是在測 110 米欄 + 400 米混合泳 + 10 公里自行車。
你不只是要跑,還要跨欄、換氣、掌握平衡,還要在不同技術動作之間切換。一次失誤不是只丟掉這一秒,而是會讓后面的整個流程都串掉。
它的任務設計有四個核心原則。
![]()
第一,真實。
這些任務不是出題人拍腦袋編出來的,而是從領域專家的日常工作里 “挖” 出來的。1000 多個候選任務,最后篩到 338 個,篩選標準是:網上搜不到現成解法,必須真的理解這個領域才能做。也就是說,模型不能靠訓練數據里見過類似教程就蒙混過關。
第二,專業。
Workflow Gym 覆蓋 6 個頂級領域、23 個細分二級領域,包括工程設計、科學計算、多媒體創作、地理與環境、數據分析、財務與管理,甚至還有生物信息、化學建模、游戲引擎這些冷門但真實存在的工作場景。
里面的軟件包括 FreeCAD、KiCad、Qucs-S、OpenModelica、DWSIM、ParaView、GeoGebra、剪映、Blender、Kdenlive、OBS、Mixxx、QGIS、GRASS GIS、SAGA GIS、JASP、jamovi、Weka、KNIME、GnuCash、HomeBank、OpenLCA、ClustalW、VESTA、Godot 等。
每款軟件都被打包成獨立的虛擬機鏡像,預裝、預配置、去除登錄步驟,保證每個模型拿到的 “考場” 是一致的。Windows 和 Ubuntu 雙環境也都有覆蓋。
第三,長程。
官方按人類專家標注的操作步數劃分難度: 30-44 步是 Easy , 129 題,占 38.2%; 45-60 步是 Medium , 159 題,占 47%; 61 步以上是 Hard , 50 題,占 14.8%,最長的題目達到 110 步。而模型實際跑起來因為探索、犯錯、重試,交互輪次經常沖到 80-400 步。這是真正的馬拉松,不是沖刺。
第四,可驗證。
這是很多長程 benchmark 糊弄過去的地方 —— 任務太開放,最后靠人眼打分,復現性一塌糊涂。 Workflow Gym 給每道題都定義了確定性的判分標準:要么比對輸出文件的二進制內容(比如導出的工程文件是否與標答一致),要么把最終界面截圖喂給裁判 VLM 按關鍵點核對(比如剪映時間線上 "00:00:02:29 處是否無縫銜接""00:00:06:06 處是否添加了疊化轉場 "),判分邏輯與任務類型匹配。論文里抽樣 60 道題做人評對照,自動評測和人評一致的有 59 道,人評機評一致率達:98.3%。
這四條放在一起,意思很簡單:分數摻不了水。
更狠的是數據質檢流程。一道題入庫要過四關 —— 指令質檢( PE 自動檢測模糊描述)、領域專家人工審核、標注員在環境鏡像里按操作規范完整復現、最后再拿 SOTA GUI Agent 跑一遍預實驗,確保不是任務本身有歧義。任何一關不過都要打回重修。
成績單:第一名也才及格線邊緣
然后是最刺激的部分 —— 把當前最能打的幾個模型拉進來裸考。
實驗設置很克制:每個任務一開始只給一段自然語言指令,沒有 step-by-step 提示,沒有中間糾錯,沒有人類兜底,最大 400 輪交互。每個任務跑 3 次獨立采樣,用 pass@3 和單次通過率兩個指標衡量。
結果是這樣的:
![]()
我盯著這個表看了很久,有三個數字格外刺眼。
第一個, 30.67%。這是 Gemini 3.1 Pro 的單次平均通過率 —— 在專業 GUI 任務里,三次里要失敗兩次。它在 OSWorld 上是 70%+ 的選手,到這兒直接腳踝斬。
第二個, 2.67%。 Gemini-3-Flash 在 Hard 題( 60 步以上)上的 pass@3 。這意味著 338 道題里最難的那 50 道,輕量模型基本是全送。 Hard 題不是 "難一點",是 "根本做不動"。
第三個,也是最反直覺的一個: Kimi-K2.6 在 Hard 題上拿了 25.33%,反而比 Gemini-3.1-Pro 的 21.33% 高一點點。長程魯棒性這件事,不一定和模型 "通用智商" 嚴格掛鉤。
分領域看更有意思。 Kimi 在數據分析、多媒體創作上表現最好,和它的 coding + 多模態能力強吻合; Gemini 在地理信息、工程設計、科學仿真上更強,顯示出對復雜空間界面的理解力優勢。每個模型都有自己的 "舒適區軟件",也有自己的黑洞。
說白了,沒有誰是 "通吃" 的。
模型到底輸在哪里
論文沒有止步于僅曬分數,作者做了兩層失敗歸因 —— 結果層和過程層 —— 結論比分數本身更值得看。
結果層把失敗分成兩類:沒跑完( workflow incompletion )和跑完但錯了( execution inaccuracy )。一個鮮明的規律是:模型越強,"沒跑完" 的比例越低 —— 強模型至少能硬撐著把流程走下來。"跑完但錯了" 的比例并沒有同步下降多少。
這就像一個馬拉松選手,以前是中途退賽,現在是咬著牙沖過終點但成績無效。
過程層歸因,作者歸納出四個模型出現比例都很高的死穴:
![]()
1.長程一致性斷裂。 這是最致命的一個。做到第 20 步時,已經忘了第 5 步設的參數是什么;明明第 15 步剛點錯了一個按鈕,第 16 步還假裝一切正常繼續往下走。 Workflow 這種東西,沒有 save point ,錯一步后面全歪。人類專家干活時腦子里有個 "任務地圖",知道自己走到哪一步、距離目標還有多遠,當前模型這個 "地圖" 要么畫不全,要么走著走著就糊了。
2.錯誤擴散無法自我修復。 模型點錯一個按鈕、輸錯一個數值、拖拽偏了幾個像素,第一反應不是 "我是不是錯了",而是在錯誤狀態下繼續 "合理" 操作,越走越遠。人類遇到這種情況會 undo 、會回退、會看看哪里不對,當前 GUI Agent 的自我糾錯回路基本是殘疾的 —— 一旦偏航,就是 "頭也不回地駛向錯誤終點"。
3.目標漂移。 做著做著,把用戶最初要什么忘了。比如任務是 "剪一段 8 秒的視頻并在三個時間點加疊化轉場",模型剪完視頻、加完特效,最后忘了導出;或者導出了,但沒檢查時長對不對。這種 "做了 80% 但漏掉最關鍵驗收點" 的失敗,在 Hard 題里尤其密集。
4.專業軟件理解不足。 這一條其實是把前三類問題的根往深挖了一層。 QGIS 的圖層堆棧、 KiCad 的網表層級、 Blender 的模式切換( Object/Edit/Sculpt )、 FreeCAD 的 sketcher 約束 —— 這些 UI 范式是各領域幾十年演化出來的,沒有 "通用常識" 可以覆蓋。模型看到一個陌生的面板和按鈕,既沒有領域知識做預判,也沒有系統化的探索策略,基本就是瞎點。
更底層的,論文點出了一個結構性矛盾:人類使用 GUI 是連續的視覺 - 動作回路,而當前 Agent 框架幾乎都是 "截圖→推理→輸出坐標→點擊" 這種離散的觀察 - 動作循環。 這個 paradigm 在簡單場景夠用,在專業軟件的精細操作(精確拖拽、快捷鍵組合、右鍵菜單、模態對話框)面前,分辨率不夠。
這不是某家模型的問題,是整個范式的瓶頸。
這張榜為什么重要
每年都有新 benchmark ,為什么要單獨說這一個?
因為它把行業里一個心照不宣的窗戶紙捅破了:當前 GUI Agent 的能力邊界,基本被 "通用軟件 × 短任務" 鎖死了。 你在演示視頻里看到的那些 "AI 幫你操作電腦",大部分是在舒適區里表演。只要你丟給它一個需要打開專業軟件、走完整工作流、產出有硬性驗收標準的任務,神話立刻破功。
這件事對從業者的信號其實很清晰。
做模型的,長程一致性、錯誤恢復、專業領域知識注入,這三個是下一個階段必須正面啃的骨頭。單靠 scaling 看多模態基座模型能不能自然涌現?我個人持懷疑態度 —— 論文里 GPT-5.4 和 Gemini-3.1-Pro 的差距并沒有大到質變,說明這是個架構 + 訓練范式問題,不只是參數問題。
做產品的,別再拿 "AI 自動幫你完成一切工作" 當宣傳口徑了。目前模型任務的完成度仍缺乏細節、深入性和穩定執行這三點重要因素,目前最靠譜的產品形態是人機協作:人盯框架和流程、 AI 做原子操作,或者 AI 跑一遍人來驗收。這不是單靠產品包裝能解決的問題,而是當前模型在長程規劃、狀態保持、細節執行和自我糾錯上的能力邊界。
做 benchmark 的同行, Workflow Gym 立了一個好參照 —— 真實任務、專業環境、確定性判分、 VM 鏡像可批量復現。這四條應該是下一代 GUI benchmark 的入場券,而不是加分項。
比賽剛開始
Workflow Gym 只是一期, 338 題、 56 款軟件。項目 Roadmap 里寫著將會繼續擴充軟件范圍和指令覆蓋面,還要把評測環境和訓練環境打通(評訓一體,支持 RL 閉環),以及探索把 GUI 軌跡轉化為 MCP 工具接口的可能性。
最后說句私心的。
我讀完這篇論文反而挺興奮。不是因為分數低看好戲,是因為終于有人不拿 "Chrome + Excel 操作成功率" 來定義 AI 的執行能力了。專業軟件里的工作流,才是真正衡量 "AI 能不能替人干活" 的考場。 FreeCAD 、 QGIS 、 KiCad 這些名字,聽著冷門,但它們背后是工程師、地理分析師、硬件設計師、視頻剪輯師 —— 真正在產出經濟價值的人。
30% 不是一個好看的數字,但它可能是一個更誠實的數字。相比那些接近 90% 的榜單成績,它更接近真實工作流里的能力邊界:專業軟件、長鏈路、硬驗收、不可糊弄。評測的意義不在于讓所有模型刷新紀錄,而在于把真實差距擺到桌面上。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.