![]()
作者|孫芮
微信 | lombredeau
從 Claude Code、Codex,到越來越多桌面端、本地化 Agent 產品出現,AI Agent 的形態正在快速演進。相比早期停留在聊天和問答層面,如今的 Agent 已經能夠理解項目、調用工具、執行任務,并逐漸融入用戶的日常工作流。
隨著 Agent 開始承擔越來越復雜的任務,競爭的重點也發生了變化。產品體驗不再只是由交互界面決定,底層模型能力、工具調用能力以及 Token 成本,正在成為影響任務完成質量、執行效率和使用成本的關鍵因素。而在眾多應用場景中,Coding 因為對模型推理、工具調用和長鏈路任務執行能力要求最高,也成為當前 Agent 能力競爭最集中的方向。
在這一背景下,Agnes 發布新一代文本模型 Agnes-2.5 Flash,并推出桌面端產品 AgnesCode,希望通過更強的模型能力、更低的使用成本,以及覆蓋完整工作流的 Agent 產品形態,讓 AI 真正成為用戶日常工作的協作伙伴。
AgnesCode的harness能力也在一些真實場景中得到驗證。在硅星人舉辦的活動中,AgnesCode與 Codex、Claude Code 等主流產品同場競技,截至7月10日位列團體第一,也能從側面看出其在真實任務場景中的綜合競爭力。
![]()
從模型升級到桌面端產品發布,這一次 Agnes 想回答的問題,是在 Agent 進入深度工作流時代后,如何讓模型真正承擔起執行任務、持續協作的角色。
1
01 Agnes模型能力再升級
隨著 Agent 開始承擔越來越多實際工作,模型能力的評價標準也在發生變化。
對于開發者而言,一個模型不僅要能夠生成代碼,更需要理解整個代碼倉庫、定位問題、修改多個文件、調用工具,并完成一系列連續任務。這也是 Agnes 本次模型升級選擇重點投入 Coding 與 Agent 場景的原因。
近期,Agnes 正式推出新一代文本模型 Agnes-2.5 Flash。相比上一代模型,新版本針對代碼理解、Bug 修復、多文件修改、多步驟任務執行以及復雜推理等開發場景進行了專項優化,在模型性能、響應速度和推理成本之間取得了更好的平衡,定位于開發者日常使用的主力模型,即日起開啟灰度上線,率先在 AgnesCode 中開放體驗,API 將于本周內全面開放。
從官方披露的信息來看,Agnes-2.5 Flash 并非單純提升代碼生成能力,而是圍繞真實開發流程進行了針對性優化。例如,在面對需要跨文件修改的任務時,模型能夠更準確地理解項目結構;面對需要多輪推理和工具調用的復雜任務,也能夠保持更穩定的執行能力。這些能力也是當前 Coding Agent 能否真正參與開發工作的基礎。
除了已經發布的 Flash,Agnes 還預告了即將推出的旗艦模型 Agnes-2.5 Pro。與強調速度和成本平衡的 Flash 不同,Pro 更側重復雜推理能力、大型代碼倉庫理解、復雜工程開發以及長鏈路 Agent 執行能力,主要面向專業開發者和更復雜的開發場景。
據 Agnes 內部透露,Agnes-2.5 Pro 將直接對標 Claude Opus 4.8、GLM-5.2 等旗艦文本模型,也將成為 Agnes 首款收費模型。這意味著 Agnes 也開始形成更加清晰的模型產品矩陣:Flash 面向高頻、日常的開發與 Agent 使用場景,兼顧性能、速度與成本;Pro 則承擔復雜工程開發和高難度推理任務,滿足更專業的需求。
從產品布局來看,這次更新的重點并不僅僅是發布一款新模型,而是進一步完善 Agnes 在 Agent 時代的模型體系。
隨著 Agent 承擔越來越長鏈路、更加復雜的工作流,模型能力已經從決定生成質量,進一步演變為決定 Agent 能否真正完成任務的核心競爭力。因此,這次 Agnes 的升級重點,也集中在 Coding 與 Agent 兩個方向。
1
02 從 Benchmark 看 Agnes 2.5 的能力提升
從Agenes公布的模型能力對比來看,Agnes-2.5 系列此次提升主要集中在 Coding 場景,而不是簡單提升通用能力。
![]()
其中,Agnes-2.5 Flash 相比上一代 Agnes-2.0 Flash,在七項 Coding Benchmark 上均實現了提升,覆蓋 Terminal 操作、代碼修復、代碼理解以及軟件工程任務等多個維度。
在 SWE-bench Verified 上,Flash 從 72.4% 提升至 75.6%;在 Terminal-Bench 2.1 上達到 62.3%;而在更具代表性的 SWE Atlas 系列測試中,提升更加明顯。
例如 SWE Atlas-QnA 從 15.8% 提升至 36.5%,SWE Atlas-RF 從 11.4% 提升至 29.5%,SWE Atlas-TW 則從 13.5% 提升至 27.5%,幾乎實現了翻倍增長。
相比 Flash,Agnes-2.5 Pro 則進一步面向復雜工程開發進行了優化。
從官方公布的數據來看,其在多個 Coding Benchmark 上已經進入旗艦模型競爭區間。例如 Terminal-Bench 2.1 達到 77.3%,SWE-bench Verified 達到 82.7%,SWE-bench Multilingual 達到 78.7%,在多項測試中已經接近甚至超過部分當前主流旗艦模型。
同時,官方特別提到,本輪升級最明顯的提升來自 SWE Atlas。
相比傳統代碼生成測試,SWE Atlas 更關注模型理解大型代碼倉庫、定位問題、分析代碼以及完成真實軟件工程任務的能力,也更接近開發者日常面對的實際工作。這也意味著 Agnes-2.5 的優化重點是圍繞真實 Coding Workflow,對代碼理解、復雜推理和 Agent 執行能力進行了針對性增強。
1
03 當 Agnes開始接手完整任務
如何體現 Agnes 2.5 系列的綜合實力?或許可以從它實際完成的任務中看出答案。
比如硅星人過往報道了非常多的企業,尤其是AI 領域的公司與產品。但隨著報道數量增長,如何快速檢索、整理這些信息,也是一個問題。
我們嘗試讓 Agnes 2.5 系列基于硅星人的歷史報道,搭建一個企業信息庫。
![]()
這個任務并不是簡單的信息搬運,而是包含了內容檢索、語義理解、關鍵信息提取、分類歸納以及結構化整理等多個環節。Agnes 2.5 系列需要先理解不同報道中的企業信息,再判斷哪些內容具備長期記錄價值,最終形成可查詢、可復用的企業數據庫。
為了測試 Agnes 2.5 系列處理復雜開發任務的能力,我們讓它從一段產品需求出發,獨立完成一個跑酷小游戲的開發。
與靜態網頁不同,跑酷游戲涉及持續的狀態管理、實時渲染以及多對象協同。Agnes 需要組織角色控制、物理碰撞、場景更新、動畫循環和計分系統等多個模塊,從而實現了實時動畫渲染、連續交互以及多模塊聯動。
同樣,Agnes 也能夠快速構建滿足具體需求的實用工具。
例如,我們讓 Agnes 開發一個在線海報生成工具:用戶上傳一張圖片后,用戶上傳一張本地圖片后,可以根據自己的喜好來選擇風格生成海報。
Agnes 最終做出的產品包含 6 種創作模式、17 種預設模板、8 種色調濾鏡,以及 10+ 項實時可調參數,包括文字密度、形狀密度、顆粒感、對比度、光暈、Glitch 強度、RGB 偏移、掃描線等,讓用戶可以進一步控制最終視覺效果。
https://6a509d542c036ef2a53b4ccb--mood-poster-studio-v12.netlify.app/
在這過程中,Agnes 不僅需要完成工具功能的搭建,還需要理解設計語言,將風格、構圖、色彩和視覺元素轉化為可操作的產品能力,才能生成一個具備完整創作流程的在線海報工具。
上述案例均由 Agnes-2.5 Flash 完成。而即將推出的 Agnes-2.5 Pro,則進一步將模型能力提升到了更復雜的工程開發場景。
我們嘗試讓 Agnes 開發了一個臺風實時追蹤系統。從地圖展示、實時數據面板,到路徑動畫、風圈變化、粒子特效,再到風速儀表盤、預警信息等模塊,整個項目涉及地圖開發、數據可視化、動畫渲染以及復雜前端交互等多個環節。
Agnes 不僅完成了整個系統的頁面搭建,還實現了地圖跟隨、路徑插值、風圈動態變化、粒子效果以及多項實時數據聯動,最終生成了一個接近專業氣象監測大屏的可交互網頁。
對于模型而言,這不僅考驗代碼生成能力,更要求它能夠理解復雜需求,將多個獨立模塊組織成一個完整的產品。
同時,Agnes 也能夠理解更加抽象的創意需求。我們嘗試讓它開發一個具有夢幻現實主義風格的交互網頁,只給出「玻璃水面」「真實液體折射」「星光粒子」等關鍵詞描述,而沒有提供任何設計稿。
Agnes 最終完成了整個網頁的搭建,實現了實時水波紋交互、玻璃折射效果、粒子動畫以及 AI 背景生成等功能,并支持用戶切換不同底圖進行創作。
1
04 AgnesCode 讓 AI 真正成為協作伙伴
如果說 Agnes-2.5 系列模型解決的是能力問題,那么 AgnesCode 則回答了另一個問題,也就是這些能力如何真正融入日常工作。
前文展示的多個 Demo,就是由 AgnesCode 做出的。模型負責思考與規劃,Agent 負責執行,而 AgnesCode 則把整個任務組織起來,讓 AI 能夠在一個真實的項目環境中持續工作。因此,Agnes 對 AgnesCode 的定位是一個桌面 AI 工作臺。
在這里,用戶面對的是一個完整可迭代的項目。無論是開發代碼、整理資料、制作 PPT,還是生成網頁、圖片、視頻,都可以圍繞同一個項目持續推進,所有上下文、文件和生成內容都會保留在同一個工作空間里。
在AgnesCode中,用戶只需要描述自己需求,AgnesCode 就會自動調用 Agnes 模型、Skill、應用連接以及本地項目完成任務。
![]()
AgnesCode 默認搭載的是最新的 Agnes-2.5 Flash 模型,可以免費開放使用。除了 Agnes 模型之外,用戶還可以接入其他模型 API,也可以直接使用 AgnesCode 內置的 GPT-5.5、Claude Fable 5、Gemini 3.5 Flash、DeepSeek V4 Pro、GLM 5.2 等旗艦模型,目前每日登錄即可獲得 1200 積分體驗。
![]()
并且,桌面端與 Agnes Web、App 共用賬號、會員和積分體系。
對于開發者來說,AgnesCode 最大的價值在于能夠理解真實項目。
它可以讀取本地代碼倉庫,理解整個項目的目錄結構和文件之間的關系,在一個任務中完成多個文件的修改,并持續利用已有上下文完成后續工作。從需求分析、代碼生成,到 Bug 修復、項目重構,AgnesCode 都能夠參與其中,而不是停留在單次代碼生成。
與此同時,它并不局限于 Coding。辦公場景中,AgnesCode 可以幫助用戶完成文檔整理、PPT 制作、數據分析和信息研究;創作場景下,它也能夠生成網頁、圖片、視頻等內容。這意味著,同一套模型能力可以覆蓋開發、辦公與創作等不同工作流,而不需要頻繁切換不同工具。
為了讓這些工作能夠持續進行,AgnesCode 還做了本地項目空間。每一個項目都有獨立的文件夾、上下文以及生成內容,無論是代碼、網頁、圖片還是視頻,都會統一保存在項目空間中,方便后續繼續編輯、下載和復用,也讓 AI 生成的內容真正成為項目資產,而不是一次性的聊天結果。
從 Agnes-2.5 Flash 到即將推出的 Agnes-2.5 Pro,再到 AgnesCode 桌面端,Agnes 正在逐步完善從模型到 Agent、再到工作流的完整產品體系。對于 Agnes 來說,這次發布是把模型能力、Agent 執行能力以及本地工作流連接起來,幫助模型更好地、有效地進入真實任務環境中。
最后,如果對AgnesCode的產品感興趣,可以前往https://agnes-ai.com/agnescode 下載。
![]()
點個“愛心”,再走 吧
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.