![]()
作者 | 王瑋
6 月 26 日,“AI 原生·聚變新生”2026 張江人工智能創新小鎮生態日在上海張江舉行。作為生態日五場平行論壇之一,由張江人工智能創新小鎮聯合 InfoQ 極客邦傳媒共同舉辦的 Top Tower Talk「Harness 時代的硅基團隊治理」專場,在張江科學之門 A 塔 67 層圓滿舉行。
本場活動聚焦一個正在從概念走向現實的問題:當 AI Agent 從個人效率工具,進一步進入企業研發、運營、數據分析、業務交付等核心流程之后,企業如何讓它真正“聽話”又“懂行”?換句話說,Agent 已經不只是一個可以調用的大模型接口,而正在成為一種新的生產力單元。它能寫代碼、做調研、生成報告、調用工具、參與決策,也可能在長任務中反復試錯、誤用工具、丟失上下文,甚至把錯誤經驗沉淀進組織流程。
因此,企業今天需要討論的已經不是“要不要用 Agent”,而是如何為 Agent 建立一套可控、可信、可追責、可持續進化的 Harness 系統。
本場論壇以兩場主題分享打開討論。質變科技 MemoryLake 首席架構師周祥聚焦 Agent 的長期記憶工程,討論企業如何將上下文、經驗與知識沉淀為可復用的記憶資產;華為 2012 實驗室項目群總監董鑫則從大型研發團隊實踐出發,分享 AI 進入研發主流程后,組織協作方式正在發生的變化。在隨后的圓桌環節,兩位分享嘉賓與 Toco 創始人兼 CE 時很快會遇到的現實問題。周祥提到,過去企業更熟悉 DevOps、CI/CD、應用集成和數據集成,而當智能體真正上線之后,一個更直接的問題出現了:它一個月到底會消耗多少 Token?如果 Agent 在執行任務時上下文不完整、Skill 調用不準確,或者工具選擇不精準,就可能陷入大量 retry 和 fail over。任務表面上完成了,但背后已經發生了高額的試錯成本。
因此,Token 的真實成本不能只看單價,還要看任務成功率。按照周祥 PPT 中給出的公式,Token 成本等于 Token 單價除以任務成功率。成功率越低,實際成本越高;一次做對的概率越高,企業為無效試錯支付的成本就越少。由此看,記憶工程并不是錦上添花,而是 Agent 進入生產環境后必須補上的一層基礎能力。
但現實中,企業的記憶基礎設施往往并不統一。數據庫、數倉、知識庫 RAG、會話記憶系統各自存在,個人用戶用起來割裂,企業側則要面對多系統融合和架構演進的復雜性。周祥介紹,MemoryLake 試圖將這些分散能力整合為一體化的記憶與 Agent 平臺,讓企業既有系統、結構化數據、半結構化數據和多模態文件都能接入同一個記憶底座。
圍繞這一目標,他將記憶系統拆解為三類核心能力:記憶蒸餾、記憶計算和記憶堆疊。
記憶蒸餾解決的是“知識如何變成可用記憶”。企業中的大量經驗并不天然適合 Agent 調用,它們分散在文本、郵件、聊天記錄、PDF、表格、圖片、音視頻、數據庫、業務文檔、SOP 和流程規則中。周祥提到,MemoryLake 通過 D1 小模型進行多模態數據提取,將復雜表格等內容轉化為結構化 JSON、多模態索引、決策圖譜、業務知識等記憶資產。在復雜表格提取場景中,相關準確率從小于 70% 提升到 99.8%。
記憶計算進一步解決“記憶如何參與推理”。這其中包括沖突檢測、遺忘、合并、演進,以及時間一致性、跨會話綜合、抗幻覺和語義模糊等問題。比如,同一事項在不同文檔中可能出現相對時間與絕對時間的混用,系統不能只做簡單檢索,而要把這些信息放進統一的時間軸和語境中重新理解。
記憶堆疊則更接近企業落地中的治理問題。企業需要沉淀優秀員工的最佳實踐和高質量 Skill,讓新人和 Agent 能夠復用;同時也必須隔離低質量經驗、個人偏見和錯誤模式,避免它們進入組織共享記憶池。換句話說,組織記憶不能只是“把所有人的經驗都存下來”,而要有篩選、隔離、歸屬和審批機制。
這也引出了周祥分享中最關鍵的組織級框架:Workspace、Actor 和 Project。Workspace 是承載項目、協作關系和上下文的大容器;Actor 可以是人,也可以是 Agent;Project 則用于組織文檔庫、數據庫、開放數據集、會話、記憶條目和 Skills 等資產。在這一框架下,記憶讀取可以跨 Project 發生,但寫入必須落到明確的主 Project 和 Actor 之下。這樣一來,多 Agent 協作、Human-Agent 協作和組織記憶沉淀之間,才能形成更清晰的讀寫邊界和責任歸屬。
2 AI 研發下半場的組織進化
如果說長在個人級任務上,AI 的提效已經非常明顯。董鑫舉例,一個編譯器 Crash 問題,工程師自己排查了三四天沒有解決,后來借助 AI 半個上午就完成定位和修復。但進入團隊級場景后,情況并沒有這么簡單。真實研發組織不是許多個體效率的簡單相加。一線研發人員真正寫代碼的時間可能只有約 20%,大量時間都消耗在需求對齊、測試、會議、責任邊界和跨團隊溝通上。
因此,AI 研發下半場的關鍵,不只是讓每個工程師都用上 AI,而是讓 Agent 能夠在團隊流程中自己轉起來。董鑫在分享中特別強調了 Human on the Loop 與 Human in the Loop:前者意味著人在系統上方做治理,制定規則、觀察狀態、控制邊界,保障系統可控;后者意味著人在必要節點進入流程,對異常、分歧和高風險結果進行判斷與干預,保障結果可信。
基于這一思路,團隊構建了 ACE Harness 系統。該系統面向倉頡編程語言等開源代碼場景,可以讓 Agent 自動分析社區 Issue、復現問題、定位根因、生成報告,并把任務分配給需要處理的人。在這一過程中,Agent 并不是單點執行,而是以團隊形式協作:有 Agent 負責定位問題,有“藍軍”Agent 負責反向審視和挑戰,也有“裁判”Agent 在分歧出現時進行仲裁;如果需要人工介入,整個 Loop 會暫停,等待工程師處理。據董鑫介紹,這套系統 7×24 小時運行,在相關流程上帶來了約 50% 到 1 倍的效率提升。
![]()
當 Agent 能夠持續運轉,組織調度方式也要隨之變化。董鑫介紹,團隊嘗試了 ATM(Ability-based Task Matching)機制,根據任務所需能力,在人和 Agent 之間進行動態匹配。過去,一個固定小組負責固定范圍內的工在這里更像研究者的加速器,適合幫助人快速查資料、生成假設、跑原型和做驗證,但不一定適合被放進高度流程化的工程系統中運行。
由此來看,AI 讓代碼生成變得越來越便宜,但真正稀缺的并不是代碼本身,而是人能否提出值得做的問題,判斷什么結果有價值,并建立足夠快的驗證閉環。Agent 進入研發組織之后,人的角色不會消失,而是會從任務執行者,轉向系統治理者、質量把關者和關鍵判斷者。
3 誰決定上限,誰兜住底線?
在圓桌環節,嘉賓們圍繞 Agent 基礎設施、組織協作和信任機制展開了更具碰撞感的討論。
關于 Agent 能力的上限和下限,嘉賓們給出了不同視角。
曹偲認為,在復雜企業場景中,Memory 很大程度上決定了上限。因為真正難的業務問題往往不是模型不會推理,而是知識散落在不同人的腦子里,文檔和代碼不一致,歷史決策和當前流程相互沖突。沒有好的記憶系統,Agent 很難理解真實業務現場。
董鑫則認為,如果放在人和 AI 配合干活的設定下,上限很大程度上仍由模型能力決定;但下限往往由人決定,尤其是人如何使用 AI、如何設計任務、如何判斷結果。
蔣爍淼則從實踐角度提出了一個不同視角,他認為,很多時候不是模型不夠好,而是人的框架限制了模型。過度設定 Harness,反而可能讓 AI 產出更差的結果。在他的使用方式中,給 AI 一個粗粒度目標,讓它先長出來,再由人進行修剪,往往會帶來更好的結果。
徐珮文認為,模型能力類似于 CPU 強度,是基礎能力;Memory 對上下文和歷史經驗的增強非常關鍵;可觀測性更像儀表盤,用來識別幻覺、異常和風險;Harness 則在成本、任務拆分、模型切換和流程控制中發揮作用。幾者并沒有絕對優先級,而是在不同場景中相互制約、相互補充。
周祥則從企業落地角度進一步補充:模型能力會不斷抬升底線,但企業能否真正把 Agent 用好,很大程度取決于能否把 Legacy Data 整理成 AI Ready Data。數據組織得越好,記憶沖突處理得越好,Agent 在企業內部的上限才可能越高。
4 個人很強,團隊為什么不一定更強?
另一個核心問題是:個人 Agent 如何走向團隊協作?
曹偲指出,團隊的第一件事是統一語言。同樣一個 Claude Code,50 個人使用,可能實際上變成了 50 種工具。每個人的 Prompt、表達方式、上下文理解都不同,最后導致團隊協作效率下降。因此,AI 落到團隊里,首先考驗的是共同語言和共同交付標準。
董鑫也提到,組織層面的挑戰首先是思維對齊。真正用得好 AI 的人,往往本身就是團隊里更開放、更優秀、更愿意探索的人。但如果整個組織要前進,就不能只依賴少數先鋒,而需要通過工具和流程,把新的協作方式逐步沉淀下來。
蔣爍淼提出,AI 在某種意義上具有“反協作”特征。因為人與 AI 的對話天然高度個體化,不同人同時圍繞同一個項目與 AI 對話,最后合并結果可能會非常混亂。因此,他更傾向于把團隊拆成邊界清晰的 2-3 人小隊,讓每個小隊圍繞一個足夠清晰的模塊閉環推進。
徐珮文則認為,在現階段,更可行的方式是明確拆分問題邊界,形成小型尖刀隊。一個人負責定義目標,一個人負責跑通結果,一個人負責審美資產工作,而不是沿著傳統“需求—PRD—設計—開發—測試—驗收”的線性流程一輪輪傳遞。未來的組織可能更像一個圍繞核心資產不斷調用工具、沉淀日志、迭代流程的系統。
5 Harness 的本質,是把 Agent 放進真實生產關系
本場論壇并沒有試圖給出一個關于 Agent 落地的標準答案,而是從長期記憶、研發工程、組織協作、可觀測性與治理邊界等多個角度,呈現了企業邁向硅基團隊過程中正在面對的真實問題:Agent 如何理解業務上下文,如何沉淀經驗資產,如何進入團隊流程,如何在持續執行中保持可控、可信、可追責。
從主題分享到圓桌討論,一個清晰的趨勢正在浮現:當 Agent 從個人效率工具走向企業生產流程,企業真正需要建設的,不只是更強的模型調用能力,而是一套圍繞數據、記憶、流程、權限、質量與責任展開的系統能力。它既要讓 Agent 能夠自主完成更多任務,也要為人的判斷、干預和治理留下清晰位置。
這也意味著,硅基團隊治理仍處在探索階段。不同企業、不同場景對 Harness、Memory、Observability 以及 Human-Agent 協作的理解并不完全相同,但它們共同指向一個更現實的命題:AI 的價值不會自動轉化為組織效率。只有當技術能力被嵌入可運行、可驗證、可治理的工作體系中,Agent 才可能真正從 Demo 走向生產。
對于正在探索 AI 原生組織形態的企業而言,如何讓硅基團隊既能持續進化,又能被有效駕馭,或許將成為下一階段競爭力的重要分水嶺。
未來,張江人工智能小鎮也將聯合 InfoQ 極客邦傳媒,持續推出「塔尖會」系列活動,圍繞 AI Infran、具身智能等前沿議題,邀請產業一線的技術專家、創業者與實踐者持續交流。站在張江這一 AI 創新高地之上,「塔尖會」希望成為一個連接前沿觀點、工程經驗與產業實踐的長期場域,讓更多關于 AI 未來的關鍵討論,在這里發生、碰撞并沉淀。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.