![]()
作 者 | 百融金融行業(yè)研究院 陳敏
來 源 | 九卦金融圈
最近,科技圈被一篇文章刷屏了。文章揭示了 OpenAI 內(nèi)部用 AI 寫代碼的“終極秘密”——不是模型多牛,而是包在模型外面的那層工程系統(tǒng)(他們稱之為 Harness)多厲害。
據(jù)說,靠著這套系統(tǒng),OpenAI 的 Codex 從空倉庫起步,5個月生成了近100萬行代碼、提交了1500個 PR,全程沒有一個人類敲一行代碼。
很多金融圈的 CIO、科技部老總看完后轉(zhuǎn)發(fā)到群里,問下面的人:“我們能不能也搞一套?”
今天,我們不妨扒開這層硅谷濾鏡,聊一個極其扎心的話題:這套讓 AI 真正投產(chǎn)的“Harness”,為什么在金融機構里根本玩不轉(zhuǎn)?真實的投產(chǎn)門檻,到底有多高?
![]()
Part.1
硅谷的“天課”:模型只是 CPU,Harness 才是操作系統(tǒng)
在這篇刷屏的文章里,拋出了一個極其核心的概念:Harness Engineering(約束工程/套具工程)。
過去兩年,大家都在卷“大模型”——今天 GPT-4o,明天 Claude 3.5,后天國產(chǎn)模型又迭代了。我們的直覺是:只要模型足夠聰明,AI 就能替我干活。
但這篇文章告訴你:錯。
如果把 AI 模型比作一臺 V8發(fā)動機,那么 Harness 就是方向盤、剎車、底盤懸掛和導航系統(tǒng)。
文章列舉了一組讓人倒吸一口涼氣的數(shù)據(jù):
同一個模型,只換了一套 Harness,編程基準測試的成功率從42%直接飆升到78%(這相當于白嫖了一代模型)。
著名的 AI 框架 LangChain,沒換模型,只重寫了 Harness,測試排名直接殺入全球前五。
Vercel 團隊把給 AI Agent 提供的工具從15個砍到2個,準確率反而從80%暴漲到100%。
為什么?因為模型再聰明,它也是個“沒常識的愣頭青”。
它不知道你的代碼庫長什么樣,不知道你們的規(guī)范是什么,不知道改了 A 模塊會不會把 B 模塊搞崩。Harness 的作用,就是給這個愣頭青套上“緊箍咒”,喂好“上下文”,配上“安全帶”,讓它在規(guī)定的賽道里狂飆。
文章總結(jié)了一個極其精辟的公式:AI Agent = 模型 + Harness。
并且斷言:未來的核心競爭力,不是訓練模型,而是“管理模型”。
![]()
Part.2
如何復制:當“Harness”撞上金融機構
看完這些,是不是覺得很振奮?覺得終于找到了 AI 落地的銀彈?
別急著興奮。
這篇文章描述的場景,是 OpenAI、Vercel 這種“數(shù)字原生”公司的烏托邦。他們的代碼庫是干凈的,規(guī)范是統(tǒng)一的,歷史包袱是不存在的。
但你低頭看看咱們金融機構的生產(chǎn)環(huán)境呢?
如果要在一家銀行、券商或保險公司落地這套“高質(zhì)量 Harness”,你面臨的不是一場技術升級,而是一場堪比“刮骨療毒”的極其痛苦的改造運動。
你至少要翻越三座幾乎不可逾越的大山:
第一座山:生產(chǎn)資料的“非標之痛”——AI 吃的是精糧,咱們喂的是糠
Harness 要發(fā)揮作用,首要前提是“上下文工程”。也就是要把企業(yè)的生產(chǎn)資料(文檔、API、數(shù)據(jù)字典、架構圖)標準化,塞給 AI。
![]()
但在金融業(yè),這簡直是噩夢:
祖?zhèn)鞔a與失蹤文檔:核心系統(tǒng)往往是十幾年前外購的,或者是幾代人“縫縫補補又三年”堆出來的。接口文檔?沒有。或者有,但已經(jīng)是三年前的版本了。
“人讀”與“機讀”的鴻溝:人類程序員看代碼,靠的是經(jīng)驗、直覺和“找老員工問”。但 AI 需要的是強結(jié)構化、無歧義、機器可直接解析的數(shù)據(jù)(比如嚴格的 JSON Schema)。把金融機構海量的“非標”資產(chǎn)清洗成“標準糧”,這是一個需要幾百人干上兩三年的臟活累活。
結(jié)論很殘酷:Garbage in, garbage out(垃圾進,垃圾出)。 在沒有完成底層數(shù)據(jù)治理之前,你搭的 Harness 再精美,AI 也只能在一個充滿謊言和錯誤的上下文里“一本正經(jīng)地胡說八道”。
第二座山:“薛定諤的熵增”——防得住人的錯,防不住 AI 的混沌
文章里提到一個高級概念:熵管理。系統(tǒng)運行久了會慢慢爛掉(架構漂移、技術債堆積),需要定期讓 AI 自己去掃描、修復。
聽起來很優(yōu)雅對吧?但在金融級的高可用系統(tǒng)里,這無異于“讓孫悟空去看管蟠桃園”。
金融系統(tǒng)的耦合度極高。一個微小的參數(shù)改動,可能引發(fā)下游幾十個賬務系統(tǒng)的連鎖反應。
人類改代碼會“畏手畏腳”,會去翻上下游依賴。但 AI 如果缺乏極其精準的“動態(tài)沙盒”和“全局依賴圖譜”,它會非常自信地跨模塊亂改。
所謂的“有機地管起來”,意味著你的 Harness 不僅要能放權,還得具備瞬間評估“AI 這次改動會不會導致明天開盤結(jié)算失敗”的能力。這種級別的管控工程,目前絕大多數(shù)金融機構的 DevOps 底子根本支撐不起來。
第三座山:合規(guī)與審批的“時空錯位”——AI 跑得快,但合規(guī)等得起嗎?
這是最致命的一擊,也是所有金融科技從業(yè)者的心頭血淚。
文章里的 Harness,講究的是“反饋循環(huán)”:AI 寫代碼 -> 跑測試 -> 發(fā)現(xiàn)問題 -> 立刻重寫。
但在金融機構,這個循環(huán)是斷裂的:
速度的錯位:AI 寫一個微服務可能只要5分鐘,但你們行里的上線審批流是怎樣的?開發(fā)自測、測試環(huán)境驗、UAT 驗、安全掃描、架構評審、科技部老總簽字、向監(jiān)管部門報備……走完可能要5周。
責任的真空:現(xiàn)有的審批流(OA、Jira 流轉(zhuǎn))是基于“人對人”的信任與追責體系。現(xiàn)在 AI 提了一個 PR,誰來背書?如果 AI 自動觸發(fā)了一個涉及客戶資金的變更請求,審批人敢點“同意”嗎?如果出了生產(chǎn)事故,是把 AI 的進程拉去開批斗會嗎?
系統(tǒng)打通的泥潭:把 AI 的輸出無縫嵌入到現(xiàn)有的 ITSM(IT 服務管理)、權限管控、審計日志系統(tǒng)中,絕不是寫幾個 API 接口那么簡單。它涉及到企業(yè)底層權力結(jié)構和合規(guī)邏輯的重構。
![]()
Part.3
降維思考:管理 AI,本質(zhì)上是一場極其復雜的“組織管理”
那篇刷屏文章的最后,落在一個極其精妙的類比上:搭 Harness,其實就像做企業(yè)管理。
寫 AGENTS.md(給 AI 的指令文檔) ≈ 給新員工寫 Onboarding 手冊;
配置 Linter 和強校驗規(guī)則 ≈ 制定公司的紅線和合規(guī)制度;
設計 CI/CD 流水線 ≈ 搭建質(zhì)量管理和審計部門;
定期做“熵管理” ≈ 每年搞一次技術債清理和架構復盤。
這恰恰點破了金融機構的痛點:我們連“管理人類程序員”的流程都還在痛苦地優(yōu)化中(敏捷轉(zhuǎn)型轉(zhuǎn)了五年還沒轉(zhuǎn)明白),現(xiàn)在你讓我去管理一個“每秒鐘產(chǎn)生一萬次幻覺、不知疲倦、無法用企業(yè)文化感化”的數(shù)字員工?
很多領導覺得買個大模型就能降本增效,這就像覺得招了一個頂級名校畢業(yè)生,公司業(yè)績就能翻倍一樣荒謬。
沒有匹配的組織土壤,再強的種子也會爛在泥里。
對于金融機構而言,真正的門檻從來不是“你能不能調(diào)通 API”,而是:
你能不能把隱性知識顯性化?
你能不能把非標流程標準化?
你能不能在“絕對安全合規(guī)”與“AI 極速迭代”之間,找到那個極其狹窄的平衡點?
如果這三點做不到,所有的 AI 投產(chǎn),都只能停留在“內(nèi)部演示 PPT”上。
![]()
Part.4
破局之道:金融機構如何搭建“接地氣”的 Harness?
既然硅谷的“全自動駕駛”模式走不通,金融機構難道就只能干等著嗎?
當然不是。我們需要的是“降維打擊”與“務實構建”。
不要追求一步到位的“Big Harness”,而是從以下幾個極其務實的小切口切入:
策略一:放棄“無人駕駛”,回歸“高級輔助駕駛”(Copilot 模式)
現(xiàn)階段,千萬不要讓 AI 直接去生產(chǎn)環(huán)境改代碼、提 PR。
最高性價比的 Harness,是把 AI 擋在“執(zhí)行”之前,讓它做“參謀”。
讓 AI 做需求拆解和反洗錢邏輯的偽代碼梳理;
讓 AI 根據(jù)業(yè)務文檔自動生成單元測試用例;
讓 AI 在代碼 Review 時找出潛在的安全漏洞。
只讓 AI 產(chǎn)出“文本建議”,不產(chǎn)出“可執(zhí)行變更”。這樣,你們行里現(xiàn)有的審批流、責任認定機制完全不需要改動,人依然是最終的執(zhí)行者和責任人。風險瞬間降到最低。
策略二:不碰“核心賬本”,建立“局部無菌室”
不要試圖在整個行里推行 AI 標準化。那會觸動所有部門的奶酪,注定死路一條。
找一個邊緣的、獨立的、哪怕是新建的微服務模塊(比如某個內(nèi)部管理看板、某個營銷活動配置頁面),在這個“無菌室”里,把文檔寫到極致干凈,把約束配到最嚴。在這個小圈子里跑通“模型+Harness”的閉環(huán),讓領導看到真實的價值,再圖擴張。
策略三:先上“硬約束”,暫緩“軟約束”
把文章里的 Harness 拆開看,投入產(chǎn)出比是完全不同的。
現(xiàn)在必須做、成本極低的硬約束:在現(xiàn)有 CI/CD 里加上更嚴格的 Lint 檢查、強制要求 AI 生成的代碼必須通過單元測試覆蓋率門禁、限制 AI 只能訪問特定的代碼庫白名單。
以后再做的軟約束:復雜的多 Agent 協(xié)同工作流、讓 AI 自己去重構歷史技術債。這些等大模型再進化兩代、幻覺問題徹底解決后再說也不遲。
策略四:把 AI 當成“受限實習生”,而不是“高級外包”
如何與管理系統(tǒng)打通?最簡單粗暴的方式:給 AI 開一個最小權限的賬號。
它提交的代碼,必須落入“待人工復核”隊列;它觸發(fā)的變更申請,必須走最嚴苛的審計追蹤。不要為了迎合 AI 去改造你的合規(guī)系統(tǒng),而是讓 AI 去適應你歷經(jīng)考驗的合規(guī)體系。
![]()
Part.5
別被忽悠了,真正稀缺的是“翻譯官”與“架構師”
回到文章開頭的那個問題:OpenAI 的“零人類代碼”是謊言嗎?
不是謊言,但那是屬于數(shù)字原生企業(yè)的“天課”。
他們花了極大的代價,用最頂尖的工程人才,構建了一套極度復雜的 Harness,才換來了那個看似輕松的數(shù)字。
對于金融機構而言,認清現(xiàn)實比盲目追捧更重要:
AI 只是照妖鏡,它把你企業(yè)過去十年欠下的“技術債”和“管理債”,放大了十倍照了出來。
未來在金融機構里,最值錢的不是懂得怎么調(diào)參的算法工程師,也不是會寫 Prompt 的提示詞工程師,而是這樣一群人:
他們既懂大模型的邊界,又深諳金融底層業(yè)務的曲折;
他們能把行里混亂的非標資產(chǎn),抽象成 AI 能理解的標準化上下文;
他們能在嚴苛的合規(guī)框架下,像搭樂高一樣,拼裝出一套輕量、可插拔、隨時能拆掉重來的“金融級 Harness”。
這不再是單純的技術問題,這是一場融合了技術架構、數(shù)據(jù)治理、合規(guī)風控與組織變革的系統(tǒng)級戰(zhàn)役。
門檻確實很高,高到足以淘汰掉那些只想賺快錢、只想拿 AI 講故事的玩家。
但也正因為門檻高,一旦你跨過去了,這座城墻就會成為別人無法逾越的護城河。
畢竟,在金融這個行當里,跑得快從來不是第一位的,穩(wěn)定高質(zhì)量發(fā)展才是真正的贏家。
Harness 門檻這么高,不如找 AI 廠商直接交付價值。
百融智能(6608.HK)是一家以企業(yè)級智能體(Agent)為核心、以“硅基員工”重構千行百業(yè)生產(chǎn)力的人工智能科技公司。公司圍繞“崗位導向 × 協(xié)同進化 × 結(jié)果計價”構建企業(yè)級智能體體系,自研多模態(tài)基礎模型,并面向語音交互等高時延敏感場景打造專用語音大模型與實時語音棧,疊加多行業(yè)領域?qū)倌P停纬筛采w感知、理解、決策與執(zhí)行的一體化智能體技術底座。
在此之上,百融智能構建了以 結(jié)果云 Results Cloud 為核心的結(jié)果交付體系,并由百工 AgentOS 統(tǒng)一承擔多智能體的編排、協(xié)同、治理與審計,使智能體能夠在營銷、客服、人力、風控、運營等關鍵崗位實現(xiàn)低時延交互、端到端流程自動化,并圍繞崗位指標進行結(jié)果交付與價值結(jié)算。
作為 AI 原生組織的先行實踐者,百融智能持續(xù)以硅基員工重塑自身運營體系,形成了業(yè)內(nèi)領先的硅碳協(xié)同效率與組織實踐樣本。百融智能已服務 8,000+ 家企事業(yè)單位,客戶覆蓋通信、金融、汽車出行、新能源及互聯(lián)網(wǎng)電商等行業(yè),是國內(nèi)最早一批實現(xiàn)企業(yè)級智能體規(guī)模化落地的新質(zhì)生產(chǎn)力實踐標桿企業(yè)之一。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.