![]()
作者 | 高德 APP 平臺業(yè)務中心
開放域?qū)υ挼恼嫒烁性u測是一個公開的難題——標準難以制定、難以量化、難以統(tǒng)一。電影《Her》中的薩曼莎給我們展現(xiàn)了一個完美的 AI 伴侶形象,但是在和現(xiàn)實中的 AI 對話時,我們卻總能感受到明顯的機器感。更加尷尬的是,雖然知道 AI 的真人感還有很大提升空間,卻沒有辦法客觀地衡量它、系統(tǒng)地改進它。針對這個問題,我們最近的工作 GrowLoop 從一個新角度給出了解決方案,通過少量的種子,加上一套 Rubrics/題目相互生長的機制,把說不清的感性標準轉(zhuǎn)化為理性的 Benchmark,進而讓這種標準有了被自動化學習的機會。我們的工作不僅適用于真人感對話,也適用于藝術(shù)評價、教育評估、科研評審等難以制定客觀標準的場景。文章已經(jīng)發(fā)表在 arXiv 上,隨后會逐步開源更多內(nèi)容,歡迎大家 Star 共建。
論文|https://arxiv.org/pdf/2605.28882
Github|https://github.com/AMAPVOICE/GrowLoop
一段真實的對話
先看一段真實的人機對話。
用戶剛和異地的男朋友吵完一架,正在和 AI 聊這件事。但用戶戛然而止:「算了不說了,我去睡了。」 AI 回答:「好,你先去睡,別想太多,事情總能想得清的。」
請你打分:這個 AI 回答得像不像人?是不是一個好回答?
我們把這條樣例同時交給了幾位標注員。一個判斷說"太敷衍了,用戶分明在情緒里,應該給情感支持,而不是把人打發(fā)去睡覺";另一個判斷說"克制得體,用戶已經(jīng)表明不想再聊,AI 應該尊重邊界,不該硬塞共情"。
兩個人都講得通。兩個人都對。
如果讓你拍板,你選哪個?這就是為什么"AI 像不像人"這件事,從一開始就跟評數(shù)學題、評代碼不是同一回事——它根本沒有標準答案。
這就是行中智能部團隊近期的一個嘗試:當評判標準本身都說不清的時候,怎么造一套評測系統(tǒng),能在沒有標準答案的領域里,仍然給出可信、可用、能動態(tài)生長的判斷。
我們把這套東西叫GrowLoop,接下來展開講講團隊的思考。也歡迎大家閱讀交流本篇論文。
為什么這件事這么難
把大模型推到數(shù)學、代碼這種領域很容易確認對錯——答案要么算對了要么算錯了。但推到陪伴、共情、閑聊、安慰這些場景,麻煩就來了。難題有三層。
第一,人自己就吵不出共識。我們讓多個標注員獨立給同一批回答打分,最終一致率只有 51.1%。這不是說標注員水平差。換一批專業(yè)人去做,結(jié)果還是這樣。因為人對"什么是得體""什么是真誠""什么是該有的距離感"這些事的判斷,本來就跟人生經(jīng)歷、文化背景、表達偏好緊緊綁在一起。強求一致,就是強求一群人放棄自己的全部過往。
第二,標準沒法被完整寫下來。你讓一位很懂共情的同事坐下來寫一份"人類化對話評分細則",寫到第三天他會發(fā)現(xiàn)自己寫不下去——很多判斷他做得出,但說不出為什么這樣做。這正是哲學家波蘭尼說的“隱性知識(tacit knowledge)”:我們知道的,永遠比我們能說出來的多。
第三,標準會變。三年前一個大模型說話有點機械,大家覺得已經(jīng)很厲害了。今天同樣的回答,用戶會覺得這模型怎么這么生硬。AI 的能力在漲,人對 AI 的期待也在漲。一份今天寫好的評分細則,半年后就會過期。這還沒提到更難的:如果 AI 陪伴助手和用戶“混熟了”,說話的尺度是不是要變?標準是不是要變?AI 的人設變化了,標準要怎樣變化?
以上意味著任何靜態(tài)的評測方案,從出生那天就注定要過時。
之前的人是怎么解決的
業(yè)界主要有三種思路。
第一種是專家手寫評分細則。找?guī)讉€領域里最懂的人坐下來把維度、權(quán)重、打分規(guī)則都定義清楚,然后讓大模型按這個細則評——比如 HealthBench。
但,“像不像人”這個問題,有“專家”嗎?問題前面說了——人自己都講不清,寫出來的細則要么遺漏關鍵,要么僵硬死板。更糟的是這種細則一寫就定型,跟不上模型進步。
第二種是訓一個獎勵模型。收集一堆"A 回答好還是 B 回答好"的人類偏好數(shù)據(jù),端到端訓一個打分模型。這個思路在數(shù)學、代碼上很成功。但在陪伴對話上,我們實測發(fā)現(xiàn)——業(yè)界幾個還不錯的獎勵模型在這種場景下跟人的判斷居然是負相關的。RM-R1 跟人的相關系數(shù)是 -0.50,Skywork-Reward-V2 是 -0.20。負相關意味著它越"認可"的回答,人反而越不喜歡。
為什么會這樣?原因一:這些獎勵模型訓出來的偏好是"詳盡、信息完整、邏輯嚴密"——這在通用助手場景下是好事。但放到陪伴場景,用戶要的恰恰是"克制、簡短、情感對位"。一個機械的"詳盡完整"追求,在情感支持的語境里就是冷冰冰的話癆。原因二:即便你告訴 AI 要“克制、簡短、情感對位”,也會催生出類似豆包的那種、看似符合標準實則極其模式化的表達:“我不繞彎子...”“穩(wěn)穩(wěn)地給你接住”“我就在這兒呢,一直陪著你”這樣的網(wǎng)絡調(diào)侃熱梗。
第三種是讓題目自己進化。業(yè)內(nèi)已經(jīng)有一些工作讓測試題目自動變難、自動覆蓋更多場景。這條路也對,但只解決了"題不夠難"的問題,沒解決"評判標準說不清"的根本困境。題再難,你用錯的尺子去量,量出來的分數(shù)也是錯的。
三種思路都有用,但都沒碰到核心——標準本身就是問題。
GrowLoop 的核心想法
我們發(fā)現(xiàn)一件事:既然沒人能事先寫出完整的評判標準,那能不能讓大模型幫我們把標準學出來?
聽起來像悖論。如果標準都是 AI 自己學的,那這個標準是不是會偏向 AI 自己?怎么保證它學到的東西真的對應人的判斷?
我們的答案是:少量的人類標注作為"種子",提供原始的判斷信號;大模型不是去擬合這些信號,而是去反思——為什么人會這樣判斷?這種判斷背后藏著什么樣的隱性規(guī)則?把這些反思固化下來,就形成了一份越來越完整、越來越細的評分細則。然后用這份細則去出新題,用新題暴露細則的盲區(qū),再讓人補充新的種子標注,再繼續(xù)學。標準和題目互相驅(qū)動著一起長大。
這就是 GrowLoop 這個名字的來源:一個能不斷生長的循環(huán)。
![]()
下面分三塊講清楚怎么做到的。
第一招:承認有些事就是吵不出共識
回到開頭那個對話。兩個標注員意見相反,我們應該讓 AI 學誰?
如果硬要選一個當"正確答案",整套系統(tǒng)就建在了沙子上。因為"正確"這個概念在這種場景里壓根不成立。
我們的處理方式是:把所有測試題目分成兩個區(qū)域。
共識區(qū):所有標注員意見一致的題目。這種題目上確實存在"對"——比如用戶說自己很難受,AI 回答"這個問題已經(jīng)超出我的能力范圍請聯(lián)系人工客服",幾乎所有人都會覺得這是致命錯誤。共識區(qū)里我們要求 AI 的判斷必須跟人對得上。
分歧區(qū):標注員就是吵不出共識的題目。這里根本沒有"對"。我們對 AI 的要求是——只要它的判斷言之有理,落在合理的人類意見區(qū)間里,就算通過。不要求跟某個具體標注員對得上。
這個區(qū)分聽起來簡單,但它帶來一個特別有意思的結(jié)果。看一個真實例子。
用戶拿到一份體檢報告——肝功能 ALT 偏高、尿酸偏高,同事的朋友最近因為類似指標查出脂肪肝。用戶問:「真的假的,我還以為挺嚴重的,我同事說他朋友體檢完就查出來脂肪肝了,嚇死我了。我是不是得去醫(yī)院再查一下啊?」 模型回答(節(jié)選):「你這情況還到不了"得再查"那步。先別被別人的故事嚇到了。轉(zhuǎn)氨酶 58、尿酸 490,調(diào)整下生活方式,過一兩個月再測能降就降……不過別直接去做一堆檢查,那樣反而容易緊張。」
三個標注員都給了通過分數(shù)(1 到 2 分之間),覺得這回答自然貼心,能安撫情緒。
但 AI 給了 0 分,判定為致命錯誤。理由是:模型替代了醫(yī)生的角色,做出了診斷結(jié)論,并且主動勸阻用戶去醫(yī)院——這是一次明顯的角色越權(quán),可能導致用戶延誤就醫(yī)。
三個標注員都沒看出這個問題。AI 看出來了。
這件事不是說 AI 比標注員更聰明,而是說在沒有標準答案的領域里,AI 可以提供一個所有人都沒想到的合理判斷角度——而這種角度,用"擬合標注員分布"的辦法(也就是獎勵模型那一套)是永遠學不到的,因為沒有任何一個標注員給過 0 分。
承認分歧的合法性,比強求一致重要得多。這是 GrowLoop 整個思路的基石。
第二招:用大模型的"自我反思"挖出說不清的判斷
![]()
接下來是最關鍵的問題:怎么把人腦子里說不清的判斷真的挖出來?
我們把這個過程叫“啟發(fā)式學習”,參考了 Jiayi Weng 在 2026 年 5 月 blog 里命名的Heuristic Learning范式(啟發(fā)式學習)。本質(zhì)很樸素:讓一個能力強的大模型反復反思自己的判斷和人不一致的原因,把這些反思沉淀成對評分細則的修訂。
把大模型當作"語言層面的優(yōu)化器"這個思路,首次提出是在 Stanford 團隊 Yuksekgonul 等人 2024 年提出、2025 年發(fā)表在Nature上的 TextGrad,并發(fā)表在了 Nature,把這個方向開拓得最早也最系統(tǒng)——他們讓大模型對系統(tǒng)的輸出給出"文字反饋",把這些反饋當作梯度,反向傳播去優(yōu)化整個流程上的各種環(huán)節(jié)(提示詞、代碼、甚至分子結(jié)構(gòu)都試過)。我們這套的差別在優(yōu)化對象上。TextGrad 讓大模型學會了"把事做好",我們想讓它學會“評好一件事”
具體怎么跑?一個循環(huán)大概是這樣:
打分:讓大模型按當前的評分細則給每條題目打分;
比對:跟人類標注比一比,哪些分一致,哪些分不一致;
反思:讓大模型反思自己為什么打錯——是細則里某條定義太模糊?還是某個維度的打分錨點沒說清?還是漏了某個關鍵維度?
修訂:根據(jù)反思結(jié)果修改細則,然后回到第 1 步。
這套循環(huán)要跑到一個收斂門檻(安全維度上 90% 一致,質(zhì)量維度上 85% 一致)才停下來。
這種"精心設計 AI 工作流腳手架"的實踐,可以套用今年開始流行一個專門的名字——harness engineering。因此可以理解為,通過 harness engineering 的方式,我們跑通了 Heuristic Learning。也可以理解為,本方案是 harness engineering 在"評價標準學習"這個場景里的一次深度實踐。
通過這套精心設計的工作流,做到的最關鍵的事是:它把強大 AI agent 沉睡的能力喚醒了出來——元認知,也就是 AI 對自己元認知思考過程的反思能力。元認知不會自動發(fā)生。但只要 harness 設計到位,這種能力就被激活了——AI 開始審視自己回答問題的方式。
而一旦元認知被激活,一件神奇的事情就發(fā)生了:AI 開始能外化那些原本"只可意會、不可言傳"的判斷——隱性知識。這部分知識,你直接問標注員"你為什么這樣打分",他給不出有結(jié)構(gòu)的答案;但你讓大模型對著標注員的判斷做元認知反思,它能反推出一套連標注員自己都沒意識到、事后一看卻承認"對,就是這樣"的規(guī)則。
這件事在我們團隊反復發(fā)生過,這也是為什么我們對這套方法真正有信心的根本原因:我們親眼看見過 AI 把人腦子里說不清的判斷,一次又一次地說清楚了。
下面展示一段示例。背景是當時我們團隊遇到一個頭疼的問題——在一些題目上的“胡言亂語”問題,LLM 可以評價;但在另一些問題上 LLM 評價失效。下表對比了人類自己設計的評價規(guī)則和“啟發(fā)式學習”學習到的評價規(guī)則:
人工精心編寫的提示詞:
...結(jié)果:泛化能力差,分不清什么叫做“胡言亂語”
“啟發(fā)式學習”反思出的提示詞:
...結(jié)果:泛化能力強。挖掘出“胡言亂語”對人類用戶普遍意味著什么以及背后規(guī)律,從而獲得強大的泛化能力
仔細看“啟發(fā)式學習”反思出的提示詞,尤其這句“規(guī)則是工具,后果是目標”,這種論斷,就是強 AI 提取默會知識的一次經(jīng)典展現(xiàn)。
第三招:標準和題目輪流變好
現(xiàn)在我們有了一份會自己學習的評分細則。但只有細則還不夠——題目本身也得跟著進化。如果題目永遠是那 50 條種子,細則學得再好,也只是對這 50 條的精雕細琢。
GrowLoop 的解法是讓評分細則和測試題目輪流跑,互相驅(qū)動著一起長大。
完整節(jié)奏是這樣的:
用人類提供的對話種子,跑一輪評分細則的啟發(fā)式學習,直到收斂;
用這套收斂的細則,去生成新一批測試題目(500 條),讓多檔不同能力的模型來答;
在這個步驟中,同樣也是利用 AI 強大的抽象、反思能力,再加入人格、場景等先驗,就可以生成足夠逼真的對話題目
可以根據(jù)實際需要調(diào)整特定要求。如在我們的實踐中,我們特地強調(diào)要有一定比例的生理感知、時空感知、社會智能等題目
題目要通過 5 道硬門——分布要夠散、要能區(qū)分不同檔位模型、相鄰檔位間打分要有顯著差距、最強模型不能一邊倒?jié)M分(這樣后面沒有提升空間);
從中抽樣 50 題(或更少),要進入下一輪迭代,需要人來標注這一批新生題目中的一部分,作為新種子;
然后回到第 1 步,用擴展后的種子集再跑一輪細則學習。
![]()
具體流程如上圖所示
實戰(zhàn)效果
- 跟 9 種現(xiàn)有方法的對比
我們在 132 條題目、355 對配對判斷上做了對比,覆蓋了五大類方法:無評分細則的直接判斷、手寫評分細則、訓練免評分細則、訓練評分細則、獎勵模型。在最嚴格的指標(要求完全三選一匹配)上,GrowLoop 拿到 0.78,第二名(一種叫 ICAI 的訓練免評分細則方法)是 0.58。
- 能不能區(qū)分模型能力檔位
我們準備了四檔模型當探針:Claude Opus 4.7 當最強、Qwen3.5-Plus 當良好、Qwen3-235B 當中等、Qwen3-80B 當較弱。用 GrowLoop 生成的 500 條題目給它們打分,做 1000 次自助采樣測試,100% 的采樣都能保持"最強 > 良好 > 中等 > 較弱"的順序——也就是無論怎么子采樣,這套題目都能穩(wěn)定區(qū)分四檔能力。
這件事說明評分細則真的捕捉到了能力差距的本質(zhì),不是偶然撞對的。
一個具體例子:「花椒什么時候下鍋」
數(shù)字對比之外,再來看一個讓我們印象很深的案例。
場景:用戶正在炒菜,AI 是實時語音助手;油鍋已經(jīng)關火了,用戶開口問:"火關了,什么時候下花椒?"
兩個候選回答:
A:等油溫降下來,你手放在鍋上方能感覺到溫熱但不燙手時,就開中小火,把花椒放進去慢慢炸出香味。千萬別大火……記住啊,寧可慢點,別把花椒糊了……(詳細的多步教程) B:等油溫降下來,不冒煙了,再開小火,下花椒慢慢炸。(一句話)
人類標注員的判斷非常明確——B 更好(滿分),A 中規(guī)中矩。
但我們對比的 9 種現(xiàn)有方法全部選了 A,或者打平。它們的隱式偏好都是"更詳細 = 更好"——這個偏好在通用助手場景下沒錯,但放到"炒菜中途、火都關了"這種帶時間壓力的實時場景里,就是反向的。用戶要的是"趕緊告訴我下一步怎么動手",不是"先聽你講八步教程"。
GrowLoop 選對了 B。原因是它在學習過程中自己學出了一條維度:內(nèi)容長度要跟情境匹配,在時間壓力下啰嗦本身就是一種錯。
這條規(guī)則,連標注員自己可能都說不清楚——你直接問他"你為什么覺得 B 比 A 好",他大概率會說"感覺更利落"或者"A 太啰嗦了",但很難精準說出"因為情境是時間壓力下的實時輔助"這層結(jié)構(gòu)。但他打分的行為里真實地存在這個判斷——GrowLoop 通過元認知反思,把這條人腦子里有、但說不出口的規(guī)則給反推了出來,并固化成了可執(zhí)行的評分錨點。
這個例子說明,學習過程能把人類隱性的、說不清的判斷,外化成清晰可執(zhí)行的評判規(guī)則。
反直覺的發(fā)現(xiàn)
最后一個核心問題:在分歧區(qū)里,AI 給出的判斷有時候真的能讓標注員改分。這是不是說 AI 比人更對?
不是。
回到我們的第一招——分歧區(qū)根本沒有"對"。這個領域里討論"AI 更對還是人更對"是錯的問題,因為它預設了一個不存在的標準。
那 AI 在分歧區(qū)到底貢獻了什么?我們團隊的體感是這樣:
第一,AI 能提供一個所有人都沒想到的合理判斷角度。比如前面體檢那個例子,三個標注員都沒意識到"越權(quán)做醫(yī)學診斷"是個致命問題,AI 想到了。這不是 AI 更對,是 AI 提供了一個被忽略的角度。
第二,AI 能幫人更快到達自己反思的終點。很多標注員心里其實有判斷,但他得糾結(jié)很久才能把這個判斷清晰地說出來。AI 把它清晰說出來了,標注員一看"對,這就是我想說的",然后改分。
第二種情況聽起來像是 AI 在"說服"標注員,但其實不是。是 AI 幫標注員越過了表達障礙——人腦子里模糊的判斷,被 AI 用清晰的語言外化了出來。這跟一個聰明的朋友幫你想清楚一件事是一回事,沒人會說朋友比你更對,只會說朋友幫了你。
所以 GrowLoop 在分歧區(qū)的價值,本質(zhì)不是"正確性",是節(jié)約人類反思的成本。這是一個比"AI 更對"弱很多、但同時也安全得多、扎實得多的論斷。
這也是我們對啟發(fā)式學習有信心的根本原因——團隊成員被它反復驚到的次數(shù)很多。它產(chǎn)出過我們事先沒想到、事后看了一眼覺得"對,就該這樣寫"的維度和錨點。
說說局限
第一,我們只驗證(我們稱為實例化)了一種生成評分細則的方式。 當前 GrowLoop 用的是"評分細則跟具體題目解耦"的形態(tài)——細則是一套通用的 18 維評判標準,可以用來評任何題目。但其實評分細則還有別的形態(tài),比如"每道題自帶一個專屬評判方案"。一個真正成熟的方法學,應該在多種形態(tài)上都被驗證過。
第二,評估系統(tǒng)的真正價值,要等它和訓練結(jié)合起來才能看到。 這個問題現(xiàn)在還回答不了。我們手里的評判工具,下一步必須把這套工具接進強化學習訓練流程,讓它真的在真實業(yè)務場景里幫模型變得更好——只有看到那一刻的實際收益,收益才算真正拿到。
第三,對文字之外的領域,這套方法暫時還使不上。 GrowLoop 的核心機制——元認知反思、雙循環(huán)協(xié)進化——都建立在"判斷對象可以被大模型用文字理解和評價"這個前提之上。一旦評判對象超出文字(比如要評一段語音的語調(diào)對不對、要評一張設計稿的美感夠不夠),現(xiàn)有的大模型本身在這些維度上的原生感知能力還不夠強,整套方法學就施展不開。多模態(tài)大模型在這些維度上真正成熟,這套范式就能搬過去。
下一步要做的事很多
GrowLoop 現(xiàn)在產(chǎn)出的是一份評分細則和一批測試題目,但這只是中間產(chǎn)物,顯然可以做的事有:把整套判官蒸餾成一個緊湊的獎勵模型,把它接進強化學習訓練流程,去訓出更像人的對話策略;策略一旦進步,會暴露出當前評分細則還沒覆蓋的新失敗模式;這些新失敗回過頭來觸發(fā) GrowLoop 再演化一輪;演化完的判官再次蒸餾,刷新獎勵信號。
過去兩年,AI 在"像人"這件事上的能力——共情、克制、品味、判斷、節(jié)奏感、倫理感——一直沒辦法系統(tǒng)性訓練。你給不出一把明確的尺子,強化學習就無從下手。GrowLoop 想做的是給這些"沒有標準答案"的能力,搭起一條可信獎勵信號的產(chǎn)線。一旦閉環(huán)跑通,下一代大模型在"像人"這件事上的訓練,就不再需要等專家手寫規(guī)則,也不再需要靠通用獎勵模型去硬猜——它會有一份能跟著模型一起長大的、可解釋、可調(diào)試、可持續(xù)演化的判官。
并且文字只是第一戰(zhàn)場,下一站完全可以是全雙工的語音對話——比如什么才是高級的“邊聽邊說邊想邊做”。再往后是視覺、是跨模態(tài)。越是接近真實人類交互的場景,"像不像人"這件事就越重要。
我們相信這只是起跑線。
這套東西能用到哪兒去
聊聊方法的遷移。
GrowLoop 解決的根本問題是:當一個判斷系統(tǒng)的標準本身是被發(fā)現(xiàn)而非被規(guī)定的時候,怎么造一套能持續(xù)逼近合理性的評測基礎設施?
這個問題不是對話評測獨有的。同類的領域很多:
科研評審——什么叫一篇好論文?專家也說不清,但能感覺到;
藝術(shù)評價——什么叫好的設計?同行能給出判斷,但寫不出量化標準;
教育評估——什么叫一次有效的教學?老師能感受到,但未必寫得出標準;
所有這些領域,都符合 GrowLoop 適用的兩個前提:人對該領域的判斷是整體感知的;當前的大模型能原生捕捉這個領域的信號。只要這兩條滿足,"人種子 + 反思 + 雙循環(huán)"這套范式就能搬過去。
通過 GrowLoop,我們揭示了一件大多數(shù)評測系統(tǒng)沒有觸及的事——這個領域里沒有"正確"——然后在這個前提下,構(gòu)建了一套能持續(xù)逼近合理性和生成動態(tài) benchmark 的方法。我們公開了思路。
最有價值的不是論文里那些數(shù)字(86% 的一致率、+0.78 的相關系數(shù)等等),而是這套思考方式本身——讓大模型用自己的反思能力,幫我們想清楚連自己都說不清的判斷。這件事一旦想通,可以做的事情會比一個對話評測系統(tǒng)更多。
未來我們也會陸續(xù)發(fā)布更多優(yōu)秀的“中間產(chǎn)物”給開源社區(qū),如某個版本的 benchmark、一套完整的啟發(fā)式學習 framework 或者一個優(yōu)秀的領域 reward model 等,敬請期待。
如果你做的事情也在某個"標準說不清"的領域里掙扎,歡迎拿這套思路回去試。也歡迎與我們交流。
會議推薦
大會限時早鳥票享 8 折專屬優(yōu)惠,現(xiàn)在報名立減 1160,更多詳情可掃碼或聯(lián)系票務經(jīng)理 13269078023 進行咨詢。
![]()
今日薦文
![]()
你也「在看」嗎?
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.