![]()
編輯 | 蔡芳芳
生成式獎勵模型(GRM)通過思維鏈(CoT)顯著提升了獎勵信號的質量,但其“一刀切”的推理策略讓簡單樣本和復雜樣本消耗同等計算資源,導致顯著的算力浪費。騰訊混元與新南威爾士大學聯合提出的 E-GRM(Efficient Generative Reward Modeling)框架,將模型自身的不確定性重新定義為計算資源的調度信號,僅對真正困難的樣本投入完整 CoT 推理,對其余樣本走短路徑直接輸出。本文從問題背景、動態路由機制、判別式評分器到訓練與實驗四個維度對該框架進行系統解讀。
論文題目:Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
收錄會議:ACL 2026
arXiv 鏈接:https://arxiv.org/abs/2604.10072
問題背景與動機
1.1 靜態推理:GRM 繞不開的效率瓶頸
獎勵模型是 RLHF 流程的核心組件,為策略模型的候選響應提供質量信號。從標量獎勵模型到生成式獎勵模型(GRM),推理鏈的引入顯著提升了獎勵信號的可解釋性與判別能力,但也帶來了固有的效率問題:
1.資源同質化:無論是“這句話是否安全”的簡單判斷,還是“證明這道數學題”的復雜推理,GRM 都執行相同深度的 CoT 生成,簡單樣本被迫消耗與復雜樣本相同的 FLOPs。
2.投票機制信息損失:傳統 GRM 從 K 條推理鏈中通過多數投票決定答案,這種離散決策無法區分“推理過程正確”與“”恰好蒙對答案“”,獎勵信號噪聲較大。
1.2 E-GRM 的核心洞察:把不確定性變成調度信號
E-GRM 的核心觀察是:模型的解碼行為隱含著問題復雜度的信息。對同一輸入多次解碼,若輸出高度一致,說明模型已有充分把握,再追加 CoT 只是冗余計算;若輸出高度分散,則說明問題超出了模型的“直覺”,需要深度思考。基于這一觀察,E-GRM 將不確定性從傳統意義上“需要規避的風險信號”重新定義為“可被利用的計算資源調度信號”,構建了先快速判斷、再按需投入的智能路由框架。
E-GRM 方法論:動態路由視角
2.1 共識度:路由決策的核心指標
給定輸入 ,E-GRM 首先執行 次并行解碼( ,使用不同采樣溫度與 top-p 參數),得到初始響應集合 。共識度定義為:
其中 是答案 出現的次數。共識度值域 ,1.0 表示所有解碼完全一致,接近 0 表示高度發散。這一指標具備三個優良性質:取值有界、計算成本極低(僅多解碼 4 次)、且與問題難度呈強單調關系。
2.2 動態路由:基于閾值的二元決策
基于共識度,E-GRM 執行二元路由決策:
短 路 徑 ( 跳 過 ) 長 路 徑 ( 執 行 )
?短路徑:直接輸出共識答案 ,完全跳過 CoT 生成,計算成本僅為完整流程的 15-20%。
?長路徑:觸發 K 條 CoT 鏈生成、判別式評分、最優選擇的完整推理流程。
閾值 經過網格搜索確定,在 MATH 數據集上恰好對應準確率陡降點之前,實現效率與精度的帕累托最優。
2.3 并行解碼的工程實現
為壓低路由決策本身的開銷,E-GRM 將 5 次解碼組織在同一 GPU 批次內并行執行,借助張量核心的并行能力將額外延遲控制在 5%以內;同時通過差異化采樣參數(溫度{0.7, 0.8, 0.9, 1.0, 1.1})保證多樣性,避免參數同質化造成的“偽共識”。
2.4 判別式評分器:替代投票的連續質量信號
進入長路徑后,E-GRM 生成 K 條候選推理鏈,使用判別式評分器 替代傳統投票機制,輸出連續分數 。評分器基于 BERT 編碼器,將提示和推理鏈通過 [SEP] 拼接后編碼,從 [CLS] 位置經線性層映射到分數,參數量約 1 億。
評分器采用混合損失訓練:
Huber 損失在小偏差時二次懲罰、大偏差時線性懲罰,兼具精細調優與抗噪聲能力;鉸鏈損失僅在正負樣本分差不足時產生梯度,自動聚焦難例。 優先保證回歸精度。
2.5 Huber 損失的數學形式
Huber 損失分段函數定義為:
當預測誤差小于閾值 時使用 L2 損失提供精細梯度;超過閾值時切換為 L1 損失,防止異常標簽產生過大梯度,保障訓練穩定性。
2.6 兩階段訓練體系
SFT 階段:根據動態觸發將訓練集劃分為短路徑集(學習 )和長路徑集(學習 ),讓模型同時具備“”快答“”與“”慢思考“”能力。
擴展 GRPO 階段:在標準 GRPO 基礎上引入成對對比獎勵:
優化目標: ,其中 平衡離散答案正確性與連續推理質量。
![]()
圖 1:E-GRM 的完整框架,涵蓋從動態不確定性的量化到判別式評分器的整體流程。
![]()
圖 2:Coupled-GRPO 的成對偏好獎勵機制,使用評分器差值作為質量對比信號。
![]()
圖 3:E-GRM 訓練與推理完整流程。
實驗評估
3.1 核心效率指標
在 MATH 數據集上,E-GRM 的路由分布與傳統 GRM 形成鮮明對比:58%的樣本進入短路徑直接輸出;延遲從 3.8 秒降至 2.2 秒(-62%);FLOPs 從 23.7T 降至 15.7T(-49%);準確率從 75.1%提升至 78.4%(+3.3%),呈現“”既快又準“”的雙贏效果。
3.2 基準測試表現
基準
得分
RM-Bench
79.2%
Safety 子集 94.2%為全場最高
RMB Overall
超越 GPT-4o(0.738)
RewardBench
91.5%
Reasoning 子集 95.4%
3.3 消融實驗
變體
準確率
FLOPs
延遲
完整 E-GRM
78.4%
15.7T
2.2s
移除動態觸發
75.2%
23.4T
3.4s
移除評分器
72.8%
15.9T
2.2s
基線 GRM
69.1%
23.7T
3.6s
消融實驗揭示出一個關鍵發現:完整框架的增益(9.3%)大于單獨移除動態觸發(-3.2%)和評分器(-5.6%)的損失之和(8.8%),說明二者存在正向協同效應。其機制是:動態觸發篩選出真正需要評估的復雜樣本,使評分器能聚焦最有判別價值的對象。
3.4 路由質量與規模擴展
短路徑樣本人工抽樣準確率達 94.3%,證明高共識度確實對應簡單樣本;長路徑樣本相比傳統 GRM 提升約 2.3%,證明評分器有效。從 7B 到 32B,E-GRM 呈現一致的性能提升(RM-Bench: 70.1%→76.4%→79.2%),且長路徑樣本的精度提升(約 12%)顯著大于短路徑(約 5%),說明大模型優勢集中在復雜推理上。
3.5 完整推理管道
推理階段流程:(1) 對輸入 x 執行 M 次并行解碼;(2) 計算共識度并做出路由決策;(3) 短路徑直接輸出共識答案;(4) 長路徑生成 K 條 CoT;(5) 評分器對每條鏈打分;(6) 選擇最高分輸出。
貢獻與局限
4.1 核心貢獻
1. 首次將模型內部不確定性從“風險信號”拓展為“計算資源調度信號”,開創了按需推理的新范式。
2. 混合損失評分器在校準性與區分度之間取得最優平衡,連續質量信號替代離散投票。
3. 統一的動態觸發+評分+優化框架,對模型規模與任務類型保持穩定增益。
4.2 局限與展望
1. 并行解碼引入約 5%固定延遲,在極低延遲場景仍需進一步優化。
2. 固定閾值 在專業領域可能需要自適應校準。
3. 評分器在分布外推理風格上的泛化性有待驗證。
結 語
E-GRM 通過“共識度”這一簡潔信號,實現了延遲降低 62%的同時精度提升 3.3%,驗證了“減少不必要的推理”這一效率優化思路的有效性。動態路由機制讓獎勵模型第一次真正實現了“智能分配算力”,為大模型的高效部署提供了可復用的方法論模板,有望在 RLHF 推理系統中產生持續影響。
延伸思考
6.1 動態路由的范式轉換意義
E-GRM 將“動態計算分配”這一在視覺領域(如 Mixture-of-Experts、Conditional Computation)已經成熟的思想,首次系統化地引入到獎勵建模領域。這一引入不是簡單的技術遷移,而是將“模型自身的不確定性”作為路由信號——這是 E-GRM 最具原創性的貢獻。
6.2 智能資源分配的未來空間
未來的 LLM 推理系統將不再是“一刀切”的等長推理,而是根據問題難度、用戶場景、SLA 要求動態分配計算資源。E-GRM 的動態路由是這一未來方向的早期里程碑,其設計思路(共識度信號+二元路由+評分器評估)有望成為通用模板。
圖表附錄:
![]()
附圖 1:Coupled-GRPO 中配對獎勵函數公式。
![]()
附圖 2:擴展 GRPO 優化目標公式。
參考文獻:
Xue, C., Wang, Y., Liu, M., Zhang, H., Chen, K., Li, X., et al. (2026). Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty Estimation and Dynamic Routing Mechanisms. *Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)*, Main Conference Track, Long Papers. Association for Computational Linguistics. arXiv:2604.10072(https://arxiv.org/abs/2604.10072)
相關工作可進一步參考 RLHF 獎勵建模、生成式獎勵模型(GRM)、思維鏈(CoT)推理優化、模型不確定性量化、動態計算分配以及高效大語言模型推理等方向的最新研究成果,這些研究共同構成了 E-GRM 框架的理論基礎與技術脈絡。
版權說明:本文為對上述 ACL 2026 論文的學術解析,僅供學術交流使用。版權歸原作者所有。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.