Bayesian control for coding agents
編碼代理的貝葉斯控制
https://arxiv.org/pdf/2606.24453
![]()
![]()
摘要:
現代編碼智能體將大語言模型生成器與各種工具配對,包括廉價的診斷工具和昂貴的驗證器。工具使用決策通常由編排器控制,這些編排器通常使用固定規則并忽略不確定性。我們將編排表述為對成本敏感的序貫假設檢驗:一個貝葉斯控制器維護關于候選代碼正確性的信念,并動態決定是否收集更多證據、改進候選代碼、驗證它或停止。在六個生成器和九個編碼基準上,當驗證成本高昂且評價器提供信息但不完美時,貝葉斯控制被證明是最有價值的。除了控制之外,信念狀態產生了一個可解釋的正確性分數,該分數在不確定性量化方面優于token概率和原始工具成功基線。
1 引言
大語言模型(LLMs)生成復雜代碼的能力日益增強,但其實際影響最充分地體現在通過編排生成、診斷、改進和驗證的編碼智能體上。現代編碼智能體運行框架通常將基于LLM的生成器與輔助工具封裝在一起,例如語法檢查器、公開測試、基于LLM的審查器、改進提示,以及一個高保真驗證器(也稱為預言機),它近似或建立真實值(Yang等,2024;Wang等,2025)。由于這些工具在成本和可靠性上各不相同,核心的工程問題是在通過策略性地決定何時改進、丟棄或驗證候選解決方案來有效分配有限資源的同時,生成正確的代碼。
許多現有的編排策略使用固定規則來解決這個問題,例如始終驗證、N選優采樣、單一評價器門控,或預定義的“生成-評價-重新生成-驗證”循環(Inala等,2022;Li等,2022;Chen等,2023;Huang等,2023)。盡管這些策略可能具有競爭力,但它們并不維護關于候選代碼正確性的后驗分布,也不顯式地將評價器調用的價值與其成本進行權衡。因此,它們并非被設計為根據先驗任務難度、評價器可靠性、生成器修復概率或驗證器成本來調整停止決策。
在這項工作中,遵循Papamarkou等(2026),我們將代碼生成控制作為一個貝葉斯決策問題來研究。潛在狀態是候選代碼的正確性,Y ∈ {0, 1}。控制器維護一個信念 b = P(Y = 1 | 證據),表示當前候選代碼是否會通過驗證器。評價器調用被視為帶噪聲的觀測,生成器調用被視為可能修復或破壞候選代碼的隨機轉移,而驗證器調用被視為成本高昂的終端動作。目標是期望效用,即正確解決方案的獎勵減去生成、評價、改進和驗證的累積成本。這產生了一個序貫假設檢驗問題,可以將其編碼為部分可觀測馬爾可夫決策過程(POMDP)(Kaelbling等,1998),其貝爾曼方程表達了信息的價值。圖1展示了我們的貝葉斯控制循環。
![]()
我們用兩個從貝爾曼方程推導出的控制器來實現這一思想。第一個是單步貝葉斯貪心控制器,它利用評價器似然度來決定是否調用另一個評價器、進行驗證、重新生成或停止。第二個是有限視界貝葉斯動態規劃(DP)控制器,它執行向后歸納,并使用從迭代改進軌跡中估計出的測量得到的生成器轉移核,即 ?P(修復 | 損壞) 和 ?P(破壞 | 正確)。這兩個控制器都在凍結的LLM之上運行:基礎生成器不進行訓練,優化問題完全在控制層。
我們提出了一系列經驗性問題:貝葉斯信念狀態控制器何時能改善經成本調整的代碼生成;簡單的啟發式方法何時就足夠了;以及驗證何時如此便宜或成功的先驗概率如此之高,以至于不需要編排?我們在九個編碼基準上評估了六個生成器,并在不同的成本-獎勵權衡下比較了這些策略的期望效用。結果表明,在具有提供信息但不完美的評價器的低先驗概率情形中,貝葉斯控制最有用;而當公開測試對隱藏測試成功的預測性很高、候選補丁已經很可能正確,或者驗證成本很低時,簡單的公開測試門控或始終驗證策略是更可取的。動態規劃只有在測量得到的修復轉移使得多步改進具有價值時才增加價值。我們的經驗研究通過樣本外驗證、與更強改進基線的比較,以及指出樸素貝葉斯變體何時失敗的負面結果,支持了這些結論。
本文的貢獻如下。(1)我們將代碼生成控制表述為關于候選代碼正確性的對成本敏感的序貫假設檢驗問題。(2)我們從貝爾曼方程推導出兩個貝葉斯信念狀態控制器,即單步貪心控制器和有限視界動態規劃控制器。(3)跨不同生成器和基準的實驗揭示了控制哪種編排策略占主導地位的三種情形,并闡明了動態規劃何時勝過貪心策略。(4)我們進一步表明,由我們的假設檢驗框架誘導的后驗信念可作為編碼智能體的有效不確定性分數,可用于檢測低質量的智能體輸出。
2 相關工作
貝葉斯決策理論。我們的方法使用了序貫分析和信息價值。
Wald(1947)研究了在錯誤和采樣成本之間進行權衡的序貫檢驗,而Howard(1966)將證據的經濟價值形式化。POMDP將這種邏輯推廣到潛在狀態不確定性下的控制(Kaelbling等,1998)。Papamarkou等(2026)最近的工作認為,智能體AI的控制層應該維護關于與任務相關的潛在量的信念,并根據效用采取行動。我們的論文在代碼生成中實現了這一想法。潛在變量是候選代碼的正確性,觀測值是語法檢查、公開測試和LLM評判器,轉移是改進步驟,終端動作是昂貴的驗證器。
針對LLM智能體的POMDP方法。最近的工作已開始將貝葉斯信息獲取用于LLM智能體。Choudhury等(2026)使用序貫貝葉斯實驗設計來選擇在多輪信息收集中最大化期望信息增益的問題。Suri等(2025)將工具參數澄清建模為結構化不確定性,并使用POMDP來選擇澄清性問題。這些論文在精神上很接近,因為它們將交互視為代價高昂的信息獲取。它們在潛在狀態、動作空間和經驗目標上與我們的設置不同。我們研究代碼生成控制,其中智能體必須決定是否購買更多診斷證據、改進候選代碼或支付驗證費用,并且我們在編碼基準上評估效用,而不是澄清成功率或信息收集游戲。
編碼智能體。大量工作致力于編碼智能體。生成的測試和重排序已被用于選擇更好的候選代碼(Chen等,2023;Inala等,2022;Zhang等,2023)。迭代自我反饋和語言記憶方法在多輪中改進模型輸出(Madaan等,2023;Shinn等,2023)。像AgentCoder和LATS這樣的多智能體和樹搜索系統引入了更豐富的生成-測試-改進或規劃循環(Huang等,2023;Zhou等,2024)。像SWE-agent和OpenHands這樣的倉庫級智能體專注于接口、沙盒執行和自主工具使用,以處理真實的軟件工程任務(Yang等,2024;Wang等,2025)。我們的經驗設置遵循已建立的代碼生成和程序修復基準,包括LiveCodeBench、SWE-Bench、EvalPlus、HumanEvalFix和CodeContests(Jain等,2025;Jimenez等,2024;Liu等,2023;Muennighoff等,2024;Li等,2022)。
總而言之,這些方法和基準展示了外部反饋、迭代控制和智能體停止策略的價值,它們為我們的評估提供了實驗基礎。我們方法的顯著特征是它將智能體的不確定性量化為關于候選代碼正確性的后驗信念。這種后驗既為成本感知控制提供了決策狀態,又提供了不確定性分數。因此,我們的框架與現有的智能體運行框架是互補的:它們的工具使用和停止循環可以用后驗信念來增強,而不是被替換。此外,我們對成本和可靠性情形的表征確定了這種信念何時能改進固定工作流,以及何時更簡單的策略就足夠了。
3 任務與環境
我們考慮資源約束下的自動程序綜合問題。本節形式化了任務環境、計算智能體的抽象以及驅動控制的決策論目標。
![]()
![]()
4 貝葉斯決策論控制
![]()
![]()
![]()
![]()
![]()
![]()
最優控制與啟發式方法。 編排啟發式方法,例如對置信度分數進行閾值處理,將決策問題簡化為一個標量邊界。這可能是不夠的,因為最優策略取決于正確性的后驗概率、特定動作的似然度、成本、剩余預算以及哪些信息來源已被使用。例如,在查詢任何評價器之前,一個低置信度的候選程序可能具有很高的信息價值,使得調用評價器比進行改進更可取。而在公開測試失敗后,一個低置信度的候選程序可能幾乎沒有剩余的診斷價值,使得進行改進更可取。靜態閾值可能會將這些情況同等對待,而貝爾曼更新則通過生成器、評價器和驗證器動作的 Q Q 值將它們區分開來。
![]()
5 實驗設置
我們調查了貝葉斯控制器優于啟發式基線的條件及其失敗模式。額外的設置細節見附錄 A。
5.1 基準和生成器
基準。 我們在跨越三個任務系列的九個基準上進行了實驗(表 3)。函數級合成基準(function-level synthesis benchmarks)包括三個難度層級的 LCB,涵蓋從 v1 到 v6 版本的 LeetCode 問題,MBPP+(Liu 等人,2023),以及 HumanEval+(Liu 等人,2023)。倉庫級補丁生成基準(repository-level patch-generation benchmarks)是 SWE-Bench Lite 和 SWE-Bench Verified(Jimenez 等人,2024)。漏洞修復基準(bug-fixing benchmarks)是 HumanEvalFix(Muennighoff 等人,2024)和 CodeContests(Li 等人,2022)。
![]()
5.2 評價器與預言機驗證器
預言機驗證器代表了一個運行成本高昂的測試套件,它以確定性方式檢查解決方案的正確性。對于 LCB,它是一個完整的隱藏測試套件;對于 SWE-Bench,它是一個基于 Podman 的測試框架;而對于 MBPP+/HumanEval+,它由基于斷言的單元測試代表。
![]()
評價器和預言機驗證器成本向量是特定于部署的超參數。為了獲得我們實驗中使用的成本向量,我們從一個代表性部署中收集遙測數據。我們測量生成成本、評價器成本和預言機驗證器成本。對于每個動作,我們記錄掛鐘延遲、token 用量和 API 成本。我們使用掛鐘延遲作為主要的代理成本指標,因為它最能捕捉實踐中至關重要的操作瓶頸,包括本地進程開銷、CI 等待時間、容器執行和外部 API 延遲。關于測量值和確切向量的詳細信息見表 4。
![]()
5.3 基線策略
![]()
迭代改進基線(Iterative-refinement baselines)。我們與 Self-Refine (Madaan et al., 2023) 和 Reflexion(Shinn et al., 2023) 編碼智能體基線進行比較。兩者每個實例最多運行四個改進步驟,并使用與貝葉斯控制器相同的驗證器預算,且兩者都不使用我們在校準軌跡上的策略回放。在每次驗證失敗后,Self-Refine 提示生成器批評其自己的補丁并重新生成,當驗證器返回 PASS 或改進預算耗盡時停止。Reflexion 通過一個包含過去失敗的語言記憶緩沖區擴展了 Self-Refine,該緩沖區被反饋到重新生成提示中。
5.4 貝葉斯信念狀態策略的細節
![]()
![]()
![]()
![]()
轉移概率是基于迭代改進語料庫中連續的父子生成對,并使用平滑技術進行估計的:
![]()
5.5 評估指標
![]()
6 結果
![]()
6.1 基于先驗和成本-獎勵比的控制策略主導情形
![]()
![]()
![]()
6.2 策略比較
![]()
![]()
![]()
6.3 評價器信息量
![]()
6.4 成本情形與參數敏感性
![]()
![]()
6.5 編碼智能體的不確定性
除了使用貝葉斯控制器來優化期望效用外,我們還調查了信念狀態是否能量化最先進的基于 LLM 的控制器的不確定性(詳見附錄 C)。在這個實驗中,我們使用帶有 gpt-oss-20b 的 SAGE 智能體 (Suri et al., 2025)。貝葉斯模型僅用于事后將評價器和驗證器的反饋聚合為一個信念,即在觀察到最終的預言機驗證結果之前,代碼是正確的。表 1 報告了 LCB-Medium 和 LCB-Hard 上的結果。平均而言,與 token 概率不確定性基線以及簡單地平均觀察到的工具結果的原始工具成功率基線相比,貝葉斯信念狀態在對不正確代碼生成進行排序方面實現了最佳性能。這表明,即使對于由 LLM 控制的編碼智能體,使用貝葉斯聚合評價器和非最終驗證器觀測值獲得的信念狀態也能提供有用的不確定性分數。
![]()
7 結論
我們將基于大語言模型(LLM)的代碼生成編排表述為一個對成本敏感的序貫假設檢驗問題,其中控制器維護關于候選代碼正確性的后驗信念,并利用它在評價、改進、驗證和停止之間做出選擇。我們的實驗揭示了三種情形。(A)當驗證成本高昂且評價器提供信息但不完美時,貝葉斯控制器表現最好,因為它們可以聚合多個帶噪聲的信號并對弱評價器進行降權。(B)當公開測試評價器已經接近預言機時,一個簡單的公開測試門控就足夠了,這使得更復雜的貝葉斯聚合幾乎沒有額外收益。(C)當驗證成本廉價或生成器的正確性先驗概率很高時,無條件驗證占主導地位,因為此時收集額外信息不值得其成本。這有助于確定貝葉斯控制何時有用,以及何時更簡單的編排策略就足夠了。
除了控制之外,我們的結果表明,該信念可以用作一個可解釋的不確定性分數,以識別生成的代碼是否正確。這使得所提出的貝葉斯框架與現有的編碼智能體具有互補性:它既可以直接用于控制智能體循環,也可以為外部控制器產生的軌跡提供不確定性分數。更系統地研究這一研究方向是未來工作的一個重要方向。
![]()
![]()
![]()
![]()
![]()
原文鏈接:https://arxiv.org/pdf/2606.24453
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.