Statistically Valid Hyperparameter Selection: From Tuning to Guarantees
統計有效超參數選擇:從調優到保證
https://arxiv.org/pdf/2606.25601
![]()
![]()
![]()
![]()
![]()
![]()
摘要
超參數選擇是現代人工智能系統部署中的關鍵步驟,因為需要調整諸如推理時參數、實現級設置以及驅動決策規則的閾值等自由度。盡管具有重要的實際意義,超參數選擇通常采用網格搜索或貝葉斯優化等盡力而為的經驗方法來執行,這些方法無法在可靠性或安全性方面提供形式化的統計保證。
本專著提出了一種用于可靠超參數選擇的統一統計框架,該框架以“先學習后測試”(LTT)范式為核心,將問題表述為在候選超參數集上進行多重假設檢驗。該框架能夠選擇經證明滿足特定應用可靠性要求(如平均風險界、分位數風險或信息論約束)的超參數,并對誤差概率實現明確的有限樣本控制。支撐該框架的統計工具,即p值、e值和集中不等式,在專門附錄中從第一性原理出發進行了構建。
從核心LTT方法出發,本專著沿四個方向逐步拓展了該框架。首先,它將LTT從平均風險拓展至一般可靠性泛函,包括分位數風險控制和信息瓶頸約束。其次,它針對必須同時滿足多項可靠性約束的多目標場景,開發了帕累托檢驗與基于可靠性圖的帕累托檢驗。第三,它通過利用e過程和任意時刻有效推斷的自適應與序貫方法,放寬了批量校準假設,從而降低標注預算。第四,它考慮了真實標簽有限的場景,將基于打賭的檢驗與預測驅動推斷(PPI)相結合,以實現從自評估數據中進行可靠的超參數選擇。
貫穿全文,該框架通過圖像分類、無線數據包調度以及大型語言模型(LLM)提示工程等實際應用進行了演示,并輔以經驗對比,展示了啟發式調優與具有統計保證的選擇之間的差距。
第1章 可靠的超參數選擇
1.1 現代人工智能系統中的超參數選擇
1.1.1 范圍
超參數決定了人工智能模型的構建、訓練和部署方式。與從訓練數據中自動估計的模型參數不同,超參數必須利用額外的信息源來指定,這些信息源包括先驗知識以及校準或驗證數據。 廣義而言,超參數在不同層面上控制著機器學習系統的運行:
![]()
- 模型層,超參數包括架構選擇,例如 token 間處理的類型(如自注意力機制與狀態空間模型),以及網絡的深度和寬度。
- 學習層,超參數包括學習率、正則化系數、批量大小,以及混合專家架構中的訓練時溫度。
- 推理層,超參數決定模型輸出如何轉化為行動或決策,例如通過置信度閾值、拒絕規則,或解碼參數(如語言頭的溫度)。
- 部署層,超參數編碼諸如模型激活值和權重的精度等方面。
在傳統的機器學習流水線中,優化基于模型或基于學習的超參數通常需要使用交叉驗證等方法運行多輪訓練(參見,例如,(Simeone, 2022))。然而,對于現代大型 AI 模型,這是不可行的,因為即使單次全量訓練也構成了重大的計算投入 (Kaplan et al., 2020; Hoffmann et al., 2022)。
針對模型層或訓練層超參數的實際解決方案包括通過優化資源分配策略(如連續減半法 (Jamieson and Talwalkar, 2016) 和 Hyperband (Li et al., 2018))在多個超參數配置下進行部分重訓練。對于極大型模型,通常轉而依賴縮放定律,將較低規模下的最優選擇轉化為較高規模下的有效選擇 (Kaplan et al., 2020; Hoffmann et al., 2022)。
與模型層和訓練層超參數不同,推理和部署層超參數可以通過預訓練模型的后訓練策略進行優化。此類后訓練方法支持對不同超參數性能的數據驅動評估,即使對于大型 AI 模型也是如此。在本專著中,我們針對推理和部署層超參數,從而聚焦于后訓練超參數選擇方法。
![]()
1.1.2 示例
應用和使用案例的示例包括以下內容:
- 在大型語言模型中,解碼超參數(如溫度、核采樣閾值和安全過濾器)直接影響回復的多樣性、事實性和拒絕行為 (Bommasani, 2021; Holtzman et al., 2019)(參見圖 1.2 的示例)。
- 在推薦和排名系統中,正則化強度和探索參數會影響穩定性、長期用戶參與度和反饋循環 (Covington et al., 2016)。
![]()
- 在計算機視覺流水線中,置信度閾值決定預測是被接受還是推遲,從而塑造了檢測和分割任務中的查準率-查全率(precision-recall)權衡 (He et al., 2017)。
- 在支持學習的通信和控制系統中,超參數調節吞吐量、延遲、可靠性和能耗之間的性能權衡 (Shlezinger et al., 2021; Simeone et al., 2025)。
- 在真值在環(ground-truth in-the-loop)系統 (Geifman and El-Yaniv, 2017; Raghu et al., 2019) 中,置信度閾值和安全裕度控制著模型何時被允許自主行動或升級至回退策略 (Amodei et al., 2016)。
1.2 盡力而為調優方法的局限性
超參數選擇傳統上被視為一個經驗性能優化問題。給定一個校準(或驗證)數據集和預定義的評估協議,目標是在計算約束下識別出在該數據集上實現較強平均經驗性能的超參數配置。
這種以優化為中心的視角催生了豐富且成熟的關于超參數優化(HPO)的文獻。在本節的其余部分,我們首先簡要回顧HPO方法,然后討論促使本專著開發以可靠性為導向的框架的差距和局限性。
1.2.1 以優化為中心的超參數選擇
HPO中的主導范式將問題構建為黑盒優化問題。超參數被視為決策變量,訓練和評估流水線定義了一個隨機目標函數,任務是高效地搜索超參數空間,以最大化預期的經驗性能。
早期方法依賴于窮舉或隨機探索策略,如網格搜索和隨機搜索,由于其簡單性和魯棒性,這些方法至今仍被廣泛使用(Bergstra and Bengio, 2012)。后續工作引入了基于模型的策略,最著名的是貝葉斯優化,它構建驗證性能的代理模型,并使用采集函數來平衡探索和利用(Snoek et al., 2012; Shahriari et al., 2016)。
為了解決評估超參數配置的高計算成本,特別是在現代深度學習中,提出了多保真度和老虎機風格(bandit-style)的方法。諸如連續減半法和Hyperband等方法自適應地分配計算資源,提前終止表現不佳的配置,同時為有希望的候選者投入更多資源(Jamieson and Talwalkar, 2016; Li et al., 2018)。相關思想出現在基于種群的訓練和進化策略中,它們在訓練期間維護和演化配置種群(Jaderberg et al., 2017)。
最近,基于梯度的HPO方法被開發出來,利用隱式微分和超梯度通過訓練過程直接優化連續超參數(Franceschi et al., 2018)。當訓練動態是可微且計算上易于處理時,這些方法特別有效。
1.2.2 缺乏可靠性與選擇后保證
從本專著的視角來看,上述回顧的方法最好被理解為盡力而為的調優過程。盡管它們在提高平均性能和降低計算成本方面非常有效,但其設計初衷并非為了在部署后對所選超參數的可靠性提供明確的保證。事實上,盡管這些方法在算法上具有多樣性,但它們共享一個共同的目標,即優化經驗性能。因此,標準的基于優化的HPO方法并未正式考慮與經驗風險估計相關的不確定性。正如 (Franceschi et al., 2025) 所強調的,HPO的主要目標是樣本效率、計算可擴展性和漸近性能。關于選擇后有效性、選擇性誤差控制或對所選配置的有限樣本保證等問題,在很大程度上超出了以優化為中心的框架的范圍。
![]()
![]()
![]()
![]()
1.3 問題定義
非正式地說,一個可靠的超參數選擇是指根據用戶定義的閾值,其表現足夠好,且違反關鍵要求的概率很低。因此,可靠性是關于部署系統在未來行為的一種陳述,這種未來行為面臨著源于數據變異性和環境隨機性的不確定性。本節詳述的這一視角,與近期關于從以性能為中心的 AI 系統評估轉向以可靠性和安全性為中心的評估的呼吁相一致 (Amodei et al., 2016)。
1.3.1 超參數選擇域
![]()
1.3.2 可靠性要求
為了確定超參數何時是可接受或可靠的,我們首先指定一個特定于應用的損失度量,例如預測誤差、約束違反率或系統級成本。如果所選的損失統計量(例如其期望值或尾部概率)低于用戶定義的閾值 α α,則該超參數被聲明為可靠的。
![]()
![]()
![]()
1.4 符號與縮寫匯總
表 1.1 匯總了本專著中使用的符號,而表 1.2 列出了文中出現的主要縮寫。
![]()
![]()
![]()
![]()
1.5 專著的范圍與組織結構
如前所述,本專著的其余部分將開發1.3 節概述的統計上有效的超參數選擇框架,并沿四個方向逐步擴大其范圍:更一般的風險概念、多個同時優化的目標、自適應和順序評估預算,以及在有限標注數據下的認證。
第 2 章介紹了核心方法論,即 (Angelopoulos et al., 2025) 提出的“先學習后測試”(LTT)框架,該框架將可靠的超參數選擇表述為一個多重假設檢驗(MHT)問題。每個候選超參數都關聯著一個零假設,即其真實風險超過了目標水平,并且通過任何控制全局誤差準則(如族錯誤率 (FWER) 或錯誤發現率 (FDR))的 MHT 過程,都會產生一個有限樣本認證的集合。本章開發了支撐性的統計工具,即 p 值和 e 值,并展示了集中不等式和基于打賭的檢驗論證如何將經驗風險估計轉化為有效的檢驗統計量。
第 3 章在兩個典型應用上展示了 LTT 框架:Fashion-MNIST 上的圖像分類 (Xiao et al., 2017) 和基于學習的無線調度器的數據包調度 (Sant Ana and Marchenko, 2020; Valcarce, 2020)。在這兩種情況下,傳統的經驗超參數優化被證明會以大大超過用戶指定的中斷概率的比率違反規定的可靠性約束,而 LTT 則如理論保證的那樣控制了違規率。
第 4 章將 LTT 從平均風險擴展到更一般的可靠性泛函。本章提出了一種統一的基于反演的方案,用于從單側置信界構建有效的 p 值,并將其實例化為兩個重要的非平均標準:分位數風險控制,它產生了 (Farzaneh et al., 2024) 的分位數 LTT (QLTT) 過程并提供針對尾部事件的防護;以及信息論相關性約束,它產生了 (Farzaneh and Simeone, 2025b) 針對信息瓶頸問題的 IB-LTT 過程。
第 5 章解決了必須同時強制執行多個可靠性約束而盡力優化次要目標的場景。本章開發了帕累托檢驗(PT)(Laufer-Goldshtein et al., 2023),它將假設檢驗限制在經驗帕累托前沿,并沿所得排序應用固定序列檢驗;以及基于可靠性圖的帕累托檢驗(RG-PT)(Farzaneh and Simeone, 2025a),它通過有向無環圖編碼先驗結構知識,并通過 (Ramdas et al., 2019) 的 DAGGER 算法認證超參數。
第 6 章放寬了前幾章的批量校準假設,允許校準數據順序到達,且獲取決策依賴于迄今為止積累的證據。基于 e 過程和 Ville 不等式,本章開發了自適應 LTT (aLTT) (Zecchin et al., 2024),它將基于打賭的檢驗與 ? ?-貪婪獲取相結合,以比批量 LTT 顯著更少的評估次數識別可靠的超參數,同時在每一個(可能是數據依賴的)停止時間保持 FWER 和 FDR 保證。
第 7 章考慮了真實標簽昂貴但廉價的自評估標簽可用的場景,例如在 LLM 作為裁判的流水線中 (Gu et al., 2024)。結合第 6 章的基于打賭的檢驗工具與預測驅動推斷 (Angelopoulos et al., 2023b),本章描述了 (Einbinder et al., 2025) 的 R-AutoEval 方法和 (Park et al., 2025) 的自適應 R-AutoEval+ 方法,后者自適應地重新加權一組依賴因子,并在樣本復雜度上經證明匹配全真實測試和全自評估測試中較好的那個。
第 8 章總結了本專著并概述了開放的研究方向。
附錄 A匯集了關于統計證據的背景材料。它提供了關于 p 值和 e 值的自包含論述,包括它們的定義、從集中界和隨機化檢驗中的構建,以及區分它們的關鍵組合性和任意時刻有效性屬性。
附錄 B匯集了補充第 2 章的關于 p 值和 e 值構建的技術細節:涵蓋有界、次高斯和次指數損失的統一矩生成函數視角;基于 Hoeffding 的 p 值的超均勻性證明;以及改進的有限樣本構建,包括精確二項和方差敏感的 Bernstein p 值。
附錄 C匯集了額外的多重檢驗過程:Holm、Hochberg、?idák 和 Westfall–Young FWER 過程,以及 e-BH 過程的 FDR 保證證明。
第2章 通過多重假設檢驗進行超參數選擇
![]()
![]()
本章組織結構如下。2.1 節介紹了風險控制目標和經驗風險估計。2.2 節回顧了多重假設檢驗(MHT)框架和族錯誤率(FWER)。2.3 節展示了如何將 MHT 與超參數認證聯系起來,并證明了主要的認證集保證。2.4 節引入 p 值作為檢驗統計量,并推導了針對有界損失的基于 Hoeffding 的 p 值。2.5 節引入 e 值作為一種替代的證據度量,并描述了其關鍵屬性。2.6 節通過 BH 和 e-BH 過程開發錯誤發現率(FDR)控制,這是比 FWER 控制保守性更低的替代方案。2.7 節總結了本章。關于從矩生成函數界構建 p 值和 e 值的技術材料收集在附錄 B 中。
2.1 風險控制
貫穿本專著,正如 1.3 節所討論的,我們固定一個有限的候選集
![]()
該集合可能產生于任何上游超參數搜索或模型設計過程。每個超參數 λ ∈ Λ 決定了預訓練模型的運作方式。
![]()
![]()
為一個有界損失函數,它編碼了一種與部署相關的(負向導向的)性能概念。注意,任何有界性能度量都可以通過重縮放被約束在標準化區間內。此外,正如 (Angelopoulos et al., 2025) 中所討論的,無界損失可以通過漸近或截斷構造來處理。 我們將超參數 λ λ 的風險定義為
![]()
其中期望是針對未知的測試時數據分布 P P 計算的。
![]()
![]()
2.2 多重假設檢驗
遵循 (Angelopoulos et al., 2025),我們將風險控制目標視為一個多重假設檢驗(MHT)問題,以此來解決該問題。為了解釋 MHT,請考慮如圖 2.1 所示的在線零售商應用的標準 A/B 測試方法。該在線零售商希望探索相對于當前網站配置的可能修改。例如,它可能會試驗新的主頁布局、不同的產品圖片尺寸、備選的行動號召(call-to-action)按鈕顏色、修訂后的價格顯示格式以及個性化推薦橫幅。
![]()
對于每一個提議的修改,零售商都會制定一個基準主張,稱為零假設(null hypothesis),其聲稱相對于當前配置,該修改并未提高轉化率。隨后,零售商收集用戶交互數據,并評估觀察到的改進是否足夠顯著,從而能夠反駁這一基準主張。當數據提供針對零假設的充分統計證據時,零售商便宣布一項“發現”(discovery),這意味著判定該修改產生了實質性的改進。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
2.3 通過多重假設檢驗進行風險控制
![]()
![]()
![]()
![]()
2.4 P 值
![]()
![]()
![]()
![]()
![]()
![]()
正如附錄 B 中進一步討論的那樣,基于更強大的集中不等式(例如針對 0-1 損失的精確二項尾部,或者基于對損失方差的了解或估計的經驗伯恩斯坦界)的更精細的 p 值,可以在識別真實可靠超參數的能力方面顯著提高檢驗性能。
2.4.2 單假設檢驗的 P 值
![]()
![]()
![]()
![]()
![]()
![]()
2.4.3 多重假設檢驗中的 P 值
![]()
![]()
![]()
![]()
![]()
與 Bonferroni 校正不同,固定序列檢驗(FST)并不將水平 δ δ 分配給這 K K 個假設。因此,當排序將真正可靠的超參數置于序列的前列時,該過程的功效可以顯著提高。然而,其性能關鍵取決于預定義排序的質量:如果不可靠的超參數出現在序列前端,該過程可能會過早停止,從而無法識別出現在序列后端的可靠配置。
![]()
![]()
![]()
2.5.2 構建
存在幾種構建有效 e 值的有原則的方法。我們總結了與超參數選擇最相關的方法。
![]()
![]()
- 將 P 值校準為 E 值:任何 p 值都可以利用 e-校準器(e-calibrator)轉換為 e 值。由于與 p 值相比,e 值具有額外的性質,這種轉換通常產生的統計量在檢測真實零假設方面的功效低于原始 p 值。換言之,為了從 e 值的特殊性質中獲益(見 2.5.4 節)所付出的代價是功效的降低。
![]()
![]()
2.5.3 單假設檢驗的 E 值
![]()
![]()
![]()
2.5.4 性質
E 值擁有使其區別于 P 值的結構性質,這使得它們在自適應和選擇后(post-selection)場景中特別具有吸引力。我們強調兩個關鍵特征:事后水平選擇(post-hoc level selection)(Grünwald et al., 2020) 和凸組合下的穩定性 (Vovk and Wang, 2021)。促使這些性質產生的 P 值的相應局限性,以及底層的證明,在附錄 A 中進行了回顧。
![]()
![]()
![]()
![]()
2.6 錯誤發現率控制
雖然 FWER 控制通過要求 (2.10) 以高概率防止任何錯誤認證,但當候選超參數數量 K K 很大時,它可能過于保守。在這種情況下,只要錯誤認證僅占認證集的一小部分,容忍一定數量的錯誤認證可能是可以接受的。這促使了對錯誤發現率(false discovery rate, FDR)的控制。
2.6.1 定義
![]()
![]()
![]()
![]()
圖 2.6 展示了兩個對應于校準數據不同實現的結果。在第一個實現(左)中,錯誤發現比例(FDP)較小,而在第二個實現(右)中,FDP 較大。FDR 條件 (2.61) 保證了平均而言,實際實現的 FDP 不超過指定的中斷率 δ δ。
![]()
2.6.2 通過 P 值控制 FDR
![]()
![]()
![]()
![]()
![]()
![]()
![]()
2.7 總結
本章介紹了 LTT,這是一種基于多重假設檢驗(MHT)的具有統計學原理的超參數選擇方法。其核心思想是將每個候選超參數與一個表達違反期望風險約束的零假設聯系起來,并且僅對那些能夠以受控誤差拒絕零假設的候選者進行認證。
上游過程使用任意啟發式方法、優化程序或領域知識生成一個有限的候選集。在下游,利用校準數據構建有效的邊際證據度量,即 p 值或 e 值,每個候選超參數對應一個。然后應用 MHT 過程來控制全局誤差,從而產生一個經過認證的超參數集。
當檢驗規則控制 FWER 時,所得的認證集享有有限樣本的選擇后保證:以高概率,認證集中的每個超參數都滿足規定的風險要求。因此,在該集合內的任何(可能是數據依賴的)選擇都保持風險控制。如果改用 FDR 控制,保證會變弱但可能更不保守,從而允許更大的認證集。
我們討論了兩種互補的邊際證據形式。P 值依賴于超均勻尾部界,并自然地與經典集中不等式聯系起來。E 值依賴于期望界,并且由于它們在可選停止和平均下的穩定性,特別適合序貫或自適應場景。
算法 2 總結了完整的 LTT 超參數選擇流程。其模塊化結構突出了本章的一個核心信息:只要最終的部署決策僅限于由有效的多重檢驗規則產生的認證集,統計有效性就可以疊加在任意的超參數生成策略之上。
。。。。。。。
原文鏈接?https://arxiv.org/pdf/2606.25601
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.