Bayesian Variable Selection in Generalized Linear Models
廣義線性模型中的貝葉斯變量選擇
https://arxiv.org/pdf/2606.24357
![]()
![]()
摘要
廣義線性模型(GLMs)中的協(xié)變量選擇是統(tǒng)計(jì)學(xué)中的一個(gè)基本問(wèn)題,因?yàn)榧{入無(wú)關(guān)預(yù)測(cè)變量可能導(dǎo)致過(guò)擬合和可解釋性差,而遺漏相關(guān)預(yù)測(cè)變量則可能導(dǎo)致估計(jì)有偏。大多數(shù)變量選擇的貝葉斯方法——包括尖峰-平板先驗(yàn)和連續(xù)收縮先驗(yàn)——存在關(guān)鍵局限性,例如:(i)基于非完全共軛的公式化表達(dá),(ii)局限于線性模型,或(iii)缺乏對(duì)變量選擇過(guò)程和模型參數(shù)的后驗(yàn)一致性保證。在本研究中,我們提出了一個(gè)用于廣義線性模型中協(xié)變量選擇的完全貝葉斯層次共軛框架,該框架適用于指數(shù)族中的任何分布,其基礎(chǔ)是對(duì)二元包含指示變量進(jìn)行建模,該指示變量直接編碼協(xié)變量在線性預(yù)測(cè)器中的包含情況。在我們的方法中,變量選擇和參數(shù)估計(jì)同時(shí)進(jìn)行,在后驗(yàn)推斷中同時(shí)結(jié)合了這兩種不確定性來(lái)源。因此,我們的方法提供了一個(gè)有效的模型后貝葉斯選擇程序。 我們提出了所提出的用于廣義線性模型的完全共軛貝葉斯變量選擇的理論保證,確立了包含指示變量和活躍回歸系數(shù)的后驗(yàn)一致性。我們推導(dǎo)了一種高效的吉布斯采樣算法,并提供了相應(yīng)的R語(yǔ)言包實(shí)現(xiàn)。我們?cè)诤铣蓴?shù)據(jù)集和真實(shí)世界數(shù)據(jù)集上驗(yàn)證了所提出的方法,展示了具有競(jìng)爭(zhēng)力的預(yù)測(cè)和推斷性能。 關(guān)鍵詞:貝葉斯變量選擇,廣義線性模型,后驗(yàn)?zāi)P瓦x擇,一致性保證,吉布斯采樣算法。
1 引言
在廣泛用于回歸和分類任務(wù)的廣義線性模型(GLMs)中,變量或協(xié)變量選擇是識(shí)別用于解釋響應(yīng)變量的最相關(guān)預(yù)測(cè)變量的關(guān)鍵步驟。在本研究中,我們將感興趣的標(biāo)量響應(yīng)稱為目標(biāo)變量或因變量,并將用于對(duì)響應(yīng)進(jìn)行建模的解釋量稱為協(xié)變量——在統(tǒng)計(jì)學(xué)文獻(xiàn)中通常稱為預(yù)測(cè)變量或變量,在機(jī)器學(xué)習(xí)領(lǐng)域則稱為特征。“協(xié)變量選擇”一詞指的是識(shí)別哪些協(xié)變量對(duì)預(yù)測(cè)目標(biāo)變量最相關(guān)的過(guò)程。納入無(wú)關(guān)或冗余的協(xié)變量會(huì)導(dǎo)致模型不必要地復(fù)雜化,使其易于過(guò)擬合且難以解釋;而遺漏重要的協(xié)變量則會(huì)導(dǎo)致估計(jì)有偏和預(yù)測(cè)性能低下。
協(xié)變量選擇一直是頻率學(xué)派和貝葉斯統(tǒng)計(jì)學(xué)研究的主題。協(xié)變量選擇的頻率學(xué)派經(jīng)典方法通常依賴于正則化技術(shù),這些技術(shù)通過(guò)懲罰函數(shù)來(lái)平衡模型擬合度和復(fù)雜度,鼓勵(lì)向稀疏模型收縮。著名的例子包括LASSO (Tibshirani, 1996)、嶺回歸、橋估計(jì)量 (Frank and Friedman, 1993; Fu, 1998) 以及基于L1的懲罰 (Donoho and Johnstone, 1994; Fan and Li, 2001)。幾種貝葉斯協(xié)變量選擇方法也已被開發(fā)出來(lái),參見(jiàn)Lu和Lou (2022) 應(yīng)用于回歸問(wèn)題的廣泛綜述、O'Hara和Sillanp?? (2009) 以及其中的參考文獻(xiàn)。這些貝葉斯技術(shù)通常通過(guò)在回歸系數(shù)上放置先驗(yàn)分布來(lái)解決變量選擇問(wèn)題,這導(dǎo)致自然表達(dá)稀疏性的后驗(yàn)分布。在貝葉斯變量選擇框架中,通常使用兩類主要的先驗(yàn):"尖峰-平板" (spike-and-slab) 先驗(yàn)和收縮先驗(yàn) (shrinkage priors)。我們?cè)诖丝偨Y(jié)這些替代方案,并指出感興趣的讀者可參閱 (Lu and Lou, 2022) 了解細(xì)節(jié)。
"尖峰-平板" 先驗(yàn) (George and McCulloch, 1993; Mitchell and Beauchamp, 1988; Ishwaran and Rao, 2005; Narisetty and He, 2014; Malsiner-Walli and Wagner, 2016) 將每個(gè)回歸系數(shù)建模為零處的點(diǎn)質(zhì)量(強(qiáng)制排除——即"尖峰")和一個(gè)擴(kuò)散的、通常較寬的高斯分布(即"平板")的混合,允許非零系數(shù)值:即,β? ~ (1 - γ?)N(0, δ) + γ?N(0, σ2),其中δ → 0,對(duì)于模型的每個(gè)協(xié)變量j。這種先驗(yàn)建模選擇的例子包括吉布斯變量選擇 (Dellaportas et al., 2002)、隨機(jī)搜索變量選擇 (SSVS) (George and McCulloch, 1993),以及Kuo和Mallick (1998) 的無(wú)條件混合先驗(yàn),其中指示變量被直接引入回歸模型。另一種策略,特別是在具有強(qiáng)相關(guān)預(yù)測(cè)變量的高維設(shè)置中特別有效,是基于貝葉斯因子回歸模型 (West, 2003)。通過(guò)在因子載荷上放置誘導(dǎo)稀疏性的先驗(yàn),這些稀疏潛因子模型能夠有效選擇相關(guān)變量 (Lucas et al., 2006; Carvalho et al., 2008)。
在連續(xù)收縮先驗(yàn)文獻(xiàn)中,我們發(fā)現(xiàn)了貝葉斯Lasso (Cai et al., 2011)、馬蹄鐵先驗(yàn) (Bhadra et al., 2019, 2021) 和Zellner的g先驗(yàn) (Liang et al., 2008)。這些著名的例子將協(xié)變量選擇視為一種收縮機(jī)制,將不相關(guān)的系數(shù)推向零——而不引入顯式的包含指示變量。它們通常依賴于全局-局部收縮機(jī)制,以在單個(gè)預(yù)測(cè)變量水平上自適應(yīng)地控制收縮量。非局部先驗(yàn) (NLPs) 代表了連續(xù)收縮方法中一個(gè)值得注意的類別,由Johnson和Rossell (2010) 定義為當(dāng)模型參數(shù)等于其零值時(shí)恰好為零的先驗(yàn)。NLPs被Johnson和Rossell (2012) 擴(kuò)展到模型選擇問(wèn)題,在回歸系數(shù)上引入了積矩 (pMoM) 和積逆矩 (piMoM) 先驗(yàn)。這些方法特別適合高維設(shè)置,并且已被適配到廣義線性模型 (Rossell et al., 2013; Shin et al., 2018; Cao and Lee, 2024)。
在這項(xiàng)工作中,我們提出了一種基于GLM回歸的完全共軛貝葉斯層次建模并帶有協(xié)變量指示變量的GLM貝葉斯協(xié)變量選擇方法。具體來(lái)說(shuō),我們擴(kuò)展了GLM,給定p個(gè)協(xié)變量,使用一個(gè)二元隨機(jī)向量z ∈ {0,1}?,其中每個(gè)指示變量z?表示第j個(gè)協(xié)變量是否被包含 (z? = 1) 或排除 (z? = 0) 在線性預(yù)測(cè)器中。
GLM的廣義線性預(yù)測(cè)器被定義為z和回歸系數(shù)β乘積的函數(shù),通過(guò)允許以概率方式直接包含/排除預(yù)測(cè)變量來(lái)擴(kuò)展標(biāo)準(zhǔn)GLM協(xié)變量選擇。回歸系數(shù)β以z為條件進(jìn)行建模,使用GLM的共軛先驗(yàn),這些先驗(yàn)誘導(dǎo)的后驗(yàn)分布具有與先驗(yàn)相同的函數(shù)形式和相似的性質(zhì),這是貝葉斯推斷中一個(gè)理想的性質(zhì)。
對(duì)于后驗(yàn)推斷,我們提出了一種基于完全共軛貝葉斯層次模型的高效吉布斯(Gibbs)采樣算法,并提供了相應(yīng)的R語(yǔ)言包實(shí)現(xiàn)。據(jù)我們所知,這是首個(gè)具有貝葉斯后驗(yàn)一致性保證的針對(duì)廣義線性模型(GLMs)的完全共軛貝葉斯變量選擇方法。
我們的貝葉斯GLM公式與早期的貝葉斯變量選擇方法有相似之處,但在分析設(shè)計(jì)、理論性質(zhì)和計(jì)算效率方面卻是獨(dú)一無(wú)二的。
Kuo和Mallick(1998)的工作與我們?cè)诨貧w方程中使用二元包含指示變量方面是相似的,而Dellaportas等人(2002)的層次框架與我們的層次建模也有相似之處。然而,這些工作都沒(méi)有詳細(xì)闡述GLM的完全共軛層次建模,也沒(méi)有解決其貝葉斯推斷過(guò)程的后驗(yàn)一致性問(wèn)題。關(guān)于變量指示變量后驗(yàn)一致性的理論結(jié)果僅在收縮先驗(yàn)(Narisetty和He,2014)和高斯特定的“尖峰和平板”(spike and slab)先驗(yàn)(Narisetty等人,2019)下建立,而這些僅限于線性高斯回歸模型。
![]()
總之,我們推導(dǎo)并分析了一個(gè)帶有二元變量選擇指示變量的完全貝葉斯層次GLM,它在一個(gè)單一連貫的框架內(nèi)統(tǒng)一了眾多貝葉斯變量選擇的視角,通過(guò)利用Chen和Ibrahim(2003)的共軛先驗(yàn)結(jié)構(gòu),適用于指數(shù)族內(nèi)的任何分布。我們就協(xié)變量選擇指示變量 z 的后驗(yàn)漸近準(zhǔn)確性和GLM回歸系數(shù) β β 的后驗(yàn)一致性提供了理論證據(jù),并為模擬和真實(shí)數(shù)據(jù)場(chǎng)景提供了相應(yīng)的實(shí)證證據(jù)。
![]()
最后,我們?cè)诘?節(jié)中通過(guò)一系列數(shù)值實(shí)驗(yàn)評(píng)估了所提出方法的預(yù)測(cè)和推斷性能,這些實(shí)驗(yàn)基于合成數(shù)據(jù)(第5.1節(jié))和真實(shí)世界數(shù)據(jù)集(第5.2節(jié))。關(guān)于后驗(yàn)推導(dǎo)、理論證明以及額外實(shí)驗(yàn)結(jié)果的更多細(xì)節(jié)置于附錄中。
2 廣義線性模型中的協(xié)變量選擇
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
后驗(yàn)分布。 給定公式 (2) 中的模型和公式 (3) 中的共軛先驗(yàn)結(jié)構(gòu),我們要刻畫所有模型參數(shù)的后驗(yàn)分布,這構(gòu)成了在所提出的協(xié)變量選擇模型下進(jìn)行推斷的基礎(chǔ):
![]()
![]()
![]()
關(guān)于后驗(yàn)計(jì)算的完整細(xì)節(jié)見(jiàn)附錄 B,而關(guān)于如何從公式 (5)-(6) 進(jìn)行采樣的細(xì)節(jié)則在第 4 節(jié)給出。在公式 (8) 中,若保證先驗(yàn)共軛性,則 τ τ 的后驗(yàn)分布與先驗(yàn)分布形式相同。
綜上所述,這些閉式后驗(yàn)分布定義了一個(gè)用于后驗(yàn)推斷的吉布斯(Gibbs)采樣方案。附錄 C 中的引理 4 表明,從該吉布斯采樣方案中進(jìn)行采樣等價(jià)于從參數(shù)的聯(lián)合后驗(yàn)分布中進(jìn)行采樣。
3 后驗(yàn)一致性
![]()
![]()
![]()
![]()
![]()
4 共軛 β β 分布:計(jì)算與采樣
![]()
4.1 GLM 共軛 β β 分布的拉普拉斯近似
![]()
![]()
![]()
4.2 從 GLM 的共軛 β β 分布中采樣
![]()
![]()
5 實(shí)證評(píng)估
我們通過(guò)一系列數(shù)值實(shí)驗(yàn),評(píng)估了所提出的、基于共軛后驗(yàn)的模型回歸系數(shù)和指示變量推斷的性能,實(shí)驗(yàn)既考慮了合成數(shù)據(jù)(我們可以獲取真實(shí)值),也考慮了真實(shí)世界數(shù)據(jù)集,從而展示了所提出的貝葉斯變量選擇過(guò)程的實(shí)際適用性。
5.1 合成數(shù)據(jù)實(shí)驗(yàn)
![]()
![]()
![]()
![]()
![]()
![]()
對(duì)于所有貝葉斯算法,使用所有參數(shù)上相同的先驗(yàn),并且使用吉布斯采樣(Gibbs Sampling)對(duì)未知量進(jìn)行后驗(yàn)推斷,迭代次數(shù)為 5000 次,預(yù)燒期(burn-in)為 10%。
我們?cè)诖苏故静此桑≒oisson)模型的結(jié)果——線性模型和邏輯斯蒂(Logistic)模型的實(shí)驗(yàn)見(jiàn)附錄 D.2 和 D.3。
5.1.1 泊松回歸的貝葉斯變量選擇
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
5.2 真實(shí)數(shù)據(jù)實(shí)驗(yàn)
在本節(jié)中,我們通過(guò)在真實(shí)世界數(shù)據(jù)集上應(yīng)用所提出的貝葉斯變量選擇過(guò)程,來(lái)展示其實(shí)際適用性。具體而言,我們涵蓋了泊松模型(第5.2.1節(jié))、邏輯斯蒂模型(第5.2.2節(jié))和線性模型(第5.2.3節(jié))。
5.2.1 螃蟹數(shù)據(jù)集的泊松回歸
![]()
![]()
為了評(píng)估預(yù)測(cè)準(zhǔn)確性,我們計(jì)算了感興趣測(cè)試集結(jié)果的平均絕對(duì)誤差(MAE)和均方根誤差(RootMSE)。跨折的誤差分布總結(jié)在圖 7 中。
![]()
5.2.2 心臟病數(shù)據(jù)集的 Logistic 模型
在本例中,我們?cè)谛呐K病數(shù)據(jù)(Heart Disease Data)上評(píng)估了我們模型(BayesVS-GLM)的性能,這是一個(gè)提供與心臟病診斷相關(guān)醫(yī)學(xué)指標(biāo)的多變量數(shù)據(jù)集。該任務(wù)是一個(gè)二元分類任務(wù),旨在基于可用的臨床和人口統(tǒng)計(jì)學(xué)屬性預(yù)測(cè)心臟病的存在或缺失。它包含 14 個(gè)屬性(分類和連續(xù)變量)以及來(lái)自四個(gè)機(jī)構(gòu)的 920 條患者記錄 (Janosi et al., 1988)。
![]()
![]()
![]()
![]()
為了評(píng)估測(cè)試集上的預(yù)測(cè)準(zhǔn)確性,我們使用了幾個(gè)特定于分類任務(wù)的指標(biāo),即平衡準(zhǔn)確率、檢測(cè)流行率、檢測(cè)率、F1分?jǐn)?shù)、負(fù)預(yù)測(cè)值、正預(yù)測(cè)值、精確率、流行率、召回率、靈敏度和特異度。這些指標(biāo)定義的詳細(xì)信息可參見(jiàn) Kuhn(2008)。圖 9 報(bào)告了各折的平衡準(zhǔn)確率和 F1 分?jǐn)?shù),而包含所有指標(biāo)的更完整的表格見(jiàn)附錄 E。
![]()
總體而言,與基線方法相比,BayesVS-GLM 獲得了相當(dāng)或略高的預(yù)測(cè)準(zhǔn)確性,同時(shí)識(shí)別出的相關(guān)協(xié)變量與既定的臨床發(fā)現(xiàn)一致(Rodriguez and Nafea, 2024; Teja and Rayalu, 2025)。
5.2.3 污染數(shù)據(jù)集的線性模型
在本例中,我們?cè)?McDonald 污染數(shù)據(jù)集(McDonald Pollution Dataset)上評(píng)估了我們模型的性能,該數(shù)據(jù)集由 McDonald 和 Schwing (1973) 首次提出,常用于研究變量選擇問(wèn)題(參見(jiàn)例如 (O’hara and Sillanp??, 2009))。該數(shù)據(jù)集可在 [此處獲取](注:原文此處似乎有鏈接缺失或截?cái)啵?/p>
![]()
![]()
![]()
有關(guān)變量之間成對(duì)關(guān)聯(lián)的更詳細(xì)視圖,請(qǐng)參見(jiàn)圖 11,該圖報(bào)告了在所有 MCMC 重復(fù)中包含的相對(duì)頻率。
![]()
為了評(píng)估預(yù)測(cè)性能,我們報(bào)告了調(diào)整后的 R 平方(AdjR2)、平均絕對(duì)誤差(MAE)和均方根誤差(RMSE),這些指標(biāo)是在 30 個(gè)交叉驗(yàn)證折上聚合得出的(圖 12)。總體而言,與所比較的基線模型相比,BayesVS-GLM 獲得了相當(dāng)?shù)念A(yù)測(cè)準(zhǔn)確性。
![]()
6 結(jié)論
我們介紹、分析并驗(yàn)證了一個(gè)貝葉斯層次共軛框架,用于在廣義線性模型(GLMs)中同時(shí)進(jìn)行變量選擇和后驗(yàn)推斷。
我們開發(fā)了一種吉布斯(Gibbs)采樣器,利用 GLM 回歸系數(shù) β β 和協(xié)變量指示變量 z z 的共軛先驗(yàn),對(duì)潛指示變量和 GLM 參數(shù)進(jìn)行高效的后驗(yàn)推斷。
![]()
原文鏈接:https://arxiv.org/pdf/2606.24357
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.