Equivariance and Augmentation for Bayesian Neural Networks
貝葉斯神經(jīng)網(wǎng)絡(luò)的等變性與增強(qiáng)
https://arxiv.org/pdf/2606.26273
![]()
![]()
摘要
對(duì)稱性對(duì)于許多深度學(xué)習(xí)任務(wù)很重要,范圍從科學(xué)中的應(yīng)用到醫(yī)學(xué)成像。然而,關(guān)于是在神經(jīng)網(wǎng)絡(luò)架構(gòu)上施加對(duì)稱性約束(產(chǎn)生等變神經(jīng)網(wǎng)絡(luò))還是從增強(qiáng)的訓(xùn)練數(shù)據(jù)中學(xué)習(xí)它們,目前仍存在持續(xù)的爭(zhēng)論。盡管等變網(wǎng)絡(luò)在理論上得到了充分研究,但對(duì)數(shù)據(jù)增強(qiáng)的了解卻少得多,因?yàn)榉治鰯?shù)據(jù)增強(qiáng)需要控制訓(xùn)練動(dòng)態(tài)。受最近結(jié)果表明增強(qiáng)的無(wú)限深度集成(infinite deep ensembles)是完全等變的啟發(fā),我們研究了使用變分推斷訓(xùn)練的貝葉斯神經(jīng)網(wǎng)絡(luò)(BNNs)的數(shù)據(jù)增強(qiáng)。我們專注于指數(shù)族中的變分分布,并推導(dǎo)出達(dá)到完全等變性的條件。我們進(jìn)一步獲得了等變誤差的界限,并引入了三種新穎的對(duì)稱化技術(shù),這些技術(shù)在此設(shè)置下提升了數(shù)據(jù)增強(qiáng)的效果。我們進(jìn)行了廣泛的數(shù)值實(shí)驗(yàn),結(jié)果表明我們的一種對(duì)稱化方法(軌道擴(kuò)展,orbit expansion)在等變性和整體性能方面均優(yōu)于基線。我們的代碼可在 github.com/dmw1998/augment-BNNs 獲取。
1 引言
近年來(lái),對(duì)稱學(xué)習(xí)任務(wù)已成為一個(gè)重要的研究領(lǐng)域。在最初專注于逐層施加對(duì)稱性約束的專用等變網(wǎng)絡(luò)[1]之后,最近的注意力已轉(zhuǎn)向從增強(qiáng)的訓(xùn)練數(shù)據(jù)中學(xué)習(xí)對(duì)稱性[2]。這種方法的優(yōu)勢(shì)在于,在給定有效的對(duì)稱變換機(jī)制的情況下,它實(shí)現(xiàn)起來(lái)很簡(jiǎn)單,并且可以與高度優(yōu)化且性能良好的架構(gòu)結(jié)合使用[3]。然而,由于對(duì)稱性僅僅是學(xué)習(xí)到的而不是被強(qiáng)加的,因此它只是近似實(shí)現(xiàn)的。因此,需要新技術(shù)來(lái)提高從增強(qiáng)訓(xùn)練中獲得的對(duì)稱性收益。
顯式的逐層等變神經(jīng)網(wǎng)絡(luò)很容易進(jìn)行理論分析,而數(shù)據(jù)增強(qiáng)的研究要困難得多,因?yàn)樗婕坝?xùn)練動(dòng)態(tài)(參見(jiàn)相關(guān)工作部分)。然而可以證明,在對(duì)初始化求期望時(shí),數(shù)據(jù)增強(qiáng)會(huì)導(dǎo)致完全的等變性[4, 5]。近似這種期望值的一種實(shí)用但成本高昂的方法是訓(xùn)練一個(gè)深度集成(deep ensemble)。
這項(xiàng)工作的目的是研究一種更廉價(jià)的方法來(lái)實(shí)現(xiàn)這種“期望中的等變性”:在增強(qiáng)數(shù)據(jù)上使用變分推斷訓(xùn)練貝葉斯神經(jīng)網(wǎng)絡(luò)(BNNs)。在這種設(shè)置下,從后驗(yàn)預(yù)測(cè)分布中采樣取代了對(duì)集成的推理步驟,并產(chǎn)生了貝葉斯不確定性估計(jì)。在這種設(shè)置下,只需要一次訓(xùn)練運(yùn)行即可獲得變分后驗(yàn),而深度集成則需要為每個(gè)集成成員進(jìn)行一次訓(xùn)練運(yùn)行。此外,由于BNN表現(xiàn)出穩(wěn)定的分布外(out-of-distribution)行為,它們特別適合小數(shù)據(jù)集,即可以預(yù)期數(shù)據(jù)增強(qiáng)會(huì)產(chǎn)生最大影響的情形。
我們的主要貢獻(xiàn)如下:
? 我們研究了在增強(qiáng)數(shù)據(jù)上訓(xùn)練的BNN,其變分分布來(lái)自指數(shù)族。我們表明,當(dāng)訓(xùn)練從一個(gè)不變先驗(yàn)開(kāi)始時(shí),在一些溫和的假設(shè)下,變分分布在訓(xùn)練過(guò)程中保持不變。這推廣了Nordenfors、Ohlsson和Flinth [6]針對(duì)非貝葉斯網(wǎng)絡(luò)訓(xùn)練的類似結(jié)果。
? 如果先驗(yàn)不是等變的,我們推導(dǎo)了變分分布偏離等變性的界限。我們進(jìn)一步證明了由于有限采樣導(dǎo)致的預(yù)測(cè)中等變誤差的界限。這些理論結(jié)果通過(guò)數(shù)值方法得到了驗(yàn)證。
? 我們引入了三種對(duì)稱化方法(幾何平均、投影和軌道擴(kuò)展),這些方法可以在訓(xùn)練期間應(yīng)用以改善BNN的等變特性。我們?cè)趫D像分類的廣泛數(shù)值實(shí)驗(yàn)中測(cè)試了這些技術(shù)。軌道擴(kuò)展在模型性能和等變性方面均優(yōu)于基線。
2 相關(guān)工作
等變神經(jīng)網(wǎng)絡(luò)。 深度神經(jīng)網(wǎng)絡(luò)的對(duì)稱性問(wèn)題,即不變性和等變性,已經(jīng)發(fā)展成為一個(gè)被稱為幾何深度學(xué)習(xí)的完整子領(lǐng)域[1]。等變網(wǎng)絡(luò)最顯著的構(gòu)造方式是逐層構(gòu)造。這種策略源于群卷積神經(jīng)網(wǎng)絡(luò)(GCNNs)[7],但迄今為止已幾乎被推廣至由任何群誘導(dǎo)的任何對(duì)稱性[8, 9, 10]。還有其他策略,例如從不變量中學(xué)習(xí)[11]、幀平均[12]、基本域投影[13]和群平均。也有一些工作近似地強(qiáng)制實(shí)現(xiàn)對(duì)稱性,例如通過(guò)所謂的權(quán)重退火[14]。
數(shù)據(jù)增強(qiáng)與訓(xùn)練動(dòng)態(tài)。 關(guān)于數(shù)據(jù)增強(qiáng)對(duì)神經(jīng)網(wǎng)絡(luò)訓(xùn)練動(dòng)態(tài)影響的問(wèn)題,已在多種簡(jiǎn)化情境下得到了探討,例如特征平均模型[15, 16]以及線性神經(jīng)網(wǎng)絡(luò)[17, 18, 19]。在這些情況下,通常可以證明數(shù)據(jù)增強(qiáng)與等變性的等價(jià)性。完全非線性網(wǎng)絡(luò)的研究見(jiàn)于Nordenfors、Ohlsson和Flinth [6]以及Nordenfors和Flinth [20]的工作中,我們?cè)诒疚闹袑⑵浣Y(jié)果推廣至貝葉斯網(wǎng)絡(luò)。
關(guān)于增強(qiáng)與限制之間差異的經(jīng)驗(yàn)研究非常豐富。更為系統(tǒng)的探討見(jiàn)于 Gandikota 等人 [21]、Gerken 等人 [22] 以及 Brehmer 等人 [23] 的工作。
貝葉斯神經(jīng)網(wǎng)絡(luò)。 深度學(xué)習(xí)的貝葉斯方法已被研究多年 [24],因?yàn)樗鼈兡軌驗(yàn)橥ǔJ呛诤心P偷纳窠?jīng)網(wǎng)絡(luò)提供不確定性估計(jì)(概述可參見(jiàn) Gal 的博士論文 [25])。然而,要使 BNN 具有實(shí)際可用性,需要將變分推斷整合到深度學(xué)習(xí)的訓(xùn)練方法論中 [26, 27, 28]。關(guān)于側(cè)重于實(shí)際應(yīng)用的 BNN 綜述,請(qǐng)參閱 Jospin 等人 [29]。
先前的研究中鮮有探討與 BNN 相關(guān)的對(duì)稱性問(wèn)題。Ouderaa 和 Wilk [30] 提出了一種針對(duì) BNN 的概率群平均方法,以實(shí)現(xiàn)針對(duì)數(shù)據(jù)優(yōu)化的軟對(duì)稱性約束。與我們的工作最接近的是 Mourdoukoutas 等人 [31],他們使用了一種特定的先驗(yàn),該先驗(yàn)結(jié)合了不同的權(quán)重共享方案,從而也結(jié)合了不同的對(duì)稱性約束。在訓(xùn)練過(guò)程中,網(wǎng)絡(luò)會(huì)學(xué)習(xí)哪種對(duì)稱性最適合該數(shù)據(jù)。相比之下,我們考慮在增強(qiáng)數(shù)據(jù)上使用不強(qiáng)制權(quán)重共享的通用先驗(yàn)進(jìn)行訓(xùn)練。
3 理論
我們要建立一個(gè)理論框架,以理解數(shù)據(jù)增強(qiáng)如何在變分貝葉斯推斷中誘導(dǎo)等變性。我們分三步進(jìn)行:首先,我們刻畫(huà)指數(shù)族在群作用下何時(shí)是封閉的(第3.2節(jié));其次,我們展示數(shù)據(jù)增強(qiáng)訓(xùn)練如何使 ELBO(證據(jù)下界)保持不變,以及這如何影響訓(xùn)練(第3.3節(jié));第三,我們提出對(duì)稱化機(jī)制并分析其性質(zhì)(第3.4節(jié))。
3.1 預(yù)備知識(shí)
在本節(jié)中,我們介紹貫穿全文所使用的數(shù)學(xué)工具。我們首先從指數(shù)族開(kāi)始,它們?yōu)槲覀兊睦碚摲治鎏峁┝私Y(jié)構(gòu)骨干,隨后回顧變分推斷以及形式化對(duì)稱性所需的群論概念。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
3.2 群作用下封閉的指數(shù)族
只有當(dāng)參數(shù)空間在群變換下是封閉的時(shí),神經(jīng)網(wǎng)絡(luò)才能從增強(qiáng)數(shù)據(jù)中有效地學(xué)習(xí)等變性 [6]。類似地,在貝葉斯設(shè)置中,我們將變分族限制為在群變換下封閉的那些族。如下定理所示,這對(duì)指數(shù)族施加了約束。我們?cè)诟戒?C 中提供了證明。
![]()
3.3 數(shù)據(jù)增強(qiáng)誘導(dǎo)等變性
![]()
![]()
![]()
請(qǐng)注意,定理 3.7 并不直接依賴于增強(qiáng)數(shù)據(jù),而僅依賴于不變的似然性(根據(jù)命題 3.1,這是由數(shù)據(jù)增強(qiáng)所蘊(yùn)含的)。因此,當(dāng)對(duì)稱性存在于數(shù)據(jù)中但未知時(shí),該定理仍然適用。然而在這種情況下,很難保證先驗(yàn)是不變的。下一個(gè)定理(我們?cè)诟戒?E 中證明)表明,隨著數(shù)據(jù)集大小的增加,非不變先驗(yàn)的影響會(huì)消失。
![]()
![]()
![]()
3.4 變分后驗(yàn)的對(duì)稱化
![]()
![]()
![]()
![]()
![]()
![]()
4 實(shí)驗(yàn)
在我們的實(shí)驗(yàn)中,我們考慮作用于 FashionMNIST [33] 的 90°倍數(shù)旋轉(zhuǎn)的循環(huán)群
。這種設(shè)置使我們能夠進(jìn)行精確的數(shù)據(jù)增強(qiáng),并支持廣泛的蒙特卡洛采樣。在整個(gè)實(shí)驗(yàn)過(guò)程中,我們使用滿足定理 3.2 約束的高斯變分分布。在附錄 J 中,我們提供了針對(duì)其他變分分布的額外消融實(shí)驗(yàn)。代碼可在 github.com/dmw1998/augment-BNNs 獲取。
4.1 定理驗(yàn)證
![]()
![]()
![]()
4.2 圖像分類上的對(duì)稱化
接下來(lái),我們?cè)诮?jīng)驗(yàn)上比較第 3.4 節(jié)中的對(duì)稱化機(jī)制。
設(shè)置。 我們訓(xùn)練一個(gè)卷積貝葉斯神經(jīng)網(wǎng)絡(luò),包含兩個(gè)分別具有 32 和 64 個(gè)通道的卷積層,隨后是一個(gè)分類層,使用對(duì)角高斯變分族和標(biāo)準(zhǔn)的各向同性高斯先驗(yàn)。訓(xùn)練集由 5000 張隨機(jī)選擇的 FashionMNIST 圖像組成,每張圖像都經(jīng)過(guò)完整的軌道增強(qiáng)(共產(chǎn)生 20000 個(gè)訓(xùn)練樣本)。
![]()
![]()
我們注意到,當(dāng)干預(yù)應(yīng)用得較晚時(shí),所有指標(biāo)和策略的性能通常會(huì)下降。這是自然的,因?yàn)檩^晚的觸發(fā)時(shí)間正好對(duì)應(yīng)于重新初始化后較短的訓(xùn)練時(shí)間。幾何平均的 OSP 和 Sym.KL 是這一趨勢(shì)的唯一例外,但與所有其他方法相比,這種下降是從好得多的數(shù)值開(kāi)始的。
軌道擴(kuò)展產(chǎn)生了最好的結(jié)果。我們假設(shè)這是因?yàn)椋c軌道平均技術(shù)相比,軌道擴(kuò)展產(chǎn)生的參數(shù)具有額外的對(duì)稱性,這是由于基濾波器數(shù)量受限所致(參見(jiàn)圖 3 和圖 5)。這些額外的對(duì)稱性似乎誘導(dǎo)了更多的穩(wěn)定性。然而,進(jìn)一步探索此類效應(yīng)仍是未來(lái)的工作。
![]()
5 結(jié)論與局限性
![]()
在我們的整個(gè)工作中,我們做出了一些限制結(jié)果范圍的假設(shè)。特別是,我們專注于指數(shù)族。盡管這是一大類概率分布,但一些著名的分布并不屬于它,例如高斯混合模型。此外,我們將分析(以及相應(yīng)的實(shí)驗(yàn))限制在有限群上,以便對(duì)(有限)增強(qiáng)數(shù)據(jù)集進(jìn)行直接的定義。擴(kuò)展到連續(xù)群將需要一種基于從對(duì)稱群中采樣的增強(qiáng)方法。盡管這超出了本工作的范圍,但我們沒(méi)有看到以這種方式擴(kuò)展我們結(jié)果的概念障礙(另見(jiàn)附錄 A 中的討論)。最后一個(gè)局限性是相容性假設(shè) (2)。鑒于中間表示選擇的靈活性,這一限制是輕微的。
原文鏈接:https://arxiv.org/pdf/2606.26273
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.