Tackling Over-smoothing on Hypergraphs: A Ricci Flow-guided Neural Diffusion Approach
應對超圖中的過平滑問題:一種里奇流引導的神經擴散方法
https://arxiv.org/pdf/2603.15696
![]()
![]()
摘要
超圖神經網絡(HGNNs)在建模復雜高階關系方面已展現出強大的能力。然而,現有的HGNNs隨著層數的增加常常遭受過平滑問題,并且缺乏對節(jié)點間消息傳遞的有效控制。受微分幾何中里奇流理論的啟發(fā),我們從理論上證明,將離散里奇流引入超圖結構能夠有效調節(jié)節(jié)點特征演化,從而緩解過平滑。基于這一見解,我們提出里奇流引導的超圖神經擴散(RFHND),這是一種由離散里奇流引導的、用于超圖的新型消息傳遞范式。具體而言,RFHND基于一個描述超圖上節(jié)點特征連續(xù)演化的偏微分方程(PDE)系統(tǒng),在幾何層面自適應地調節(jié)信息擴散速率,以防止特征同質化并生成高質量的節(jié)點表示。實驗結果表明,RFHND在多個基準數據集上顯著優(yōu)于現有方法并展現出強大的魯棒性,同時也有效減輕了過平滑問題。
索引詞——超圖神經網絡,過平滑,里奇流,微分方程
I. 引言
近年來,超圖作為建模復雜系統(tǒng)的重要工具受到了廣泛關注[1], [2]。與傳統(tǒng)圖只能表示節(jié)點之間的成對關系不同,超圖可以通過超邊連接多個節(jié)點,自然地捕獲高階關系[3]。這種能力使超圖在社交網絡[4], [5]、推薦系統(tǒng)[6], [7]和生物網絡[8], [9]等諸多領域具有獨特的表達能力。為了充分利用超圖數據中的信息,研究人員提出了多種超圖神經網絡方法[10],在節(jié)點分類[11]、鏈接預測[12], [13]和表示學習[2]等任務上取得了顯著進展。
盡管現有的超圖神經網絡為超圖學習提供了強大的工具,但過平滑問題仍然是一個關鍵挑戰(zhàn)[14], [15]。隨著網絡層數的加深,節(jié)點特征趨于收斂并變得越來越難以區(qū)分,從而降低了模型的性能[16]。當前的緩解策略主要分為兩種范式。第一種范式通過引入殘差連接等機制來修改網絡架構,以保留初始節(jié)點特征[17], [18]。第二種范式優(yōu)化聚合步驟,通常使用注意力機制對節(jié)點和超邊進行選擇性加權,從而防止特征同質化[19], [20]。然而,盡管現有方法在一定程度上緩解了過平滑問題,但它們本質上大多是算子層面的修正,缺乏嚴格的理論保證,這限制了它們在復雜場景中的有效性。
受文獻[21]的啟發(fā)(該文獻建立了幾何曲率與過平滑之間的直接聯(lián)系),我們將超圖神經網絡中的特征收斂視為一種無約束的幾何演化過程,類似于熱擴散。這一視角促使我們尋求一種來自微分幾何的機制,以從內在控制此類擴散動力學。里奇流正是為此目的服務的[22],它描述了度量張量如何根據局部曲率進行演化。近年來,其推廣形式——離散里奇流——已被證明在圖任務上有效[23]。然而,它在超圖上的潛力尚未被探索。在本工作中,我們將這種演化推廣到超圖,并從理論上證明,該演化通過局部曲率約束節(jié)點特征的擴散,從而有效緩解過平滑。
基于前述理論見解,我們提出里奇流引導的超圖神經擴散(RFHND)。(注:原文“Diffusio”為排版筆誤,應為“Diffusion”)基于偏微分方程,RFHND將節(jié)點特征演化建模為一個連續(xù)的動力學過程,并根據局部曲率自適應地調節(jié)信息擴散,有效防止過平滑。RFHND的核心思想如圖1所示。具體而言,我們根據超邊內節(jié)點之間的特征相似性為超邊分配權重,從而實現自適應的更新流,緩解特征同質化。該設計在實現高效特征融合的同時保留了節(jié)點間的差異性,增強了模型的表達能力和穩(wěn)定性。最后,通過一系列全面的實驗驗證了我們算法的有效性。本工作的主要貢獻如下:
? 理論基礎:我們將離散里奇流引入超圖學習領域,從理論上證明它通過局部曲率自適應地控制特征擴散,從而緩解過平滑。 ? 方法貢獻:我們提出RFHND,這是一種離散里奇流引導的超圖神經擴散方法,將傳統(tǒng)的消息傳遞轉化為自適應的、曲率引導的擴散過程,從而有效防止特征同質化。 ? 實驗驗證:在多個超圖數據集上的實驗表明,與現有方法相比,RFHND實現了更優(yōu)的節(jié)點分類準確率,同時展現出更高的穩(wěn)定性、魯棒性,并顯著減少了過平滑現象。
II. 相關工作
在本節(jié)中,我們回顧與我們的工作密切相關文獻,重點關注兩個關鍵領域:超圖神經網絡(HGNNs)與超圖神經網絡中的過平滑問題。
A. 超圖神經網絡
超圖神經網絡已成為圖神經網絡(GNNs)的一種強大泛化形式,專門設計用于捕獲實體之間超越成對連接的復雜高階關系。該領域的發(fā)展始于基礎HGNN模型[24]的開創(chuàng)性工作。該模型利用超圖上的譜卷積框架,聚合與同一超邊相連的節(jié)點信息。
此后,一系列基于消息傳遞的模型被提出,例如HNHN [25]、HyperGCN [26]、HyperSAGE [27]和UniGNN [17],以增強HGNN的表達能力。這些方法擴展了聚合與傳播機制,以適應異構和加權的超邊,從而在節(jié)點分類等任務上取得了顯著改進。與此同時,像AllDeepSets [18]和AllSetTransformer [18]這樣的架構則完全摒棄了譜假設。它們轉而采用超邊上的置換不變集函數,以促進更靈活的、集合層面的推理。
近期的HGNN進展包括更復雜的建模視角。例如,動態(tài)系統(tǒng)模型如HDS [28]使用常微分方程(ODEs)來提高學習過程的穩(wěn)定性和可控性。此外,諸如KHGNN(采用名為HyperGINE的嵌套卷積模塊)[29]等模型,旨在通過從節(jié)點、超邊以及它們之間的中間路徑提取特征來捕獲長程依賴關系。
B. 超圖神經網絡中的過平滑問題
在深層超圖網絡中,節(jié)點表示往往趨于一致,這會嚴重降低模型性能。當前旨在應對該問題的緩解策略可分為兩種主要范式。
架構修改。此類工作側重于改變網絡架構,以保留來自早期層的信息。受殘差連接在卷積神經網絡(CNN)和圖神經網絡(GNN)中有效性的啟發(fā),UniGCNII [17] 和 Deep-HGCN [18] 等模型引入了跳躍連接以將初始節(jié)點特征向前傳遞,從而使得構建更深且更有效的超圖神經網絡成為可能。
FrameHGNN [14] 引入了一種基于幀元(framelet)的超圖卷積框架,該框架將低通和高通濾波器與殘差和恒等映射等經過驗證的深度 GNN 技術相結合,從而在深層網絡中保持判別性信號。
優(yōu)化聚合算子。該范式旨在使特征聚合過程更具區(qū)分度。與均勻聚合不同,該方法采用注意力機制為超邊內的節(jié)點或連接到節(jié)點的不同超邊分配不同的權重。例如,超圖注意力網絡 [19], [20] 學習節(jié)點和超邊的動態(tài)權重,從而有效緩解無差別特征混合的問題。ED-HNN [30] 提出,采用等變算子在節(jié)點間分配差異化的消息有助于保持特征多樣性(或節(jié)點可區(qū)分性),從而有效防止過平滑問題。
現有方法的局限性。盡管現有方法在一定程度上緩解了過平滑問題,但大多數方法依賴于局部框架修改,且缺乏嚴格的理論保證,這限制了它們在復雜場景中的有效性。相比之下,我們引入離散里奇流以全局調節(jié)節(jié)點特征的演化,從而有效緩解過平滑問題。
III. 預備知識
A. 符號表示
![]()
B. 加權超圖上的超邊曲率
![]()
C. 狄利克雷能量
超圖 ![]()
的狄利克雷能量用于刻畫節(jié)點間特征的平滑性 [34]。其表達式如下 [18]:
![]()
公式 (1) 表明,相鄰節(jié)點特征之間更高的相似度會導致能量值更接近 0,這反映了過平滑問題。
D. 離散里奇流 (DRF)
里奇流,最初由 Hamilton 在微分幾何 [35] 中引入,根據偏微分方程演化一個黎曼度量![]()
:
![]()
![]()
![]()
![]()
![]()
![]()
IV. 在超圖上應用 DRF
![]()
![]()
![]()
A. 狄利克雷能量界
通過在超圖上應用屬性離散里奇流,我們可以證明,當節(jié)點特征演化遵循里奇流時,系統(tǒng)的能量值保持有界。這表明我們的方法可以有效地防止過平滑,并在傳播過程中保持受控的特征差異化。具體結論如下:
![]()
![]()
正如所示,定理 1 為解決超圖神經網絡中的過平滑問題提供了關鍵的理論支持。該定理的嚴格正下界確保了在整個特征演化過程中,節(jié)點間的差異不會完全消失。這反過來保留了有意義的特征區(qū)分,并防止了節(jié)點表示的過度同化。完整的證明可在補充材料中找到。
B. 收斂性分析
繼前文對該方法防止過平滑有效性的分析之后,我們進一步研究其收斂性。該分析的具體結果如下:
![]()
定理 2 證明了離散里奇流具有指數收斂的性質。這意味著無論系統(tǒng)的初始狀態(tài)如何,超邊曲率都能迅速趨近于零。因此,定理 2 為我們方法的效率和穩(wěn)定性提供了理論保證。定理 2 的證明可參考文獻 [39]。
V. 方法論
A. 里奇流引導的超圖特征擴散
正如第四節(jié)所確立的,將屬性離散里奇流應用于超圖帶來了幾個關鍵優(yōu)勢。該過程在促進高質量、非平滑節(jié)點表示學習的同時,驅動超邊曲率趨向均勻。此外,該方法經理論證明具有強收斂性。受這些優(yōu)勢的啟發(fā),我們在本節(jié)設計了一種新的超圖特征擴散架構。利用鏈式法則展開公式 (5),我們得到:
![]()
![]()
![]()
公式 (17) 定義了單個超邊 e e 對節(jié)點 i i 的局部影響,而節(jié)點的表示則是基于其整個鄰域進行更新的。因此,我們通過遍歷與節(jié)點 i i 關聯(lián)的所有超邊并聚合相應的信息,將該公式從單個超邊推廣到整個超圖。我們可以將公式 (17) 重寫如下:
![]()
![]()
![]()
![]()
B. 里奇流引導的超圖神經擴散
![]()
![]()
這一理論結果為我們的架構設計提供了堅實的理論基礎。它保證了通過神經網絡(例如多層感知機 MLP)對曲率引導的聚合權重進行參數化是一種有效的方法。在實際實現中,我們通過數值求解微分方程來驅動特征更新。RFHND 前向傳播的偽代碼如算法 1 所示。為了確保求解過程的魯棒性,我們進一步推導了顯式歐拉法的穩(wěn)定性條件,具體如下:
![]()
![]()
![]()
VI. 實驗
A. 基準數據集上的結果
數據集。為了驗證 RFHND 的性能,我們在代表學術場景和真實場景的多樣化基準數據集集合上進行了全面評估。
學術場景評估在五個來自共引網絡和合著網絡的成熟超圖基準數據集上進行:Cora、Citeseer、Pubmed、Cora-CA 和 DBLP-CA [26]。對于這些數據集,節(jié)點特征源自詞袋表示,而標簽對應于論文的主題類別。為了評估該方法在不同領域的泛化能力,我們還使用了幾個真實世界的數據集。這些包括來自 UCI 知識庫 [41] 的 Zoo 數據集、3D 視覺數據集 ModelNet40 [42] 和 NTU2012 [43],以及交易數據集 Walmart [44]、社交網絡數據集 House [45] 和 Senate [46]。遵循先前的工作,我們?yōu)樗袛祿瘶嫿顺瑘D結構;在缺乏固有節(jié)點特征的情況下,我們使用高斯隨機向量對其進行初始化。對于評估,訓練集、驗證集和測試集采用一致的 50%/25%/25% 劃分比例。為確保結果穩(wěn)健可靠,最終報告的性能是使用不同隨機劃分進行 20 次獨立試驗的聚合結果。所有數據集的統(tǒng)計摘要見表 I。
基線方法。為了評估 RFHND 的性能,我們將其與一組具有代表性的超圖神經網絡基線方法進行了比較。這包括幾種方法,例如 HGNN [24],該方法應用了專為超圖數據設計的譜卷積操作。我們還納入了 HCHA [19],這是一種結合層次注意力機制進行表示學習的方法,以及廣泛使用的 HyperGCN [26],該方法通過團擴展策略將圖卷積擴展到超圖領域。
我們的比較還納入了 HNHN [25],該模型以其新穎的超圖特定歸一化技術而聞名,以及 UniGCNII [17],后者通過殘差連接統(tǒng)一了多種超圖卷積范式。著名的 HAN [47] 模型也被納入,作為層次注意力網絡的關鍵代表。此外,我們還以 AllSetTransformer 和 AllDeepSets [18] 為基準,這兩種方法將深度集理論適配到超圖學習中以確保置換不變性。
評估進一步擴展到更新穎和更專業(yè)的架構。基線集合包含 ED-HNN [30],這是一種利用等變超圖擴散算子的方法。為了考慮長程依賴關系,我們納入了 HyperGINE 和 KHGNN [29],后者通過 K 跳消息傳遞促進遠距離節(jié)點之間的交互。最后,還納入了多尺度方法 FrameHGNN [14],該方法將框架變換(framelet transforms)整合到其架構中。為確保公平且標準化的比較環(huán)境,所有模型均在 PyTorch Geometric 庫 [48] 中實現。
實驗設置。對于 RFHND 模型,采用 Adam 優(yōu)化器。主要超參數——學習率、權重衰減、丟棄率、隱藏維度和總訓練輪數——根據驗證集性能為每個數據集單獨調整。具體而言,學習率從 {0.001, 0.01} 中選擇,權重衰減從范圍 [0.001, 0.03] 中選擇,輸入丟棄率從 {0.001, 0.01, 0.1, 0.2, 0.3} 中選擇,隱藏維度從 {16, 32, 64, 128, 256, 512} 中選擇,總訓練輪數從 {2, 3, 4} 中選擇。每個數據集的最優(yōu)配置在這些范圍內確定。在適用情況下,采用余弦學習率調度器(CosineLR)。我們使用 torchdiffeq [49] 實現的方法作為 RFHND 的微分方程求解器。所有實驗均使用固定隨機種子進行,以確保可復現性。源代碼可在 https://gitee.com/zmyovo/rfhnd.git 獲取。
![]()
結果。如表 II 和表 III 所示,實驗結果充分展示了我們提出的 RFHND 模型的優(yōu)越性能。通過計算所有比較方法的平均排名,RFHND 模型在學術數據集和真實世界數據集上均保持第一位,這有力地證明了其強大的泛化能力。具體而言,RFHND 模型在五個學術基準數據集中的三個上達到了最先進(State-of-the-Art)的性能,并在另一個數據集上取得了優(yōu)秀的第二名排名。這一表現確鑿地證實了 RFHND 模型有效捕捉結構化數據中復雜關系的關鍵能力。此外,RFHND 模型在六個真實世界數據集上全面超越了所有比較方法,這些數據集涵蓋了交易網絡和社交網絡分析等多樣化的應用領域。這些在不同類型數據集上的一致性結果共同驗證了 RFHND 模型在超圖節(jié)點分類任務上的卓越有效性。
B. 合成異質超圖數據集上的結果
![]()
結果。表 IV 中呈現的結果表明,與所有基線方法相比,RFHND 模型在評估的數據集上始終實現了優(yōu)越的性能。其優(yōu)勢在異配設置(當 時)尤為明顯,在該設置下模型表現出顯著提高的魯棒性和泛化能力。這些發(fā)現證實了所提出架構的有效性。
![]()
C. 消融實驗
在本節(jié)中,我們在多個數據集上進行消融實驗,以評估我們模型中每個子模塊的貢獻。詳細發(fā)現總結如下。
- w/o COS:在此 RFHND 變體中,余弦系數從節(jié)點特征演化過程中被移除,因此特征更新是在沒有基于余弦的調節(jié)下進行的。
- w/o HyperNet:在此 RFHND 變體中,用于建模邊曲率的 HyperNet 被替換為一個隨機生成的數值,而不是自適應地學習曲率。
- w/o C and H:此 RFHND 變體排除了節(jié)點特征演化過程中的余弦系數以及用于邊曲率建模的 HyperNet。
如表 V 所示,所有變體在標簽預測方面均表現出性能下降,這強調了這些組件在增強交互類型建模方面的重要性。具體而言,與單一組件的消融相比,聯(lián)合移除 COS 和 HyperNet 模塊(w/o C 和 H)導致性能下降更為顯著,這強調了這兩個模塊之間協(xié)調配合的關鍵重要性。
![]()
D. 過平滑分析
本節(jié)考察模型深度如何影響超圖神經網絡的性能。大多數現有的超圖神經網絡(HGNNs)本質上是淺層的,這限制了它們從高階鄰居中捕捉信息的能力 [15]。然而,單純增加深度往往會導致過平滑,即節(jié)點表示變得越來越相似,最終變得無法區(qū)分。
為了研究這個問題,我們在 Cora、Cora-CA 和 Citeseer 數據集上評估了具有不同深度的幾種模型。使用固定的數據劃分,我們測試了 2、4、10、20、30 和 40 層的設置,以觀察隨著網絡變深性能如何變化。同時,我們還記錄了不同層配置下的狄利克雷能量(Dirichlet Energy)。具體而言,對于零層,能量是使用初始節(jié)點特征計算的;而對于更深的配置,它是根據訓練好的網絡輸出的節(jié)點嵌入計算的。
如圖 2 系統(tǒng)所示,結果得出了兩個關鍵觀察結果:
![]()
- 提出的 RFHND 模型在所有測試的層深度上始終提供卓越的性能。至關重要的是,隨著層數的逐步增加,其性能表現出顯著的穩(wěn)定性。
- RFHND 在上述三個數據集上顯示出穩(wěn)定的狄利克雷能量軌跡,而對比方法則隨著深度的增加經歷了能量的快速下降。這與我們在 IV-A 節(jié)中的理論分析一致。
E. 魯棒性分析
為了評估 RFHND 在噪聲輸入條件下的魯棒性,我們進行了大量實驗,同時考慮了特征級和結構級的擾動。實驗配置如下:
![]()
如圖 3 所示,在所有噪聲設置下,提出的方法始終優(yōu)于基線方法。當面臨特征級擾動時,RFHND 在 Citeseer 數據集上表現出強大的魯棒性,在不同的噪聲類型(包括高斯噪聲、均勻噪聲和基于掩碼的擾動)下均保持了穩(wěn)定的性能。值得注意的是,與其他特征擾動相比,所有被檢查的模型對掩碼噪聲顯示出更高的容忍度,這可能是因為掩碼噪聲引入了結構化稀疏性而非隨機扭曲,從而允許模型在訓練期間更好地適應。
![]()
對結構噪聲的分析在 Cora-CA 數據集上展示了類似的優(yōu)勢。在所有檢查的噪聲水平(0.1–0.4)下,提出的方法始終提供更好的性能。雖然所有模型的準確率都隨著噪聲率的增長而下降,但 RFHND 僅顯示出微小的下降,反映了其對結構擾動的強大魯棒性。
F. 參數分析
![]()
具體來說,我們選擇了三個具有代表性的數據集:Zoo、NTU2012 和 ModelNet40。如圖 4 所示,RFHND 在不同的隱藏層下保持相對穩(wěn)定。然而,當步長變得過大時,模型性能會惡化,這表明過大的步長可能會導致不穩(wěn)定的特征傳播,并削弱模型捕捉細粒度關系模式的能力。這與定理 6 的結論是一致的。
具體來說,我們選擇了三個具有代表性的數據集:Zoo、NTU2012 和 ModelNet40。如圖 4 所示,RFHND 在不同的隱藏層下保持相對穩(wěn)定。然而,當步長變得過大時,模型性能會惡化,這表明過大的步長可能會導致不穩(wěn)定的特征傳播,并削弱模型捕捉細粒度關系模式的能力。這與定理 6 的結論是一致的。
![]()
G. 特征可視化
![]()
如圖 5 所示,可以看出隨著時間的推移,節(jié)點嵌入逐漸形成更清晰、更緊湊的簇。這一現象表明,模型逐漸增強了區(qū)分不同類別節(jié)點的能力,在整個積分過程中,表示演變成了更具可分性和判別性的結構。
![]()
VII. 結論
在本文中,我們通過將微分幾何中的里奇流推廣至超圖領域,緩解了超圖神經網絡中過平滑這一關鍵挑戰(zhàn)。具體而言,我們提出了 RFHND(里奇流引導的超圖神經擴散),這是一種新穎的消息傳遞范式,利用離散里奇流來自適應地調節(jié)信息傳播。通過將節(jié)點特征演化構建為基于連續(xù)偏微分方程(PDE)的系統(tǒng),我們的方法在幾何層面上有效地控制了擴散速率,從而防止了特征同質化。此外,我們提供了嚴格的理論分析,驗證了我們框架的收斂性質與逼近能力。在多個基準數據集上的廣泛實驗表明,RFHND 顯著優(yōu)于現有最先進的方法,并展現出強大的魯棒性。最終,這項工作為解決過平滑問題提供了一個頗具前景的幾何視角,豐富了高階表示學習的相關理論。
原文鏈接:https://arxiv.org/pdf/2603.15696
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.