基于高階超圖的動態主題模型
Dynamic Topic Modeling with a Higher-Order Hypergraphical
Representation
https://arxiv.org/pdf/2605.28269
![]()
![]()
摘要
動態主題建模被廣泛用于分析科學文獻、醫療記錄和社交媒體中的演變趨勢。傳統的主題模型通過多項單純形(multinomial simplex)上的單一概率向量來表示每個主題,并在單一概率機制內隱式地將詞語的出現與重復耦合在一起。然而,這種表述限制了詞語之間的依賴結構,并忽略了信息豐富的高階交互,特別是在語義重疊的動態語料庫中。為了解決這些局限性,我們引入了一種文本的超圖表示,其中每個文檔被建模為連接所有共現詞語的超邊,并將重復強度編碼為節點權重。這種表示自然地將詞語的出現與重復分離開來,并誘導了一種新穎的基于超圖的多項分布(multinomial distribution),該分布具有依賴于每個文檔所觀測到的詞語集合的非線性歸一化。基于該似然函數,我們通過結構化低秩分解開發了一個動態主題建模框架,并在主題-詞特征(topic-word profiles)上施加了顯式的時間正則化。此外,在理論上,盡管雙線性分解和特定于文檔的非線性歸一化具有內在的非凸性,我們仍建立了局部收斂保證并推導了非漸近誤差界。在合成數據上的數值實驗以及對國際學習表征會議(ICLR)語料庫的應用表明,與現有的基于多項分布的主題模型相比,該方法表現出了一致的改進。
關鍵詞:超圖;低秩分解;非凸優化;投影梯度下降;局部收斂。
1 引言
主題建模旨在揭示大型文檔語料庫中的潛在語義結構,并量化主題的普遍性(或流行度)。它已成為統計文本分析的核心工具,應用于科學文獻追蹤、醫療記錄分析(Sarioglu 等,2012;Ye 等,2024)、社交媒體監控(Curiskis 等,2020)以及電子商務檔案(Palese & Usai,2018;Yuan 等,2018)。在許多當代場景中,語料庫是在較長的時間跨度內收集的,并且主題-詞特征(topic-word profiles)和文檔-主題關聯都在動態演變。這種時間異質性促使了動態主題模型的發展,這些模型能夠追蹤潛在主題隨時間發生的結構變化。
經典的主題建模方法將多項似然應用于文檔的詞袋(BOW)表示(Harris,1954),通過邊緣詞頻對文檔進行編碼。該概率范式內的兩個主導框架是潛在狄利克雷分配(LDA)(Blei 等,2003)和概率潛在語義索引(pLSI)(Hofmann 等,1999)。基于LDA的方法(Blei & Lafferty,2006a;Roberts 等,2014;Chen 等,2020;Sobhani 等,2024;Mcauliffe & Blei,2007;Chong 等,2009)采用貝葉斯公式,并在動態擴展中通常通過具有狀態空間鏈式連接和時不變先驗的變分推斷進行擬合(Blei & Lafferty,2006b)。同時,基于pLSI的方法(Arora 等,2012,2013;Klopp 等,2023;Ke & Wang,2024)主要關注靜態設置,將主題建模表述為低秩矩陣分解,并在可分離性假設下利用詞分布的幾何或譜性質。
然而,盡管它們應用廣泛,這兩個框架都將多項似然應用于BOW計數。在給定文檔長度的條件下,詞元是從單一的單純形約束概率向量中獨立抽取的,并且所有共現結構均由邊緣構成決定。這種建模選擇具有三個重要含義。首先,每個文檔內的依賴結構完全由特定主題的概率向量決定,無法適應特定于文檔的詞語交互模式。其次,詞語的出現和重復可能表現出不同的行為,但通過相同的參數耦合在一起。第三,主題可識別性僅依賴于邊緣詞分布,當主題在邊緣上重疊但在聯合出現-重復模式上存在差異時,這會削弱可分離性。
為了捕獲特定于文檔的高階依賴關系并將詞語的出現與重復解耦,我們考慮了一種新穎的文檔超圖表示。具體而言,我們將每個詞匯項視為一個節點,并將每個文檔視為一個由文檔中出現的詞語支撐的加權超邊。每個超邊的支撐集捕獲了文檔的詞語共現模式,而節點權重則編碼了詞語的重復強度。例如,在數據科學文章的語料庫中,以數據集為中心的論文通常專注于單個基準數據集,形成一個在單一數據集節點上權重較高的超邊(即諸如“ImageNet32”和“MNIST”等術語),而方法論論文則引用多個數據集進行數據說明,從而導致連接到許多節點但每個節點權重較低的超邊。因此,與BOW不同,這種表示通過超邊支撐集和節點權重將詞語的出現與重復解耦,允許交互模式在特定于文檔的詞語子集上變化,而不是由單一的多項參數控制。通過利用超越邊緣比例的聯合激活和重復模式,它提供了額外的判別信息,并在主題在語義內容上重疊時提高了主題可識別性。
基于這種表示,我們開發了一個動態主題建模框架,該框架分別對詞語的出現和重復進行建模,同時允許主題結構隨時間演變。具體而言,我們通過伯努利(Bernoulli)分量對每個超邊的支撐集進行建模,并在給定該支撐集的條件下,通過具有特定于文檔的歸一化的多項分布對節點權重進行建模。利用混合隸屬度公式,我們對這兩個分量施加結構化低秩分解,以表征文檔-主題關聯和主題-詞特征。在標準的非負性和單純形約束下,低秩因子可以自然地解釋為主題-文檔關聯和主題-詞行為(即出現和重復),從而直接洞察主題普遍性和語義用法如何隨時間演變。在動態語料庫中,預期主題在保持連貫主題的同時逐漸演變。例如,隨著“語言模型”研究的發展,論文的用詞模式可能會發生變化,但整體主題焦點仍保持在“語言模型”上。為了適應這種設置,我們直接對主題-詞特征施加時間正則化,在保持可識別性的同時允許平滑的語義漂移。
我們的貢獻有三方面。首先,我們引入了一種基于超圖的文本語料庫概率表示,該表示捕獲了超越多項模型的高階依賴結構,并明確地將詞語出現與重復強度分離開來。其次,我們開發了一個動態建模框架,該框架通過具有直接時間正則化的結構化低秩分解來適應隨時間演變的語料庫,為動態主題建模提供了一種基于似然的替代方案。第三,盡管雙線性分解和特定于文檔的歸一化引起了內在的非凸性,我們通過開發新穎的擾動和集中論證(perturbation and concentration arguments),建立了局部收斂保證,并推導了明確的非漸近Frobenius范數誤差界。
本文的其余部分組織如下。第2節介紹了超圖表示及其誘導的分布。第3節介紹了動態建模框架和估計算法。第4節建立了理論性質。第5節報告了數值實驗。第6節以討論和未來工作方向作為結論。
2 通過超圖進行文本表示
![]()
為了編碼超越邊緣構成的文檔特定交互結構,我們將每個文檔表示為超圖中的加權超邊。雖然圖已被用于建模成對詞語共現(Rousseau & Vazirgiannis 2013, Rousseau et al. 2015, Yao et al. 2019),但它們局限于成對交互,因為圖的每條邊僅連接兩個節點。超圖通過允許每條超邊連接任意節點子集來推廣圖,因此直接編碼了文檔級別的共現結構。最近的研究將超圖納入用于文本分析的神經架構中(Ding et al. 2020, Pradeepa et al. 2024, Bazaga et al. 2024),主要作為架構增強。相比之下,我們將超圖用作詞語交互的顯式概率表示。
給定一個詞匯量大小為 p p 的語料庫,我們構建一個具有 p p 個節點的超圖,每個節點對應一個詞匯詞。每個文檔由一個支撐(supported)在出現在其中的詞集上的超邊表示,節點權重記錄該文檔內的重復強度。超邊支撐捕獲了詞語激活和共現模式,而節點權重量化了異質重復行為。圖 2.1 提供了一個說明性示例,其中每個彩色區域代表一個超邊。為了視覺清晰,重復強度未顯示。我們觀察到,特定于超邊的詞語揭示了每個超邊的語義主題,而重疊詞語則反映了跨文檔的共享激活模式。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
3 動態主題建模
在本節中,我們基于提出的 H-多項分布開發了一個動態主題建模框架。第 3.1 節介紹了建模目標和設計原則。基于這些原則,第 3.2 節形式化了動態模型的低秩結構和可識別性條件。第 3.3 節隨后構建了懲罰似然問題,第 3.4 節展示了一種高效的估計算法。
3.1 一般原則
我們的動態主題模型由三個原則指導。
首先,H-多項分布將詞語出現概率 q q 和重復強度 λ λ 分離開來。這些成分編碼了不同的語言信號,而在 BOW-多項表示中,這些信號被單一的組合參數所混淆,我們通過獨立的機制對它們進行建模。
其次,出現概率和重復強度共享低秩主題結構。正如在經典混合隸屬模型(Hofmann 等,1999;Blei 等,2003)中一樣,每個文檔被表示為潛在主題的混合。文檔級主題權重共同決定了出現和重復行為。這兩個信號為區分主題提供了互補信息,同時通過共享的混合成分在語義上保持關聯。
第三,在進行時間對齊后,允許主題語義隨時間平滑演變。雖然文檔-主題比例可以在不同時間窗口內自由變化,但假設主題-詞特征圍繞其時間平均值適度波動。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
假設 3.2 形式化了正確的模型設定,并確保了時間內和跨時間的可識別性。在每個時間窗口內,錨文檔和可分離性條件保證了雙線性分解在置換意義下的唯一性。錨類型條件在混合隸屬模型中是標準的;參見 Klopp et al. (2023), Jung & Donnat (2024)。pLSI 方法中使用的錨詞假設 (Arora et al. 2012, 2013, Ke & Wang 2024) 是充分的,并且通常比我們的可分離性條件更強。跨時間地,覆蓋率和連通性條件允許主題出現或消失,同時保持全局可識別性,而唯一對齊條件排除了多個對齊序列產生相同時間偏差的退化情況。
![]()
![]()
命題 3.1 為第 4 節中的非漸近誤差分析提供了一個良定義的目標(在置換意義下)。
3.3 估計
![]()
![]()
![]()
![]()
與對潛變量施加狀態空間演變的動態 LDA 類模型不同,我們的表述直接對特定主題的詞語分布進行正則化,允許局部語義漂移,同時保持全局一致性。與依賴特定時間的錨點幾何且缺乏顯式時間關聯的譜 pLSI 方法(Arora et al. 2012, 2013, Klopp et al. 2023, Ke & Wang 2024)相比,我們基于似然的表述能夠適應時變語料庫幾何,并且在主題出現或消失時保持穩定。
![]()
與對潛變量施加狀態空間演變的動態 LDA 類模型不同,我們的表述直接對特定主題的詞語分布進行正則化,允許局部語義漂移,同時保持全局一致性。與依賴特定時間的錨點幾何且缺乏顯式時間關聯的譜 pLSI 方法(Arora et al. 2012, 2013, Klopp et al. 2023, Ke & Wang 2024)相比,我們基于似然的表述能夠適應時變語料庫幾何,并且在主題出現或消失時保持穩定。
3.4 投影梯度下降算法
目標函數是非凸的,這是由于雙線性分解以及多項分量中依賴支撐集的歸一化造成的。閉式解不可用,且全局最小化器不一定是唯一的。因此我們采用投影梯度下降(PGD),總結在算法 1 中。
![]()
![]()
4 理論性質
在本節中,我們為提出的估計算法建立局部收斂保證和有限樣本誤差界。第 4.1 節介紹了誤差度量和基本正則性條件。第 4.2 節陳述了主要理論結果,包括確定性和概率形式。第 4.3 節提供了主題數量 K K 的一致估計。
4.1 正則性假設
為了確保主題可分離性,我們施加了一個標準的非退化條件,要求真實的低秩因子是良態的(well-conditioned)。
![]()
![]()
![]()
通過這一選擇,公式 (4.1) 中的每個分塊均在平衡的尺度下進行度量,且所得度量適應了目標函數的局部曲率。鑒于目標函數的非凸性以及全局最優解的非唯一性,我們的分析聚焦于真值鄰域內投影梯度下降(PGD)迭代點的局部行為。因此,我們將局部吸引域定義如下。
![]()
定義 4.1 將幾何收縮轉化為 oracle 對齊的誤差控制。建立有限樣本界需要刻畫經驗目標函數的局部曲率,由于依賴支撐集的歸一化、重復層中的逐分量依賴、伯努利掩碼以及由采樣噪聲引起的隨機擾動,這一過程是非標準的。因此,我們在 PGD 軌跡上施加以下局部正則性條件。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
5 數值研究
我們將提出的方法與基于 LDA(Blei et al. 2003, Blei & Lafferty 2006b)和基于 pLSI(Klopp et al. 2023, Ke & Wang 2024)的基線方法在合成和真實動態語料庫上進行了比較。第 5.1 節在受控的真實情況(ground truth)下評估有限樣本準確性,第 5.2 節報告了在帶有移動時間窗口的修剪后 ICLR 語料庫上的實證表現。
5.1 模擬數據分析
我們進行合成實驗,這些實驗基于修剪后的 ICLR 摘要語料庫(González-Márquez & Kobak 2024)進行校準,以模擬真實的主題-詞行為。數據集中的每個文檔都是一篇關聯了元數據和手動分配主題標簽的摘要。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
隨著時間跨度的增加,主題內的語義演變不斷累積,使得準確的主題隸屬度估計更具挑戰性。我們的方法旨在通過對主題-詞特征進行直接的時間正則化來適應這種動態變化。因此,詞語出現和重復強度都被允許隨時間靈活演變,同時受到相對于時間平均值的懲罰偏差的約束。隨著 T T的增長,這種機制產生了越來越穩定和準確的主題隸屬度估計。
相比之下,諸如 SPOC 和 LDA 之類的靜態方法并未顯式地對時間動態進行建模,導致隨著 T T 的增加,準確性逐漸下降。正如第 5.1 節所討論的,DTM 通過時不變先驗參數捕捉時間演變,但仍然對初始化敏感,并且并未始終從更長的窗口中受益。Topic-SCORE 依賴于源自代表性詞語的幾何性質,在 T T 適度增加時表現出相對穩健的性能。這表明,在足夠長的時間跨度內,某些代表性詞語保留了可區分的邊緣比例。盡管如此,優越的性能表明,超越邊緣詞頻的信息結構——即通過我們框架中的高階共現模式所捕獲的結構——對于準確的主題恢復仍然至關重要。恢復主題的定性可視化展示在附錄 C.2 中。
6 結論
在本文中,我們提出了一種基于超圖的文本語料庫表示方法,該方法偏離了經典的BOW-多項范式。其核心創新在于通過文檔級支撐和特定節點權重,明確地將詞語出現與重復強度分離開來。這種表述誘導了一種具有依賴支撐集歸一化的伯努利-多項分解,允許保留高階詞語交互,同時保持一個適合統計分析的基于似然的框架。
基于這種表示,我們開發了一個動態主題建模框架,該框架基于出現和重復分量的結構化低秩分解。所提出的估計量通過投影梯度下降進行計算,并得到嚴格理論保證的支持,包括局部線性收斂和非漸近誤差界。這些結果通過新穎的擾動分析論證,將基于似然的主題建模理論擴展到了標準多項設置之外。實證研究表明,分別對出現和重復進行建模改善了主題區分度,特別是在語義主題重疊時。這支持了一個更廣泛的觀點,即更豐富的依賴結構可以增強動態文本分析中的可識別性和估計精度。
更廣泛地說,所提出的超圖似然框架為建模具有異質支撐和強度模式的結構化離散數據提供了一種原則性方法,并且可能在動態主題建模之外也有用。例如,在移動應用程序日志中,用戶活動數據記錄了用戶是否參與特定功能(激活支撐)以及該功能被使用的頻率或時長(強度)。類似地,投資交易記錄包含投資者是否參與給定資產(激活支撐)以及投資金額或頻率(強度)。在這兩種設置中,支撐和強度機制在概念上是截然不同的,并且可能在個體或項目之間表現出不同的依賴結構。超圖表示,連同激活和強度分量的明確分離,為建模此類異質行為模式提供了一個自然的框架,并且是未來研究的一個有前景的方向。
原文鏈接:https://arxiv.org/pdf/2605.28269
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.