動態主題模型 Dynamic Topic Models
https://mimno.infosci.cornell.edu/info6150/readings/dynamic_topic_models.pdf
![]()
![]()
摘要
開發了一系列概率時間序列模型,用于分析大型文檔集合中主題的時間演變。該方法是在表示主題的多項分布的自然參數上使用狀態空間模型。開發了基于卡爾曼濾波和非參數小波回歸的變分近似,以對潛在主題進行近似后驗推斷。除了提供順序語料庫的定量預測模型外,動態主題模型還為了解大型文檔集合的內容提供了一個定性的窗口。通過分析《科學》(Science)雜志從1880年到2000年經過OCR(光學字符識別)處理的檔案,對這些模型進行了演示。
1. 引言
管理電子文檔檔案的爆炸式增長需要新的工具來自動組織、搜索、索引和瀏覽大型集合。機器學習和統計學領域的近期研究開發了新技術,利用層次概率模型在文檔集合中尋找詞語模式(Blei 等,2003;McCallum 等,2004;Rosen-Zvi 等,2004;Griffiths 和 Steyvers,2004;Buntine 和 Jakulin,2004;Blei 和 Lafferty,2006)。這些模型被稱為“主題模型”,因為發現的模式通常反映了組合形成文檔的潛在主題。這種層次概率模型很容易推廣到其他類型的數據;例如,主題模型已被用于分析圖像(Fei-Fei 和 Perona,2005;Sivic 等,2005)、生物數據(Pritchard 等,2000)和調查數據(Erosheva,2002)。
在可交換主題模型(exchangeable topic model)中,假設每個文檔的詞語是從多項分布的混合中獨立抽取的。混合比例是為每個文檔隨機抽取的;混合分量(即主題)由所有文檔共享。因此,每個文檔以不同的比例反映這些分量。這些模型是大型非結構化文檔集合的一種強大的降維方法。此外,文檔級別的后驗推斷對于信息檢索、分類和主題導向的瀏覽非常有用。將詞語視為可交換的是一種簡化,這與識別每個文檔內語義主題的目標是一致的。然而,對于許多感興趣的集合,文檔可交換的隱式假設是不恰當的。諸如學術期刊、電子郵件、新聞文章和搜索查詢日志等文檔集合都反映了不斷演變的內容。例如,《科學》雜志的文章《Laborde教授的大腦》(The Brain of Professor Laborde)可能與《通過揭示潛在的皮層內連接重塑皮層運動圖》(Reshaping the Cortical Motor Map by Unmasking Latent Intracortical Connections)這篇文章處于同一條科學脈絡上,但1903年的神經科學研究與1991年相比看起來大不相同。文檔集合中的主題隨時間演變,明確地對潛在主題的動態進行建模是很有意義的。
在本文中,我們開發了一種動態主題模型,該模型捕獲按時間順序組織的文檔語料庫中主題的演變。我們通過分析《科學》雜志100多年來經過OCR處理的文獻來證明其適用性,該雜志由托馬斯·愛迪生于1880年創立并一直出版至今。在該模型下,文章按年份分組,每年的文章源于一組從上一年的主題演變而來的主題。
在隨后的章節中,我們擴展了經典的狀態空間模型,以指定主題演變的統計模型。然后,我們開發了高效的近似后驗推斷技術,用于從順序文檔集合中確定不斷演變的主題。最后,我們展示了定性結果,證明動態主題模型如何允許以新的方式探索大型文檔集合;并展示了定量結果,證明與靜態主題模型相比,其具有更高的預測精度。
2. 動態主題模型
雖然傳統的時間序列建模一直關注連續數據,但主題模型是專為分類數據設計的。我們的方法是在潛在主題多項式的自然參數空間上,以及在用于建模文檔特定主題比例的對數正態分布的自然參數上使用狀態空間模型。
![]()
![]()
因此,我們的方法是通過在動態模型中鏈式連接高斯分布,并將生成的值映射到單純形,從而對成分隨機變量序列進行建模。這是對邏輯正態分布(Aitchison, 1982)在時間序列單純形數據(West and Harrison, 1997)上的擴展。
![]()
![]()
![]()
3. 近似推斷
在自然參數上處理時間序列使得能夠使用高斯模型來描述時間動態;然而,由于高斯模型和多項分布模型之間的非共軛性,后驗推斷是難以處理的。在本節中,我們提出一種用于近似后驗推斷的變分方法。我們使用變分方法作為隨機模擬的確定性替代方案,以便處理文本分析中典型的大型數據集。雖然吉布斯采樣(Gibbs sampling)已有效地用于靜態主題模型(Griffiths and Steyvers, 2004),但非共軛性使得采樣方法對于這種動態模型更加困難。
![]()
![]()
![]()
3.1. 變分卡爾曼濾波
![]()
![]()
![]()
3.2. 變分小波回歸
![]()
![]()
![]()
運行此算法和卡爾曼變分算法以近似一元語法模型(unigram model)的示例結果如圖3所示。這兩種變分近似都平滑了一元語法計數中的局部波動,同時保留了可能表明期刊內容發生顯著變化的尖銳峰值。雖然擬合結果與使用標準小波回歸對(歸一化)計數進行擬合的結果相似,但這些估計值是通過最小化 KL 散度獲得的,這與標準變分近似中的做法一致。
![]()
在第2節的動態主題模型中,算法本質上與上述描述的相同。然而,我們不是根據真實觀測計數來擬合觀測值,而是根據公式(3)中文檔級變分分布下的期望計數來擬合它們。
4. 《科學》雜志的分析
我們分析了來自《科學》(Science)雜志的30,000篇文章的一個子集,涵蓋了1881年至1999年這120年間每年的250篇文章。我們的數據由JSTOR (www.jstor.org) 收集,這是一個非營利組織,它通過在原始印刷期刊上運行光學字符識別(OCR)引擎來維護一個在線學術檔案庫。JSTOR 對生成的文本建立索引,并通過關鍵詞搜索提供對原始內容掃描圖像的在線訪問。
我們的語料庫由大約750萬個單詞組成。我們通過將每個詞提取詞干至其詞根、去除功能詞以及去除出現次數少于25次的詞來修剪詞匯表。總詞匯量為15,955。為了探索該語料庫及其主題,我們估計了一個包含20個分量的動態主題模型。在一臺1.5GHz PowerPC Macintosh筆記本電腦上,后驗推斷大約花費了4小時。圖4展示了其中兩個結果主題,根據使用卡爾曼濾波變分近似估計的后驗平均出現次數,顯示了這些主題在每十年中的前幾個詞。圖中還展示了幾十年來體現這些主題的示例文章。如圖所示,該模型捕捉到了不同的科學主題,并可用于檢查其中詞語使用的趨勢。
![]()
為了定量驗證動態主題模型,我們考慮了根據往年所有文章預測《科學》雜志下一年內容的任務。我們比較了三種20主題模型的預測能力:根據往年所有數據估計的動態主題模型、根據往年所有數據估計的靜態主題模型,以及僅根據前一年數據估計的靜態主題模型。所有模型均估計至相同的收斂標準。根據所有往年數據估計的主題模型和動態主題模型在同一點進行初始化。
動態主題模型表現良好;與其他兩個模型相比,它總是賦予下一年的文章更高的似然值(圖5)。有趣的是,每種模型的預測能力隨年份推移而下降。我們可以暫時將其歸因于科學語言專業化程度的提高。
![]()
原文鏈接:https://mimno.infosci.cornell.edu/info6150/readings/dynamic_topic_models.pdf
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.