大模型架構下的注意力(attention)機制本質上是一套記憶系統:每個詞把自己寫進上下文,后面的詞再從中讀取。過去十年,幾乎所有的改進都在討論“讀”:該從哪里讀、按什么權重讀;卻很少有人追問“寫”:一個詞寫進記憶時,應該原樣存進去,還是只存下它相對于過去的增量?
對于寫入端的改進,馬學喆和他的合作團隊給出了自己的答案:SoftDelta。團隊讓模型在寫入記憶時只存儲相對于已有信息的增量,且繞開了這套方法此前無法落地的計算難題(一個巨型矩陣求逆),讓 SoftDelta 訓練更穩定,最終效果反超標準 Transformer。
馬學喆目前是南加州大學計算機系研究型助理教授,也是南加大信息科學研究所(USC-ISI)研究負責人。他本碩畢業于上海交通大學,博士畢業于卡內基梅隆大學語言技術研究所,師從國際知名計算語言學家、自然語言處理領域先驅 Eduard Hovy,曾獲 ACL 2016、EMNLP 2023 杰出論文獎。他本人長期研究高效神經架構與長上下文建模,是 Mega、Megalodon、Luna 等一系列高效注意力架構的主要作者。SoftDelta 是他與穆罕默德·本·扎耶德人工智能大學基礎模型研究員( MBZUAI-IFM )合作的最新成果。
圍繞注意力機制的“讀與寫”這條線,以及 SoftDelta 的未來應用,DeepTech 和馬學喆展開了一場對話。整場對話里,馬學喆始終保持著冷靜的思考,比如,他覺得 SoftDelta 的更大舞臺在音視頻而非文本;唯獨談到未來架構的時候,他說,應該“越極端越好”。
注意力機制,為什么之前沒考慮“寫什么”?
DeepTech:來聊聊你一開始為什么會想做 SoftDelta 吧。
馬學喆:這個想法受益于 Delta Rule(增量法則,一種只存儲或更新相對于已有信息變化量(delta),而非重復保存全部信息的方法。)現實中一個很好的例子是音頻、視頻信號的存儲:比如視頻,我們不會每一幀都保存全部信息,而是保存它和前一幀的差,因為相鄰兩幀之間變化很少。語言里這個現象沒那么明顯,畢竟一個詞和上一個詞是比較分開的,但道理一樣。沒有必要把這一步的所有信息都存下來,只需要存和之前相比的增量。
而原始的注意力機制,只是把當前這一步和前面的信息加權求和,它沒有顯式地模擬“剔除已有信息”這個過程。雖然從數學上說,注意力理論上也能學出類似的模式,但如果不顯式地引導,很難讓模型自己學出來。
DeepTech:這個直覺聽起來并不復雜。那為什么注意力的改進大多集中在“讀”這一側,寫入端的工作一直這么少?
馬學喆:我覺得主要有兩個原因。第一是代價:Delta Rule 這個想法已經很久了,在線性注意力(linear attention)上也應用得很成功,DeltaNet、最近很火的 Gated DeltaNet 都是類似的思想。但要把它嚴格寫進標準的 softmax 注意力,算式里需要對一個由注意力權重構成的巨大三角矩陣求逆,現實中幾乎不可行。去年字節的一篇論文,包括最近的一些工作,討論過能不能用 GPU 上的快速算法去求這個逆,但速度依然很慢,而且求逆對精度要求也很高。所以之前大家可能嘗試過、發現太慢,就沒有再多試,所以一直沒有一個現實中可用的方案。
第二是動力:在文本上,它可能并不能完全發揮出潛力,而標準注意力的效果本來也還不錯,大家就沒有那么大的動力去改造它。
SoftDelta 的三條約束性質
DeepTech:所以你們的切入點是繞開求逆?
馬學喆:對。我們的想法是,我們是不是真的要追求這個逆、追求那個精確的形式?可不可以先分析這個逆矩陣有哪些好的性質,然后只需要構造一個近似滿足這些性質的東西?
分析下來,最主要的就是三條性質。第一,對角線上必須是正的。當前詞對自己的貢獻,得是一個 0 到 1 之間的正數。第二,每一行所有位置的貢獻加起來,得落在 0 到 1 之間。第三,每一個位置的貢獻落在 -1 到 1 之間,因為它要做減法去抹掉之前已有的冗余信息,所以可以是負數,但必須是有控制的負數。為了滿足這三條性質,我們推導出了 SoftDelta Attention 這個形式:只用兩次標準的注意力讀取,加一個門控。
DeepTech:這三條性質,是研究做到一半慢慢推出來的,還是心里先有大致的要求,再去印證?
馬學喆:應該說是經驗加上一些直覺,是這么多年大家在使用注意力的過程中總結出來的。前兩條都很容易理解:每個位置的貢獻必須可控,否則某個位置權重特別大,訓練中很容易把梯度弄崩;一行加起來要在 0 到 1 之間,否則輸出的規模變大,后面的層就不穩定了。
真正是這次新發現的,是對角線。以前的注意力機制滿足這一點,當前位置的貢獻天然是正的,所以大家從來沒有把它當成一個問題。這次我們發現,像 Differential Attention 那樣的模式,最主要的隱患恰恰是對角線上不一定是正數,可能是負的。我們發現這是導致它訓練容易崩潰的主要原因。
DeepTech:這就解釋了那次對照實驗,Differential Attention V2 訓練到六分之一處損失突然跳升且不再恢復,而 SoftDelta 穩定訓練到底。這可以看作三條約束最直接的證據嗎?
馬學喆:對。從形式上看,SoftDelta 和 Differential Attention V2 非常像,都是兩個注意力圖做減法。唯一的區別是,我們的構造讓它滿足了這三個條件,而 Differential Attention V2 不滿足其中的一些。對比實驗里,一開始兩者效果差不多,但訓練到一定位置,它就崩了,我們可以一直穩定訓練下去。
![]()
圖 | 訓練損失對比曲線(來源:Notion)
Delta Rule 的主場在文本之外
DeepTech:為什么說文本上發揮不出它的全部潛力?
馬學喆:因為文本的冗余沒那么大,而視頻信號、語音信號里有大量前后冗余的信息,這正是 Delta Rule 最對口的場景。之前直接套用標準注意力,是沒有考慮這個問題的。我聽說現在計算機視覺和語音那邊的做法,是在處理數據時先做預處理,讓前后幀盡量分開。但那只是在輸入層做一步處理,我們當然希望模型自己具備這個辨別能力。如果引入 delta rule,我相信在視頻、音頻上效果會更明顯。
DeepTech:視頻往下走一步就是世界模型。你之前對擴散模型(diffusion)能否學到真實世界規律持謹慎態度,認為逐像素預測(next-pixel prediction)更合理但難度極高。現在看法有變化嗎?
馬學喆:沒有太大變化。我還是覺得這種方式直觀上比擴散模型更有可能學出真正理解物理世界的效果。它的問題是信號密度太低、學習困難,需要更好的基座架構來支持。這也正是我說 SoftDelta 這類嘗試值得一試的原因,它做的恰好是處理冗余、提取增量這件事。
除了信號密度,世界模型還有一個大挑戰是數據。如果真去現實世界里直接采樣,無用數據太多;要篩出真正信息豐富的數據,成本又很高,比文本高太多。所以它需要的投入,可能要比現在的大模型再高一個級別。
DeepTech:聽起來你對世界模型是冷靜觀望的態度?
馬學喆:我覺得它像大模型爆發之前的階段。ChatGPT 是 2022 年底出來的,往前倒五年、十年,那時候已經有人用深度學習做語言模型了,大家覺得這條路可以走,但沒人覺得它能做出多驚人的效果。等到算力、算法都迭代上去,才迎來爆發點。世界模型現在就處在這樣的階段:很多東西可以嘗試,而且越早開始越好。
注意力機制的未來架構
DeepTech:你之前提過一個設想:未來可能只保留大約四分之一的層做全注意力(full attention)、專門負責檢索,其余交給 DeltaNet 這類模塊。SoftDelta 還在這條路線上嗎?
馬學喆:混合架構肯定是未來的方向。至于是不是四分之一,我個人希望能推得越極端越好,最好只需要一兩層全注意力。這樣可以把全注意力放到便宜一點的低層級存儲上,讓它只負責檢索。當然現在不能一下子那么激進,但可以開始嘗試:全注意力到底能壓縮到多小,還能滿足要求。
DeepTech:別人可能求穩,你為什么想推這么猛?
馬學喆:首先,成本肯定是最大的因素。第二,現在很多功能其實是全注意力層包辦的,那些局部注意力、稀疏注意力、線性注意力層可能根本沒有發揮出真正的能力——要最大化其他層的能力,就值得壓縮全注意力。第三是長序列:全注意力對更長序列的外推能力,總歸是有限的。
DeepTech:總體上看,我們離 Transformer 的上限是更近了,還是還有很大空間?
馬學喆:看你怎么定義 Transformer。大的架構一直還是 Transformer,大家改的是里面的部分。我覺得整個架構短時間內不會變,但每一個算子、包括它的具體實現,都是可以動的。現在幾乎沒有大模型還在直接用最標準的 Transformer,基本都在上面做了一定的改動。至于會不會出現一次徹底的替換,我覺得暫時還不太會。
誰還在做底層架構研究?
DeepTech:你之前判斷,國內模型在架構改進上走了一些比較新的方向和嘗試;美國更多在走 scaling law,堆數據和算力換性能。半年過去,這個看法有變化嗎?
馬學喆:大的格局沒變:這半年美國這邊更多還是數據、算力方面的優化,包括圍繞 agent 的工程鏈路優化;國內看到了更多架構上的改進。但國內也出現了一些搖擺。比如 MiniMax 是最早用線性注意力的,最新版本卻把它去掉了。不過我覺得搖擺是好事,說明大家在認真對比不同方法的真實性能,看哪個是真正更優的。它同時也說明,新路線確實不那么好走:scaling law 就擺在那里,花更多算力換更好效果,但總歸要封頂;新東西理論上限高很多,代價是周期長、風險大。
DeepTech:美國那邊完全沒有這樣的嘗試嗎?
馬學喆:有,但形態不一樣。學術界、實驗室和各家的非旗艦模型都在試:Google 除了 Gemini 還有 Gemma 在嘗試不同的東西,Nvidia 的 Nemotron 一直在做 Mamba 和注意力的混合。他們資源多,可以兩條路并行。但這些嘗試更多是展示方向,沒有像國內那樣,放進一個要沖擊絕對性能、要產生收益的旗艦模型里。
DeepTech:SoftDelta 是 USC-ISI 和 MBZUAI-IFM 合作的成果。MBZUAI 這種“第三方”的位置,是否恰好為底層架構研究提供了某種空間?
馬學喆:倒不一定非要跨地緣,但它確實點出了一個結構性的問題。基座架構研究需要長期、大量的投入,短期看不到明顯效果。而中美的頭部公司已經進入拼收益、拼模型效果的階段,估值非常高——兩三個月沒有新模型、效果被別人拉開一代,都會直接影響估值。所以它們必須把資源投在最前線,長期的底層研究就會被擠壓;你也不可能在那個環境下勉強它們。另外,在中美做長期研究還容易被淹沒,模型太多,大家都在做。
而像 MBZUAI 所在的中東地區,AI 還處于起步階段,完全沒有到考慮投入產出的時候,反而更愿意在這種事情上花時間。這就是這種合作的好處。
DeepTech:最后回到你們自己的研究。下一步的計劃是什么?
馬學喆:我們最近做了不少架構上的研究,但這些新方法還沒有整合起來,也沒有一個完整的模型在大規模上驗證過。下一步,我們希望把這些被驗證有效的方法整合到一個統一的新架構里,在一定規模的模型和數據量上,做一次真正從頭到尾的訓練,然后和以 Transformer 為基準的模型做公平比較,證明它最后的效果到底怎么樣。這是我們接下來半年的重點。
參考資料:
https://maxlab.notion.site/softdelta-attention
運營/排版:何晨龍
注:封面由 AI 輔助生成
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.