過(guò)去半年以來(lái),大家都在等DeepSeek再次放大招,但是似乎并沒(méi)有讓人特別驚艷的進(jìn)展,再次橫空出世。
等2026年的新年剛翻頁(yè),DeepSeek 并沒(méi)有像外界期待的那樣發(fā)布新模型、刷榜單、秀參數(shù),而是做了一件更加踢館炸街的大事,在 arXiv上發(fā)表了一篇最重磅的論文。
![]()
這一點(diǎn)非常關(guān)鍵。因?yàn)閍rXiv 從來(lái)就不是給市場(chǎng)看的地方,它是全球科研共同體默認(rèn)的“原始技術(shù)水源”。
能選擇在這里發(fā)聲,說(shuō)明這一次DeepSeek 想討論的,不是大模型的應(yīng)用效果了,而是以前的規(guī)則本身,能不能繼續(xù)成立,還能不能繼續(xù)創(chuàng)新的問(wèn)題。
論文的名字叫《mHC:引入流形約束的超連接結(jié)構(gòu)》。如果你只是停留在標(biāo)題層面,大概率會(huì)覺(jué)得這又是一篇典型的模型結(jié)構(gòu)改進(jìn)論文,專業(yè)、抽象。而且離現(xiàn)實(shí)很遠(yuǎn)。![]()
但如果你順著論文真正想解決的問(wèn)題往下拆,你會(huì)發(fā)現(xiàn),這一次DeepSeek 實(shí)際上是在正面回答一個(gè),過(guò)去兩年幾乎所有大模型公司都在刻意回避的問(wèn)題:
大模型,還能不能繼續(xù)穩(wěn)定地變大?
注意,這里不是“還能不能繼續(xù)變強(qiáng)”,而是“還能不能穩(wěn)定”的變大的問(wèn)題。這是兩個(gè)完全不同的命題。
過(guò)去十年,整個(gè)深度學(xué)習(xí)體系有一個(gè)幾乎沒(méi)人再質(zhì)疑的默認(rèn)前提:只要模型足夠深、足夠?qū)挘灰懔蛿?shù)據(jù)能跟上,訓(xùn)練的效果就一定能出來(lái)。參數(shù)規(guī)模,等于能力上限。這個(gè)邏輯,支撐了從ResNet 到 Transformer,再到今天所有大模型的擴(kuò)張路徑。
但這個(gè)邏輯并不是天然成立的,它背后依賴的,其實(shí)是一項(xiàng)極其關(guān)鍵、卻早已被視為“空氣”的基礎(chǔ)設(shè)施——殘差連接。
如果沒(méi)有殘差連接,今天你看到的所有GPT、Claude、Gemini、LLaMA,根本不可能存在。
關(guān)于殘差連接,我們得把這個(gè)來(lái)龍去脈和底層邏輯說(shuō)清楚。
在殘差連接出現(xiàn)之前,神經(jīng)網(wǎng)絡(luò)一旦加深之后,訓(xùn)練就會(huì)迅速失控。不是算力不夠,而是梯度在層層傳遞中不斷衰減、扭曲,信息根本傳不到該去的地方。這一點(diǎn)工程上表現(xiàn)得非常直觀:loss 不收斂、效果倒退、調(diào)參調(diào)到崩潰。
參差連接的偉大之處,在于它做了一件極其簡(jiǎn)單、卻極其反直覺(jué)的事:
它不要求每一層都必須“學(xué)到東西”,而是允許它什么都不學(xué)。
輸出不再是f(x),而是x + f(x)。
那條“+ x”,就是一條信息的保命通道。
只要這條通道在,哪怕這一層的參數(shù)全錯(cuò),信息至少還能原樣往下走。也正是因?yàn)檫@一點(diǎn),網(wǎng)絡(luò)才第一次具備了“無(wú)限加深”的工程可能性。
換句話來(lái)說(shuō),殘差連接的作用,不是為了提高上限,而是為了防止系統(tǒng)出現(xiàn)崩潰。
![]()
但是,問(wèn)題也恰恰出在這里。
殘差連接就像一條單向的高速公路。當(dāng)模型規(guī)模越來(lái)越大、任務(wù)越來(lái)越復(fù)雜,人們開始逐漸意識(shí)到:這種單一、線性的殘差信息通道,雖然穩(wěn),但可能已經(jīng)不夠用了。
現(xiàn)實(shí)世界的信息處理,從來(lái)不是一條直線。復(fù)雜認(rèn)知一定是多層信息、多路徑并行、交叉作用的結(jié)果。而傳統(tǒng)殘差連接,本質(zhì)上是一條極其干凈、極其保守的高速路,它可以保證不出事故,但是同時(shí)也限制了交通運(yùn)行的復(fù)雜度。
這正是Hyper-Connections(HC)出現(xiàn)的背景。
HC 的出發(fā)點(diǎn),是非常清晰:既然信息不該只在相鄰層之間流動(dòng),那為什么不讓多層之間直接建立連接?讓不同深度的特征充分混合,理論上模型的表達(dá)能力會(huì)大幅提升。
從研究的動(dòng)機(jī)上看,這條路設(shè)是完全正確的選擇。從實(shí)驗(yàn)的直覺(jué)上看,它也確實(shí)有效。但HC 真正的問(wèn)題,不在于“連得多”,而在于它動(dòng)了殘差連接的底座。
為了實(shí)現(xiàn)多層混合,HC 把原本的恒等映射 x → x,變成了 x → W·x。也就是說(shuō)。那條原本不參與學(xué)習(xí)、不容易出錯(cuò)的信息高速路,被強(qiáng)行加上了一個(gè)可學(xué)習(xí)的變換矩陣。
聽(tīng)起來(lái)只是多了一步線性映射,但是這一步,在工程層面,帶來(lái)的變化是巨大的。
因?yàn)橐坏¦ 學(xué)錯(cuò)了,那么信息就不再是“至少能通過(guò)”,而是必然會(huì)被扭曲。原來(lái)殘差連接提供的是“兜底信息機(jī)制”,現(xiàn)在這個(gè)兜底的機(jī)制被拆掉了。
于是你會(huì)看到一個(gè)非常典型的現(xiàn)象:HC 在小模型、小規(guī)模實(shí)驗(yàn)中表現(xiàn)十分亮眼;但是模型一放大、層數(shù)一加深,訓(xùn)練立刻開始變得不穩(wěn)定了。算力越多、參數(shù)越大,問(wèn)題反而暴露得越快。
這其實(shí)暴露了一個(gè)更深層的問(wèn)題:大模型表達(dá)能力的提升,正在侵蝕系統(tǒng)原有的穩(wěn)定性。
于是,這一次,針對(duì)這個(gè)問(wèn)題,DeepSeek 做了一件非常值得玩味,也非常“硬核”的事。
它沒(méi)有否定HC,也沒(méi)有退回傳統(tǒng)殘差連接的安全區(qū),而是直接選擇了一個(gè)從數(shù)學(xué)層面重新立規(guī)矩的路徑。它這次給出的答案,核心思路只有一句話:HC,你可以連得更加復(fù)雜,但你不能破壞信息守恒。
于是,DeepSeek 的mHC 出現(xiàn)了。
DeepSeek 把殘差路徑中的映射矩陣,強(qiáng)行約束到了一個(gè)特定的數(shù)學(xué)空間里——Birkhoff 多面體。這個(gè)空間里所有矩陣,都滿足一個(gè)極其重要的性質(zhì):它們是雙隨機(jī)矩陣。
雙隨機(jī)矩陣如果不用數(shù)學(xué)語(yǔ)言解釋,這到底意味著什么?意味著信息不會(huì)被放大,也不會(huì)被壓縮,只會(huì)在不同通道之間重新分配。意味著信息的“總量”,是被鎖死了。
實(shí)現(xiàn)這一步的工程意義,可以說(shuō)非常直接而重大,因?yàn)闊o(wú)論你怎么設(shè)計(jì)復(fù)雜的信息連接,殘差信息都不會(huì)被破壞;也就意味著無(wú)論模型變得多大,梯度都不會(huì)因?yàn)闅埐盥窂蕉Э亍?/p>
所以,mHC 的本質(zhì),不是讓模型變得更“聰明”,而是讓模型在復(fù)雜化之后,系統(tǒng)依然可控。
具體的實(shí)驗(yàn)結(jié)果,也非常耐人尋味:模型規(guī)模越大,mHC 相對(duì)于傳統(tǒng) HC 的優(yōu)勢(shì)越明顯。那么不得不承認(rèn),這是一個(gè)極其關(guān)鍵的信號(hào),因?yàn)樗f(shuō)明,mHC的解決方案,這不是一個(gè)小技巧,而是一種隨規(guī)模放大的結(jié)構(gòu)優(yōu)勢(shì)。
到這里,如果我們只站在技術(shù)視角來(lái)理解的話,這已經(jīng)是一篇很扎實(shí)的論文了。但如果我們?cè)俅吻袚Q到資本市場(chǎng)的視角,你會(huì)發(fā)現(xiàn),這件事的意義要大得多。
過(guò)去兩年,大模型競(jìng)爭(zhēng)在資本層面的邏輯其實(shí)非常單一:誰(shuí)能拿到更多錢,誰(shuí)能買到更多卡,誰(shuí)就有更大的勝率。
這是一種極端依賴資本投入的競(jìng)爭(zhēng)模式,它的隱含前提是:算力投入的邊際效率始終成立。只要你愿意燒錢,就一定能換來(lái)能力。
而mHC 這類工作的真正沖擊在于:它開始動(dòng)搖這個(gè)前提。因?yàn)橛?xùn)練不穩(wěn)定,本身就是最大的隱性成本。一次失敗的大規(guī)模訓(xùn)練,消耗的不只是算力,還有時(shí)間、團(tuán)隊(duì)節(jié)奏、資本耐心,以及市場(chǎng)的窗口期。
大模型具備更穩(wěn)定的結(jié)構(gòu),到底意味著什么?意味著花同樣的錢,可以換來(lái)的是更確定的結(jié)果;意味著擴(kuò)張不是資本的博弈,而是工程化的決策和手段;意味著大模型的規(guī)模優(yōu)勢(shì),開始從資源壟斷,算力優(yōu)勢(shì),轉(zhuǎn)向“結(jié)構(gòu)設(shè)計(jì)”能力了。
這種情況會(huì)直接改變?nèi)隆5谝唬懔Φ慕^對(duì)優(yōu)勢(shì),會(huì)被結(jié)構(gòu)效率部分對(duì)沖。第二,工程能力,會(huì)重新成為大模型公司的核心壁壘。第三,大模型競(jìng)爭(zhēng)的重心,會(huì)從“誰(shuí)更有錢有卡”,慢慢轉(zhuǎn)向“誰(shuí)更不容易崩”。
從這個(gè)角度看,DeepSeek 這篇論文,真正的價(jià)值不在于 mHC 本身,而在于它所代表的技術(shù)方向選擇。
它沒(méi)有在參數(shù)規(guī)模上,去硬剛美國(guó),也沒(méi)有在應(yīng)用層面追熱點(diǎn),而是提前一步,把注意力放在了一個(gè)更長(zhǎng)期,也更底層的問(wèn)題上:當(dāng)模型繼續(xù)變大的確定性開始下降,新的系統(tǒng)的確定性,到底從哪里來(lái)?
DeepSeek借助mHC,給出的答案,是結(jié)構(gòu)的約束,是工程的理性,是在復(fù)雜系統(tǒng)里主動(dòng)引入“安全邊界”。
這件事,對(duì)DeepSeek 自身的戰(zhàn)略價(jià)值也非常清晰。更穩(wěn)定的訓(xùn)練意味著更低的邊際成本、更高的成功率、更強(qiáng)的開源社區(qū)吸引力。同時(shí)也意味著在下一輪模型繼續(xù)放大之前,DeepSeek已經(jīng)提前卡住了一塊關(guān)鍵的技術(shù)高地。
更重要的是,它釋放了一個(gè)非常明確的信號(hào):中國(guó)的AI 團(tuán)隊(duì),已經(jīng)開始在“規(guī)則層”參與博弈了。
不是繼續(xù)跟隨,不是看淡優(yōu)化,而是嘗試定義,嘗試改變規(guī)則,改變底層邏輯。
所以,如果你把這篇論文放回資本市場(chǎng)的語(yǔ)境里,它討論的從來(lái)不只是殘差連接,而是一個(gè)更宏觀的問(wèn)題:當(dāng)大模型的擴(kuò)張不再只是算力問(wèn)題,誰(shuí)有能力讓系統(tǒng)在更大規(guī)模下依然不崩?這才是下一階段真正決定產(chǎn)業(yè)格局和技術(shù)能力的核心變量。
新的一年剛剛開始,DeepSeek 又一次選擇了不走尋常路。而真正值得關(guān)注的,也從來(lái)不是這一篇論文本身,而是它背后所指向的那條創(chuàng)新路線。
如果說(shuō)過(guò)去的競(jìng)爭(zhēng),是“誰(shuí)能把模型做得更大”,那接下來(lái)的競(jìng)爭(zhēng),很可能會(huì)變成一句話:今后誰(shuí)能把模型,安全地做大。目前來(lái)看,能夠很快掌握這一必殺秘訣的,就是DeepSeek團(tuán)隊(duì)了,就是中國(guó)的AI工程師了。
因此mHC的提出,其實(shí)釋放了一個(gè)很清晰的信號(hào):中國(guó)的AI研發(fā)團(tuán)隊(duì),再次跑到了世界前列,因?yàn)樗麄円呀?jīng)開始在“基礎(chǔ)架構(gòu)層”開始做原創(chuàng)了。
所以,在新的一年剛剛開始之際,DeepSeek 又來(lái)踢館,又來(lái)炸街了,是不是很快,又會(huì)掀起全球的DeepSeek時(shí)刻了?
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.