![]()
![]()
![]()
中國(guó)大模型進(jìn)入系統(tǒng)能力競(jìng)爭(zhēng)
基礎(chǔ)模型正在迅速成為一種高度同質(zhì)化的技術(shù)供給。參數(shù)規(guī)模可以追趕,訓(xùn)練數(shù)據(jù)可以擴(kuò)充,榜單成績(jī)可以刷新,甚至模型架構(gòu)也可以在較短時(shí)間內(nèi)被復(fù)現(xiàn)。在這樣的競(jìng)爭(zhēng)環(huán)境中,一個(gè)沒有明確技術(shù)壁壘、成本優(yōu)勢(shì)、應(yīng)用閉環(huán)或生態(tài)控制力的基礎(chǔ)模型,很難擁有真正的長(zhǎng)期價(jià)值。沒有護(hù)城河的基礎(chǔ)模型,最終只能陷入?yún)?shù)競(jìng)賽、價(jià)格競(jìng)爭(zhēng)和能力同質(zhì)化,也就很難擁有獨(dú)立的未來(lái)。
因此,判斷一家大模型公司的競(jìng)爭(zhēng)力,已經(jīng)不能只看它發(fā)布了多少參數(shù)、刷新了多少榜單,或者在某幾項(xiàng)測(cè)試中超過了誰(shuí)。真正重要的問題是:它是否形成了一種競(jìng)爭(zhēng)對(duì)手難以在短期內(nèi)復(fù)制的系統(tǒng)能力?這種能力可能來(lái)自底層架構(gòu)與推理效率,也可能來(lái)自長(zhǎng)周期 Agent 訓(xùn)練、國(guó)產(chǎn)算力適配、多模態(tài)交互能力,或者覆蓋模型、工具、開發(fā)者與企業(yè)應(yīng)用的完整生態(tài)。
從目前的中國(guó)大模型格局看,真正開始形成差異化護(hù)城河的基礎(chǔ)模型,主要集中在三條路線:DeepSeek 的效率與長(zhǎng)上下文工程,GLM 的 Agentic Engineering 和國(guó)產(chǎn)技術(shù)棧,以及 Qwen 的模型生態(tài)、多模態(tài)能力與平臺(tái)化布局。
2026 年 2 月至 5 月,短短四個(gè)月內(nèi),中國(guó)大模型賽道接連迎來(lái)三款重要模型:2 月,智譜 AI 發(fā)布 GLM-5.2;4 月,DeepSeek 推出 DeepSeek-V4;5 月 20 日,阿里通義千問在阿里云峰會(huì)上發(fā)布 Qwen3.7。三個(gè)模型分別代表了三種不同的技術(shù)哲學(xué),也意味著中國(guó)大模型的競(jìng)爭(zhēng)邏輯正在發(fā)生根本變化。
DeepSeek、GLM 和 Qwen 不只是圍繞參數(shù)規(guī)模、榜單分?jǐn)?shù)和對(duì)話能力展開橫向競(jìng)爭(zhēng),而逐漸開始在推理效率、長(zhǎng)上下文、Agent 能力、多模態(tài)理解、訓(xùn)練基礎(chǔ)設(shè)施和工程部署上建立各自的縱深優(yōu)勢(shì)。中國(guó)大模型由此進(jìn)入了一個(gè)新的階段:競(jìng)爭(zhēng)的重心轉(zhuǎn)移到誰(shuí)能夠圍繞基礎(chǔ)模型構(gòu)建一條足夠深、足夠?qū)挘沧銐螂y以復(fù)制的系統(tǒng)護(hù)城河。
![]()
DeepSeek 押注極致的長(zhǎng)上下文效率——1M token 全線標(biāo)配,但單 token 推理計(jì)算量降低很多。GLM-5.2 押注 Agent 工程和國(guó)產(chǎn)化——從第一天起就適配 7 大國(guó)產(chǎn)芯片平臺(tái),構(gòu)建了完全異步的 RL 訓(xùn)練框架。Qwen 則經(jīng)歷了一次最激進(jìn)的架構(gòu)革命——從 Qwen3.5 起用線性注意力替代了 75%的標(biāo)準(zhǔn)注意力層,并在 Qwen3.7 Plus 中首次實(shí)現(xiàn)了跨文本、圖像、代碼的全域思考。這一輪變化的核心,從模型是否更大向著模型是否更能執(zhí)行復(fù)雜任務(wù)轉(zhuǎn)變。
長(zhǎng)上下文讓模型能夠處理完整代碼庫(kù)、長(zhǎng)文檔和多輪任務(wù)歷史;推理模式讓模型能夠在復(fù)雜問題中進(jìn)行更穩(wěn)定的分解和驗(yàn)證;Agent 能力讓模型從回答問題走向調(diào)用工具、執(zhí)行代碼和持續(xù)修正;多模態(tài)能力則讓模型進(jìn)入更接近真實(shí)世界的交互場(chǎng)景。因此,2026 年的中國(guó)大模型已進(jìn)入新的范式競(jìng)爭(zhēng),未來(lái)的關(guān)鍵不再只是模型有多大、分?jǐn)?shù)有多高,是誰(shuí)能在效率、推理、工具調(diào)用、多模態(tài)和部署生態(tài)之間形成更完整的系統(tǒng)能力。
DeepSeek-V4:把長(zhǎng)上下文做成可部署能力
DeepSeek-V4 把長(zhǎng)上下文推理從展示能力變成可部署能力。很多模型都可以在參數(shù)表上寫出很長(zhǎng)的上下文窗口,但真正困難的是,在百萬(wàn)級(jí) token 場(chǎng)景下,模型是否還能保持穩(wěn)定推理、可控延遲和合理成本。DeepSeek-V4 試圖解決的正是這個(gè)問題。
![]()
DeepSeek-V4 最核心的變化,是把長(zhǎng)上下文能力做成了一套系統(tǒng)工程。傳統(tǒng)自注意力在長(zhǎng)序列下會(huì)迅速遇到計(jì)算和顯存瓶頸,序列越長(zhǎng),成本越難控制。DeepSeek-V4 通過 CSA 與 HCA 結(jié)合的混合注意力結(jié)構(gòu),將近鄰信息、中長(zhǎng)距離依賴和超長(zhǎng)距離上下文分層處理,用壓縮、稀疏選擇和全局建模來(lái)降低百萬(wàn)級(jí)上下文的計(jì)算負(fù)擔(dān)。
這種設(shè)計(jì)的關(guān)鍵在于,長(zhǎng)上下文并不等于讓每一個(gè) token 都和全部歷史信息充分交互。真實(shí)任務(wù)中,大部分信息只在局部范圍內(nèi)相關(guān),只有少數(shù)關(guān)鍵內(nèi)容需要跨越長(zhǎng)距離被重新調(diào)用。DeepSeek-V4 的稀疏化和壓縮機(jī)制,正是為了把計(jì)算資源集中到更重要的上下文位置上,讓百萬(wàn)級(jí)上下文從參數(shù)表上的窗口變成更接近實(shí)際部署的能力。
![]()
因此,DeepSeek 的路線可以概括為效率工程驅(qū)動(dòng)的前沿推理模型。它沒有把重點(diǎn)放在多模態(tài)擴(kuò)張或概念包裝上,而是集中解決長(zhǎng)上下文、高并發(fā)和低成本推理中的工程瓶頸。DeepSeek-V4 最值得關(guān)注的地方,不只是 1M token 或萬(wàn)億級(jí) MoE,而是它把模型能力、注意力機(jī)制、推理成本和 Agent 場(chǎng)景放在同一個(gè)系統(tǒng)中重新設(shè)計(jì),代表了一種更務(wù)實(shí)的大模型進(jìn)化方向。
GLM-5.2:從 Vibe Coding 到 Agentic Engineering
GLM-5.2 的定位非常明確,它不做最長(zhǎng)上下文,不做最多語(yǔ)言,甚至不做多模態(tài)。它把所有籌碼壓在了一個(gè)方向上:讓模型真正像一個(gè)軟件工程師一樣工作。它試圖把大模型從輔助寫代碼的工具,推進(jìn)到能夠參與復(fù)雜軟件工程的智能體系統(tǒng)。代碼生成只是起點(diǎn),真正的難點(diǎn)在于長(zhǎng)周期任務(wù)執(zhí)行。一個(gè)工程問題往往不只是補(bǔ)全函數(shù),而是需要理解代碼庫(kù)結(jié)構(gòu)、定位缺陷、跨文件修改、調(diào)用終端、驗(yàn)證結(jié)果,并在多輪失敗后重新調(diào)整方案。GLM-5.2 的技術(shù)路線,正是圍繞這種復(fù)雜工作流展開的。
![]()
GLM-5.2 的另一個(gè)關(guān)鍵改動(dòng),是引入 DSA 動(dòng)態(tài)稀疏注意力,用更低的訓(xùn)練和推理成本維持長(zhǎng)上下文能力。真實(shí)工程任務(wù)通常包含大量代碼、日志、依賴關(guān)系和歷史對(duì)話,如果仍然依賴傳統(tǒng)注意力機(jī)制,成本會(huì)隨著上下文長(zhǎng)度迅速上升。DSA 的意義在于,讓模型在長(zhǎng)序列中更有選擇地分配注意力資源,從而把長(zhǎng)上下文能力和 Agent 工作流結(jié)合起來(lái)。
更重要的是后訓(xùn)練方式的變化。GLM-5.2 采用面向長(zhǎng)周期任務(wù)的異步強(qiáng)化學(xué)習(xí)框架,將生成軌跡和模型訓(xùn)練解耦。傳統(tǒng)同步訓(xùn)練容易被長(zhǎng)尾任務(wù)拖慢,因?yàn)椴煌?Agent 任務(wù)的執(zhí)行時(shí)間差異很大,有的很快完成,有的會(huì)卡在測(cè)試、搜索或多輪工具調(diào)用中。異步框架讓推理端持續(xù)生成任務(wù)軌跡,訓(xùn)練端周期性更新模型,減少等待和空轉(zhuǎn),使模型能夠從更復(fù)雜、更長(zhǎng)鏈路的交互中學(xué)習(xí)。
![]()
因此,它代表的是一種以 Agentic Engineering 為核心的模型路線:模型不再只是回答者,而是逐步成為能夠參與工程流程的執(zhí)行者。從企業(yè)應(yīng)用角度看,這條路線非常重要。未來(lái)大模型真正進(jìn)入生產(chǎn)系統(tǒng),關(guān)鍵不只是會(huì)聊天,而是能否接入代碼倉(cāng)庫(kù)、文檔系統(tǒng)、終端環(huán)境、CI/CD 流程和內(nèi)部工具鏈。GLM-5..2強(qiáng)調(diào)的正是這種能力。它把模型能力、訓(xùn)練基礎(chǔ)設(shè)施、工具調(diào)用和工程環(huán)境放在同一個(gè)框架里處理,體現(xiàn)了大模型從對(duì)話智能走向任務(wù)智能的轉(zhuǎn)變。
Qwen3.7:線性注意力革命與全域思考
Qwen 的故事是三個(gè)模型中變化最劇烈的。從 Qwen3 到 Qwen3.7,短短一年內(nèi)經(jīng)歷了一次根本性的架構(gòu)變革。理解 Qwen3.7,必須先理解中間那一步——Qwen3.5。
Qwen3.5 是 Qwen 系列從通用語(yǔ)言模型走向原生多模態(tài) Agent 的重要節(jié)點(diǎn)。它的核心變化在于架構(gòu)、模態(tài)融合和工程效率上同時(shí)推進(jìn),使模型更適合長(zhǎng)上下文、多模態(tài)理解和復(fù)雜任務(wù)執(zhí)行。第一,Qwen3.5 延續(xù)了 Qwen3-Next 以來(lái)的混合注意力路線,將 Gated Delta Networks 引入主干架構(gòu),在部分層中用線性注意力替代傳統(tǒng)自注意力,從而降低長(zhǎng)上下文推理時(shí)的計(jì)算和 KV cache 開銷。第二,Qwen3.5 更強(qiáng)調(diào)原生多模態(tài)建模。第三,Qwen3.5 進(jìn)一步擴(kuò)展了模型生態(tài)和語(yǔ)言覆蓋。
![]()
Qwen3.7 的重點(diǎn)不應(yīng)理解為單一架構(gòu)突破,而應(yīng)理解為 Qwen 系列向 Agent 平臺(tái)化能力的繼續(xù)推進(jìn)。Qwen3.7-Max 面向文本推理、代碼任務(wù)、辦公工作流和長(zhǎng)周期 Agent 執(zhí)行,支持 1M token 上下文,更適合作為復(fù)雜任務(wù)執(zhí)行中的主干模型,這里的關(guān)鍵在于它能否在連續(xù)任務(wù)中保持上下文、保留推理狀態(tài),并在多次工具調(diào)用和反饋迭代中維持一致的目標(biāo)。Qwen3.7-Plus 則進(jìn)一步支持文本、圖像和視頻輸入,面向多模態(tài)理解和生產(chǎn)力場(chǎng)景,把視覺理解納入 Agent 工作流,面向屏幕理解、圖文任務(wù)、瀏覽器操作、GUI 交互和生產(chǎn)力場(chǎng)景進(jìn)行擴(kuò)展。隨著 AI Agent 從命令行和代碼環(huán)境走向真實(shí)軟件界面,模型需要理解的不再只是文本指令,還包括網(wǎng)頁(yè)、表格、按鈕、圖像、截圖和多模態(tài)文檔。
![]()
從技術(shù)趨勢(shì)看,Qwen 的優(yōu)勢(shì)在于生態(tài)完整性。一個(gè)模型再?gòu)?qiáng),也很難覆蓋所有部署場(chǎng)景;而 Qwen 更像是在構(gòu)建一組互補(bǔ)模型,讓用戶可以根據(jù)任務(wù)復(fù)雜度、成本預(yù)算、輸入模態(tài)和部署環(huán)境選擇合適的能力層級(jí)。對(duì)于企業(yè)應(yīng)用來(lái)說(shuō),這種模型族思路比單一旗艦更容易落地,因?yàn)檎鎸?shí)業(yè)務(wù)往往同時(shí)需要高性能推理、低成本調(diào)用、多模態(tài)輸入、代碼能力和穩(wěn)定 API。因此,Qwen3.7 最值得關(guān)注的地方是它試圖把大模型變成一個(gè)可接入真實(shí)應(yīng)用系統(tǒng)的智能中樞。它把模型能力、工具調(diào)用、多模態(tài)理解和開發(fā)生態(tài)放在同一條主線上,體現(xiàn)了大模型從基礎(chǔ)模型走向應(yīng)用平臺(tái)的趨勢(shì)。
![]()
系統(tǒng)和環(huán)境是新的加速度
把 DeepSeek-V4、GLM-5.2 和 Qwen3.7 放在一起看,可以看到一個(gè)清晰變化:大模型競(jìng)爭(zhēng)正在從單點(diǎn)能力轉(zhuǎn)向系統(tǒng)能力。過去評(píng)估一個(gè)模型,更多看參數(shù)規(guī)模、通用榜單、對(duì)話流暢度和知識(shí)覆蓋;現(xiàn)在更關(guān)鍵的是,它能否在長(zhǎng)上下文中穩(wěn)定工作,能否在復(fù)雜任務(wù)中持續(xù)推理,能否調(diào)用工具并根據(jù)反饋修正,能否和真實(shí)軟件、文檔、代碼庫(kù)、瀏覽器和多模態(tài)界面連接起來(lái)。
我們能清晰地看到如下幾點(diǎn)趨勢(shì):
Agent 能力正在成為新的主戰(zhàn)場(chǎng)。大模型的價(jià)值更多在于調(diào)用工具、讀取文件、修改代碼、運(yùn)行測(cè)試、理解界面,并在多輪反饋中持續(xù)修正和完成任務(wù)。
模型競(jìng)爭(zhēng)正在延伸到后訓(xùn)練、多模態(tài)和生態(tài)部署。強(qiáng)化學(xué)習(xí)、蒸餾、可驗(yàn)證環(huán)境、多模態(tài)交互、芯片適配、API 穩(wěn)定性和開源生態(tài),正在共同決定一個(gè)模型能否真正進(jìn)入生產(chǎn)系統(tǒng)。
長(zhǎng)上下文逐漸變成重要的基礎(chǔ)設(shè)施能力。模型的長(zhǎng)下文能力是支撐代碼倉(cāng)庫(kù)理解、長(zhǎng)文檔分析、多輪任務(wù)執(zhí)行和復(fù)雜 Agent 工作流的底層條件。
模型架構(gòu)正在圍繞效率重新設(shè)計(jì)。傳統(tǒng)注意力機(jī)制在長(zhǎng)序列場(chǎng)景中成本過高,因此壓縮注意力、動(dòng)態(tài)稀疏注意力、線性注意力和 MoE 稀疏激活正在成為新一代大模型的關(guān)鍵工程路線。
推理模式更加可控。模型開始通過思考模式、推理預(yù)算、反思機(jī)制和任務(wù)模式控制,讓用戶能夠在速度、成本和準(zhǔn)確性之間進(jìn)行權(quán)衡。
![]()
沒有護(hù)城河的基礎(chǔ)模型,沒有獨(dú)立的未來(lái)
DeepSeek-V4、GLM-5.2 和 Qwen3.7 所代表的,并不只是三版模型之間的競(jìng)爭(zhēng),也象征著中國(guó)基礎(chǔ)模型正在形成的三種護(hù)城河。
DeepSeek 試圖建立的是一條以架構(gòu)創(chuàng)新、長(zhǎng)上下文效率和低成本推理為核心的技術(shù)護(hù)城河。它的關(guān)鍵價(jià)值,不只是把上下文窗口擴(kuò)展到百萬(wàn) token,而是通過稀疏注意力、上下文壓縮和系統(tǒng)級(jí)推理優(yōu)化,使超長(zhǎng)上下文真正具備部署價(jià)值。在模型能力越來(lái)越容易趨同的情況下,更低的訓(xùn)練成本、更高的推理效率和更強(qiáng)的工程可擴(kuò)展性,本身就是最直接的競(jìng)爭(zhēng)壁壘。
GLM 建立的則是一條以 Agentic Engineering、長(zhǎng)周期強(qiáng)化學(xué)習(xí)和國(guó)產(chǎn)算力適配為核心的工程護(hù)城河。它關(guān)注的是模型能否進(jìn)入真實(shí)的軟件工程環(huán)境,持續(xù)調(diào)用工具、修改代碼、驗(yàn)證結(jié)果,并在復(fù)雜任務(wù)鏈路中完成閉環(huán)。同時(shí),對(duì)國(guó)產(chǎn)芯片、訓(xùn)練框架和企業(yè)環(huán)境的深度適配,使其優(yōu)勢(shì)不只停留在模型層,而是延伸到基礎(chǔ)設(shè)施和產(chǎn)業(yè)部署層。
Qwen 形成的是一條以模型族、多模態(tài)能力、開發(fā)者生態(tài)和云平臺(tái)為核心的平臺(tái)護(hù)城河。它并不依賴單一旗艦?zāi)P透采w全部需求,而是通過不同規(guī)模、不同模態(tài)和不同部署方式的模型組合,覆蓋從端側(cè)應(yīng)用到云端推理、從文本生成到代碼、多模態(tài)理解和 Agent 執(zhí)行的完整鏈路。對(duì)于企業(yè)和開發(fā)者而言,這種生態(tài)完整性意味著更低的接入成本、更豐富的應(yīng)用選擇和更穩(wěn)定的長(zhǎng)期支持。
這三條路線說(shuō)明,中國(guó)大模型的競(jìng)爭(zhēng)已經(jīng)跨過了單純模仿和參數(shù)追趕的階段。未來(lái)的勝負(fù),不會(huì)由某一次榜單領(lǐng)先決定,也不會(huì)由某一項(xiàng)能力的短期突破決定,而取決于模型能否把架構(gòu)、數(shù)據(jù)、后訓(xùn)練、推理系統(tǒng)、Agent 框架、硬件適配和開發(fā)者生態(tài)組織成一個(gè)相互強(qiáng)化的整體。
基礎(chǔ)模型的能力會(huì)不斷擴(kuò)散,標(biāo)準(zhǔn)能力會(huì)不斷商品化,今天看似領(lǐng)先的參數(shù)和分?jǐn)?shù),也可能在幾個(gè)月后成為行業(yè)標(biāo)配。真正不會(huì)輕易消失的,是經(jīng)過長(zhǎng)期積累形成的成本結(jié)構(gòu)、工程體系、數(shù)據(jù)閉環(huán)、應(yīng)用入口和生態(tài)網(wǎng)絡(luò)。
因此,基礎(chǔ)模型市場(chǎng)最終不會(huì)容納大量缺乏差異化的參與者。沒有護(hù)城河的基礎(chǔ)模型,只會(huì)成為可替代的能力供應(yīng)商;只有建立起系統(tǒng)級(jí)護(hù)城河的模型,才可能成為下一代人工智能基礎(chǔ)設(shè)施。
Ref:
http://api-docs.deepseek.com/news/news260424/
https://z.ai/blog/glm-5.2
https://qwen.ai/blog?id=qwen3.7
作者: Wang Shijie
![]()
![]()
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.