![]()
DeepSeek、智譜、MiniMax 搶先開席「年夜飯」。
作者 / 企鵝
除夕夜還沒到,「大模型春晚」就已經拉開帷幕。
2 月 11 日,國產選手智譜 AI、MiniMax 與 DeepSeek 幾乎押注同一時間窗口,似乎誰都不想帶著「落后一個代際」的焦慮跨入新年。
昨日多位用戶發現,DeepSeek 在網頁端和 App 端推送了新一輪灰度測試。上下文窗口長度從此前 V3.1 版本的 128K token 增加到 1M token,知識截止日期也從 2024 年 7 月更新至 2025 年 5 月。外界普遍認為這是 V4 正式亮相前的熱身。
隨后,智譜在深夜揭曉了此前以「Pony Alpha」代號并在 OpenRouter 上匿名登頂的神秘模型便是 GLM-5。而在這一周前,「Pony Alpha 到底是誰」的猜測席卷了整個開發者社區,GPT-5 偷跑、Claude 5 內測……各種版本的陰謀論輪番上演。
GLM-5 是智譜新一代的旗艦基座模型,面向 Agentic Engineering 打造。在 Coding 與 Agent 能力上,智譜方表示 GLM-5 已「取得開源 SOTA 表現」。它在真實編程場景的使用體感逼近 Claude Opus 4.5,擅長復雜系統工程與長程 Agent 任務。
與此同時,Minimax 也傳來消息,M2.5 模型的正式上線已提上日程。目前 M2.5 模型已在海外 MiniMax Agent 產品進行內測。有拿到 M2.5 內測資格的人在社交平臺分享了使用感受,稱其是「真正的 SOTA 模型,和 Opus 4.6 打的有來有回」。
![]()
三家此次模型的對比/新物種繪圖
或許這份「春節檔」之爭要從 2025 年的 1 月 20 日說起,DeepSeek 發布的 R1 模型掀起了一場關于算法效率的驚天駭浪。時隔一年,DeepSeek V4 再借灰度測試打開一場「心理戰」,而智譜與 Minimax 在春節前的密集入場,更像是面對「焦慮」順勢而來的「截擊」。
01. DeepSeek:靜默灰度,懸念留給 V4
具體來看,DeepSeek 一步跨到 1M ,對齊了此前 Google Gemini 系列觸及的百萬級門檻。
要知道,128K 大約能處理一本普通小說,而 1M 是它的近 8 倍,理論上可以一次性處理《三體》三部曲這樣體量的超長文本。
同時 DeepSeek 模型的回復風格也有著微妙變化,灰度版模型在自我介紹中將自身回復風格概括為「熱情、細膩,盡可能讓答案對你有幫助」。新版本支持圖片、PDF、Word、Excel、PPT 等多格式文件上傳,支持聯網搜索(需手動開啟),App 端支持語音輸入。
![]()
DeepSeek 模型的「自我介紹」
不過多模態能力仍未加入,這也是社區反饋中的一個「小遺憾」。
早在一個月前,DeepSeek 團隊發布了《Conditional Memory via Scalable Lookup》論文,并開源了對應的實現庫 Engram。核心思路是用條件記憶將知識查找的復雜度壓縮到近似 O(1)。技術路線與這次灰度測試中「超長上下文」的能力方向高度吻合。
同時在 GitHub 的更新中 V4 也初現端倪:其 FlashMLA 倉庫中出現了名為 「Model 1」 的模型標識,在百余個文件中被反復調用。且Model 1 模型的 KV 緩存布局、稀疏性算法及 FP8 解碼方式均與 V3.2 存在顯著差異,明顯像是一次架構級重構而非增量迭代。此前外媒也曾爆料,DeepSeek 計劃于 2 月中旬發布下一代旗艦模型 V4。
02.智譜:Pony馬甲下的GLM-5
相對于DeepSeek的「煙霧彈」,智譜的牌面則明朗得多。
智譜的 GLM-5 采用了 MoE 混合專家架構,總參數量達到 745B(7450 億),大約是上一代 GLM-4.7 的兩倍。包含 256 個專家,每次推理激活其中 8 個,激活參數約 44B,與 DeepSeek V3.2 的 5.4% 基本持平。通過稀疏激活設計,GLM-5 實際推理延遲被控制在了一個可用的水平, 有 WaveSpeed AI 的博主反饋,實際體感上首 token 延遲已接近 30-70B 密集模型的水平。
架構層面,GLM-5 繼承了兩項來自 DeepSeek 的核心技術。
第一是DeepSeek 稀疏注意力(DSA),通過 Lightning Indexer 輕量級組件快速掃描所有歷史 token 并打分,僅挑選相關性最高的 Top-k 個 token 進行完整注意力計算,在處理超長文本時大幅降低計算開銷;其次是多 Token 預測(MTP),提升模型的生成效率。這兩項技術在 vLLM 推理框架的代碼提交中被開源社區發現,GLM-5 的實現邏輯被直接映射到了 DeepSeek-V3 的組件上。
值得注意的是,GLM-5 在編程與 agent 能力直逼 Claude Opus 4.5,但 API 成本卻只有后者的四十分之一。
在業內公認的主流基準測試中取得開源模型最高分數。在 SWE-bench-Verified 和 Terminal Bench 2.0 中分別獲得 77.8 和 56.2 的開源模型最高分數,性能表現超過 Gemini 3.0 Pro。
![]()
GLM-5 性能評測對比圖
在 Agent 能力維度,GLM-5 拿下了開源模型的SOTA表現。
BrowseComp(聯網檢索與信息理解)、MCP-Atlas(工具調用與多步驟任務執行)、τ2-Bench(復雜多工具場景下的規劃與執行)三項評測均為開源最高分。這三項基準覆蓋了 Agentic Engineering 的核心要求:模型不只是能寫代碼、交付工程,還要在長程任務中維持目標一致性,管理資源調度,處理多步驟之間的依賴關系。
換言之,GLM-5 瞄準的不是「能用」,而是「能扛活」的 Agentic Ready 基座。
智譜首席科學家唐杰在 1 月 8 日的內部信中,將 2026 年定義為「全面回歸基礎模型研究」的一年,并明確提出四個聚焦方向:GLM-5 的推出、全新的模型架構設計、更強泛化能力的強化學習(RL),以及對在線學習與持續學習的前瞻布局。受 GLM-5 即將發布的消息刺激,智譜港股在公布前兩日暴漲近 60%。
03.MiniMax:小參數,大野心
同一天,MiniMax 也沒有閑著。
2 月 11 日,MiniMax 向部分用戶開放了 M2.5 的內測資格。
M2.5 的前身是 2025 年 12 月 23 日發布的 M2.1。M2.1 總參數 230B,僅激活 10B,主打多語言編程能力,在 SWE-bench 多語言測試上表現超過了 Claude Sonnet 4.5,但 M2 系列的定價僅為 Claude Sonnet 4.5 的 8%,速度卻快一倍。MiniMax M2(2025 年 10 月正式開源)在 Artificial Analysis 綜合智能基準中拿到了全球開源模型第一的總分。
目前M2.5 的具體參數官方尚未披露。而社區討論主要集中在兩個方面:總參數能否從 M2.1 的 230B 推到 300B 量級,拉近與 GLM-5 在復雜任務上的體感差距;以及MCP工具調用能否真正可靠,M2.1 被用戶普遍反映「不愛調工具」「格式錯誤調不對」,這在 Agent 場景下幾乎是硬傷。
![]()
在 agent 界面已可以選擇 M2.5
MiniMax 在 2026 年初的產品節奏相當密集。1 月 29 日,公司發布了 Music 2.5 音樂大模型和面向長程陪伴場景的 M2-her 模型。Music 2.5 憑借段落級強控制和物理級高保真技術,更是被國內的一家科技媒體稱為「AI 界的格萊美」。加上此前推出的 Agent Desktop 桌面端、Hailuo 2.3 視頻模型,MiniMax 的多模態生態正在快速補齊。
從競爭策略看,MiniMax 走的是一條與智譜截然不同的路。
智譜用 745B 的參數規模證明「中國也能做前沿級大模型」,MiniMax 則堅持用極小的激活參數(10B 量級)去逼近大模型的天花板。創始人閆俊杰在多個場合強調「Intelligence with Everyone」的愿景,即讓更多人以更低的成本獲得 AI 能力的加持。
04.「春節檔」之爭
去年春節,DeepSeek R1 的橫空出世改變了全球 AI 競爭格局。今年業內也在觀望:誰會復刻 R1 的輝煌?
從 2 月11 日來的信息密度來看,答案或許不是某一個模型,可能是屬于集體的質變。
智譜用一周的匿名測試和一夜的正式揭幕,把 GLM-5 送上了 OpenRouter 熱度榜首,在 BrowseComp、MCP-Atlas 等 Agent 基準上交出了與 Claude Opus 4.5 正面交手的成績單;DeepSeek 沒有發布會、沒有博客,只用一次靜默的灰度更新便將上下文推到百萬 token 量級,留下的懸念比答案更多;而 MiniMax 還沒亮出 M2.5 的全部底牌,但 M2 系列一直堅持的方向很明確:用盡可能小的激活參數,把性價比壓到極限。這條路能走多遠,M2.5 是一次關鍵檢驗。
除夕夜還沒到,但大模型的「年夜飯」已經端上了桌。至于誰是這桌上的「主菜」,我們可以等藏在后廚里的其他「硬菜」揭曉后,再做定奪。
![]()
頭圖來源 / 三國演義
排版運營 /Teagan
- End -
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.