出品 | 網易智能
作者 | 小小
編輯 | 王鳳枝
DeepSeek又一次引發海外開發者熱議,連馬斯克都在X上關注了它。
![]()
7月31日,DeepSeek正式開放V4 Flash API公測。官方公布的測試結果顯示,新版本在多個智能體基準測試中大幅超過此前的V4-Pro Preview。
![]()
真正讓開發者興奮的,并不只是一次科技圈圍觀,而是DeepSeek V4 Flash走出的路線:
在保持2840億總參數規模、單Token激活130億參數和100萬Token上下文窗口的基礎上,通過后訓練優化提升智能體與代碼能力。
更關鍵的是,它把這種能力壓到了一個極低的價格區間。
V4 Flash每百萬未命中緩存輸入Token僅1塊錢,輸出Token 2塊錢;緩存命中輸入成本更低至2分錢。 海外開發者實測中,單次任務調用成本甚至低至0.0005美元,與部分競品拉開了數量級差距。
這也是DeepSeek V4 Flash真正引發關注的原因:
它不只是又一個"便宜能用"的模型,而是在嘗試證明,接近前沿水平的智能體能力,也可以用遠低于傳統旗艦模型的成本運行。
官方同時明確表示,本次更新僅升級DeepSeek-V4-Flash API,V4 Pro API與客戶端維持不變,V4 Pro正式版即將發布。
![]()
當OpenAI、Anthropic等頭部實驗室仍在圍繞更強模型和更高算力投入競爭時,DeepSeek正在重新提出另一個問題:
前沿智能,究竟應該賣多少錢?
01馬斯克關注之后,海外社區為何熱議
"馬斯克需要親自試試V4 Flash。它就像魔法一樣。"
這句話最初來自X上的開發者討論。
隨著這句話傳播,網友發現,埃隆·馬斯克真的關注了DeepSeek官方賬號。這一細節迅速在海外社區引發討論。
有網友認為,馬斯克與DeepSeek在推動AI技術發展、探索科學突破方面存在一些共同點;也有人開始猜測未來可能出現合作。
當然,更多開發者選擇用玩笑回應。有人調侃下一代編程模型Composer 3.5可能會基于DeepSeek構建;還有網友直接調侃Grok:
"我猜他要買下DeepSeek。你說呢Grok,你的爹要給你買個小弟弟嗎?"
這些玩笑背后,是海外開發者對V4 Flash的真實興趣:他們關注的不是一次社交媒體熱搜,而是這個模型是否正在改變AI開發的成本結構。
02基準壓測:官方數據與第三方驗證怎么說
評估一次后訓練的成效,最直接的辦法就是看標準化測試集上的量化表現。
官方公布的基準測試中,V4 Flash在模擬真實命令行環境操作的Terminal Bench 2.1(82.7分)、網絡安全攻防Cybergym(76.7分)以及復雜API協同Toolathlon Verified(70.3分)等智能體場景中均表現上佳。
而在代碼工程化與復雜軟件重構領域(如NL2Repo與DeepSWE),它同樣取得了較好成績,甚至在其內部的全棧難題測試集(DSBench-Hard)中拿下59.6分。
![]()
官方解釋稱,這套代碼智能體表現是在最大努力級別與特定采樣參數下跑出的。這種"小體積、高智商"的突破,直接打破了傳統大模型"參數越龐大、智能體表現才越強"的固有認知。
第三方權威測評機構的交叉驗證,進一步補充了該模型的表現細節。
測評機構Artificial Analysis在Intelligence Index智能指數測試中給予V4 Flash 50分的成績,這一分數比上代模型提升10分,領先V4 Pro預覽版6分,甚至追平了Gemini 3.6 Flash,并與GPT-5.6 Luna、GLM-5.2等模型接近。
![]()
在運行效率與輸出質量方面,Artificial Analysis的測試表明,V4 Flash跑完整個智能指數消耗了2.06億個輸出Token,相比前代的2.34億個下降12%。
同時,該模型在AA-Omniscience事實準確率與抗幻覺評估中的表現提升了12個百分點,展現出更好的上下文理解能力。
![]()
在評估真實世界智能體任務的GDPval-AA v2中,V4 Flash拿下1559的Elo評級,在開源權重模型中僅次于Kimi K3,超越了GLM-5.2。
而在Arena.ai前端代碼競技場中,DeepSeek-V4-Flash-High拿下1586分,位列競技場第七名、開源模型第三名,較前代提升154分。
結合其首token延遲(TTFT)與吞吐量(TPS)表現,憑借98% 的緩存折扣,V4 Flash單任務執行成本比打折后的GPT-5.6 Luna還低60%。
Arena.ai評價指出,V4 Flash在前端代碼與智能體領域重新塑造了"價格—質量"層面的帕累托前沿。
![]()
03開發者工程實測:150倍價差下的極致性價比
隨著公測展開,開發者社區涌現出大量實操壓測,V4 Flash在真實Terminal智能體、Canvas前端渲染以及跨模型工作流中的表現被多角度呈現。
在最直觀的極限性價比層面,科技分析師 @RoundtableSpace在對比發布時間僅相隔七天的Opus 5時觀察到,盡管Opus 5能一次完成復雜任務,而DeepSeek需要經過三次迭代嘗試,但Opus輸出了長達3000行代碼,DeepSeek用約900行精簡代碼就達到了目的,且單次嘗試成本僅約1美分。
![]()
科技博主 @SciTechera也援引數據進一步驗證,在Terminal-Bench 2.1上,V4 Flash完成單個基準任務的估計花費僅為0.03美元, 相比高價旗艦模型展現出了極強的成本壓制。
而當脫離極端高價模型、轉而對比同預算檔位的競品時,V4 Flash依然保持了品質上的小幅領先。
在前瞻性的前端與動態交互測試中,開發者 @stevibe將降價后的OpenAI GPT-5.6 Luna與V4 Flash放在一起對比。
在3D魔方旋轉測試中,DeepSeek的貼紙與旋轉表現流暢,而Luna出現了貼紙位置錯位的問題;在煙花爆破綻放效果中,Luna出現較明顯的卡頓;而在筆寫"Hello"草書的動態渲染上,Luna直接渲染為靜態圖像,DeepSeek則完成了動態草書軌跡。
@stevibe認為,在相同的預算檔位下,DeepSeek的綜合渲染表現略勝一籌。
![]()
除了直接對抗,面對V4 Flash暫未原生接入視覺輸入的短板,開發者們探索出了具有實操價值的"跨模型組合"工作流。
前端開發者 @hqmank在重建3D地球儀表板測試中,先讓Kimi K3讀取參考圖像并提取布局與顏色規范,再將結構化文本轉交給V4 Flash進行代碼生成。實測結果顯示,布局與間距被較好還原,而整體輸出成本遠低于完全調用頂級多模態模型。
![]()
這種靈活的生態配合,最終落腳于工業級智能體開發的成本賬單上。
Bold Metrics CTO摩根·林頓(Morgan Linton)在VulcanBench測試后指出,V4 Flash在中等努力水平(Medium Effort)下的表現極其穩定,成功擊敗了Grok 4.5、Fable 和ChatGPT。
對于需要成千上萬次API 調用的工業級智能體工作流而言,這種極低的價格讓大批量自動化試錯第一次具備了財務可行性。
![]()
大模型測評團隊 @CommandCodeAI 在相同的游戲設計提示詞測試中發現,Kimi K3與GLM 5.2表現出色,單次調用花費分別為0.0740美元和0.0480美元;而DeepSeek V4 Flash 雖在邊緣細節上略顯粗糙,但單次調用的實際賬單僅為0.0005美元,便宜了整整150倍。
![]()
硬件與模型設計師 @bookwormengr 體驗后感嘆,V4 Flash 在如此小巧的體積和極低成本下展現出的知識密度簡直如同"巫術", 雖然UI 和視覺交互體驗上仍可向月之暗面借鑒,但其底層智力產出已足夠令人震撼。
![]()
盡管V4 Flash 在性價比與常態代碼補全上表現優異,但客觀的工程壓測中,它也暴露出了一定的技術邊界:
首先,在極高難度的推理與算法突破場景中,Flash 模型的表現依然受限于其激活參數規模。 軟件開發者 @OmedVibeCodes 在深度基準壓測后指出,面對頂級模型(如GPT-5.6 Sol、Kimi K3等)時,V4 Flash 在處理極其復雜的長邏輯鏈求解上仍有明顯差距。
其次,在特定測試套件的兼容性上,@OmedVibeCodes 觀察到Pi 套件在DeepSeek 上的運行表現遜于 OpenCode,顯示出不同基準下的適配差異。
此外,當前 V4 Flash 尚不支持原生的多模態視覺輸入,處理圖文混排任務時仍需借助外部模型進行前置解析。
因此,在真實的生產架構中,V4 Flash 更適合承擔80% 高頻、常態化任務的基礎引擎角色,而極端復雜的難題仍需交由規模更大的旗艦模型處理。
04灰度中的 V4 Pro 提前亮相:"礦泉水摻頂級茅臺"
在 Flash 模型憑性價比引發關注的同時,正在小范圍灰度測試的旗艦模型 V4 Pro GA 正式版也引發了討論。
開發者 @BoxMrChen 僅用4行提示詞,要求模型融合《我的世界》與《無人深空》的核心機制編寫一款 Web 網頁游戲。V4 Pro 經過深度推理,以約0.1美元的 Token 成本生成了包含任務樹系統、物品合成邏輯與資源采集的可玩游戲。
![]()
開發者 @mirochill 在復雜 Bug 修復測試中表示,針對《魷魚游戲》機制的代碼構建中,V4 Pro 只經歷2次自我迭代就修復了深層邏輯缺陷,連續輸出3000行代碼,總成本僅0.12美元,表現足以正面抗衡 Fable 5和 GPT-5.6 Sol。
![]()
開發者 @Waguri_Kaoruko8補充稱,新版 V4的推理思維鏈(CoT)能夠自動梳理出"編寫主要場景代碼……""生成核心邏輯……"等節點,可讀性有所提升。
![]()
然而,V4 Pro 展現出的生成能力,也在社區內引發了爭議。
科技媒體 @TechFlowPost 報道稱,有部分開發者稱在調用 V4 Pro 生成復雜大廠級別代碼時,發現其輸出風格與某些高價旗艦模型(例如 Claude Fable 5)存在相似之處,甚至有用戶稱觸發了疑似特定高價模型風格的安全拒絕響應,從而引發了后臺是否采用了混合路由機制的猜測。
社區調侃該現象為"礦泉水瓶里摻茅臺"。 需要指出的是,上述安全響應細節目前多為社區反饋,尚無官方的進一步復現說明。
![]()
面對社區的種種猜想,技術專家 @TeksCreate 從架構層面給出了分析。
V4 Pro 擁有1.6萬億的總參數規模(推理時單 Token 激活490億),采用 MoE 混合專家架構。 其核心改進在于引入了混合注意力系統,將歷史壓縮(CSA)、超長文本壓縮(HCA)與全保真跟蹤(SWA)結合,使處理100萬上下文時的計算量降至前代的27%,KV 緩存占用也大幅下降。
在性能上,V4 Pro 在 Codeforces 跑出3206分,SWE-bench Verified 達80.6%,1M 長上下文檢索 MRCR 達83.5%。 @TeksCreate 認為,這些架構創新證明 V4 Pro 本身具備獨立達到該水平的技術條件。至于模型在實際部署中是否使用了混合路由,在官方明確回應之前尚無定論。
![]()
05宏觀市場重構:更多人負擔得起的前沿 AI 生產力
從 V4 Flash 的正式公測到 V4 Pro 正式版的灰度亮相,DeepSeek 掀起的定價風暴正在全球開發者生態與市場預期中引發連鎖反應。
對比當下主流廠商的定價策略,V4 Flash 每百萬輸入/輸出 Token 0.14/0.28美元的價格,不僅讓打折后的 GPT-5.6 Luna(輸入0.20美元/輸出1.20美元)感到巨大壓力,更是對 Anthropic Haiku 4.5(輸入1美元/輸出5美元)形成了輸入端便宜7倍、輸出端便宜18倍的優勢。
預測市場平臺 Polymarket 的分析者 @goodworse 認為,V4 Flash 的出現將迫使前沿 AI 服務的綜合使用成本進一步降低。
![]()
0xSupergemma 創始人宋駿(Jun Song)從全球經濟視角分析指出,全球有相當龐大的低收入群體與初創團隊無法直接承擔高昂的模型訂閱費。DeepSeek 極低 API 定價的意義,在于能夠通過下游開發者轉化為極其便宜的 SaaS 工具、應用與服務,間接讓更廣泛的終端用戶享受技術紅利,成為降低 AI 生產力門檻的重要選項之一。
![]()
《財富》雜志分析指出,DeepSeek V4的研發與發布與華為底層芯片生態進行了緊密適配。 隨著華為昇騰系列處理器軟硬件協同效率的提升,未來模型推理成本還有進一步下探的空間。DeepSeek 展現出的成本優勢,背后是算法架構重構與本土硬件生態適配共同作用的結果。
結語
綜合官方測試集數據、權威第三方交叉驗證以及一線開發者的真實反饋,DeepSeek V4 Flash 展現出的核心價值,并不在于要在每一個實驗室單項榜單上都拿下第一,而在于它以一種務實的方式,重構了智能體與代碼開發中的成本賬單。
在現代智能體軟件工程中,一個看似簡單的自然語言指令,往往需要拆解為意圖理解、環境感知、文件檢索、工具調用以及多次代碼生成與自我修正,調用的乘數效應會瞬間放大 Token 消耗。
V4 Flash 在中等努力水平下的穩定性、對 Codex 接口的無縫集成以及高額緩存折扣,為開發者提供了一個能夠支撐大規模日常調用的基礎選項。
當越來越多的企業財務官與開發者開始精細化計算 API 賬單時,答案已經很明確:前沿智能的價格,正在被重新定義。
