![]()
Kimi K3 的發布引起了海內外網友的高度關注,2.8T 的萬億大參數模型,直接在某些測試項目上,把國外閉源模型給擊敗了。
![]()
緊跟在 Kimi K3 之后,定位千問新一代旗艦基座模型的預覽版 Qwen3.8-Max-Preview,也正式發布,開放給所有用戶使用,接替 5 月發布的 Qwen3.7-Max。
兩個月的時間,Qwen3.8-Max 的參數量從 3.7 時代的「超萬億的千問模型」到現在的 2.4T,千問團隊表示 Qwen3.8-Max 是目前最強大的模型之一,兼容領先的前沿 AI 模型,僅次于 Fable 5。
![]()
目前在千問官網,已經能體驗最新的 Qwen3.8-Max-Preview 預覽版
雖然正式版還沒上,Qwen3.8-Max-Preview 在 X 上的熱度也并不比 Kimi K3 要低,將近 600 萬次的瀏覽,但網友們討論的內容都集中在「能聊 ≠ 能用,承諾 ≠ 交付」。
大家都在等正式版/滿血版的 Qwen3.8-Max,以及模型的 benchmark 表、激活參數量,和 Hugging Face 上帶許可證的真實權重文件。
![]()
對比之前 Hy3 的預覽版和正式版,三個月的時間簡直是兩個模型。這次 Qwen3.8-Max 正式版估計不會要等三個月,所以我們還是簡單測試了一下 Qwen3.8-Max 的預覽版,看看是不是值得期待。
實測 Qwen3.8-Max-Preview,速度很快但效果
幾乎所有的大模型公司都開始有自己的「Codex」應用,Qwen 用于編程和效率工作場景的應用是 Qoder/QoderWork。我們這次使用 Qoder 來對 Qwen3.8-Max-Preview 進行測試。
![]()
在 Qoder 內可以看到 Qwen3.8-Max-Preview 的定位是最新一代基座模型,深度推理辦公的首選,而模型上下文窗口在模型設置中,最多可以拉到 1M,即支持百萬字上下文。
我們先是讓它設計一個個人作品集網站首頁,這類工作對大模型來說基本上都是「灑灑水」,關鍵點在于怎么做得高級又好看,有創新點。
![]()
生成過程中,Qoder 會彈出問題要我們選擇網頁的樣式和內容,但也可以直接讓 AI 自行決定。
最終的生成的網頁效果確實不賴,并且還添加了適當的緩入緩出的漸變效果,讓網頁的閱讀體驗更高級。
![]()
上下滑動查看更多內容
在 Qoder 應用內,我們發現它提供了 161 種風格參考,包括 Aribnb、Apple、Figma、GOV.UK 等不同網站,我們可以直接應用對應風格,來創作網頁。
![]()
此外,Qoder 非常好的一點是,我們可以直接對網頁進行修改。通過應用內的「畫布」功能,我們可以直接選擇網頁上的元素,進行排版、顏色、間距、文本內容、視覺編輯,以及描邊等參數的修改。
![]()
接著測試「真才實學」的代碼能力,自從 Fable 5 出來之后,有網友用它制作各式各樣的 3D 網頁,模擬真實的地理環境,創作不同的游戲場景。3D 測試也成了這段時間以來新發布大模型必測的項目之一。
我們從之前的 3D 測試提示詞項目中隨便找了一個,這次是在 Qoder,即代碼場景下的應用內讓它完成,完整的提示詞是:
創建一款明亮的 Three.js 屋頂跑酷游戲,場景位于風格化的紐約街谷上方。玩家開局時已經在奔跑,朝著第一個發光的屋頂邊緣沖去。
不要創建標題畫面、菜單、關卡選擇、新手引導浮層或按鍵開始狀態。
核心玩法只有一個:在計時結束前,從一個屋頂邊緣跳到另一個屋頂邊緣,穿過屋頂檢查點,最終抵達終點廣告牌。打造一條充滿活力但范圍集中的天際線路,加入水塔、消防梯、屋頂通風口、廣告牌、晾衣繩、遠處車流、窗格陣列和清晰的落點標記。
加入計時器、檢查點計數、重置功能、緊湊的操作提示和近距離第三人稱鏡頭。整體要明亮、有動感、清晰易讀,并且打開后即可游玩。
![]()
Qoder 的整個任務界面也很像 Codex,主頁面顯示當前任務的對話窗口,側邊欄顯示項目概要,包括項目進展、產物和文件或 Skill 的引用,以及終端和文件信息等。
Qwen3.8-Max-Preview 的運行時間非常快,深度思考 29s、深度思考 1s、深度思考 1s,沒用幾分鐘就把這個 3D 網頁給做出來了。
游戲確實是能玩的,而且整體的風格和 Fable 5 也確實類似,但是這是第二版的結果。第一版 Qwen3.8-Max-Preview 給的網頁沒有控制好玩家前進的速度,導致游戲體驗極差,幾乎每次都要掉下去重來。
我們在 Qoder Work 和網頁版內輸入同樣的提示詞,只有 Qoder 交付的結果是比較樂觀的,其他的平臺應該是沒有針對編程項目做過專門的優化,以及單獨的 HTML 文件沒有順利加載 Three.js 庫文件等問題。
![]()
Qoder Work 內生成的網頁是一片漆黑
接著我們又讓它生成一些 3D 的藝術世界,在莫奈位于吉維尼的睡蓮世界中,打造一個極限的 Three.js 體驗:一片遼闊的池塘,同時也是一幅畫,整個水面與花園都由漂浮的純色筆觸構成,乘船穿行其中。
光是聽著就很有難度,這次 Qwen3.8-Max-Preview 的執行時間也比紐約屋頂跑酷任務更久,但整體上依舊很快,尤其是側邊欄顯示的進展,經常是一瞬間就全部 Checked 完成。
最后的結果就相當抽象了,完全不知道這個網頁是什么。雖然它在結果里寫著 118,500 個獨立色彩筆觸,有睡蓮葉、花朵、日本橋等等元素,但是交付的網頁就是一些碎片在旋轉。
![]()
二次修改讓它重新檢查之后,新的結果依舊是有點一言難盡,但至少是比第一次能明顯地看到這個橋的形狀了。
![]()
而如果是復刻 App,我們也輸入「幫我復刻一個 flighty 的 app,給我可以分享的網頁預覽鏈接先。」,看看它能否學到 Flighty 精美的交互和動效,以及簡潔大方的 UI。
結果也是相當簡陋,而且幾乎沒有任何功能,只是找了幾個航班放在這里展示。我甚至授權了 Vercel(網頁部署平臺)給它,但是這個交付的網頁很明顯是不夠格的。
![]()
除了在 Qoder 內能體驗到 Qwen3.8-Max-Preview,我們在千問官網也測試了一下模型的深度研究能力。
![]()
最后的結果,基本上和我們用 Qwen3.7-Max 測試是類似的,從核心摘要到市場格局,以及未來行業發展趨勢,都沒有太大的差別。
![]()
上下滑動查看更多內容(部分)
目前預覽版的能力或許無法代表最終 Qwen3.8-Max 的能力,但國產開源模型進擊的勢頭確實讓人招架不住。
國產開源大模型首次超過閉源模型
國外的網友說,現在的開源模型幾乎都是來自中國。已經發布的 GLM-5.2 和 Kimi K3,一個是接近 Anthropic 的 Opus 水平,一個來到了可以跟 Fable 5 一桌的等級。
而本月還將迎來 Qwen3.8-Max、DeepSeek V4 正式版、GLM-5.5,以及 MiniMax-M3-Pro,幾乎都把「對標 Fable 5」當成了模型的評價基準。
![]()
OpenAI 的戰略未來主管 Dean W. Ball 在 X 上發文,提到 Kimi 是一個非常優秀的模型,它不認為 Kimi 的性能可以用蒸餾之類的技術來解釋。
而在 Agent Coding 測試里,Kimi K3 的表現幾乎可以與今年一季度最好的公開模型相媲美。
今年以來,主要公司的大模型發布情況顯示累計有 39 次模型發布,其中國產模型有 21 個,而美國的大模型 18 個。
39 個大模型中開源模型有 17 個,其中 13 個來自國產開源模型,4 個美國模型分別是 Mira Murati 的 Thinking Machine Lab 最新發布的 Inkling 模型、英偉達發布的 Nemotron 3 Ultra、Google 的 Gemma 4 以及英偉達的 Nemotron 3 Super。
![]()
或許現在談要超過 Fable 5 為時尚早,但是當看到 X 上的網友一本正經的分析:
Mythos Preview 是 10T 參數模型;GPT-6、Fable 5.1 已經完成訓練但尚未發布;美國實驗室因為安全風險主動壓低或隱藏能力;以及國產模型近期的進步有一部分仍然來自蒸餾等判斷……
這就很讓人忍俊不禁,照他們的邏輯,中國模型成績追上來,可以歸因于蒸餾和刷榜;尚未追上的部分,又可以解釋成美國把真正的強模型藏起來了;無論出現什么結果,都不會輸。
![]()
今天的榜單上,Kimi K3 可能超過了某個國外模型;明天 Qwen3.8-Max 可能又在另一個項目里拿到第一;再過幾天,DeepSeek、智譜還會繼續把新的模型推上來。
模型之間的差距,開源和閉源,國產和海外模型,都正在變得越來越短。
以前,想要最強的模型,可能只能選擇少數幾家海外閉源模型。現在,同樣的能力開始出現在更多模型、更多產品,以及更多本地部署的方案里。
模型能力越接近,我們的選擇就越多。最后決定我們能不能用上更強 AI 的,大概會是這些模型,誰先把價格打下來。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.