在“越大越好”幾乎成為AI界鐵律的今天,一家以社交媒體而非尖端技術(shù)聞名的公司,卻投下了一顆震撼彈。
新浪微博的9人研究團(tuán)隊(duì)悄然發(fā)布了一篇論文,宣稱(chēng)其僅有30億參數(shù)的模型VibeThinker-3B,在數(shù)學(xué)和代碼推理能力上,竟能與谷歌、OpenAI及DeepSeek等巨頭動(dòng)輒千億、萬(wàn)億參數(shù)的旗艦?zāi)P头滞タ苟Y。
這一結(jié)果不僅讓業(yè)界嘩然,更將長(zhǎng)久以來(lái)的“基準(zhǔn)測(cè)試(Benchmark)崇拜”推上了審判臺(tái)。這究竟是算法工程的重大突破,還是對(duì)早已失效的評(píng)分體系的最后一次嘲諷?
在LLM領(lǐng)域,小規(guī)模參數(shù)模型(通常指7B及以下)確實(shí)長(zhǎng)期占據(jù)著“端側(cè)部署”和“成本控制”的重要席位,但隨著2025年GPT-5、Claude 4、Gemini 3等超大參數(shù)模型在推理能力上的斷層式領(lǐng)先,以及API調(diào)用成本的驟降,大眾開(kāi)發(fā)者和輿論確實(shí)在近一年內(nèi)將目光完全聚焦在了“大模型”身上,默認(rèn)“更大即更強(qiáng)”,從而忽略了小模型本身的進(jìn)化潛力。
正是在這種“大模型通吃”的集體潛意識(shí)下,微博VibeThinker-3B的橫空出世才顯得如此刺耳又迷人。它不僅打破了“小模型只能做簡(jiǎn)單任務(wù)”的刻板印象,更用一張逆天的成績(jī)單,狠狠扇了盲目崇拜參數(shù)的行業(yè)一記耳光。
![]()
1.違背常理的分?jǐn)?shù):小模型的大能量
根據(jù)技術(shù)報(bào)告,VibeThinker-3B的成績(jī)單堪稱(chēng)“逆天”。
數(shù)學(xué)推理:在極具挑戰(zhàn)性的美國(guó)數(shù)學(xué)邀請(qǐng)賽(AIME 2026)中,它拿下了94.3分。這個(gè)分?jǐn)?shù)與擁有6710億參數(shù)的DeepSeek V3.2持平,甚至超過(guò)了谷歌Gemini 3 Pro(91.7分)。
代碼能力:在LiveCodeBench v6測(cè)試中,其Pass@1得分達(dá)到80.2%;在2026年4月至5月的LeetCode實(shí)戰(zhàn)周賽中,接受率高達(dá)96.1%,表現(xiàn)優(yōu)于同期測(cè)試的大部分主流大模型。
為了直觀理解這種差距:VibeThinker-3B的參數(shù)規(guī)模僅為DeepSeek V3的1/224,甚至可以在一臺(tái)普通的消費(fèi)級(jí)筆記本電腦上流暢運(yùn)行。
研究人員將此稱(chēng)為“參數(shù)壓縮-覆蓋假說(shuō)”:即數(shù)學(xué)推導(dǎo)和代碼邏輯這類(lèi)“可驗(yàn)證推理”能力,本質(zhì)上是“參數(shù)密集型”的,可以被極度濃縮;而通用知識(shí)(如“誰(shuí)當(dāng)了總統(tǒng)”)才是“參數(shù)擴(kuò)展性”的,需要龐大的參數(shù)來(lái)存儲(chǔ)事實(shí)。
![]()
2.微博是如何做到的?4級(jí)訓(xùn)練流水線(xiàn)
VibeThinker-3B并非從零訓(xùn)練,而是基于阿里巴巴的Qwen2.5-Coder-3B進(jìn)行后期訓(xùn)練(Post-training)。微博團(tuán)隊(duì)設(shè)計(jì)了一條精密的四級(jí)流水線(xiàn),核心在于“頻譜到信號(hào)原理”:
課程學(xué)習(xí)(Curriculum Learning):先喂“粗糧”(廣泛的數(shù)學(xué)、代碼數(shù)據(jù)),再喂“細(xì)糧”(精心篩選的高難度問(wèn)題)。模型被強(qiáng)制丟棄簡(jiǎn)單的樣本,只專(zhuān)注于解決那些它有75%概率會(huì)做錯(cuò)的難題。
強(qiáng)化學(xué)習(xí)(RL):采用自研的MGPO算法,像教練一樣盯著運(yùn)動(dòng)員的短板。它不訓(xùn)練模型已經(jīng)會(huì)的東西,也不訓(xùn)練它完全不會(huì)的東西,只訓(xùn)練“跳一跳夠得著”的邊界問(wèn)題。
長(zhǎng)短數(shù)學(xué)強(qiáng)化:引入零和獎(jiǎng)勵(lì)重分配機(jī)制,優(yōu)先獎(jiǎng)勵(lì)更短的正確解題過(guò)程。這迫使模型去除啰嗦的“思考鏈”,學(xué)會(huì)像人類(lèi)高手一樣直覺(jué)性地給出高效解法。
蒸餾與指令微調(diào):將大模型的解題思路(Teacher Traces)提煉出來(lái),教給小模型,并進(jìn)行最后的指令對(duì)齊。
這種極致的訓(xùn)練方式,讓一個(gè)3B的小模型在推理效率上達(dá)到了極致。
3.基準(zhǔn)測(cè)試的悖論:是突破還是“刷分”?
論文發(fā)布數(shù)小時(shí)內(nèi),Hugging Face上贊不絕口,但X(推特)上卻充滿(mǎn)了懷疑的電子煙味。
首先是基準(zhǔn)污染與“Benchmaxxing”。
批評(píng)者指出,許多模型高分是因?yàn)椤氨愁}”。用戶(hù)@Itsdotdev質(zhì)問(wèn):“如果它在訓(xùn)練截止日期之前的老套題(如AIME)上獲勝,那是泄漏;只有在截止日期之后的新題上獲勝,才是真實(shí)力。”雖然微博團(tuán)隊(duì)聲稱(chēng)使用了2026年4月后的LeetCode新題作為驗(yàn)證,且進(jìn)行了嚴(yán)格的去污處理,但質(zhì)疑聲依然不斷。
更有網(wǎng)友創(chuàng)造了新詞“Benchmaxxing”,諷刺那些為了刷榜而犧牲實(shí)際能力的模型。用戶(hù)@politilols實(shí)測(cè)后吐槽:“它甚至不知道什么是UV腳本(Python熱門(mén)開(kāi)發(fā)工具),這絕不可能反映真實(shí)的編碼能力。”
![]()
第二,現(xiàn)實(shí)與榜單的割裂。
最尖銳的矛盾在于,榜單上的王者,在現(xiàn)實(shí)中卻可能連基本的開(kāi)發(fā)工具都搞不定。這種“基準(zhǔn)分?jǐn)?shù)與實(shí)際效用的巨大鴻溝”,正是VibeThinker-3B引發(fā)爭(zhēng)論的核心。它證明了現(xiàn)有的基準(zhǔn)測(cè)試可能已經(jīng)無(wú)法衡量AI的真實(shí)生產(chǎn)力,而更像是一種“應(yīng)試教育”的產(chǎn)物。
4.小模型的大影響:產(chǎn)業(yè)無(wú)法回避的問(wèn)題
拋開(kāi)爭(zhēng)議,VibeThinker-3B的出現(xiàn)本身就具有里程碑意義。它來(lái)自一家社交媒體公司,而非傳統(tǒng)的AI巨頭,且團(tuán)隊(duì)僅有9人。這打破了“只有燒得起幾億美元電費(fèi)的公司才能做前沿研究”的迷信。
一個(gè)啟示是混合架構(gòu)的未來(lái)。如果參數(shù)壓縮假說(shuō)成立,未來(lái)的AI系統(tǒng)將不再是單一的巨型模型,而是“混合專(zhuān)家+推理引擎”的架構(gòu)。
一個(gè)30B的大模型負(fù)責(zé)提供知識(shí)和對(duì)話(huà),旁邊并行跑著一個(gè)3B的VibeThinker負(fù)責(zé)復(fù)雜的數(shù)學(xué)計(jì)算和代碼生成。這將極大降低推理成本和延遲。
另一個(gè)則是端側(cè)AI的黎明。用戶(hù)@cmitsakis一針見(jiàn)血地指出:“小模型是Agent(智能體)的未來(lái)。”只有像VibeThinker-3B這樣小巧、高效、專(zhuān)注推理的模型,才能在手機(jī)、汽車(chē)、IoT設(shè)備上本地運(yùn)行,而無(wú)需時(shí)刻連接昂貴的云端算力。
VibeThinker-3B或許無(wú)法立刻取代Claude或GPT-4成為你的編程助手,但它撕開(kāi)了一道口子。它逼迫整個(gè)行業(yè)思考:我們是否花了數(shù)十億美元,在盲目堆砌參數(shù)的路上走得太遠(yuǎn),卻忽略了算法優(yōu)化和訓(xùn)練策略的潛力?
最重要的測(cè)試不在任何排行榜上,而在每一個(gè)開(kāi)發(fā)者的終端里。如果微博的這個(gè)小模型能讓AI推理能力真正飛入尋常百姓家,那么無(wú)論基準(zhǔn)分?jǐn)?shù)如何,它都已經(jīng)贏了。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.