![]()
智東西
編譯 茄子
編輯 程茜
智東西7月16日消息,今日,OpenAI前CTO米拉·穆拉蒂(Mira Murati)創(chuàng)辦的、美國AI獨角獸Thinking Machines Lab發(fā)布其首個多模態(tài)MoE開放權(quán)重模型Inkling。該模型的核心優(yōu)勢是可改造、可部署、可控成本,開發(fā)者能對模型微調(diào)、調(diào)節(jié)推理強(qiáng)度,以控制其效果、延遲和成本。
穆拉蒂在社交平臺X上發(fā)帖稱,這是我們首個模型,Inkling。從零開始訓(xùn)練,權(quán)重對外開放,即日起可在Tinker平臺開展微調(diào)。
![]()
▲Mira Murati發(fā)文宣布Inkling(圖源:X)
Thinking Machines Lab聯(lián)合創(chuàng)始人、前OpenAI研究安全副總裁翁荔發(fā)文稱,Inkling作為基礎(chǔ)底座,在廣泛任務(wù)維度擁有均衡扎實的能力,并提供實際落地與定制微調(diào)。
![]()
▲翁荔發(fā)文介紹Inkling(圖源:X)
目前,Inkling已在Thinking Machines Lab旗下Tinker平臺上線,支持64K和256K兩種上下文長度,并限時提供5折優(yōu)惠。Thinking Machines Lab稱,開發(fā)者可通過Tinker對Inkling進(jìn)行調(diào)整,也可以先在Tinker控制臺的測試頁面Inkling Playground中體驗聊天和Agent式網(wǎng)絡(luò)搜索功能。
同時,Inkling完整權(quán)重已在Hugging Face開放,開發(fā)者可下載原始checkpoint和NVFP4 checkpoint,用于部署或調(diào)整該模型。
![]()
▲Inkling開放權(quán)重(圖源:Hugging Face)
據(jù)官方博客介紹,Inkling基礎(chǔ)模型借鑒了中國的DeepSeek-V3模型的MoE架構(gòu)設(shè)計,并在后訓(xùn)練階段使用了由月之暗面公司Kimi K2.5生成的數(shù)據(jù)進(jìn)行了優(yōu)化。
![]()
▲Inkling借鑒中國DeepSeek-V3、使用Kimi K2.5優(yōu)化(圖源:Thinking Machines Lab)
Inkling采用MoE Transformer架構(gòu),總參數(shù)量9750億,激活參數(shù)量410億,最高支持100萬token上下文窗口。在預(yù)訓(xùn)練階段Inkling就融合了文本、圖像、音頻和視頻數(shù)據(jù),僅靠單一模型就能實現(xiàn)視覺理解、音頻問答、代碼開發(fā)和工具調(diào)用。
多名用戶在社交平臺分享了對Inkling模型的實測反饋。部分測試者認(rèn)為Inkling在文學(xué)創(chuàng)作場景表現(xiàn)尚可、具備開發(fā)潛力。但是,也有開發(fā)者指出模型當(dāng)前存在明顯缺陷,認(rèn)為其任務(wù)穩(wěn)定性不足,并且綜合性能尚未達(dá)到頂尖開放權(quán)重模型水平。
從基準(zhǔn)測試看,Inkling綜合能力均衡。在大模型評測榜單Artificial Analysis中,Inkling的綜合測試得分為41分,高于Nemotron 3 Ultra、Gemma 4 31B等開放權(quán)重模型,在美國開放權(quán)重模型中排名第一。在通用智能和綜合任務(wù)測試中,該模型獲得1238 Elo分,超過Kimi K2.6和DeepSeek v4 Flash(max)。
![]()
▲Inkling在Artificial Analysis中的排名(圖源:Artificial Analysis)
價格方面,在64K上下文窗口下,該模型輸入價格為每百萬token 1.87美元(約合人民幣12.65元),緩存輸入0.374美元(約合人民幣2.53元),輸出4.68美元(約合人民幣31.7元);在256K上下文窗口下,該模型輸入價格為每百萬token 3.74美元(約合人民幣25.3元),緩存輸入0.748美元(約合人民幣5.06元),輸出9.36美元(約合人民幣63.3元)。
此外,Thinking Machines Lab同步上線了輕量版本Inkling-Small預(yù)覽版。該輕量化模型激活參數(shù)量為120億,采用與Inkling相同的訓(xùn)練方案,在降低模型規(guī)模的同時,保留了部分核心能力。據(jù)官方博客透露,Inkling只是開端,Thinking Machines Lab會持續(xù)迭代拓展這條產(chǎn)品線。
Hugging Face體驗地址:
https://huggingface.co/thinkingmachines/Inkling
一、從寫網(wǎng)頁到制作游戲,Inkling展示多任務(wù)Agent能力
Inkling上線后,用戶很快開始測試其文本、編碼和工具調(diào)用能力。有的用戶認(rèn)為Inkling在文本創(chuàng)作表現(xiàn)良好,還有的開發(fā)者則對Inkling的網(wǎng)頁生成能力進(jìn)行了測試。
比如這位用戶讓Inkling創(chuàng)作200詞的文本,Inkling根據(jù)同一提示詞生成了3篇風(fēng)格統(tǒng)一的短篇科幻文本。該用戶認(rèn)為Inkling有較好的英文文本功底。
![]()
▲用戶對Inkling的文本創(chuàng)作實測(圖源:X)
這位用戶則對Inkling開展多維度驗證,他基于Inkling搭建只能書法教練應(yīng)用,并測試了該模型的編碼、工具調(diào)用與視覺能力。經(jīng)過測試,他認(rèn)為,這款從零開始訓(xùn)練的多模態(tài)模型具備不錯的開發(fā)潛力。
![]()
▲用戶對Inkling的生成應(yīng)用的實測(圖源:X)
但是,也有一些用戶對Inkling的實際表現(xiàn)提出質(zhì)疑。AI研究者Ethan Mollick測試后稱,Inkling整體表現(xiàn)難以接近中國頭部開放權(quán)重模型。他在測試中發(fā)現(xiàn),Inkling未能通過Lem詩歌測試,在GLSL編程調(diào)試中也存在輸出不穩(wěn)定的問題,即使開啟最高推理強(qiáng)度,處理簡單代碼任務(wù)時仍會出現(xiàn)偏差。
![]()
▲用戶對Inkling的實測表現(xiàn)不滿意(圖源:X)
Thinking Machines Lab也通過案例展示了該模型在復(fù)雜任務(wù)執(zhí)行、多輪迭代方面的能力。
在Agent任務(wù)方面,Inkling可以結(jié)合工具調(diào)用完成端到端的軟件開發(fā)。例如,在一次測試中,Inkling僅根據(jù)一句需求描述,便生成了一個完整的求職網(wǎng)站,并進(jìn)一步驅(qū)動瀏覽器Agent操作網(wǎng)頁,根據(jù)已有資料自動填寫求職表單。
▲Inkling制作求職網(wǎng)站(圖源:Thinking Machines Lab)
官方稱,Inkling在訓(xùn)練過程中適配了不同類型的Agent框架,并隨機(jī)化訓(xùn)練階段使用的工具集合和工具調(diào)用格式,使得該模型降低對特定工具環(huán)境的依賴,從而具備更強(qiáng)的任務(wù)遷移能力。
除了代碼開發(fā),Inkling還展示了長流程任務(wù)處理能力。在一項測試中,Inkling根據(jù)用戶反饋持續(xù)優(yōu)化一款多人在線貪吃蛇游戲,經(jīng)過40輪迭代后,最終生成了包含實時服務(wù)器、AI Bot和排行榜等功能的完整游戲。
▲Inkling對貪吃蛇的長任務(wù)處理(圖源:Thinking Machines Lab)
在圖像和文本方面,Inkling可以根據(jù)用戶的要求生成一份設(shè)計風(fēng)格統(tǒng)一的文檔,并且具有詳細(xì)的說明和準(zhǔn)確的信息。
![]()
▲Inkling制作的文檔(圖源:Thinking Machines Lab)
二、Inkling在多項基準(zhǔn)測試中表現(xiàn)均衡
第三方測試機(jī)構(gòu)Artificial Analysis對Inkling進(jìn)行了多項測試。在Artificial Analysis Intelligence Index測試中,Inkling首次該進(jìn)入榜單便獲得41分,比此前領(lǐng)先的美國開放權(quán)重模型Nemotron 3 Ultra 38分高出3分,同時也優(yōu)于Gemma 4 31B的29分和gpt-oss-120b的24分。
![]()
▲Inkling在Artificial Analysis中的排名(圖源:Artificial Analysis)
在衡量通用智能與綜合任務(wù)表現(xiàn)的GDPval-AA v2測試中,Inkling獲得1238 Elo分,高于Kimi K2.6的1190分以及DeepSeek v4 Flash(max)的1189分。
![]()
▲Inkling在GDPval-AA v2測試中的分?jǐn)?shù)(圖源:Artificial Analysis)
此外,Inkling還展現(xiàn)出較高的token效率。據(jù)Artificial Analysis測試,Inkling平均生成約2.5萬個token,而GLM-5.2(max)、Kimi K2.6和DeepSeek v4 Pro(max)分別需要約4.3萬、3.8萬和3.7萬個token。這意味著,在達(dá)到相近任務(wù)效果時,Inkling能夠通過更少的推理token完成任務(wù),從而降低實際部署成本和響應(yīng)延遲。![]()
▲Inkling在token消耗上的排名(圖源:Artificial Analysis)
Thinking Machines Lab稱,Inkling并不是為了成為某一項測試中的最高分模型,而是希望打造一個覆蓋推理、Agent、多模態(tài)、代碼和事實準(zhǔn)確性的綜合型基礎(chǔ)模型。他們認(rèn)為,通用性對于定制化和實際應(yīng)用至關(guān)重要:不同的用戶需要能夠適應(yīng)截然不同的工作流程的模型。
![]()
▲Inkling綜合得分(圖源:Thinking Machines Lab)
從下方表格也可以看到,Inkling在多數(shù)測試表現(xiàn)中并未超過閉源模型,但在SWE-bench Pro Public、GDPval-AA v2、MCP Atlas、VoiceBench等測試中進(jìn)入開放權(quán)重模型前列。
![]()
▲Inkling在推理、Agent、代碼、視覺、音頻、安全等多項測試中的表現(xiàn)(圖源:Thinking Machines Lab)
在評估模型處理銀行業(yè)務(wù)代理任務(wù)能力的Tau 3 Banking測試中,Inkling取得23.7%的成績,高于Kimi K2.6的20.6%,接近DeepSeek v4 Pro的25.8%。
![]()
▲Inkling在Tau 3 Banking測試中的分?jǐn)?shù)(圖源:Thinking Machines)
在代碼能力測試中,Inkling同樣保持較強(qiáng)表現(xiàn)。在考察真實軟件工程問題修復(fù)能力的SWE-bench Pro Public測試中,Inkling取得 54.3%的成績;在評估模型終端操作與命令行任務(wù)完成能力的Terminal Bench 2.1測試中,使用最佳Harness時達(dá)到63.8%。
![]()
▲Inkling在代碼能力測試上的分?jǐn)?shù)(圖源:Thinking Machines Lab)
在設(shè)計領(lǐng)域,Inkling在Design Arena的智能Web開發(fā)排行榜上接受了評估,該排行榜由不知情的評估人員對生成的Web應(yīng)用進(jìn)行直接比較。在榜單上,該模型排在第7名。
![]()
▲Inkling在設(shè)計領(lǐng)域分?jǐn)?shù)(圖源:Thinking Machines Lab)
在評估語音理解與語音交互能力的VoiceBench測試中,Inkling取得91.4%的成績;在衡量多模態(tài)音頻理解能力的MMAU測試中達(dá)到77.2%。
在考察多模態(tài)視覺理解與推理能力的MMMU Pro標(biāo)準(zhǔn)測試中,Inkling取得73.5%,能夠完成圖像描述、圖表理解以及基于視覺信息的復(fù)雜推理任務(wù)。
![]()
▲Inkling在音頻和圖像測試上的分?jǐn)?shù)(圖源:Thinking Machines Lab)
Thinking Machines Lab稱,Inkling并非當(dāng)前綜合能力最強(qiáng)的模型,其優(yōu)勢在于多模態(tài)能力、可控推理效率以及開放權(quán)重后的可定制能力。
三、9750億參數(shù)MoE架構(gòu),多模態(tài)訓(xùn)練+可控推理降低使用成本
在MoE架構(gòu)設(shè)計上,Inkling參考了DeepSeek-V3的部分方案。Inkling每個MoE層包含256個路由專家和2個共享專家,每個token僅激活6個路由專家參與計算。同時,Inkling采用基于Sigmoid函數(shù)計算專家選擇權(quán)重的路由機(jī)制,并通過無輔助損失負(fù)載均衡策略,讓不同專家被調(diào)用的頻率更加均衡。
在注意力機(jī)制方面,Inkling采用滑動窗口注意力與全局注意力結(jié)合的方式。官方介紹,該模型按照5:1比例交替使用局部窗口層和全局層,同時采用8個KV Head,以提升長上下文處理效率。
不同于目前大量模型采用的旋轉(zhuǎn)位置編碼(RoPE),Inkling采用相對位置嵌入方式編碼位置信息。Thinking Machines Lab稱,相比RoPE,相對位置嵌入在長序列外推方面表現(xiàn)更好,更適合百萬token級上下文窗口。
在訓(xùn)練數(shù)據(jù)方面,Inkling預(yù)訓(xùn)練階段使用了4500萬億token規(guī)模的數(shù)據(jù),覆蓋文本、圖像、音頻和視頻。與傳統(tǒng)先訓(xùn)練文本模型,再外掛視覺或音頻模塊不同,Inkling從訓(xùn)練階段便加入多模態(tài)數(shù)據(jù),使模型能夠直接處理不同類型的信息。
在音頻輸入方面,該模型將音頻信號轉(zhuǎn)換為dMel頻譜,通過輕量級Embedding層后,與文本token共同輸入模型。視覺輸入方面,Inkling采用40×40像素Patch方式編碼圖片,再通過四層hMLP進(jìn)行處理。
這些視覺和音頻信息最終都會映射到統(tǒng)一隱藏空間,由同一個Transformer進(jìn)行推理。因此,Inkling不僅可以進(jìn)行圖片理解,也能夠完成語音轉(zhuǎn)寫、音頻內(nèi)容分析以及基于長音頻信息的推理任務(wù)。
在后訓(xùn)練階段,Thinking Machines Lab采用大規(guī)模異步強(qiáng)化學(xué)習(xí)(RL checkpoint)優(yōu)化模型能力。官方數(shù)據(jù)顯示,Inkling訓(xùn)練過程中累計完成超過3000萬次迭代。隨著強(qiáng)化學(xué)習(xí)規(guī)模擴(kuò)大,該模型在推理測試中的表現(xiàn)持續(xù)提升。
![]()
▲Inkling的異步學(xué)習(xí)優(yōu)化(圖源:Thinking Machines Lab)
此外,Inkling還引入了“可控思考努力程度”(Controllable Thinking Effort)。開發(fā)者可以根據(jù)實際需求調(diào)整模型推理強(qiáng)度:當(dāng)任務(wù)需要更高準(zhǔn)確率時,可以讓模型投入更多計算資源;當(dāng)任務(wù)更關(guān)注速度和成本時,則可以降低推理token消耗。
以下是Inkling在強(qiáng)化學(xué)習(xí)訓(xùn)練初期和后期對同一數(shù)學(xué)問題展開思考的示例,可以看到,在初期階段,Inkling的思考過程是比較冗長的,并且還會出現(xiàn)錯誤,而在后期階段則壓縮了冠詞和連接詞,較初期比較簡潔。
![]()
▲Inkling強(qiáng)化學(xué)習(xí)后思路更加簡潔(圖源:Thinking Machines Lab)
Inkling目前已經(jīng)接入Tinker平臺,開發(fā)者可以基于該模型進(jìn)行定制訓(xùn)練。官方展示了一個案例:讓Inkling自己設(shè)計微調(diào)任務(wù),包括生成訓(xùn)練任務(wù)、運(yùn)行訓(xùn)練流程并評估訓(xùn)練效果。
▲Thinking Machines Lab對Inkling的微調(diào)(圖源:Thinking Machines Lab)
結(jié)語:開放模型加速落地,開發(fā)者生態(tài)成為關(guān)鍵變量?
Thinking Machines Lab選擇開放Inkling完整權(quán)重,通過多模態(tài)能力、可控推理以及微調(diào)能力,將其定位為企業(yè)和開發(fā)者構(gòu)建AI應(yīng)用的基礎(chǔ)模型。
近年來越來越多模型也在朝這個方向走:DeepSeek-V3采用MoE架構(gòu)并開放權(quán)重;阿里云Qwen系列持續(xù)推出多模態(tài)和Agent相關(guān)模型;Meta的Llama系列、Mistral系列也通過開放權(quán)重策略推動開發(fā)者生態(tài)。它們除了提升推理能力,也在長上下文、多模態(tài)、Agent任務(wù)適配和微調(diào)能力上持續(xù)提升。
對于企業(yè)和開發(fā)者而言,模型是否開放、是否具備進(jìn)一步定制能力,將影響其在具體業(yè)務(wù)中的應(yīng)用空間。隨著越來越多廠商布局開放權(quán)重模型,未來競爭或?qū)@模型能力、使用成本以及開發(fā)生態(tài)展開。
來源:Thinking Machines Lab、Artificial Analysis、X
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.