![]()
作者 | 四月
時至今日,全球大模型格局已成定數,還有必要耗費巨資從零開始訓練一個新模型嗎?
由 OpenAI 前 CTO Mira Murati 、華人研究員翁荔(前 OpenAI 應用研究 VP)聯合創立的 Thinking Machines Lab(TML)今天給出了答案。
![]()
北京時間 7 月 16 日凌晨,這家公司帶來首款自研通用基礎模型 Inkling,采用混合專家 MoE 專家架構,總參數量為 9750 億、激活參數 410 億,采用 Apache 2.0 協議完整開放推理權重,包含 BF16 及 NVFP4 量化版本。
![]()
Hugging Face 開源地址:https://thinkingmachines.ai/news/introducing-inkling
Thinking Machines Lab 創立于 2025 年 2 月,成立 5 個月后便完成 20 億美元種子輪融資,估值 120 億美元,創下 AI 行業種子輪紀錄。可以說,Inkling 完全有資本在榜單上大做文章,但 TML 卻以業內少有的坦誠姿態,主動放棄了 SOTA 敘事。
官方博客中他們直言,"Inkling 并非當今最強的模型,開源閉源都不是"。在他們看來,開源模型的首要價值并不在于性能的摸高,而是需要:
在能力、推理成本、原生多模態和可微調性之間找到一個平衡,成為企業可以用自己數據持續改造的模型底座。
![]()
而 TML 之所以對"開源模型市場"有如此深刻的感悟,還在于他們已經基于旗下的大模型微調算力服務平臺 Tinker在 ToB 一線摸爬了近一年,這套經驗投射到 Inkling 身上,就體現為一個適合企業二次微調的模型應重點關注的三件事:
Token 經濟性、深度可定制閉環與原生多模態。
六邊形戰士登頂美國開源陣列
Inkling 采用混合專家 MoE 架構,總參數 975B,單次推理激活 41B,上下文窗口最高 100 萬 token,預訓練數據量為45 萬億 token,涵蓋文本、圖像、音頻與視頻。
![]()
圖注:Inkling(預感、暗示),其形象設計看起來像是一灘可以隨意變幻形狀的墨汁。
單看體量,9750 億參數已躋身全球規模最大的開源模型陣列(高于智譜 GLM-5.2 的7530 億參數,低于 Kimi-K2 的 1T 參數)。
但由于借鑒了 DeepSeek V3 的 MoE 架構設計(“largely follows DeepSeek-V3”),Inkling 在單次推理中僅調用一小部分專家,實際運行成本與延遲得以控制。這也是當前大模型的通用路線,DeepSeek、Kimi、GLM 均采用類似設計。
值得期待的是,同期還有更輕量的預覽版Inkling-Small,總參 276B、激活 12B,權重將在測試完成后開放。
在綜合通用性評測方面,第三方機構 Artificial Analysis 結果顯示:Inkling 以 41 分的綜合得分,超越了英偉達 Nemotron 3 Ultra、谷歌 Gemma 4 31B 以及前東家 OpenAI 的 GPT-OSS-120B,登頂美國開源模型。
![]()
這種能力廣度對于模型定制和實際應用十分重要。不追求單一維度的極限(如純邏輯推理),而是覆蓋智能體編排、編程、指令遵循、多模態理解等廣泛的任務譜系。 因為企業實際的工作流是復雜且交錯的,底座模型必須是個“通才”,才能支撐后續的專精微調。
在智能體編排與工具調用層面,為解決模型在特定的測試框架下表現極佳,但一換環境就“水土不服”的魯棒性,TML 在訓練時刻意打亂了工具集和工具定義,迫使模型去理解工具調用的底層邏輯,而非死記硬背特定框架的 API。
![]()
在實際案例中,Inkling 能夠通過“一次生成”(One-shot)直接構建出一個可正常運行的 Web 應用,并內嵌一個 AI 助手,允許用戶通過自然語言直接操控界面。這種從“生成代碼”到“構建可交互系統”的跨越,正是企業自動化工作流中最稀缺的能力。
在網頁開發測試與多頁面構建上,長程一致性是 Inkling 的另一大亮點。在匿名人類評審盲測 Design Arena 中,Inkling 拿下 1257 分,追平了閉源旗艦 Claude Opus 4.6,超越 Gemini 3.5 Flash 和 Kimi K2.6,在全球開放權重模型中僅次于智譜 GLM 5.2。
![]()
大語言模型在長文本生成中常出現“風格漂移”或“指令遺忘”,但 Inkling 能夠在生成多頁面應用時,準確維持跨頁面的視覺風格連貫性與信息可靠性。這也側面印證了其 100 萬 token 上下文窗口并非紙面參數,而是具備真實的工程落地支撐。
![]()
客觀而言,盡管 Inkling 已經登頂美國開源陣營,但在 HLE、極限代碼代理等“硬核推理”榜單上,與國內的 GLM 5.2、Kimi K2.6 仍有差距。但 TML 顯然并不在意。
為了證明這種“廣度優先”的策略對微調有多大幫助,TML 甚至做了一個極其大膽的實驗:讓 Inkling 參與自身的微調過程。
![]()
在這個演示中,模型通過 Tinker 平臺自己編寫微調任務、運行訓練流程并評估結果。這說明,Inkling 是一款可塑性極高的模型底座,甚至可以充當塑造自身和其他模型的基礎設施。
1/3 Token 成本追平 Nemotron 3 Ultra
如果說“六邊形戰士”的能力廣度是 Inkling 登頂美國開源陣列的入場券,那么它真正在 ToB 市場建立護城河的,是其對“部署成本”和“可塑性”的極端追求。
在 Terminal Bench 2.1(智能體編程基準)上,Inkling 達到英偉達 Nemotron 3 Ultra 相同性能水平時,平均生成 Token 數量只有后者的大約三分之一。
![]()
圖注:隨著推理強度從 0.2 提高至 0.99,Inkling 可以在任務表現與生成 Token 之間選擇不同工作點
從測試結果中可以看到,Nemotron 3 Ultra 在該測試中的成績為 56.4%,Inkling 在最高推理強度下可以達到 63.8%。當 TML 調低 Inkling 的推理強度,使其成績落在 Nemotron 相同水平時,所需 Token 約為對方三分之一。
也就是說,Inkling 用一條更短的推理路徑,抵達了相同的任務成功率。對于需要將模型嵌入長流程工作流、每天跑數百萬次調用的企業來說,這不僅意味著 API 費用銳減,更直接決定了用戶感知到的響應延遲。
值得研究的是,Inkling 的 token 經濟性,并非基于后置接口硬性截斷思維鏈來實現,而是通過強化學習“長”在模型基因里的。
![]()
圖注:Inkling 在超過 3000 萬次強化學習 Rollout 中保持穩定訓練,推理評測成績持續提升
在后訓練階段,TML 投入海量算力進行大規模異步強化學習,rollout 次數超過 3000 萬次。團隊沒有盲目追求推理深度的最大化,而是引入了一個精巧的機制:通過修改系統消息,并為不同任務設置不同的每 Token 成本,讓模型有時可以充分展開推理,有時則必須控制計算預算。
經過反復訓練,Inkling 逐漸學會在不同任務中看碟下菜:什么問題值得繼續深挖,什么任務已經可以停止,以及增加一段推理能否帶來足夠的性能收益。
這意味著,開發者調整的不再是一個簡單的輸出長度上限,而是模型在強化學習中已經習得的不同思考檔位(可通過output_config.effort設置 0 至 1 之間的推理強度;數值越高,通常會促使 Inkling 投入更多推理,但不保證每次都更長或更準確)。
更有意思的是,隨著強化學習推進,Inkling 的思維鏈還出現了自發壓縮現象。
早期模型會使用相對完整的語法,不斷復述條件和推理意圖;訓練后期,它開始省略部分冠詞、連接詞和重復表達,推理過程逐漸變成一種接近速記的語言。TML 并沒有專門獎勵這種文風,單純的 Token 成本壓力,就促使模型尋找更短的推理路徑。
![]()
圖注:同一道問題在強化學習前后的思維鏈對比,后期推理省略了更多語法性表達。Cognition 團隊在訓練 SWE-1.7 時,也曾觀察到類似變化。
這意味著 Inkling 擁有了一種“內生”的推理強度控制能力,它并非一個永遠“少想偷懶”的模型,而是一條可以調節的性能成本曲線。
簡單任務不必為最高推理強度付費,復雜任務仍然可以增加計算預算。對于企業而言,這比一個只能以固定檔位運行的高分模型更容易部署,也更容易針對不同工作流進行成本控制。
一個懂得自我節流的模型,在微調時也往往能更高效地吸收新知識。
補齊大小模型協同的后訓練閉環
為了讓這種可塑性真正落地,TML 并沒有止步于“開放權重”,而是補齊了全鏈路的工具棧。他們不僅在 Tinker 平臺原生集成了 Inkling 的微調支持,更新了 Cookbook 和三套音頻定制示例,更關鍵的推出了 tml-renderer 渲染器。
![]()
在大模型實際落地中,當推理過程夾雜了工具調用、多模態輸入時,數據采樣和后訓練往往極其脆弱。tml-renderers承擔的正是這層轉換工作,它可將聊天消息、工具調用、圖像和音頻統一渲染成 Inkling 所需的輸入格式,并使用同一套規則處理推理采樣與監督微調數據,以提供穩定可靠的采樣與后處理支持。
你會發現,這是真正懂工程痛點才會做的基建。前文中 Inkling 展示的“模型微調自己”的實驗,就是這套鏈路的運轉機制。
與 Inkling 同時預覽的 Inkling-Small,還為這套后訓練體系補上了另一套成本檔位。
![]()
圖注:Inkling-Small 以不足三成的激活參數保留了多項能力,但在復雜 Agent 和事實準確性上仍存在明顯折損
Inkling-Small 擁有 2760 億總參數、120 億激活參數,激活規模不足 Inkling 的三成。由于使用了改進后的預訓練數據與訓練配方,它在 HLE 工具版、GPQA Diamond、IFBench 及部分視覺測試中持平甚至反超大版本,SWE-bench Verified 也僅相差 0.2 個百分點。兩款模型共享同一套可擴展后訓練技術棧。
它并非 Inkling 的全面低價替代品。在復雜終端編程、銀行 Agent 與事實準確性等任務中,小模型仍有較明顯的性能下降。
但官方對它的應用定位非常具體:編程、為其他模型評測打分,以及為其他模型生成合成數據。這幾類工作通常需要高頻、批量地調用模型,對單次能力上限的要求未必最高,卻高度敏感于成本和延遲。
從原生多模態到全棧部署
Token 效率緩解的是企業落地中的成本與延遲問題,原生多模態和開放生態,則進一步回答了另外兩個問題:人要怎樣參與模型工作,以及誰有權決定模型最終變成什么樣。
Inkling 的另一大亮點在于原生多模態,即文本、圖像和音頻從預訓練階段便進入同一模型聯合學習。這與當前 GLM、DeepSeek 等主流開源模型不同,后者多采用“后期外掛”視覺或音頻編碼器的路線,以求快速獲取跨模態能力。
![]()
圖注:Inkling 將音頻、圖像轉換為輕量表示,并與文本 Token 統一處理
這套能力并非單純為了增加輸入格式。TML 將 Inkling 定位為交互模型系統中的后臺推理模型:前臺模型持續接收用戶的語音、畫面和文字,維持實時交流;遇到深度推理、搜索和工具調用,再將任務及共享上下文交給 Inkling 異步處理。換言之,原生多模態是 Inkling 承接復雜交互上下文的能力基礎,“雙模型異步協作”則是這項能力的應用場景。
![]()
圖注:TML 將實時交互與后臺推理分開,用戶持續參與對話,復雜任務則由后臺模型異步完成
具體來看,Inkling 能夠轉寫語音、理解口頭指令和分析長音頻,也能處理圖表、示意圖與數學視覺問題。面對復雜圖片,它還可以調用 Python 進行放大、裁剪,將視覺理解與代碼推理結合。在 CharXiv 視覺推理測試中,加入 Python 工具后,其成績由 78.1%提高至 82.0%。不過,Inkling 當前仍只支持文本輸出,尚不能直接生成語音或圖像。
![]()
進入生產環境還意味著模型不能在安全問題上失控,也不能因為過度防御而頻繁誤拒。在 FORTRESS 測試中,Inkling 對對抗性有害請求的拒絕率為 78%,同時對無害相似請求保持 95.9%的正常響應率,在 TML 比較的開放權重模型中取得了相對均衡的表現。
在交付方式上,TML 也沒有將 Inkling 綁定在單一 API 中。
![]()
原始權重與面向 Blackwell 優化的 NVFP4 版本均已開放;開發者既可通過 Together AI、Fireworks、Modal 等平臺調用,也可借助 SGLang、vLLM、llama.cpp 和 Transformers 自行部署。可以說,Inkling 同時覆蓋了托管 API 與自主部署兩條主流路徑。
原生多模態讓 Inkling 能夠進入更復雜的人機交互,全權重開放和推理框架適配則讓它進入企業自己的技術棧。
結語:為什么還要從零訓練一款模型
對于 TML 而言,一方面需要 證明自己不只有明星光環和融資故事,也真正具備從預訓練到強化學習,完整訓練一款近萬億參數模型的科研與工程能力。
但更重要的是 TML 的商業模式,要借開放權重與此前布局的 Tinker 微調平臺,卡位企業級定制化 AI 基礎設施市場。
一個面向企業的模型服務平臺,不能永遠只負責連接和供給第三方模型。它還需要知道:完成任務需要多少 Token?推理強度能否按需調節?模型能否原生理解語音、圖像與文本?企業是否能夠用自己的數據持續微調,并將其無縫部署進技術棧?
而這些能力,只有把預訓練、強化學習、推理和微調的完整鏈路握在自己手里,才能真正打通。
所以,這個問題的本質是:一家想要卡位 B 端市場的 MaaS 服務平臺,為什么最終必須擁有自研的核心模型?
聲明:本文為 AI 前線原創,不代表平臺觀點,也不構成投資建議,未經許可禁止轉載。
會議推薦
年中技術充能,盛夏 8 折赴約!AICon 深圳站集結華為、騰訊、阿里等全明星講師陣容,前沿方向 + 實戰干貨雙在線,承包你一夏的 AI 技術成長。大會限時早鳥票享 8 折專屬優惠,現在報名立減 1160,更多詳情可掃碼或聯系票務經理 13269078023 進行咨詢。
今日薦文
你也「在看」嗎?
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.