![]()
Thinking Machines正式推出開源多模態(tài)大模型Inkling。該模型擁有約1萬億參數(shù),原生支持圖像、文本和音頻輸入,具備100萬詞元的超長上下文窗口及強大的跨模態(tài)理解能力。目前,Inkling已在Hugging Face平臺上線,并提供全精度BF16及NVFP4量化版本,內置推測解碼(MTP)層以加速推理,已獲得transformers、SGLang和llama.cpp等主流框架支持。
核心架構與技術突破
Inkling基于45萬億個多模態(tài)詞元訓練而成,是首個參數(shù)量達萬億級且原生支持多模態(tài)輸入的開源模型。其架構設計兼顧效率與性能:
- 混合專家模型(MoE):包含256個專家模塊,采用稀疏前饋網(wǎng)絡,每次激活僅調用410億參數(shù),顯著提升推理速度。
- 注意力機制創(chuàng)新:摒棄傳統(tǒng)RoPE位置編碼,改用相對注意力機制;結合全局與滑動窗口注意力(比例5:1),在保障計算效率的同時構建豐富特征表示。
- 多模態(tài)處理模塊:視覺方面采用分層MLP Patchifier生成圖塊嵌入;音頻方面通過離散化梅爾頻譜圖,將每100毫秒音頻片段分類至特定頻譜-bin。
- 其他優(yōu)化:引入短卷積(SConv)輔助局部特征處理,并采用共享專家Sink機制,從6個路由專家和2個共享專家中進行Top-k選擇。
靈活部署與推理方案
為適配不同硬件環(huán)境,Inkling提供多種部署路徑:
主流框架支持
推薦使用transformers庫(5.14.0+版本)的 pipeline。用戶可根據(jù)顯卡架構選擇BF16版本(Hopper及以上)或NVFP4量化版本(Blackwell架構)。SGLang和vLLM均提供高效部署支持,前者憑借自定義實現(xiàn)具備極速優(yōu)勢,后者適合生產環(huán)境,兩者均支持張量并行及OpenAI兼容API。
any-to-any
云端與本地輕量化
Hugging Face提供無服務器推理路由器,發(fā)布初期向所有用戶提供2小時免費額度。針對資源受限場景,Unsloth已將模型量化至1-bit精度,顯存占用降低95%;配合llama.cpp運行GGUF格式模型,可搭建本地OpenAI兼容服務,支持MCP集成及工具調用。
應用場景與性能表現(xiàn)
Inkling在多項復雜任務中展現(xiàn)出卓越能力:
- 智能體與代碼:結合Pi框架,模型能利用工具解決復雜數(shù)學及代碼任務,兼具低Token消耗優(yōu)勢。內置MTP層作為“草稿”生成器,在不犧牲質量前提下大幅提升推理速度。
- 多模態(tài)推理:在MMMU-Pro等視覺測試中,模型通過OCR提取文本后進行邏輯評估,中等推理強度(0.7)即可實現(xiàn)準確率與能耗的最佳平衡。在BigBenchAudio等音頻基準測試中,模型能精準識別多語種語音及形式謬誤,推理鏈條清晰。
- 后訓練生態(tài):官方推出專用工具tinker,結合OpenEnv環(huán)境和ECHO算法,支持在無驗證器情況下進行強化學習微調,或通過GOLD算法將知識蒸餾至端側小模型。
基準測試結果
據(jù)披露數(shù)據(jù),Inkling在關鍵基準測試中表現(xiàn)強勁,接近頂尖閉源模型水平:
- HLE(人類水平評估):得分40.5。
- AIME 2026(數(shù)學競賽):得分99.2,展現(xiàn)極強數(shù)學推理能力。
- SWE-bench Pro(軟件工程):得分62.1,代碼修復與生成能力穩(wěn)健。
- MCP-Atlas(智能體工具使用):得分76.8,驗證了復雜工具調用的可靠性。
Inkling的發(fā)布標志著開源多模態(tài)大模型在參數(shù)規(guī)模、上下文長度及推理效率上的重大突破,為新一代多模態(tài)應用奠定了堅實基礎。
【星途科訊 圖文丨LCC 首發(fā)于ZAKER科技,轉載請注明出處】
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.