谷歌正在開發一款專為其Gemini AI模型量身定制的新型服務器芯片,將模型架構直接固化于硅片之中,以大幅提升AI推理效率。
據科技媒體The Information周一報道,這款被內部稱為"Frozen v2"的芯片效率或達現有自研芯片的6至10倍,最早有望于2028年投入部署。
兩位直接知情人士向該媒體透露,這一項目的直接驅動力,是谷歌內部嚴峻的AI算力短缺問題——這一短缺已引發內部矛盾,并迫使谷歌云拒絕部分外部客戶的合作請求。Frozen v2將部分Gemini模型的決策邏輯預先嵌入芯片,從而減少運行時的計算步驟與數據搬運量,以提升響應速度并降低單位算力功耗。
谷歌發言人在聲明中表示,公司團隊"持續研究和探索新創新,以為用戶和客戶提供最高性能與效率",并補充稱"并非每個項目都會進入量產,但這種嚴格的探索是我們全棧方法的核心"。
受上述消息提振,谷歌股價周一盤中一度上漲3.7%,最終收漲1.52%。
專用推理芯片:效率優先的架構賭注
Frozen v2的核心設計理念,在于將Gemini模型的底層架構永久刻入芯片硅基,使其在處理推理請求時無需像通用芯片那樣進行大量實時決策。
報道稱,以每單位功耗可處理的token數量衡量,該芯片的效率預計達到谷歌現有最新一代自研AI芯片的6至10倍。
這一邏輯與通用AI芯片形成鮮明對比。谷歌現有的張量處理器(TPU)與英偉達的GPU類似,均設計為兼容多種AI模型,因此在運行特定模型時需要處理大量動態決策過程。Frozen v2通過預先固化部分決策,換取更高的運行效率,但代價是通用性的降低。
谷歌正在評估應將多少信息鎖定于芯片之中,以在靈活性與效率之間取得平衡。知情人士指出,Frozen v2芯片僅能兼容與設計時所采用的相同底層架構的Gemini后續版本,這意味著谷歌實際上是在押注自身將長期沿用當前的Gemini模型架構。谷歌表示,芯片可支持模型權重的更新——即決定模型如何響應問題的參數設置。
項目沿革:從"全固化"到"彈性固化"
Frozen項目并非全新構想。
報道稱,其前身為最初由谷歌DeepMind首席科學家Jeff Dean主導的"原版Frozen"方案,該方案計劃將模型權重本身直接燒錄進芯片。然而,由于這一設計將使芯片僅能服務于某一特定版本的Gemini模型,生命周期過短,該方案已被擱置。
Frozen v2在此基礎上作出調整,轉向"彈性固化"思路——固化模型架構而非具體權重,從而在保留效率優勢的同時延長芯片使用周期。
在行業參照系上,加拿大芯片初創公司Taalas采用了類似的將特定AI模型硬編碼入芯片的設計理念,目前已從Quiet Capital、富達等投資方融資逾2億美元。相比之下,SambaNova、d-Matrix及OpenAI、微軟等公司也在開發推理芯片,但技術路徑與谷歌有所不同。英偉達則于去年12月斥資200億美元與推理芯片初創公司Groq達成技術授權協議,以強化自身在推理市場的布局。
定位:TPU之外的新分支,而非替代品
谷歌明確將Frozen v2定位為TPU產品線之外的新分支,而非對其現有自研芯片體系的替代。TPU與英偉達GPU同屬通用AI芯片,可兼容多種模型;Frozen v2則專為Gemini打造,兩條產品線將并行發展。
谷歌目前尚無將Frozen v2規模擴產至與TPU相當體量的計劃。
知情人士表示,相對有限的部署規模使谷歌得以在項目后期再引入外部設計與制造合作伙伴,而無需像重大產品發布那樣提前大規模統籌。此外,谷歌也將這一代產品部分視為工程試驗——為工程師積累開發更高專用化芯片的經驗,尤其是在AI模型架構逐漸趨于穩定的背景下。
谷歌現有的自研芯片戰略已初見成效。
今年,谷歌發布了第八代TPU,并開始將其直接向云計算客戶銷售,向英偉達的主導地位發起挑戰。谷歌已與Meta簽署數十億美元規模的TPU租用協議,并正積極爭取其他云服務提供商客戶。知情人士表示,自主研發芯片已使谷歌能夠以更低成本運行Gemini模型——Frozen v2若能成功,則有望將這一成本優勢進一步放大。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.