深度觀察
大模型的成本結構,可能正面臨一次根本性的松動。
不追熱點本身,先看它改變了什么。
一家名叫 Subquadratic 的邁阿密初創公司上月走出隱身模式,聲稱解決了拖慢大語言模型的核心瓶頸。
這個瓶頸不是參數規模,不是訓練數據,而是每次推理時都躲不開的那道算術墻。
![]()
瓶頸不在模型大小,而在每次推理的代價
過去兩年,人們習慣用“參數量”衡量模型能力。
但真正讓大模型昂貴的,是使用它的過程。
當你向聊天機器人發送一段長文、讓 AI 分析一份合同、或者要求它根據整本書回答問題,模型內部發生了一件計算量爆炸的事。
Transformer 架構的注意力機制,需要讓每個詞都和所有其他詞做一次交互。
在傳統 Transformer 架構中,注意力計算常被認為具有隨輸入長度平方增長的特性。
在短文本時代,這個代價尚可承受。
但當模型上下文窗口從 4k token 擴展到 128k、1M token,推理成本迅速成為商業化的真正天花板。
一個長文檔問答請求,背后消耗的算力可能等價于生成數百條短回復。
這就是為什么許多長上下文模型雖然發布,實際調用量卻很低。
用戶不是在為智能付費,而是在為長度付費。
從二次方到亞二次方,改變了什么結構
Subquadratic 的名字本身就是一張技術路線圖。
該公司宣稱其系統能顯著降低注意力計算的復雜度,但未公布具體技術細節和實測數據。
如果該技術有效,處理長文本所需計算時間的增長幅度可能遠低于傳統方案,但實際效果尚待驗證。
推理延遲不再隨上下文長度劇烈膨脹。
API 調用成本有可能出現明顯下降,但降幅取決于技術落地情況和實際性能。
改變的結構,首先是成本。
那些依賴長文本處理的行業——法律合規、金融研報、學術研究、客服知識庫——將突然發現,部署大模型的單位經濟學變得成立。
其次是入口。
當推理足夠便宜,大模型就不再是一個需要精打細算的昂貴工具,而可以嵌入到每一個文檔編輯器、每一個郵件客戶端、每一個內容管理系統的右鍵菜單里。
用戶習慣會從“我有一件重要的事才打開 ChatGPT”,變成“選中一段文字,AI 就在旁邊”。
供給鏈也會被擾動。
目前云服務商的推理收入很大程度上建立在現有架構的高能耗之上。
如果新架構能大幅降低算力需求,相關硬件、云服務和模型市場的格局可能發生變化。
誰在受益,誰只是被討論
最直接的受益者是應用層。
那些在垂直場景里做文檔理解、長文生成、代碼審查的團隊,將獲得更大的利潤空間和更自由的用戶體驗設計。
內容創作者和職場人也會感受到變化。
理論上,自媒體作者或許能讓 AI 快速處理大量歷史文章并提煉風格,但這取決于技術能否實現。
一個分析師可以扔進幾百頁的調研記錄,幾分鐘內拿到結構化摘要。
這些任務現在也能做,只是太慢、太貴,所以很少有人真的用。
被擠壓的一方,可能是那些把“長上下文”當作高端定價錨點的模型廠商。
如果推理成本普降,長上下文的溢價就會消失,競爭重新回到模型能力和產品體驗本身。
短期被討論的,當然是 Subquadratic 這家公司本身。
但技術突破的新聞周期很短,真正值得關注的,不是它有沒有登上頭條,而是它有沒有改變開發者的選擇。
![]()
高估的風險:實驗室里的突破與生產環境的距離
大模型領域從來不缺“顛覆性架構”。
線性注意力、狀態空間模型、稀疏注意力……幾乎每季度都有論文聲稱在某個基準上逼近甚至超越 Transformer,同時復雜度更低。
但絕大多數沒能走出實驗室。
原因往往藏在細節里:有的方案在理論復雜度上漂亮,但在實際 GPU 上的利用率很低;有的方案在短文本上表現尚可,一上長文本就出現記憶丟失;有的方案需要配套特殊的硬件或編譯器,導致部署成本不降反升。
Subquadratic 目前披露的公開信息非常有限。
它沒有發布詳細的基準測試,也沒有給出可復現的開源模型。
如果它走的是一條需要定制芯片的路線,那么從技術原型到大規模商用,中間至少隔著一次半導體周期的距離。
另一個值得注意的點是,成本下降的幅度可能被過度預期。
推理成本只是大模型總擁有成本的一部分。
模型訓練、數據工程、持續微調、安全對齊,這些環節的支出并不會因為推理優化而消失。
如果市場把推理成本的改善等同于大模型民主化的全部,很可能會低估產品化過程中其他環節的阻力。
讀者可以觀察的五個信號
普通讀者不需要看懂論文,但可以通過幾個低成本信號,判斷這件事是否在真實推進。
一個值得關注的信號是,該公司是否會推出公開可用的 API。
如果 Subquadratic 只是停留在博客和媒體報道,沒有讓外部開發者實際調用,那么驗證周期會很長。
第二個信號是,是否有獨立第三方用相同硬件環境測試延遲和成本。
公司自己公布的對比數字往往選擇最有利的條件,獨立復現才是行業慣例。
第三個信號是,是否有云廠商或大型企業客戶簽約。
初創公司的技術要進入生產環境,通常需要借助云平臺或標桿客戶的背書。
第四個信號是,是否開源模型權重或推理代碼。
開源會極大加速社區驗證,也能反映團隊對自身技術的信心。
第五個信號是,早期使用者的真實反饋。
可以觀察早期用戶是否真正采用該技術替代現有方案,而不僅僅是表達興趣。
![]()
這件事對內容、職業和消費決策的意義
如果推理成本顯著降低,AI 的應用模式可能從按次調用轉向持續在線的輔助角色。
對內容創作者,這意味著創作流程可以全程嵌入 AI,而不是只在某個環節使用。
對職場人,這意味著處理信息的基礎設施成本會降到令人忽略的程度,信息篩選和整合的效率可能再上一個臺階。
但決策的時機還不成熟。
現在更適合做的是把這類突破放進一個觀察清單,而不是立刻調整業務方向或技術棧。
大模型的天花板不止一塊,推理效率只是其中一塊。
當一塊天花板松動,通常意味著新的結構正在形成,而不是舊結構立刻崩塌。
保持關注,但保持判斷的距離。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.