![]()
作者丨薛皓皓
編輯丨關雎
過去一年,美國科技圈掀起了一波以AI為名的裁員潮。邏輯很簡單:AI能干活,人就可以少要。
但現實并不如預期順利。
一項對300多家企業HR的訪談顯示,有36%的公司裁掉員工之后,不得不把裁掉人數的其中一半重新招了回來。原因是AI還不夠穩定,很多活還是得人來干。
更諷刺的是,裁員省下的錢,被AI的Token賬單吃掉了。
Uber是最典型的案例。去年12月,Uber大力推廣AI編碼工具,工程師普及率很快達到95%。但4個月后,Uber全年的AI預算就被打穿。總裁隨即下令:每人每月AI工具開銷,上限卡死在1500美元。
另一個極端案例與OpenClaw有關。2026年5月,已加入OpenAI的OpenClaw創始人Peter Steinberger發布了一張使用統計截圖。據媒體報道,其三人團隊使用了約100個Codex編碼智能體實例;過去30天共發起約760萬次請求,消耗約6030億個Token, 使用的API等價成本約為130.5萬美元。
這背后有一個結構性原因:智能體不是在一步步完成任務,而是在反復循環,把每一輪的代碼、報錯日志、搜索結果重新塞進上下文窗口,Token越燒越多。普通對話每輪消耗約1萬個Token,推理模型升到10萬,智能體動輒超過100萬。同一個任務跑兩次,消耗量可以相差30倍。
這場賬單危機,正在倒逼整個行業重新思考AI的運行方式。為此,創業邦與引航陪跑創業營的教練——原高通全球副總裁沈勁聊了聊這個話題。
01 Token消耗量上漲100倍
沈勁未曾想到,跑AI Agent會如此花錢。
作為投資人,他每天需要處理大量的郵件、微信消息和短信通知。這些事情繁瑣但并不復雜,正是AI智能體最擅長的領域。于是他在某知名通用AI Agent平臺上搭建了一套工作流,設定好觸發條件,讓智能體每天自動跑一遍。
結果剛運行了一天,就出事了。
他一個月擁有8000積分的額度,按正常使用節奏,這筆預算足夠支撐一個月的AI智能體花銷。但智能體啟動后,它并沒有在高效地處理任務,而是出現了各類BUG,更嚴重的是一天之內,8000個積分全部歸零。
沈勁隨即給平臺方寫了一封郵件,語氣克制但訴求明確:我用了你們的官方模板,按標準流程跑了一遍,BUG沒有修復,8000個積分都沒了,請補回來。
對方沒有回復。
“可能他們剛融完資,近期推廣推得又很猛,顧不上處理這種售后的事情。”沈勁后來這樣解釋。平臺方的沉默持續了整整一個月,直到下個月系統自動重置,才又發放了新的8000積分。
“現在我不太敢用了,估計過兩天就把訂閱取消掉。”他說這話的時候語氣平淡,但背后的結論卻很尖銳——
這不是他一人遇到的現象,而是整個行業都面臨的問題。
微軟也存在類似情況。旗下的設備體驗部門(負責 Windows、Microsoft 365、Teams 等產品)曾為數千名開發人員,甚至設計師和項目經理,都開放了Claude Code使用權限。結果這一產品在內部大受歡迎,賬單也隨之失控,為了避免過高的開支,該部門要求在今年6月末,取消絕大多數內部的 Claude Code 許可證。
隨著ChatGPT橫空出世后,Token消耗也隨著技術沿革發生了指數級別的飆升。沈勁認為,ChatGPT類的對話式AI每輪消耗約1萬個Token,推理模型后每輪消耗約10萬個Token,智能體則每輪消耗約100萬個Token。
![]()
所以,從1萬個Token飆升至100萬個Token,單位使用量在三年多的時間暴漲100倍。
這100倍消耗中的絕大部分,并非用于生成內容(比如代碼、文字、圖片),而是用于數據輸入。
以代碼生成的案例來看,從相關研究顯示,輸入Token和輸出Token之比高達154:1。那輸出一個Token,需要輸入154個Token,那154個Token用在哪里?
答案是AI將Token用于反復循環地讀取代碼庫和報錯日志。在每一輪對話中,AI把上一輪的工具調用結果、報錯信息、網頁搜索、代碼內容等重新打包輸入,再進行下一輪修改。對話次數越多,輸入的Token消耗量越大,Token消耗量就像滾雪球般急劇上升。
Token消耗量在三年時間暴漲的另一個原因在于,成本的不可預測。同一個任務,執行兩次,Token消耗差距可達30倍——“做完這次任務花10美元,下次同樣任務可能要花300美元”沈勁說。
企業本指望AI編程實現降本增效,結果卻可能適得其反。
Meta、微軟等硅谷高科技大廠已在今年上半年裁掉超10萬個崗位,AI成為最頻繁提及的理由——企業期望用AI替代人工,而壓縮成本并提高效率。
諷刺的是,許多企業發現高昂的AI賬單,疊加昂貴的遣散費用,已把AI帶來“降本增效”紅利消耗殆盡。
“最近有一項報告說明,超過三分之一的企業裁掉員工后,不得不再召回裁掉用工數量的一半,因為他們發現AI并未帶來預期程度的節省成本和提高效率。”沈勁說。
02 GPU贏了三年,CPU要翻身了
智能體AI給我們帶來的變化, 不僅僅是昂貴的Token消耗, 也讓CPU要咸魚翻身了. 過去三年多時間,所有人的注意力都在GPU上。2025年,Meta、微軟、谷歌和亞馬遜僅這4家公司,就在AI智算中心上花費超3000億美元,而其中六成用于采購GPU。
在AI智算中心的一臺服務器內部,GPU和CPU配比約為8:1,GPU需求量遠高于CPU。
GPU和CPU需求量的懸殊差距,也反映在頭部公司的市值上:2025年底,GPU頭部公司英偉達市值突破三萬億美元,而同期CPU頭部公司英特爾市值僅不到2000億美元。
不過在沈勁看來,GPU和CPU配比正在發生關鍵變化:GPU和CPU之比,正從8:1轉變為1:1。“在AI Agent時代,CPU正在悄然回到舞臺中央。”沈勁說。
GPU的強項在于生成內容,但AI Agent最消耗資源的地方,不是在內容生成,是在“編排”和“調度”,這是CPU的強項。
![]()
具體而言,AI Agent需要CPU做以下工作:任務編排(決定先做什么、再做什么)、狀態的持久化維護(記住上一步做到哪里了)、高并發的API調用(同時向多個外部系統發出請求)、復雜的沙盒環境管理(給代碼運行提供隔離的測試空間),以及調用各種工具——瀏覽器、數據庫、搜索引擎。
沈勁以自身訂機票的案例來說明CPU對Agent的作用:他曾用Agent幫自己搜索一段極其苛刻的多航段行程:上海出發,途經西班牙、多倫多,最終抵達圣地亞哥;超過7小時的航段必須是能躺平的商務艙,7小時以內的航段只要經濟艙;所有方案里總價最便宜,且登機時間不能太早。
這個任務,智能體需反復調用各大航空公司的數據接口和攜程這樣的OTA平臺,把幾十種方案的價格、艙位、時間全部拉取出來,再按照多個條件進行比對和篩選。
整個過程里,GPU幾乎無用武之地——整個過程幾乎不涉及內容生成,有的只是海量的數據調取、比較和編排。最終,CPU相對GPU的使用率飆升到了70%~80%。
沈勁還分享了幾個具體案例:
![]()
由此可見,任務越復雜、越依賴外部數據調取和多步驟編排,CPU的占比就越高。
如今,新的AI硬件想將云端的運算模式,轉變為電腦本地的運算模式。
這背后的邏輯并不復雜。云端的運算模式,是一個“用多少花多少”的Token計量方式——每一次調用、每一輪循環,都在按Token計費。智能體的“上下文雪球效應”讓這個問題雪上加霜:循環越多,輸入Token越多,賬單越高,沒有上限。
更重要的是,云端數據中心的硬件配置是以GPU為核心設計的(GPU與CPU的比例約為8:1),而GPU本身就是為大規模內容生成優化的,并不擅長智能體所需要的高頻調度和工具調用——這些恰恰是CPU的強項。
本地設備則完全不同。每臺PC里都有性能強勁的CPU,天然適合承接智能體的編排和調度工作;更關鍵的是,本地運算不按Token計費,智能體跑多少輪、循環多少次,都不會產生額外的賬單。
今年6月1日,英偉達在臺灣發布的RTX Spark硬件,正是專門針對本地AI Agent適配的新型硬件載體。
這臺設備的核心,是一顆專門為智能體打造的定制芯片N1X——它把GPU和CPU封裝在一起。而且,英偉達與微軟合作,對Windows 11進行了13項關鍵能力的底層改造,目標是把傳統的PC操作系統升級為"智能體OS"——既能讓智能體在本地高效運行,又能兼容用戶已經習慣的所有軟件。
03蘋果:打造兼具隱私和省錢的AI
英偉達RTX Spark將把算力從云端拉回本地,但在云端和終端分布式AI方面,蘋果一直處于第一梯隊。
在近期舉辦的WWDC上,蘋果正式推出了自己全新的AI解決方案。“當硅谷大廠都在卷上千億、上萬億參數的大語言模型時,蘋果卻在追求最懂個人、最安全、最能調度各類工具的AI。”沈勁認為。
蘋果推出了按照AI任務復雜度而切分的五層系統。
第一層在手機本地, 一個30億參數的輕量模型,專門處理每天被觸發幾十次的日常需求:總結通知、提煉短信摘要、調整寫作語氣。它完全不聯網,Token成本為0。
第二層也在手機本地, 一個200億參數的稀疏模型,每次只激活其中10到40億參數。它負責更高質量的Siri對話、多模態理解(比如看懂照片里的內容)。依然不聯網,Token成本為0。
第三層開始上云,但上的是蘋果自己的私有云。當任務涉及復雜推理、多步驟的智能體工作流、或者高質量圖像生成時,請求會被送到裝有蘋果自研芯片的服務器上,由蘋果自研的主力語言模型來處理。
第四層也在蘋果私有云,負責處理的是高質量圖像生成和復雜的圖像編輯,用的也是蘋果自研模型。
第五層會在谷歌公有云,跑在英偉達GPU上,處理前四層都搞不定的極端任務,比如高級數學推理和極復雜的多模態理解。
沈勁認為,蘋果這套分層架構同時服務于兩個目標:省錢和保護隱私。能在手機本地解決的,絕不上云;必須上云的,優先走蘋果自己的私有云;只有極少數最復雜的任務,才會流入谷歌的公有云。
![]()
對于這場Token賬單的失控,沈勁認為至少有四個值得創業者思考的方向:
第一個方向,是做消費類AI終端以及在終端的AI小模型。手機市場已經沒有懸念——國內就那五六家,格局早已鎖死。但手機之外的C端設備,盒子、眼鏡、手表,依然有著諸多機遇。
第二個方向,是做分布式智能體AI的運營商。當端云協同成為主流,必然需要一個調度層——它的工作是判斷哪個任務在哪里跑最合適:本地小模型、蘋果私有云、還是公有云大模型,并負責任務編排和狀態維護。
第三個方向,做Context Engineering(上下文工程)技術公司。目前,Token消耗本身的問題,還未完全解決。他的判斷是:如果有一家公司能做出一個中間層,讓企業的請求在進入云端大模型之前先經過壓縮和優化,把Token消耗減少60%,“肯定很多公司愿意通過這一平臺來做”。
第四個方向,做CPU,不論是超算中心的CPU,還是PC、手機、邊緣盒子等終端的CPU,都是創業的極佳的方向。
歡迎點擊鏈接報名引航陪跑創業營:https://www.coachingcamp.cn/
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.