![]()
![]()
半年融資超10億元、趨境科技高品質生產級AI Token服務快速擴張。
作者|田思奇
編輯|栗子
很多人以為,AI Infra最后拼的是三件事:算力更多、模型更全、Token單價更低。
過去兩年,行業競爭也確實沿著這個邏輯狂奔。Token正被越來越多人當作標準化商品——規模做大,價格做低,似乎就是終局。
但真實的企業生產場景,給出的答案截然不同。
趨境科技創始人兼CEO艾智遠在實踐中感受到一個反直覺的事實:低價并不是很多企業客戶追求的唯一甚至不是主要目標。價格太低,他們首先擔心的不是有沒有撿到便宜,而是服務能否長期穩定。
“這更像公司拉專線,而不是買普通家庭寬帶。專線不是奢侈品,而是生產環境對性能的硬性要求。”
這并不意味著企業不在意成本,而是衡量成本的方式變了——從“花多少錢把模型跑起來”,轉向“每一筆AI Token投入能產生多少業務價值”。消費級AI Token有望繼續普惠,而面向核心業務的生產級高品質AI Token,則因為能提供確定性服務,形成了更穩定的價格體系。
這場認知轉變,在過去一年里悄然加速。
回望2025年初的“DeepSeek時刻”,企業買大模型一體機做私有化部署,花的更多是研發和試錯預算。彼時,趨境科技依托和清華大學高性能所 KVCache.AI 團隊聯合開源的KTransformers異構推理框架,搭配CPU、GPU、內存、SSD全鏈路異構協同計算,幫助各類企業以極低門檻在單機硬件上跑通超大參數大模型,切中了私有化試錯的成本痛點。
今年,AI Coding等場景率先跑通商業化,Token開始真正接入業務系統。客戶的關注點也隨之遷移:代碼生成要1分鐘還是10秒?業務高峰會不會掉速?服務能否長期保持4個 9(全年99.99%穩定可用)?趨境過去積累的推理技術,也從幫助客戶部署模型,進化為穩定生產和運營高品質AI Token的能力。
在需求從“模型跑起來”轉向“持續生產”的關鍵節點,7月13日,趨境科技宣布完成新一輪融資,半年內累計融資金額超過10億元。本輪融資由河南投資集團匯融基金重磅領投,真知資本、尚勢資本、星連資本、上海國方創新、弘暉基金、華控基金、杭州福成等老股東持續超額跟投。
本輪資金將主要用于擴大高品質AI Token產能儲備、升級自研高效能AI Token生產服務平臺ATaaS(Approaching.AI Token as a Service),推動國產異構算力在核心生產場景中的規模化投產,并進一步建設面向頭部模型、互聯網平臺和區域產業生態的高品質AI Token工廠。
「甲子光年」獲悉,趨境科技的AI Token產能已從去年底的百億級增至如今的日均萬億級,且為頭部萬億參數大模型Token。2026年僅6月份的單月收入,已超過2025年全年總和。
但規模并不是AI Token工廠的全部。當請求長度從128 個Token波動到90K Token,大規模并發、長上下文、網絡波動和硬件故障同時出現,系統能否保證性能、隔離故障并控制單位成本,才是真正的考驗。
因此,趨境沒有選擇覆蓋盡可能多的模型,而是堅定走“少模型、深優化”路線。艾智遠觀察到,生產環境中,承擔絕大部分調用量、持續創造業務價值的,往往只有少數頭部模型。“模型超市”更強調選擇覆蓋面,而AI Token工廠強調交付確定性——最好用的模型,能否在真實流量下跑得足夠快、足夠穩且成本可控。
宣布本輪融資前夕,「甲子光年」與艾智遠進行了一場深入訪談,圍繞企業為何開始為高品質AI Token付費、日均萬億級AI Token如何穩定生產、國產異構算力怎樣進入核心場景,以及“少模型、深優化”背后的商業邏輯,展開了一場務實交流。
1.高品質Token,先過經濟賬
甲子光年:今年上半年,趨境累計融資超過10 億元,僅6月單月收入超過去年全年,增長驅動力是什么?公司目前處在怎樣的業務節點?
艾智遠:核心驅動力就一個——市場需求真正起來了。去年企業做私有化部署,更多是研發和試錯;今年AI Coding全面進入生產環境以后,Token用量很快爆發了。
尤其今年2月后,國內頭部模型的 Coding 能力持續提升,客戶從“不太敢用”轉向將其放進生產環境,需求的閘門一打開,我們在推理性能、系統穩定性和交付上的能力的積累,也順勢得到了集中釋放。
當然,AI Token生意需要規模化,算力仍是關鍵變量。這輪融資的主要目標就是用于擴大算力租賃、推進聯合運營項目和國產卡布局,建設更多AI Token工廠。
甲子光年:從一體機部署切換到做Token Services,趨境的產品和交付方式發生了什么變化?
艾智遠:我們今年其實依然在提供一體機,只是規模和目標變了。過去的一體機更多解決“怎么用較低成本把超大模型跑起來”,服務的是私有化部署和小規模試錯。現在的一體機主要面向已驗證場景的輕量化交付,幫客戶快速復制生產環境中的最佳實踐。
Token Services則更像持續運營。我們在自己租賃或客戶提供的算力基礎上,持續生產Token、服務客戶。機器每天都有成本,所以必須更準確地判斷客戶需求、業務規模和算力利用率。
我們切換比較快,核心是對自身技術有信心——相信能把推理的性價比做到足夠有競爭力。當時行業里已經有人做Token和MaaS,但大多還在虧損。我們的判斷是,憑借趨境在推理系統和工程能力上的積累,至少能把這筆賬算回來。現在的業務數據證明,這個判斷基本得到了驗證。
甲子光年:趨境如何定義高品質AI Token?
艾智遠:高品質AI Token不是單純速度快,也不是盲目追求高價,而是一整套生產級要求:低首Token響應時延、穩定高輸出速度、高并發處理能力、SLA可保障、模型效果不縮水,以及單位成本可控。
完成單項指標其實不難。比如用4臺機器只跑一個請求,速度肯定很好看,但經濟賬不成立。真正的難點在于,在滿足特定場景下所有指標的同時,還要把成本壓到可商業化的區間。
甲子光年:AI Token是否必然會出現分層?趨境為什么在其中選擇了面向企業生產環境的AI Token服務?
艾智遠:AI Token分層是行業必然趨勢。分層的本質不是模型能力有高下,而是不同業務對服務的訴求完全不同。有些任務慢一點沒關系,但在AI Coding這類生產場景里,等 1 分鐘和等 10 秒,直接決定了開發者是流暢推進還是反復卡頓。就像通信網絡從2G到5G,體驗一旦上去,用戶很難再回到過去。
面向C端的“模型超市”,更看重模型多、覆蓋面廣,但對速度、時延和穩定性的要求不一定那么極致。而生產環境恰恰相反——不需要特別多的模型,但每個模型都要跑得足夠穩、足夠快、足夠有性價比。這些恰好是我們技術最擅長的方向,也跟我們的商業模式和長期布局天然匹配。更重要的是,當前付費意愿最強、流量最穩定的恰恰是生產端客戶,所以我們選擇扎根這里。
甲子光年:模型越來越多的情況下,趨境為什么堅持“少模型、深優化”?
艾智遠:這是客戶選擇決定的。市面上雖有上百款模型,但客戶真正認為能進入生產環境的屈指可數。企業關注的無非三點:模型的智能穩定性、問題解決的效率以及能否實際提升業務指標。
我們不會為了堆數量而適配,而是始終圍繞客戶真實需要的AI能力來取舍。生產環境里,沒人會因為平臺接入了100款模型就下單,大家真正在意的是:最好用的模型能不能跑得足夠快、足夠穩,同時成本還在可接受的范圍里。
甲子光年:趨境目前同時采用直營和共同運營兩種模式,它們如何擴大高品質AI Token的供給規模?
艾智遠:上半年,趨境的AI Token供給仍以直營為主;下半年,一批共同運營項目將迎來集中落地。
直營模式是在租賃或獲取算力資源后,直接生產高品質AI Token并供給頭部模型廠商、互聯網平臺、AI應用公司和大型企業客戶等,其中,某頭部萬億級參數大模型,高品質AI Token日均產量已經穩定突破萬億量級。
共同運營主要面向計劃建設或已經擁有算力資源的地方政府、算力中心和云廠商。趨境不只是交付一套系統,而是承接AI Token工廠的整體規劃設計、建設交付與后續聯合運營,打通“設計-建設-生產-運營”的全流程。這種模式也能借助合作方已有的算力資源,以相對輕資產的方式擴大整體AI Token產能。
2.Benchmark之外的真實生產
甲子光年:對于Token客戶會如何提出自己的需求?AI Token工廠的含義是什么?
艾智遠:很多客戶一上來就會提很具體的要求,比如“我要支持6000人每天使用,至少500人并發,每路輸出50 Token每秒以上,系統該怎么建?”
我們需要從業務目標往回倒推——用什么模型、配什么芯片、集群和網絡怎么設計、硬件穩定性怎么保證。交付之后,客戶還會追問 API 兼容性、SLA怎么保障、不同業務怎么分級響應。
所以AI Token工廠不是買一批卡、裝一個開源引擎就完事了,而是從規劃設計、建設交付到投產運營的一整套工業化能力。它解決的不是"能不能跑"的問題,而是"能不能一直跑得好、跑得省、跑得穩"的問題——這才是生產環境和實驗室環境的本質區別。
甲子光年:真實生產流量和Benchmark最大的差別是什么,運營難點體現在哪里?
艾智遠:Benchmark通常在理想條件下做壓測,往往可以把性能調優的很高,但真實生產環境完全不同——請求長度、輸出長度、并發、網絡狀態、流量變化都在持續變化。一次輸入可能從128 Token到90K Token變化,超長的未緩存 Prompt會占用更多KV Cache塊和Prefill計算資源,可能造成排隊時間上升、緩存驅逐、資源碎片化或隊頭阻塞;當緩存放置、請求路由或負載分片不均衡時,還可能形成節點熱點、網絡擁塞等情況,會拖慢后續請求,甚至影響集群整體效率。
真正的難點從來不是簡單堆更多機器,而是在大規模并發下長期保障每個請求的響應質量、整條生產線的穩定性,以及單位產出的經濟性。
甲子光年:從KTransformers到異構 PD ,趨境如何進一步提升國產算力在生產級AI Token場景中的利用效率?
艾智遠:不同模型、場景和硬件的最優解并不一樣,所以生產高品質AI Token不能只做推理引擎,還要把芯片選型、模型優化、集群設計、網絡搭建和長期運維通盤考慮。
去年我們重點做單機異構,通過KTransformers讓CPU與消費級GPU協同運行超大模型,把客戶的試錯成本從幾百萬元降到十萬元級,同時積累了模型拆分和異構調度能力。
今年進一步從“單機異構”走向“集群異構”。新一代國產卡的8bit、乃至4bit算力其實非常有價值,關鍵是怎樣通過系統技術把這些算力組織起來,真正承載生產級AI Token服務需求。
趨境的方案是把國產卡集群與先進算力集群互聯,通過混合推理和異構PD,讓兩類算力分工協作,比如分別承擔Prefill和Decode,再配合集群互聯與調度,把國產卡有價值的算力利用起來。這樣既能擴大整體算力儲備,也能讓性價比更接近生產級要求,把異構PD真正做成能夠進入生產環境的方案,讓國產卡在真實業務場景中釋放出應有的性價比。
甲子光年:除此之外,趨境還實現了哪些面向大規模高品質AI Token生產的升級?
艾智遠:一方面是以存換算,這個我們2024年開始主導開源Mooncake系統中TE和Store等核心模塊的設計和實現,今年進一步落到千卡甚至更大規模集群,把不同節點的存儲連接成整體緩存,提高Cache命中率和首Token延遲(TTFT)穩定性。
不少場景的Cache命中率可以超過90%。如果100K Token的輸入只有10K需要重新計算,成本會顯著下降;命中率從90%提高到95%,需要重算的部分還會再減少一半。
另一個方面是虛實同構,主要解決的是大集群調度問題。集群擴大后容易出現熱點,不同流量的輸入、輸出特征也不一樣,固定PD策略很難一直適用。我們用CPU模擬GPU集群的運行邏輯,把策略迭代壓縮到小時級或半天級,提高集群利用率和AI Token產量。
甲子光年:趨境積極主導和參與了KTransformers、Mooncake等開源項目。在公司商業化進程中,開源項目的意義和作用是什么?
艾智遠:第一,開源是信任的起點。系統能力很難靠宣傳證明,開源項目就是最好的技術背書,客戶看到這些項目,天然就會建立起對趨境底層技術能力的信任。
第二,開源推動標準形成。與其閉門造車,不如共同圍繞開放的標準協作,標準越開放,云廠商、芯片廠商和上層軟件的協作成本越低、效率越高。
第三,開源是最好的迭代加速器。只靠一家創業公司,很難把實驗方案快速推到生產環境。和開源社區、云廠商、芯片廠商共同迭代,會加快平臺成熟,形成開源與商業化產品的正向循環。
3.AI的終點,不止是Token
甲子光年:從學術研究到產業界,再到創辦趨境,您對技術和商業之間關系的理解發生了什么變化?
艾智遠:我在產業界做過比較多產品,也接觸過很多市場和客戶。最大的變化,是看到技術和客戶需求之間存在Gap。很多技術想法不一定能落到客戶場景里。
做科研更關注技術有沒有創新性;做商業化,要看能不能供應、能不能交付,客戶能不能真正使用。技術人員可能希望不計成本把Token速度做到極致,但客戶會說,每秒50個Token已經夠了,關鍵是服務不能經常掉線,最好成本再低一些。穩定性在論文里不一定最有創新性,但在商業里可能是成本可控情況下的第一優先級。
甲子光年:2023年決定創業時,趨境為什么選擇做推理?當時對什么最有信心,什么還存在不確定性?
艾智遠: 當時最確定的是我們的優勢所在——系統、大集群計算優化和計算效率提升。雖然正值百模大戰,但我們判斷,第三方訓練很難形成獨立付費市場,資源最終會向少數頭部模型廠商集中。
但模型只要落地,推理就是剛需,而且推理與業務深度綁定,遠不只是一個引擎或性能問題。Kimi、智譜GLM等模型已經開源,我們也預判更好的智能會來自更長的上下文和更大參數的模型,所以很早就開始研究KV Cache、內存與顯存之間的數據搬運,以及PCIe帶寬等問題。后來AI Coding進入100K上下文場景,這些提前布局自然轉化成了生產級能力。
最大的不確定性,是模型能力到底什么時候才能讓客戶真金白銀付費。如果沒有應用場景,推理就只是個成本項。實際進展比我們預想的快得多——DeepSeek爆發以后,模型迅速進入生產場景,推理也快速進入了真實付費階段。
甲子光年:從MaaS、一體機到Token、Agent,行業關注點為什么一直變化?Agent為何尚未大規模落地,接下來可能從哪些場景突破?
艾智遠:這些概念其實一直存在,只是不同階段行業關注的重心不同。前幾年大家聚焦模型能力;后來模型開始落地,一體機和推理部署被看見;今年生產場景起量,Token又成了更直觀的計量方式。這更像技術發展過程中的曝光輪動。
Agent尚未大規模落地,原因有兩層:一方面是很多能力正在被模型吸收,邊界在模糊,另一方面是模型在幻覺、穩定性和生產可用性上,還沒有完全過線。
AI Coding本身是一種“原能力”。它不只改變程序員寫代碼的習慣,也會重塑軟件和數字化系統的生成方式,例如直接生成H5頁面和業務界面,以及智能駕艙、辦公、財務和HR輔助。未來一兩年,這些能力會逐漸長出更多落地應用。
甲子光年:面對這些變化,未來一兩年趨境希望達到什么里程碑?長期邊界在哪里?
艾智遠:短期來看,我們希望到明年或后年,趨境直營和共同運營體系的Token供應量實現十幾倍到幾十倍提升,達到日均幾十萬億AI Token產量。
但AI Token只是現階段比較明確的計量方式。隨著模型和應用繼續發展,AI計算會向多模態、視頻和Agent方向進一步擴展,未來衡量產出的方式也可能發生變化。
我們的公司名“趨境”,本身就是不斷接近的意思。AGI不會在某一天突然完成,而是在技術和應用的演進中一步步逼近。我們希望趨境能在這個過程中扮演好自己的角色——讓不同AI任務在不同算力上都獲得更好的穩定性和性價比,把底層算力持續轉化為可運營、能創造經濟價值的AI產能,幫助更多應用真正扎根生產環境。
(封面圖來源:AI生成)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.