![]()
“硅仙人”的又一力作。
近日,由業(yè)界知名芯片設(shè)計(jì)師Jim Keller掌舵的人工智能計(jì)算公司Tenstorrent,在日本東京舉行的TT-Deploy JP大會上推出適配智能體AI的TT-Ascalon S RISC-V CPU IP,其僅用一半的面積就實(shí)現(xiàn)了前一代1.4 倍的單位面積性能。
據(jù)了解,本次大會公布的所有技術(shù)突破與落地項(xiàng)目,均依托Tenstorrent核心的單一AI架構(gòu)搭建。該架構(gòu)最大優(yōu)勢在于運(yùn)行大型AI工作負(fù)載的速度優(yōu)于傳統(tǒng)GPU,同時具備極強(qiáng)的拓展性,可憑借標(biāo)準(zhǔn)以太網(wǎng),從授權(quán)核心靈活拓展至Tenstorrent Galaxy超級集群,兼顧高性能與高適配性,打破了傳統(tǒng)AI部署的性能與拓展瓶頸。相較于行業(yè)主流方案,Tenstorrent網(wǎng)絡(luò)化AI架構(gòu)具備開放、通用、靈活的核心特質(zhì),支持異構(gòu)部署與獨(dú)立部署雙重模式,能夠適配AI行業(yè)快速迭代的發(fā)展節(jié)奏,為企業(yè)級AI部署提供全新解決方案。
在AI推理性能層面,Tenstorrent基于現(xiàn)有技術(shù)持續(xù)迭代升級,公布了Galaxy Blackhole超級集群的最新基準(zhǔn)測試數(shù)據(jù),在大語言模型、視頻生成領(lǐng)域?qū)崿F(xiàn)跨越式突破,多項(xiàng)指標(biāo)大幅超越GPU設(shè)備。大語言模型推理方面,Kimi K2.6模型實(shí)現(xiàn)每秒每用戶900個token的處理速度,性能達(dá)到GPU的3倍;DeepSeek-R1-0528 671B模型單用戶每秒可處理超400個token,較此前TT-Deploy SF大會公布的350余個token/秒的成績實(shí)現(xiàn)穩(wěn)步提升。
視頻智能處理領(lǐng)域,Tenstorrent的技術(shù)優(yōu)勢更為突出。其搭載的LTX 2.3 Fast模型,可在144幀/秒的高速下生成6秒、24幀標(biāo)準(zhǔn)畫質(zhì)的視頻,全程完美適配音頻與唇音同步效果,整體處理速度是GPU的4倍。值得關(guān)注的是,該架構(gòu)可兼容多款不同系列AI模型,且系統(tǒng)容量能夠隨Galaxy集群規(guī)模擴(kuò)大實(shí)現(xiàn)近乎線性增長,助力企業(yè)低成本、高效率拓展高級AI推理工作負(fù)載,適配規(guī)模化商用場景。
本次大會的核心新品之一——TT-Ascalon S高密度RISC-V CPU IP,標(biāo)志著Tenstorrent進(jìn)一步完善AI硬件產(chǎn)品矩陣,適配新興智能體AI工作負(fù)載需求。相較于傳統(tǒng)AI算力依賴原始計(jì)算能力的特點(diǎn),智能體AI更考驗(yàn)設(shè)備的任務(wù)編排、IO交互與低延遲執(zhí)行能力,TT-Ascalon S專為這一場景優(yōu)化升級。該產(chǎn)品基于TT-Ascalon X迭代研發(fā),芯片尺寸縮小約50%,單位面積性能提升140%,兼具高密度、高能效、低延遲三大優(yōu)勢。
能效與延遲優(yōu)化上,TT-Ascalon S采用緊湊節(jié)能設(shè)計(jì),適配高吞吐量AI執(zhí)行層部署;同時針對智能體典型的混合運(yùn)算、分支密集、工具高頻連接的運(yùn)行模式深度調(diào)優(yōu),可實(shí)現(xiàn)可預(yù)測的穩(wěn)定執(zhí)行,大幅降低智能體交互延遲。除智能體AI外,該產(chǎn)品還可廣泛應(yīng)用于高效服務(wù)器、網(wǎng)絡(luò)存儲SoC、數(shù)據(jù)中心邊緣等場景,且支持IP授權(quán)模式,允許客戶基于該架構(gòu)開展定制化芯片設(shè)計(jì),靈活性極高。
此外,Tenstorrent表示,此前推出的TT-Ascalon系列高性能RISC-V CPU,已是行業(yè)頂尖水平的RISC-V CPU IP產(chǎn)品。該芯片全面兼容RVA23規(guī)范與RVV1.0矢量引擎,支持硬件虛擬化、高級內(nèi)存管理、安全防護(hù)與RAS可靠性運(yùn)維功能,經(jīng)SPEC CPU權(quán)威基準(zhǔn)測試驗(yàn)證,SPECint?2006/GHz超22、SPECint?2017/GHz超2.3、SPECfp?2017/GHz超3.6,在三星SF4X工藝節(jié)點(diǎn)下主頻可達(dá)2.5GHz以上,性能比肩高端專屬架構(gòu)處理器,可覆蓋服務(wù)器、AI基礎(chǔ)設(shè)施、車載HPC、ADAS等多場景。
生態(tài)布局方面,Tenstorrent已完成GCC、LLVM、Qemu三大主流工具鏈的全線適配并完成上游提交,開發(fā)者可快速部署適配RVA23規(guī)范的軟件,保障生態(tài)兼容性。同時,Tenstorrent推出創(chuàng)新IP許可計(jì)劃,助力企業(yè)自主持有、定制化改造核心算力IP,并聯(lián)合CoreLab搭建區(qū)域服務(wù)體系,為客戶提供設(shè)計(jì)優(yōu)化、落地適配、規(guī)模化部署的全流程支持。
Jim Keller在此前接受采訪時表示,AI芯片競爭已經(jīng)不再是單點(diǎn)算力的比拼,而是系統(tǒng)架構(gòu)、成本結(jié)構(gòu)與生態(tài)能力的全面競爭,Tenstorrent將全面擊敗晶圓級AI芯片廠商Cerebras,并且拒絕被收購,會以IPO為目標(biāo)努力。
Tenstorrent目前已經(jīng)收到了硬件訂單,其中最大的采購訂單是一個96臺Galaxy集群(即3072顆Blackhole芯片),將發(fā)往美國以外的地區(qū)。Tenstorrent迄今為止最大的客戶是日本的AI&。
*聲明:本文系原作者創(chuàng)作。文章內(nèi)容系其個人觀點(diǎn),我方轉(zhuǎn)載僅為分享與討論,不代表我方贊成或認(rèn)同,如有異議,請聯(lián)系后臺。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.