![]()
Agent 時代,哪些方向正在成為行業(yè)關(guān)鍵變量?50 + 實戰(zhàn)案例揭曉答案!
模型參數(shù)規(guī)模不斷突破,推理成本持續(xù)下降,開源生態(tài)日益繁榮。當模型能力逐漸成為行業(yè)共識,一個新的問題開始浮現(xiàn):當人人都能獲得強大的模型能力之后,真正的競爭力還剩下什么?答案正在從模型能力本身,轉(zhuǎn)向圍繞模型構(gòu)建可規(guī)模化的智能系統(tǒng);從單點能力提升,轉(zhuǎn)向系統(tǒng)工程與組織級落地能力。
在這一背景下,2026 年 AICon 人工智能開發(fā)與應(yīng)用大會 · 深圳站正式啟動。本次大會將于8 月 21 日—22 日舉辦,聚焦 AI 基礎(chǔ)設(shè)施、大模型系統(tǒng)、智能體工程、數(shù)據(jù)智能、多模態(tài)技術(shù)與行業(yè)落地等關(guān)鍵方向,邀請來自騰訊、阿里、華為、百度、螞蟻集團等 50 + 頭部科技企業(yè)技術(shù)負責人、科研機構(gòu)一線專家,系統(tǒng)性分享前沿洞察與實戰(zhàn)干貨,共同探討 AI 技術(shù)從能力到系統(tǒng)、從實驗到生產(chǎn)的真實路徑。
SGLang, RadixArk Engineer 楊雨豪已確認出席 “AI Infra、推理工程與異構(gòu)計算” 專題,并發(fā)表題為《百萬上下文下的 DeepSeek V4:SGLang 推理優(yōu)化實戰(zhàn)》的主題分享。DeepSeek V4 模型采用了由 SWA(滑窗注意力)、CSA(壓縮稀疏注意力,4:1 壓縮 +TopK 篩選)和 HCA(高壓縮注意力,128:1 壓縮)組成的混合注意力架構(gòu),相較于 V3 單一的 MLA 結(jié)構(gòu)更為復(fù)雜,同時模型支持百萬級上下文長度,對推理框架的緩存管理、算子效率和并行策略提出了嚴苛挑戰(zhàn)。本次演講分享 SGLang 團隊如何通過緩存架構(gòu)、算子融合和并行策略的全棧優(yōu)化,實現(xiàn) DeepSeek-V4 百萬上下文推理的 Day-0 支持與持續(xù)性能提升,并結(jié)合 InferenceX 公開基準展示在 GB300 NVL72 上的實測結(jié)果。他在本次會議的詳細演講內(nèi)容如下:
演講提綱:
一、DeepSeek V4 推理的核心挑戰(zhàn)
混合注意力架構(gòu)的復(fù)雜性:SWA(滑窗 128)、CSA(4:1 壓縮 + TopK 稀疏篩選)、HCA(128:1 純壓縮)三種異構(gòu) Attention 共存,每種有獨立的 KV Cache 生命周期和索引邏輯
百萬級上下文帶來的內(nèi)存與計算壓力:KV Cache 顯存占用激增,TopK 等索引操作在長序列下成為瓶頸
Compressor 機制引入跨 token 依賴:CSA/HCA 的 KV 計算需復(fù)用前序 token 中間狀態(tài),打破了傳統(tǒng)逐 token 獨立計算的假設(shè)
二、ShadowRadix:三套 KV Cache 的統(tǒng)一管理
在 RadixTree 上擴展虛擬地址表,每個 token 分配唯一虛擬位置,通過除法映射到三組 Shadow 頁表(SWA 原始位置 / CSA 除以 4 / HCA 除以 128)
SWA 引入 Tombstone 機制,自動釋放滑窗外過期 KV,Shadow B/C 無需淘汰
額外維護兩個 Ring Buffer 管理 Compressor 中間狀態(tài),保證 CSA/HCA 跨 token 依賴的正確性
踩坑:三套 Cache 的頁大小、淘汰策略、前綴匹配邏輯完全不同,SWA 為支持前綴緩存需保留多于 128 token 的 KV,不能簡單按滑窗大小截斷
三、算子級優(yōu)化
FlashCompressor:將 Compressor 流程中 Softmax、bias、scale-dot 等零散操作融合為單一 kernel,HBM 讀寫從 5 次降至 2 次
Lightning TopK:序列分片到同一 Cluster 內(nèi)的多個 CTA,各 CTA 用直方圖做本地統(tǒng)計,通過 SM 互聯(lián)(而非 HBM)完成 reduce;百萬上下文 BS=1 下從 100μs 降至 15μs
MegaMoE(DeepSeek 官方):將 dispatch / group GEMM / combine 三階段融合重疊為單一 kernel,直接調(diào)用 DeepGEMM 實現(xiàn);限制:僅支持 FP8×FP4、僅 Blackwell SM100、僅 NVLink 互聯(lián)
踩坑:Kernel 語言選型——Triton 開發(fā)快但優(yōu)化上限有限,CUDA 可做極致優(yōu)化但開發(fā)慢,TileLang 居中;FlashCompressor 用 Triton 即可,Lightning TopK 必須用 CUDA
四、并行策略與工程化
DP Attention:V3 延續(xù)方案,提升吞吐
CP(Context Parallelism):將長序列均勻分片到多卡,Attention 前 AllGather 所需 KV(因壓縮后體積小,通信開銷低);超長輸入(90 萬 +)下 CP 優(yōu)于 TP,短輸入 TP 更優(yōu)(CP 額外通信開銷不劃算)
EP(Expert Parallelism):GB300 NVL72 上大規(guī)模專家并行,AlltoAll 走 NVLink 帶寬充足
多流并行:SWA/CSA/HCA 三種 Attention 無數(shù)據(jù)依賴,分配到不同 CUDA Stream;解碼階段 SM 利用率未飽和,多流收益明顯;用 CUDA Event 控制依賴順序
踩坑:FlashMLA 庫專為 DP Attention 設(shè)計(頭數(shù)完整),開啟 TP 切分頭數(shù)后只能 padding 到要求的頭數(shù),存在浪費,后續(xù)仍需優(yōu)化;CP 的 KV AllGather 目前無法做 overlap(前后有數(shù)據(jù)依賴),計劃用 Ring Attention 方案解決
五、投機采樣適配
V4 MTP Layer 僅含 SWA,無 CSA/HCA,結(jié)構(gòu)比主模型輕量
將 KV 位置等元數(shù)據(jù)準備移入 CUDA Graph,消除 CPU 開銷;兼容 Overlap Scheduling 實現(xiàn) CPU/GPU 完全并行
實測 4K 與 900K 上下文解碼速度差異極小(TP=8, BS=1, MTP Len=3)
踩坑:大 Batch(512/1024)下投機采樣收益下降,因 GPU 瓶頸從訪存轉(zhuǎn)為計算,投機采樣本質(zhì)優(yōu)化的是訪存
六、KV Cache Offloading 與 PD 分離
HiSparse:CSA pool 溢出時卸載至 CPU 內(nèi)存,SWA/HCA 體積小暫留 GPU
PD 分離結(jié)合 ShadowRadix 虛擬索引,KV Cache 按配置從 P 節(jié)點傳輸至 D 節(jié)點
七、性能數(shù)據(jù)
InferenceX 基準(Input 8K / Output 1K):開啟 MTP 單用戶交互速度 180 token/s;GB300 NVL72 高吞吐場景單 GPU 吞吐 11,500 token/s
強化學習框架 Miles Day-0 支持:Rollout 階段用 FP8、Training 用 BF16 混合精度,獎勵值與 benchmark 分數(shù)隨訓練步數(shù)穩(wěn)步提升
實踐痛點
架構(gòu)復(fù)雜度換性能
ShadowRadix 為三種 Attention 各維護一套獨立的頁表、淘汰策略和前綴匹配邏輯,系統(tǒng)復(fù)雜度相比 V3 單一 MLA 大幅膨脹。例如 SWA 為支持前綴緩存必須保留多于 128 token 的 KV,不能按滑窗大小簡單截斷,即使是最基礎(chǔ)的緩存管理也充滿 corner case。三套 Cache 的聯(lián)調(diào)、一致性維護和 bug 排查成本很高,后續(xù)每新增一個功能(如 PD 分離、CP)都要在三套系統(tǒng)上分別適配。
并行策略沒有通解
CP 在超長輸入下優(yōu)于 TP,但 AllGather 目前無法做 overlap(有數(shù)據(jù)依賴),且長上下文高并發(fā)容易 OOM;TP 在短輸入下更好但受限于卡間通信;EP 依賴 NVLink 帶寬。本質(zhì)上不存在自動化策略選擇,用戶需要自己在 DP/TP/CP/EP 的組合空間里反復(fù)試參,調(diào)優(yōu)成本不低。運行時動態(tài)切換并行策略也不可行,涉及 CUDA Graph 重建、元數(shù)據(jù)重建等問題。
Kernel 開發(fā)的工程代價
實際開發(fā)中 Triton、CUDA、TileLang 三種語言混用:Triton 開發(fā)快但優(yōu)化上限有限,CUDA 能做極致優(yōu)化但開發(fā)慢,TileLang 居中。Lightning TopK 必須用 CUDA,F(xiàn)lashCompressor 用 Triton,訓練反向算子用 TileLang。三套工具鏈混合意味著團隊需要同時維護三種代碼風格和調(diào)試流程,且融合 kernel 一旦出現(xiàn)數(shù)值精度問題,排查難度遠高于樸素 PyTorch 實現(xiàn)。
聽眾收益
復(fù)雜模型架構(gòu)落地的工程方法論:DeepSeek V4 的三種異構(gòu) Attention 共存是業(yè)界新趨勢,ShadowRadix 的虛擬地址映射 + 分層頁表設(shè)計提供了一套可復(fù)用的思路——當模型架構(gòu)變復(fù)雜時,如何在不重寫整個緩存系統(tǒng)的前提下做擴展式適配,而非推倒重來。
性能優(yōu)化的決策框架:分享覆蓋了從算子融合(FlashCompressor 減少 HBM 讀寫)、到并行策略選型(短輸入用 TP、超長輸入用 CP、高吞吐用 EP)、再到投機采樣適用邊界(小 Batch 有效、大 Batch 收益下降)的完整決策鏈路,幫助參會者在自身業(yè)務(wù)場景中快速定位優(yōu)化方向,避免盲目套用單一方案。
多硬件適配的實戰(zhàn)經(jīng)驗:Kernel 語言選型(Triton 快速迭代 vs CUDA 極致優(yōu)化 vs TileLang 折中)、MegaMoE 的硬件約束(僅 Blackwell + NVLink)、FlashMLA 在 TP 下的 padding 浪費等具體案例,為正在做跨平臺部署或硬件選型的團隊提供真實的 tradeoff 參考,減少試錯成本。
除此之外,本次大會還策劃了AI Infra、推理工程與異構(gòu)計算、超級個體與蜂群智能的共生進化、邁向機器人 AGI 的關(guān)鍵技術(shù)與產(chǎn)業(yè)實踐、Agent 安全:從風險到可控、端側(cè)智能與 AI 原生終端、AI Agent 高價值商業(yè)場景實戰(zhàn)等 11 個專題論壇,屆時將有來自不同行業(yè)、不同領(lǐng)域、不同企業(yè)的 50+ 資深專家在現(xiàn)場帶來前沿技術(shù)洞察和一線實踐經(jīng)驗。
做 AI 的誰還沒點技術(shù)焦慮,來 AICon 深圳站,吃顆技術(shù)定心丸! 大會限時 9 折專屬優(yōu)惠,現(xiàn)在報名立減 580,更多詳情可掃碼或聯(lián)系票務(wù)經(jīng)理 13269078023 進行咨詢。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.