![]()
作者|吳瑞琪
微信 |RachieWoo
很多人以為,把一個大模型放進手機或電腦,就像下載一個 App 一樣簡單。
實際上,手機、電腦和智能硬件的芯片各不相同,同一個模型換一臺設備,往往就要重新適配。開發者不僅要讓它跑起來,還要解決速度、耗電和穩定性問題。
在云端,這套工作已經有成熟的工具。但是在終端設備,尤其是新一代設備里專門處理 AI 任務的計算單元(NPU)上,工具幾乎是空白:一個新模型發布后,常常需要數周甚至數月的適配。
Nexa AI 做的,就是解決這部分最麻煩也最容易被忽視的工作。
2023 年,斯坦福校友 Alex Chen 和 Zack Li 創辦 Nexa AI,做了一套開源工具 Nexa SDK,讓開發者不必逐個研究不同芯片,只需很少的代碼,就能把模型部署到手機、電腦和智能設備上。與大多面向傳統處理器的開源項目不同,Nexa 很早就把重心押在 NPU 上,直接針對芯片特性優化模型,并把行業數周甚至數月的適配周期壓縮到了當天:模型一發布,開發者就能在設備上跑起來。
這套工具很快就在開發者社區走紅:登上 GitHub Trending 第一,獲得近 8,000 個 Star,拿下 Product Hunt 榜首。
去年 8 月,Nexa 把"NPU First"確立為產品重點后,很快被高通的開發者關系團隊注意到,隨后被不斷引薦給內部的技術、創投和管理團隊。一位高通 VP 親自深度試用產品后發現,Nexa 的方案在模型運行速度、效果和支持新模型的速度上,做出了比高通現有方案更好的結果。
今年 3 月中旬,Nexa AI 的 12 人團隊正式加入高通,并保持完整建制。Nexa SDK 的能力將以面向高通平臺的生成式 AI 推理框架 GenieX 延續。
端側 AI 現在到底發展到哪一步?NPU First 解決的究竟是什么問題?一家已經形成開發者影響力的創業公司,為什么認為加入芯片平臺是更好的路徑?
近期,硅星人與 Nexa AI 聯合創始人 Alex Chen 進行了對話。以下為對話實錄,經不改變原意的編輯。
![]()
Nexa AI 聯合創始人 Zack Li (左)和 Alex Chen(右)
硅星人:Nexa AI 最早是怎么與高通產生聯系的?一開始有正式的技術或產品合作嗎?
Alex: 我們一直在做 on-device AI,也有自己的開源項目 Nexa SDK。高通在過去很長一段時間里,都把端側 AI 作為核心戰略。相比之下,英偉達、AMD 等芯片公司的絕對重點還是云端 AI。
我們大約從 2024 年 10 月開始關注高通。當時我們在為 Nexa SDK 找客戶,發現很多需要端側 AI 的客戶使用的是高通芯片。但高通芯片不像英偉達那樣有非常成熟的 CUDA 框架,要在上面部署模型仍然比較困難。所以我們投入了很多精力,研究怎么把模型部署到高通芯片上。
一開始,我們和高通內部沒有任何正式聯系。到 2025 年 8 月,我們對產品做了一次很重要的升級,把 NPU 推理作為重點。因為當時已經有很多設備配備 NPU,但 NPU 的推理邏輯與 GPU 不同,軟件生態也不理想。我們覺得這是創業公司的機會。
產品發布后,很快引起了高通兩位同事的注意。其中一位主要負責合作伙伴和開發者關系。他不斷把我們介紹給高通內部的不同團隊,我們的項目后來也經常出現在高通的官方賬號上,他們還為我們寫了不少博客。整個過程逐漸引起了管理層的關注,最后走到收購,我覺得是水到渠成。
硅星人:從哪一次產品驗證開始,雙方真正開始討論收購?
Alex: 因為我們的軟件是開源的,所有人都可以直接試用。后來,高通負責開發者關系的負責人把我們介紹給了 Qualcomm Ventures 團隊。Ventures 的投資人體驗過產品后覺得很有意思,又把我們推薦給了一位負責相關業務的 VP,之后我們也向高通的一位 EVP 介紹了整個項目。
這位 VP 自己深度試用了我們的產品。他發現,無論是在性能還是模型質量上,我們相比高通當時已有的方案都有一定優勢。除此之外,還有一點讓他們印象特別深刻:我們支持新模型的速度非常快。
按照當時行業里的常見節奏,一款新模型發布后,從完成適配到在特定芯片上穩定運行,往往需要兩三個月時間。我們當時基本已經做到了“Day-0 Support”,也就是模型發布當天,就能夠在軟件框架里完成支持。
對于開發者來說,這意味著可以第一時間使用最新模型;而對于芯片廠商來說,它的意義更大。因為越早證明自己的芯片能夠支持最新模型,就越能向手機、PC 等 OEM 客戶展示平臺能力。在很多情況下,這不僅關系到技術競爭力,也會直接影響后續的客戶合作和采購決策。
![]()
Nexa 美國團隊
硅星人:高通最終看中的核心資產是什么?
Alex: 第一,我們已經做出了相對成熟的軟件,可以快速 onboard 新模型,并實現模型推理。軟件本身的 IP 是最核心的。
第二,我們已經形成了不錯的用戶群體和開發者生態。Nexa SDK 在 GitHub 有接近 8,000 個 Star,也上過 GitHub Trending 第一,在 Product Hunt 拿到過第一名。在 on-device AI 這個相對小的社區里,我們已經有一定知名度。
簡單來說,一方面是已經經過驗證、可以直接使用的軟件;另一方面是圍繞產品形成的開發者生態。
硅星人:端側 AI 已經談了很多年,但真正能被用戶感知到的落地似乎仍然很少。現在大概處于什么階段?
Alex: 其實已經有很多端側 AI 真正投入使用,只是它的一個特點是,用戶平時不一定能感知到。
比如大部分智能手機拍照時,從按下快門到最終生成圖片,中間會有二十多個小型 AI 模型對圖像進行處理。我們現在用 Teams 視頻會議,攝像頭捕捉到的像素和最終呈現的畫面之間,也有 AI 模型實時處理。如果放到云端再傳回來,很難做到這么快。
異常檢測、機器人本地關節控制等任務,也已經大量使用端側模型。這些主要是非生成式 AI。
生成式 AI 方面,很多手機 OEM 都在推動本地模型。蘋果已經開始使用,但效果可能還沒有達到大家想象中“特別好用”的狀態,還需要一些時間。
不過,硬件正在快速變好。終端算力和內存能力每年都在快速迭代,這意味著設備可以支持越來越大的模型;與此同時,相同尺寸的模型本身也在不斷變強。這兩個因素會共同推動端側 AI 能處理的問題越來越多。
硅星人:未來端側模型和云端模型的關系會是什么樣的?
Alex: 我覺得云端和端側聯合推理可能會成為趨勢。
現在,本地模型已經可以處理功能調用、文本信息提取等任務。比如從一份很長的文本里提取信息,如果本地模型可以完成,速度很快,邊際成本也幾乎為零。如果全部調用云端大模型,任務本身雖然簡單,卻會消耗大量 Token。
未來更合理的做法可能是:適合在本地完成的任務交給端側模型,真正復雜的推理再調用云端。
硅星人:Nexa 一直強調“NPU First”。它具體是什么意思?
Alex: NPU 是 Neural Processing Unit,也就是專門為 AI 運算設計的處理單元。
CPU 需要處理操作系統和各種通用計算;GPU 可以同時進行大量線程計算,因此很適合 AI。NPU 更進一步,它在設計時就去掉了很多 AI 推理不需要的通用能力,并重點優化整數等模型推理常用的數據類型。
正因為它更專用,NPU 在支持新模型和軟件生態上,反而不如 CPU 和 GPU 成熟。高通的大部分芯片同時有 CPU、GPU 和 NPU。我們提出 NPU First,是因為我們認為 NPU 是當下最迫切需要解決的部分,而且一旦解決,價值也最大。
硅星人:如果用一句比較技術的話解釋 Nexa 的壁壘,它主要來自 runtime、量化、硬件調度,還是跨平臺工程能力?
Alex: 最大的壁壘,是我們對 NPU 硬件有比較深入的理解,并從軟件層面進行了 hardware-aware software design。也就是軟件設計從一開始就理解硬件的特性,因此可以同時在速度和模型質量上取得優勢。
![]()
硅星人:Nexa SDK 并入高通后變成 GenieX,產品本身發生了什么變化?
Alex: 以前 Nexa SDK 的 slogan 是“Any Model, Any Backend”,我們希望把任何模型部署到任何硬件 backend 上。
并入高通以后,我們不再支持其他芯片后端,現在只支持高通芯片。這是最大的變化,其他部分沒有本質區別。
硅星人:有沒有一個真實場景,可以說明端側 AI 不只是 Demo,而是確實比云端方案更合適?
Alex: 最近有一個 Demo,可以在本地計算機運行一個約 20B 參數的模型,把它作為 AI Agent 的 API,再讓 Agent 幫用戶完成發票報銷。
發票里可能包含隱私信息,Agent 還需要控制本地電腦、操作報銷系統。類似這種涉及敏感數據和本地操作權限的任務,就適合用本地模型完成。現在它已經可以正常工作,只是速度還不如云端,但會持續提升。
硅星人:本地計算省掉了網絡傳輸,為什么速度反而可能不如云端?
Alex: 本地設備的算力是固定的,云端使用的是 A100、H100,甚至更新一代的工業級 GPU,計算能力顯著強于個人設備。
端側真正節省的是信息來回傳輸的延遲。所以,那些模型本身計算量不大、但對實時性要求很高的任務,尤其適合放在本地。比如視頻會議的畫面處理幾乎需要瞬時完成,如果把圖像傳到云端處理再傳回來,速度會慢很多。
但 LLM 需要不斷生成 Token,模型計算時間占據了主要部分。這種任務即便不需要網絡傳輸,本地運行也不一定比云端更快。
硅星人:被收購前,有沒有考慮過繼續獨立發展?為什么最終認為加入大平臺是更好的路徑?
Alex: 我們當然考慮過繼續獨立發展。但研究下來,端側 AI 在商業模式上有一個很特別的地方。
如果把某個模型在某款芯片上的端側部署做得足夠好,它可以極大促進這款芯片的銷售。所以,最終的商業模式其實是賣芯片,真正的付費用戶主要是手機、電腦等設備的 OEM 廠商。
端側 AI 技術與某一款芯片深度整合后,可以產生很好的商業價值;但端側 AI 軟件本身如果單獨變現,會面臨難以 scale 等問題。最后,我們是基于端側 AI 的商業格局做出了加入高通的決定。
![]()
Nexa 中國團隊
硅星人:加入高通后,接下來 12 個月最重要的目標是什么?
Alex: 最重要的目標,是讓 GenieX 覆蓋絕大部分、甚至幾乎全部 Qualcomm 芯片的開發者,讓他們在自己的工作流里使用這款 SDK。核心仍然是推廣產品,并根據開發者反饋持續迭代。
硅星人:團隊目前是怎樣的狀態?
Alex: 我們一共有 12 個人,全部加入了高通,目前仍然保持為一個完整團隊。
加入高通后,我們可以更加專注,只關注一套芯片平臺。需要適應的是與更多部門合作,以及更規范的產品發布流程。產品也要更具體地考慮高通芯片的用戶。
以前,我們做研發的同時,還需要分出大量精力做產品推廣、合作和增長。現在高通有成熟的 marketing 和 developer marketing 團隊幫助我們,對于我們兩位創始人來說,也重新回到了最喜歡的狀態:專注于產品和技術開發。
![]()
點個“愛心”,再走 吧
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.