編注:我們每天會接觸大量的軟件、硬件,但是多數時間下,都只是以固有的「使用者」視覺去體驗和評判,快節奏的模式讓我們沒時間體會太多背后的理念。「幕后」欄目因此而生,我們會不定期邀請一些制作者,講述他們在產品開發、制作過程中的點滴。
過去,做一個 3D 模型是件門檻極高的事 —— 建模、拓撲、UV、貼圖、材質,一整套專業軟件里的復雜操作,把絕大多數普通人擋在門外。而隨著 AI 時代的到來,3D 創作第一次有機會像拍照一樣簡單。
前不久,我們造訪了華為的開發者大會 HDC 2026。會上,V2Fun 作為鴻蒙系統首個 3D 大模型 AI 原生應用亮相,上架華為應用市場后很快登上編輯精選,闖進下載榜 Top30 和當月最佳應用,成為鴻蒙生態里空間智能方向最受關注的原生應用之一。這款產品背后的極頂數創(Vertex Lab),是一支在論文和競賽方面收獲頗豐,卻又執意要把「最難的 3D」做成大眾產品的團隊。
帶著關于「為什么是 3D」「為什么是鴻蒙」以及「一支研究型團隊如何做產品」的諸多疑問,少數派專訪了極頂數創創始人、CEO 嵇盼博士。
![]()
(極頂數創創始人、CEO 嵇盼博士在發布會上)
▍請介紹一下自己和你的產品。
少數派的讀者們大家好,我是嵇盼,極頂數創(Vertex Lab)的創始人和 CEO。我畢業于浙江大學,之后到海外攻讀博士,師從 3D 視覺領域的知名科學家 Hongdong Li 教授,博士后師從澳大利亞工程院和科學院雙院院士 Ian Reid,一直主攻三維視覺、空間計算、感知交互和 3D 內容生成等方向。在硅谷的核心 AI 圈待了差不多五年后,我回國加入大廠工作,曾經擔任騰訊 XR 感知交互中心的負責人。2025 年,我創立了極頂數創,目前的主要產品就是 V2Fun。
V2Fun 的功能用一句話說,就是把過去只有專業人士才能完成的 3D 建模,變成普通人也能上手的事。拍一張照片或者輸入一段文字,它就能生成一個高還原度的 3D 模型。我們支持了多端,移動端是鴻蒙原生 app,面向大眾和輕量創作者;網頁端是個工業級的 3D 內容生產全管線,面向專業創作者、設計師、3D 內容團隊和游戲、泛娛樂的生產方。兩端賬戶互通,你可以在手機上隨手起草,再到網頁端精修、落地。
▍如今流行的 AI 方向主要是文本、圖片和視頻生成,為什么選擇更小眾可能也更難的 3D 生成方向?
我的判斷是,3D 大模型是 AI 從「二維內容生成」走向「三維世界生成」的關鍵基礎設施。真正的空間智能、未來的世界模型,底層入口一定是三維的。3D 生成確實更難,它要同時解決結構、紋理、視角和資產可用性的問題;但也正因為難,才會離未來更近。
這個種子其實在十幾年前就種下了。2009 年,我還是大三學生,在浙大紫金港校區附近的一家影院里看了《阿凡達》。還記得銀幕上呈現出一個縱深、有光影的立體世界,潘多拉星球的叢林與生物以一種前所未見的方式「活」了過來。我被這種「另一個世界真實存在」的錯覺擊中了。
散場后,我除了感嘆特效震撼,也開始琢磨一個更實際的問題:這些三維的角色和場景,究竟是怎么生成出來的?帶著這個問題,我一頭扎進了校內的 3D 數字電視實驗室,從此和「三維」這兩個字較上了勁。
十幾年后,我在硅谷做完自動駕駛的 3D 視覺,又轉戰 AR、VR 賽道,最后回國加入騰訊游戲的 XR 感知交互中心。但那個當年在電影院里冒出來的念頭始終沒有消失:如果三維世界的構建門檻能夠被徹底打破,普通人也能像寫一句話那樣「造」出一個三維角色,那會怎樣?
2025 年,這個念頭終于落地成了一次創業。我后來常說,3D 模型是真實世界的一種物理表達。這句話聽起來像是產品理念,但對我而言,其實是從 16 年前那個電影院的座位上,一路走到今天的答案。
▍先來說說 V2Fun 的移動端吧。一個完全沒有建模基礎的普通人,打開它能做什么?
我們對移動端的核心定位是「讓 3D 創作像拍照一樣簡單」。你只要負責上傳圖片,剩下的 AI 識別主體、生成 3D 模型,都會自動完成,然后就可以 360° 預覽,滿意后直接保存、導出、分享。傳統 3D 建模要經歷建模、貼圖、材質、拓撲、UV、格式轉換一大串步驟,而我們把它變成了普通人也能完成的一次移動端創作。
![]()
此外,我們還支持一鍵把現實照片轉成更適合建模的風格參考圖,包括寫實參考圖優化、潮玩盲盒、積木藝術、立體折紙幾種風格。這既降低了門檻,也讓它在潮玩、手辦、個性化禮物、社交分享這些場景里更好玩。生成之后,更可以導出 GLB、3MF 這些行業標準格式,對接 3D 打印機,把數字創意直接變成實體的手辦或擺件。
![]()
(使用 V2Fun 制作的 3D 打印手辦)
▍為什么選擇在鴻蒙平臺首發 V2Fun app?主要是出于技術上還是生態上的考慮?
兩方面考慮都有。
先說技術。我們能成為鴻蒙系統首個 3D 大模型 AI 原生應用亮相 HDC 2026,前提是 V2Fun 的能力和 HarmonyOS 的空間智能方向本來就高度契合。我們沒有簡單移植一個網頁版,而是發現 V2Fun 的技術能力和 HarmonyOS 的空間智能方向非常契合,然后抓住這些結合點深耕。例如,依托系統級框架 ArkGraphics 3D 這些,模型生成后可以在手機上自然地預覽、旋轉、查看和交互;生成的 GLB、3MF 資產可以保存到系統圖庫,讓用戶像管理照片一樣管理 3D 文件。
再說生態。這其實是華為和我們的一次雙向選擇:華為需要一個能展示空間智能系統能力的標桿應用,而我們需要一個能承接 3D 資產、放大 3D AI 體驗的系統級生態。加上鴻蒙正處在高速成長期,我們也順利獲得了編輯精選、下載榜 Top30 和當月最佳應用等成績。這是自己單打獨斗很難換來的。
![]()
(V2Fun 在 HDC 2026 獲現場展示)
![]()
(V2Fun 在鴻蒙應用商店所獲曝光)
▍根據你們目前掌握的情況,移動端的大眾用戶最常生成的是哪些類型的 3D 模型?和你們最初的設想一致嗎?
說實話,和我們最初的設想有重合,但也有不少意外。
從后臺數據來看,目前用戶生成最多的還是人和寵物兩大類:自拍、證件照、和朋友的合影,占了相當大一部分;緊隨其后的是寵物,貓貓狗狗幾乎是每天生成量最高的品類之一。這兩類符合我們最初的判斷,人們最想留住的,永遠是和自己有情感聯系的東西。
讓我們意外的是一位手辦收藏愛好者的用法。他把自己收藏了幾十個的絕版手辦逐一拍照建模,做成了一個可以在手機里 360 度翻看、甚至能「排列組合」的虛擬展柜。他跟我們反饋說,很多手辦年代久遠、易碎,平時都鎖在柜子里舍不得拿出來把玩,但現在可以在手機上隨時「盤」一遍。這種把收藏和展示重新連接起來的用法,讓我們意識到 3D 模型的價值,不只是「造出來」,更是「留下來」和「看下去」。
![]()
(V2Fun 用戶用手機還原出的手辦模型)
▍與移動端相比,V2Fun 網頁版服務群體有何不同?為什么選擇同時服務兩個需求差異極大的群體?
網頁版的 V2Fun 工作臺(v2fun.art)面向專業創作者、設計師、3D 內容團隊和游戲、泛娛樂的生產方,提供更完整的能力:AI 圖像負責更穩定可控的視覺輸入,AI 建模能從文字或圖片生成高精度模型、原生附帶 8K PBR 材質貼圖,AI 動畫則支持一鍵骨骼綁定、海量動作庫和 AI 視頻動作捕捉,讓靜態模型動起來。
例如,我們有一位叫做喵不靈的專業用戶,他是?名擁有 8 年經驗的資深游戲原畫師,曾參與過《?限暖暖》等?型項?,但?直想獨?完成?個屬于??的童話?鎮《唯詩利亞》(Wishlia)。過去,他曾先后嘗試過 7 次,但每?次都在進?建筑細節、空間搭建和模型資產制作階段時,因為?作量過??被迫放棄。
接? V2Fun 后,他從原畫、參考圖和空間草圖出發,就快速?成了建筑、街?、道具等 3D 資產,再進? 3D 空間中進?組合、驗證和?次調整。通過這種?式,他已經制作了超過 100 個資產,夢想非常接近成型。
![]()
![]()
![]()
(喵不靈使用 V2Fun 創作的過程和成果)
移動端和網頁端在我們的規劃中有明確分工的:移動端負責驗證大眾需求和爆款玩法,網頁版負責沉淀專業創作能力和高質量生產管線。換句話說,移動端幫人們發現需求,網頁版負責把價值真正兌現。再加上兩端賬戶和資產是互通的,一個用戶完全可以在手機上隨手起草,再到網頁版精修落地。我們相信這樣既能讓專業的人更快,又能讓沒有基礎的人參與創造。
▍V2Fun 一直強調「行業領先的精度和還原度」,你覺得你們的優勢主要體現在什么方面?
首先說技術上的優勢,我覺得主要有兩個層面,一是底層的 3D 基礎大模型,二是幾何與紋理的聯合優化。
我們基礎模型有過幾次重要迭代。最早是「二維升三維」,相當于給模型看幾張照片、讓它去猜物體的立體結構。這種方式速度快、好上手,但應對復雜造型的能力不足,不同角度還常常對不上。后來我們換成 VAE+Diffusion,其中的 VAE(變分自編碼器)先把龐雜的三維數據壓成一份緊湊的「壓縮包」,Diffusion(擴散模型,和大家熟悉的 AI 畫圖是同一類技術)再在這份壓縮包上生成 3D。這樣一來,細節和復雜紋理的效果就提高很多。
現在,我們進一步發展到 VAE+DiT,DiT 是指 Diffusion Transformer(擴散 Transformer),通俗說就是把模型的骨架換成和大語言模型同源的 Transformer。這樣不僅能應對數據更多、結構更復雜的情況,還能把形狀、質感、每個角度乃至語義放進同一個模型里一起處理,結果更穩定、更可控。
![]()
(使用 V2Fun 制作的高清模型)
幾何與紋理的優化也很重要。一個 3D 圖形的質量,很大程度上取決于它的形狀是怎么保存的。傳統的方法存在精度均一的問題,數據量太大,給模型學習造成很大負擔。而我們只保留剛好夠重建形狀的關鍵信息,只在形狀復雜的位置用更密集的數據記錄,實現了精度和效率的良好平衡。
![]()
(幾何算法原理圖)
而在紋理貼圖方面,主流做法是先用 AI 生成幾張不同角度的圖、再「貼」回模型上,但這樣無法補全沒拍到的細節,不同角度之間還容易「打架」。我們則區分「全局」和「局部」,全局上定好整體結構,局部用高清小圖塊補充表面細節,所有視?和圖塊通過同?套三維表?表達交換外觀信息。這套方案很輕,還和角度數量、分辨率徹底解耦,推理時能一路放大到 8K 甚至 12K 的紋理效果。
![]()
(極頂數創的世界模型效果)
▍3D 生成的賽道里也有大廠和其他野心勃勃的創業公司,你們認為 V2Fun 的差異化在哪?
除了上面說的技術優勢,也就是自研底層大模型加系統級工程適配能力,我們的差異化還在于長遠目標。
具體來說,我們賭的是從「3D 原生資產」進化到「3D 世界模型」這條路:先讓用戶生成一個帶有精準幾何、材質和骨骼的高精度實體,解決資產結構的確定性;下一步讓模型擁有動作和骨骼;未來再通過動作控制與動態記憶機制,讓主體和環境發生真正的物理交互與因果推演,最終收斂成一個全功能的世界模型。
所以在我們看來,3D 資產生成只是入口,不是終點。
▍「3D 原生資產」進化到「3D 世界模型」聽起來很有吸引力,但具體要如何實現呢?
我們把世界模型的核心能力拆成三類:負責畫面質感的渲染器、負責空間物理規律的仿真器、負責行動決策的規劃器。行業現在的局限是,純 2D 視頻路線缺三維結構,高頻交互下畫面容易變形、崩塌;純三維路線能生成精美場景,卻丟了時間維度,只是一具靜態標本。
而我們的核心判斷是:下一代世界模型必須是渲染、仿真、規劃的深度融合。所以我們選擇以帶實體模型、動畫、骨骼的「真 3D」為世界主體,再借助面向交互的「動作控制視頻生成技術」為環境引入時間與因果。
這具體分為兩個階段。第一階段,也就是現在已經做到的,是構建主體和確定性資產:讓用戶生成帶精準幾何、材質和骨骼的高精度模型,把結構底座打牢。第二階段則是引入動作和時間維度。例如,我們正在研究「隱空間高斯記憶體」(Latent Gaussian Memory),把實時的動作和視角切換轉成 3D 記憶顆粒,讓 AI 無論走多遠都能精準召回空間記憶、以低延遲渲染出符合物理規律的畫面;還在研究「動態偏差歸檔機制」(Dynamic Deviation Archive),在交互推理時自動修正長程誤差。這樣,無論視角在虛擬世界里繞多大一圈,場景、顏色、結構都能始終如一。
![]()
(隱空間高斯記憶體原理圖)
▍你們經常說自己是一支「研究型團隊」,為什么這么定義?怎么做好「前沿研究」和「適應市場」之間的平衡?
我們團隊成員來自浙大、上交、同濟、澳國立、山大這些海內外頂尖院校,核心成員多是 3D 視覺、深度學習、圖形學、AIGC 方向的博士和資深研發。技術積累上,累計拿過十余次最佳論文和國際競賽獎項,包括 CVPR 最佳論文、ICCV 馬爾獎榮譽提名、ICPR 最佳論文、ICIP 最佳學生論文、WACV 最佳應用論文,還有 ICRA HILTI Visual SLAM 比賽冠軍、CVPR DDAD 深度估計比賽亞軍,谷歌學術總引用接近 5 萬,申請發明專利一百多項。
但我更想強調的是「復合」這兩個字。我們的優勢不在于是一支純算法團隊,也不是傳統的 3D 工具團隊,而是同時具備 3D 視覺、深度學習、圖形學、XR 交互、工程系統和產品化能力的復合型團隊。眾所周知,算法再漂亮,跑不到用戶手機上也沒用。正是因為不僅有模型技術,也有工程適配能力,我們才能把前沿研究真正變成一個普通人幾十秒就能出片的產品。
▍V2Fun 對于商業模式的計劃是怎樣的?最終會以什么形式向誰收費?
我們的商業化路徑將圍繞「創作者生態」與「企業級能力開放」兩個方向展開,一方面通過會員訂閱沉淀創作者用戶價值,另一方面通過 API 能力開放拓展企業級應用場景。
在 C 端,我們以 Web 產品為主要載體,面向創作者群體提供會員訂閱服務。創作者訂閱后,可獲得更完整的產品功能、創作權益以及相應的平臺積分,并通過積分使用平臺內的生成、編輯、增強等能力。我們相信這樣的模式能圍繞高頻創作場景建立持續性的用戶關系,并通過分層會員體系服務不同階段、不同需求的創作者。
在 B 端,我們專注于企業級合作,通過 API 形式開放平臺核心能力。企業客戶可付費獲得相應積分,用于按需調用相關能力或服務。該機制兼具靈活性與可擴展性,能夠支持企業在內容生產、創意工具、營銷應用等場景中接入我們的技術能力。
▍最后一個輕松的問題:用 V2Fun 生成過的所有東西里,哪一個是你自己最喜歡、也最意想不到的?
說出來可能挺普通,不是什么炫酷的角色,是我給自己一歲半的小孩做的一個 3D 模型。
那天他剛睡醒,頭發翹得到處都是,坐在爬爬墊上啃一個積木,表情特別專注。我隨手用手機拍了張照片,扔進我們自己的模型里試效果,其實就是想看看 AI 處理小朋友這種五官比例特殊的對象效果怎么樣。結果沒一會兒,一個圓滾滾的小人就生成出來了,連他啃積木時那種嘟起來的小嘴、翹起來的那撮頭發都還原得清清楚楚。
把模型給我愛人看,她當時就愣住了,說「這也太像了吧,連他那個專注的小表情都在」。我當時心里也咯噔了一下。我們做這套系統,本意是服務專業的動畫師、游戲公司,天天討論的都是精度、拓撲、渲染效率,結果真正戳中我的,是以普通爸爸身份隨手一拍的照片,就能變成一個可以從任何角度看、可以留存下來的立體存在。
這大概就是我們一直想做的事 —— 把 3D 創作還給每一個普通人。一次完整的建模,本來要經過建模、貼圖、拓撲這些專業軟件里的復雜步驟,跟大多數人沒什么關系。而現在,它可以像拍照一樣簡單:拍下來,就留住了。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.