![]()
Fast Reading
在2026年WAIC期間,商湯科技正式發布全新多模態基座商湯日日新 SenseNova-U1 Pro,實現“交付級”的復雜圖片創作能力。
最重要的技術創新,都必須跨越一道工業紅線:從展示效果的“玩具”,變成推動生產力變革的工具。
語言讓機器理解人類表達,視覺讓機器感知真實環境,而二者的融合,才可能讓AI真正進入物理世界。
作者| 于米
編輯 | 黃運濤
林達華并不否認AI競爭中的“快”。
過去一年,大模型行業進入高速迭代期,新模型、新應用甚至新的創業公司不斷涌現。對于技術公司而言,速度似乎成為一種生存能力。
但作為商湯科技聯合創始人、首席科學家,林達華對“快”有另一種理解。
“快跟慢需要辯證地看。”林達華說。在大模型領域,真正的快往往來自長期的慢。沒有持續投入形成的技術積累、基礎設施和迭代閉環,所謂速度只是短暫的領先。ChatGPT的誕生看似突然,背后卻是OpenAI多年研究投入后的集中釋放。
這也是商湯面對多模態大模型競爭時選擇的路徑:不追逐短期風口,而是圍繞底層架構持續投入,等待技術積累跨越從實驗室能力到產業價值的臨界點。
7月18日,在2026世界人工智能大會(WAIC)期間,商湯科技正式發布全新多模態基座——商湯日日新 SenseNova-U1 Pro(以下簡稱U1 Pro)。
通過圍繞視覺創作進行迭代,U1 Pro實現了“交付級”的復雜圖片創作能力,媲美國際頂尖模型。它可以通過內生的圖文交錯思維進行深度創作和交付,是業界首個以“理解、生成、行動”原生統一為內核的多模態智能體基座。
在行業普遍通過模塊組合提升模型能力時,商湯希望從底層改變模型理解世界的方式。
在林達華看來,最底層的創新什么時候才能夠在商業化上取得巨大成功,具有很大的不確定性。但他相信,那些最重要的技術創新,最終都必須跨越一道工業紅線:從展示效果的“玩具”,變成推動生產力變革的工具。
U1 Pro是這一判斷的最新實踐。
林達華打了一個比喻,如果說傳統文生圖模型是一個生成工具,那么U1 Pro更像一個會思考的設計師。它能夠理解用戶意圖,在生成、修改、優化之間不斷迭代,最終形成可交付的圖片作品。
但設計只是起點。
在商湯更長期的技術藍圖中,多模態模型最終要走向世界模型。語言讓機器理解人類表達,視覺讓機器感知真實環境,而二者的融合,才可能讓AI真正進入物理世界。“我們希望通過語言跟視覺的聯合涌現,來實現更廣闊物理空間下的AGI。”林達華說。
在商湯科技正式發布U1 Pro前,雪豹財經社等與林達華進行過一次交流,以下為訪談實錄(節選,經編輯):
跨越工業紅線
Q1:大模型行業都在追求快,作為技術帶頭人,你對“快”這個字如何理解?
林達華:快跟慢需要辯證地看。慢,代表長期主義,堅持在一個方向上持續投入和積累。快,則代表前期的投入建設起了一整個基礎設施和閉環的迭代鏈路。在大模型領域,你很難在兩三個月內突然在一個方向上建立起深厚的競爭力。
OpenAI推出ChatGPT,是長時間鋪墊后的厚積薄發。當產品推出去、獲得大量用戶反饋后,迭代速度確實會極大提高。但“快”絕不能是“打一槍換一個地方”,否則就無法形成長期復利的飛輪。
Q2:越懂技術的人越容易因為知曉難度而謹慎,商湯在堅持做原生統一架構時,是否經歷過商業化被別人搶跑的焦慮?
林達華:確實有這個可能性。今年4月份我們開源U1輕量版并發布詳細技術報告時,我們也擔心過別人會很快借鑒。但我認為,最底層的創新什么時候才能夠在商業化上取得巨大成功,具有很大的不確定性。
最初做U1時,我們嘗試過視覺推理、具身智能等不同方向。后來,我們從今年上半年備受市場青睞的Coding賽道中得到啟發:一個技術只要突破了工業紅線,達到能夠實現生產力變革,而不僅是玩具水平的時候,它就一定能打開巨大的商業空間。
Q3:視覺設計是一個巨大的賽道,U1 Pro 是如何在其中找到突破口的?
林達華:在4月份開源U1時,我們做了一個“圖文交錯思維”的探索,發現模型具備了初步的連續創作可能性——你可以先畫草圖,再去補充細節、著色,最后變成豐富的圖像。這就讓我們看到了一種可能性:它是否能像一個設計師一樣去工作,從而改變整個設計行業?這能把生圖從“好玩、看著不錯”的娛樂屬性,轉變為改變生產力、打開商業化空間、實現成品級設計的核心力量。
Q4:商湯如何定義圖像設計的“可交付”標準?
林達華:我們內部的標準非常簡單:60分叫做“交付級”。我們有一個由兩百位美院學生和設計師組成的團隊,他們只給每張圖評判一句話:“作為設計師,你愿不愿意把這張圖直接交給你的客戶?”
如果60%以上的出圖能夠達到這個標準,我們就認為它達到了交付級。在我們的內部評測中,今年年初以前出來的各種生圖模型(包括小規模開源模型)在這塊的交付率只有個位數;近期出來的商業化模型,其交付率也低于五成。目前能夠達到交付級的只有兩個模型:一個是我們的U1 Pro,另一個是GPT-Image 2。
Q5:對于交付級的生圖模型,評價維度與傳統評測有何區別?
林達華:區別在于容錯率。比如一張海報里有一百個字,如果錯了一個字,你大概率是不敢拿去打印并滿大街張貼的。
在傳統的生圖評價體系里,一百個字錯一個字它還能得99分,因為它是平均評價所有維度的。但對于交付級生成來說,一百個字錯一個字,這張圖就是不可用的,就是0分。很多傳統的生圖軟件沒法交付,就是因為細節總是出瑕疵。我們必須做到生出來的圖沒有瑕疵,用戶拿到就可以直接沖印和打印。一旦打穿這個工業紅線,商業閉環就能規模化打開。
Q6:對于設計類大模型,商湯是如何規劃C端與B端的商業模式的?
林達華:舉個例子,我們另外一款產品“小浣熊”,它在C端的增長很快,現在已有200多萬活躍周用戶。C端用戶在試用后覺得好,當我們的銷售再去向B端客戶推廣時,市場教育和溝通成本就會低很多。
C端可能并不是我們收入的主要來源,但它能為我們帶來源源不斷、有愿意付費的B端客戶。我們目前已經有一些KA(關鍵客戶)在游戲、設計等內部環境中試用我們的專業版模型。
U1 Pro:一個會思考的設計師
Q7:如果用一句話來區分 U1 Pro 和傳統的文生圖模型,你會怎么講?
林達華:U1 Pro 是一個創作模型,而不是一個生成模型。傳統的生成模型是“Prompt直出圖像”,中間沒有過程;而U1 Pro 像一個會思考的設計師,在理解、生成和行動的循環中,多步迭代、逐漸形成高美學的成品圖像。
Q8:主打原生統一的架構,在結構和性能上有什么具體優勢?
林達華:最核心的優勢在于結構非常簡單,非常適合Scale(參數擴展)。當結構過于復雜時,設計更大集群的訓練和推理系統會面臨各種平衡計算特性的難題。更重要的是“表征空間的統一”。如果理解和生成分別走不同的通道,其表征層面就是不融合的,就像外國人跟中國人說話總是需要翻譯。如果它們都用同一種語言(同一個表征空間)進行學習和交融,學習效率、服務效率和推理效率都會有質的提升。
Q9:在沒有顯示調度信號的情況下,原生統一架構是如何決定這一步該輸出文字還是輸出圖片的?
林達華:這里沒有調度信號,它采用的是非常標準的自回歸(Auto-regressive)方式,也就是不斷地Predict the next token(預測下一個Token)。
在我們的架構里,出圖像的地方都會有特殊的Beginning Tag和Slash Tag(結束標記),圖像本身也有對應的Token。當模型運行到那個點,覺得Next token就應當是圖像時,它自然就會往生成圖像的方向去走。
Q10:U1 Pro 支持原生8K輸出,這在帶來畫質突破的同時,如何控制計算量和顯存成本?
林達華:高分辨率意味著視覺Token數量激增。我們為此做出了幾項關鍵創新:
第一,我們使用了32×32的大Patch(普通的生圖軟件一般采用16×16的小Patch),這使得Token數量直接降低到原來的四分之一。
第二,大Patch面臨的挑戰是對細節的精準控制力。我們研發了“自適應噪聲控制(Adaptive Noise Control)”手段,幫助模型有效捕捉并學好細節。
第三,我們在空間采樣上允許Patch之間有一定的Overlap,結合模型結構的專門優化,確保Context在沒有發生爆炸性增長的前提下,依然獲得極強的大圖生成能力。
Q11:與 GPT Image 2 相比,U1 Pro 在設計感和細節控制上有什么差異化優勢?
林達華:我們自己觀察,U1 Pro在文字能力、設計感以及細節控制上,甚至比GPT Image 2更勝一籌。因為在我們的迭代回路中,有至少兩百位專業設計師在不斷給模型提供強化學習的反饋,這賦予了模型很強的中式美感與藝術細節表現力。
此外,GPT Image 2只能出到4k,我們能原生出8k。比如在7月18日的發布會上,大家會看到一張類似《清明上河圖》的長幅巨作,它是單一長圖直接生成的,能鋪滿現場極寬的屏幕。這種復雜大長圖的生成,是GPT Image 2目前絕對生成不出來的。
Q12:U1 系列包含了 Pro(閉源)、Standard(開源)、Fast(高并發版),這種分層邏輯背后的考量是什么?
林達華:通過不同的策略和模型大小,我們在算力成本和生成性能之間做了分層。這背后對應的是我們想要同時實現的三個目標:
1. 擁抱社區(Standard開源版):我們認為任何健康可持續的商業模式都離不開一個共同成長的生態。通過開源輕量級模型,能讓學術界和開發者共同探索技術邊界。
2. 專業交付(Pro專業版):面向高端專業級用戶,追求完美無缺、可以直接拿去印刷的高品質畫面,它需要多輪深度迭代,對算力要求高。
3. 高并發C端體驗(Fast快版):針對大部分普通用戶,他們可能需要10秒鐘快出一張圖,發個朋友圈,對美學精度要求沒那么極致,這就需要極低延遲、極低成本的服務。
Q13:U1 Pro 強調“理解、生成、行動”三位一體。在圖像生成中,這種“行動與思考”是如何具體運作的?
林達華:它本質上是一個很強的多模態模型在執行一個多步的任務邏輯。我們為它提供了一個Action Space(行動空間),它每走一步都會做出生成、局部編輯或者組合構建等行動。
我們將設計師的專業意見整理為Instruction(思維鏈),幫助模型做冷啟動。隨后利用多維度(如文字對齊、構圖美感等)的Reward Model(獎勵模型)進行強化學習。每出一張圖,系統都會給反饋,模型在自適應地糾錯中學會了“看到不同的畫面情況,自己去Sense下一步應該做什么”。
語言與視覺聯合涌現的AGI終局
Q14:現在“世界模型”被賦予了不同的定義。在商湯的技術架構中,如何判定一個模型具備了“世界模型”的屬性?
林達華:在我們的定義里,世界模型必須能夠有效地去建模這個世界。這意味著:當你對這個世界采取任何一個動作時模型能夠盡可能忠實、符合物理規律地去反映這個世界由于交互所產生的狀態變化。比如,機器人往前走一步,或者端起杯子。因此,世界模型絕不僅是一個“視頻生成模型”,而是一個具備空間動態交互建模能力的模型。
Q15:你曾提出大模型的進化方向是Words to Worlds,從數字空間向真實空間交互跨越。這會是商湯長期的戰略方向嗎?
林達華:你可以把它理解為商湯的終極愿景——我們希望通過“語言跟視覺的聯合涌現”,來實現更廣闊物理空間下的AGI。我們所理解的AGI,絕不是一個狹義的、只能處理文字或寫代碼的模型,而是像人一樣,擁有能將視覺感知與語言語義發生深度融合的通用智能。一旦實現這個,才能迎來機器人的“GPT時刻”。目前絕大多數具身智能機器人,其行動邏輯都只能局限在非常有限的范圍內。
Q16:在走向這個終極愿景的漫長過程中,商湯還需要補足哪些維度的能力?
林達華:我們需要從三個層面逐級攻克:
1. 架構層面:我們已經通過原生統一架構,做好了能讓視覺和語言在同一個空間表達、融合、交互的地基。
2. 數據層面:我們需要捕捉更為多樣化的數據。除了生圖與設計,還需要采集三維物理空間數據,以及通過模擬生成的帶有空間結構的多模態數據。
3. 訓練范式層面:純文本大模型的next token prediction無法捕捉復雜的連續空間結構。我們必須在深層融合的表征空間上,探索next frame prediction或next view prediction。讓模型學會在特定視角下把圖像“生成”出來,再跟真實物理世界做比對和判斷。
Q17:在面向更通用的 Agent(智能體)基座時,商湯為什么堅持使用多模態理解與生成模型,而不是業界常用的 Coding 或文本通用大模型?
林達華:因為通用AGI一定離不開視覺。純文本和代碼模型是打不開空間能力和視覺感知的,而且現實世界里的很多視覺信息是無法完全用語言表達出來的。我們期待的是視覺與語言在底座上的深層融合、聯合涌現,這是打開物理世界現實應用的唯一鑰匙。
群雄逐鹿,商湯優勢何在?
Q18:在字節、騰訊等巨頭林立,以及獨立AI公司不斷涌現的競爭格局中,商湯處于什么位置?
林達華:商湯目前在收入上是一家中等規模的公司,很難在所有賽道上和巨頭直接拼體量、拼資本。但商湯有一個獨特優勢,就是我們從管理層到研發團隊,對技術路線都有著極深的信仰和堅持。
我們所有的戰略——從開悟世界模型、具身智能平臺,到現在的設計模型,全部共用一套“原生統一架構”服務于不同的下游任務。巨頭的熱點,每個階段都在變,但終局是一致的。我們在走向終點的過程中,率先通過機器人巡檢、外賣、視覺設計等應用打穿行業,獲得持續的商業閉環和資金,支撐我們往終點走下去。
Q19:今年AI人才競爭呈白熱化,許多公司開出天價搶人,商湯怎么留住人才?
林達華:商湯研究體系團隊今年的穩定性非常強。我們之所以能凝聚共識,是因為所有參與統一架構研發的同學,都對這個長期愿景有極深的信仰。一個有歷史意義、能讓大家在技術長河中留下獨特印記的愿景,有時候更能吸引和留住最頂尖的人。
Q20:外界常把商湯稱為“AI人才的黃埔軍校”,你如何看待員工離開商湯去創業?
林達華:我認為年輕人去追求創新、創業,去做改變歷史的事情,是一個非常積極和正面的現象,這說明商湯的創新基因是非常強大的。
湯曉鷗老師當年創辦商湯的初衷,就是為年輕人創造舞臺。現在我們積極擁抱這個變化,提出了“1+X”戰略。有些同事想出去創業,如果內部體系暫時無法完全支持,我們選擇“扶上馬,送一程”。他們的公司可以作為X,與商湯這個“1”(集團本體)在基礎設施、技術服務和應用鏈路上形成非常好的生態協同。這讓商湯的生態空間能以一種更開放的方式持續擴大。(End)
以下是用U1 Pro生成的6張效果圖,
由雪豹財經社從商湯日日新官網獲取:
![]()
![]()
![]()
![]()
![]()
![]()
封面來源:U1 Pro 官網
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.