![]()
作者 | 四月
谷歌 Nano Banana 2 Lite 正式上線,不僅以對標Seedream 5.0 Lite 的微弱價格優勢,挑起文生圖領域的價格戰,更憑借 4 秒極速生成與直出視頻能力,向多模態的頭號勁敵字節跳動發起正面挑戰。
剛剛,谷歌把 Nano Banana 家族最輕的一顆“香蕉”推到了臺前。
Nano Banana 2 Lite 全面登陸 Google AI Studio 、 Gemini API 和 Gemini 企業代理平臺,官方調用名稱是gemini-3.1-flash-lite-image。其核心參數直接對標字節最新款文生圖模型Seedream5.1 Lite(2026.2 月推出):
單張 1K 圖生成成本壓低至0.034 美元,平均生圖速度僅需 4 秒。
![]()
這意味著,在 API 調用成本上,二者幾乎是貼身肉搏:
Nano Banana 2 Lite 定價為0.034 美元每張圖1K分辨率
Seedream 5.0 Lite 約為0.035 美元每張(國內官方渠道折算后 0.22 元/張,主流第三方 API 接口定價$0.035/張)。
![]()
![]()
0.001 美元的差距在單張上小到可以忽略,但放到內容、電商、游戲、教育、廣告這類業務里,會被調用量成倍放大。批量生成、A/B 測試、個性化素材、實時預覽……等任務下,延遲和成本都會成為“放大器”。
更有意思的是,在性能維度,NB Lite 2 同時在文生圖“審美偏好”(基于人類盲測)與端到端延遲兩個關鍵指標上,對 Seedream 5.0 Lite 實現了“雙反超”。
![]()
第三方數據顯示,Nano Banana 2 Lite 的 Text-to-Image Elo 為 1251,高于 Seedream 5.0 Lite 的 1132;而 Lite 的延遲約為 4.0 秒,Seedream 5.0 Lite 的端到端時延則高達 45.1 秒。
(注意:延遲數據參考AI 模型評測與數據平臺 Artificial Analysis,測量為 API 環境下的端到端時間,可能包含排隊、服務商封裝與圖片下載等環節)。
兩個指標里,前者影響觀感,后者決定產品形態:Elo 決定“圖片好不好看”,延遲決定“能不能嵌進產品交互”。
換句話說,Nano Banana 2 Lite 不是單純更便宜,而是在幾乎同價位上,把 1K分辨率的文生圖質量和響應速度都向上拉了一檔。
![]()
在字節的官方口徑里,此前并沒有圍繞 Seedream 5.0 Lite 指標的具體量化描述,主要強調“在跨模態理解與推理、精準指令遵循、聯網實時檢索三大能力上全面提升,讓每一個需求都能及時響應、準確呈現”。
至于 Nano Banana 2 Lite,谷歌則將其定義為 Nano Banana 家族里最快、最具成本效率的圖像模型,面向高吞吐、低延遲和規模化生成場景。
可以看到,NB 2 Lite 并非取代 Pro,而是把“高頻海量出圖”這一檔補齊。在犧牲多分辨率(僅 1K)和部分重型能力的同時,把全部算力壓在速度與單位成本上,從而打中當前文生圖場景下“又慢又貴”的真實痛點。
此外,它還能無縫接入谷歌多模態 Gemini Omni Flash,能夠把靜態圖直接推進視頻生成與對話式編輯。
4 秒 vs 45 秒
如果只看價格標簽,谷歌 Nano Banana 2 Lite 很難說對字節的 Seedream 5.0 Lite 形成了壓倒性優勢。
但作為一家美國模型廠商,能夠做到價格對標(0.034 美元對 0.035 美元)也足夠罕見,這更像是谷歌主動踏進了此前由中國模型主導的性價比戰場。
而真正能拉開二者差異的還是“單位時間產能”。
![]()
在第三方口徑下,NB 2 Lite 的優勢并不是一張圖省了 0.001 美元,而是在接近同價的情況下,把 1K 文生圖的生成體驗壓縮成了 4 秒。
這意味著它的想象力不再只是一個圖片生成工具,而有機會變成產品交互的一部分,真正嵌入業務流。
用戶改一句提示詞、換一個風格、調整一處背景,幾秒后就能看到結果。這種“所見即所得”的即時反饋,對設計工具、電商后臺、廣告平臺、社交應用和游戲 UGC來說,比單純便宜一點更重要。
![]()
這背后折射出的,是谷歌和字節兩家公司在商業落點的差異。
字節的多模態優勢根植于其強大的內容產業鏈,尤其是短劇/短視頻、電商和營銷場景。數據顯示,Seedance 在國內 AI 短劇行業的滲透率已高達約 95%,僅 2.0 單個版本模型就能為火山引擎每月帶來超過 10 億元人民幣收入。
字節的路線,是服務海量的內容分發與變現,離“爆款內容”更近。
而谷歌的優勢則來自開發者工具、設計生態、云平臺和企業工作流。在其博客所展示的客戶案例里,不乏Artlist、Figma、Manus這類專業化工具平臺。
Google 自己也更愿意把它放在“快速創意、廣告 A/B 測試、面向百萬用戶的社交應用”這些場景里,是服務于基礎設施與生產工具,離“生產接口”更近。
也正是為了適配這些對速度和成本極度敏感的企業級工具場景,谷歌在技術實現上做了極其激進的工程優化。
與 Nano Banana 2 標準版和 Pro 版相比,Lite 版在模型層數與注意力機制的計算量上做了大幅裁剪,并引入了更具針對性的推理策略:
默認“低思考”模式:在官方定義中,Lite 版默認運行在 Low-Thinking 模式下。這意味著模型在生成圖像時,跳過了大部分用于復雜邏輯推理和長鏈條規劃的計算步驟,直接利用訓練好的潛空間映射進行快速采樣。這正是其能將延遲壓縮至 4 秒的關鍵。
針對性算子優化:為了適應高頻 API 調用,Lite 版在服務端針對常見的 1K 分辨率生圖請求進行了算子融合與批處理優化,極大提升了 GPU 的利用率,從而攤薄了單張圖片的推理成本,才得以打出 0.034 美元的價格牌。
1K 單圖甜區模型
Nano Banana 2 Lite 另一個容易被低估的指標,是文生圖的人類審美偏好得分(Elo)。
在看圖盲測的生成任務里,Nano Banana 2 Lite 拿到了 1251,不僅高于 Seedream 5.0 Lite 的 1132 分,在部分基準上甚至超越了參數量更大的 Pro 版。
這個結果打破了“參數量決定一切”的傳統認知,也展現出谷歌的輕量模型并不是單純靠降配換速度,而是在基礎觀感、提示詞遵循和圖像完成度上,依然保留了極強的競爭力。
其核心技術邏輯在于知識蒸餾與場景化特訓的結合:
站在巨人的肩膀上:雖然 Lite 版本體量小,但“見識”很大。谷歌在訓練時,利用了Gemini 3.1 系列更大規模模型(如 Ultra 或 Pro)生成的合成數據進行對齊。
這使得 Lite 版繼承了旗艦模型對物理世界、復雜物體關系的理解能力,實現了“世界知識的強繼承”。
放棄大而全,專注高頻場景:Lite 版并未追求所有數據通吃,而是針對用戶最高頻的提示詞場景進行了精細化清洗與權重提升。
這種“專項訓練”策略,使得它在處理風景、人像、常見物體等通用場景時,比一個試圖面面俱到的大模型更加穩定和精準。
不僅如此,針對輕量模型最容易“露怯”的細節控制,谷歌也做了針對性的“加固”。
在以往的輕量化過程中,圖內文字渲染(OCR)和跨圖角色一致性往往是最先被犧牲的。但 Nano Banana 2 Lite 通過特殊的損失函數設計,尤其強化了這兩項能力:
OCR 級別的文字生成:通過引入額外的文本感知分支,Lite 版在生成海報、UI 界面等包含文字的圖像時,依然能保持極高的字符準確率。
特征錨定機制:為了解決 AI 生圖“千人千面”的問題,Lite 版引入了更高效的特征錨定技術,確保在多輪生成或批量生成時,同一主體的面部特征、服裝細節能保持高度一致。
這一點對于商業化落地至關重要。
很多輕量模型的問題在于“便宜但不敢用”——出圖快是快,但細節質量差強人意,最后省下的 API 費用,全花在了人工篩圖和重新生成上。
Nano Banana 2 Lite 的產品邏輯則非常清晰:把能力壓在最常見、最高頻的 1K 單圖場景里,確保每一張圖都是“可用”的,從而真正打通降本增效的最后一公里。
圖像不是終點,視頻才是
在發布 Nano Banana 2 Lite 的同時,谷歌還順勢解禁了多模態模型 Gemini Omni Flash。兩者在谷歌的生態版圖中扮演著接力跑的角色:
Nano Banana 2 Lite 負責極速出圖,而 Omni Flash 負責視頻生成與對話式編輯。
這種組合讓 Lite 不再只是一個孤立的圖像生成工具,而是成為了一條完整多媒體生產鏈路的“入口”。
![]()
在性能對標上,谷歌也更強調 Omni Flash 的視頻編輯能力。
在“Overall Preference”(總體偏好)和“Instruction Following”(指令遵循)兩個關鍵維度上,其 Elo 分數均位居榜首,領先于包括阿里的 HappyHorse、快手 Kling v3 Pro 和字節的 Seedance 2.0(946 和 960)。
Omni Flash的“圖生視頻”的一體化能力,在技術實現上依賴于幾個關鍵的架構設計。
首先,谷歌引入了Interactions API來解決視頻編輯中“記憶丟失”的痛點。當你把 Lite 生成的靜態圖傳給 Omni Flash 時,模型會提取圖像特征作為初始狀態,并保留會話歷史。
目前,用戶可以連續疊加最多三輪的自然語言指令(如“讓鏡頭推近一點”、“換一種光影”),模型可在原有狀態基礎上進行修改,而不是推翻重來。
其次,Omni Flash 深度整合了 Gemini 的多模態理解與世界知識。它支持文本、圖像、視頻的組合輸入,并直接調用 Gemini 在歷史、物理、敘事邏輯等方面的知識庫。
谷歌已經針對電商、室內設計、社媒傳播三個場景,上架了對應的功能模塊來實現更完整的功能鏈條。比如,上傳一張商品圖,先用 Lite 快速生成多角度靜態圖,再一鍵轉成電商短視頻,大幅縮短素材制作周期。
目前,Omni Flash 輸出視頻的定價為每秒 0.10 美元(與 Veo 3.1 Fast 持平),支持最長 10 秒的視頻生成。
![]()
雖然谷歌也坦誠列出了當下的局限性:如暫不支持音頻參考上傳、場景延展受限、以及在復雜運鏡時的人物一致性仍有待優化,但對于廣告預告、社媒短內容這類對時長要求不高的場景來說,這套管線已經具備了極高的實用價值。
從參數競賽進入生產競賽
在旗艦模型時代,大家比的是上限:誰的人臉更真,誰的構圖更復雜,誰的光影更高級。但到了 Lite 這種模型身上,問題變成了另一套:一張圖多少錢,多久返回,能不能批量跑,能不能穩定改,能不能接進視頻。
如果說,Seedream 所代表的路線:把搜索、推理、理解和生成揉進同一套圖像系統里,是中國大模型公司在視覺智能上的探索方向。
那么,谷歌Nano Banana 2 Lite 則展現出另一種思路:用 Gemini 家族的基礎能力,把輕量圖像模型做成高吞吐、低延遲、可接視頻的生產接口。
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/
https://cloud.google.com/blog/products/ai-machine-learning/nano-banana-2-lite-and-gemini-omni-flash-available/
聲明:本文為 AI 前線原創,不代表平臺觀點,也不構成投資建議,未經許可禁止轉載。
![]()
![]()
會議推薦
大會限時早鳥票享 8 折專屬優惠,現在報名立減 1160,更多詳情可掃碼或聯系票務經理 13269078023 進行咨詢。
![]()
今日薦文
![]()
你也「在看」嗎?
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.