![]()
用多模態奪回主場,用生態掩護追趕。
作者 /企鵝
觀看今年的Google I/O開發者大會后,整場發布會的脈絡可以概括為一句話:在哪些戰場谷歌正在領跑,又有哪些戰場谷歌還在追趕。
名義上,I/O是一場面向開發者的技術盛會。但過去幾年里,它已經實質上變成了谷歌新一代消費級AI產品的展示櫥窗。同時,谷歌需要用它來回應OpenAI和Anthropic帶來的競爭壓力。
今年的語境也格外微妙。本屆I/O召開之前,谷歌面對的是一個更尖銳的版本問題:它的AI是否還有競爭力?
一方面,谷歌在多模態生成和消費級用戶增長上節節進逼;另一方面,在當前最熱的 AI 編碼戰線上,它仍處于追趕位置。
就在大會前的一個多月里,Anthropic在4月初發布了Claude Mythos限定預覽;OpenAI緊接著在4月下旬推出GPT-5.5作為回擊。
兩家頭部對手把基準線抬到了一個新高度,而Gemini的新版本要在這兩個參照系之間證明自己的位置。在這樣的背景下,一次“稱職的Gemini更新”已經不再是新聞——它只是留在牌桌上的入場券。
在谷歌密集的發布中,頗受關注的產品是全新的視頻生成模型Gemini Omni。
它的思路延續了去年大火的圖像模型Nano Banana:以Gemini作為底層基礎,解決了模型在內容創作和反復編輯時缺乏一致性的“老問題”,并把這套成功經驗從圖片搬到了視頻上。
而在谷歌最核心的搜索業務上,他們推出了全新的“Information Agents(信息智能體)”。它能全天24小時幫你盯著租房信息或者新品發布這類動態,一有消息就主動匯報。這個功能今年夏天就會推給付費用戶。
谷歌步步緊逼的另一個底氣是用戶規模。
Gemini應用的月活躍用戶現在已經到了9億。雖然這跟OpenAI今年2月公布的ChatGPT“9億周活”還差一截。但Gemini 一年內從4億翻倍到9億,已經足夠說明谷歌在消費側的追趕力度。
此外這次Gemini還上了個叫“Daily Brief(每日摘要)”的個性化新功能。
它的產品形態跟OpenAI去年9月推出的ChatGPT Pulse在結構上有些接近。而Pulse據報道在去年12月OpenAI進入"Code Red"狀態時已被內部“邊緣化”。兩家巨頭在產品上這種互相摸索、踩著時間差出牌的現象,就是這輪AI大戰真實的縮影。
不過,在開發者最關心的寫代碼這件事情上,谷歌的還是追趕者的姿態。
就在幾個月前,OpenAI還曾因谷歌Gemini 3的強大能力而拉響內部警報。然而,行業格局的演變異常迅速。今年4月,Anthropic推出了主打網絡安全防御的限定版模型Mythos,進一步擴大了其在代碼領域的領先優勢。由于該模型能力過強且伴隨潛在風險,Anthropic并未將其向公眾開放,僅定向提供給Project Glasswing中的亞馬遜、蘋果、微軟等少數頭部合作伙伴。
隨著OpenAI將戰略重心逐漸向企業級市場傾斜,在代碼這條戰線上,谷歌與OpenAI實質上都已成為Anthropic的追趕者。面對這一局面,谷歌在本屆I/O大會上的應對顯得相對保守:發布代碼智能體的新版桌面端Antigravity 2.0,并同步推出全新的命令行工具,敦促老用戶盡快遷移。這并非底層技術的重大突破,而更像是承壓之下對現有產品線的一次梳理與瘦身。
明白了這層底色,再重新審視本屆I/O大會上密集的Gemini更新,便能看出這絕不僅僅是一份產品清單,而是谷歌面對2026年AI戰局,向外界交出的一份真實態勢評估。
01.
從4億到9億用戶
CEO桑達爾·皮查伊(Sundar Pichai)按慣例率先登臺。他略去了冗長的寒暄,直接拋出了一組數據:谷歌目前擁有13款用戶破10億的產品,其中5款更是超過30億;Gemini應用的月活躍用戶從去年I/O的4億翻倍至如今的9億以上,覆蓋230多個國家和地區,支持70多種語言。皮查伊表示:“公司轉向AI優先已滿十年,我們依然認為,AI是推進公司使命、改善人類生活最深刻的方式。”
這種增長速度頗具意味。
一年前,科技界還在熱議ChatGPT是否會顛覆谷歌搜索;而今天,Gemini應用9億的月活與ChatGPT今年2月公布的“9億周活”已然站上同一量級(第三方估算ChatGPT月活大概率已超10億)。
皮查伊提到,上季度谷歌搜索的查詢量創下歷史新高。AI Overviews等功能并未削弱用戶的搜索習慣,反而促使人們提出更多、更復雜的問題。谷歌正將AI深度嵌入其龐大的產品矩陣,借此將傳統的分發優勢轉化為新的技術護城河。
在大會的熱場環節,谷歌展示了一款名為“Jellectronica”的現場互動裝置:AI實時追蹤蒙特雷灣水族館畫面中的水母運動軌跡,并將其轉化為控制信號,驅動DeepMind的Lyria Realtime模型實時生成電子樂。這一細節也折射出谷歌對2026年AI產品形態的設想——AI不僅是工具,更是創作的協作者。
而在主題演講的核心模塊,谷歌發布了兩款重磅模型:Gemini 3.5 Flash與Gemini Omni。
Gemini 3.5 Flash被定位為谷歌目前“最強的智能體與代碼模型”。官方表示,該模型在前沿任務的性能表現已達頂尖水準,不僅速度是同類前沿模型的近四倍,成本也通常不到競品的一半。即日起,它將作為多項谷歌服務的默認模型正式上線。
谷歌強調,3.5系列追求的不再是單純的參數堆疊,而是要在構建高階智能體(Agent)上邁出關鍵一步,重點優化了代碼智能體、長周期任務(long-horizon tasks)以及真實世界工作流這三大方向。
這些背后離不開龐大的算力支撐。
皮查伊披露了幾個反映規模的數據:谷歌模型API目前每分鐘處理約190億個Token;而內部使用的代碼智能體Antigravity,其每日處理的Token量已從今年3月的約5000億激增至目前的逾3萬億。為了應對這種呈指數級增長的算力需求,谷歌將2026年的資本支出規模提升至約1800億至1900億美元,這大約是2022年(310億美元)的六倍。
資金大量涌入了自研的TPU張量處理器。今年新發布的第八代TPU首次采用雙芯片架構,分別針對模型訓練(TPU 8t)和推理(TPU 8i)進行了專項優化。更低的延遲與更低的推理成本,將真正使得AI能夠無處不在。
另一場重頭戲是Gemini Omni的亮相。
Google DeepMind CEO戴密斯·哈薩比斯(Demis Hassabis)登臺介紹了這款多模態模型,官方將其描述為“能夠從任何輸入創造任何輸出”。其首發版本Gemini Omni Flash即日起向Google AI Plus、Pro與Ultra訂閱用戶開放,并將通過YouTube Shorts和YouTube Create應用免費提供給所有創作者。
在AI視頻生成賽道競爭白熱化的當下——字節跳動的Seedance 2.0曾在公開評測中長期領跑,而阿里巴巴4月匿名提交的HappyHorse-1.0在Artificial Analysis評測榜上實現反超并穩居榜首——Omni打出了自己的差異化策略。
它并沒有選擇在原始畫質上與對手拼殺,而是將“對話式編輯”做到了極致。用戶在給出提示詞或初始素材后,可直接通過自然語言對視頻中的角色、背景、動作進行精細修改。這一邏輯沿用了去年備受矚目的圖像模型Nano Banana的成功經驗,并成功將其平移到了視頻領域。
谷歌DeepMind產品管理總監妮可·布里赫托娃(Nicole Brichtova)在接受TechCrunch采訪時透露,目前Flash版本的視頻輸出被限制在10秒以內。但她強調,這只是“出于部署考量的決策,而非模型本身存在限制”,旨在算力緊張的當下確保更多用戶能夠體驗。哈薩比斯也表示,Omni的長期愿景絕不僅限于視頻生成。
值得一提的是,Omni在內容真實性保障上延續了谷歌的SynthID水印技術。
據谷歌透露,SynthID迄今已為超過1000億張AI生成的圖像和視頻,以及總時長達6萬年的音頻打上了隱形水印。
目前,OpenAI、ElevenLabs和Kakao等公司也已開始采用這一技術標準。接下來,SynthID的驗證能力將進一步整合至Google搜索(通過Circle to Search功能)和Chrome瀏覽器(右鍵點擊即可驗證)。隨著生成式AI的產出愈發逼真,內容溯源與標記體系正逐漸成為整個行業的關鍵基礎設施。
02.
Gemini Spark和搜索變革
如果說前面發布的模型屬于“基礎設施層”,那么Gemini Spark的亮相,則標志著谷歌的產品形態正從“工具型AI”跨向“代理型AI”。
官方將Spark定義為“一個全天候協助處理數字生活的個人AI智能體”。它運行在Gemini 3.5 Flash模型之上,底層由谷歌的Antigravity代理平臺支撐。這套“代理優先”的開發者環境,早在此前隨Gemini 3發布時就已亮相。
與OpenAI此前推出的ChatGPT agent(前身為Operator)等競品不同,Spark擺脫了對本地設備的依賴。它不需要手機解鎖或電腦保持開機,而是直接運行在Google Cloud的專屬虛擬機中,實現24小時不間斷的后臺運行。即使用戶離線,任務依然可以繼續推進。
它的能力非常具體。根據現場演示與媒體報道,Spark開箱即用了Gmail、Google Docs、Sheets和Slides等Workspace全家桶應用,同時通過MCP(Model Context Protocol)協議接入了Canva、OpenTable、Instacart等第三方服務。具體來說,它可以做到:
自動掃描每月的信用卡賬單,揪出新出現或隱蔽的訂閱扣費; 持續監控學校發來的郵件,自動提取重要的截止日期,并每天向家長發送摘要; 將散落在Gmail和Docs中的會議筆記整理成一份干凈的文檔,并草擬跟進郵件; 用戶還可以“教”它學習自定義技能,這相當于用自然語言對其進行編程。
目前處于Beta階段的Spark將率先向受信測試者和Google AI Ultra訂閱用戶開放,并在下周開始大規模推送。
值得注意的是,谷歌同步調整了AI Ultra套餐的定價策略:原本單一定價250美元/月的Ultra計劃被拆分為兩檔。新增了一檔100美元/月的中級Ultra(這也是使用Gemini Spark的入門門檻);原有的頂級方案則降至200美元/月(包含更高的20倍Pro使用量和Project Genie等額外特性)。
Spark在兩檔Ultra中均可使用。這表明谷歌正在雙管齊下:一邊將高端訂閱向下延伸以擴大付費用戶基數,一邊將高級智能體作為核心的差異化賣點。
Spark的發布之所以備受關注,更深層的原因在于它代表了一種范式的轉移。在此之前,絕大多數用戶仍將Gemini視為一個“非常聰明的聊天框”。
但Spark打破了這一局限,它不再被動等待提問,而是主動、并行地在后臺處理多線任務,僅在需要用戶決策時發出提醒。這種“主動型AI”的體驗,或將徹底重塑人們對個人生產力軟件的預期。
除了AI戰略,還有搜索業務這個不容有失的主戰場。在今年的I/O大會上,谷歌為Search帶來了用他們自己的話來說“25年來最大的升級”。
最直觀的變化體現在搜索框本身。谷歌正式發布了全新的AI驅動“智能搜索框”。它打破了傳統固定大小的限制,會隨著用戶的輸入動態擴展,提供足夠的空間來描述復雜需求。同時,AI驅動的查詢建議也超越了傳統的字詞補全,它會嘗試預測用戶的真實意圖,主動引導你把問題“問得更準確”。
而且這個搜索框天然支持多模態輸入。用戶可以上傳圖片、文件、視頻,甚至直接將Chrome瀏覽器的標簽頁作為輸入素材“喂”給搜索引擎。
可以說,幾十年來,搜索框一直是數億人事實上的“互聯網首頁”。而如今,這個超級界面被徹底重塑了。
谷歌還宣布了AI Mode的進一步迭代。自去年I/O推出以來,AI Mode僅用一年時間就突破了10億月活用戶,查詢量自上線起每季度都保持翻倍以上的增長。如今,全球范圍內的AI Mode已全面接入Gemini 3.5 Flash驅動。同時,AI Overviews(AI概覽)與AI Mode之間的過渡也變得更加無縫:用戶只需點擊“顯示更多”,就能從概覽直接切入完整的AI對話模式。
Search業務中最具變革性的部分,是“Information Agents(信息智能體)”的引入。這些智能體可以在后臺24小時不間斷運行,根據用戶設定的關注點,持續監控全網的博客、新聞、社交媒體貼文,并結合谷歌自家的實時金融、購物、體育數據。一旦情況發生變化,它們不僅會生成綜合摘要,還支持用戶直接采取后續行動。
谷歌在現場給出的場景非常具體:如果用戶正在找房子,只需將具體要求告訴智能體,后者便會持續掃描各類房源網站,一旦符合條件的房源上線就會立即發出通知;如果用戶是球鞋迷,希望第一時間獲知喜歡的球員是否發布了新聯名款,智能體同樣可以代勞盯著。信息智能體將于今夏率先向美國的Google AI Pro和Ultra訂閱者開放。
此外,搜索還將具備“Generative UI(生成式UI)”能力。對于策劃婚禮、規劃搬家等需要長期推進的任務,它可以構建定制化的儀表盤、追蹤器甚至是“迷你應用”。這相當于在搜索結果頁上,即時為每個用戶的特定任務生成了一個專屬的工作界面。
谷歌還在大幅擴展其Personal Intelligence(個性化智能)版圖。這項功能允許用戶安全地接入Gmail、Google Photos以及未來的Google Calendar。這意味著AI將不僅僅局限于掌握“世界知識”,而是能真正理解用戶的“個人上下文”。
即日起,Personal Intelligence將在近200個國家和地區、以98種語言向AI Mode用戶免費開放。
但這些信息智能體以及不斷擴張的AI Overviews,對在線媒體生態的影響并不容樂觀。許多新聞網站本就苦于AI摘要功能造成的流量流失,如果未來智能體可以直接代替用戶閱讀整個互聯網,內容發布者的處境只會雪上加霜。這是一個谷歌至今仍未給出明確答案的結構性難題。
03.
從穿戴設備到跨平臺購物的底牌
按照今年I/O的節奏安排,Android 17等系統層面的更新早在一周前的“Android Show I/O Edition”上便已全部公布。因此,主舞臺的硬件驚喜被刻意留到了最后——Android XR陣營的智能眼鏡(Intelligent Eyewear)。
谷歌聯手三星,正式推出了首批面向消費市場的Android XR智能眼鏡,合作方包括美國平價時尚眼鏡品牌Warby Parker和韓國前衛眼鏡品牌Gentle Monster。
各方分工極其清晰:技術底座由谷歌(操作系統與AI)和三星(硬件平臺)共同提供,外觀與時尚屬性則交由眼鏡品牌操刀。這批眼鏡統一搭載Android XR平臺,由Gemini提供核心AI能力。其功能涵蓋了實時翻譯(音頻翻譯甚至能匹配說話人的音色)、視野內文字翻譯、Google Maps步行導航、通知摘要、日歷管理以及基于位置的上下文推薦(例如沿途的咖啡店)。
在現場演示中,工作人員戴著Gentle Monster太陽鏡,僅憑語音詢問“我和朋友約在哪里見面”,眼鏡便立即給出了答案;另一段演示則展示了她直接通過眼鏡在咖啡店下單并支付小費。
最有趣的細節來自大模型與硬件的聯動:在I/O的“年度大合影”環節,演講者佩戴眼鏡對著觀眾席抓拍了一張照片,隨即通過Gemini調用Nano Banana,在畫面背景里加上了一個寫著“I/O”標志的飛艇。處理完成后,預覽圖被無縫推送到她手腕配對的Pixel Watch上顯示。從眼鏡采集、模型生成到手表預覽,三端協同完成了一次完整的硬件示范。
目前,Warby Parker與Gentle Monster已在各自官網上線了“Intelligent Eyewear”專屬頁面并接受預購登記,產品將于今年秋季上市。
值得注意的是,原本被外界期待的另一位合作伙伴——XREAL及其Project Aura并未出現在主舞臺上,Android Central的現場記者表示,希望能在大會展區獲得相關產品的上手體驗。智能眼鏡并非全新概念,但Meta的Ray-Ban系列已經驗證了“AI+時尚眼鏡”的商業路徑。
谷歌此次入局,憑借的是Android XR生態的開放性與Gemini模型的能力。能否在Meta已有的優勢上打開局面,將是接下來一年值得觀察的硬件賽道。
硬件生態落地的同時,谷歌的軟件護城河也在向全場景蔓延。除了搜索和模型,Workspace全家桶也獲得了一輪“語音化、對話化”的全面升級。
新推出的Docs Live讓用戶可以通過語音“把腦海中所有零碎想法倒出來”,隨后由AI自動整理成結構化文檔。Google Keep中的語音AI也允許用戶通過對話創建筆記。郵箱端則引入了全新的Gmail Live郵件搜索方式,允許用戶用自然語言查詢郵箱內容;同時AI Inbox功能也將下沉到AI Plus與AI Pro的訂閱層級。
谷歌還宣布推出一款名為Google Pics的新設計工具,定位為面向普通用戶的輕量級AI設計創作平臺。在Tom's Guide的現場報道中,這被認為是谷歌延續Nano Banana技術思路、向Canva等設計工具發起挑戰的一次嘗試。視頻內容端的最大新聞則是Ask YouTube的上線,這是一個“全新重新構想”的對話式搜索體驗。
用戶可以用自然語言詢問視頻內容,AI會在浩瀚的視頻庫中檢索出符合需求的片段,甚至可以跨視頻聚合信息。對于YouTube這種以視頻為載體、傳統上難以精準搜索的平臺來說,這是一次潛在的體驗革命。
更進一步,谷歌借著這輪AI升級直接將觸手伸向了電子商務領域。
他們在I/O上推出了“通用購物車”(Universal Cart)——一個跨平臺的智能購物車功能,用戶可以從Search、Gemini、YouTube、Gmail等任意接觸點把商品加入同一個購物車。Tom's Guide在現場看到的演示則揭示了更深的野心:當用戶在購物車中添加電腦配件時,AI能夠精準識別出用戶在攢一臺PC,于是會自動監控價格、提示硬件兼容性、推薦其他必要的配件,甚至支持代為下單。
“代理式電商”曾是過去兩年許多創業公司試圖跑通的方向,現在,谷歌正借助其龐大的用戶規模將其一次性鋪開。
04.
從AI for Science到生態護城河
盡管消費側的產品占據了絕大多數時間,但本屆I/O主舞臺的壓軸時段依然留給了科學。
哈薩比斯在臺上回顧了DeepMind一直以來“用AI推動科學”的傳統,從AlphaFold蛋白質結構預測,一路引出了全新發布的Gemini for Science套件。這是一組旨在加速科研工作流的工具集:涵蓋自動化日常雜務、把想法快速變成可用代碼,以及運行復雜的AI模擬。
其中較具代表性的成果是AI天氣預報模型WeatherNext。現場視頻展示了它在2025年颶風梅麗莎登陸牙買加之前的預測表現:相比傳統數值模型,WeatherNext的預測更準確、提前預警時間更長,為美國國家颶風中心提供了關鍵支持。
還宣布了Co-Scientist,一款基于Gemini的協作型AI科研伙伴,它能幫助研究人員加速科學突破。此外他還介紹了Project Genie:這套“世界模型”框架已與谷歌街景近20年的視覺數據相連,可以基于現實位置創建新的虛擬世界,用于訓練AI智能體或構建沉浸式應用。
在演講尾聲,重申了那個他過去一年多次提到的判斷:“AGI(通用人工智能)已經近在眼前。如果構建得當,它能夠促進人類福祉與繁榮,超出我們最狂野的想象。”一年前還在被邊緣化的谷歌AI業務,如今已成為整個公司的核心驅動。緊接著是關于AI安全的承諾,再次邀請專家測試CodeMender,這款由Google DeepMind在2025年10月發布的AI安全代理,能夠自動發現代碼庫中的漏洞并生成補丁,過去半年內已向開源項目提交了72個安全修復(部分項目代碼量達450萬行)。這也正面回應了外界對智能體系統潛在風險的擔憂。
從前沿科學的星辰大海回到商業戰場的現實,回看整場I/O,我們能清晰地梳理出谷歌在2026年打出的四張底牌與護城河邏輯。
第一,模型層的產品化與商品化并行。
Gemini 3.5 Flash把“前沿性能+極致速度+友好價格”作為定位,Gemini Omni則在多模態這一最貴的賽道上搶占用戶心智。兩者共同支撐起一個調整后的付費訂閱梯度:AI Plus、AI Pro以及拆分為100美元和200美元兩檔的AI Ultra。
其次智能體范式全面取代單點工具范式。
無論是Gemini Spark、Search中的信息智能體,還是Workspace中的Docs Live、Universal Cart中的購物代理,背后都是同一個押注:未來的應用形態不再是“打開App輸入指令”,而是AI主動在后臺執行任務。Android Halo則會在Android狀態欄中實時顯示智能體的工作進度,把代理工作徹底“可視化”成系統級體驗。
還有分發優勢的“AI化”。
Search、Chrome、YouTube、Gmail、Android、Maps,谷歌的這些產品都擁有數十億用戶。當AI被深度嵌入其中后,競爭對手很難僅憑模型上的些許優勢就把用戶遷移走。OpenAI、Anthropic這類公司即便擁有更優秀的模型,也要面對一個現實:用戶在哪里,AI體驗就在哪里。
最后是硬件作為新觸點。
Android XR智能眼鏡代表了“AI從屏幕走入物理世界”的下一步。它不必立即顛覆智能手機,但提供了一個比手機更貼身的AI入口。
透過這套森嚴的生態護城河再來審視這場大會,我們會發現它在性質上已經發生了根本的轉變:這究竟是一場開發者大會,還是消費者大會?
回看幾年前的I/O,開發者們仍然在熱烈討論Material Design、Android Wear、Android Things等圍繞Android生態的話題。而2026年的I/O,主舞臺上幾乎聽不到Android這個詞。
「新物種」發現今年的I/O主題演講幾乎全是Gemini公告,最小的一點硬件驚喜,就只剩Android XR音頻眼鏡了。
這或許正是Google I/O演變到今天的一個寫照:它不再僅僅是面向開發者的技術大會,而越來越像一個面向所有人的“AI時代愿景發布會”。臺上展示的不再是SDK或API的更新,而是關于工作、購物、獲取信息與認知世界方式的圖景。
正如皮查伊在演講中所說:“我們轉向AI優先已經10年了。”十年過去,谷歌如今想要證明的不只是它能做出多好的模型,更是它能讓AI抵達每一個人的日常生活。在與OpenAI、Anthropic等競爭對手的賽跑中,這場I/O給出的答卷可能不是最炫目的,但是系統性最強、規模感最足的一份。
下一年的I/O會發生什么?沒有人能確定。但可以肯定的是,“AI一切”的故事才剛剛翻開新的一頁。
排版運營 / Teagan
- End -
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.