機(jī)器之心編輯部
沒(méi)有給大家?guī)?lái)心心念念的 Gemini 3.5 Pro,谷歌今天一股腦地發(fā)了三款 Flash 輕量級(jí)模型。
![]()
沒(méi)有意外,谷歌的這一操作遭到了網(wǎng)友毫不留情地吐槽:
![]()
令人難繃的是,Gemini 3.6 Flash 的智能水平并未超過(guò) Gemini 3.5 Flash。
![]()
在官方博客中,谷歌表示,「面向生產(chǎn)環(huán)境構(gòu)建 AI 智能體的開(kāi)發(fā)者和企業(yè),需要更高的 Token 使用效率、更低的延遲,以及更加穩(wěn)定可靠的性能。Flash 系列正是圍繞效率與質(zhì)量之間的平衡點(diǎn)打造,幫助智能體工作流實(shí)現(xiàn)規(guī)模化運(yùn)行。」因此在 Gemini 3.5 Flash 的基礎(chǔ)上,推出了這樣三款新模型:
- Gemini 3.6 Flash:面向主力生產(chǎn)任務(wù)的通用模型,在編程、知識(shí)工作和多模態(tài)任務(wù)上的表現(xiàn)進(jìn)一步提升。
- Gemini 3.5 Flash-Lite:Gemini 3.5 系列中速度最快、成本最低的模型。
- CodeMender 中的 Gemini 3.5 Flash Cyber:高水平網(wǎng)絡(luò)安全應(yīng)用,需要模型與智能體基礎(chǔ)設(shè)施進(jìn)行精細(xì)協(xié)同。
目前,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 即日起開(kāi)放使用。開(kāi)發(fā)者可通過(guò) Google AI Studio 和 Android Studio 調(diào)用 Gemini API。Gemini 3.6 Flash 同時(shí)已登陸 Google Antigravity。企業(yè)用戶(hù)可通過(guò) Gemini Enterprise Agent Platform 使用。普通用戶(hù)可通過(guò) Gemini 應(yīng)用體驗(yàn),Gemini 3.5 Flash-Lite 也正在逐步接入 Google 搜索。
此外,谷歌還透露了 Gemini 3.5 Pro 的進(jìn)度消息,稱(chēng)其正在與合作伙伴開(kāi)展測(cè)試,待準(zhǔn)備充分后將盡快面向更多用戶(hù)開(kāi)放。與此同時(shí),谷歌已經(jīng)開(kāi)始推進(jìn)下一代模型 Gemini 4,并啟動(dòng)了迄今規(guī)模最大、目標(biāo)最具挑戰(zhàn)性的預(yù)訓(xùn)練任務(wù)。
先不管谷歌「畫(huà)的大餅」什么時(shí)候能吃上,我們先來(lái)一一看此次發(fā)布的三款模型。
Gemini 3.6 Flash
效率和性能全面超過(guò) Gemini 3.5 Flash
Gemini 3.6 Flash 直接吸收了開(kāi)發(fā)者和客戶(hù)在使用 Gemini 3.5 Flash 過(guò)程中提出的反饋,在編程和知識(shí)工作能力上進(jìn)一步提升,同時(shí)顯著改善了 Token 使用效率。
例如,在 Artificial Analysis Index 測(cè)試中,Gemini 3.6 Flash 的輸出 Token 消耗較 Gemini 3.5 Flash 減少 17%。執(zhí)行多步驟工作流時(shí),它所需的推理步驟和工具調(diào)用次數(shù)也更少。
效率提升的同時(shí),Gemini 3.6 Flash 的價(jià)格也低于 Gemini 3.5 Flash。其輸入價(jià)格為每 100 萬(wàn) Token 1.50 美元,輸出價(jià)格為每 100 萬(wàn) Token 7.50 美元,可以進(jìn)一步降低單次智能體任務(wù)的總體成本,讓智能體的開(kāi)發(fā)和運(yùn)行更具經(jīng)濟(jì)性。
在提高效率的同時(shí),Gemini 3.6 Flash 在多類(lèi)任務(wù)上的表現(xiàn)也超過(guò) Gemini 3.5 Flash:
- 在 DeepSWE 測(cè)試中,Gemini 3.6 Flash 的得分由 37% 提升至 49%,能夠以更高精度完成任務(wù),減少非必要的代碼修改和重復(fù)執(zhí)行。在衡量機(jī)器學(xué)習(xí)研究能力的 MLE Bench 中,其成績(jī)由 49.7% 提升至 63.9%。
- 計(jì)算機(jī)操作能力進(jìn)一步增強(qiáng),在 OSWorld-Verified 上的成績(jī)由 78.4% 提升至 83.0%。目前,計(jì)算機(jī)操作已作為內(nèi)置客戶(hù)端工具接入 Gemini API 和 Gemini Enterprise。
- 在知識(shí)工作領(lǐng)域,Gemini 3.6 Flash 同樣取得提升,GDPval-AA v2 得分由 1349 提高到 1421。Hebbia、Harvey 等客戶(hù)發(fā)現(xiàn),該模型尤其擅長(zhǎng)文檔解析、圖表與數(shù)據(jù)分析、報(bào)告撰寫(xiě)等多模態(tài)任務(wù)。
![]()
![]()
Gemini 3.5 Flash-Lite
為智能體工作流規(guī)模化運(yùn)行而生
Gemini 3.5 Flash-Lite 同時(shí)面向低延遲任務(wù),以及智能體搜索、文檔處理等對(duì)吞吐量要求較高的開(kāi)發(fā)工作流。
Gemini 3.5 Flash-Lite 是 Gemini 3.5 系列中速度最快的模型。根據(jù) Artificial Analysis 的測(cè)試,其輸出速度達(dá)到每秒 350 個(gè) Token。
該模型的輸入價(jià)格為每 100 萬(wàn) Token 0.30 美元,輸出價(jià)格為每 100 萬(wàn) Token 2.50 美元。憑借顯著超過(guò) Gemini 3.1 Flash-Lite 的模型質(zhì)量,Gemini 3.5 Flash-Lite 為運(yùn)行高吞吐量生產(chǎn)業(yè)務(wù)的開(kāi)發(fā)者和企業(yè)提供了較高的性?xún)r(jià)比。
Gemini 3.5 Flash-Lite 可以幫助智能體系統(tǒng)以更高效率擴(kuò)展。在不同思考等級(jí)下,模型表現(xiàn)均顯著超過(guò) Gemini 3.1 Flash-Lite。
開(kāi)發(fā)者可以根據(jù)具體任務(wù)靈活配置模型。面對(duì)大規(guī)模、高頻任務(wù),可以選擇 minimal 或 low 思考等級(jí),優(yōu)先降低延遲和成本;面對(duì)多步驟子智能體任務(wù),則可以啟用更高的思考等級(jí)。計(jì)算機(jī)操作能力也已作為內(nèi)置工具加入模型,幫助智能體在不同產(chǎn)品和使用界面中更加穩(wěn)定地完成任務(wù)。
在編程和智能體任務(wù)方面,Gemini 3.5 Flash-Lite 實(shí)現(xiàn)了顯著提升:
- Terminal-Bench 2.1:由 31% 提升至 54%;
- 長(zhǎng)上下文測(cè)試 GDM-MRCR v2:由 60.1% 提升至 72.2%;
- 真實(shí)任務(wù)執(zhí)行測(cè)試 GDPval-AA v2:由 642 提升至 1140。
![]()
在多項(xiàng)智能體和編程評(píng)測(cè)中,Gemini 3.5 Flash-Lite 甚至超過(guò)了 Gemini 3 Flash。例如,其 SWE-Bench Pro 成績(jī)?yōu)?54.2%,高于 Gemini 3 Flash 的 49.6%;OSWorld-Verified 成績(jī)?yōu)?74.0%,也超過(guò)后者的 65.1%。
對(duì)于此前使用 Gemini 2.5 Flash 和 Gemini 3 Flash 處理相關(guān)任務(wù)的開(kāi)發(fā)者而言,Gemini 3.5 Flash-Lite 提供了速度更快、能力更強(qiáng)的新選擇。
![]()
CodeMender 中的 Gemini 3.5 Flash Cyber
高效發(fā)現(xiàn)并修復(fù)安全漏洞
AI 模型發(fā)現(xiàn)安全漏洞的速度正在加快,現(xiàn)有系統(tǒng)修復(fù)漏洞的能力卻未必能夠同步跟上。面對(duì)不斷擴(kuò)大的風(fēng)險(xiǎn),軟件安全體系需要同時(shí)具備更強(qiáng)的能力和更高的運(yùn)行效率。
Flash 系列兼具性能與效率,適合大規(guī)模檢測(cè)、驗(yàn)證和修復(fù)代碼安全問(wèn)題。Gemini 3.5 Flash Cyber 基于 Gemini 3.5 Flash 開(kāi)發(fā),并針對(duì)網(wǎng)絡(luò)安全漏洞的發(fā)現(xiàn)和修復(fù)進(jìn)行了專(zhuān)項(xiàng)微調(diào),每個(gè) Token 的使用成本低于更大規(guī)模的模型。
在 CodeMender 系統(tǒng)中,多個(gè) Gemini 3.5 Flash Cyber 智能體會(huì)協(xié)同工作,最終生成一份整合后的報(bào)告。通過(guò)這一機(jī)制,Gemini 3.5 Flash Cyber 在主流基準(zhǔn)測(cè)試 CyberGym 上取得了接近前沿水平的競(jìng)爭(zhēng)力表現(xiàn)。
![]()
考慮到這項(xiàng)技術(shù)具有明顯的雙重用途屬性,谷歌對(duì) Gemini 3.5 Flash Cyber 采取了審慎的開(kāi)放策略。
該模型近期將通過(guò) CodeMender 面向政府機(jī)構(gòu)和受信任的合作伙伴推出,并采用限量試點(diǎn)的方式提供。這樣可以讓一線(xiàn)安全防御人員優(yōu)先獲得相關(guān)能力,在關(guān)鍵漏洞被利用前完成發(fā)現(xiàn)和修復(fù),同時(shí)降低技術(shù)遭到大范圍濫用的風(fēng)險(xiǎn)。
更多信息可以查看以下模型卡:
- Gemini 3.6 Flash:https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-6-Flash-Model-Card.pdf
- Gemini 3.5 Flash-Lite:https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Lite-Model-Card.pdf
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.