![]()
該論文團(tuán)隊(duì)由來(lái)自10所高校的28位研究者構(gòu)成,核心作者包含加州大學(xué)伯克利分校呂博涵、韓鑫陽(yáng),普渡大學(xué)張家儒,華盛頓大學(xué)李星漢,以及清華大學(xué)楊玉成、黃思喬、徐啟鑫、張華清、張軼程。團(tuán)隊(duì)成員覆蓋多領(lǐng)域背景,在大語(yǔ)言模型、強(qiáng)化學(xué)習(xí)、MLsys、計(jì)算機(jī)視覺、優(yōu)化理論等領(lǐng)域的成果受到學(xué)界業(yè)界廣泛認(rèn)可。
當(dāng)一個(gè) AI Agent 在機(jī)器學(xué)習(xí)實(shí)驗(yàn)中得到更高分,提升究竟來(lái)自哪里?
它可能提出了新的優(yōu)化器或訓(xùn)練目標(biāo),也可能只是調(diào)整了學(xué)習(xí)率、擴(kuò)大了模型、修改了數(shù)據(jù)處理,甚至找到了評(píng)測(cè)流程中的漏洞。只觀察最終指標(biāo),往往無(wú)法區(qū)分方法創(chuàng)新與工程優(yōu)化。
這也是現(xiàn)有 Auto-Research 評(píng)測(cè)面對(duì)的核心歸因問(wèn)題。代碼生成與實(shí)驗(yàn)執(zhí)行已經(jīng)成為前沿模型的常見能力,但「能完成研究流程」并不等于「能發(fā)現(xiàn)更好的方法」。如果不控制數(shù)據(jù)、容量、訓(xùn)練預(yù)算和評(píng)測(cè)協(xié)議,任何分?jǐn)?shù)提升都很難被可靠歸因到算法本身。
來(lái)自伯克利、普林斯頓、清華等多家機(jī)構(gòu)的研究者提出MLS-Bench,試圖在可執(zhí)行環(huán)境中單獨(dú)測(cè)量這項(xiàng)能力。它包含 12 個(gè)機(jī)器學(xué)習(xí)領(lǐng)域的 140 個(gè)真實(shí)研究任務(wù),每個(gè)任務(wù)都設(shè)置多個(gè)泛化條件,并在統(tǒng)一代碼庫(kù)中復(fù)現(xiàn)至少三種強(qiáng)人類方法,其中包括領(lǐng)域公認(rèn)的 SOTA。
論文對(duì)初版五個(gè)前沿模型的分析發(fā)現(xiàn),即使獲得這些強(qiáng)方法的實(shí)現(xiàn),模型仍然更擅長(zhǎng)優(yōu)化和組合已有組件,而不是完成真正的方法發(fā)現(xiàn)。
![]()
MLS-Bench 論文首頁(yè):
- 論文:https://arxiv.org/abs/2605.08678
- 項(xiàng)目主頁(yè):https://mls-bench.com/
- GitHub:https://github.com/Imbernoulli/MLS-Bench
現(xiàn)有評(píng)測(cè)為什么難以測(cè)量方法發(fā)現(xiàn)
過(guò)去一年,自動(dòng)研究系統(tǒng)取得了不少進(jìn)展。一類系統(tǒng)把代碼生成、自動(dòng)驗(yàn)證和進(jìn)化搜索連接起來(lái),在 circle packing、kernel 優(yōu)化或固定訓(xùn)練任務(wù)中持續(xù)提高指標(biāo);另一類系統(tǒng)嘗試讓 Agent 閱讀論文、提出想法、編寫實(shí)現(xiàn)并生成研究報(bào)告。
兩類路線分別證明了大模型可以進(jìn)行大規(guī)模搜索,也可以執(zhí)行越來(lái)越完整的研究流程。但它們?nèi)粤粝乱粋€(gè)共同問(wèn)題:結(jié)果變好時(shí),我們不知道模型究竟發(fā)現(xiàn)了什么。
具體來(lái)看,MLE-Bench 一類任務(wù)繼承了數(shù)據(jù)挖掘競(jìng)賽的形式:模型獲得訓(xùn)練集與測(cè)試接口,通過(guò)數(shù)據(jù)清洗、特征工程和既有算法組合提高單個(gè)數(shù)據(jù)集上的預(yù)測(cè)表現(xiàn)。這適合評(píng)估機(jī)器學(xué)習(xí)工程,但單點(diǎn)結(jié)果無(wú)法說(shuō)明候選方法能否遷移。另一類端到端研究評(píng)測(cè)讓 Agent 生成方案和論文,再由語(yǔ)言模型從新穎性、完整性與可行性等維度評(píng)分,卻不直接比較候選方法的實(shí)際性能。
還有一些任務(wù)更接近方法搜索,但聚焦范圍較窄。例如激活函數(shù)發(fā)現(xiàn)可以在少數(shù)固定數(shù)據(jù)和模型上驗(yàn)證大量表達(dá)式;nanoGPT speedrun 可以持續(xù)吸收新優(yōu)化器、注意力實(shí)現(xiàn)與訓(xùn)練技巧。它們能夠推動(dòng)具體系統(tǒng),卻沒(méi)有為跨領(lǐng)域方法發(fā)現(xiàn)提供統(tǒng)一測(cè)量。
在擁有廉價(jià)驗(yàn)證器的任務(wù)中,系統(tǒng)可以生成大量候選,通過(guò)單一分?jǐn)?shù)選擇最優(yōu)實(shí)現(xiàn)。這種設(shè)置適合測(cè)量搜索效率,卻不要求候選方法跨數(shù)據(jù)、模型或規(guī)模成立。端到端研究任務(wù)覆蓋范圍更廣,但允許模型修改的環(huán)節(jié)也更多。只要數(shù)據(jù)處理、訓(xùn)練資源、模型容量或評(píng)分邏輯沒(méi)有鎖定,局部工程收益就可能被誤認(rèn)為方法進(jìn)步。
機(jī)器學(xué)習(xí)方法的價(jià)值通常來(lái)自可遷移性。殘差連接、Attention、歸一化或 Adam 并不是只在某個(gè)固定實(shí)例上有效;它們解決了更一般的問(wèn)題,并在條件發(fā)生變化時(shí)繼續(xù)帶來(lái)收益。因此,一套面向方法發(fā)現(xiàn)的評(píng)測(cè)至少需要回答兩個(gè)問(wèn)題:
- 提升能否被歸因到目標(biāo)研究組件,而不是其他工程變量?
- 同一個(gè)改進(jìn)能否跨越多個(gè)數(shù)據(jù)、環(huán)境、模型或規(guī)模?
從這個(gè)角度看,工程優(yōu)化與科學(xué)方法發(fā)現(xiàn)的區(qū)別不在于是否寫代碼,而在于優(yōu)化對(duì)象。工程任務(wù)允許圍繞一個(gè)最終指標(biāo)使用多種技巧;方法發(fā)現(xiàn)則要求改進(jìn)一個(gè)明確研究組件,并驗(yàn)證它在多個(gè)下游條件與更大規(guī)模中仍然成立。
MLS-Bench 的任務(wù)設(shè)計(jì)圍繞這兩個(gè)問(wèn)題展開。
從真實(shí)研究問(wèn)題構(gòu)造 140 個(gè)可執(zhí)行任務(wù)
MLS-Bench 覆蓋語(yǔ)言模型預(yù)訓(xùn)練、語(yǔ)言模型后訓(xùn)練、視覺生成、強(qiáng)化學(xué)習(xí)、機(jī)器人、機(jī)器學(xué)習(xí)系統(tǒng)、AI for Science、優(yōu)化與理論、因果推斷、時(shí)間序列和可信學(xué)習(xí)等 12 個(gè)方向,共包含 140 個(gè)任務(wù)。
任務(wù)跨度包括 KV 緩存壓縮、主動(dòng)學(xué)習(xí)、時(shí)空交通預(yù)測(cè)、黑洞圖像逆問(wèn)題、抗體與抗原結(jié)合、機(jī)器人世界模型、訓(xùn)練量化以及優(yōu)化與理論問(wèn)題。完整評(píng)測(cè)運(yùn)行一次候選方案約需 700 個(gè) H100 小時(shí);30 題的 MLS-Bench-Lite 將單次評(píng)測(cè)降至約 90 個(gè) H100 小時(shí)。這個(gè)成本本身也反映了真實(shí)方法驗(yàn)證與廉價(jià)代碼評(píng)分之間的差異。
這些任務(wù)并不要求模型總結(jié)論文或復(fù)現(xiàn)既有實(shí)驗(yàn)。每個(gè)任務(wù)都從真實(shí)代碼庫(kù)和具體研究問(wèn)題出發(fā),要求 Agent 修改一個(gè)明確的研究組件。例如,候選提交可能是一種新的訓(xùn)練目標(biāo)、優(yōu)化器、注意力變體、采樣策略或路由機(jī)制。模型必須提交可運(yùn)行實(shí)現(xiàn),并通過(guò)統(tǒng)一評(píng)測(cè)得到結(jié)果。
![]()
MLS-Bench 關(guān)注方法在多個(gè)條件下是否持續(xù)有效,而不是固定實(shí)例上的單點(diǎn)提升。
完整任務(wù)包含五類關(guān)鍵要素:
- 一個(gè)具體研究問(wèn)題和對(duì)應(yīng)的真實(shí)代碼庫(kù);
- 一個(gè)由領(lǐng)域?qū)<倚?zhǔn)的可修改范圍;
- 至少三個(gè)用于檢驗(yàn)遷移能力的測(cè)試條件;
- 至少三種強(qiáng)人類基線,其中包括領(lǐng)域公認(rèn)的 SOTA;
- 在同一代碼庫(kù)、同一訓(xùn)練與評(píng)測(cè)流程中復(fù)現(xiàn)的基線結(jié)果。
團(tuán)隊(duì)還從中選擇 30 個(gè)任務(wù)構(gòu)成 MLS-Bench-Lite。這個(gè)子集覆蓋全部 12 個(gè)方向,用于成本更低的持續(xù)評(píng)測(cè)。Kimi K3 和 Qwen3.8-Max 已在各自官方發(fā)布中采用這一版本。
![]()
圖片分別來(lái)自 Kimi K3 Tech Blog 與 Qwen3.8-Max 官方 Blog。
受控修改范圍如何隔離算法貢獻(xiàn)
開放性與可歸因性之間存在直接張力。允許模型修改整個(gè)倉(cāng)庫(kù),更接近自由研究,但難以判斷增益來(lái)源;只允許修改少量代碼,又可能排除真正有價(jià)值的方法。
MLS-Bench 通過(guò)復(fù)現(xiàn)人類基線來(lái)校準(zhǔn)這個(gè)邊界。對(duì)每個(gè)任務(wù),研究團(tuán)隊(duì)首先將至少三種代表性方法重新接入同一代碼庫(kù),并確認(rèn)其中的 SOTA 能夠恢復(fù)參考性能。如果某種強(qiáng)方法無(wú)法在給定范圍內(nèi)表達(dá),說(shuō)明任務(wù)邊界過(guò)窄;如果無(wú)需改動(dòng)目標(biāo)組件也能顯著提高結(jié)果,說(shuō)明邊界仍然過(guò)寬。
經(jīng)過(guò)校準(zhǔn)后,模型只能修改與目標(biāo)問(wèn)題直接相關(guān)的部分。研究訓(xùn)練目標(biāo)時(shí),數(shù)據(jù)管線、評(píng)分器和共享訓(xùn)練協(xié)議保持固定;研究模型結(jié)構(gòu)時(shí),系統(tǒng)會(huì)檢查參數(shù)規(guī)模,避免通過(guò)增加容量換取性能;涉及不同計(jì)算預(yù)算的任務(wù),也會(huì)統(tǒng)一資源約束。
部分原始研究使用的訓(xùn)練規(guī)模過(guò)大,無(wú)法直接放入持續(xù)評(píng)測(cè)。MLS-Bench 對(duì)這類任務(wù)使用較小模型或較少數(shù)據(jù),但要求所有人類基線在縮小后的規(guī)模上保持原有性能排序。也就是說(shuō),降低驗(yàn)證成本不能改變?nèi)蝿?wù)對(duì)方法優(yōu)劣的基本判斷。140 個(gè)任務(wù)都需要通過(guò)這項(xiàng)校準(zhǔn)。
![]()
強(qiáng)人類方法與模型提交在相同代碼基礎(chǔ)和相同協(xié)議中比較。
多個(gè)測(cè)試條件承擔(dān)另一個(gè)作用。模型可能在可見反饋上找到特例,但候選方法還需要在未用于局部?jī)?yōu)化的數(shù)據(jù)集、環(huán)境、模型規(guī)模或訓(xùn)練條件中繼續(xù)有效。一個(gè)只提高單個(gè)實(shí)例、離開當(dāng)前條件便失效的補(bǔ)丁,不會(huì)被計(jì)為一般性方法進(jìn)步。
不同任務(wù)包含不同數(shù)量的條件和指標(biāo),論文采用三級(jí)統(tǒng)一評(píng)分。原始指標(biāo)先以人類基線為錨點(diǎn)進(jìn)行變換,再在同一測(cè)試條件內(nèi)聚合,最后得到任務(wù)分?jǐn)?shù)。對(duì)單項(xiàng)指標(biāo),最弱基線對(duì)應(yīng) 0 分,最強(qiáng)基線對(duì)應(yīng) 50 分;存在理論上界的指標(biāo)還保留繼續(xù)向上的空間。
由于分?jǐn)?shù)先在單項(xiàng)指標(biāo)上錨定,再跨測(cè)試條件和任務(wù)聚合,最終總分并不是一條預(yù)先設(shè)置的「人類及格線」。它適合比較候選方案的整體表現(xiàn),卻不能單獨(dú)證明某個(gè)候選包含新的方法機(jī)制。
這種設(shè)計(jì)使 MLS-Bench 更接近受控實(shí)驗(yàn)。最終變量不是模型能修改多少工程細(xì)節(jié),而是它能否圍繞目標(biāo)研究問(wèn)題提出一個(gè)具有遷移性的算法改動(dòng)。
主實(shí)驗(yàn)測(cè)到的,不只是模型會(huì)不會(huì)跑實(shí)驗(yàn)
主實(shí)驗(yàn)為五個(gè)前沿模型提供兩種工作方式。第一種直接評(píng)估模型首次提出的方案;第二種允許模型進(jìn)入代碼庫(kù),多輪運(yùn)行實(shí)驗(yàn)并修改實(shí)現(xiàn),最后提交最優(yōu)版本。
模型同時(shí)獲得強(qiáng)人類基線代碼,其中包括當(dāng)前公認(rèn)的最佳方法。因此,實(shí)驗(yàn)并不是測(cè)量模型能否從零復(fù)現(xiàn)文獻(xiàn),而是在已有方法清楚可見時(shí),它能否繼續(xù)發(fā)現(xiàn)更好的機(jī)制。
![]()
網(wǎng)頁(yè)柱狀圖分別展示模型首次方案、多輪實(shí)驗(yàn)結(jié)果與 Human SOTA。
論文主實(shí)驗(yàn)中,多輪實(shí)驗(yàn)普遍改善了匯總成績(jī),但當(dāng)時(shí)評(píng)測(cè)的五個(gè)模型所提出的方法在整體表現(xiàn)上均未超過(guò) Human SOTA。此后隨著更強(qiáng)模型進(jìn)入公開榜單,總分仍在繼續(xù)上漲。不過(guò),當(dāng)前領(lǐng)先成績(jī)的絕對(duì)水平依然不高,評(píng)測(cè)遠(yuǎn)未飽和。比某個(gè)時(shí)間點(diǎn)的靜態(tài)排名更重要的,是模型通過(guò)什么方式取得這些分?jǐn)?shù)。
更關(guān)鍵的是模型如何取得提升。對(duì)初版五個(gè)模型的消融和專家分析顯示,模型主要圍繞已知組件進(jìn)行局部修改、參數(shù)調(diào)整和重新組合,很少提出能夠解釋現(xiàn)有失敗、并在多個(gè)條件中持續(xù)成立的新機(jī)制。
模型規(guī)模檢查的控制實(shí)驗(yàn)進(jìn)一步說(shuō)明了嚴(yán)格歸因的必要性。移除這項(xiàng)檢查后,所有模型都會(huì)通過(guò)擴(kuò)大參數(shù)規(guī)模提高成績(jī),部分候選甚至超過(guò)人類基線。表面上看是 Agent 發(fā)現(xiàn)了更優(yōu)方案,實(shí)際上被改變的是容量,而不是目標(biāo)算法。重新施加容量約束后,這類收益隨即消失。
這一差距不能簡(jiǎn)單解釋為模型不會(huì)使用代碼工具。Agent 能夠讀寫倉(cāng)庫(kù)、運(yùn)行訓(xùn)練、查看指標(biāo)并迭代方案。問(wèn)題出現(xiàn)在更上游的方法選擇:它們往往圍繞已知組件做局部修改,卻很少提出能夠解釋現(xiàn)有失敗并產(chǎn)生穩(wěn)定增益的新機(jī)制。
消融分析區(qū)分了「優(yōu)化」與「發(fā)現(xiàn)」
研究團(tuán)隊(duì)進(jìn)一步改變?nèi)蝿?wù)提示。要求模型「發(fā)現(xiàn)新方法」時(shí),表現(xiàn)弱于把目標(biāo)表述為「優(yōu)化現(xiàn)有方法」時(shí)的結(jié)果。這說(shuō)明當(dāng)前模型的優(yōu)勢(shì)更接近工程搜索,而不是方法發(fā)現(xiàn)。
專家案例分析支持了這一點(diǎn)。很多候選提交可以運(yùn)行,也會(huì)組合多種已知技術(shù),但核心結(jié)構(gòu)通常來(lái)自已經(jīng)提供的基線。模型會(huì)把一個(gè)方法的損失函數(shù)、另一個(gè)方法的模塊和第三個(gè)方法的調(diào)度策略拼接起來(lái),再進(jìn)行局部參數(shù)調(diào)整。真正新的機(jī)制很少;即使出現(xiàn),也經(jīng)常沒(méi)有一個(gè)足夠有洞見的假設(shè)來(lái)說(shuō)明它為什么應(yīng)該跨條件有效。
![]()
模型輸出通常更接近對(duì)已知組件的重新組合。
這一區(qū)分很重要。組合已有模塊可能產(chǎn)生實(shí)用系統(tǒng),也可能提高具體任務(wù)表現(xiàn),但它與提出一種新的、可推廣的方法并不是同一能力。MLS-Bench 的實(shí)驗(yàn)結(jié)果表明,當(dāng)前模型在前者上已經(jīng)較強(qiáng),在后者上仍存在明顯缺口。
測(cè)試時(shí)擴(kuò)展提高分?jǐn)?shù),但沒(méi)有改變行為模式
增加迭代和采樣能否彌補(bǔ)能力差距?論文測(cè)試了不同規(guī)模的測(cè)試時(shí)計(jì)算。
![]()
增加嘗試次數(shù)可以改善簡(jiǎn)單任務(wù),但收益很快飽和。
更多迭代和大規(guī)模采樣通常能夠提高結(jié)果,但收益很快趨于飽和,模型仍主要圍繞已有候選空間進(jìn)行局部搜索。當(dāng)模型只獲得部分測(cè)試條件的反饋時(shí),持續(xù)搜索還可能過(guò)度適應(yīng)這些可見條件,導(dǎo)致候選方法在未開放條件下退化。
這說(shuō)明搜索規(guī)模與方法創(chuàng)新不是可以直接互換的變量。更多采樣能夠更充分地探索已定義的候選空間,但它不能保證模型提出一個(gè)更好的問(wèn)題解釋,也不能自動(dòng)創(chuàng)造新的算法空間。
比提出想法更難的是規(guī)劃實(shí)驗(yàn)
論文還設(shè)置了一個(gè)受算力約束的預(yù)訓(xùn)練研究實(shí)驗(yàn),用于觀察模型是否具備更完整的科學(xué)判斷。
固定方案原本允許進(jìn)行三次完整的 345M 參數(shù)訓(xùn)練。研究團(tuán)隊(duì)將前兩次訓(xùn)練的資源轉(zhuǎn)換成一筆可自由分配的預(yù)算,讓模型自行選擇代理模型規(guī)模、訓(xùn)練 token 數(shù)、實(shí)驗(yàn)順序,以及何時(shí)進(jìn)行完整驗(yàn)證。
這相當(dāng)于給模型更多研究自由。它可以先用便宜實(shí)驗(yàn)檢驗(yàn)假設(shè),排除錯(cuò)誤方向,再把剩余資源投入最有希望的方案。然而,更多選擇通常沒(méi)有帶來(lái)更好結(jié)果。一個(gè)模型消耗大量預(yù)算后性能反而下降;唯一獲得提升的模型只使用了很少資源。
![]()
當(dāng)前模型仍難以把有限算力分配給最有信息量的實(shí)驗(yàn)。
模型之間的差距因此不僅體現(xiàn)在能否提出新想法,還體現(xiàn)在能否形成有洞見的假設(shè)、選擇有效代理實(shí)驗(yàn)、根據(jù)不完整反饋更新判斷,并決定何時(shí)值得進(jìn)行昂貴驗(yàn)證。
給模型加入網(wǎng)頁(yè)搜索、基線論文推導(dǎo)和理論背景,也只帶來(lái)有限改善。信息更多并沒(méi)有自動(dòng)轉(zhuǎn)化為更好的實(shí)驗(yàn)決策。這表明當(dāng)前瓶頸不是單純的知識(shí)缺失,而是建立與驗(yàn)證證據(jù)所需的、更廣泛的科學(xué)判斷力。
從廉價(jià)驗(yàn)證轉(zhuǎn)向完整科學(xué)發(fā)現(xiàn)
當(dāng)前大規(guī)模搜索范式可以追溯到一條清楚的技術(shù)路徑。AlphaGo 與 AlphaZero 在規(guī)則明確的博弈中進(jìn)行深度搜索;AlphaTensor 將矩陣乘法重寫為可搜索的數(shù)學(xué)對(duì)象;FunSearch 讓語(yǔ)言模型生成函數(shù),并通過(guò)自動(dòng)評(píng)分保留更優(yōu)候選;AlphaEvolve 則把同一循環(huán)擴(kuò)展到更復(fù)雜的程序與代碼庫(kù)。
![]()
語(yǔ)言模型生成候選程序,自動(dòng)評(píng)分器執(zhí)行并打分,程序庫(kù)再?zèng)Q定下一輪的搜索起點(diǎn)。圖源:Google DeepMind。
基于大規(guī)模搜索的自改進(jìn)工作通常依賴快速、明確的驗(yàn)證器。每個(gè)候選都能立刻得到分?jǐn)?shù),因此擴(kuò)大采樣量能夠提高找到好答案的概率。
科學(xué)研究中的驗(yàn)證則經(jīng)常昂貴、延遲、多階段且只能部分觀察。一次實(shí)驗(yàn)失敗可能來(lái)自方法、實(shí)現(xiàn)、數(shù)據(jù)、尺度或隨機(jī)性;研究者需要用小規(guī)模實(shí)驗(yàn)區(qū)分多種解釋,再?zèng)Q定是否投入完整訓(xùn)練。此時(shí)真正受限的不是可生成多少候選,而是多少計(jì)算能夠轉(zhuǎn)化為有效證據(jù)。
論文將目標(biāo)概括為:在驗(yàn)證難以規(guī)模化的條件下,實(shí)現(xiàn)可規(guī)模化的科學(xué)發(fā)現(xiàn)。
這也給 Auto-Research 提出了更嚴(yán)格的評(píng)測(cè)標(biāo)準(zhǔn)。一個(gè)系統(tǒng)不僅要產(chǎn)出候選方法,還需要說(shuō)明提升來(lái)自哪里,驗(yàn)證它在多個(gè)條件下是否成立,并在有限資源下完成從假設(shè)到證據(jù)的研究過(guò)程。
隨著傳統(tǒng)代碼評(píng)測(cè)逐漸飽和,AI for Research 正成為新的能力前沿。Kimi K3 與 Qwen3.8-Max 已將 MLS-Bench-Lite 放入官方發(fā)布評(píng)測(cè)。下一步值得持續(xù)觀察的,不只是模型能否執(zhí)行研究,而是它何時(shí)能夠獨(dú)立發(fā)現(xiàn)并驗(yàn)證真正推動(dòng)機(jī)器學(xué)習(xí)前進(jìn)的方法。
MLS-Bench 論文:https://arxiv.org/abs/2605.08678
MLS-Bench 項(xiàng)目主頁(yè):https://mls-bench.com/
MLS-Bench GitHub:https://github.com/Imbernoulli/MLS-Bench
Kimi K3 官方博客:https://www.kimi.com/blog/kimi-k3
Qwen3.8-Max 官方博客:https://qwen.ai/blog?id=qwen3.8
Anthropic《When AI builds itself》:https://www.anthropic.com/institute/recursive-self-improvement
Richard Sutton《The Bitter Lesson》:https://bitterlesson.ai/
Google DeepMind AlphaEvolve:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.