GPT Image2以1512分出色成績登頂Arena榜單,領(lǐng)先第二名241分,呈現(xiàn)出歷史最大分差生成速度提升6倍,3秒出圖,4K分辨率。英文、中文、韓文、孟加拉語的文字渲染準(zhǔn)確率超過99%。這些數(shù)字的背后,是一位中國學(xué)者帶領(lǐng)一支僅13人的團(tuán)隊(duì),和一張從無錫到伯克利再到MIT的華人學(xué)術(shù)傳幫帶網(wǎng)絡(luò)。他的名字叫做——陳博遠(yuǎn)。
這位年僅二十六歲、MIT博士畢業(yè)不到一年的年輕人,已然成為負(fù)責(zé)訓(xùn)練GPT圖像生成模型的核心五個人成員之一,同時還是Sora視頻生成團(tuán)隊(duì)的成員。他從高中夏令營里連Python語法都不懂的編程小白,到站在全球最強(qiáng)圖像生成模型最前方的Research Lead——只用了十年。
![]()
圖片來源: Boyuan Chen個人主頁
高中時代16歲玩機(jī)器人,17歲遇上引路人
陳博遠(yuǎn),2000年左右出生,他的高中時代在江蘇省天一中學(xué)度過。2015年起,由于自身對智能機(jī)器人領(lǐng)域的無盡熱愛,他選擇去擔(dān)任天一中學(xué)人工智能社的社長。在他的帶領(lǐng)下,天一中學(xué)的機(jī)器人小隊(duì)在全國乃至各類賽事中獲得優(yōu)異成績,成為了一名在人工智能領(lǐng)域擁有深厚學(xué)術(shù)背景、堅(jiān)定科研信念和抱負(fù)的青年學(xué)者。
2016年前后,16歲的他參加了FIRST Robotics Competition(FRC)。學(xué)校資源有限,但他每天花數(shù)小時設(shè)計機(jī)器人,帶隊(duì)完成比賽。同年5月,作為高二學(xué)生的他參加江蘇省青少年科技創(chuàng)新大賽,憑借圖像識別追蹤無人機(jī)項(xiàng)目入圍決賽。那時候他對AI還沒有概念。連Python的基本語法都不熟悉,NumPy是什么更是聞所未聞。
真正改變他軌跡的,是高二那年參加的一個科研夏令營。在那里,他結(jié)識了后來成為Google DeepMind資深研究員的華人學(xué)者夏斐(Fei Xia)。對一個高中生來說,這種出色的動手能力和鉆研勁頭是藏不住的。夏斐作為已經(jīng)在Google DeepMind工作的資深研究員,愿意花時間向一個高中生解釋什么是深度學(xué)習(xí),大概率是因?yàn)樗吹搅诉@個年輕人身上的好奇心和執(zhí)行力——這是做研究最核心的兩個素質(zhì)。正因如此,一個當(dāng)時連編程都不會的高中生,就這樣被推入了AI世界的大門。
![]()
圖片來源:新智元(中間陳博遠(yuǎn),右一夏斐)
從夏令營里的偶然相識,促成了學(xué)術(shù)圈里最原始、最純粹的師徒關(guān)系,而這段關(guān)系的起點(diǎn),只是一個前輩愿意花時間去引導(dǎo)一個后輩觀察,發(fā)現(xiàn)深度學(xué)習(xí)的世界。夏斐本身就是一個既做前沿研究、又愿意帶學(xué)生的學(xué)者。夏令營對他來說可能只是一個短期的mentoring機(jī)會,但對陳博遠(yuǎn)來說,這是整個職業(yè)生涯的入口。
本科階段18歲進(jìn)伯克利,19歲創(chuàng)業(yè),20歲進(jìn)頂級實(shí)驗(yàn)室
2017年,陳博遠(yuǎn)從天一中學(xué)國際部畢業(yè),進(jìn)入加州大學(xué)伯克利分校(UC Berkeley)。他選擇了計算機(jī)科學(xué)與應(yīng)用數(shù)學(xué)雙專業(yè),進(jìn)入競爭激烈的EECS榮譽(yù)班(EECS Honors),最終以3.96的GPA完成本科學(xué)業(yè)。
入學(xué)三個月后,18歲的他做了一件大多數(shù)新生不會嘗試的事,他創(chuàng)辦了機(jī)器人教育公司(Robot Locomotion Group Lab),為中小學(xué)生開發(fā)機(jī)器人競賽相關(guān)的軟硬件產(chǎn)品。這家公司從2017年11月一直經(jīng)營到2020年3月,跨越了他本科的大部分時間。從想法到代碼、從代碼到用戶、從用戶到收入,他完整走了一遍。一個18歲的大學(xué)生,一邊應(yīng)付EECS榮譽(yù)班的雙學(xué)位課程,一邊經(jīng)營一家面向中小學(xué)生的機(jī)器人教育公司——這種同時駕馭多件事的能力,后來在他同時操盤GPT圖像訓(xùn)練和Sora視頻兩大項(xiàng)目時,幾乎以更大的規(guī)模重演。
![]()
圖片來源:MIT CSAIL Alliances
2019年1月,20歲的他進(jìn)入伯克利人工智能實(shí)驗(yàn)室(BAIR),師從美國機(jī)器人學(xué)習(xí)領(lǐng)域的先驅(qū)Pieter Abbeel,從事深度強(qiáng)化學(xué)習(xí)和無監(jiān)督學(xué)習(xí)研究。這段經(jīng)歷一直持續(xù)到2021年8月,幾乎覆蓋了他本科的后兩年半。2021年,22歲的陳博遠(yuǎn)以雙學(xué)位榮譽(yù)畢業(yè),隨后進(jìn)入麻省理工學(xué)院(MIT)計算機(jī)科學(xué)與人工智能實(shí)驗(yàn)室(CSAIL)攻讀博士學(xué)位。
至暗時刻
陳博遠(yuǎn)的博士生涯比絕大多數(shù)人都要緊湊——2021年9月入學(xué),2025年完成答辯,不到四年,同時還輔修了哲學(xué)。但光鮮背后,他也經(jīng)歷過真實(shí)的低谷。讀博第一年,22至23歲的他因論文產(chǎn)出陷入瓶頸,這是他整個學(xué)術(shù)生涯最艱難的階段。
關(guān)鍵時刻,夏斐再次提供了決定性的幫助:協(xié)助陳博遠(yuǎn)發(fā)表了第一篇有影響力的研究NLMap,并邀請他到Google X與Google DeepMind參與兩次實(shí)習(xí)。第一次實(shí)習(xí)在2022年5月至8月,23歲的他在Google X實(shí)習(xí),表現(xiàn)出色到拿到了谷歌L4級別的return offer——但他選擇了decline,繼續(xù)深耕學(xué)術(shù)。第二次實(shí)習(xí)在2023年5月至8月,24歲的他來到Google DeepMind,在夏斐指導(dǎo)下主導(dǎo)搭建了基于大規(guī)模合成數(shù)據(jù)的多模態(tài)大語言模型(MLLM)數(shù)據(jù)合成管線,其總結(jié)的指令微調(diào)技術(shù)后來被Gemini2.0直接采用。
在MIT期間,他發(fā)表了多篇在學(xué)術(shù)界和工業(yè)界均獲得認(rèn)可的研究。其中博士代表作“Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion”入選NeurIPS 2024,提出了一種全新的序列生成訓(xùn)練范式,將逐token獨(dú)立噪聲級擴(kuò)散與因果下一個token預(yù)測結(jié)合。他還以共同一作身份發(fā)表了“SpatialVLM”,通過自動構(gòu)建互聯(lián)網(wǎng)規(guī)模的3D空間推理VQA數(shù)據(jù)集(1000萬圖像、20億QA對),為視覺語言模型賦予定量空間推理能力,可從單張2D圖像輸出米制距離、尺寸、方位等精確數(shù)值,將思維鏈空間推理應(yīng)用到了具身智能領(lǐng)域。
![]()
圖片來源:Google scholar
值得一提的是,在此期間,陳博遠(yuǎn)遇到了兩位出色的學(xué)者作為他的導(dǎo)師,他們分別是:1)Vincent Sitzmann,作為MIT EECS助理教授,領(lǐng)導(dǎo)Scene Representation Group(場景表示研究組),2)Russ Tedrake,作為MIT Toyota講席教授(橫跨EECS、航空航天、機(jī)械工程三個系),領(lǐng)導(dǎo)Robot Locomotion Group(機(jī)器人運(yùn)動研究組)。這兩位導(dǎo)師對他的影響十分深遠(yuǎn)。Vincent Sitzmann的“世界模型”研究思路——讓AI通過心理模擬器預(yù)判物理世界的變化,而不只是單純模仿像素——直接影響了陳博遠(yuǎn)后續(xù)在OpenAI的技術(shù)方向。在陳博遠(yuǎn)的讀博期間,Sitzmann幫助他探索把擴(kuò)散模型和序列生成結(jié)合起來的方法,讓模型理解并分析時序和空間上的因果邏輯,從而更好的生成更高質(zhì)量的內(nèi)容。兩人聯(lián)合發(fā)表了《History-Guided Video Diffusion》和《Large Video Planner》兩篇論文。
![]()
圖片來源:arXiv
Russ Tedrake則教會了他研究的“延遲滿足”:陳博遠(yuǎn)曾回憶,自己最初總想盡快投稿,但Tedrake會告訴他,“我知道你能把這篇論文投中,但我們應(yīng)該再打磨一下,推遲提交。”那些被推遲提交的作品,后來都收到了前所未有的好評。Tedrake還教會他欣賞他人的工作、強(qiáng)調(diào)自己算法的優(yōu)勢而非別人的局限——這種心態(tài)幫助他建立了真正有影響力的研究基礎(chǔ)。
2025年,不到26歲的陳博遠(yuǎn)完成MIT博士答辯。輔修哲學(xué)的他,在研究之外也保持著對技術(shù)與人類關(guān)系的深層思考。他在個人博客中寫道:“我可以負(fù)責(zé)任地告訴大家,具身智能一定是下一個一百年最令人激動的技術(shù),并且我們在有生之年很有希望見證通用機(jī)器人的誕生。”
OpenAI時代—從Sora到GPT Image 2的架構(gòu)重構(gòu)
2025年6月,博士剛畢業(yè)的陳博遠(yuǎn)加入OpenAI,迅速成為GPT圖像生成核心五人研究團(tuán)隊(duì)之一,負(fù)責(zé)GPT圖像生成模型的所有訓(xùn)練,同時也是Sora視頻生成團(tuán)隊(duì)的一員。在演示中,他給家鄉(xiāng)無錫做了一張海報。然后為來自首爾的隊(duì)友做韓文海報,為來自Bangladesh的隊(duì)友做孟加拉語海報。每一張中的文字渲染都精準(zhǔn)無誤。
十個月后,2026年4月,GPT Image2發(fā)布。發(fā)布會現(xiàn)場,陳博遠(yuǎn)和Sam Altman同臺主持,演示了文字渲染能力。但他在知乎博客里自嘲了一句:“多語言能力是直播后半節(jié),國內(nèi)媒體好像并沒有發(fā)現(xiàn)只有我才是國人QwQ。”這句帶表情符號的自嘲背后,是一個值得玩味的細(xì)節(jié)——在那支13人、華人過半的團(tuán)隊(duì)里,真正站到前臺承擔(dān)訓(xùn)練和能力展示核心角色的,是他。
![]()
圖片來源:陳博遠(yuǎn)的知乎博客
發(fā)布后不久,陳博遠(yuǎn)在知乎發(fā)了一篇博客,標(biāo)題非常直接:“我在OpenAI修中文。”開頭更直接:“大家好,我是GPT Image團(tuán)隊(duì)的研究科學(xué)家陳博遠(yuǎn)。上周發(fā)布的GPT生圖模型就是我主力訓(xùn)練的!”這篇博客不是技術(shù)論文,更像一個幕后花絮。但他透露的信息量足夠讓外界理解,GPT Image2為什么能做到99%的字符準(zhǔn)確率。
解題思路發(fā)生了改變,舊方法是把文字當(dāng)圖形畫,隨機(jī)噪聲還原成像素,“看起來像字”就行。GPT Image2把文字當(dāng)語言生成,一個token接一個token,圖像和文字共用同一個生成流程。對語言模型來說,輸出“好”和輸出任何語言的字符一樣可靠。這個思路,和陳博遠(yuǎn)2024年在NeurIPS發(fā)表的論文《Diffusion Forcing》高度呼應(yīng)。那篇論文的標(biāo)題就很直白:Next-token Prediction Meets Full-Sequence Diffusion。翻成大白話,就是讓“一個token接一個token的結(jié)構(gòu)能力”和“擴(kuò)散模型處理連續(xù)細(xì)節(jié)的能力”接上。他的學(xué)術(shù)工作,直接影響了他主力訓(xùn)練的這個產(chǎn)品。
陳博遠(yuǎn)在博客里還解釋了一個更有趣的細(xì)節(jié):整個官網(wǎng)blog的所有圖片,都是用模型生成的,完全沒有普通文本。而他親手做了其中大部分。那張中文彩蛋漫畫,是他想做一個“很搞笑的漫畫”,用到了“接住梗”和“香蕉梗”。為了展示文字能力,他特意讓模型在圖里加入多國語言文字,又在家鄉(xiāng)海報的右下角生成特別特別小的中文,用來測試模型到底能處理多細(xì)的細(xì)節(jié)。更關(guān)鍵的是,這張圖不是拼接出來的——整張圖,包括畫中畫和畫中畫中畫,都是一次性生成的。他擔(dān)心大家以為這是拼接圖,還特意在圖底加了備注。
![]()
圖片來源:陳博遠(yuǎn)的知乎博客
還有這張米粒刻字圖。4K分辨率,畫面里是一堆米粒,其中一顆米粒上刻著字。這測試的是模型在極小尺度里的文字控制能力。以及黑板視覺證明——用視覺方式證明數(shù)學(xué)定理。每一張看似宣傳物料的圖片,其實(shí)都是一次次有設(shè)計目的的能力測試。
![]()
圖片來源:陳博遠(yuǎn)的知乎博客
在博客最后,他特別感謝了整個團(tuán)隊(duì)。他說,每個人都做了很多很多的事情。在發(fā)布前的尾聲,他除了修一些小東西,就是和市場部門的同事、做藝術(shù)的同事一起準(zhǔn)備發(fā)布會和網(wǎng)站。GPT Image2是一次研究、產(chǎn)品、審美和傳播的共同完成。
布基膠帶
GPT Image2在正式發(fā)布前,用代號“duct-tape”在LMArena上進(jìn)行了雙盲測試。這個代號是陳博遠(yuǎn)自己起的。“至于為啥起名叫布基膠帶嘛,”他在知乎博客里寫,“當(dāng)然是因?yàn)槟憧梢杂貌蓟z帶把香蕉貼在墻上啦!”——指的是那幅世界聞名的藝術(shù)品,一根香蕉用布基膠帶貼在墻上。
![]()
圖片來源:陳博遠(yuǎn)的知乎博客
結(jié)果是:布基膠帶以ELO+242分?jǐn)嘌骂I(lǐng)先第二名,代號為“小香蕉”(nano banana)。+241分是LMArena圖像競技場有史以來最大的領(lǐng)先差距,沒有模型曾經(jīng)以這個幅度超過第二名。這不是小幅迭代,是架構(gòu)級別的跳躍。陳博遠(yuǎn)自己在博客里也確認(rèn),從去年12月底的GPT Image1.5算起,只用了四個月就有如此大的改進(jìn)。但是底層架構(gòu)已經(jīng)徹底重構(gòu),核心團(tuán)隊(duì)只有13人。
![]()
圖片來源:Gabriel Goh的Twitter
團(tuán)隊(duì)負(fù)責(zé)人Gabriel Goh在社交媒體上曬出了一張團(tuán)隊(duì)成員AI全家福。全員亞裔,華人過半。評論區(qū)有網(wǎng)友感嘆:怎么全是亞洲人?這個問題本身可能比任何技術(shù)論文都更能說明當(dāng)下的AI權(quán)力格局正在發(fā)生的變化。陳博遠(yuǎn)身后那張由夏斐、Pieter Abbeel、Russ Tedrake、Vincent Sitzmann等一代代學(xué)者搭建起來的華人學(xué)術(shù)傳幫帶網(wǎng)絡(luò),不是血緣關(guān)系,是知識關(guān)系——是無數(shù)個“他就像我的吳恩達(dá)”的鏈條疊加在一起,最終把一批二十多歲的年輕華人研究者,推到了全球AI創(chuàng)新的最中央。
從16歲在FRC賽場上設(shè)計機(jī)器人的高中生,到26歲帶隊(duì)重構(gòu)全球最強(qiáng)圖像生成模型的Research Lead,陳博遠(yuǎn)用十年時間走完了這條路徑。而視覺世界模型對于具身智能至關(guān)重要——這是他反復(fù)強(qiáng)調(diào)的信念。當(dāng)AI不僅能生成逼真的畫面,還能理解物理世界的運(yùn)行規(guī)律時,通用機(jī)器人的誕生才真正有了時間表。
從16歲在FRC賽場上設(shè)計機(jī)器人,到26歲站上OpenAI最核心的圖像生成團(tuán)隊(duì),陳博遠(yuǎn)只用了十年。但他最特別的地方,或許并不是“天才”——而是一種很少見的、始終愿意從零開始的研究者氣質(zhì)。高中時不會Python,讀博第一年經(jīng)歷低谷,進(jìn)入OpenAI后又重新“修中文”、重新思考圖像與語言的關(guān)系。
他不像那種鋒芒畢露的明星科學(xué)家,反而更像一個對世界始終保持好奇的人:認(rèn)真到會在一粒米上測試模型能不能刻字,也會為了一個香蕉梗給模型取名“duct-tape”。而這種近乎執(zhí)拗的好奇心,也許正是他一路走到今天的原因——真正推動AI向前的人,很多時候并不是最會講故事的人,而是那些愿意反復(fù)追問“機(jī)器到底有沒有真正理解世界?”的人。
[1] 新智元,來自MIT最強(qiáng)AI實(shí)驗(yàn)室:OpenAI天才華人研究員博士畢業(yè)了,https://www.36kr.com/p/3470460912801156
[2] 量子位,半壁華人!GPT Image 2團(tuán)隊(duì)曝光:無錫才俊帶隊(duì),https://www.qbitai.com/2026/04/405391.html
[3] 愛范兒,起底GPT Image 2 團(tuán)隊(duì)后,我扒出了一張華人師徒網(wǎng),https://www.ifanr.com/1663499
[4] MIT CSAIL,Boyuan Chen Spotlight,https://cap.csail.mit.edu/engage/spotlights/boyuan-chen
[5] 虎嗅,實(shí)測ChatGPT最新生圖模型三大發(fā)現(xiàn),https://www.huxiu.com/article/4853320.html
[6] 江蘇省天一中學(xué),天一校友風(fēng)采| 陳博遠(yuǎn):OpenAI天才華人研究員,https://www.tyzx.com.cn/gjjy/jsfc2
[7] Boyuan Chen個人主頁,https://www.boyuan.space/
[8] Boyuan Chen個人主頁Resume,https://www.boyuan.space/resume
加入ZF討論群,請先添加小助手微信
我們相信認(rèn)知能夠跨越階層,
致力于為年輕人提供高質(zhì)量的科技和財經(jīng)內(nèi)容。
稿件經(jīng)采用可獲邀進(jìn)入Z Finance內(nèi)部社群,優(yōu)秀者將成為簽約作者,00后更有機(jī)會成為Z Finance的早期共創(chuàng)成員。
我們正在招募新一期的實(shí)習(xí)生
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.