7月17日的WAIC主論壇上,中國工程院院士、之江實驗室主任、阿里云創始人王堅在演講中表示,人工智能正迎來一個如同數學般成為科學基礎設施的轉折點;而要駕馭這場深遠的科學革命,核心在于讓真正的科學數據成為大模型的“原住民”。
在王堅看來,今天,我們又到了一個依靠數據重新認識人工智能的關鍵節點。在當前的語境中,存在一個巨大的思維盲區——中文世界常把“大模型”等同于“大語言模型”。王堅指出,大語言模型本質上只是一個建立在“文本數據”上的基礎模型。人類處理文本的歷史非常古老,中國古代漢語和古拉丁文最初都沒有標點符號和空格,人必須要念出聲來才能理解。而現代人加空格、加標點的樸素行為,本質上就和今天大模型做分詞的邏輯如出一轍。
王堅表示,如果AI對科學的理解僅局限于人類現有的、被寫成論文和代碼的死知識,那么未來的創新空間將被嚴重鎖死。正因如此,之江實驗室在幾年前就明確定義了“科學基礎模型”,內部代號為“021”。它不是一個被局限在某一學科的垂直模型,而是一個獨立的、具備最基本能力的通用基礎模型。它的終極目標非常純粹,即通過對科學數據進行分詞,將文本、代碼與真正的科學數據融合在同一個空間和同一個大模型中,讓科學數據真正成為大模型的原住民。
在演講的最后,王堅院士預言:人工智能已經到了一個非常不一樣的轉折點,它變得跟數學一樣基礎,不再是一個領域的獨立的東西。王堅斷言,數學在人類科學歷史上起了多大的基礎性作用,在接下來的五十年里,人工智能對人類科學研究所起的作用就會有多大。而這一切的起點,都取決于我們今天能否勇敢地打破文本的藩籬,讓科學數據成為智能時代真正的原住民。(漢雨棣)
