當AI coding在前端開發(fā)中覆蓋率突破80%時,數(shù)據(jù)部門為何仍在手搓代碼?本文作者親測AI生成SQL指標方案的實戰(zhàn)經(jīng)歷,揭示了從指標字典準備到代碼驗證的全流程思考,以及如何通過AI解放人力創(chuàng)造更高價值。更重要的是,這一過程正在倒逼企業(yè)數(shù)據(jù)基建的規(guī)范化與標準化。
———— / BEGIN / ————
從今年1月份開始,筆者所在公司的前、后端開發(fā)們?nèi)奸_啟了 AI coding(通過 AI 輔助編寫代碼)的工作模式。除了外采供應(yīng)系統(tǒng)的改造開發(fā)外,其他端通過 AI 編寫代碼的覆蓋率最高甚至達到了 80% 以上。可筆者所在的數(shù)據(jù)部門,幾乎所有的數(shù)倉依然“不忘初心”——通過手搓代碼的方式去建表、開發(fā)指標。后來和他們交流,都清一色的回復:“等我跟 AI 講清楚的時間,我自己早都寫好了”。
一開始筆者也和大多數(shù)數(shù)倉伙伴一樣,認為 AI 還替代不了數(shù)據(jù)相關(guān)的崗位,還沾沾自喜不會有裁員的風險。當每隔幾周 AI 界就會出現(xiàn)爆炸性的突破時,筆者突然意識到如果還拿防御性的態(tài)度對待 AI 時,那將失去和 AI 產(chǎn)生其他可能性的機會。今天筆者就從術(shù)與道兩個維度,結(jié)合指標 AI 生產(chǎn)的實踐聊聊自己的想法,也歡迎大家在下方留言討論。
忘掉自己的崗位屬性,不確定的讓 AI 來輔助你
“如果我先把這條路跑通呢?”這是筆者當時的想法,因為數(shù)據(jù)產(chǎn)品本身就要求了解 SQL(一種用于操作、管理關(guān)系數(shù)據(jù)庫的語言),天然對數(shù)據(jù)開發(fā)有更多的了解,于是筆者決定自己上手去干。
起初筆者想在網(wǎng)絡(luò)上找一些關(guān)于指標 AI 開發(fā)的成功經(jīng)驗,但幾乎找不到一個可以復用的例子去模仿。后來想到 w 老師的一句話:“如果數(shù)據(jù)分析沒有思路,那就先假設(shè)一個結(jié)論,按這個方向去分析”,筆者索性假定 AI 大模型能夠執(zhí)行這個任務(wù),就問了大模型如下這句話:
我是想通過你幫我生成計算指標的 SQL ,我需要給你提供哪些必要信息?
經(jīng)過一輪的調(diào)整對話后,豆包、Claude 分別給筆者輸出了各自的方案(部分截圖如下),因為 Claude 方案簡潔,我優(yōu)先選定了 Claude 的方案去試驗。
![]()
理解 AI,給概率性思維設(shè)置目標與邊界
確認了方案選型后,筆者沒有立即啟動,因為 AI 開發(fā)本質(zhì)是對語義的理解,理解的不同就會出現(xiàn)各種概率性的執(zhí)行方式。這種機制對系統(tǒng)開發(fā)可能不會帶了極端影響,系統(tǒng)功能解決的是用戶需求,解決需求的結(jié)果也是多種多樣(比如,用戶登錄可以郵箱、手機登錄,也可以第三方或自己的域賬號登錄,最終結(jié)果是讓用戶可以訪問系統(tǒng))。可數(shù)據(jù)指標開發(fā)最終對應(yīng)的是具體數(shù)值,且只有唯一準確的數(shù)值。所以筆者在試驗方案時,選擇以開發(fā)過的口徑復雜的指標為切入點,最終將兩段 SQL 執(zhí)行的結(jié)果進行對比,驗證生成代碼的準確性。
在方案執(zhí)行前,筆者準備了兩類文檔,一類是指標字典(包含指標計算口徑及其計算因子對應(yīng)表、字段的血緣關(guān)系),另一類是元數(shù)據(jù)信息(包含字段名稱、字段說明等)和數(shù)據(jù)樣本,如下圖所示(數(shù)據(jù)樣本略)。
![]()
第一次讓 Claude 生成時,SQL 中的 where 條件多了三個筆者沒有在指標字典中聲明的內(nèi)容。后來筆者在排查中發(fā)現(xiàn)了問題,因為元數(shù)據(jù)文檔我直接照搬了數(shù)倉伙伴的注釋,而這三個正好是唯一進行“值說明”的字段(如上圖紅框部分),就影響了 AI 的注意力權(quán)重。于是在調(diào)整提示詞后,筆者得到了最終的代碼。
AI 的價值不是替代人,而是解放人去創(chuàng)造價值
在最后執(zhí)行兩段 SQL 代碼,AI 生成與數(shù)倉手搓的結(jié)果存在小數(shù)位的偏差。把兩段代碼提供給 Claude ,它快速定位到了不同點:數(shù)倉手搓的是按 SKU 單獨算天數(shù)再取整,而 AI 生成的是先匯總所有金額再統(tǒng)一算天數(shù)。后來在和數(shù)倉伙伴老川對數(shù)據(jù)二次計算校驗后,確認 AI 生成的計算邏輯更準確。首戰(zhàn)告捷,筆者非常開心,結(jié)合遇到的問題,整理出最終基于大模型的 SQL 代碼自動化生成方案(如下圖,已在筆者部門內(nèi)應(yīng)用)。
![]()
溫馨提示: 因為每次執(zhí)行都是概率性,所以一次有效的執(zhí)行動作一定要保存下來。如果經(jīng)常使用可以把上述過程生成 skills,這樣以后任何時候?qū)υ挘灰斎搿?技能名稱”就能調(diào)用。也可以把整個執(zhí)行過程生成個文件,當下次對話時可以讓 AI 訪問這個文件,了解上次的成功經(jīng)驗。
我們再回過頭來看看整個指標 AI 生產(chǎn)的過程,花費時間、精力最多的就是指標字典、元數(shù)據(jù)、表&字段血緣等信息的準備上,對于數(shù)倉來說確實是和 AI 對話的時間早都可以把 SQL 寫完了。但這不是一錘子的買賣,這個過程既反向要求數(shù)據(jù)部門做好數(shù)據(jù)基建(規(guī)范的數(shù)倉表架構(gòu)、指標字典、元數(shù)據(jù)等),又能夠在其他數(shù)據(jù)應(yīng)用上提供基礎(chǔ)(比如自助分析,下篇會介紹),是一個邊際成本遞減、效率不斷凸顯的過程。
讓我們成為在混亂中保持樂觀并推動事情發(fā)生的人吧~
本文來自公眾號:潮生兮 作者:潮生
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.