來源:市場資訊
(來源:新智元 新智元)
![]()
新智元報道
![]()
最尷尬的一刻,往往不是AI PPT生成失敗。
而是它明明已經生成了一套還不錯的slides,你只是說:「把第 8 頁右下角那塊改得更像流程圖。」
下一秒,第8頁可能確實改了,但第3頁標題層級變了,第12頁配色也漂了,前面反復調好的風格又被打散。
這才是真實PPT工作流里更常見的痛點。
第一版只是草稿,改稿才是主戰場。
從「生成一套」到「生成得像這個用戶」
過去幾年,自動幻燈片生成進步很快。很多系統已經可以從論文、產品說明或一句主題出發,生成結構完整、視覺上也不算粗糙的初稿。
但在真實使用里,第一版slides的關鍵不只是「有沒有生成出來」,而是它是不是已經貼近某個用戶的表達習慣。
同一篇Transformer論文,可以被講成基礎教學課,也可以被組織成組會匯報、論文精讀或技術培訓。不同用戶關心的頁面角色、內容密度、證據邊界和機制展開方式都不一樣。有人希望先給結論和takeaways,有人更希望把定義、機制、邊界條件拆清楚。
這正是用戶畫像記憶在round-0階段的作用。
由北京郵電大學、清華大學、上海交通大學合作完成MemSlides 不是等到用戶反復修改之后才開始「記住」,而是在首輪生成時就會根據當前任務意圖檢索用戶畫像,將兼容的長期偏好路由到當前工作記憶里,用來影響頁面組織和表達方式。
![]()
論文鏈接: https://arxiv.org/abs/2606.17162
項目主頁: https://memslides.github.io/
演示鏈接: https://memslides.com/
代碼鏈接: https://github.com/huohua325/Memslides
HF鏈接: https://huggingface.co/papers/2606.17162
該工作登頂Hugging Face Daily Papers #1 Paper of the Day,GitHub已獲400+ stars;Demo website上線后也已吸引 100+ verified users試用。
圖1展示的不是一個泛泛的「生成效果圖」。它更像是在說明:系統如何把論文材料拆成定義、核心機制、實驗依據、常見誤區和邊界條件等頁面。這些選擇背后,對應的就是用戶畫像中關于內容結構、信息密度和證據導向表達的偏好。
![]()
圖1:首輪生成不僅體現完整性,也體現用戶畫像記憶對頁面組織、內容密度和證據邊界的影響。
項目也提供了在線Demo。用戶可以上傳材料、選擇memory profile或模板,生成初稿后繼續進入revision,并下載當前版本的PPTX、HTML或PDF。
也就是說,MemSlides面向的是從個性化初稿到后續持續修改的完整流程。
而一旦第一版已經開始貼近用戶,后續問題就變得更尖銳:系統能否在多輪修改中繼續保留這些偏好?當前會話里臨時提出的要求,會不會過幾輪就失效?用戶只想改一個局部區域時,系統能不能避免把已經對齊的頁面重新打散?
讓記憶分工
很多人一聽到「Agent memory」,會自然想到:那就把歷史對話放進更長的上下文里。
MemSlides 沒這么做。
原因很簡單:歷史越長,里面的沖突也越多。今天用戶說「這套報告用藍色標題」,不代表他以后所有 PPT 都要藍色標題;用戶在某次編輯里遇到的工具錯誤,也不應該和「他喜歡什么風格」混在一起。
因此,MemSlides 把個性化幻燈片生成建模成一個有狀態的 authoring process:系統先根據源材料、用戶畫像記憶和可選模板生成 round-0 初稿;之后每一輪反饋都會更新當前 session state,再圍繞當前 deck 做局部編輯。
它的記憶組織有兩個視角。
從生命周期看,有長期記憶和工作記憶。長期記憶保存跨任務穩定存在的信息,工作記憶保存當前 deck 中仍然有效的臨時約束、修改目標和執行狀態。
從功能角色看,有用戶畫像記憶和工具記憶。前者回答「這套 slides 應該體現什么偏好」,后者回答「Agent 應該怎么改得更穩」。
換句話說,MemSlides 不是讓 Agent 記住更多廢話,而是讓它知道哪些信息該長期保留,哪些只在當前任務里生效,哪些屬于用戶偏好,哪些屬于工具經驗。
![]()
圖2:MemSlides 將長期記憶、工作記憶、用戶畫像記憶和工具記憶組織到同一個多輪改稿流程中。
用戶畫像
真正的個性化,通常不是一句 role prompt 能解決的。
同樣是學術匯報,有人喜歡每頁只放一個核心結論,有人會保留公式和實驗細節;同樣是商業路演,有人偏好高密度表格,有人更依賴趨勢圖和對比圖。
這些差異不是一次 prompt 里的標簽,而是用戶在長期寫作和修改中慢慢暴露出來的習慣。
MemSlides 用用戶畫像記憶來保存這類跨任務偏好。它不是把 profile 整塊貼到 prompt 前面,而是在任務開始時根據當前 intent 檢索相關偏好,再與本輪請求做協調。
如果長期偏好和當前明確指令兼容,它們會一起進入工作記憶;如果發生沖突,當前這套 slides 的明確要求優先。
這一步很重要。否則,系統很容易把「這次臨時想要藍色標題」誤當成「用戶永遠喜歡藍色標題」。
任務結束后,MemSlides 也不會把每一句反饋都寫回長期畫像。它只沉淀穩定、可遷移的交互信號,讓下一次生成更貼近用戶,而不是更混亂。
![]()
圖3:用戶畫像記憶會經歷檢索、路由、當前任務使用和任務結束后的穩定信號沉淀。
工作記憶
多輪改稿里,還有一類信息更微妙。
它不是長期偏好,卻必須在當前 deck 里持續有效。
比如用戶在第2輪說:「后面如果新增 summary/tip box,就用淺灰背景。」當時系統還沒有新增這類元素,所以這條要求沒有立刻執行對象。幾輪之后,如果用戶要求插入帶 summary box 的頁面,這條規則就應該被觸發。
如果Agent只看當前輪輸入,就很容易把這類延遲生效的約束忘掉。
MemSlides的工作記憶就是當前寫作任務的狀態板:active temporary preferences、carryover instructions、resolved targets、coverage status 都放在這里。Plan 階段讀取這些狀態來確定修改范圍,Act 階段據此執行受限編輯,Guard 階段再更新檢查結果。
這讓多輪修改不再是彼此孤立的一次次 prompt,而是圍繞同一套 slides 持續推進的編輯過程。
![]()
圖4:工作記憶讓早先提出、后續才觸發的臨時樣式偏好繼續生效。
只改該改的地方
對人類編輯來說,「只改這一處」是一句很自然的話。
對生成式系統來說,這句話卻很難。
因為很多系統在處理反饋時,會重新讀取或重寫大范圍內容。結果就是目標區域改對了,但非目標頁面也發生變化。用戶看上去只提了一個小要求,系統卻把整套 PPT 的狀態重新打散。
MemSlides用scoped slide-local revision來約束這個問題。
每次反饋先被映射到最小有效修改區域,然后進入Plan-Act-Guard流程。
Plan階段把自然語言請求轉成execution contract,明確目標slide、作用范圍、selector hints 和覆蓋要求。
Act階段根據頁面結構選擇編輯工具,并在受限范圍內執行最小有效操作。Guard 階段把「完成」變成一個需要檢查的狀態:目標沒覆蓋不能草率finalize,snapshot 過期需要重新綁定,局部請求也不應被擴展成整套deck的重寫。
這一步把「模型覺得自己改完了」,變成「系統能檢查這次修改是否真的覆蓋目標、是否越界」。
![]()
圖5:Plan-Act-Guard 將局部修改拆成范圍規劃、受控執行和結果檢查。
工具記憶
Slides編輯不是純文本改寫。
一個局部修改可能涉及頁面結構、選擇器、樣式規則、布局快照和驗證邏輯。Agent 即使理解了用戶想要什么,也可能在工具調用時讀錯區域、重復試錯、擴大修改范圍,或者在目標尚未覆蓋時提前結束。
所以,MemSlides 還引入了工具記憶。
工具記憶不記錄「用戶喜歡什么」,而是記錄「類似編輯任務里,什么執行路徑有效,什么錯誤應該避免」。
論文將其組織成兩種粒度:round-scope task experience 記錄一輪修改中的經驗、錯誤總結和可遷移模式;operation-scope tool-chain experience 保存更細粒度的 reasoning-tool-observation 片段,在相似工具調用前被檢索出來作為參考。
這種設計把目標和執行分開了。
用戶畫像決定 slides 應該往什么方向變,工具記憶則讓 Agent 少走彎路,減少無效探索和執行不確定性。
![]()
圖6:工具記憶關注的是工具調用經驗,而不是用戶審美偏好。
實驗結果
MemSlides 的評估沒有只給一個總體生成分數,而是把不同記憶組件對應的能力拆開驗證:用戶畫像記憶對應 round-0 persona alignment,工作記憶對應多輪會話中的 delayed preference carryover,工具記憶則在 diagnostic matched-pair modify setting 中隔離驗證。
在個性化生成上,用戶畫像記憶提升了多 persona、多 intent 設置下的 persona alignment。論文進一步指出,這種提升不僅體現在「更像某個模板」,也體現在內容重點、頁面角色、證據組織和 persona 區分等規劃層面的選擇。
在局部修改的配對診斷中,工具記憶帶來的變化更直接:
![]()
同時,core tool time ratio降至0.327x。
需要注意的是,這些數字來自診斷性matched-pair modify setting,不能被解讀為所有場景下單調領先。更準確地說,它們支持的是一個過程性結論:當工具記憶提供可復用執行經驗時,Agent在閉環完成、嚴格驗證和找到首次正確編輯路徑上更容易收斂。
![]()
圖7:局部編輯對比是論文中的定性案例,用來展示工具記憶注入前后編輯過程的差異。
PPT Agent的下一步
是長期協作
MemSlides討論的是PPT,但它背后的問題不只屬于PPT。
當 Agent 進入文檔生成、代碼修改、數據分析、企業知識系統等長周期任務時,都會遇到類似挑戰:哪些信息應該長期保留,哪些狀態只屬于當前任務,哪些執行經驗可以復用,哪些內容在局部修改時必須保持不變。
如果說一鍵生成解決的是從0到1,那么多輪修改考驗的是從1到可用。
未來的Slides Agent,不只要會生成更漂亮的第一頁,還要能在反復改稿中持續理解用戶、保持編輯邊界,并讓一套slides穩定地向用戶真正想要的版本靠近。
參考資料:
https://arxiv.org/abs/2606.17162
編輯:LRST
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.