![]()
本文的第一作者為北京大學(xué)王選計(jì)算機(jī)研究所博士生高嘉懌,通訊作者為博士生導(dǎo)師劉洋。團(tuán)隊(duì)近年來在 TPAMI、CVPR、ICCV、ICML 等頂會(huì)上有多項(xiàng)代表性成果發(fā)表,多次榮獲多模態(tài)感知和生成競(jìng)賽冠軍,和國(guó)內(nèi)外知名高校、科研機(jī)構(gòu)廣泛開展合作。
本文主要介紹該團(tuán)隊(duì)的最新論文:Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework。
本文面向復(fù)雜人 - 物交互(Human-Object Interaction, HOI)圖像編輯任務(wù),提出首個(gè)層級(jí)化認(rèn)知評(píng)測(cè)基準(zhǔn) HOI-Edit,系統(tǒng)刻畫模型在基礎(chǔ)交互編輯、上下文空間理解、因果與物理推理三類能力上的表現(xiàn)。
針對(duì)現(xiàn)有全局指標(biāo)難以判斷 “具體人與具體物體是否真正發(fā)生正確交互” 的問題,本文進(jìn)一步提出基于成對(duì)區(qū)域 grounding 的自動(dòng)評(píng)測(cè)協(xié)議 HOI-Eval,通過目標(biāo)區(qū)域關(guān)聯(lián)、身份一致性驗(yàn)證和交互 / 合理性問答,更可靠地評(píng)估編輯結(jié)果。
在此基礎(chǔ)上,本文發(fā)現(xiàn)圖生視頻(I2V)模型天然適合重構(gòu)動(dòng)態(tài)交互過程,并提出 SCPE(Self-Correcting Process Editing) 多智能體系統(tǒng)自糾錯(cuò)框架:利用視頻生成過程暴露失敗原因,再通過分析、反思和工具書更新迭代增強(qiáng)提示,使 I2V 模型在復(fù)雜 HOI 編輯中顯著提升交互準(zhǔn)確性與推理能力。
目前該研究已被 ICML 2026 正式接收,相關(guān)數(shù)據(jù)集、代碼均已開源。
![]()
- 論文標(biāo)題:Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework
- 論文鏈接:https://arxiv.org/abs/2606.19073
- 代碼鏈接:https://github.com/oceanflowlab/HOI-Edit
- 項(xiàng)目主頁(yè):https://andyplus1.github.io/HOIEdit_page/
從 “改像素” 到 “改交互”:圖像編輯的新挑戰(zhàn)
本文聚焦的是圖像編輯中更具挑戰(zhàn)性的一類任務(wù):人物交互編輯。傳統(tǒng)指令式圖像編輯在修改顏色、風(fēng)格、物體屬性等靜態(tài)內(nèi)容上已取得顯著進(jìn)展,但當(dāng)指令變成 “拿起桌上的某個(gè)蘋果”“把碗放下”“清理扶手箱內(nèi)部” 時(shí),模型面對(duì)的不再是簡(jiǎn)單的局部重繪,而是需要真正理解人與物體之間的交互關(guān)系。
這類任務(wù)的難點(diǎn)在于,模型必須同時(shí)滿足多重約束:既要保持原圖中人物和物體的身份,又要理解場(chǎng)景中的空間指代,還要推理動(dòng)作發(fā)生的過程和物理后果。例如,當(dāng)圖中存在多個(gè)相似工具時(shí),模型可能拿錯(cuò)目標(biāo);當(dāng)任務(wù)要求 “清理扶手箱內(nèi)部” 時(shí),模型還需要先打開扶手箱,再完成清理動(dòng)作。這些能力已經(jīng)遠(yuǎn)超普通靜態(tài)屬性編輯的范疇。
然而,現(xiàn)有圖像編輯基準(zhǔn)往往將 HOI 與普通屬性修改混在一起,評(píng)價(jià)指標(biāo)也多依賴 CLIPScore 等全局相似度或單獨(dú)實(shí)體檢測(cè),難以回答兩個(gè)關(guān)鍵問題:目標(biāo)人物和目標(biāo)物體是否被準(zhǔn)確保留?二者之間的交互是否真的發(fā)生,并且符合上下文邏輯?
為解決這一空白,本文提出 HOI-Edit 基準(zhǔn)與 HOI-Eval 評(píng)測(cè)指標(biāo),并進(jìn)一步將 I2V 模型 引入圖像 HOI 編輯。不同于靜態(tài)圖像模型只能給出最終結(jié)果,I2V 模型能夠展開完整交互過程,使失敗原因變得可診斷;基于這一點(diǎn),本文構(gòu)建了從評(píng)測(cè)到優(yōu)化的完整方法鏈路(如圖一所示),其核心特性如下:
1.HOI-Edit 層級(jí)化認(rèn)知基準(zhǔn):面向復(fù)雜人 - 物交互編輯任務(wù),構(gòu)建覆蓋基礎(chǔ)交互編輯、上下文空間理解、因果與物理推理三類能力的評(píng)測(cè)基準(zhǔn),用于系統(tǒng)刻畫模型的認(rèn)知層級(jí)能力。
2.HOI-Eval 自動(dòng)評(píng)測(cè)指標(biāo):針對(duì)傳統(tǒng)全局指標(biāo)難以判斷交互是否真正發(fā)生的問題,引入成對(duì)區(qū)域 grounding 的評(píng)測(cè)流程,通過目標(biāo)區(qū)域關(guān)聯(lián)、身份一致性驗(yàn)證和交互問答,更可靠地衡量編輯結(jié)果。
3.I2V 過程可診斷與 SCPE 自糾錯(cuò)框架:借助 I2V 模型的完整交互過程,本文將錯(cuò)誤進(jìn)一步定位到軌跡偏移、步驟缺失或物理不合理等具體原因,并據(jù)此讓 SCPE 把失敗經(jīng)驗(yàn)轉(zhuǎn)化為可復(fù)用的提示優(yōu)化策略,通過分析、反思與工具書更新形成閉環(huán),迭代提升復(fù)雜 HOI 編輯的準(zhǔn)確性與推理能力。
![]()
圖 1 我們提出了:(A)HOI-Edit,首個(gè)覆蓋 3 個(gè)認(rèn)知層級(jí)的 HOI 編輯基準(zhǔn);(B)HOI-Eval,一種用于驗(yàn)證 HOI 正確性的全新評(píng)測(cè)指標(biāo);以及(C)SCPE,一種用于優(yōu)化 I2V 模型 HOI 編輯能力的代理式框架。
層次化人物交互編輯評(píng)測(cè):HOIEdit 數(shù)據(jù)集
![]()
圖 2 HOI-Edit 層級(jí)化認(rèn)知評(píng)測(cè)示例:基準(zhǔn)從基礎(chǔ)交互編輯、上下文空間理解、因果與物理推理三個(gè)層次系統(tǒng)評(píng)估 HOI 圖像編輯能力。
本文提出了一套面向復(fù)雜人 - 物交互圖像編輯的層級(jí)化評(píng)測(cè)體系。與傳統(tǒng)圖像編輯評(píng)測(cè)不同,HOIEdit 不再只關(guān)注最終圖像是否 “看起來相似”,而是進(jìn)一步考察模型是否真正理解了目標(biāo)對(duì)象、交互動(dòng)作、空間關(guān)系以及背后的因果與物理過程。
具體而言,HOIEdit 具有以下關(guān)鍵設(shè)計(jì):
三層認(rèn)知評(píng)測(cè)
如圖 2 所示,HOIEdit 將人 - 物交互編輯拆解為由易到難的三類能力,系統(tǒng)評(píng)估模型在不同認(rèn)知層級(jí)上的表現(xiàn):
- L1 基礎(chǔ)交互編輯:關(guān)注交互關(guān)系的創(chuàng)建、移除與修改,要求模型在改變動(dòng)作的同時(shí)保留原圖中的人和物體身份。
- L2 上下文空間理解:進(jìn)一步考察對(duì)場(chǎng)景空間關(guān)系的理解,例如在多個(gè)相似物體中選對(duì)目標(biāo),或?qū)?dòng)作結(jié)果放到正確位置。
- L3 因果與物理推理:要求模型推理事件的因果鏈和物理后果,例如先完成必要的前置動(dòng)作,再生成符合物理規(guī)律的結(jié)果。
![]()
圖 3 HOI-Edit 數(shù)據(jù)構(gòu)建與 HOI-Eval 評(píng)測(cè)流程:從上下文感知指令設(shè)計(jì)、區(qū)域標(biāo)注、多維問答構(gòu)建,到基于成對(duì)區(qū)域的身份驗(yàn)證、交互判斷與合理性評(píng)估。
細(xì)粒度數(shù)據(jù)構(gòu)建
數(shù)據(jù)構(gòu)建上,HOI-Edit 通過上下文感知的指令設(shè)計(jì)、系統(tǒng)化區(qū)域標(biāo)注和多維問答構(gòu)造(見圖 3 上),形成覆蓋 357 個(gè) L1、202 個(gè) L2、146 個(gè) L3 樣本且包含豐富交互類別的評(píng)測(cè)集合(見圖 4)。該設(shè)計(jì)避免了 “只看最終圖像是否像” 的粗粒度判斷,而是把具體人 - 物對(duì)、動(dòng)作狀態(tài)、空間約束和過程合理性納入統(tǒng)一評(píng)測(cè)。
![]()
圖 4 HOI-Edit 數(shù)據(jù)分布與交互類別統(tǒng)計(jì):左圖展示 L1、L2、L3 三類樣本在不同任務(wù)子類中的分布情況,右圖展示評(píng)測(cè)集合中覆蓋的主要交互動(dòng)詞類別。
HOI-Eval 評(píng)測(cè)邏輯
HOI-Eval 的核心思想是讓評(píng)測(cè)模型 “帶著目標(biāo)區(qū)域思考”,其評(píng)測(cè)流程主要包括以下幾步:
- 目標(biāo)區(qū)域關(guān)聯(lián):基于原圖中的人物、物體及輔助區(qū)域,在編輯后圖像中建立對(duì)應(yīng)關(guān)系,定位需要評(píng)測(cè)的目標(biāo)區(qū)域。
- 身份一致性驗(yàn)證:分別檢查人物和物體的身份是否保持一致,避免出現(xiàn)目標(biāo)被改錯(cuò)或改丟的情況。
- 交互與合理性問答:圍繞交互是否發(fā)生、動(dòng)作是否到位、空間位置是否正確、過程步驟是否完整以及物理現(xiàn)象是否合理等問題,設(shè)計(jì)針對(duì)性問答。
相比只看整體相似度的全局指標(biāo),這種方法更能避免指代歧義,也更貼近人類對(duì) HOI 編輯成功與否的判斷。
基于過程的自糾錯(cuò):代理式閉環(huán)優(yōu)化用于交互編輯
![]()
圖 5 SCPE 框架流程圖:Generator、Analyzer、Reflector 與 Curator 四類代理圍繞工具書形成閉環(huán),將失敗視頻中的過程線索轉(zhuǎn)化為可復(fù)用的提示優(yōu)化經(jīng)驗(yàn)
如圖 5 所示,SCPE(Self-Correcting Process Editing) 是一種面向復(fù)雜 HOI 編輯的代理式自糾錯(cuò)框架。其核心基礎(chǔ)在于:I2V 模型生成的連續(xù)視頻不僅包含最終編輯幀,還會(huì)記錄人物從接近目標(biāo)、執(zhí)行動(dòng)作到形成最終結(jié)果的過程。因此,失敗不再只是最終圖像中的黑盒結(jié)果,而是可以通過視頻過程被觀察、分析和修正。
換句話說,SCPE 并不是簡(jiǎn)單地對(duì)提示詞做一次性增強(qiáng),而是利用 I2V 生成過程中的動(dòng)態(tài)交互線索來定位失敗原因。例如,當(dāng)模型本應(yīng)拿起最右側(cè)鑿子卻抓向中間鑿子時(shí),視頻軌跡能夠直接暴露 “模型優(yōu)先選擇最近物體” 的失敗模式,為后續(xù)的提示優(yōu)化提供依據(jù)。
如圖 5 所示,SCPE(Self-Correcting Process Editing) 是一種面向復(fù)雜 HOI 圖像編輯的基于智能體的自糾錯(cuò)框架。該方法結(jié)合圖生視頻的時(shí)序生成過程與多模態(tài)大模型的理解能力,實(shí)現(xiàn)對(duì)復(fù)雜交互編輯的自動(dòng)分析與糾錯(cuò)。具體來說,其核心基礎(chǔ)在于:I2V 模型生成的連續(xù)視頻不僅包含最終編輯幀,還會(huì)記錄人物從接近目標(biāo)、執(zhí)行動(dòng)作到形成最終結(jié)果的過程。因此,在復(fù)雜交互編輯任務(wù)中,失敗不再只是最終圖像里的黑盒結(jié)果,而是可以通過視頻生成過程中的動(dòng)態(tài)交互線索被觀察、分析和修正。 換句話說,SCPE 并不是簡(jiǎn)單地對(duì)提示詞做一次性增強(qiáng),而是利用 I2V 生成結(jié)果的過程反饋來定位失敗原因,并通過工具書積累可復(fù)用的提示優(yōu)化經(jīng)驗(yàn)。例如,當(dāng)模型本應(yīng)拿起最右側(cè)鑿子卻抓向中間鑿子時(shí),視頻軌跡能夠直接暴露 “模型優(yōu)先選擇最近物體” 的失敗模式,為后續(xù)的 Prompt 優(yōu)化、視覺生成模型糾錯(cuò)與復(fù)雜 HOI 編輯提供依據(jù)。
具體來說,SCPE 由四個(gè)專門代理組成:
- Generator:根據(jù)輸入圖像、原始指令和工具書生成細(xì)化的視頻提示。
- Analyzer:采樣視頻幀并診斷生成失敗原因。
- Reflector:將單個(gè)失敗案例提煉為一般性經(jīng)驗(yàn)。
- Curator:將經(jīng)驗(yàn)增量寫入工具書。
下一輪生成時(shí),Generator 會(huì)調(diào)用更新后的工具書,顯式強(qiáng)調(diào)目標(biāo)對(duì)象、動(dòng)作軌跡、前置條件和物理后果,從而減少同類錯(cuò)誤。
不同于一次性 Prompt Enhancer 的 “盲預(yù)測(cè)”,SCPE 利用真實(shí)生成視頻作為反饋來源,能夠根據(jù)模型實(shí)際失敗位置進(jìn)行糾錯(cuò);同時(shí)工具書將個(gè)例經(jīng)驗(yàn)沉淀為跨樣本策略,使得框架不僅能優(yōu)化當(dāng)前樣本,也能提升后續(xù)復(fù)雜交互編輯的穩(wěn)定性。
性能與泛化雙提升:SCPE 的實(shí)驗(yàn)驗(yàn)證
為驗(yàn)證 SCPE 的有效性,本文在 HOI-Edit 基準(zhǔn)上對(duì)開源圖像編輯模型、閉源商業(yè)模型以及 I2V 視頻生成模型進(jìn)行了系統(tǒng)評(píng)測(cè)。實(shí)驗(yàn)重點(diǎn)關(guān)注交互準(zhǔn)確性(I)、人物身份保持(H)、物體身份保持(O)以及考慮合理性問題的交互成功率(I+Q&A),用于判斷模型是否真正完成目標(biāo)交互,而不僅是生成視覺上相似的結(jié)果。
實(shí)驗(yàn)部分的結(jié)論很直接:SCPE 不只是讓結(jié)果 “看起來更像”,而是在交互發(fā)生、身份保持、空間約束和物理 / 因果合理性上都有明顯提升。 論文圍繞 HOI-Edit 的三層認(rèn)知任務(wù)、人工一致性、消融實(shí)驗(yàn)、不同主干模型、獨(dú)立評(píng)測(cè)器與 VLM 泛化性展開驗(yàn)證,下面依次給出關(guān)鍵表格與解讀。
![]()
表 1 HOI-Edit 主量化結(jié)果:對(duì)比不同圖像編輯模型與 I2V 模型在 L1 基礎(chǔ)交互編輯、L2 上下文空間理解和 L3 因果與物理推理三類任務(wù)上的交互準(zhǔn)確性(I)、人物身份保持(H)、物體身份保持(O)及考慮合理性問題的交互成功率(I+Q&A)。
如表 1 所示,在主量化結(jié)果上,SCPE 帶來了穩(wěn)定且顯著的性能提升。相比原始 Wan 2.2 I2V,加入 SCPE 后,模型在三層認(rèn)知任務(wù)上的交互表現(xiàn)均明顯提高,其中 L1 交互分?jǐn)?shù)提升約 22%,L2 約束成功指標(biāo)提升約 26%,L3 約束成功指標(biāo)提升約 22%,并在多個(gè)關(guān)鍵交互指標(biāo)上超過閉源強(qiáng)基線(表 1)。這說明 SCPE 不僅能讓動(dòng)作 “發(fā)生”,還能讓動(dòng)作發(fā)生在正確對(duì)象、正確位置和合理過程中。
![]()
圖 6 不同方法在 HOI-Edit 上的可視化對(duì)比:SCPE 能更準(zhǔn)確地執(zhí)行交互動(dòng)作、理解目標(biāo)對(duì)象和位置,并在復(fù)雜場(chǎng)景中保持過程與物理一致性。
如圖 6 所示,從可視化結(jié)果來看,SCPE 在復(fù)雜交互場(chǎng)景中也表現(xiàn)出更強(qiáng)的穩(wěn)定性和可控性(圖 6)。在 L1 場(chǎng)景中,SCPE 能克服靜態(tài)模型常見的編輯慣性和幻覺偽影;在 L2 場(chǎng)景中,SCPE 能更準(zhǔn)確地理解目標(biāo)對(duì)象和空間位置;在 L3 場(chǎng)景中,SCPE 更擅長(zhǎng)保持過程一致性與物理合理性,生成符合常識(shí)的中間步驟和最終結(jié)果。
![]()
表 2 HOI-Eval 與人工判斷的一致性分析:對(duì)比 DINOv2、CLIP 和 HOI-Eval 在人物身份、物體身份和交互判斷上的 Pearson 相關(guān)性及統(tǒng)計(jì)顯著性,驗(yàn)證 HOI-Eval 更貼近人類評(píng)測(cè)結(jié)果。
如表 2 所示,進(jìn)一步實(shí)驗(yàn)從評(píng)測(cè)可靠性和模塊設(shè)計(jì)兩方面驗(yàn)證了本文方法的有效性:HOI-Eval 相比 DINOv2、CLIP 等全局相似度指標(biāo),與人工判斷具有更高相關(guān)性,說明基于成對(duì)區(qū)域的問答式評(píng)測(cè)更貼近人類判斷。
![]()
表 3 SCPE 消融實(shí)驗(yàn)結(jié)果:對(duì)比原始 Wan 2.2 I2V、官方 Prompt Enhancer、去除 工具書的版本和完整 SCPE,在交互準(zhǔn)確性(I)與身份保持分?jǐn)?shù)(IDS)上的表現(xiàn),驗(yàn)證視頻過程反饋與 Playbook 經(jīng)驗(yàn)復(fù)用的作用。
表 3 展示了 SCPE 的核心組件貢獻(xiàn)。官方 Prompt Enhancer(OPE)雖然將交互分?jǐn)?shù)從 0.6804 小幅提升到 0.7028,但身份分?jǐn)?shù)從 0.8494 降到 0.7385,說明盲目補(bǔ)充提示可能引入身份漂移。相比之下,去掉工具書后的視覺反饋版本已能把 I 提升到 0.7625、IDS 提升到 0.8786;完整 SCPE 進(jìn)一步達(dá)到 0.8199 / 0.8954,證明工具書的跨樣本經(jīng)驗(yàn)沉淀是性能繼續(xù)提升的關(guān)鍵。
進(jìn)一步研究表明,SCPE 在不同設(shè)置下也展現(xiàn)出良好的泛化能力。如接入更快推理速度的 TurboDiffusion 后,SCPE 仍能在較短推理時(shí)間內(nèi)明顯提升總體交互表現(xiàn);使用獨(dú)立評(píng)測(cè)器或替換為 Qwen 工具書時(shí),性能趨勢(shì)也保持一致。這表明 SCPE 的優(yōu)勢(shì)并不依賴單一主干模型或單一 VLM,而是來自過程診斷與經(jīng)驗(yàn)積累這一機(jī)制本身。 整體來看,實(shí)驗(yàn)結(jié)果表明:SCPE 通過 “視頻過程診斷 — 失敗經(jīng)驗(yàn)總結(jié) — 工具書 更新” 的閉環(huán)機(jī)制,顯著提升了 I2V 模型在復(fù)雜 HOI 編輯中的交互準(zhǔn)確性、空間理解能力和物理 / 因果合理性。
總結(jié):面向世界模型的交互編輯新基準(zhǔn)
本文圍繞復(fù)雜人 - 物交互圖像編輯任務(wù),提出了覆蓋評(píng)測(cè)、指標(biāo)與優(yōu)化框架的完整方案。HOI-Edit 構(gòu)建了面向三層認(rèn)知能力的層級(jí)化評(píng)測(cè)基準(zhǔn),涵蓋基礎(chǔ)交互編輯、上下文空間理解、因果與物理推理等關(guān)鍵維度;HOI-Eval 進(jìn)一步引入基于成對(duì)區(qū)域的自動(dòng)評(píng)測(cè)機(jī)制,使模型評(píng)估從全局相似度走向更細(xì)粒度的交互正確性判斷。
實(shí)驗(yàn)結(jié)果表明,SCPE 能夠顯著提升 I2V 模型在復(fù)雜 HOI 編輯任務(wù)中的表現(xiàn),不僅在三層認(rèn)知任務(wù)上取得穩(wěn)定增益,也在消融實(shí)驗(yàn)、獨(dú)立評(píng)測(cè)器和跨 VLM 設(shè)置中展現(xiàn)出良好的魯棒性與泛化能力。進(jìn)一步分析表明,視頻生成結(jié)果提供的過程反饋與工具書中積累的交互經(jīng)驗(yàn),是推動(dòng)模型從 “結(jié)果修正” 走向 “過程自糾錯(cuò)” 的關(guān)鍵。
總體而言,本文不僅提出了一個(gè)新的 HOI 編輯基準(zhǔn)和評(píng)測(cè)指標(biāo),也探索了一種利用視頻過程反饋優(yōu)化圖像編輯模型的新范式,為未來構(gòu)建具備更強(qiáng)空間理解、因果推理和物理一致性的視覺生成模型提供了重要基礎(chǔ)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.