Same Evidence, Different Answer:
Auditing Order Sensitivity in Multimodal Large Language Models
同證異答:多模態大模型順序敏感性審查
https://arxiv.org/pdf/2606.26079
![]()
![]()
摘要
多模態大語言模型(MLLM)的標準基準測試僅基于一種規范順序對每個項目進行評分,并忽略了與順序無關的打亂是否會改變答案,而這是新興的人工智能評估指南所呼吁的一項基線可靠性屬性。我們引入了FACET-PROBE,這是對18個前沿和開放權重MLLM進行的五面審計(包括選項、證據塊、文檔排序、圖像集和混合模態順序)。貝葉斯項目反應模型將順序噪聲與各面偏差分離開來;同序控制估計了觀察到的翻轉的解碼器隨機下限。發現。我們審計的18個MLLM均非順序不變:經過篩選的各面面板平均翻轉率介于24%至50%之間。在溫度為0的Gemini同序控制中,估計在已驗證的單元中存在顯著超出同輸入解碼器噪聲下限的順序超額。模型能力可以預測翻轉但不能消除翻轉;表現最好的模型在13.4%的試驗中仍然發生了翻轉。啟示。在我們的Gemini緩解測試中,免訓練的提示詞更改是依賴于模態的,并且無法從文本推理遷移到視覺推理。這些結果表明,僅靠提示詞層面的緩解不太可能提供通用的順序魯棒性,這促使未來開展關于訓練階段和架構層面的方法的研究。我們提出將跨順序翻轉率作為MLLM的標準報告軸。代碼與審計產物:https://github.com/yahskapar/facet-probe
1 引言
多模態大語言模型(MLLM)的標準基準測試僅基于單一的規范順序對每個項目進行評分,并隱含地將語義上等效的排列視為可互換的(Wang等人,2024b;Zuo等人,2025;Jiang等人,2024)。在部署的系統中,輸入順序是由檢索管道(Lewis等人,2020;Abootorabi等人,2025;Yao等人,2025)、智能體工具調度器(Shinn等人,2023;Faghih等人,2025;Mei等人,2025)或面向臨床和消費者的接口(Haberle等人,2024;Tierney等人,2024;Hurt等人,2025;Paruchuri等人,2025)設定的,而不是由最終用戶設定的。如果模型的答案在這些排列下發生變化,那么規范基準測試的準確率就會高估多模態檢索增強生成(RAG)、智能體工具使用以及臨床或其他高風險環境中的可靠性,而在這些環境中,用戶合理地期望相同的證據能產生相同的答案。多模態大語言模型并非順序不變的。相同的查詢在三種語義上等效的輸入順序下會產生三個不同的答案(圖1)。這種行為并不局限于小型或較舊的模型,也不是任何單一基準測試的測量假象。新興的人工智能評估指南要求基準測試在輸入擾動下明確“限定”順序無關性假設(Salaudeen等人,2025;Bean等人,2026;Keller等人,2026),但目前廣泛使用的評估中沒有一個針對多模態順序這樣做。先前的工作觸及了這一問題,但并未徹底解決。Tan等人(2024)在5到8個2025年之前的多模態模型上,測量了單一順序面上的多模態位置偏差。Promptception(Ismithdeen等人,2025)表征了10個多模態模型對提示模板的敏感性,但沒有研究正交的順序面或2026年的前沿一代模型。M3IRT(Uebayashi等人,2026)將項目反應理論應用于多模態評估,是沿著跨模態捷徑軸,而不是順序噪聲軸。Kostiuk和Enevoldsen(2026)確立了純文本和純嵌入評估中的排序不穩定性,但沒有研究多模態順序,也沒有估計超出同輸入解碼器隨機翻轉的順序超額。關于純文本語言模型中選項順序和對話輪次敏感性的基礎性工作(Pezeshkpour和Hruschka,2024;Laban等人,2023;Chen等人,2024b)提出了我們將之擴展到多模態前沿的問題。先前的工作沒有運行同序控制來估計超出同輸入解碼器噪聲下限的順序超額;如果沒有這種分解,已發布的翻轉率數字是模糊的。因此,本文提出以下問題:
![]()
本文介紹了FACET-PROBE。FACET-PROBE是對18個多模態大語言模型(6個前沿閉源模型:Gemini-Pro 3.1、Gemini-Flash 3、Claude Opus 4.7、Claude Sonnet 4.6、ChatGPT 5.5、ChatGPT 5.4-mini;12個開放權重模型:Qwen3.5、InternVL3.5、Kimi-VL以及MedGemma系列)在12個數據集和超過40萬次試驗中進行的五面審計,并結合了ODI(順序分解項目反應理論),這是一種2PL貝葉斯項目反應分解方法,可將逐項順序噪聲σπ與逐面系統性偏差|δ|分離開來。模型能力可以預測翻轉但無法消除翻轉(斯皮爾曼ρ ≈ ?0.95);表現最佳的模型在13.4%的試驗中仍會發生翻轉。在我們的Gemini緩解測試中,免訓練的提示更改是依賴于模態的,且無法從文本推理遷移到視覺推理。
我們的貢獻如下:
? 第4.1節:FACET-PROBE,對12個數據集上的18個多模態大語言模型進行的五面順序審計,并使用ODI(2PL貝葉斯IRT)進行分解。同序對照組估計了在溫度為0的已驗證Gemini單元中,顯著超出同輸入解碼器噪聲下限的順序超額;經過篩選的圖像集聲明錨定于MEDFRAMEQA,而非位置參考的MANTIS-EVAL項目。
? 第4.2節:模型能力可以預測翻轉但無法消除翻轉(全面板ρ ≈ ?0.95;最佳模型在13.4%的試驗中仍發生翻轉);表述的置信度對順序風險的低估幅度達9至62個百分點;機制分析發現內容合理化是一種常見的失敗模式,其中原始的圖像集機制行被視為探索性的,因為它是在MANTIS-EVAL位置參考篩選之前采樣的。
? 第4.3節:免訓練的提示級緩解措施是依賴于模態的且不可組合;我們報告了一個成本-帕累托前沿。
我們計劃發布完整的評估代碼及相關產物,以供研究社區進一步使用。
2 相關工作
FACET-PROBE在五個維度上不同于先前的工作:輸入面(選項、證據塊、文檔排序、圖像集、混合模態)、模型代際(前沿和開放權重的2026年MLLM)、測量目標(跨順序不穩定性)、通過同序對照進行分解,以及緩解措施評估。分解維度是核心:先前的工作都沒有在2026年多模態前沿估計超出同輸入解碼器隨機翻轉的順序超額。
語言模型中的順序敏感性。語言模型對許多語義上無關的輸入擾動很敏感:少樣本演示順序(Lu等人,2022)、提示格式(Sclar等人,2024;Mizrahi等人,2024)、多選題選項順序(Pezeshkpour和Hruschka,2024;Zheng等人,2024)、長上下文中的位置(Liu等人,2024a)、兩輪挑戰(Laban等人,2023)、推理前提順序(Chen等人,2024b)、嵌入提示不穩定性(Kostiuk和Enevoldsen,2026),以及純解碼器Transformer中逆排列學習的理論不可能性(Alur等人,2025)。多模態工作記錄了單面位置偏差(Tan等人,2024)、多圖像VLM位置偏差(Tian等人,2025)、10個模型上的提示模板敏感性(Ismithdeen等人,2025),以及多模態RAG中的U型位置偏差(Yao等人,2025)。
多模態評估與基準有效性。多模態基準測試(Yue等人,2024;Wang等人,2024b;Lu等人,2024;Chen等人,2024a;Zuo等人,2025;Jiang等人,2024)在一種規范順序下對每個項目進行評分。MMBench(Liu等人,2024b)通過CircularEval緩解多選題位置偏差;我們將其推廣到五個正交面,并通過ODI分解殘差。有效性研究(Bean等人,2026;Salaudeen等人,2025;Reuel等人,2024;Jacovi等人,2023),包括NIST AI 800-2(Keller等人,2026),將基準測試視為必須對其擾動包絡加以限定的工具。IRT框架(Uebayashi等人,2026;Polo等人,2024;Romanou等人,2026)針對跨模態捷徑或項目難度;ODI通過逐項σπ和逐面|δ|針對順序方差。
推理時緩解措施。自一致性(Wang等人,2023)是典型的免訓練緩解措施,也是我們的基線。排列自一致性(Tang等人,2024)將其擴展到列表級擾動,并在我們的混合模態LLM評判器(第3節)內部運行。位置去偏方法包括PINE(Wang等人,2025b)、注意力校準(Hsieh等人,2024)、多模態因果雙向插值(Tian等人,2025),以及交換并投票的LLM-as-judge(Zheng等人,2023)。第4.3節在2026年多模態前沿上,針對跨順序翻轉對這些方法進行了評估。
3 方法
模型。我們審計了在2026年5月4日至5月25日期間提供服務的18個多模態大語言模型。前沿閉源模型(6個):Gemini Pro 3.1(gemini-3.1-pro-preview)和Gemini-Flash 3(gemini-3-flash-preview)(Pichai等人,2025);Claude Opus 4.7(claude-opus-4-7)和Claude Sonnet 4.6(claude-sonnet-4-6)(Anthropic,2026);ChatGPT 5.5(gpt-5-5)和ChatGPT 5.4-mini(gpt-5-4-mini)(Singh等人,2025)。開放權重模型(12個):Qwen3.5-VL(0.8B、2B、4B、9B、27B)(Qwen團隊,2026),InternVL3.5(4B、8B、14B、38B)(Wang等人,2025a),Kimi-VLA3B-Instruct(Team等人,2025),以及MedGemma(4B-IT、27B-IT)(Sellergren等人,2025)。閉源模型推理使用各提供商的API,在允許的情況下將溫度設為0(Anthropic和OpenAI的推理API拒絕該參數,故省略);Gemini的top-p設為1;最大輸出token數為8192(Anthropic、OpenAI)或24576(Gemini);思考預算為8192個token(Anthropic、Gemini)或推理力度中等(OpenAI)。所有模型使用通用的提示詞族,并包含針對特定面的答案格式說明(完整提示詞和逐模型適配器詳情見附錄A);簡而言之,提示詞指示模型在回答前閱讀每一個證據項,封閉式選擇提示詞要求恰好輸出一個選項標簽,且前面帶有“Answer: ”。開放權重模型在單張A6000 GPU上使用HuggingFace transformers(≥4.57)進行貪心解碼,max_new_tokens設為512(默認)或在輸出推理軌跡時設為2048。模型以bfloat16精度加載,但InternVL3.5系列(4B/8B/14B/38B)和≥27B的變體(Qwen3.5-VL 27B、MedGemma 27B-IT)除外,它們使用4位bitsandbytes NF4(雙重量化,bfloat16計算)并結合FlashAttention-2。 注意事項。思考/推理參數在不同提供商之間具有不同的語義;我們在上文使用了最接近的跨提供商等效設置,并在消融實驗中改變了Gemini的預算(第4.3節)。2026年5月4日至25日的訪問窗口與每個提供商ID配對,作為可重復性錨點。
數據集與采樣。FACET-PROBE涵蓋四大任務類別的12個數據集。多選題推理(選項順序):MMLU-Pro(Wang等人,2024b)、CommonsenseQA(Talmor等人,2019)和MathVision(Wang等人,2024a)。多跳問答與RAG(證據塊順序和文檔排序):HotpotQA(Yang等人,2018)、MuSiQue(Trivedi等人,2022)、MultiHop-RAG(Tang和Yang,2024);MedXpertQA(Zuo等人,2025)的檢索證據變體也著重考察證據塊順序。多圖像VLM(圖像集順序):Mantis-Eval(Jiang等人,2024)、MedFrameQA(Yu等人,2025b)。自由格式混合模態RAG(混合模態順序):MRAMG-Recipe(Yu等人,2025a)、MMDocRAG(Dong等人,2025)、MultiModalQA(Talmor等人,2021)。
在每個數據集中,我們通過種子為42的確定性均勻打亂來采樣一個固定的項目子集,然后應用特定于數據集的過濾,僅納入對目標面具有所需結構支持的項目。每個數據集的N(過濾后)范圍在70到200之間,混合模態數據集在3個數據集中總計N=597;完整的過濾列表和每個數據集的N見附錄A。我們在每個(面,數據集)單元中為所有18個模型嘗試相同的項目集,其中檢索到的證據(RAG和多跳)預先計算一次并在各模型間逐字重放;派生分析在模型產生不可用輸出時報告解析或丟棄率。我們不過濾至包含黃金證據的項目:HotpotQA和MuSiQue使用其干擾項增強拆分,因此黃金答案可能可以從可見證據中推導出來,也可能不行,這反映了開放檢索部署的實際情況。被降級的對話輪次和少樣本面及其數據集在第F節中報告。
順序面。FACET-PROBE審計五個順序面,每個面由排列單位和評分規則定義。選項順序對選項內容與顯示標簽之間的映射進行排列(選項內容本身不變;僅重新排序哪個內容獲得哪個字母)。評分通過逆排列將模型預測的字母映射回源選項索引,因此翻轉表示所選選項內容的變化,而不是字母的變化;字母上的翻轉是沒有信息量的,因為黃金字母隨排列而移動。每個項目排列的選項數量等于數據集的原生選擇數(CSQA固定為5;MMLU-Pro為4-10,中位數為5;MathVision為4-5)。證據塊順序在單一扁平列表上下文中排列證據段落的順序(HotpotQA、MuSiQue、MedXpertQA檢索變體),其中每個單位是一個段落或短段落;每個項目3-6個塊。文檔排序在RAG提示中排列排序后的檢索文檔的順序(MultiHop-RAG、HotpotQA重放),其中每個單位是特定檢索排序處的完整文檔;每個項目2-6個文檔。與證據塊順序的區別在于排列單位:塊是作為扁平列表呈現的文檔內段落,文檔是作為排序列表呈現的完整檢索單元。圖像集順序對VLM的多圖像輸入順序進行排列(Mantis-Eval 3-6張圖像,MedFrameQA 2-5張圖像)。我們對圖像集分析應用位置參考篩選:問題或答案選項中明確提及圖像位置的項目將從干凈的圖像集摘要中排除(排除52/70個Mantis-Eval項目;排除5/200個MedFrameQA項目)。混合模態順序在自由格式RAG中對每個項目的整個異構文本和圖像組件序列進行排列;結果由LLM評判器(見下文)評分為伯努利黃金匹配標簽,與多選題面平行,同時增加了一個獨立的測量層。
排列語法。對于每個(項目,面),我們從該面的排列語法中采樣K=6個順序:當n! ≥ 6時,從n個組件的n!個排列中進行無放回的均勻采樣;當存在少于六個唯一排列時,我們使用所有唯一排列并根據需要重復以保持六次調用。K=6是通過對MedXpertQA進行K消融實驗設定的:K=3能以一半的推理成本恢復大部分(但非全部)K=6可檢測到的翻轉,因此K=6是我們整個面板的操作點。排列清單在推理前固定并在所有18個模型間重放;計劃發布的版本包含這些索引,因此忠實的重新生成不依賴于進程哈希種子。
![]()
![]()
![]()
自由格式輸出的 LLM 評判評分。 非 MIXED-MODALITY-ORDER 面使用確定性評分:OPTION-ORDER 和 IMAGE-SET-ORDER 在逆排列下將預測標簽映射回源內容,而 EVIDENCE-CHUNK-ORDER 和 DOCUMENT-RANK-ORDER 使用針對黃金簡答的精確匹配。MIXED-MODALITY-ORDER 在3個基準中的2個(MRAMG-Recipe, MMDocRAG)上產生段落形式輸出;MultiModalQA 的黃金答案是簡短事實。對于這三者,我們通過 LLM 評判(Gemini Pro 作為主評判,ChatGPT 5.4-mini 作為跨供應商檢查)定義了一個伯努利正確性結果,該評判使用結構化等價提示對個項目輸出進行評分。文本翻轉(原始復述變體)作為上限一并報告,評判修正將其壓縮了 10–90 個百分點,具體取決于模型和基準。完整提示、評判者間 Cohen's κ κ 以及無評判 MMQA 黃金錨點交叉檢查見附錄 E 和附錄 H。MIXED-MODALITY-ORDER 結果作為伯努利黃金匹配標簽進入 ODI(下文),而基于評判的測量層需要表2中的注意事項。
![]()
![]()
![]()
![]()
4 發現
4.1 跨面順序敏感性
Q1:跨順序翻轉在18個模型面板中的普遍程度如何?跨順序翻轉在模型和各個面中普遍存在(表1,圖2):各面的面板平均K=6翻轉率介于0.24至0.50之間(混合模態順序為0.50,證據塊順序為0.41,選項順序為0.36,文檔排序為0.26,經篩選的圖像集順序為0.24);在54個(模型×基準)單元中,混合模態順序的sem-flip中位數為0.50,而原始的混合模態順序基準單元則介于0.09至0.89之間。
![]()
Q2:有多少超出了同輸入解碼器噪聲下限?在溫度為0時,已驗證的Gemini單元顯示出顯著超出同輸入解碼器噪聲下限的順序超額,但該比例是依賴于底層模型和溫度的。在12單元面板的8個已驗證單元中(附錄D),MMLU-Pro選項順序(OPTION-ORDER)單元顯示出約51–75%的順序超額占比。在干凈的MedFrameQA圖像集順序(IMAGE-SET-ORDER)子集上,同序下限低于跨順序率(Pro/Flash上為0.03/0.10 vs 0.10/0.14),而MedXpertQA證據塊順序(EVIDENCE-CHUNK-ORDER)顯示出類似但較小的超額(0.11/0.15 vs 0.20/0.21)。Mantis-Eval被排除在干凈的圖像集分解之外,因為大多數項目包含位置參考語言。在T ≥ 0.7時,更廣泛的附錄掃描顯示一致性份額估計器不再是一個穩定的分解目標,而經解碼器去噪后的準確率波動仍然具有信息量(附錄D)。
Q3:零效應出現在哪里?我們觀察到了兩個可靠的零效應(消歧查詢下的工具描述順序,以及GSM8K上的少樣本數學),詳見附錄F。
![]()
![]()
4.2 能力、校準與機制
![]()
![]()
4.3 緩解措施菜單
![]()
![]()
![]()
![]()
5 討論
18個多模態大語言模型均非順序不變:經過篩選的各面面板平均K=6翻轉率介于24%至50%之間。在溫度為0時,同序Gemini對照組估計在已驗證單元中存在顯著超出解碼器噪聲的順序超額,但這種分解是依賴于模型底座和溫度的。能力可以預測翻轉但不能消除翻轉(全面板ρ ≈ ?0.95;表現最好的模型仍有13.4%的翻轉率)。機制分析表明,內容合理化是分類單元中常見的失敗模式;原始的圖像集機制行在篩選后的圖像集子集上重復驗證之前被視為探索性的。CTA將高基線文本單元的翻轉率從0.30降低到0.18(絕對下降12個百分點,相對減少40%),而在基線相當的視覺單元上沒有觀察到測量效果。
將順序魯棒性作為報告維度。規范基準測試的準確率未能捕捉到順序魯棒性這一維度:盡管關于這種失敗模式已有活躍的研究文獻(Pezeshkpour和Hruschka,2024;Chen等人,2024b;Laban等人,2023),但我們審計的前沿或開放權重模型卡中沒有一個報告跨順序翻轉率。遵循Mitchell等人(2019)關于模型卡披露、Raji等人(2022)關于未記錄脆弱性的研究,以及NIST AI 800-2的“限定性聲明”原則(Keller等人,2026),我們提出將跨順序翻轉率作為多模態大語言模型的標準報告維度,與準確率并列。同序對照是一種方法論檢查:它估計了重復調用的隨機性下限,因此報告的翻轉率可以相對于同輸入不穩定性進行解釋。
訓練階段和架構層面的干預是前進的方向。思考預算減少了困難項目上的翻轉,但在簡單項目上以線性token成本趨于平穩;提示詞級緩解措施是依賴于模態的且無法疊加生效。這種權衡表明,相比于推理時計算,應傾向于訓練階段、目標函數或架構層面的干預(Egressy和Stühmer,2026)。一個具體的假設是,預訓練或后訓練數據混合中固定順序慣例(如規范選項字母、檢索排序或圖像槽位)的占比過高;未來的工作應該測試排列增強或對比順序目標是否能減少這種影響(Alur等人,2025;Egressy和Stühmer,2026)。將輸入順序記錄為部署配置參數是一種臨時的保障措施。
原文鏈接:https://arxiv.org/pdf/2606.26079
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.