0
IJCAI2026:用最弱維度優化提升多模態推理
來源:NLPIR
原文鏈接:https://mp.weixin.qq.com/s/FLV5RwspqYkXEQQ25WibyA
論文引言
近日,NLPIR團隊圍繞多模態大模型推理可靠性問題開展研究,提出了一種全新的多模態過程獎勵建模框架 MMS-PRM(Multimodal Multi-Dimensional Salarization Process Reward Modeling)。相關論文題為 “Improving Multimodal Reasoning via Worst Dimension Optimization”。該工作聚焦多模態推理中長期存在的“平均分掩蓋局部錯誤”問題,通過細粒度多維獎勵、Chebyshev 引導的蒙特卡洛樹搜索以及課程式 DPO 對齊,顯著提升了模型在復雜視覺推理任務中的魯棒性與可靠性。
多模態推理不能只看“平均表現”
隨著多模態大語言模型在數學圖形、科學圖表、視覺問答等任務中的能力不斷提升,模型已經不再只是“看圖說話”,而是需要完成更復雜的跨模態推理。
然而,多模態推理往往要求模型同時滿足多個條件:視覺信息要對齊,邏輯鏈條要一致,語義判斷要準確,最終答案還要正確。任何一個環節出錯,都可能導致整個推理過程失效。
現有過程獎勵模型通常將多個維度壓縮成單一標量分數。這樣做雖然簡單,但容易出現一個嚴重問題:模型在某些維度上的高分,可能掩蓋另一些維度上的關鍵失敗。例如,推理過程在文本邏輯上看似完整,但卻引用了圖像中并不存在的關系,最終仍可能獲得較高獎勵。
論文指出,多模態推理的可靠性不應由“平均質量”決定,而應由“最薄弱的有效維度”決定。換句話說,一個推理步驟只要在視覺 grounding、邏輯一致性或幾何有效性等關鍵維度中存在嚴重短板,就不應被強化。
讓模型優先修補最短板
針對上述問題,論文提出 MMS-PRM,將多模態過程獎勵建模重新定義為一個非補償式的多目標軌跡優化問題。該框架主要包含三個核心模塊。
1. 層次化細粒度獎勵空間
MMS-PRM 首先構建了一個層次化、可解釋的獎勵空間,將多模態推理質量拆分為多個維度與子維度。例如:
? 視覺 grounding 是否準確;
? 圖表、顏色、角度等視覺元素是否被正確識別;
? 推理鏈是否邏輯一致;
? 因果關系是否成立;
? 表達是否簡潔、無冗余。
這種設計使模型不再只接收一個籠統分數,而是能夠獲得更細粒度的步驟級反饋,從而明確知道每一步推理到底在哪些方面存在風險。
2. Chebyshev 引導的 MCTS 搜索
在搜索推理路徑時,MMS-PRM 引入了基于 Chebyshev 標量化的蒙特卡洛樹搜索方法。與傳統加權求和不同,Chebyshev 優化更關注當前表現最差的維度。
這意味著,如果一個推理路徑在邏輯維度上很強,但在視覺對齊上很弱,系統不會簡單地用邏輯高分“補償”視覺錯誤,而是會優先懲罰這個最弱環節,推動搜索過程找到更加均衡、可靠的推理軌跡。
3. 課程式 DPO 策略
在搜索得到更平衡的推理軌跡后,論文進一步使用課程式 Direct Preference Optimization(DPO)將這些行為遷移到模型策略中。
訓練過程從較短、較簡單、置信度較高的推理鏈開始,逐漸過渡到更長、更復雜的多模態推理任務。這樣的設計有助于模型循序漸進地學習穩定、均衡的推理能力,而不是直接面對高難度樣本導致訓練不穩定。
實驗結果
論文在 MathVista、MMStar、MMMU、M3CoT、AI2D、ChartQA 等多個多模態推理基準上進行了評測。結果顯示,MMS-PRM 在多項任務中取得了穩定提升,平均成績達到 73.0,優于對應的 InternVL2.5-MPO + SFT 基線。
消融實驗也進一步驗證了各模塊的有效性:僅加入層次化獎勵即可提升性能;加入 Chebyshev MCTS 后進一步提升;完整 MMS-PRM 框架取得最佳結果。相比加權求和式 MCTS,Chebyshev 機制在抑制“最弱維度坍塌”方面表現更優。
同時,我們的方法也對最終講理的選擇進行了統計,可以看到,我們的方法經過基于切比雪夫標量化的MCTS增強后會選擇更優的獎勵:
研究意義
MMS-PRM 的價值不僅在于提高 benchmark 分數,更在于提出了一種更加符合多模態推理本質的監督范式。
對于視覺語言模型而言,正確答案并不總是意味著正確推理。一個模型可能通過偶然猜測得到答案,也可能在中間步驟中出現視覺幻覺、邏輯跳躍或語義偏差。MMS-PRM 強調對推理過程進行多維度、非補償式評估,有助于推動多模態大模型從“結果正確”走向“過程可信”。
這一思路對于數學圖形理解、科學圖表分析、教育場景輔助解題、復雜視覺問答等任務具有重要意義,也為未來構建更加可靠、可解釋的多模態智能系統提供了新的技術路徑。
項目鏈接:
https://github.com/leibniz-Man/MMS-PRM
第一作者:呂浩成
本專題其他文章
編輯
重發郵箱修改郵箱