0
| 本文作者: 陳淑瑜 | 2026-05-27 18:16 | 專題:CVPR 計算機視覺與模式識別會議 |
原文鏈接:https://mp.weixin.qq.com/s/AbtZYKAhP5KEaChBnLIV7A
近日,由InTimeLab、騰訊、南京理工大學合作完成的研究成果《Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training》被 CVPR 2026 主會接收。論文聚焦"如何讓端到端文檔解析模型在真實隨拍場景下保持魯棒性"這一核心問題,提出了端到端文檔解析模型 DocHumming,通過數據-訓練協同設計,以僅 1B 參數的規模在標準數字文檔和真實隨拍文檔上同時建立了全新的 SOTA。同時,論文構建并開源了首個真實場景文檔解析基準 Wild-OmniDocBench。
文檔解析將非結構化文檔圖像轉化為結構化輸出,已隨著多模態大語言模型(MLLM)的進步取得了顯著發展。然而,當面對真實世界中用手機隨手拍攝的文檔時,現有方法的性能出現了顯著退化。

掃描/數字文檔 vs 真實隨拍文檔:左側的標準文檔可被模塊化管線和端到端方法正確解析,而右側真實隨拍文檔引入了透視變形、光照不均、陰影遮擋等退化,導致模塊化管線出現布局分析錯誤、元素缺失,端到端方法產生重復內容。
現有方法面臨的核心挑戰:
模塊化管線(Modular Pipeline)。
端到端方法(End-to-End)。
*DocHumming 正是通過數據-訓練協同設計來系統性解決這兩大瓶頸。*
為解決全頁級端到端訓練數據稀缺的瓶頸,論文提出了一套系統化、可擴展的合成數據管線。

Realistic Scene Synthesis 概覽:左側為原子元素庫(9M 元素)和布局模板庫(576K 模板);右側為合成流水線——將采樣元素組合到模板中,施加空間/結構約束生成頁級標注,再通過拍攝感知增強模擬真實世界圖像。
該管線包含三個關鍵模塊:
元素倉庫(Element Repository)。
布局模板庫(Layout Library)。
拍攝感知增強(Data Augmentation)。
最終產出 DocMix-3M——約 300 萬高質量合成文檔,其中約 20% 經增強模擬隨拍條件。
為解決端到端模型在長序列全頁解析中的結構崩潰問題,論文設計了兩階段漸進式訓練策略:
Stage 1:Short-to-long Training(短到長漸進訓練)。
Stage 2:Parsing Token Preference(結構 token 偏好優化)。
現有基準(如 OmniDocBench)僅評估掃描/數字文檔,缺少真實隨拍場景的退化挑戰。論文構建了 Wild-OmniDocBench——源自真實世界拍攝的文檔解析基準。

Wild-OmniDocBench 的采集流程:對 OmniDocBench 中的原始文檔進行真實場景下的手動拍攝(多角度、多設備、多環境),引入自然退化的同時保留精確的 Ground Truth 標注。
標準文檔評估(OmniDocBench)。 DocHumming 以僅 1B 參數在所有指標上全面超越現有方法:

Table 1:各類 OCR 和 VLM 系統在文檔理解基準上的對比。DocHumming(1B)在 Overall、Text、Formula、Table、Reading Order 五個維度上均取得最優表現,超越了 GPT-4o、Gemini-2.5 Pro、InternVL3 等通用大模型以及 PaddleOCR-VL、MinerU2.5 等專用方案。
多語言評估(XFUND)。 DocHumming 在德語、意大利語、日語、西班牙語、葡萄牙語、法語六種語言上均取得最優表現。

Table 2:XFUND 多語言性能對比。受益于 DocMix-3M 中的多語言監督,DocHumming 在所有六種語言上均超越 Gemini-2.5 Pro、GPT-4o 等方法。
真實隨拍評估(Wild-OmniDocBench)。 關鍵發現:所有模型從標準文檔到真實隨拍文檔都出現了性能退化,但 DocHumming 退化幅度最小(僅 -6.72),遠優于模塊化管線的 -19.76 和其他端到端方法的 -10.40。

Table 3:Wild-OmniDocBench 上的性能對比。DocHumming 在真實隨拍場景下保持最高精度(Overall 87.03),退化幅度遠小于其他方法。
消融實驗。 驗證了核心組件的有效性:

Table 4:訓練策略消融——Realistic Scene Synthesis(RSS)和 Document-Aware Training Recipe(DATR)的每個組件都對最終性能有正向貢獻。

Table 5:數據規模消融——DocMix-3M 是最優配比,進一步增加到 4M 后在 Wild 場景出現輕微過擬合。
DocHumming 的核心洞察是:要實現魯棒的真實場景文檔解析,僅靠模型規模的擴大遠遠不夠——需要同時解決"缺乏大規模全頁級訓練數據"和"缺乏結構感知訓練策略"兩大根本瓶頸。 通過數據合成與訓練策略的協同設計,僅 1B 參數的端到端模型便能在標準文檔和真實隨拍文檔上同時超越百倍參數的通用大模型。
Wild-OmniDocBench已開源:
https://github.com/VirtualLUOUCAS/Wild_OmniDocBench
題目:
作者:
單位:
arXiv:
本專題其他文章