鳳凰網科技訊 7月24日,阿里雲正式開源發布文檔解析模型OvisOCR2。該模型以綜合得分96.58刷新OmniDocBench v1.6排行榜紀錄,成為首個超越傳統流水線方法並登頂該排行榜的端到端模型,標誌着文檔解析領域迎來重要技術路線突破。

此前文檔解析領域由「流水線方法」主導,需依次調用版面分析、文字識別等多個模型,存在維護成本高、誤差累積等問題。OvisOCR2採用端到端路線:輸入文檔圖像後,模型一次性輸出符合自然閱讀順序的Markdown格式結果,覆蓋文本、公式、表格和視覺區域,一個模型完成過去多模型協作的工作。
該模型由Qwen3.5-0.8B後訓練得到,僅0.8B參數量即實現SOTA性能。訓練採用監督微調、強化學習、在線策略蒸餾和模型融合四階段流程,並構建了真實與合成文檔互補的數據引擎體系,以充分釋放緊湊模型潛力。OvisOCR2已以Apache 2.0許可證開源,兼容vLLM等主流推理框架,可與Qwen3.5生態無縫銜接。