OvisOCR2是什麼
OvisOCR2 是阿里 ATH-MaaS 團隊推出的端到端文檔解析模型,基於 Qwen3.5-0.8B 訓練並完全開源。模型在 OmniDocBench v1.6 評測中以 96.58 分登頂榜首,具備對複雜版式文檔的高精度識別與結構化提取能力,支持多欄排版、表格、公式等場景的解析,適用學術研究、檔案數字化及企業知識庫構建等文檔智能處理需求。

OvisOCR2的主要功能
-
端到端文檔解析:輸入文檔圖像直接輸出結構化文本,無需多階段流水線拼接。
-
複雜版式識別:支持多欄排版、圖文混排、表格嵌套等複雜文檔佈局的精準解析。
-
高精度 OCR 提取:在 OmniDocBench v1.6 上以 96.58 分取得第一,字符與段落識別準確率行業領先。
-
開源可部署:基於 Qwen3.5-0.8B 訓練,模型權重與代碼已開源至 HuggingFace。
OvisOCR2的技術原理
-
視覺語言模型架構:模型以 Qwen3.5-0.8B 爲基座,融合視覺編碼器與文本解碼器,實現圖像到結構化文本的端到端映射。
-
大規模文檔預訓練:在海量掃描文檔、PDF 渲染圖等數據上預訓練,學習文檔版式與語義關聯。
-
端到端優化:摒棄傳統檢測→識別→後處理的多階段流程,通過單一模型聯合優化降低誤差累積。
-
輕量高效:基於 0.8B 參數規模的小模型實現 SOTA 性能,兼顧推理速度與部署成本。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用OvisOCR2
-
環境準備:克隆 HuggingFace 倉庫,安裝依賴庫(Transformers、PyTorch 等)。
-
加載模型:通過
AutoModelForCausalLM加載 OvisOCR2 權重與對應分詞器。 -
輸入文檔:將掃描件或截圖轉爲張量格式,傳入模型進行前向推理。
-
獲取結果:模型直接輸出 Markdown 或純文本格式的結構化解析結果。
-
微調部署:基於自有文檔數據繼續微調,適配特定領域版式需求。
OvisOCR2的核心優勢
-
評測榜首:OmniDocBench v1.6 以 96.58 分登頂,文檔解析精度行業領先。
-
極致輕量:基於 Qwen3.5-0.8B 訓練,僅 0.8B 參數即可實現 SOTA 性能,單卡流暢推理。
-
完全開源:模型權重與代碼均已公開至 HuggingFace,無商業授權限制,支持自由二次開發。
-
端到端架構:模型摒棄傳統多階段流水線,輸入文檔圖像直接輸出結構化文本,顯著降低工程維護成本。
-
複雜版式適配:原生支持多欄排版、圖文混排、表格嵌套等複雜場景,無需額外規則後處理。
OvisOCR2的項目地址
- HuggingFace模型庫:https://huggingface.co/ATH-MaaS/OvisOCR2
OvisOCR2的同類競品對比
| 維度 | OvisOCR2 | GOT-OCR2.0 |
|---|---|---|
| 參數規模 | 0.8B(Qwen3.5) | 約 0.5B |
| 評測成績 | OmniDocBench v1.6 第一(96.58) | 多榜單領先 |
| 開源協議 | 完全開源 | 開源可商用 |
| 架構特點 | 端到端視覺語言模型 | 端到端通用 OCR |
| 部署成本 | 極低,消費級 GPU 可跑 | 極低 |
| 擅長場景 | 複雜版式文檔結構化解析 | 通用 OCR 與公式識別 |
OvisOCR2的應用場景
-
學術文獻數字化:批量解析掃描版 PDF 論文,自動提取正文、圖表標題與參考文獻結構,加速科研資料整理。
-
企業檔案管理:將歷史紙質檔案掃描件轉爲可檢索的結構化數據庫,降低人工錄入成本。
-
金融票據處理:精準識別發票、合同中的關鍵字段與嵌套表格,支撐自動化財務審覈流程。
-
教育資料整理:解析教材、試卷的複雜多欄排版,生成結構化電子資源便於在線檢索與編輯。
-
RAG 知識庫構建:爲文檔問答系統提供高質量結構化文本輸入,提升檢索增強生成的回答準確性。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...