OvisOCR2 – 阿里ATH-MaaS團隊推出的端到端文檔解析模型

AI工具2天前發佈新公告 AI管理員
0 0

OvisOCR2是什麼

OvisOCR2 是阿里 ATH-MaaS 團隊推出的端到端文檔解析模型,基於 Qwen3.5-0.8B 訓練並完全開源。模型在 OmniDocBench v1.6 評測中以 96.58 分登頂榜首,具備對複雜版式文檔的高精度識別與結構化提取能力,支持多欄排版、表格、公式等場景的解析,適用學術研究、檔案數字化及企業知識庫構建等文檔智能處理需求。

OvisOCR2 – 阿里ATH-MaaS團隊推出的端到端文檔解析模型

OvisOCR2的主要功能

  • 端到端文檔解析:輸入文檔圖像直接輸出結構化文本,無需多階段流水線拼接。
  • 複雜版式識別:支持多欄排版、圖文混排、表格嵌套等複雜文檔佈局的精準解析。
  • 高精度 OCR 提取:在 OmniDocBench v1.6 上以 96.58 分取得第一,字符與段落識別準確率行業領先。
  • 開源可部署:基於 Qwen3.5-0.8B 訓練,模型權重與代碼已開源至 HuggingFace。

OvisOCR2的技術原理

  • 視覺語言模型架構:模型以 Qwen3.5-0.8B 爲基座,融合視覺編碼器與文本解碼器,實現圖像到結構化文本的端到端映射。
  • 大規模文檔預訓練:在海量掃描文檔、PDF 渲染圖等數據上預訓練,學習文檔版式與語義關聯。
  • 端到端優化:摒棄傳統檢測→識別→後處理的多階段流程,通過單一模型聯合優化降低誤差累積。
  • 輕量高效:基於 0.8B 參數規模的小模型實現 SOTA 性能,兼顧推理速度與部署成本。

OvisOCR2 – 阿里ATH-MaaS團隊推出的端到端文檔解析模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用OvisOCR2

  • 環境準備:克隆 HuggingFace 倉庫,安裝依賴庫(Transformers、PyTorch 等)。
  • 加載模型:通過 AutoModelForCausalLM 加載 OvisOCR2 權重與對應分詞器。
  • 輸入文檔:將掃描件或截圖轉爲張量格式,傳入模型進行前向推理。
  • 獲取結果:模型直接輸出 Markdown 或純文本格式的結構化解析結果。
  • 微調部署:基於自有文檔數據繼續微調,適配特定領域版式需求。

OvisOCR2的核心優勢

  • 評測榜首:OmniDocBench v1.6 以 96.58 分登頂,文檔解析精度行業領先。
  • 極致輕量:基於 Qwen3.5-0.8B 訓練,僅 0.8B 參數即可實現 SOTA 性能,單卡流暢推理。
  • 完全開源:模型權重與代碼均已公開至 HuggingFace,無商業授權限制,支持自由二次開發。
  • 端到端架構:模型摒棄傳統多階段流水線,輸入文檔圖像直接輸出結構化文本,顯著降低工程維護成本。
  • 複雜版式適配:原生支持多欄排版、圖文混排、表格嵌套等複雜場景,無需額外規則後處理。

OvisOCR2的項目地址

  • HuggingFace模型庫:https://huggingface.co/ATH-MaaS/OvisOCR2

OvisOCR2的同類競品對比

維度 OvisOCR2 GOT-OCR2.0
參數規模 0.8B(Qwen3.5) 約 0.5B
評測成績 OmniDocBench v1.6 第一(96.58) 多榜單領先
開源協議 完全開源 開源可商用
架構特點 端到端視覺語言模型 端到端通用 OCR
部署成本 極低,消費級 GPU 可跑 極低
擅長場景 複雜版式文檔結構化解析 通用 OCR 與公式識別

OvisOCR2的應用場景

  • 學術文獻數字化:批量解析掃描版 PDF 論文,自動提取正文、圖表標題與參考文獻結構,加速科研資料整理。
  • 企業檔案管理:將歷史紙質檔案掃描件轉爲可檢索的結構化數據庫,降低人工錄入成本。
  • 金融票據處理:精準識別發票、合同中的關鍵字段與嵌套表格,支撐自動化財務審覈流程。
  • 教育資料整理:解析教材、試卷的複雜多欄排版,生成結構化電子資源便於在線檢索與編輯。
  • RAG 知識庫構建:爲文檔問答系統提供高質量結構化文本輸入,提升檢索增強生成的回答準確性。
© 版權聲明

相關文章

暫無評論

暫無評論...