mPLUG-DocOwl 1.5 – 阿里開源的多模態大型語言模型

AI工具2年前 (2024)發佈新公告 AI管理員
0 0

mPLUG-DocOwl 1.5是什麼

mPLUG-DocOwl 1.5是由阿里巴巴集團推出的多模態大型語言模型,專注於OCR-free(無需光學字符識別)的文檔理解。模型基於統一結構學習,強化對文本豐富圖像如文檔、表格和圖表的結構信息理解能力。mPLUG-DocOwl 1.5包含結構感知解析任務和多粒度文本定位任務,覆蓋五個領域:文檔、網頁、表格、圖表和自然圖像。mPLUG-DocOwl 1.5的H-Reducer模塊基於卷積層合併水平相鄰圖像塊,減少視覺特徵長度,保持佈局信息,讓模型能高效處理高分辨率圖像。在多個視覺文檔理解基準測試中,模型展現業界領先的無OCR性能,提升SOTA性能超過10分。

mPLUG-DocOwl 1.5 – 阿里開源的多模態大型語言模型

mPLUG-DocOwl 1.5的主要功能

  • 結構感知的文檔解析:識別和解析文檔中的文本結構,如換行和空格,理解文檔的組織方式。
  • 表格轉Markdown:將表格圖像轉換爲Markdown格式,便於進一步的處理和閱讀。
  • 圖表轉Markdown:將圖表圖像轉換爲Markdown格式,保留圖表中的關鍵數據和結構信息。
  • 自然圖像解析:對自然場景中的圖像進行解析,識別和理解圖像中的文字信息。
  • 多粒度文本定位:在不同粒度級別(單詞、短語、行、塊)上定位文本,增強模型對文本位置的識別能力。

mPLUG-DocOwl 1.5的技術原理

  • 統一結構學習(Unified Structure Learning):基於結構感知解析任務和多粒度文本定位任務,模型學習如何理解和處理文本豐富的圖像。
  • H-Reducer視覺-文本模塊:基於卷積層合併水平相鄰的視覺特徵,減少特徵長度,保持佈局信息,讓大型語言模型能更有效地處理高分辨率圖像。
  • 多模態大型語言模型(MLLM):結合視覺編碼器和大型語言模型,用視覺到文本的模塊(如H-Reducer),讓模型理解和生成與視覺內容相關的語言描述。
  • 大規模數據集訓練:用大規模的標註數據集,如DocStruct4M和DocReason25K,模型能學習各種文檔和圖像中的文本結構和語義信息。
  • 兩階段訓練框架:首先進行統一結構學習,然後進行多任務調整,讓模型在各種下游任務中能表現出色。

mPLUG-DocOwl 1.5的項目地址

  • GitHub倉庫:X-PLUG/mPLUG-DocOwl/tree/main/DocOwl1.5
  • arXiv技術論文:https://arxiv.org/pdf/2403.12895

mPLUG-DocOwl 1.5的應用場景

  • 自動化文檔處理:在企業或政府機構中,自動化解析和理解大量文檔,如合同、發票、報告和表格,提高工作效率和減少人工干預。
  • 智能搜索引擎:在搜索引擎中集成mPLUG-DocOwl 1.5,增強對圖像中文本內容的搜索能力,提供更準確的搜索結果。
  • 輔助閱讀和理解:幫助用戶更好地理解複雜文檔的內容,尤其是對於視覺障礙人士,基於解析文檔結構提供易於訪問的信息。
  • 教育和學術研究:在教育領域,輔助學生和研究人員理解教科書、學術論文和研究資料中的複雜信息。
  • 客戶服務和支持:在客戶服務系統中,用mPLUG-DocOwl 1.5解析用戶上傳的文檔,自動提取關鍵信息,提供更快的服務響應。
© 版權聲明

相關文章

暫無評論

暫無評論...