HyOCR-1.5 – 騰訊混元開源的輕量級端到端 OCR 專家大模型

AI工具4周前發佈新公告 AI管理員
0 0

HyOCR-1.5是什麼

HyOCR-1.5 是騰訊混元開源的輕量級端到端 OCR 專家大模型,僅 1B 參數能實現文檔解析、文本識別、信息抽取、拍照翻譯、圖表解析、古文字識別、視頻字幕提取與多頁文檔問答等全棧能力。模型基於 DFlash 投機解碼,長結構化輸出推理最高提速 6.37 倍;OmniDocBench v1.6 以 94.74 分位居端到端第一。

HyOCR-1.5 – 騰訊混元開源的輕量級端到端 OCR 專家大模型

HyOCR-1.5的主要功能

  • 文檔解析:將密集文檔、多欄版面、表格與公式一鍵轉爲結構化文本(Markdown/HTML/LaTeX)。
  • 文本檢測識別:輸出圖片中全部文字內容及對應座標,覆蓋文檔、街景、手寫、廣告、遊戲、視頻等場景。
  • 信息抽取:從票據、證件、收據中提取指定字段並按 JSON 格式返回。
  • 拍照翻譯:提取圖中文字並翻譯爲多種語言,保留文檔版式與公式格式。
  • 圖表解析:將流程圖、統計圖表解析爲 Mermaid 或 Markdown 格式。
  • 古文字識別:支持漢字七體(甲骨、金文、篆、隸、楷、行、草)識別。
  • 視頻字幕提取:從視頻幀中精準提取字幕文本。
  • 多頁文檔問答:基於多頁 PDF 進行跨頁檢索、比對與證據聚合問答。

HyOCR-1.5的技術原理

  • 輕量端到端架構:沿用 HyOCR-1.0 驗證過的緊湊設計,由原生分辨率視覺編碼器 Hunyuan-ViT、自適應 MLP 連接器與輕量語言模型 Hunyuan-0.5B 組成,直接將多模態輸入映射爲 Markdown、HTML、LaTeX 等結構化輸出,無需任何任務級後處理模塊。
  • 4K 原生分辨率視覺編碼:視覺編碼器基於 Hunyuan-ViT 構建,最大輸入分辨率從 2K 擴展至 4K,保持原始寬高比與空間佈局,使模型能捕捉高密度文檔、超大表格及複雜版面的細粒度結構細節。
  • DFlash 投機解碼:引入約 90.7M 參數的 block-diffusion 草稿模型,一次並行前向即可預測整塊候選 token,再由目標模型單次驗證並接受最長正確前綴;嚴格保持目標模型輸出分佈的同時,將長結構化 OCR 生成的解碼延遲大幅降低。
  • Agentic Data Flow:智能體驅動數據生產閉環,將模型短板轉化爲可執行數據需求,自主完成素材搜索、工具輔助清洗、難例挖掘與數據管線開發,並與算法工程師持續迭代。
  • 三階段訓練配方:預訓練階段重規劃 Stage 3,注入新能力數據並擴展至 4K 分辨率與 128K 上下文;SFT 階段徹底清洗數據、統一 prompt 接口;RL 階段採用 IcePop(GRPO 風格)優化,通過事實性、一致性評判與退化抑制三類互補獎勵提升輸出質量。

HyOCR-1.5 – 騰訊混元開源的輕量級端到端 OCR 專家大模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用HyOCR-1.5

  • 環境準備:安裝 Python 3.12+、CUDA 12.9、PyTorch 2.7.1 與 vLLM(≥0.12.0)。
  • 模型啓動:執行 vllm serve tencent/HunyuanOCR 啓動服務,或加載 Hugging Face 權重。
  • 圖片輸入:使用 PIL 讀取圖片並構建含 image 與 text 的 messages 對話結構。
  • 任務指令:按場景選擇 Prompt,如文檔解析、文字檢測、信息抽取、翻譯等。
  • 調用推理:通過 vLLM 或 Transformers 生成結果,設置 temperature=0 與 max_tokens=16384。
  • 結果清洗:使用內置去重函數清理可能的重複子串,獲取最終結構化輸出。
  • 本地部署:通過 llama.cpp 在 CPU 或消費級 GPU 上運行,無需服務器。

HyOCR-1.5的核心優勢

  • 極速推理:DFlash 投機解碼讓長文檔生成在 Transformers 下提速 6.37 倍、vLLM 下提速 2.14 倍,端到端每頁僅 1.4 秒。
  • 輕量可部署:1B 參數可通過 llama.cpp 在 CPU、消費級顯卡及筆記本本地運行。
  • SOTA 精度:OmniDocBench v1.6 端到端第一(94.74),表格 TEDS 93.67,複雜表格與閱讀順序表現突出。
  • 全棧開源:訓練配方、推理框架、模型權重完整公開,可復現、可微調、可擴展。
  • 長尾能力:Agentic Data Flow 補齊 331 種低資源語種、古文字、多圖問答等稀缺能力。
  • 高分辨率長上下文:支持 4K 圖像分辨率與 128K 上下文,適配高密度長文檔。
  • 幻覺抑制:CHAOS-Bench 頁均召回率 14.15,優於現有模型,輸出更忠於所見。

HyOCR-1.5的項目地址

  • GitHub倉庫:https://github.com/Tencent-Hunyuan/HunyuanOCR
  • HuggingFace模型庫:https://huggingface.co/tencent/HunyuanOCR
  • arXiv技術論文:https://arxiv.org/pdf/2607.04884

HyOCR-1.5的同類競品對比

維度 HyOCR-1.5 DeepSeek-OCR-2
參數規模 1B(輕量) 3B(大 3 倍)
OmniDocBench 94.74 87.01
端到端延遲 1.408s / 頁 5.460s / 頁(慢 3.9 倍)
表格解析 TEDS 93.67 約 84.97
推理加速 DFlash 投機解碼,Transformers 6.37× 提速 無專用加速,純自迴歸解碼
部署成本 可跑在 CPU / 筆記本 需服務器級 GPU

HyOCR-1.5的應用場景

  • 密集文檔數字化:一鍵將合同、論文、報告等高密度多欄版面轉爲 Markdown / HTML / LaTeX 結構化文本,保留閱讀順序與版式。
  • 複雜表格與公式解析:精準還原財務報表、學術論文中的超大表格與數學公式,支持 HTML 表格與 LaTeX 公式輸出。
  • 多語種跨國文檔處理:覆蓋 331 種語言,自動識別並解析混合語種文檔,適用於外貿、法務、出版等全球化業務場景。
  • 古文字研究與保護:識別甲骨、金文、篆書、隸書等漢字七體,輔助博物館、考古機構對歷史文獻進行數字化存檔與研究。
© 版權聲明

相關文章

暫無評論

暫無評論...