HyOCR-1.5是什麼
HyOCR-1.5 是騰訊混元開源的輕量級端到端 OCR 專家大模型,僅 1B 參數能實現文檔解析、文本識別、信息抽取、拍照翻譯、圖表解析、古文字識別、視頻字幕提取與多頁文檔問答等全棧能力。模型基於 DFlash 投機解碼,長結構化輸出推理最高提速 6.37 倍;OmniDocBench v1.6 以 94.74 分位居端到端第一。

HyOCR-1.5的主要功能
-
文檔解析:將密集文檔、多欄版面、表格與公式一鍵轉爲結構化文本(Markdown/HTML/LaTeX)。
-
文本檢測識別:輸出圖片中全部文字內容及對應座標,覆蓋文檔、街景、手寫、廣告、遊戲、視頻等場景。
-
信息抽取:從票據、證件、收據中提取指定字段並按 JSON 格式返回。
-
拍照翻譯:提取圖中文字並翻譯爲多種語言,保留文檔版式與公式格式。
-
圖表解析:將流程圖、統計圖表解析爲 Mermaid 或 Markdown 格式。
-
古文字識別:支持漢字七體(甲骨、金文、篆、隸、楷、行、草)識別。
-
視頻字幕提取:從視頻幀中精準提取字幕文本。
-
多頁文檔問答:基於多頁 PDF 進行跨頁檢索、比對與證據聚合問答。
HyOCR-1.5的技術原理
- 輕量端到端架構:沿用 HyOCR-1.0 驗證過的緊湊設計,由原生分辨率視覺編碼器 Hunyuan-ViT、自適應 MLP 連接器與輕量語言模型 Hunyuan-0.5B 組成,直接將多模態輸入映射爲 Markdown、HTML、LaTeX 等結構化輸出,無需任何任務級後處理模塊。
- 4K 原生分辨率視覺編碼:視覺編碼器基於 Hunyuan-ViT 構建,最大輸入分辨率從 2K 擴展至 4K,保持原始寬高比與空間佈局,使模型能捕捉高密度文檔、超大表格及複雜版面的細粒度結構細節。
- DFlash 投機解碼:引入約 90.7M 參數的 block-diffusion 草稿模型,一次並行前向即可預測整塊候選 token,再由目標模型單次驗證並接受最長正確前綴;嚴格保持目標模型輸出分佈的同時,將長結構化 OCR 生成的解碼延遲大幅降低。
- Agentic Data Flow:智能體驅動數據生產閉環,將模型短板轉化爲可執行數據需求,自主完成素材搜索、工具輔助清洗、難例挖掘與數據管線開發,並與算法工程師持續迭代。
- 三階段訓練配方:預訓練階段重規劃 Stage 3,注入新能力數據並擴展至 4K 分辨率與 128K 上下文;SFT 階段徹底清洗數據、統一 prompt 接口;RL 階段採用 IcePop(GRPO 風格)優化,通過事實性、一致性評判與退化抑制三類互補獎勵提升輸出質量。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用HyOCR-1.5
-
環境準備:安裝 Python 3.12+、CUDA 12.9、PyTorch 2.7.1 與 vLLM(≥0.12.0)。
-
模型啓動:執行
vllm serve tencent/HunyuanOCR啓動服務,或加載 Hugging Face 權重。 -
圖片輸入:使用 PIL 讀取圖片並構建含 image 與 text 的 messages 對話結構。
-
任務指令:按場景選擇 Prompt,如文檔解析、文字檢測、信息抽取、翻譯等。
-
調用推理:通過 vLLM 或 Transformers 生成結果,設置 temperature=0 與 max_tokens=16384。
-
結果清洗:使用內置去重函數清理可能的重複子串,獲取最終結構化輸出。
-
本地部署:通過 llama.cpp 在 CPU 或消費級 GPU 上運行,無需服務器。
HyOCR-1.5的核心優勢
-
極速推理:DFlash 投機解碼讓長文檔生成在 Transformers 下提速 6.37 倍、vLLM 下提速 2.14 倍,端到端每頁僅 1.4 秒。
-
輕量可部署:1B 參數可通過 llama.cpp 在 CPU、消費級顯卡及筆記本本地運行。
-
SOTA 精度:OmniDocBench v1.6 端到端第一(94.74),表格 TEDS 93.67,複雜表格與閱讀順序表現突出。
-
全棧開源:訓練配方、推理框架、模型權重完整公開,可復現、可微調、可擴展。
-
長尾能力:Agentic Data Flow 補齊 331 種低資源語種、古文字、多圖問答等稀缺能力。
-
高分辨率長上下文:支持 4K 圖像分辨率與 128K 上下文,適配高密度長文檔。
-
幻覺抑制:CHAOS-Bench 頁均召回率 14.15,優於現有模型,輸出更忠於所見。
HyOCR-1.5的項目地址
- GitHub倉庫:https://github.com/Tencent-Hunyuan/HunyuanOCR
- HuggingFace模型庫:https://huggingface.co/tencent/HunyuanOCR
- arXiv技術論文:https://arxiv.org/pdf/2607.04884
HyOCR-1.5的同類競品對比
| 維度 | HyOCR-1.5 | DeepSeek-OCR-2 |
|---|---|---|
| 參數規模 | 1B(輕量) | 3B(大 3 倍) |
| OmniDocBench | 94.74 | 87.01 |
| 端到端延遲 | 1.408s / 頁 | 5.460s / 頁(慢 3.9 倍) |
| 表格解析 TEDS | 93.67 | 約 84.97 |
| 推理加速 | DFlash 投機解碼,Transformers 6.37× 提速 | 無專用加速,純自迴歸解碼 |
| 部署成本 | 可跑在 CPU / 筆記本 | 需服務器級 GPU |
HyOCR-1.5的應用場景
- 密集文檔數字化:一鍵將合同、論文、報告等高密度多欄版面轉爲 Markdown / HTML / LaTeX 結構化文本,保留閱讀順序與版式。
- 複雜表格與公式解析:精準還原財務報表、學術論文中的超大表格與數學公式,支持 HTML 表格與 LaTeX 公式輸出。
- 多語種跨國文檔處理:覆蓋 331 種語言,自動識別並解析混合語種文檔,適用於外貿、法務、出版等全球化業務場景。
- 古文字研究與保護:識別甲骨、金文、篆書、隸書等漢字七體,輔助博物館、考古機構對歷史文獻進行數字化存檔與研究。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...