PixelRAG – 伯克利開源的視覺原生 RAG 框架

AI工具4周前發佈新公告 AI管理員
0 0

PixelRAG是什麼

PixelRAG 是伯克利 SkyLab/BAIR 開源的視覺原生 RAG 框架。框架跳出網頁抽成純文本再檢索的傳統路線,改用瀏覽器把網頁、PDF 渲染成截圖瓦片,通過 LoRA 微調的 Qwen3-VL 視覺向量檢索,讓模型直接讀圖上的表格、圖表和版式,解決傳統 RAG 丟表格、丟版式的痛點。

PixelRAG – 伯克利開源的視覺原生 RAG 框架

PixelRAG的主要功能

  • 頁面渲染(pixelshot):用無頭 Chromium把網頁、PDF 渲染成截圖瓦片,完整保留表格、圖表、版式;Windows/macOS 自動調用系統 Chrome,支持 URL 與本地文件混用。
  • 視覺語義檢索:將截圖編碼爲向量,支持文本搜圖、以圖搜圖;本地默認 FAISS,大規模可切換 Qdrant(支持量化壓縮、磁盤存儲、多服務共享)。
  • 像素直接閱讀:檢索命中的截圖直接作爲圖像輸入餵給 VLM 回答問題,全程無文本轉換。
  • 託管搜索服務:免密鑰 API+ 網頁 Demo,內置 828 萬維基百科頁預建索引,開箱即搜。
  • 自建索引管線pixelrag index / embed / build-index / serve 全套命令,可對自己的 PDF、站點建庫,Mac(Apple Silicon)即可跑小規模。
  • Agent 集成:Claude Code 插件 pixelbrowse,無 MCP 依賴,讓 Claude 截圖”看”網頁而非吞殘缺 HTML。

PixelRAG的技術原理

  • 表示層——文檔即圖像:用無頭 Chromium 把網頁截圖、把 PDF 按頁轉圖並切分爲瓦片,使表格行列對齊、圖表、信息圖等視覺結構原樣保留。
  • 檢索層——視覺向量嵌入:基於 Qwen3-VL-Embedding-2B,用對比學習數據做 LoRA 微調,讓截圖可被語義檢索,查詢命中的是”那一塊圖”而非”那一段字”;向量本地存 FAISS,大規模可切 Qdrant。
  • 生成層——VLM 讀圖作答:檢索命中的截圖瓦片直接作爲像素輸入交給視覺語言模型,模型從圖上直接讀數字和版式,全程無中間文本轉換。
  • 規模與效率:首個用截圖形式覆蓋全量維基百科的 RAG 管線;像素表示還帶來新的效率槓桿——降低截圖分辨率可使 token 成本最多降 3 倍且精度不降,實驗上全面超越文本 RAG 基線,最高提升 18.1%。

PixelRAG – 伯克利開源的視覺原生 RAG 框架

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用PixelRAG

  • 安裝:執行 pip install pixelrag 即可獲得核心工具(需 Python 3.10+)。
  • 渲染頁面:運行 pixelshot https://example.com -o ./tiles 將網頁或 PDF 渲染爲截圖瓦片。
  • 體驗託管搜索:無需任何配置,直接 POST 請求 https://api.pixelrag.ai/search 即可搜索 828 萬維基頁索引,或在瀏覽器打開 pixelrag.ai 在線試用。
  • 自建索引:編寫 pixelrag.yaml 配置(指定文檔路徑、嵌入模型、輸出目錄),執行 pixelrag index build 構建後,用 pixelrag serve --index-dir ./my_index --port 30001 啓動搜索服務(Mac Apple Silicon 即可跑小規模,全量維基索引約 217GB 需 GPU 算力)。
  • 對接 Claude Code:執行 uv tool install pixelrag 後安裝 pixelbrowse 插件(claude plugin marketplace add StarTrail-org/PixelRAGclaude plugin install pixelbrowse@pixelrag-plugins),即可讓 Claude 截圖”看”網頁,無需 MCP。
  • 進階訓練:如需自研嵌入模型,進入 train/ 目錄(獨立 uv 項目)按 README 微調,或直接複用官方開源的 LoRA 權重與訓練數據。

PixelRAG的核心優勢

  • 信息無損:以截圖代替文本抽取,表格行列、圖表、版式完整保留,徹底解決傳統 RAG看起來有答案、抽完字就沒了的痛點。
  • 性能更強:論文顯示其全面超越文本 RAG 基線,在 NQ、SimpleQA 等純文本任務上同樣更優,多模態與 Agentic 基準最高提升 18.1%。
  • 成本更低:像素表示帶來獨有的效率槓桿,降低截圖分辨率可使 token 成本最多降 3 倍且精度不降。
  • 管線更簡單:省去複雜的 HTML 解析、清洗、切分流程,渲染截圖即可入庫,工程量大幅縮減。
  • 規模已驗證:是首個用截圖形式覆蓋全量維基百科的 RAG 管線,附帶 828 萬頁的免密鑰託管索引可即刻體驗。

PixelRAG的項目地址

  • 項目官網:https://pixelrag.ai/
  • GitHub倉庫:https://github.com/StarTrail-org/PixelRAG
  • arXiv技術論文:https://arxiv.org/pdf/2606.28344

PixelRAG的同類競品對比

對比維度 PixelRAG ColPali
出品方 伯克利 SkyLab / BAIR / NLP Group(2026) Illuin 科技(2024)
基座模型 Qwen3-VL-Embedding-2B + LoRA 微調 PaliGemma(後續有 ColQwen2.5 變體)
檢索對象 網頁截圖爲主,兼容 PDF PDF 等靜態文檔頁面圖像
嵌入粒度 單向量:每塊截圖對應一個向量 Late-interaction:每頁保留上千個 patch 級向量
存儲成本 單向量方案,存儲效率高,易擴展 每頁約 256KB,大規模部署壓力大
索引規模 已驗證覆蓋全量維基百科,3000 萬張截圖 公開驗證以萬級頁碼基準爲主
檢索精度 在 NQ、SimpleQA、MMSearch 等開放域任務全面超越文本基線,最高提升 18.1% 版面密集型文檔細粒度匹配精度佔優,長期佔據 ViDoRe 榜首
token 效率 降低截圖分辨率可降最多 3 倍 token 成本且精度不降 無圖像壓縮效率槓桿
工程生態 全棧工具鏈:渲染、嵌入、索引、託管 API、Claude Code 插件 提供模型與評測代碼,檢索服務需自建

PixelRAG的應用場景

  • 財報與數據表問答:直接讀取財報頁、統計表中的數字,避免文本解析導致的行列錯位。
  • 儀表盤與圖表檢索:檢索命中包含圖表、KPI 面板的截圖區域,讓模型讀圖作答。
  • 信息圖與帶圖解文檔:信息圖、流程圖等傳統文本索引無法覆蓋的內容可被搜索。
  • 多欄排版產品頁:複雜版式的商品對比頁、新聞頁保持原始佈局參與檢索。
  • Agent 網頁閱讀:通過 Claude Code 的 pixelbrowse 插件,讓 Agent 截圖”看”網頁而非吞殘缺 HTML。
© 版權聲明

相關文章

暫無評論

暫無評論...