PixelRAG是什麼
PixelRAG 是伯克利 SkyLab/BAIR 開源的視覺原生 RAG 框架。框架跳出網頁抽成純文本再檢索的傳統路線,改用瀏覽器把網頁、PDF 渲染成截圖瓦片,通過 LoRA 微調的 Qwen3-VL 視覺向量檢索,讓模型直接讀圖上的表格、圖表和版式,解決傳統 RAG 丟表格、丟版式的痛點。
![]()
PixelRAG的主要功能
-
頁面渲染(pixelshot):用無頭 Chromium把網頁、PDF 渲染成截圖瓦片,完整保留表格、圖表、版式;Windows/macOS 自動調用系統 Chrome,支持 URL 與本地文件混用。
-
視覺語義檢索:將截圖編碼爲向量,支持文本搜圖、以圖搜圖;本地默認 FAISS,大規模可切換 Qdrant(支持量化壓縮、磁盤存儲、多服務共享)。
-
像素直接閱讀:檢索命中的截圖直接作爲圖像輸入餵給 VLM 回答問題,全程無文本轉換。
-
託管搜索服務:免密鑰 API+ 網頁 Demo,內置 828 萬維基百科頁預建索引,開箱即搜。
-
自建索引管線:
pixelrag index / embed / build-index / serve全套命令,可對自己的 PDF、站點建庫,Mac(Apple Silicon)即可跑小規模。 -
Agent 集成:Claude Code 插件 pixelbrowse,無 MCP 依賴,讓 Claude 截圖”看”網頁而非吞殘缺 HTML。
PixelRAG的技術原理
- 表示層——文檔即圖像:用無頭 Chromium 把網頁截圖、把 PDF 按頁轉圖並切分爲瓦片,使表格行列對齊、圖表、信息圖等視覺結構原樣保留。
- 檢索層——視覺向量嵌入:基於 Qwen3-VL-Embedding-2B,用對比學習數據做 LoRA 微調,讓截圖可被語義檢索,查詢命中的是”那一塊圖”而非”那一段字”;向量本地存 FAISS,大規模可切 Qdrant。
- 生成層——VLM 讀圖作答:檢索命中的截圖瓦片直接作爲像素輸入交給視覺語言模型,模型從圖上直接讀數字和版式,全程無中間文本轉換。
- 規模與效率:首個用截圖形式覆蓋全量維基百科的 RAG 管線;像素表示還帶來新的效率槓桿——降低截圖分辨率可使 token 成本最多降 3 倍且精度不降,實驗上全面超越文本 RAG 基線,最高提升 18.1%。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用PixelRAG
- 安裝:執行
pip install pixelrag即可獲得核心工具(需 Python 3.10+)。 - 渲染頁面:運行
pixelshot https://example.com -o ./tiles將網頁或 PDF 渲染爲截圖瓦片。 - 體驗託管搜索:無需任何配置,直接 POST 請求
https://api.pixelrag.ai/search即可搜索 828 萬維基頁索引,或在瀏覽器打開 pixelrag.ai 在線試用。 - 自建索引:編寫
pixelrag.yaml配置(指定文檔路徑、嵌入模型、輸出目錄),執行pixelrag index build構建後,用pixelrag serve --index-dir ./my_index --port 30001啓動搜索服務(Mac Apple Silicon 即可跑小規模,全量維基索引約 217GB 需 GPU 算力)。 - 對接 Claude Code:執行
uv tool install pixelrag後安裝 pixelbrowse 插件(claude plugin marketplace add StarTrail-org/PixelRAG並claude plugin install pixelbrowse@pixelrag-plugins),即可讓 Claude 截圖”看”網頁,無需 MCP。 - 進階訓練:如需自研嵌入模型,進入
train/目錄(獨立 uv 項目)按 README 微調,或直接複用官方開源的 LoRA 權重與訓練數據。
PixelRAG的核心優勢
- 信息無損:以截圖代替文本抽取,表格行列、圖表、版式完整保留,徹底解決傳統 RAG看起來有答案、抽完字就沒了的痛點。
- 性能更強:論文顯示其全面超越文本 RAG 基線,在 NQ、SimpleQA 等純文本任務上同樣更優,多模態與 Agentic 基準最高提升 18.1%。
- 成本更低:像素表示帶來獨有的效率槓桿,降低截圖分辨率可使 token 成本最多降 3 倍且精度不降。
- 管線更簡單:省去複雜的 HTML 解析、清洗、切分流程,渲染截圖即可入庫,工程量大幅縮減。
- 規模已驗證:是首個用截圖形式覆蓋全量維基百科的 RAG 管線,附帶 828 萬頁的免密鑰託管索引可即刻體驗。
PixelRAG的項目地址
- 項目官網:https://pixelrag.ai/
- GitHub倉庫:https://github.com/StarTrail-org/PixelRAG
- arXiv技術論文:https://arxiv.org/pdf/2606.28344
PixelRAG的同類競品對比
| 對比維度 | PixelRAG | ColPali |
|---|---|---|
| 出品方 | 伯克利 SkyLab / BAIR / NLP Group(2026) | Illuin 科技(2024) |
| 基座模型 | Qwen3-VL-Embedding-2B + LoRA 微調 | PaliGemma(後續有 ColQwen2.5 變體) |
| 檢索對象 | 網頁截圖爲主,兼容 PDF | PDF 等靜態文檔頁面圖像 |
| 嵌入粒度 | 單向量:每塊截圖對應一個向量 | Late-interaction:每頁保留上千個 patch 級向量 |
| 存儲成本 | 單向量方案,存儲效率高,易擴展 | 每頁約 256KB,大規模部署壓力大 |
| 索引規模 | 已驗證覆蓋全量維基百科,3000 萬張截圖 | 公開驗證以萬級頁碼基準爲主 |
| 檢索精度 | 在 NQ、SimpleQA、MMSearch 等開放域任務全面超越文本基線,最高提升 18.1% | 版面密集型文檔細粒度匹配精度佔優,長期佔據 ViDoRe 榜首 |
| token 效率 | 降低截圖分辨率可降最多 3 倍 token 成本且精度不降 | 無圖像壓縮效率槓桿 |
| 工程生態 | 全棧工具鏈:渲染、嵌入、索引、託管 API、Claude Code 插件 | 提供模型與評測代碼,檢索服務需自建 |
PixelRAG的應用場景
- 財報與數據表問答:直接讀取財報頁、統計表中的數字,避免文本解析導致的行列錯位。
- 儀表盤與圖表檢索:檢索命中包含圖表、KPI 面板的截圖區域,讓模型讀圖作答。
- 信息圖與帶圖解文檔:信息圖、流程圖等傳統文本索引無法覆蓋的內容可被搜索。
- 多欄排版產品頁:複雜版式的商品對比頁、新聞頁保持原始佈局參與檢索。
- Agent 網頁閱讀:通過 Claude Code 的 pixelbrowse 插件,讓 Agent 截圖”看”網頁而非吞殘缺 HTML。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...