PixRestore是什麼
PixRestore 是香港理工大學與 OPPO 研究院聯合推出的統一圖像修復模型。模型採用像素空間 Diffusion Transformer 直接在像素層面進行 flow matching,避免細節損失。PixRestore通過 DINO 驅動的自適應層特徵路由,僅 53.7M 參數的輕量模型即可高效處理超分辨率、去噪、去模糊、去雨、去霧等 8 種退化任務,單步推理僅需 44 毫秒,在保真度與效率上均達到領先水平。

PixRestore的主要功能
-
超分辨率:將低分辨率圖像恢復爲細節豐富的高清圖像。
-
圖像去噪:去除畫面中的隨機噪聲顆粒,還原乾淨紋理。
-
運動去模糊:消除因運動或失焦造成的模糊,恢復銳利邊緣。
-
雨線去除:清除密集雨線對畫面的干擾,還原背景內容。
-
雨滴去除:消除玻璃或鏡頭表面的雨滴遮擋,恢復清晰視野。
-
圖像去霧:驅散大氣霧霾導致的朦朧感,提升畫面通透度與色彩。
-
去雪處理:去除圖像中的雪花噪點,恢復場景原本面貌。
-
低光照增強:提升暗光環境下的亮度與細節,改善畫面可見性。
PixRestore的技術原理
-
像素空間擴散 Transformer:PixRestore 直接在像素層面執行 flow matching,完全摒棄 VAE 編碼器,避免潛在空間壓縮導致的高頻細節丟失,同時擺脫對 T2I 預訓練模型的依賴,確保修復結果與原始內容高度一致。
-
自適應層特徵路由:模型利用 LQ–HQ 圖像的 DINO 特徵相似度,動態評估視覺編碼器各層特徵的可靠性;將可靠層融合爲密集條件注入 DiT,對不可靠層則施加更強的高質量特徵監督,從而自適應地去除不同退化。
-
單步高效推理:在完整訓練後,PixRestore 通過基於 DINO 的對抗目標進一步微調爲單步生成器,僅 53.7M 參數即可在 44ms 內完成推理,在保真度、感知質量與計算效率之間實現最佳平衡。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用PixRestore
- 環境配置:從 GitHub 克隆 PixRestore 代碼倉庫並安裝所需依賴。
- 模型獲取:從 Hugging Face 下載預訓練的模型權重文件。
- 圖像準備:準備待修復的低質量圖像,支持超分辨率、去噪、去模糊等 8 種退化類型。
- 執行推理:運行推理腳本,模型默認單步推理,約 44ms 即可輸出修復結果。
- 結果保存:獲取並保存高質量修復圖像,直接用於後續應用。
PixRestore的核心優勢
- 像素級保真:直接在像素空間進行擴散建模,徹底規避 VAE 編碼導致的高頻細節丟失與內容僞影。
- 極致輕量高效:僅 53.7M 參數,單步推理僅需 44 毫秒,計算開銷遠低於主流潛在擴散修復方案。
- 統一多任務覆蓋:單一模型可處理超分辨率、去噪、去模糊、去雨、去霧、去雪、低光照增強等 8 種退化。
- 自適應退化感知:通過 DINO 特徵相似度動態評估各層可靠性,實現退化去除與細節保留的智能權衡。
- 獨立訓練範式:無需依賴任何文本到圖像預訓練模型,完全從頭訓練,避免生成先驗引入的內容偏差。
- 性能全面領先:在公開基準與真實世界測試集上,保真度、感知質量與退化去除能力均優於現有統一修復模型。
PixRestore的項目地址
- 項目官網:https://csslc.github.io/pixrestore-page
- GitHub倉庫:https://github.com/csslc/PixRestore
- HuggingFace模型庫:https://huggingface.co/VCLab-PolyU/PixRestore
- arXiv技術論文:https://arxiv.org/pdf/2608.16793
PixRestore的同類競品對比
| 對比維度 | PixRestore | PixelHacker |
|---|---|---|
| 核心任務 | 統一圖像修復(UIR):去除超分辨率、去噪、去模糊、去雨、去霧、去雪、低光照增強等 8 種退化 | 圖像修復(Inpainting):根據掩碼填充圖像中的缺失區域,恢復結構與語義一致性 |
| 技術架構 | 像素空間 Diffusion Transformer,無 VAE,從頭訓練 | 潛在擴散模型(Latent Diffusion),基於 VAE 編碼器,將特徵從像素空間轉換到潛在空間 |
| 參數量 | 53.7M(輕量) | 未公開具體參數,基於標準擴散 U-Net,參數量通常在數億級別 |
| 推理效率 | 單步 44ms,計算量約 658G FLOPs | 多步迭代去噪,需數十步採樣,推理延遲顯著更高 |
| 條件輸入 | 僅需低質量(LQ)圖像,自動感知退化類型 | 需輸入圖像 + 掩碼(Mask),明確指定待修復區域 |
| 訓練數據 | 大規模多樣化場景與退化配對數據 | 1400 萬張圖像-掩碼對,基於前景(116 類)與背景(21 類)標註 |
| 特徵注入方式 | DINO 驅動的自適應層特徵路由,動態融合多層視覺特徵 | 潛在類別引導(LCG),通過線性注意力間歇性注入前景/背景嵌入 |
PixRestore的應用場景
-
手機端實時拍照增強:用 44ms 超低延遲,在 OPPO 等移動設備上實時修復夜景噪點、運動模糊與雨滴遮擋,提升成片質量。
-
自動駕駛與無人機視覺:在雨霧雪等惡劣天氣下,統一去除圖像退化,恢復道路標誌與障礙物細節,增強感知系統可靠性。
-
監控視頻畫質修復:對老舊或低碼率監控錄像進行超分辨率與去噪處理,還原人臉與車牌等關鍵信息,輔助安防取證。
-
老照片與歷史檔案數字化:統一修復褪色、劃痕、黴斑與低光照問題,將珍貴歷史影像高效轉換爲高保真數字檔案。
-
醫學影像增強:提升內窺鏡、顯微鏡等在低光照下的成像質量,去除噪聲與模糊,輔助醫生更清晰地觀察病竈細節。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...