PixelFlow是什麼
PixelFlow 是香港大學和Adobe聯合推出的圖像生成模型,支持直接在像素空間中生成圖像。PixelFlow基於高效的級聯流建模,從低分辨率逐步提升到高分辨率,降低計算成本。PixelFlow 在 256×256 ImageNet 類別條件圖像生成任務中達到 1.98 的 FID 分數,展現出色的圖像質量和語義控制能力。PixelFlow在文本到圖像生成任務中也表現出色,支持生成高質量且與文本描述高度一致的圖像。PixelFlow 的端到端可訓練性和高效的多尺度生成策略爲下一代視覺生成模型提供新的研究方向。
![]()
PixelFlow的主要功能
- 高質量圖像生成:支持生成高分辨率、高質量的圖像。
- 類別條件圖像生成:根據給定的類別標籤生成相應的圖像。
- 文本到圖像生成:根據文本描述生成與之匹配的圖像,支持複雜的語義理解和視覺表現。
PixelFlow的技術原理
- 流匹配:流匹配是生成模型技術,基於一系列線性路徑將先驗分佈(如標準正態分佈)的樣本逐步轉換爲目標數據分佈的樣本。訓練時,基於線性插值構造訓練樣本,訓練模型預測從中間樣本到真實數據樣本的轉換速度。
- 多尺度生成:基於多階段去噪過程逐步增加圖像分辨率。每個階段從較低分辨率的噪聲圖像開始,逐步去噪提升分辨率,直到達到目標分辨率。逐步提升分辨率的方法避免在全分辨率下進行所有去噪步驟,顯著降低計算成本。
- Transformer 架構:
- Patchify:將輸入圖像的空間表示轉換爲 1D 序列的標記。
- RoPE(Rotary Position Embedding):用 RoPE 替換原始的正弦餘弦位置編碼,更好地處理不同圖像分辨率。
- 分辨率嵌入:引入額外的分辨率嵌入區分不同分辨率。
- 文本到圖像生成:在每個 Transformer 塊中引入交叉注意力層,將視覺特徵與文本輸入對齊。
- 端到端訓練:基於統一的參數集直接在像素空間中進行訓練,無需預訓練的 VAE 或其他輔助網絡。訓練時,模型從所有分辨率階段均勻採樣訓練樣本,用序列打包技術進行聯合訓練,提高訓練效率和模型的可擴展性。
- 高效的推理策略:在推理時,PixelFlow 從最低分辨率的高斯噪聲開始,逐步去噪和提升分辨率,直到達到目標分辨率。支持多種 ODE 求解器(如 Euler 和 Dopri5),根據需要選擇不同的求解器平衡速度和生成質量。
PixelFlow的項目地址
- GitHub倉庫:https://github.com/ShoufaChen/PixelFlow
- arXiv技術論文:https://arxiv.org/pdf/2504.07963
- 在線體驗Demo:https://huggingface.co/spaces/ShoufaChen/PixelFlow
PixelFlow的應用場景
- 藝術與設計:生成創意繪畫、平面設計元素和虛擬角色。
- 內容創作:輔助視頻製作、遊戲開發和社交媒體內容創作。
- 教育與研究:作爲教學工具,幫助理解複雜概念,輔助科研可視化。
- 商業與營銷:生成產品設計原型、廣告圖像和品牌推廣內容。
- 娛樂與互動:用在互動故事、VR/AR內容生成和個人化圖像定製。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...