OmniConsistency – 新加坡國立大學推出的圖像風格遷移模型

AI工具1年前 (2025)發佈新公告 AI管理員
0 0

OmniConsistency是什麼

OmniConsistency 是新加坡國立大學推出的圖像風格遷移模型,能解決複雜場景下風格化圖像的一致性問題。模型基於大規模配對的風格化數據進行訓練,用兩階段訓練策略,將風格學習與一致性學習解耦,在多種風格下保持圖像的語義、結構和細節一致性。模型支持與任意風格的 LoRA 模塊無縫集成,實現高效且靈活的風格化效果。OmniConsistency 在實驗中展現出與 GPT-4o 相當的性能,且提供更高的靈活性和泛化能力。

OmniConsistency – 新加坡國立大學推出的圖像風格遷移模型

OmniConsistency的主要功能

  • 風格一致性:在多種風格下保持圖像的風格一致性,避免風格退化。
  • 內容一致性:在風格化過程中保留原始圖像的語義和細節,確保內容的完整性。
  • 風格無關性:與任意風格的 LoRA(Low-Rank Adaptation)模塊無縫集成,支持多種風格的風格化任務。
  • 靈活性:支持靈活的佈局控制,無需依賴傳統的幾何約束(如邊緣圖、草圖、姿態圖)。

OmniConsistency的技術原理

  • 兩階段訓練策略:第一階段(風格學習)獨立訓練多個風格特定的 LoRA 模塊,每個模塊專注於捕捉特定風格的獨特細節。第二階段(一致性學習)在配對數據上訓練一致性模塊,動態切換不同的風格 LoRA 模塊,確保一致性模塊專注於結構和語義的一致性,避免吸收特定風格的特徵。
  • 一致性 LoRA 模塊:在條件分支中引入低秩適應(LoRA)模塊,僅對條件分支進行調整,避免干擾主網絡的風格化能力。用因果注意力機制,確保條件令牌在內部交互,主分支(噪聲和文本令牌)保持乾淨的因果建模。
  • 條件令牌映射(CTM):低分辨率條件圖像引導高分辨率生成,基於映射機制確保空間對齊,減少內存和計算開銷。
  • 特徵重用:在擴散過程中,緩存條件令牌的中間特徵,避免重複計算,提高推理效率。
  • 數據驅動的一致性學習:構建高質量的配對數據集,包含 22 種不同風格的 2,600 對圖像,基於數據驅動的方式學習語義和結構的一致性映射。

OmniConsistency的項目地址

  • GitHub倉庫:https://github.com/showlab/OmniConsistency
  • HuggingFace模型庫:https://huggingface.co/showlab/OmniConsistency
  • arXiv技術論文:https://arxiv.org/pdf/2505.18445
  • 在線體驗Demo:https://huggingface.co/spaces/yiren98/OmniConsistency

OmniConsistency的應用場景

  • 藝術創作:將各種藝術風格(如動漫、油畫、素描等)應用於圖像,幫助藝術家快速生成風格化的作品。
  • 內容生成:在內容創作中,快速生成符合特定風格的圖像,提升內容的多樣性和吸引力。
  • 廣告設計:爲廣告和營銷材料生成風格一致的圖像,提升視覺效果和品牌一致性。
  • 遊戲開發:快速生成遊戲中的風格化角色和場景,提高開發效率。
  • 虛擬現實(VR)和增強現實(AR):生成風格化的虛擬環境和元素,增強用戶體驗。
© 版權聲明

相關文章

暫無評論

暫無評論...