SeFi-Image – 開源的文本到圖像模型,基於語義優先擴散

AI工具4周前發佈新公告 AI管理員
0 0

SeFi-Image是什麼

SeFi-Image 是基於語義優先擴散的文本到圖像模型,提供 1B、2B、5B 三種規格。模型將高層語義結構與紋理細節分離,讓語義流提前去噪,爲紋理生成提供清晰的結構錨點。5B 模型用 125K A800 GPU 小時訓練,在 GenEval、LongTextBench、CVTG-2K 和 OneIG 等基準上表現強勁,支持場景合成、富文本排版、動漫角色、風格多樣性及人像生成。

SeFi-Image – 開源的文本到圖像模型,基於語義優先擴散

SeFi-Image的主要功能

  • 文本到圖像生成:基於文本提示生成高質量圖像,支持自然語言描述。
  • 多規格模型:提供 1B、2B、5B 三種參數規模,適應不同算力需求。
  • 語義優先擴散:將語義結構與紋理細節分離,實現更清晰的幾何和組合控制。
  • 多領域支持:覆蓋場景合成、富文本排版、動漫角色、風格化藝術及人像生成。
  • 長文本渲染:支持中英文長文本提示,在 LongTextBench 上表現領先。

SeFi-Image的技術原理

  • 語義-紋理解耦架構:SeFi-Image 採用語義優先擴散架構,將圖像生成過程拆分爲語義流和紋理流兩條獨立的去噪軌跡。
  • 時序偏移機制:模型引入時序偏移機制,讓語義流提前一個時間步開始去噪,爲紋理生成提供清晰的結構錨點。
  • 三階段生成流程:整個生成過程分爲三個階段:第一階段進行語義初始化,第二階段實現語義與紋理的異步聯合去噪,第三階段完成紋理的精修補全。
  • 重建-生成平衡:架構在提升紋理重建保真度的同時,會增加擴散模型的訓練難度,實現重建與生成的有效平衡。

SeFi-Image – 開源的文本到圖像模型,基於語義優先擴散

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用SeFi-Image

  • 獲取資源:訪問 SeFi-Image 官網或 arXiv 頁面,下載論文、開源代碼及對應規格的模型權重文件。
  • 配置環境:在本地服務器或工作站上安裝 PyTorch 等深度學習依賴,準備與模型規模匹配的 GPU 顯存資源。
  • 加載模型:將下載的 1B、2B 或 5B 模型檢查點加載到推理框架中,完成權重初始化與參數設置。
  • 輸入提示:編寫包含場景描述、風格要求或文字內容的中英文文本提示,支持長文本與複雜組合描述。
  • 執行生成:運行語義優先擴散採樣流程,模型將先完成語義結構去噪,再基於語義錨點進行紋理細節生成。
  • 輸出圖像:將最終去噪完成的潛變量通過解碼器轉換爲像素圖像,並保存爲所需分辨率與格式的輸出文件。

SeFi-Image的核心優勢

  • 精準結構控制:語義優先機制使模型能對複雜的空間組合和文本排版實現更精準的結構控制。
  • 低訓練成本:5B 參數模型僅使用 125K A800 GPU 小時完成訓練,用較低的算力成本達到第一梯隊的生成性能。
  • 長文本領先:在長文本渲染評測中,SeFi-Image 在 LongTextBench 上取得 0.978 分,顯著領先於同類競品。
  • 視覺文本準確:模型在 CVTG-2K 字符級視覺文本生成測試中達到 0.895 的準確率,生成的海報和標籤具有高度可讀性。
  • 多基準第一:SeFi-Image 在 GenEval、OneIG-EN 等多項權威基準測試中均排名第一,展現出全面的生成能力。

SeFi-Image的項目地址

  • 項目官網:https://jmliu206.github.io/sefi-web/
  • GitHub倉庫:https://github.com/jmliu206/SeFi-Image
  • HuggingFace模型庫:https://huggingface.co/SeFi-Image
  • arXiv技術論文:https://arxiv.org/pdf/2606.22568

SeFi-Image的同類競品對比

對比維度 SeFi-Image-5B Qwen-Image
架構特點 語義優先擴散,語義流與紋理流解耦,引入時序偏移機制 常規擴散或自迴歸架構,未明確採用語義-紋理分離機制
GenEval 0.88(第一) 0.87
LongTextBench 0.978(第一) 0.945
CVTG-2K 0.895(第一) 0.829
DPG-Bench 87.27 88.32(第一)
OneIG-EN 0.5606(第一) 0.5390
OneIG-ZH 0.5379 0.5480(第一)

SeFi-Image的應用場景

  • 廣告海報設計:在廣告與海報設計領域,SeFi-Image 能生成包含清晰可讀文字的品牌海報、產品菜單和商品標籤。
  • 動漫角色創作:對於動漫與角色創作,模型支持生成動漫角色、奇幻場景以及全身或特寫等多種構圖形式。
  • 自然場景生成:在自然場景與景觀生成方面,SeFi-Image 可創作天氣、城市、動物及自由寬高比的風景圖像。
  • 藝術風格創作:模型支持插畫、水墨、毛絨玩具、貼紙、素描等多種藝術風格,適用於風格化視覺內容創作。
  • 人像攝影輔助:在人像與攝影輔助場景中,SeFi-Image 能生成具有多樣光照、姿態和材質的人像及環境肖像。
© 版權聲明

相關文章

暫無評論

暫無評論...