InstanceAssemble是什麼
InstanceAssemble 是小紅書與復旦大學聯合推出的輕量級的佈局到圖像生成框架。框架通過創新的“實例組裝注意力”機制,實現從簡單到複雜、從稀疏到密集佈局的精準圖像生成。用戶只需提供物體的邊界框位置和內容描述,AI 能在對應位置生成符合語義的圖像。InstanceAssemble 基於擴散變換器架構,採用輕量級適配方式,僅需少量額外參數能適配主流模型,大幅降低使用門檻。

InstanceAssemble的主要功能
-
精準佈局控制:通過指定每個物體的位置(邊界框)和內容描述,讓 AI 在對應位置生成符合語義的圖像內容。
-
從簡單到複雜的佈局生成:對簡單的幾個物體和複雜、密集的場景,InstanceAssemble 能保持高精度的佈局對齊和語義一致性。
-
多模態內容控制:支持通過文本描述、參考圖像、深度圖、邊緣圖等多種模態來定義每個實例的內容,進一步提升生成圖像的準確性和細節表現。
-
輕量級適配:無需重新訓練整個模型,僅通過少量額外參數(如適配 Stable Diffusion 3-Medium 模型僅需約 3.46% 的額外參數),適配多種主流擴散模型,降低使用門檻。
-
強大的泛化能力:在訓練時僅使用稀疏佈局(≤10 個實例),能在密集佈局(≥10 個實例)上保持穩健性能,適應不同複雜度的佈局條件。
InstanceAssemble的技術原理
-
擴散模型基礎:InstanceAssemble 基於當前主流的擴散變換器架構(如 Multimodal Diffusion Transformer, MMDiT),用擴散模型的強大生成能力,通過逐步去噪的過程生成高質量圖像。
-
實例組裝注意力機制:
-
佈局編碼器(Layout Encoder):將用戶提供的佈局條件(如邊界框、文本描述等)編碼爲實例令牌(instance tokens)。對於每個實例,結合其位置信息(通過 DenseSample 增強)和內容描述(文本或視覺內容),生成對應的實例令牌。
-
組裝注意力模塊(Assemble-Attn):在生成過程中,將圖像令牌(image tokens)與實例令牌進行交互。對於每個實例,僅關注邊界框內的圖像區域,通過注意力機制更新區域特徵。通過加權組裝的方式將更新後的特徵融合到整體圖像中,確保每個實例的佈局和語義一致性。
-
級聯結構:採用級聯機制,通過基礎的 MMDiT 模型處理全局文本提示和圖像特徵,再通過 Assemble-MMDiT 模塊處理實例佈局條件,在保持全局生成質量的同時實現精準佈局控制。
-
-
輕量級適配(LoRA):爲高效適配現有擴散模型,InstanceAssemble 使用低秩適配(LoRA)技術,僅在注意力模塊中引入少量可訓練參數(如低秩矩陣),在不改變基礎模型能力的前提下,實現佈局控制功能。
-
評估與基準測試:爲更準確地衡量佈局與圖像的匹配程度,InstanceAssemble 提出“佈局錨定分數”(Layout Grounding Score, LGS)評估指標,創建了包含 5000 張圖像和 90000 個實例的“DenseLayout”基準測試集,用於評估複雜佈局條件下的生成性能。
InstanceAssemble的項目地址
- GitHub倉庫:https://github.com/FireRedTeam/InstanceAssemble
- arXiv技術論文:https://arxiv.org/pdf/2509.16691
InstanceAssemble的應用場景
-
設計與廣告:幫助設計師和廣告公司快速生成符合特定佈局和風格的設計草圖或廣告畫面,精準控制元素位置和內容。
-
內容創作:爲內容創作者提供高質量圖像生成工具,用於社交媒體、視頻製作等,提升內容吸引力和專業性。
-
遊戲開發:框架能快速生成遊戲場景和角色裝備佈局,助力遊戲開發者高效設計逼真的背景和關卡。
-
教育與培訓:框架能生成教學材料和虛擬實驗室場景,幫助教師更直觀地傳達知識,提升教學效果。
-
建築設計:輔助室內設計師和建築師生成室內空間和建築外觀的佈局圖與效果圖,優化設計方案。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...