BLIP3-o – Salesforce Research等機構推出的多模態模型

AI工具1年前 (2025)發佈新公告 AI管理員
0 0

BLIP3-o是什麼

BLIP3-o是Salesforce Research等機構推出的創新多模態模型,融合自迴歸模型的推理和指令遵循能力及擴散模型的強大生成能力。模型基於擴散語義豐富的CLIP圖像特徵,不依靠傳統的VAE特徵或原始像素,在圖像理解和生成方面表現出色。BLIP3-o用一種順序預訓練策略,先進行圖像理解訓練,再進行圖像生成訓練,保留圖像理解能力發展強大的圖像生成能力。模型在多個圖像理解和生成基準測試中取得優異的成績,且完全開源,包括代碼、模型權重、預訓練和指令調整數據集。

BLIP3-o – Salesforce Research等機構推出的多模態模型

BLIP3-o的主要功能

  • 文本到文本:生成與圖像相關的描述性文本。
  • 圖像到文本:對輸入的圖像進行理解生成描述性文本,支持多種圖像理解任務,如視覺問答(VQA)和圖像分類。
  • 文本到圖像:根據輸入的文本描述生成高質量的圖像。
  • 圖像到圖像:對輸入的圖像進行編輯和修改,生成新的圖像。
  • 混合訓練:支持圖像生成和理解任務的混合訓練,提高模型的綜合性能。

BLIP3-o的技術原理

  • 自迴歸模型與擴散模型的結合:自迴歸模型生成中間視覺特徵,捕捉文本描述中的語義信息。擴散模型生成最終的圖像。擴散模型基於逐步去除噪聲生成圖像,生成高質量且多樣化的圖像。
  • CLIP特徵擴散:用CLIP模型對圖像進行編碼,生成語義豐富的特徵向量。特徵向量比傳統的VAE特徵更緊湊且信息量更大。基於擴散模型對CLIP特徵進行建模,生成與目標圖像特徵相似的特徵向量,實現高質量的圖像生成。
  • 順序預訓練策略:首先對模型進行圖像理解任務的預訓練,確保模型具備強大的圖像理解能力。在圖像理解預訓練的基礎上,凍結自迴歸模型的權重,僅對擴散模型進行訓練,實現高效的圖像生成。
  • 流匹配損失函數:用流匹配損失函數訓練擴散模型,損失函數能更好地捕捉圖像特徵的分佈,生成更高質量的圖像。流匹配損失函數引入隨機性,讓模型能生成多樣化的圖像,不僅僅是單一的輸出。
  • 指令調整數據集:基於GPT-4o生成的多樣化提示,創建一個包含60k高質量提示圖像對的數據集,用在微調模型,提高指令遵循能力和視覺審美質量。

BLIP3-o的項目地址

  • GitHub倉庫:https://github.com/JiuhaiChen/BLIP3o
  • HuggingFace模型庫:https://huggingface.co/BLIP3o
  • arXiv技術論文:https://arxiv.org/pdf/2505.09568

BLIP3-o的應用場景

  • 圖像生成與編輯:根據文本描述生成或修改圖像,輔助設計和創意工作。
  • 視覺問答:理解圖像內容並回答相關問題,可用於教育和智能客服。
  • 多模態對話:結合圖像和文本進行對話,提升交互體驗。
  • 圖像標註與分類:自動生成圖像標籤和進行分類,優化圖像管理。
  • 藝術與創意:生成藝術圖像,激發創作靈感,滿足個性化需求。
© 版權聲明

相關文章

暫無評論

暫無評論...