Seaweed-7B – 字節推出的視頻生成模型

AI工具1年前 (2025)發佈新公告 AI管理員
0 0

Seaweed-7B是什麼

Seaweed-7B 是字節跳動團隊推出的視頻生成模型,擁有約 70 億參數。Seaweed-7B具備強大的視頻生成能力。模型支持從文本描述、圖像或音頻生成高質量的視頻內容,支持多種分辨率和時長,廣泛應用於視頻創作、動畫生成、實時交互等場景。Seaweed-7B設計注重成本效益,基於優化訓練策略和架構,讓中等規模模型在性能上與大型模型相媲美,降低計算成本。

Seaweed-7B – 字節推出的視頻生成模型

Seaweed-7B的主要功能

  • 文本到視頻:根據文本描述生成與之匹配的視頻內容,支持複雜的動作和場景。
  • 圖像到視頻:用圖像作爲第一幀,生成與之風格一致的視頻,或指定第一幀和最後一幀生成過渡視頻。
  • 音頻驅動視頻生成:根據音頻輸入生成匹配的視頻內容,確保口型和動作與音頻同步。
  • 長鏡頭生成:支持生成長達 20 秒的單鏡頭視頻,或基於擴展技術生成長達一分鐘的視頻。
  • 連貫的故事敘述:生成多鏡頭長視頻,維持場景和鏡頭之間的連貫性。
  • 實時生成:支持在 1280×720 分辨率和 24fps 下實時生成視頻。
  • 高分辨率和超分辨率:支持生成高達 1280×720 分辨率的視頻,基於進一步上採樣到 2K QHD 分辨率。
  • 相機控制和世界探索:支持用定義的軌跡進行精確的相機控制,提供互動式世界探索功能。
  • 物理一致性增強:基於計算機生成的合成視頻進行後訓練,增強視頻生成的物理一致性和 3D 效果。

Seaweed-7B的技術原理

  • 變分自編碼器(VAE):將視頻數據壓縮到低維潛在空間,從潛在空間重建原始視頻。基於因果 3D 卷積架構,支持圖像和視頻的統一編碼,避免邊界閃爍問題。基於混合分辨率訓練(如 256×256、512×512 等)提高高分辨率視頻的重建質量。
  • 擴散變換器(DiT):在 VAE 的潛在空間中生成視頻內容,逐步去噪生成高質量視頻。用混合流結構,結合全注意力和窗口注意力機制,提高訓練效率和生成質量。用多模態旋轉位置編碼(MM-RoPE)增強文本和視頻之間的位置信息融合。
  • 多階段訓練策略:從低分辨率圖像開始逐步過渡到高分辨率視頻,優化 GPU 資源分配。包括預訓練階段(僅圖像、圖像+視頻)和後訓練階段(監督微調、人類反饋強化學習)。
  • 優化技術:多級激活檢查點(MLAC)減少 GPU 內存佔用和計算開銷。融合 CUDA 內核優化 I/O 操作,提高訓練和推理效率。擴散蒸餾技術減少生成所需的函數評估次數(NFE),加速推理過程。
  • 數據處理:用高質量視頻數據,基於時間分割、空間裁剪、質量過濾等方法進行數據清洗。用合成視頻數據增強訓練數據的多樣性和物理一致性。生成詳細的視頻字幕增強模型的文本理解能力。

Seaweed-7B的項目地址

  • 項目官網:https://seaweed.video/
  • 技術論文:https://seaweed.video/seaweed.pdf

Seaweed-7B的應用場景

  • 內容創作:根據文本或圖像生成高質量視頻,適用於廣告、電影、短視頻等,支持多種風格和場景。
  • 實時交互:支持實時視頻生成,用在虛擬現實(VR)和增強現實(AR),提供沉浸式體驗。
  • 多媒體娛樂:根據音頻生成匹配視頻,適用音樂視頻和有聲讀物。
  • 教育與培訓:生成教育視頻和模擬訓練場景,用在科學實驗、歷史重現、軍事訓練等。
  • 廣告與營銷:生成個性化廣告和品牌宣傳視頻,提高吸引力和轉化率。
© 版權聲明

相關文章

暫無評論

暫無評論...