LTX-2.5 – LTX 開源的 AI 視頻生成基礎模型

AI工具4周前發佈新公告 AI管理員
0 0

LTX-2.5是什麼

LTX-2.5 是  LTX  開源的 AI 視頻生成基礎模型,擁有 22B 參數,發佈即開放權重。模型支持原生多鏡頭生成、4K HDR 與 RAW/EXR 專業工作流,可同步生成音頻,具備精確視頻編輯能力。在閉源模型日益高價化的當下,LTX-2.5 以開放生態策略爲 AI 視頻領域提供專業級的開源替代方案。

LTX-2.5 –  LTX 開源的 AI 視頻生成基礎模型

LTX-2.5的主要功能

  • 原生多鏡頭生成:單次生成即可輸出多個不同機位和景別的連續鏡頭,在鏡頭切換間保持角色形象、環境氛圍、光線條件和聲音的高度一致,解決 AI 劇情創作中鏡頭連續性的核心痛點。
  • 擴散保真渲染:根據場景複雜度自適應分配渲染算力,複雜動態鏡頭獲得更多計算資源,靜態或簡單場景則自動節省,在保障畫質的同時提升整體效率。
  • 精確視頻編輯:在保留原始實拍素材運動軌跡與空間結構的基礎上,進行高精度的風格改寫、場景重繪與角色替換,實現”實拍骨架 + AI 風格化覆膜”的可控創作。
  • 自動時長預測:內置 Duration Head 模塊,讀取提示詞中的動作描述後自動判斷最合適的片段長度,無需創作者反覆試驗。
  • 專業級輸出格式:支持原生 4K HDR、RAW 與 EXR 無損格式輸出,可直接接入專業影視調色、特效合成與後期剪輯管線。
  • 同步音頻生成:通過獨立 Audio VAE 模塊,爲視頻同步生成匹配的聲音軌道。
  • IC-LoRA 精確控制:提供 Canny 邊緣、Depth 深度、Pose 姿態三種參考視頻控制模式,讓生成結果嚴格遵循參考素材的構圖、空間結構或人物動作。

LTX-2.5的技術原理

  • Gemma 4 12B 文本編碼器:Lightricks 專爲 LTX 定製的大語言模型編碼器,能夠完整保留複雜長提示中的多主體關係、動作細節、光照描述和鏡頭方向,不會因提示變長而丟失子句信息。
  • Prompt Enhancer:一個輕量級輔助模型,自動將用戶輸入的簡短提示擴展爲詳細的電影級指令,降低提示詞工程門檻,且計算開銷極低。
  • Diffusion Video Decoder:替代傳統 VAE 解碼器的新架構,專門針對快速運動場景優化,顯著減少畫面塗抹和僞影,使人臉更清晰、文字更可讀。
  • Audio VAE:獨立的音頻潛空間編碼器,負責將視頻內容映射爲匹配的音頻表徵,實現畫面與聲音的同步生成。
  • Diffusion Fidelity Rendering:採用”先結構後細節”的兩階段渲染策略。第一階段在 8× 時間壓縮的潛空間中構建運動、構圖和鏡頭框架,並自適應生成高保真關鍵幀;第二階段從結構和關鍵幀共同擴散渲染出最終視頻,以像素級精度解析紋理、材質和麪部細節。
  • Duration Head:部署在擴散過程之前的預測模塊,通過理解提示詞中的動作語義,自動推斷並輸出最合適的視頻時長,使模型具備對敘事節奏的初步感知能力。

LTX-2.5 –  LTX 開源的 AI 視頻生成基礎模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用LTX-2.5

  • 選擇路徑:決定使用 API 雲服務或 ComfyUI 本地部署。
  • API 接入:在 LTX 官網申請 API Key,選擇 Fast或 Pro檔位調用接口。
  • 安裝節點:本地部署需更新 ComfyUI 至最新版,並通過 Manager 安裝 ComfyUI-LTXVideo 節點包。
  • 下載模型:在 ComfyUI 模板瀏覽器搜索 “LTX-2.5″,選擇對應工作流後一鍵下載所有模型文件。
  • 配置參數:設置寬高爲 32 的倍數、幀數爲 1+8 的倍數、幀率 24/25/48/50fps,基礎分辨率設爲目標的一半以啓用 2× 放大。
  • 撰寫提示詞:用一段連貫散文描述鏡頭景別、場景光照、角色動作、相機運動和音頻,避免標籤堆疊或權重語法。
  • 執行生成:點擊運行,文生視頻直接出片,圖生視頻需上傳首幀,首尾幀模式需上傳首幀與尾幀。
  • 精確控制:進階用戶可加載 Canny、Depth 或 Pose 模式的 IC-LoRA,接入參考視頻實現構圖或動作鎖定。
  • 模型選擇:快速迭代用 distilled 模型,最終出片用完整 dev 模型以獲得更細膩的細節。

LTX-2.5的核心優勢

  • 敘事連貫性:原生 Multishot 多鏡頭生成能力,單次輸出可保持角色形象、環境氛圍、光線條件和聲音的高度一致,從根本上解決 AI 劇情創作中鏡頭連續性的最大痛點。
  • 可控性躍升:精確視頻編輯保留原始實拍素材的運動軌跡與空間結構,配合 Canny/Depth/Pose 三種 IC-LoRA 控制模式,實現從”盲目抽卡”到”實拍骨架 + AI 風格化覆膜”的可控生產轉變。
  • 工業級工作流:原生 RAW/HDR/EXR 輸出可直接接入專業調色、特效合成與後期剪輯管線,無需壓縮轉碼,滿足影視工業對無損素材的剛性需求。
  • 自適應效率:Diffusion Fidelity Rendering 技術按場景複雜度動態分配渲染算力,複雜動態鏡頭精細渲染、靜態簡單場景自動節省資源,在保障像素級畫質的同時提升整體生成效率。

LTX-2.5的項目地址

  • 項目官網:https://ltx.io/model/ltx-2-5
  • HuggingFace模型庫:https://huggingface.co/Lightricks/LTX-2.5

LTX-2.5的同類競品對比

對比維度 LTX-2.5 Minimax H3
出品方 Lightricks(以色列) MiniMax(中國)
發佈時間 2026 年 8 月 2026 年 8 月
開放程度 22B 權重完全開源,可本地部署與微調 權重部分區域開放(排除美/英/歐/韓),不支持本地微調
參數規模 22B(公開) 未公開
最大分辨率 4K (3840×2160) 2K(固定)
最大時長 20 秒 10 秒
原生多鏡頭 ✅ 支持 ❌ 不支持
同步音頻 ✅ 支持 ❌ 未開放
輸入模式 文本 / 圖像 / 音頻 文本 / 圖像
輸出格式 4K HDR、RAW、EXR 無損 常規壓縮格式
可控性 精確視頻編輯 + IC-LoRA(Canny/Depth/Pose) 主要依賴提示詞驅動

LTX-2.5的應用場景

  • 專業影視後期:原生 4K HDR、RAW 與 EXR 無損輸出可直接接入調色、特效合成與剪輯管線,滿足院線及流媒體級別的後期製作需求,無需忍受壓縮 MP4 的調色噩夢。
  • AI 短劇與漫劇:Multishot 多鏡頭生成一次性輸出連貫敘事分鏡,精確視頻編輯支持”真人實拍動作骨架 + AI 角色替換與風格化覆膜”,從根本上解決鏡頭連續性與動作可控性兩大死穴。
  • 廣告與品牌內容:快速迭代高質量商業視頻,利用 Prompt Enhancer 降低提示詞工程門檻,Distilled 模型支持快速預覽,完整模型輸出最終成片,兼顧效率與品質。
  • 物理 AI 與機器人:Physical AI Checkpoint 爲具身智能團隊提供世界模型基礎,幫助機器人系統感知物理世界和運動規律,超越純內容創作範疇。
© 版權聲明

相關文章

暫無評論

暫無評論...