LTX-2.5是什麼
LTX-2.5 是 LTX 開源的 AI 視頻生成基礎模型,擁有 22B 參數,發佈即開放權重。模型支持原生多鏡頭生成、4K HDR 與 RAW/EXR 專業工作流,可同步生成音頻,具備精確視頻編輯能力。在閉源模型日益高價化的當下,LTX-2.5 以開放生態策略爲 AI 視頻領域提供專業級的開源替代方案。

LTX-2.5的主要功能
- 原生多鏡頭生成:單次生成即可輸出多個不同機位和景別的連續鏡頭,在鏡頭切換間保持角色形象、環境氛圍、光線條件和聲音的高度一致,解決 AI 劇情創作中鏡頭連續性的核心痛點。
- 擴散保真渲染:根據場景複雜度自適應分配渲染算力,複雜動態鏡頭獲得更多計算資源,靜態或簡單場景則自動節省,在保障畫質的同時提升整體效率。
- 精確視頻編輯:在保留原始實拍素材運動軌跡與空間結構的基礎上,進行高精度的風格改寫、場景重繪與角色替換,實現”實拍骨架 + AI 風格化覆膜”的可控創作。
- 自動時長預測:內置 Duration Head 模塊,讀取提示詞中的動作描述後自動判斷最合適的片段長度,無需創作者反覆試驗。
- 專業級輸出格式:支持原生 4K HDR、RAW 與 EXR 無損格式輸出,可直接接入專業影視調色、特效合成與後期剪輯管線。
- 同步音頻生成:通過獨立 Audio VAE 模塊,爲視頻同步生成匹配的聲音軌道。
- IC-LoRA 精確控制:提供 Canny 邊緣、Depth 深度、Pose 姿態三種參考視頻控制模式,讓生成結果嚴格遵循參考素材的構圖、空間結構或人物動作。
LTX-2.5的技術原理
- Gemma 4 12B 文本編碼器:Lightricks 專爲 LTX 定製的大語言模型編碼器,能夠完整保留複雜長提示中的多主體關係、動作細節、光照描述和鏡頭方向,不會因提示變長而丟失子句信息。
- Prompt Enhancer:一個輕量級輔助模型,自動將用戶輸入的簡短提示擴展爲詳細的電影級指令,降低提示詞工程門檻,且計算開銷極低。
- Diffusion Video Decoder:替代傳統 VAE 解碼器的新架構,專門針對快速運動場景優化,顯著減少畫面塗抹和僞影,使人臉更清晰、文字更可讀。
- Audio VAE:獨立的音頻潛空間編碼器,負責將視頻內容映射爲匹配的音頻表徵,實現畫面與聲音的同步生成。
- Diffusion Fidelity Rendering:採用”先結構後細節”的兩階段渲染策略。第一階段在 8× 時間壓縮的潛空間中構建運動、構圖和鏡頭框架,並自適應生成高保真關鍵幀;第二階段從結構和關鍵幀共同擴散渲染出最終視頻,以像素級精度解析紋理、材質和麪部細節。
- Duration Head:部署在擴散過程之前的預測模塊,通過理解提示詞中的動作語義,自動推斷並輸出最合適的視頻時長,使模型具備對敘事節奏的初步感知能力。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用LTX-2.5
-
選擇路徑:決定使用 API 雲服務或 ComfyUI 本地部署。
-
API 接入:在 LTX 官網申請 API Key,選擇 Fast或 Pro檔位調用接口。
-
安裝節點:本地部署需更新 ComfyUI 至最新版,並通過 Manager 安裝
ComfyUI-LTXVideo節點包。 -
下載模型:在 ComfyUI 模板瀏覽器搜索 “LTX-2.5″,選擇對應工作流後一鍵下載所有模型文件。
-
配置參數:設置寬高爲 32 的倍數、幀數爲 1+8 的倍數、幀率 24/25/48/50fps,基礎分辨率設爲目標的一半以啓用 2× 放大。
-
撰寫提示詞:用一段連貫散文描述鏡頭景別、場景光照、角色動作、相機運動和音頻,避免標籤堆疊或權重語法。
-
執行生成:點擊運行,文生視頻直接出片,圖生視頻需上傳首幀,首尾幀模式需上傳首幀與尾幀。
-
精確控制:進階用戶可加載 Canny、Depth 或 Pose 模式的 IC-LoRA,接入參考視頻實現構圖或動作鎖定。
-
模型選擇:快速迭代用 distilled 模型,最終出片用完整 dev 模型以獲得更細膩的細節。
LTX-2.5的核心優勢
- 敘事連貫性:原生 Multishot 多鏡頭生成能力,單次輸出可保持角色形象、環境氛圍、光線條件和聲音的高度一致,從根本上解決 AI 劇情創作中鏡頭連續性的最大痛點。
- 可控性躍升:精確視頻編輯保留原始實拍素材的運動軌跡與空間結構,配合 Canny/Depth/Pose 三種 IC-LoRA 控制模式,實現從”盲目抽卡”到”實拍骨架 + AI 風格化覆膜”的可控生產轉變。
- 工業級工作流:原生 RAW/HDR/EXR 輸出可直接接入專業調色、特效合成與後期剪輯管線,無需壓縮轉碼,滿足影視工業對無損素材的剛性需求。
- 自適應效率:Diffusion Fidelity Rendering 技術按場景複雜度動態分配渲染算力,複雜動態鏡頭精細渲染、靜態簡單場景自動節省資源,在保障像素級畫質的同時提升整體生成效率。
LTX-2.5的項目地址
- 項目官網:https://ltx.io/model/ltx-2-5
- HuggingFace模型庫:https://huggingface.co/Lightricks/LTX-2.5
LTX-2.5的同類競品對比
| 對比維度 | LTX-2.5 | Minimax H3 |
|---|---|---|
| 出品方 | Lightricks(以色列) | MiniMax(中國) |
| 發佈時間 | 2026 年 8 月 | 2026 年 8 月 |
| 開放程度 | 22B 權重完全開源,可本地部署與微調 | 權重部分區域開放(排除美/英/歐/韓),不支持本地微調 |
| 參數規模 | 22B(公開) | 未公開 |
| 最大分辨率 | 4K (3840×2160) | 2K(固定) |
| 最大時長 | 20 秒 | 10 秒 |
| 原生多鏡頭 | ✅ 支持 | ❌ 不支持 |
| 同步音頻 | ✅ 支持 | ❌ 未開放 |
| 輸入模式 | 文本 / 圖像 / 音頻 | 文本 / 圖像 |
| 輸出格式 | 4K HDR、RAW、EXR 無損 | 常規壓縮格式 |
| 可控性 | 精確視頻編輯 + IC-LoRA(Canny/Depth/Pose) | 主要依賴提示詞驅動 |
LTX-2.5的應用場景
- 專業影視後期:原生 4K HDR、RAW 與 EXR 無損輸出可直接接入調色、特效合成與剪輯管線,滿足院線及流媒體級別的後期製作需求,無需忍受壓縮 MP4 的調色噩夢。
- AI 短劇與漫劇:Multishot 多鏡頭生成一次性輸出連貫敘事分鏡,精確視頻編輯支持”真人實拍動作骨架 + AI 角色替換與風格化覆膜”,從根本上解決鏡頭連續性與動作可控性兩大死穴。
- 廣告與品牌內容:快速迭代高質量商業視頻,利用 Prompt Enhancer 降低提示詞工程門檻,Distilled 模型支持快速預覽,完整模型輸出最終成片,兼顧效率與品質。
- 物理 AI 與機器人:Physical AI Checkpoint 爲具身智能團隊提供世界模型基礎,幫助機器人系統感知物理世界和運動規律,超越純內容創作範疇。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...