JoyAI-Video-Edit是什麼
JoyAI-Video-Edit是京東開源自研的實時流式視頻編輯模型,基於16B參數自迴歸擴散架構,在720P分辨率下實現30FPS推理速度,支持任意時長穩定流式編輯。用戶可通過自然語言指令在視頻播放過程中實時修改人物、場景、風格及物體,無需等待完整視頻生成。模型在OpenVE-Bench評測中超越所有流式編輯方法,各項指標全面領先,同時可爲具身智能提供大規模數據合成路徑。

JoyAI-Video-Edit的主要功能
-
實時流式編輯:視頻幀到達時即時編輯,無需預先知道完整序列。
-
開放式指令控制:支持全局風格遷移、局部對象增刪改、背景替換、動作調整及參考圖引導編輯。
-
任意時長處理:突破秒級或分鐘級限制,可持續隨視頻播放進行穩定編輯。
-
720P高吞吐部署:端到端pipeline在720×1280分辨率下達30.19 FPS。
-
多維度編輯能力:覆蓋人物換裝、場景變換、風格轉換、物體替換與字幕編輯等任務。
JoyAI-Video-Edit的技術原理
-
MLLM條件編碼器:用多模態大語言模型將自然語言指令編碼爲編輯條件,實現開放式語義控制。
-
因果視頻VAE:採用因果時序結構的變分自編碼器對視頻幀進行壓縮與重建,保證流式場景下的時序一致性。
-
16B參數MMDiT骨幹:用16B多模態擴散Transformer爲核心,融合文本與視覺特徵進行自迴歸擴散生成。
-
自迴歸分佈匹配蒸餾:通過對齊自迴歸分佈的蒸餾策略加速推理,顯著降低訓練與推理的分佈差異。
-
長時域優化與有界KV推理:引入長時域穩定性優化及有界KV緩存機制,抑制累積時序漂移並維持高吞吐量。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用JoyAI-Video-Edit
-
環境準備:創建Conda環境
python=3.10並安裝requirements.txt依賴。 -
下載權重:從Hugging Face獲取模型文件,按指定目錄結構放置檢查點。
-
啓動服務:進入
deploy目錄執行bash run_server.sh啓動本地服務器。 -
訪問界面:瀏覽器打開
http://localhost:8080進入交互式編輯界面。 -
實時編輯:上傳視頻或接入攝像頭流,輸入自然語言指令即可邊播邊改。
JoyAI-Video-Edit的核心優勢
-
實時流式編輯:視頻幀到達即處理,無需等待完整序列,實現真正的”邊播邊改”交互體驗。
-
速度與質量雙優:720P分辨率下端到端推理達30.19 FPS,在OpenVE-Bench評測中超越所有流式與離線編輯方法。
-
任意時長穩定輸出:突破傳統模型僅支持秒級或分鐘級片段的限制,可持續隨視頻播放進行無漂移穩定編輯。
-
開放式語義控制:基於MLLM條件編碼器,支持自然語言指令驅動的全局風格、局部對象、背景替換及參考圖引導等多維度編輯。
-
高效推理架構:16B參數自迴歸擴散Transformer配合分佈匹配蒸餾與有界KV緩存,顯著降低訓練推理差異並抑制時序累積誤差。
JoyAI-Video-Edit的項目地址
- GitHub倉庫:https://github.com/jd-opensource/JoyAI-Video-Edit
- HuggingFace模型庫:https://huggingface.co/jdopensource/JoyAI-Video-Edit
- arXiv技術論文:https://arxiv.org/pdf/2608.03974
JoyAI-Video-Edit的同類競品對比
| 維度 | JoyAI-Video-Edit | SANA-Streaming |
|---|---|---|
| 模型規模 | 16B參數 | 2B參數 |
| 推理速度 | 37.21 FPS (DiT) | 約54 FPS (DiT) |
| 編輯質量 | 3.60 (OpenVE-Bench) | 約2.6 |
| 編輯類型 | 開放式多維度編輯 | 流式編輯 |
| 分辨率支持 | 720P穩定輸出 | 較低分辨率爲主 |
| 時序穩定性 | 任意時長,有界KV優化 | 短片段爲主 |
JoyAI-Video-Edit的應用場景
-
短視頻創作:創作者可在視頻播放過程中實時替換人物服裝、調整場景風格,提升內容生產效率。
-
直播實時特效:主播邊播邊改背景或添加虛擬元素,實現互動式直播視覺增強。
-
家裝與室內設計:用戶在瀏覽房間視頻時實時更換傢俱、牆面材質與燈光效果,輔助裝修決策。
-
影視後期預演:導演在剪輯階段快速嘗試不同視覺風格與場景替換,降低試錯成本。
-
具身智能數據合成:將人手操作視頻轉化爲機械臂操作素材,低成本擴展機器人訓練數據規模。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...