JoyAI-Video-Edit – 京東開源的實時流式視頻編輯模型

AI工具3周前發佈新公告 AI管理員
0 0

JoyAI-Video-Edit是什麼

JoyAI-Video-Edit是京東開源自研的實時流式視頻編輯模型,基於16B參數自迴歸擴散架構,在720P分辨率下實現30FPS推理速度,支持任意時長穩定流式編輯。用戶可通過自然語言指令在視頻播放過程中實時修改人物、場景、風格及物體,無需等待完整視頻生成。模型在OpenVE-Bench評測中超越所有流式編輯方法,各項指標全面領先,同時可爲具身智能提供大規模數據合成路徑。

JoyAI-Video-Edit – 京東開源的實時流式視頻編輯模型

JoyAI-Video-Edit的主要功能

  • 實時流式編輯:視頻幀到達時即時編輯,無需預先知道完整序列。
  • 開放式指令控制:支持全局風格遷移、局部對象增刪改、背景替換、動作調整及參考圖引導編輯。
  • 任意時長處理:突破秒級或分鐘級限制,可持續隨視頻播放進行穩定編輯。
  • 720P高吞吐部署:端到端pipeline在720×1280分辨率下達30.19 FPS。
  • 多維度編輯能力:覆蓋人物換裝、場景變換、風格轉換、物體替換與字幕編輯等任務。

JoyAI-Video-Edit的技術原理

  • MLLM條件編碼器:用多模態大語言模型將自然語言指令編碼爲編輯條件,實現開放式語義控制。
  • 因果視頻VAE:採用因果時序結構的變分自編碼器對視頻幀進行壓縮與重建,保證流式場景下的時序一致性。
  • 16B參數MMDiT骨幹:用16B多模態擴散Transformer爲核心,融合文本與視覺特徵進行自迴歸擴散生成。
  • 自迴歸分佈匹配蒸餾:通過對齊自迴歸分佈的蒸餾策略加速推理,顯著降低訓練與推理的分佈差異。
  • 長時域優化與有界KV推理:引入長時域穩定性優化及有界KV緩存機制,抑制累積時序漂移並維持高吞吐量。

JoyAI-Video-Edit – 京東開源的實時流式視頻編輯模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用JoyAI-Video-Edit

  • 環境準備:創建Conda環境python=3.10並安裝requirements.txt依賴。
  • 下載權重:從Hugging Face獲取模型文件,按指定目錄結構放置檢查點。
  • 啓動服務:進入deploy目錄執行bash run_server.sh啓動本地服務器。
  • 訪問界面:瀏覽器打開http://localhost:8080進入交互式編輯界面。
  • 實時編輯:上傳視頻或接入攝像頭流,輸入自然語言指令即可邊播邊改。

JoyAI-Video-Edit的核心優勢

  • 實時流式編輯:視頻幀到達即處理,無需等待完整序列,實現真正的”邊播邊改”交互體驗。
  • 速度與質量雙優:720P分辨率下端到端推理達30.19 FPS,在OpenVE-Bench評測中超越所有流式與離線編輯方法。
  • 任意時長穩定輸出:突破傳統模型僅支持秒級或分鐘級片段的限制,可持續隨視頻播放進行無漂移穩定編輯。
  • 開放式語義控制:基於MLLM條件編碼器,支持自然語言指令驅動的全局風格、局部對象、背景替換及參考圖引導等多維度編輯。
  • 高效推理架構:16B參數自迴歸擴散Transformer配合分佈匹配蒸餾與有界KV緩存,顯著降低訓練推理差異並抑制時序累積誤差。

JoyAI-Video-Edit的項目地址

  • GitHub倉庫:https://github.com/jd-opensource/JoyAI-Video-Edit
  • HuggingFace模型庫:https://huggingface.co/jdopensource/JoyAI-Video-Edit
  • arXiv技術論文:https://arxiv.org/pdf/2608.03974

JoyAI-Video-Edit的同類競品對比

維度 JoyAI-Video-Edit SANA-Streaming
模型規模 16B參數 2B參數
推理速度 37.21 FPS (DiT) 約54 FPS (DiT)
編輯質量 3.60 (OpenVE-Bench) 約2.6
編輯類型 開放式多維度編輯 流式編輯
分辨率支持 720P穩定輸出 較低分辨率爲主
時序穩定性 任意時長,有界KV優化 短片段爲主

JoyAI-Video-Edit的應用場景

  • 短視頻創作:創作者可在視頻播放過程中實時替換人物服裝、調整場景風格,提升內容生產效率。
  • 直播實時特效:主播邊播邊改背景或添加虛擬元素,實現互動式直播視覺增強。
  • 家裝與室內設計:用戶在瀏覽房間視頻時實時更換傢俱、牆面材質與燈光效果,輔助裝修決策。
  • 影視後期預演:導演在剪輯階段快速嘗試不同視覺風格與場景替換,降低試錯成本。
  • 具身智能數據合成:將人手操作視頻轉化爲機械臂操作素材,低成本擴展機器人訓練數據規模。
© 版權聲明

相關文章

暫無評論

暫無評論...