EchoWM – 京東開源的交互式視聽世界模型

AI工具3周前發佈新公告 AI管理員
0 0

EchoWM是什麼

EchoWM 是京東探索研究院開源的交互式視聽世界模型。模型延續JoyAI-Echo的原生音視頻生成能力,讓用戶以第一/第三人稱視角在AI生成的世界中實時移動探索,畫面、空間關係與環境音、語音持續同步且長時間不跑偏。模型採用統一相機意圖接口與世界數據引擎訓練,WBench導航評測平均分81.7位列第一。

EchoWM – 京東開源的交互式視聽世界模型

EchoWM的主要功能

  • 實時可探索世界生成:用戶可通過WASD方向鍵在AI生成的場景中自由移動、轉身、折返,世界隨操作實時展開。
  • 原生音視頻聯合生成:在同一框架內同步生成720p視頻與環境音、音樂、人物語音,聲音隨畫面變化自然延續。
  • 第一/第三人稱雙視角控制:第一人稱下鏡頭即觀察者移動,第三人稱下鏡頭自動跟隨人物、車輛等主體運動。
  • 多輪長時程延續:用上一段末尾的音視頻作爲下一輪上下文,多輪操作後場景佈局、主體外觀與聲音依然連貫。
  • WBench導航評測第一:158個案例中平均得分81.7,一致性與交互性指標均居前列。

EchoWM的技術原理

  • 統一相機意圖接口:將離散的鍵盤指令映射爲相對初始位姿的連續6-DoF軌跡,用同一套接口描述鏡頭如何移動;第一人稱下它直接表示觀察者運動,第三人稱下由模型從數據中學習”主體移動—鏡頭跟隨”的耦合關係,無需額外的角色軌跡或相機預設參數,且軌跡僅注入視頻分支,音頻隨畫面聯動。
  • 世界數據引擎:整合四類互補數據源,內部採集gameplay、人類實玩錄像、UE仿真、普通互聯網視頻;再用軌跡最大平移幅度的第90百分位數爲全局”尺子”統一歸一化,保留不同軌跡間的相對位移差異,避免分段定標帶來的速度突變。
  • 漸進式四階段訓練:第一階段用AV-rich數據做音視頻持續預訓練打底;第二階段凍結骨幹、只訓練輕量軌跡分支強化控制響應;第三階段用兼具控制可靠性與視聽質量的數據低學習率聯合微調;第四階段自迴歸後訓練,通過Teacher Forcing改造爲因果分塊生成,結合短時程Self-Gradient Forcing讓模型適應自己生成的歷史,再用分佈匹配蒸餾壓縮爲四步採樣,配合sink-plus-FIFO緩存機制在控制KV成本的同時支撐長時程流式交互。

EchoWM – 京東開源的交互式視聽世界模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用EchoWM

  • 克隆倉庫:git clone 下載 github.com/jd-opensource/JoyAI-Echo,進入 echo_wm/ 目錄(與長視頻項目 echo_longvideo/ 相互獨立)。
  • 創建環境:conda create -n echo-wm python=3.11 創建獨立環境並激活。
  • 安裝依賴:先裝 PyTorch 2.9.1(cu128),再 pip install -r requirements.txt,並用 torch.cuda.is_available() 驗證顯卡可用。
  • 下載模型權重:用 hf download Echo-Team/Echo-WM 下載模型 checkpoint;另需下載 Gemma 3 文本編碼器(gated 倉庫,需先在 HF 頁面接受許可並 hf auth login)。
  • 跑官方示例驗證:運行 scripts/run_wm_case.py --case examples/wm_cases/0010 等內置完整案例,確認環境配置無誤。
  • 自定義生成:運行 inference_wm.py,傳入首幀圖片 + 六字段提示詞+ 動作串(Action DSL)即可輸出帶聲音的視頻。
  • 編寫動作指令:用 Action DSL 描述相機運動,格式爲 <按鍵>-<幀數>,逗號連接,如 w-60,a-60 表示前進60幀後左移60幀,支持 w/s/a/d/i/j/k 組合。

EchoWM的核心優勢

  • 視聽一體化:在同一框架內原生聯合生成720p視頻與環境音、音樂、語音,聲音隨畫面場景和事件同步變化,解決了多數世界模型”只出畫面不出聲”的問題。
  • 統一控制接口:用一套相對6-DoF軌跡同時驅動第一人稱觀察者移動和第三人稱鏡頭跟隨主體,無需爲不同視角單獨設計控制器。
  • 長時程連貫:通過自迴歸後訓練與sink-plus-FIFO緩存機制,用戶可基於上一輪末尾音視頻上下文繼續多輪探索,場景、主體與聲音長時間不跑偏。
  • 評測領先:WBench Navigation評測平均分81.7位列第一,用戶研究整體偏好顯著優於LingBot-World-v2和HappyOyster。

JoyAI-EchoWM的項目地址

  • 項目官網:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
  • GitHub倉庫:https://github.com/jd-opensource/JoyAI-Echo
  • arXiv技術論文:https://arxiv.org/pdf/2608.23189

EchoWM的同類競品對比

對比維度 EchoWM(京東) HappyOyster
產品定位 可進入的全模態世界模型 音視頻聯合生成 + 實時交互模型
交互模式 第一人稱 + 第三人稱雙視角 導演模式 + 第一人稱漫遊模式
控制方式 統一相機意圖接口(6-DoF 軌跡,WASD 映射) 視角與動作控制(具體接口公開信息有限)
音視頻生成 原生聯合生成 720p 視頻 + 環境音/音樂/語音 支持音視頻聯合生成
長時程能力 多輪延續 + 自迴歸後訓練,長時程一致性突出 支持交互式生成,長時程細節公開較少
WBench 平均分 81.7(第1) 76.8
用戶研究(整體偏好) 63.13% 27.06%

EchoWM的應用場景

  • 遊戲原型開發:創作者進入生成場景試玩,驗證空間佈局、路線設計與鏡頭體驗後再決定製作方向。
  • 互動敘事:劇情按用戶選擇分支推進並持續生成,替代傳統預製素材,用於互動劇、互動小說。
  • 沉浸式內容:影視與廣告內容從”觀看”變爲”進入”,觀衆可自由探索畫面中的世界。
  • 虛擬遊覽:博物館、景區、房產等場景的低成本數字化漫遊,無需逐幀建模。
  • 數字人表演:人物語音、動作與周圍動態環境、鏡頭、聲音協同生成,適用於虛擬主播、數字員工。
© 版權聲明

相關文章

暫無評論

暫無評論...