EchoWM是什麼
EchoWM 是京東探索研究院開源的交互式視聽世界模型。模型延續JoyAI-Echo的原生音視頻生成能力,讓用戶以第一/第三人稱視角在AI生成的世界中實時移動探索,畫面、空間關係與環境音、語音持續同步且長時間不跑偏。模型採用統一相機意圖接口與世界數據引擎訓練,WBench導航評測平均分81.7位列第一。

EchoWM的主要功能
-
實時可探索世界生成:用戶可通過WASD方向鍵在AI生成的場景中自由移動、轉身、折返,世界隨操作實時展開。
-
原生音視頻聯合生成:在同一框架內同步生成720p視頻與環境音、音樂、人物語音,聲音隨畫面變化自然延續。
-
第一/第三人稱雙視角控制:第一人稱下鏡頭即觀察者移動,第三人稱下鏡頭自動跟隨人物、車輛等主體運動。
-
多輪長時程延續:用上一段末尾的音視頻作爲下一輪上下文,多輪操作後場景佈局、主體外觀與聲音依然連貫。
-
WBench導航評測第一:158個案例中平均得分81.7,一致性與交互性指標均居前列。
EchoWM的技術原理
- 統一相機意圖接口:將離散的鍵盤指令映射爲相對初始位姿的連續6-DoF軌跡,用同一套接口描述鏡頭如何移動;第一人稱下它直接表示觀察者運動,第三人稱下由模型從數據中學習”主體移動—鏡頭跟隨”的耦合關係,無需額外的角色軌跡或相機預設參數,且軌跡僅注入視頻分支,音頻隨畫面聯動。
- 世界數據引擎:整合四類互補數據源,內部採集gameplay、人類實玩錄像、UE仿真、普通互聯網視頻;再用軌跡最大平移幅度的第90百分位數爲全局”尺子”統一歸一化,保留不同軌跡間的相對位移差異,避免分段定標帶來的速度突變。
- 漸進式四階段訓練:第一階段用AV-rich數據做音視頻持續預訓練打底;第二階段凍結骨幹、只訓練輕量軌跡分支強化控制響應;第三階段用兼具控制可靠性與視聽質量的數據低學習率聯合微調;第四階段自迴歸後訓練,通過Teacher Forcing改造爲因果分塊生成,結合短時程Self-Gradient Forcing讓模型適應自己生成的歷史,再用分佈匹配蒸餾壓縮爲四步採樣,配合sink-plus-FIFO緩存機制在控制KV成本的同時支撐長時程流式交互。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用EchoWM
-
克隆倉庫:
git clone下載github.com/jd-opensource/JoyAI-Echo,進入echo_wm/目錄(與長視頻項目echo_longvideo/相互獨立)。 -
創建環境:
conda create -n echo-wm python=3.11創建獨立環境並激活。 -
安裝依賴:先裝 PyTorch 2.9.1(cu128),再
pip install -r requirements.txt,並用torch.cuda.is_available()驗證顯卡可用。 -
下載模型權重:用
hf download Echo-Team/Echo-WM下載模型 checkpoint;另需下載 Gemma 3 文本編碼器(gated 倉庫,需先在 HF 頁面接受許可並hf auth login)。 -
跑官方示例驗證:運行
scripts/run_wm_case.py --case examples/wm_cases/0010等內置完整案例,確認環境配置無誤。
-
自定義生成:運行
inference_wm.py,傳入首幀圖片 + 六字段提示詞+ 動作串(Action DSL)即可輸出帶聲音的視頻。 -
編寫動作指令:用 Action DSL 描述相機運動,格式爲
<按鍵>-<幀數>,逗號連接,如w-60,a-60表示前進60幀後左移60幀,支持 w/s/a/d/i/j/k 組合。
EchoWM的核心優勢
-
視聽一體化:在同一框架內原生聯合生成720p視頻與環境音、音樂、語音,聲音隨畫面場景和事件同步變化,解決了多數世界模型”只出畫面不出聲”的問題。
-
統一控制接口:用一套相對6-DoF軌跡同時驅動第一人稱觀察者移動和第三人稱鏡頭跟隨主體,無需爲不同視角單獨設計控制器。
-
長時程連貫:通過自迴歸後訓練與sink-plus-FIFO緩存機制,用戶可基於上一輪末尾音視頻上下文繼續多輪探索,場景、主體與聲音長時間不跑偏。
-
評測領先:WBench Navigation評測平均分81.7位列第一,用戶研究整體偏好顯著優於LingBot-World-v2和HappyOyster。
JoyAI-EchoWM的項目地址
- 項目官網:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
- GitHub倉庫:https://github.com/jd-opensource/JoyAI-Echo
- arXiv技術論文:https://arxiv.org/pdf/2608.23189
EchoWM的同類競品對比
| 對比維度 | EchoWM(京東) | HappyOyster |
|---|---|---|
| 產品定位 | 可進入的全模態世界模型 | 音視頻聯合生成 + 實時交互模型 |
| 交互模式 | 第一人稱 + 第三人稱雙視角 | 導演模式 + 第一人稱漫遊模式 |
| 控制方式 | 統一相機意圖接口(6-DoF 軌跡,WASD 映射) | 視角與動作控制(具體接口公開信息有限) |
| 音視頻生成 | 原生聯合生成 720p 視頻 + 環境音/音樂/語音 | 支持音視頻聯合生成 |
| 長時程能力 | 多輪延續 + 自迴歸後訓練,長時程一致性突出 | 支持交互式生成,長時程細節公開較少 |
| WBench 平均分 | 81.7(第1) | 76.8 |
| 用戶研究(整體偏好) | 63.13% | 27.06% |
EchoWM的應用場景
-
遊戲原型開發:創作者進入生成場景試玩,驗證空間佈局、路線設計與鏡頭體驗後再決定製作方向。
-
互動敘事:劇情按用戶選擇分支推進並持續生成,替代傳統預製素材,用於互動劇、互動小說。
-
沉浸式內容:影視與廣告內容從”觀看”變爲”進入”,觀衆可自由探索畫面中的世界。
-
虛擬遊覽:博物館、景區、房產等場景的低成本數字化漫遊,無需逐幀建模。
-
數字人表演:人物語音、動作與周圍動態環境、鏡頭、聲音協同生成,適用於虛擬主播、數字員工。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...