Zing-0.5是什麼
Zing-0.5 是 Loopit 開源的實時交互視頻世界模型,5B 參數,基座爲 Wan2.2-TI2V-5B,採用 Apache 2.0 協議。核心能力是”聯合控制”,鍵盤空間操作與自然語言語義改寫兩條鏈路共同進入 Causal DiT,用戶可一邊操控角色移動,一邊隨時用文字改寫正在發生的世界,新指令會進入當前世界而非重置場景。模型通過訓練中途切換 Prompt 學會”邊玩邊改”,主動擾動歷史畫面以抗誤差累積。單卡 RTX 5090 可超 24 FPS 實時生成,一分鐘流式推理成本約 6 分錢,在美團 LongCat 與復旦聯合的 WBench 評測中位列實時世界模型第一。

Zing-0.5的主要功能
-
聯合控制:鍵盤空間操作(W/A/S/D 移動 + I/J/K/L 視角)與自然語言語義改寫共同作用,一邊操控移動一邊用文字改變世界,新指令進入當前世界而非替換場景。
-
實時流式生成:單卡 RTX 5090 超過 24 FPS,一分鐘推理成本約 6 分錢,支持無限長時序連續生成。
-
中途語義改寫:可在生成進行中隨時插入文字指令(如”暴風雪””龍噴火”),模型保留視覺與操作歷史,讓改寫發生在當前世界中。
-
多對象同時響應:一條指令可同時驅動多個不同對象變化(如人物跪地祈禱 + 多座雕像睜眼發光)。
-
長程一致性:角色外觀、場景結構、畫風(如像素風格)在持續生成中保持穩定,不漂移、不換畫風。
-
抗誤差累積:訓練中主動擾動歷史畫面,模型學會”接住自己的錯誤”,長時間生成不越走越偏。
-
動作控制:8 維連續動作信號(取值 [0,1]),支持前進/後退/左右移動與四向視角變化,編碼爲逐幀 action residual。
-
本地部署:5B 參數單卡可跑,Linux + PyTorch 環境,80GB+ 顯存或滑窗注意力配置(RTX 4090 級別亦可),輸出 H.264 MP4。
-
開源免費:Apache 2.0 協議,代碼與權重在 GitHub、ModelScope、HuggingFace 開放,基於 Wan2.2-TI2V-5B 訓練。
Zing-0.5的技術原理
-
基座模型:基於 Wan2.2-TI2V-5B 訓練,5B 參數量級,核心生成網絡爲 Causal DiT(因果擴散 Transformer),配合因果 KV 緩存支持無限長時序自迴歸推演。
-
雙控制鏈路架構:兩條獨立但共同進入 Causal DiT 的控制通道——空間操作走”動作鏈”,語義改寫走”文本鏈”,二者共同決定接下來生成的內容。
-
動作鏈(action residual):W/A/S/D 移動 + I/J/K/L 視角構成 8 維連續動作信號(取值 [0,1]),經 sin/cos 編碼與因果時序卷積(不足 10M 參數)轉化爲逐幀 action residual,與對應視頻 token 逐幀對齊後注入生成。
-
文本鏈(cross-attention):自然語言指令經語言模型編碼爲 language tokens,通過 cross-attention 寫入當前生成,實現中途語義改寫。
-
兩鏈解耦、持續並行:文本條件改變時動作鏈路不中斷,因此能實現”巨龍一邊按原方向飛行一邊噴火”這類邊操作邊改寫的效果。
-
訓練即學會”中途改寫”:訓練時在自迴歸生成中途切換 Prompt,保留已生成的視覺歷史與操作歷史,用新文本條件預測後續,改寫能力是訓練出來的原生能力,而非推理時拼接的後加功能。
-
抗誤差累積訓練:自迴歸生成的”歷史”是模型自己的輸出,誤差會累積;Zing-0.5 在訓練中主動擾動部分歷史畫面(加噪聲、輕微模糊、顏色偏移、視角變化)模擬真實誤差,訓練目標始終保持乾淨,迫使模型學會從不完美歷史中甄別真實狀態。
-
純訓練解法,推理零開銷:抗累積能力完全內化於權重,在線推理無需額外糾錯模型,不增加延遲與算力。
-
四步 DMD 蒸餾採樣:將擴散採樣壓縮至 4 步,是單卡實時(>24 FPS)與低成本(約 6 分錢/分鐘)的關鍵。
-
滑窗注意力適配顯存:80GB+ 顯存用
--local-attn-size 97 --sink-size 9;RTX 4090 級別用--local-attn-size 33 --sink-size 5,通過局部注意力 + sink token 在有限顯存內維持長上下文。 -
輸出管線:視頻幀經 patch embedding 成 token 進入 Causal DiT,預測幀解碼後輸出 H.264 編碼的 24 FPS MP4。
如何使用Zing-0.5
- 環境準備:準備硬件與系統:Linux 系統 + NVIDIA GPU(建議 80GB+ 顯存,如 H100/A100;RTX 4090 級別可用滑窗注意力配置),安裝基礎環境:Python 3.11、PyTorch 2.9、CUDA。
- 獲取代碼與模型
-
克隆代碼倉庫:
git clone https://github.com/seedleap/zing-world-model.git,進入目錄cd zing-world-model。 -
安裝依賴:
pip install -r requirements.txt。 -
下載模型權重:
pip install modelscope,然後執行modelscope download --model seedleap/Zing-0.5 --local_dir ./Zing-0.5。 -
確認目錄結構:權重包含
generator/model.pt(生成器)和pretrained/(text_encoder、tokenizer、vae)。
-
- 運行推理
-
文本驅動模式(Action T2V):執行
run.sh,指定--pretrained-dir、--checkpoint、--messages examples/case3_action_t2v.jsonl、輸出目錄和隨機種子。 -
圖片初始化模式(Action TI2V):同樣用
run.sh,換用examples/case4_action_ti2v.jsonl等圖生視頻配置。 -
按顯存選擇注意力參數:80GB+ 加
--local-attn-size 97 --sink-size 9;低於 80GB 加--local-attn-size 33 --sink-size 5;完整歷史注意力用--local-attn-size -1 --sink-size 0。
-
- 交互操作
-
鍵盤操控:W/A/S/D 控制前後左右移動,I/J/K/L 控制視角轉動(內部爲 8 維連續向量,取值 [0,1])。
-
中途語義改寫:在生成進行中輸入自然語言指令(如”暴風雪””龍嘴巴噴火”),世界實時響應且場景不被重置。
-
-
查看輸出:生成結果爲 H.264 編碼的 24 FPS MP4 文件,保存在指定的
--output-dir目錄。 - 零部署體驗(可選):不想本地部署可等官方產品:對應功能預計兩週內上線 Loopit APP 海外版,直接在 App 中體驗實時互動世界。
Zing-0.5的核心優勢
-
實時榜第一的硬實力:WBench 評測平均分 81.0,總榜第二僅次於一個非實時的雙向模型,實時世界模型榜第一。
-
“邊玩邊改”獨一檔:多數實時世界模型只支持”探索場景”,Zing-0.5 是少數能邊操控移動邊用文字中途改寫世界的模型,聯合控制是核心差異化。
-
改寫不換世界:新指令精準寫入當前世界,只改該改的(加暴風雪、讓龍噴火),不該動的(角色、畫風、遠處場景)紋絲不動,同類模型常”順手換掉整個世界”。
-
長時序不跑偏:訓練中主動擾動歷史畫面讓模型學會糾錯,長時間生成角色外觀、場景結構保持穩定;且是純訓練階段解法,推理時無需額外糾錯模型,不增延遲。
-
成本與門檻雙低:5B 參數單卡部署,單張 RTX 5090 超 24 FPS,一分鐘流式推理僅約 6 分錢,消費級顯卡即可實時交互。
-
架構輕量優雅:動作控制鏈路不足 10M 參數(sin/cos 編碼 + 因果卷積 → 逐幀 action residual),雙控制鏈共同進入 Causal DiT,設計簡潔高效。
-
真開源:Apache 2.0 協議,代碼 + 權重 + 部署文檔全套開放,商用無門檻,基座 Wan2.2-TI2V-5B 成熟可靠。
Zing-0.5的項目地址
- Github倉庫:https://github.com/seedleap/zing-world-model
- HuggingFace模型庫:https://huggingface.co/seedleap/zing-0.5
- ModelScope:https://modelscope.cn/models/seedleap/Zing-0.5
Zing-0.5的同類競品對比
| 對比項 | Zing-0.5(Loopit/SeedLeap) | HiDream-O1-World(HiDream.ai) | LingBot-World v2(螞蟻集團) |
|---|---|---|---|
| WBench 總排名 | 第 2(實時榜第 1) | 第 3 | 第 5 |
| 綜合平均分 | 81.0 | 80.9 | 79.4 |
| 畫面質量(Quality) | 80.6 | 81.0(三者最高) | 81.8(三者最高) |
| 場景設定(Setting) | 77.8 | 82.2 | 76.8 |
| 交互能力(Interaction) | 84.2(三者最高) | 80.0 | 82.8 |
| 一致性(Consistency) | 88.5(三者最高) | 88.0 | 86.5 |
| 物理規律(Physical) | 73.8(三者最高) | 73.3 | 69.1 |
| 實時性 | 實時(單卡 5090 超 24 FPS) | 未標註實時標籤 | 標註 “fast”(快速) |
| 交互類型 | action + 文本聯合控制(可中途改寫世界) | 動作控制 | 動作控制 |
| 參數規模 | 5B(基座 Wan2.2-TI2V-5B) | 未公開 | 未公開 |
| 開源情況 | 開源(Apache 2.0,代碼+權重) | 未標註開源 | 開源 |
| 核心特點 | 邊操控邊文字改寫世界,新指令進入當前世界不重置場景 | 畫面質量與場景設定最強 | 速度快,交互能力較好 |
| 推理成本 | 約 6 分錢/分鐘流式生成 | 未公開 | 未公開 |
| 產品落地 | 2 周內上線 Loopit APP 海外版 | — | — |
Zing-0.5的應用場景
-
AI 互動娛樂/AI 遊戲:玩家用鍵盤操控角色在生成世界中探索,隨時用語言改寫劇情與環境(如下雪、召喚怪物),實現”人人可玩的生成式遊戲”。
-
“可以玩的抖音”式內容消費:短視頻從”看”變成”玩”,每個用戶在同一段內容裏玩出不同走向,改寫內容平台形態。
-
UGC 互動內容創作:創作者生成可交互視頻世界供粉絲體驗,觀衆不再是旁觀者而是參與者,衍生全新內容品類。
-
遊戲原型快速驗證:遊戲團隊無需搭建引擎場景,用世界模型快速生成可交互 Demo,低成本驗證玩法與關卡創意。
-
虛擬直播/虛擬主播:主播實時驅動虛擬世界,觀衆通過彈幕文字參與改寫場景與事件,增強直播互動性。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...