Vivix是什麼
Vivix 是前商湯高管劉宇創立的AI創新企業發佈的全球首個實時交互多模態基座模型 Vivix-A1 與 Vivix-W1。兩款模型均採用約30B激活參數的統一流式架構,將多模態參考、原生交互與流式視頻生成整合於單一模型中,支持用戶通過語音、文字、觸控等方式實時介入並改變AI角色動作與劇情走向。端到端首次反應延遲低於1.7秒,推理成本在一年內降低兩個數量級,已接近主流視頻平台CDN帶寬成本,可在消費級GPU上實現實時推理。

Vivix的主要功能
-
實時全雙工交互:AI 角色在說話或行動過程中,用戶可隨時通過語音、文字插話或更換話題,角色即時響應,無需等待當前輪次結束,實現真正的人機雙向對話。
-
全身角色與動作生成:角色不僅能說話,還能實時行走、轉身、拿取物品、與環境進行物理交互,支持寫實人物、3D 角色和動漫形象等多種風格。
-
原生音畫聯合生成:畫面、對白、環境音與音效同步生成,無需單獨音頻模型後補,實現視聽一體化輸出,確保口型、動作與聲音高度匹配。
-
多模態動態參考:支持語音、文字、圖片等多種輸入方式,且圖片可在互動過程中動態加入,角色能根據新素材實時調整講解內容與動作表現。
-
原生多鏡頭敘事:模型可自主切換視角、移動鏡頭,處理對白節奏與人物反應,實現電影級的實時導演與敘事能力。
-
流式持續生成:採用小段流式生成方式,上一段內容作爲下一段基礎,支持故事長期演進而不漂移,保證長時間交互的連貫性。
-
極低延遲響應:流式調度器處理新輸入最短僅需 300 毫秒,用戶輸入到畫面首次可見反應平均低於 0.6 秒,端到端首次反應時間(TTFR)低於 1.7 秒。
-
消費級 GPU 實時運行:通過 MJD 多維聯合蒸餾、原生 NVFP4 訓推協同與 VMI 推理引擎優化,30B 參數模型可在消費級顯卡上實現實時推理。
如何使用Vivix
-
訪問官網申請內測:前往Vivix的官網 https://vivix.ai/ 或 API 開放平台提交體驗申請。
-
選擇模型與場景:根據需求選擇 Vivix-A1(角色實時交互)或 Vivix-W1(互動敘事/世界生成)。
-
輸入參考素材:上傳角色圖片、場景描述或語音指令,確定故事或角色的初始狀態。
-
實時互動介入:通過語音、文字、點擊或觸控與AI角色/故事進行雙向交流,隨時改變劇情或角色行爲。
-
動態調整與導出:在流式生成過程中追加新圖片或修改指令,系統將實時重定向後續內容,無需從頭生成。
Vivix的核心優勢
-
極低延遲:流式調度器響應新輸入最短僅需300毫秒,用戶輸入到畫面首次可見反應平均低於0.6秒,端到端TTFR低於1.7秒。
-
消費級GPU實時運行:通過MJD多維聯合蒸餾、原生NVFP4訓推協同與VMI推理引擎,將30B參數模型壓縮至2步推理,實現消費級顯卡單卡超10,000 video tokens/s。
-
成本大幅降低:推理與基礎設施成本在一年內降低兩個數量級(約100倍),實時生成成本已接近YouTube每小時約0.2美元的CDN帶寬成本。
-
非級聯原生架構:摒棄傳統ASR+LLM+TTS拼接管線,採用端到端原生多模態生成循環,交互更自然、延遲更低。
-
長期一致性保障:通過局部連續性銜接與全局序列先驗,維持人物、背景、聲音和動作的長期穩定,避免長時間生成後畫面漂移。
Vivix的同類競品對比
| 對比維度 | Vivix | 智譜 GLM-Realtime |
|---|---|---|
| 模型定位 | 全球首個實時交互多模態基座模型 | 端到端音視頻通話多模態模型 |
| 核心架構 | 統一流式架構,約30B激活參數,端到端原生多模態生成循環 | 端到端多模態模型,跨文本/音頻/視頻實時推理 |
| 實時交互模式 | 全雙工實時交互,用戶可隨時插話改變角色動作與劇情 | 低延遲視頻理解與語音交互,支持實時打斷 |
| 視頻能力側重 | 生成式:AI實時生成角色動作、場景與鏡頭敘事 | 理解式:實時理解用戶攝像頭畫面並語音回應 |
| 記憶時長 | 流式持續生成,支持故事長期演進與一致性保持 | 2分鐘內容記憶 |
| 延遲表現 | 流式調度器300ms,畫面首次可見<0.6s,端到端TTFR<1.7s | 低延遲(強調”近乎實時”,具體數值未公開) |
| 生成模態 | 畫面+對白+環境音+音效同步生成(音畫聯合) | 語音+文本輸出(基於視頻理解) |
| 角色/動作生成 | 支持全身角色行走、轉身、拿取物品、物理交互 | 無(側重理解用戶視頻而非生成角色) |
| 多模態輸入 | 語音、文字、圖片、觸控/點擊 | 視頻、音頻、文本 |
| 硬件要求 | 消費級GPU可實時運行(單卡超10,000 video tokens/s) | 雲端API調用,無本地硬件要求 |
| API開放情況 | W1已開放API,A1開放內測申請 | 已上線智譜開放平台,按分鐘計費 |
| 定價參考 | 推理成本一年內降低約100倍,接近CDN帶寬成本 | 音頻0.18–0.3元/分鐘,視頻1.2–2.1元/分鐘 |
| 特色功能 | 電影級多鏡頭自主切換、角色風格自定義(寫實/3D/動漫)、環境物理交互 | 清唱功能、Function Call工具調用、口語陪練、面試模擬 |
Vivix的適用人羣
-
遊戲開發者:需要構建開放世界劇情、實時NPC交互與動態敘事的遊戲工作室。
-
直播與內容創作者:希望打造實時互動數字人、虛擬主播或沉浸式直播體驗的團隊。
-
房產與電商營銷:需要AI銷售/導購進行線上帶看、商品展示與實時答疑的企業。
-
教育與文旅機構:開發虛擬導覽、互動講解、沉浸式研學內容的機構。
-
AI研究者與開發者:關注實時多模態生成、流式架構與低延遲推理技術的前沿技術人員。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...