Vivix – Vivix推出的首個實時交互多模態基座模型

AI工具2周前發佈新公告 AI管理員
0 0

Vivix是什麼

Vivix 是前商湯高管劉宇創立的AI創新企業發佈的全球首個實時交互多模態基座模型 Vivix-A1Vivix-W1。兩款模型均採用約30B激活參數的統一流式架構,將多模態參考、原生交互與流式視頻生成整合於單一模型中,支持用戶通過語音、文字、觸控等方式實時介入並改變AI角色動作與劇情走向。端到端首次反應延遲低於1.7秒,推理成本在一年內降低兩個數量級,已接近主流視頻平台CDN帶寬成本,可在消費級GPU上實現實時推理。

Vivix – Vivix推出的首個實時交互多模態基座模型

Vivix的主要功能

  • 實時全雙工交互:AI 角色在說話或行動過程中,用戶可隨時通過語音、文字插話或更換話題,角色即時響應,無需等待當前輪次結束,實現真正的人機雙向對話。
  • 全身角色與動作生成:角色不僅能說話,還能實時行走、轉身、拿取物品、與環境進行物理交互,支持寫實人物、3D 角色和動漫形象等多種風格。
  • 原生音畫聯合生成:畫面、對白、環境音與音效同步生成,無需單獨音頻模型後補,實現視聽一體化輸出,確保口型、動作與聲音高度匹配。
  • 多模態動態參考:支持語音、文字、圖片等多種輸入方式,且圖片可在互動過程中動態加入,角色能根據新素材實時調整講解內容與動作表現。
  • 原生多鏡頭敘事:模型可自主切換視角、移動鏡頭,處理對白節奏與人物反應,實現電影級的實時導演與敘事能力。
  • 流式持續生成:採用小段流式生成方式,上一段內容作爲下一段基礎,支持故事長期演進而不漂移,保證長時間交互的連貫性。
  • 極低延遲響應:流式調度器處理新輸入最短僅需 300 毫秒,用戶輸入到畫面首次可見反應平均低於 0.6 秒,端到端首次反應時間(TTFR)低於 1.7 秒。
  • 消費級 GPU 實時運行:通過 MJD 多維聯合蒸餾、原生 NVFP4 訓推協同與 VMI 推理引擎優化,30B 參數模型可在消費級顯卡上實現實時推理。

如何使用Vivix

  • 訪問官網申請內測:前往Vivix的官網 https://vivix.ai/ 或 API 開放平台提交體驗申請。
  • 選擇模型與場景:根據需求選擇 Vivix-A1(角色實時交互)或 Vivix-W1(互動敘事/世界生成)。
  • 輸入參考素材:上傳角色圖片、場景描述或語音指令,確定故事或角色的初始狀態。
  • 實時互動介入:通過語音、文字、點擊或觸控與AI角色/故事進行雙向交流,隨時改變劇情或角色行爲。
  • 動態調整與導出:在流式生成過程中追加新圖片或修改指令,系統將實時重定向後續內容,無需從頭生成。

Vivix的核心優勢

  • 極低延遲:流式調度器響應新輸入最短僅需300毫秒,用戶輸入到畫面首次可見反應平均低於0.6秒,端到端TTFR低於1.7秒。
  • 消費級GPU實時運行:通過MJD多維聯合蒸餾、原生NVFP4訓推協同與VMI推理引擎,將30B參數模型壓縮至2步推理,實現消費級顯卡單卡超10,000 video tokens/s。
  • 成本大幅降低:推理與基礎設施成本在一年內降低兩個數量級(約100倍),實時生成成本已接近YouTube每小時約0.2美元的CDN帶寬成本。
  • 非級聯原生架構:摒棄傳統ASR+LLM+TTS拼接管線,採用端到端原生多模態生成循環,交互更自然、延遲更低。
  • 長期一致性保障:通過局部連續性銜接與全局序列先驗,維持人物、背景、聲音和動作的長期穩定,避免長時間生成後畫面漂移。

Vivix的同類競品對比

對比維度 Vivix 智譜 GLM-Realtime
模型定位 全球首個實時交互多模態基座模型 端到端音視頻通話多模態模型
核心架構 統一流式架構,約30B激活參數,端到端原生多模態生成循環 端到端多模態模型,跨文本/音頻/視頻實時推理
實時交互模式 全雙工實時交互,用戶可隨時插話改變角色動作與劇情 低延遲視頻理解與語音交互,支持實時打斷
視頻能力側重 生成式:AI實時生成角色動作、場景與鏡頭敘事 理解式:實時理解用戶攝像頭畫面並語音回應
記憶時長 流式持續生成,支持故事長期演進與一致性保持 2分鐘內容記憶
延遲表現 流式調度器300ms,畫面首次可見<0.6s,端到端TTFR<1.7s 低延遲(強調”近乎實時”,具體數值未公開)
生成模態 畫面+對白+環境音+音效同步生成(音畫聯合) 語音+文本輸出(基於視頻理解)
角色/動作生成 支持全身角色行走、轉身、拿取物品、物理交互 無(側重理解用戶視頻而非生成角色)
多模態輸入 語音、文字、圖片、觸控/點擊 視頻、音頻、文本
硬件要求 消費級GPU可實時運行(單卡超10,000 video tokens/s) 雲端API調用,無本地硬件要求
API開放情況 W1已開放API,A1開放內測申請 已上線智譜開放平台,按分鐘計費
定價參考 推理成本一年內降低約100倍,接近CDN帶寬成本 音頻0.18–0.3元/分鐘,視頻1.2–2.1元/分鐘
特色功能 電影級多鏡頭自主切換、角色風格自定義(寫實/3D/動漫)、環境物理交互 清唱功能、Function Call工具調用、口語陪練、面試模擬

Vivix的適用人羣

  • 遊戲開發者:需要構建開放世界劇情、實時NPC交互與動態敘事的遊戲工作室。
  • 直播與內容創作者:希望打造實時互動數字人、虛擬主播或沉浸式直播體驗的團隊。
  • 房產與電商營銷:需要AI銷售/導購進行線上帶看、商品展示與實時答疑的企業。
  • 教育與文旅機構:開發虛擬導覽、互動講解、沉浸式研學內容的機構。
  • AI研究者與開發者:關注實時多模態生成、流式架構與低延遲推理技術的前沿技術人員。
© 版權聲明

相關文章

暫無評論

暫無評論...