Cosmos 3 Edge – 英偉達開源的 4B 參數世界模型

AI工具8小時前發佈新公告 AI管理員
0 0

Cosmos 3 Edge是什麼

Cosmos 3 Edge 是 NVIDIA 推出的 4B 參數開源世界模型,專爲機器人和邊緣 AI 實時推理設計。模型基於 Nemotron 架構,融合自迴歸與擴散雙 Transformer 塔,共享多模態注意力層,可在 Jetson Thor、RTX GPU 及 DGX 等設備上本地運行,實現 15 Hz 實時控制。開發者可在約一天內將模型適配至特定機器人或環境,無需依賴雲端即可感知、推理並生成動作策略。

Cosmos 3 Edge – 英偉達開源的 4B 參數世界模型

Cosmos 3 Edge的主要功能

  • 世界狀態理解:通過自迴歸塔處理視覺與文本 token,實時解析邊緣環境中的物體、空間關係與場景語義,爲後續推理提供共享世界表徵。
  • 未來狀態預測:基於擴散塔對視覺、音頻與動作 token 進行去噪生成,模擬執行某動作後的視覺結果。
  • 動作策略生成:將機械臂、車輛、攝像頭等不同具身形態統一編碼爲平移、旋轉與操作狀態的緊湊幾何向量,每次推理生成 32 個連續動作,用 15 Hz 頻率輸出控制指令。
  • 端側實時推理:在 Jetson Thor、RTX PRO、Jetson T2000/T3000 等內存受限設備上實現內存高效的高吞吐量推理,無需雲端即可閉環運行。
  • 快速領域適配:提供完整後訓練腳本與 DROID 數據集策略檢查點,開發者可在約一天內將基礎模型微調至特定機器人或環境。

Cosmos 3 Edge的技術原理

  • 雙塔共享架構:模型由自迴歸塔與擴散塔組成。自迴歸塔採用因果注意力處理視覺和文本 token,用於場景理解與推理;擴散塔採用雙向注意力處理視覺、音頻和動作 token,用於預測、生成與神經模擬。兩塔各自擁有獨立的 LayerNorm 與 MLP,共享多模態注意力層,將語言、視頻、音頻和動作信息對齊到統一表徵空間。
  • 通用動作表徵:將不同物理系統的動作映射爲緊湊的幾何向量,統一編碼平移、旋轉與操作狀態,建立像素變化與物理運動、空間關係及控制輸入之間的直接聯繫。
  • 世界動作模型(WAM):作爲策略使用時,模型接收當前觀測狀態,同時輸出應執行的動作及其預期視覺結果,將世界建模與機器人策略訓練直接關聯。動作在模型中可雙向流動:能預測某動作的效果,從效果反推動作。
  • 邊緣優化推理:基於 Nemotron 架構的 4B 參數緊湊設計,結合 4 步知識蒸餾與 vLLM 優化框架,在保持輸出質量的同時實現高達 25 倍推理加速,適配 Jetson 系列等邊緣計算平台的內存與算力約束。

Cosmos 3 Edge – 英偉達開源的 4B 參數世界模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用Cosmos 3 Edge

  • 環境準備:安裝 NVIDIA Container Toolkit 並拉取官方 Docker 鏡像,或配置 Conda 環境安裝 PyTorch、Diffusers、Transformers 等依賴。
  • 下載模型:從 Hugging Face 下載 nvidia/Cosmos3-Edge 權重,同時獲取後訓練腳本與 DROID 數據集策略檢查點。
  • 後訓練微調:用小型 H100 集羣或 DGX Station,基於開源 Cosmos Framework 對特定機器人、傳感器或環境進行約一天的適配微調。
  • 部署推理:將微調後的模型部署至 Jetson T2000/T3000、RTX PRO 或 DGX 等邊緣設備,通過 vLLM 或 NIM 微服務實現 15 Hz 實時動作生成。

Cosmos 3 Edge的核心優勢

  • 端側實時推理:40 億參數輕量化設計,在 Jetson Thor 上實現 15 Hz 實時控制,消除雲端延遲。
  • 快速適配:開發者可在約一天內將基礎模型微調至特定機器人或環境,大幅降低部署週期。
  • 統一多模態架構:自迴歸塔與擴散塔共享注意力層,統一處理語言、視頻、音頻與動作,實現”理解→模擬→行動”閉環。
  • 開放生態:模型權重、訓練腳本、後訓練方案及 4 步知識蒸餾檢查點全部開源,支持 Hugging Face Diffusers 與 vLLM 部署。
  • 基準領先:在同規模(4B)模型中,VANTAGE-Bench 視覺分析排名第一,機器人策略學習達業界領先水平。

Cosmos 3 Edge的項目對比

  • 項目官網:https://huggingface.co/blog/nvidia/cosmos3edge
  • HuggingFace模型庫:https://huggingface.co/nvidia/Cosmos3-Edge

Cosmos 3 Edge的同類競品對比

維度 Cosmos 3 Edge SmolVLA
發佈方 NVIDIA HuggingFace / 社區
參數規模 4B 450M
架構類型 世界動作模型(WAM)雙塔架構 視覺-語言-動作(VLA)模型
核心機制 自迴歸塔+擴散塔共享注意力,統一世界理解與動作生成 SigLIP+DinoV2 雙視覺編碼器,分塊動作預測
開源程度 完全開源(權重+訓練腳本+後訓練方案) 完全開源(權重+代碼+評估腳本)
邊緣部署 Jetson Thor / RTX PRO / T2000 / T3000,15 Hz 實時控制 單張 RTX 4090,15–30 Hz 推理
微調成本 小型 H100 集羣或 DGX Station,約一天 單張 A100 或消費級 GPU,數小時
動作輸出 每次推理生成 32 個動作,通用幾何向量表徵 每次預測 50 步動作塊,減少 50 倍計算調用
世界建模 內置世界模型,可預測動作的視覺結果 無內置世界模型,直接從觀測映射到動作
適用場景 需因果推理與模擬的複雜操作、動態環境 結構化環境下的快速反應式抓取與放置

Cosmos 3 Edge的應用場景

  • 工業機械臂控制:在工廠產線上實時感知工件位置,生成抓取與裝配動作,無需雲端往返。
  • 倉儲物流機器人:自主導航倉庫通道,實時避障並規劃最優揀貨路徑,支持 15 Hz 動態決策。
  • 自動駕駛邊緣感知:在車載 Jetson 平台上實時推理路況,預測他車軌跡並生成自車控制策略。
  • 醫療輔助機器人:在醫院環境中理解場景變化,實時調整機械臂動作以輔助手術或護理。
  • 農業自動化:在田間邊緣設備上實時識別作物狀態,生成採摘或噴灑動作,適應戶外弱網環境。
© 版權聲明

相關文章

暫無評論

暫無評論...