Grok 4.5 – SpaceXAI推出的新一代旗艦大語言模型

AI工具11小時前發佈新公告 AI管理員
0 0

Grok 4.5是什麼

Grok 4.5是SpaceXAI(原xAI)推出的新一代旗艦大語言模型,基於1.5萬億參數V9基礎架構。模型在補充訓練階段深度整合Cursor編程數據,顯著強化代碼生成與軟件工程能力。馬斯克將其定位爲Opus 4.7級別模型,主打更快推理速度、更高token效率與更低使用成本。在第三方評測中,Grok 4.5在GDPval-AA v2基準排名全球第四,已面向公衆開放。

Grok 4.5 – SpaceXAI推出的新一代旗艦大語言模型

Grok 4.5的主要功能

  • 智能代碼生成:基於 Cursor 編程數據深度訓練,支持代碼補全、Bug 修復、項目重構與自動化測試生成。
  • 多步驟工程任務處理:覆蓋跨文件依賴分析、架構設計與技術文檔生成,擅長長程軟件工程流程。
  • 智能體異步執行:支持長時間運行的 AI Agent 任務,可處理複雜多輪決策與辦公自動化流程。
  • 極速推理輸出:每秒 80 token 的生成速度,響應延遲低,適合實時交互場景。
  • 多語言編程支持:在 SWE-Bench Multilingual 等基準中表現優異,支持跨語言代碼理解與轉換。
  • 平台原生集成:已嵌入 Grok Build 對話平台與 Cursor IDE,開發者無需切換環境即可調用。
  • 標準 API 接入:通過 SpaceXAI 控制檯提供 OpenAI 兼容接口,支持企業級系統集成與批量調用。

Grok 4.5的技術原理

  • 架構規模:基於全新1.5萬億參數V9基礎架構,較前代大幅提升模型容量與表達能力。
  • 數據工程:訓練數據經過嚴格去重、質量評分與領域篩選,並引入Cursor編程數據作爲補充訓練集,針對性強化代碼理解與生成能力。
  • 訓練基礎設施:採用數萬塊英偉達GB300 GPU進行大規模訓練,配合穩定運行技術保障長時間訓練不中斷。
  • 強化學習優化:覆蓋數十萬個多步驟軟件工程任務,通過支持長時間運行的智能體異步訓練,提升模型在複雜長程任務中的推理效率。
  • 推理效率:優化解碼策略與推理路徑規劃,使SWE Bench Pro任務平均僅消耗15954個token,約爲同類頂尖模型的四分之一,實現速度與成本的雙重壓縮。

如何使用Grok 4.5

  • 通過Grok Build使用:用戶可直接登錄Grok Build平台,在對話界面選擇Grok 4.5模型進行交互,適合日常問答、代碼編寫與文檔處理。
  • 通過Cursor編譯器使用:Grok 4.5已集成至Cursor編程環境,開發者在IDE內即可調用模型進行代碼補全、Bug修復與項目重構,實現編程工作流無縫嵌入。
  • 通過API調用:開發者可登錄SpaceXAI控制檯獲取API密鑰,按照標準OpenAI兼容接口格式接入。

Grok 4.5的核心優勢

  • 性能對標頂尖梯隊:內部評估與Opus 4.7大致相當,Terminal-Bench 2.1得分83.3%,躋身大模型第一梯隊。
  • 極致成本優勢:GDPval-AA v2單項任務成本僅0.49美元,比排名前三的模型便宜近90%,低於GLM-5.2與Kimi K2.6。
  • Token效率領先:SWE Bench Pro任務平均消耗15954 token,比Opus 4.8的67020 token減少4.2倍,直接降低用戶實際支出。
  • 推理速度極快:輸出速度達每秒80 token,達到快速模型運行標準,長程任務響應更及時。
  • 工程能力突出:在DeepSWE 1.0與SWE-Bench Pro等軟件工程基準中表現優異,經過Cursor數據強化,代碼生成與多步驟工程任務處理能力顯著。

Grok 4.5的項目地址

  • 項目官網:https://x.ai/news/grok-4-5

Grok 4.5的同類競品對比

對比維度 Grok 4.5 Claude Opus 4.8
Terminal-Bench 2.1 83.3% 78.9%
SWE-Bench Multilingual 78.0% 84.4%
DeepSWE 1.0 62.0% (high) 55.8% (max)
SWE-Bench Pro 64.7% (high) 69.2% (max)
GDPval-AA v2 Elo 1543(全球第四) 1600(前三)
任務成本 $0.49/任務 約$5-10/任務
Token效率 15954 token/任務 67020 token/任務
輸出速度 80 token/秒 較慢
API輸入價格 $2/百萬token 更高
API輸出價格 $6/百萬token 更高
核心定位 高性價比工程模型 極致性能旗艦模型

Grok 4.5的應用場景

  • 智能軟件開發:在Cursor等IDE中輔助代碼補全、Bug診斷、項目重構與自動化測試生成,適合全棧開發與大型代碼庫維護。
  • 多步驟工程任務:處理複雜的長程軟件工程流程,如跨文件依賴分析、架構設計與技術文檔自動生成。
  • 企業級API集成:通過SpaceXAI控制檯接入內部系統,構建低成本、高吞吐的客服機器人、數據分析與業務流程自動化工具。
  • 終端編程輔助:在Grok Build平台中快速生成腳本、查詢命令與配置文件,適合運維工程師與數據科學家提升日常效率。
© 版權聲明

相關文章

暫無評論

暫無評論...