Grok 4.7 – SpaceXAI 推出的最新旗艦大模型

AI工具2周前發佈新公告 AI管理員
1 0

Grok 4.7是什麼

Grok 4.7 是 SpaceXAI 推出的最新旗艦大模型,定位爲最強編碼與知識工作模型。模型換用更大的基座模型,強化長程任務、自我驗證與長上下文管理能力,在 CursorBench、Terminal-Bench、法律及電氣工程等基準上大幅超越前代 Grok 4.6,價格維持每百萬 token 輸入 $2、輸出 $6 不變,性價比突出。

Grok 4.7 – SpaceXAI 推出的最新旗艦大模型

Grok 4.7的主要功能

  • 長程編碼:擅長持續數小時的複雜軟件任務,能讀倉庫、拆需求、改多文件並反覆糾錯。
  • 自我驗證:執行任務時可檢查自身工作、管理長上下文,減少中途跑偏。
  • 知識工作:覆蓋文檔、演示文稿、法律分析、醫療推理、工程任務等專業場景。
  • 四檔推理:支持 Low / Medium / High / Extra High 四檔推理力度,按任務複雜度靈活選擇。
  • Fast 模式:輸出速度翻倍的快速變體,價格翻倍但仍遠低於競品。
  • 安全護欄:拒答與抗越獄能力爲歷代最強,生物安全與網絡安全高風險攔截表現突出。

Grok 4.7的技術原理

  • 更大基座模型:Grok 4.7 換用比 4.6 更大的基礎模型,爲長任務和複雜推理提供更強的表徵與生成能力。
  • 強化學習加難加長:訓練階段延長了強化學習週期,任務組合進一步加難,更多樣本需要數小時才能完成,使模型習慣長程執行鏈。
  • 自我驗證機制:通過訓練讓模型主動檢查自己的工作、管理長上下文,在漫長任務中發現並糾正錯誤。
  • Harness 原生理解:模型被訓練爲原生理解 Grok Bot 運行框架,改善對話任務及與工具、執行環境之間的持續協作。
  • 新一代安全防護:啓用全新安全體系,在拒答、越獄抵抗及生物安全基準上達到官方測試過的最強水平。

如何使用Grok 4.7

  • 網頁/APP 體驗:訪問Grok官網或下載 Grok App,登錄 X 賬號後在對話中選擇 Grok 4.7 模型。
  • Grok Build 更新:本地終端用戶執行 grok update,將 Grok Build 升級到最新版即可使用。
  • 選擇推理檔位:在 Grok Build 中按任務複雜度切換 Low / Medium / High / Extra High 四檔推理力度。
  • Cursor 接入:更新 Cursor 後,在模型設置中選擇 Grok 4.7 作爲編碼模型。
  • API 調用:通過 Grok API(或第三方框架、模型路由、雲平台)接入。
  • Fast 模式:追求速度時在 API 中選擇 fast 變體,輸出速度翻倍、價格翻倍。

Grok 4.7的核心優勢

  • 長程任務能力:強化數小時級複雜任務的執行與自我糾錯,大幅減少中途跑偏。
  • 編碼性能躍升:CursorBench 達 46.3%(+5.9pt)、Terminal-Bench 翻倍至 38.0%,穩居第一梯隊。
  • 垂直領域領先:法律基準 19.6%、電氣工程 64.0%,大幅反超 GPT-5.6 Sol 與 Fable 5.1。
  • 極致性價比:輸入 $2/輸出 $6 每百萬 token 與前代持平,價格僅爲 Fable 5.1 的 1/5~1/8。
  • 速度翻倍選項:fast 變體輸出速度翻倍,即使加價後仍遠低於競品。
  • 免費換代升級:用戶無需爲更強性能支付額外標準版成本。
  • 安全最強一代:拒答與抗越獄表現創官方紀錄,LatchBio 62.4% 登頂。
  • 全場景覆蓋:從編碼延伸到文檔、演示、法律、醫療、工程等完整知識工作流。

Grok 4.7的項目官網

  • 項目地址:https://x.ai/news/grok-4-7

Grok 4.7的同類競品對比

對比維度 Grok 4.7 Claude Fable 5.1
定位 最強編碼與知識工作模型 前沿旗艦通用模型
CursorBench 4.0 46.3% 🥇 51.8%(領先)
Terminal-Bench 4.0 38.0% 🥇 57.9%(大幅領先)
DeepSWE v1.1 🥇 71.0%(反超) 70.0%
Harvey 法律基準 🥇 19.6%(近 3 倍領先) 6.7%
EEBench(電氣工程) 🥇 64.0%(明顯領先) 56.4%
AA Briefcase 辦公任務 1657 分(接近) 🥇 1678 分
HealthBench Professional 56.7%(偏弱) 🥇 62.1%

Grok 4.7的應用場景

  • 智能編程開發:倉庫級代碼理解、多文件修改、測試運行與自動糾錯,適合 Cursor 等 Agent 編碼場景。
  • 法律專業工作:合同分析、法律檢索與文書起草,Harvey 基準近三倍領先競品。
  • 電氣工程設計:電路分析、工程文檔處理與計算,EEBench 上全面反超對手。
  • 長時間辦公任務:律師、金融分析師等崗位的多步驟工作流,如製作文檔、演示文稿與數據報告。
  • 多輪知識對話:原生理解 Grok Bot harness,適合客服助手、研究助理等需要持續協作的對話場景。
© 版權聲明

相關文章

暫無評論

暫無評論...