GPT-6.1 Sol – OpenAI 推出的新一代主力模型

AI工具3天前發佈新公告 AI管理員
0 0

GPT-6.1 Sol是什麼

GPT-6.1 Sol是OpenAI推出的新一代主力模型,作爲GPT-6 Sol的升級版,以Astra旗艦五分之一的Token價格實現接近後者的智能水平。GPT-6.1 Sol專注於智能體編程、電腦操作和專業工作三類高消耗場景,在真實代碼庫工程任務上追平Astra,在OSWorld電腦操作評測中僅落後2.1個百分點,同時將緩存輸入價格壓至每百萬Token僅0.1美元。官方爲模型配套了最高8倍速的Ultrafast檔位,現已通過API和ChatWork、Codex面向付費用戶開放。

GPT-6.1 Sol – OpenAI 推出的新一代主力模型

GPT-6.1 Sol的主要功能

  • 智能體編程:在 DeepSWE v1.1 真實代碼庫工程任務上追平 GPT-6 Astra,比 GPT-6 Sol 提升 6.4 個百分點。
  • 電腦操作:OSWorld 2.0 計算機使用評測中比 GPT-6 Sol 高 7 個百分點,與 Astra 差距僅 2.1 個百分點。
  • 專業文檔處理:GDP.pdf 評測中超過 Claude Opus 5.5,單任務成本不到其一半。
  • 多步業務工作流:AutomationBench 上以中等推理強度比 Opus 5.5 高 2.2 個百分點,成本約爲其三分之一。
  • 科學工作流:Terminal-Bench Science 上單任務成本 5.47 美元,比 Opus 5.5 和 Astra 低超 75%。
  • 事實準確性:低推理強度下事實錯誤率從 11.4% 降至 7.7%,高推理強度下達 4.1%。
  • Ultrafast 高速檔:Token 生成速度最高可達標準版 8 倍,API 與 $500/月 Pro 檔可用。
  • 多檔位推理強度:支持從低到高的可調推理 effort,供用戶在成本與質量間取捨。

GPT-6.1 Sol的技術原理

  • 旗艦能力下放的模型定位:GPT-6.1 Sol 屬於 GPT-6 系列的中端推理模型,官方將 GPT-6 Astra 級別的能力通過後續訓練優化”下沉”到更低的成本區間,在保持推理模型架構的前提下,重點加強智能體編程、電腦操作、專業任務三類場景的 post-training。
  • 可調推理強度(Reasoning Effort)機制:模型支持多檔推理 effort 設置:低檔位響應快、成本低,適合簡單任務;最高檔會分配更多推理計算預算,在 DeepSWE、OSWorld、Terminal-Bench 等評測中官方均以最高檔報告成績。
  • 上下文緩存的成本優化:緩存輸入價格定爲每百萬 Token 0.10 美元,比標準輸入低 95%、比 GPT-6 Sol 再降 50%,是本次降價的真正核心。當智能體在多次請求間複用同一份上下文時,服務端可複用已緩存的 KV/prefix,只對新增的增量輸入計費。
  • Ultrafast 推理加速:Ultrafast 檔最高提供 8 倍於標準速度的 Token 生成,代價是更高的計費倍率(Codex 中約 6 倍價格)。

如何使用GPT-6.1 Sol

  • ChatGPT 入口使用:登錄 ChatGPT,在 ChatGPT Work 或 Codex 中選擇 GPT-6.1 Sol 模型(普通 Chat 暫未提供)。
  • API 調用:在代碼中將模型 ID 設爲 gpt-6.1-sol,用標準 Chat Completions 接口發起請求。
  • 設置推理強度:根據任務難度選擇 reasoning effort 檔位,低難度用低檔省成本,複雜任務用最高檔。
  • 啓用上下文緩存:跨請求複用系統提示和任務上下文,緩存輸入按 0.10 美元/百萬 Token 計費。
  • 需要極速時開 Ultrafast:通過 API 或 500 美元/月 Pro 檔啓用最高 8 倍速的生成。

GPT-6.1 Sol的核心優勢

  • 極致性價比:以 GPT-6 Astra 五分之一的標準 Token 價格提供接近旗艦的智能水平。
  • 智能體編程強:DeepSWE v1.1 真實代碼庫評測追平 Astra,比 GPT-6 Sol 提升 6.4 個百分點。
  • 電腦操作領先:OSWorld 2.0 評測距 Astra 僅 2.1 個百分點,單任務成本約爲其七分之一。
  • 專業任務超越競對:GDP.pdf 和 AutomationBench 評測中均超過 Claude Opus 5.5,成本僅爲其一半到三分之一。
  • 事實錯誤率更低:低推理強度下事實錯誤率從 11.4% 降至 7.7%,降幅約 32%。
  • 8 倍速 Ultrafast:高速檔下以接近此前 Astra 的費用獲得最高 8 倍生成速度。

GPT-6.1 Sol的同類競品對比

對比維度 GPT-6.1 Sol GPT-6 Astra
模型定位 能力/成本最優平衡的主力模型 綜合能力最強的旗艦
輸入價格/百萬Token $2.00 $10.00(爲其 5 倍)
緩存輸入 $0.10 $1.00(爲其 10 倍)
輸出價格 $10.00 $50.00(爲其 5 倍)
DeepSWE v1.1 編程 追平 Astra 基準線
OSWorld 2.0 計算機使用 距 Astra 2.1 分,成本約 1/7 基準線
Terminal-Bench Science 單任務 $5.47,得分未超 Astra 最高分 68.1%,單任務 $23.80
GDP.pdf 專業文檔 接近 Astra 業界領先性能,成本約 1/5 業界領先
事實錯誤率(高檔) 4.1% 4.0%(略優)
搜索工具故障披露 未披露率 2.1% 1.5%(略優)
Ultrafast 高速檔 有,最高 8 倍速 有,全球最快前沿模型檔

GPT-6.1 Sol的應用場景

  • App 全生命週期維護:開發者發佈應用後,由常駐 Agent 持續跟蹤用戶反饋、自動整理高頻問題、修復 Bug 並提交完整 PR 和改動視頻。
  • 產品研發跟進:新產品發佈期間,Agent 持續瞭解產品定位與團隊要求,在需求變更後自動更新發布材料、調整文檔並標記需人工確認的部分。
  • 科研數據分析:新實驗數據入庫後,自動重跑分析流程、調查異常值、更新論文圖表並同步修訂相關文字解釋。
  • 企業財務自動化:監控應收賬款,發現漏開發票時自動準備好發票文件,經人工確認後發出——OpenAI 已披露有早期測試用戶的 Dot 實際完成了這一任務。
  • 多渠道信息監控:定時檢查指定 Slack 頻道或郵件,將新發現自動彙總進共享的 ChatGPT Space 頁面並生成動態圖表,供團隊實時查看。
© 版權聲明

相關文章

暫無評論

暫無評論...