GPT-6.1 Sol是什麼
GPT-6.1 Sol是OpenAI推出的新一代主力模型,作爲GPT-6 Sol的升級版,以Astra旗艦五分之一的Token價格實現接近後者的智能水平。GPT-6.1 Sol專注於智能體編程、電腦操作和專業工作三類高消耗場景,在真實代碼庫工程任務上追平Astra,在OSWorld電腦操作評測中僅落後2.1個百分點,同時將緩存輸入價格壓至每百萬Token僅0.1美元。官方爲模型配套了最高8倍速的Ultrafast檔位,現已通過API和ChatWork、Codex面向付費用戶開放。

GPT-6.1 Sol的主要功能
-
智能體編程:在 DeepSWE v1.1 真實代碼庫工程任務上追平 GPT-6 Astra,比 GPT-6 Sol 提升 6.4 個百分點。
-
電腦操作:OSWorld 2.0 計算機使用評測中比 GPT-6 Sol 高 7 個百分點,與 Astra 差距僅 2.1 個百分點。
-
專業文檔處理:GDP.pdf 評測中超過 Claude Opus 5.5,單任務成本不到其一半。
-
多步業務工作流:AutomationBench 上以中等推理強度比 Opus 5.5 高 2.2 個百分點,成本約爲其三分之一。
-
科學工作流:Terminal-Bench Science 上單任務成本 5.47 美元,比 Opus 5.5 和 Astra 低超 75%。
-
事實準確性:低推理強度下事實錯誤率從 11.4% 降至 7.7%,高推理強度下達 4.1%。
-
Ultrafast 高速檔:Token 生成速度最高可達標準版 8 倍,API 與 $500/月 Pro 檔可用。
-
多檔位推理強度:支持從低到高的可調推理 effort,供用戶在成本與質量間取捨。
GPT-6.1 Sol的技術原理
- 旗艦能力下放的模型定位:GPT-6.1 Sol 屬於 GPT-6 系列的中端推理模型,官方將 GPT-6 Astra 級別的能力通過後續訓練優化”下沉”到更低的成本區間,在保持推理模型架構的前提下,重點加強智能體編程、電腦操作、專業任務三類場景的 post-training。
- 可調推理強度(Reasoning Effort)機制:模型支持多檔推理 effort 設置:低檔位響應快、成本低,適合簡單任務;最高檔會分配更多推理計算預算,在 DeepSWE、OSWorld、Terminal-Bench 等評測中官方均以最高檔報告成績。
- 上下文緩存的成本優化:緩存輸入價格定爲每百萬 Token 0.10 美元,比標準輸入低 95%、比 GPT-6 Sol 再降 50%,是本次降價的真正核心。當智能體在多次請求間複用同一份上下文時,服務端可複用已緩存的 KV/prefix,只對新增的增量輸入計費。
- Ultrafast 推理加速:Ultrafast 檔最高提供 8 倍於標準速度的 Token 生成,代價是更高的計費倍率(Codex 中約 6 倍價格)。
如何使用GPT-6.1 Sol
- ChatGPT 入口使用:登錄 ChatGPT,在 ChatGPT Work 或 Codex 中選擇 GPT-6.1 Sol 模型(普通 Chat 暫未提供)。
- API 調用:在代碼中將模型 ID 設爲
gpt-6.1-sol,用標準 Chat Completions 接口發起請求。 - 設置推理強度:根據任務難度選擇 reasoning effort 檔位,低難度用低檔省成本,複雜任務用最高檔。
- 啓用上下文緩存:跨請求複用系統提示和任務上下文,緩存輸入按 0.10 美元/百萬 Token 計費。
- 需要極速時開 Ultrafast:通過 API 或 500 美元/月 Pro 檔啓用最高 8 倍速的生成。
GPT-6.1 Sol的核心優勢
-
極致性價比:以 GPT-6 Astra 五分之一的標準 Token 價格提供接近旗艦的智能水平。
-
智能體編程強:DeepSWE v1.1 真實代碼庫評測追平 Astra,比 GPT-6 Sol 提升 6.4 個百分點。
-
電腦操作領先:OSWorld 2.0 評測距 Astra 僅 2.1 個百分點,單任務成本約爲其七分之一。
-
專業任務超越競對:GDP.pdf 和 AutomationBench 評測中均超過 Claude Opus 5.5,成本僅爲其一半到三分之一。
-
事實錯誤率更低:低推理強度下事實錯誤率從 11.4% 降至 7.7%,降幅約 32%。
-
8 倍速 Ultrafast:高速檔下以接近此前 Astra 的費用獲得最高 8 倍生成速度。
GPT-6.1 Sol的同類競品對比
| 對比維度 | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|
| 模型定位 | 能力/成本最優平衡的主力模型 | 綜合能力最強的旗艦 |
| 輸入價格/百萬Token | $2.00 | $10.00(爲其 5 倍) |
| 緩存輸入 | $0.10 | $1.00(爲其 10 倍) |
| 輸出價格 | $10.00 | $50.00(爲其 5 倍) |
| DeepSWE v1.1 編程 | 追平 Astra | 基準線 |
| OSWorld 2.0 計算機使用 | 距 Astra 2.1 分,成本約 1/7 | 基準線 |
| Terminal-Bench Science | 單任務 $5.47,得分未超 Astra | 最高分 68.1%,單任務 $23.80 |
| GDP.pdf 專業文檔 | 接近 Astra 業界領先性能,成本約 1/5 | 業界領先 |
| 事實錯誤率(高檔) | 4.1% | 4.0%(略優) |
| 搜索工具故障披露 | 未披露率 2.1% | 1.5%(略優) |
| Ultrafast 高速檔 | 有,最高 8 倍速 | 有,全球最快前沿模型檔 |
GPT-6.1 Sol的應用場景
-
App 全生命週期維護:開發者發佈應用後,由常駐 Agent 持續跟蹤用戶反饋、自動整理高頻問題、修復 Bug 並提交完整 PR 和改動視頻。
-
產品研發跟進:新產品發佈期間,Agent 持續瞭解產品定位與團隊要求,在需求變更後自動更新發布材料、調整文檔並標記需人工確認的部分。
-
科研數據分析:新實驗數據入庫後,自動重跑分析流程、調查異常值、更新論文圖表並同步修訂相關文字解釋。
-
企業財務自動化:監控應收賬款,發現漏開發票時自動準備好發票文件,經人工確認後發出——OpenAI 已披露有早期測試用戶的 Dot 實際完成了這一任務。
-
多渠道信息監控:定時檢查指定 Slack 頻道或郵件,將新發現自動彙總進共享的 ChatGPT Space 頁面並生成動態圖表,供團隊實時查看。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...