Claude Opus 5 – Anthropic 最新發布的旗艦級模型

Claude Opus 5是什麼

Claude Opus 5 是 Anthropic 最新發布的旗艦級模型,定位“接近 Fable 5 的前沿智能,價格約爲後者一半”,相比 Opus 4.8 在成本不變的前提下大幅提升性能,已成爲 Claude Max 默認模型、Claude Pro 上的最強選擇。 引入可調節的 effort 思考檔位,用戶能在更強推理與更低延遲、更省 token 之間權衡;在 Frontier-Bench、GDPval-AA、ARC-AGI 3、AutomationBench、OSWorld 2.0 等編程、知識工作、商業自動化和電腦操作評測中多項登頂,僅網絡安全等少數任務落後 Mythos 5。

Claude Opus 5 – Anthropic 最新發布的旗艦級模型

Claude Opus 5的主要功能

  • 可調 effort 思考檔位:支持 low、medium、high、xhigh、max 等檔位,調高獲得更強推理,調低則更快、更省 token,便於按任務平衡質量、速度與成本。
  • Agentic 編程能力:面向終端與軟件工程任務,在 Frontier-Bench v0.1 得分 43.3%,高於 Fable 5、Opus 4.8 與 GPT-5.6 Sol;官方稱相比 Opus 4.8 性能提升一倍以上且單任務成本更低。
  • 代碼協作優化:在 CursorBench 3.2 最高檔位下與 Fable 5 峯值僅差 0.5%,成本約一半;high、xhigh、max 檔位同預算表現領先其他模型。
  • 知識工作與寫作:覆蓋分析、研究、文檔、辦公類任務,GDPval-AA v2 得分 1861,領先 Fable 5、GPT-5.6 Sol 與 Opus 4.8。
  • 智能搜索與瀏覽:具備 agentic search 能力,BrowseComp 得分 90.8%,略高於 GPT-5.6 Sol 的 90.4%,可用於複雜資料檢索與綜合。
  • 電腦操作能力:在 OSWorld 2.0 得分 70.6%,高於 Fable 5 與 GPT-5.6 Sol,官方稱可用約三分之一成本超過 Fable 5 最好成績。
  • 商業流程自動化:可端到端完成商業任務,AutomationBench 通過率 26.0%,同成本下約爲次優模型 1.5 倍;最低 effort 檔完成任務數也超過所有競爭者。
  • 新問題求解:ARC-AGI 3 得分 30.2%,約爲第二名 GPT-5.6 Sol 的三倍,強調處理訓練中未見過任務的能力。
  • 科學研究輔助:生命科學評測全面超過 Opus 4.8,覆蓋結構生物學、有機化學、生物信息學;光譜推斷分子結構提升 10.2 個百分點,蛋白序列變異功能影響預測提升 7.7 個百分點。
  • 更主動也更審慎:官方定位爲更 proactive、更深思熟慮的模型,能減少來回確認、自我檢查並在任務中從錯誤恢復;同時強調安全護欄。
  • 高頻日常與產品集成:運行效率更高,適合日常使用;已成爲 Claude Max 默認模型,也是 Claude Pro 上可用的最高能力選擇,界面提供 “Opus 5 High” 等檔位入口。

如何使用Claude Opus 5

  • 訪問平台:打開 Claude 應用或網頁版,在模型選擇器中切換到 Claude Opus 5。
  • 按訂閱層級使用:Claude Max 已把 Opus 5 作爲默認模型;Claude Pro 用戶可作爲當前最高能力選擇。
  • 按任務調 effort 檔位:簡單問答、摘要、潤色用低檔位更快更省;代碼調試、複雜分析、研究任務調到 high、xhigh 或 max 以獲得更強推理。
  • 給清晰目標和約束:說明交付物、格式、字數、截止時間、可用工具與驗收標準,減少來回確認,發揮“更主動”的特點。
  • 編程場景:粘貼倉庫結構、報錯日誌、接口文檔和期望行爲,Opus 5 最強方向是定位問題、改代碼、跑測試並解釋取捨。
  • 知識工作:給背景資料、目標讀者和輸出模板,然後進行調研、提綱、初稿、校對與改寫;GDPval-AA v2 顯示其知識工作領先。
  • 搜索與綜述:要求“先檢索再歸納,標註來源,區分事實與推測”,對應其 agentic search 能力,BrowseComp 得分 90.8%。
  • 自動化流程:把重複性辦公流程拆成步驟、輸入、輸出和異常處理,讓它端到端執行;AutomationBench 顯示其同成本通過率約爲次優 1.5 倍。
  • 電腦操作類任務:明確允許操作的軟件、文件範圍和禁止動作,再讓進行執行;OSWorld 2.0 上 Opus 5 得分 70.6%。
  • 科研場景:用於結構生物學、有機化學、生物信息學等問題,例如光譜推斷分子結構、蛋白變異功能影響分析;但仍需專家複覈。
  • 控制成本:先用低檔位試跑,再對難任務升檔;長任務拆小批量執行,優先把 max effort 留給關鍵難題,因爲高檔位更聰明但更耗 token。

Claude Opus 5的核心優勢

  • 半價逼近旗艦:智能水平接近 Fable 5,但價格約爲後者一半;CursorBench 3.2 最高檔位與 Fable 5 峯值僅差 0.5%,成本卻約一半。
  • 加量不加價:相比 Opus 4.8,在成本不變前提下大幅提升性能,官方稱 Frontier-Bench 編程任務性能提升一倍以上且單任務成本更低。
  • 編程能力最突出:Frontier-Bench v0.1 得分 43.3%,高於 Fable 5 的 33.7%、GPT-5.6 Sol 的 34.4% 和 Opus 4.8 的 21.1%。
  • 同預算更能打:在 high、xhigh、max 檔位下,同等成本得分領先其他模型;官方敘事可概括爲“花一半的錢,完成接近 99% 的工作”。
  • effort 彈性稀缺:一個模型覆蓋從快到省到深度推理的多檔需求,低檔位可高頻日用,高檔位攻堅難題,成本曲線更可控。
  • 知識工作領先:GDPval-AA v2 得分 1861,超過 Fable 5、GPT-5.6 Sol 與 Opus 4.8,適合研究、分析、寫作與辦公決策。
  • 新問題求解躍升:ARC-AGI 3 得分 30.2%,約爲第二名 GPT-5.6 Sol 的三倍,說明面對陌生任務的泛化能力更強。
  • 自動化與電腦操作性價比高:AutomationBench 同成本通過率約爲次優 1.5 倍;OSWorld 2.0 用約三分之一成本即可超過 Fable 5 最好成績。
  • 搜索與綜合能力靠前:BrowseComp 90.8%,略高於 GPT-5.6 Sol 的 90.4%,適合複雜檢索、資料比對和綜述生成。
  • 科研能力增益明確:生命科學各項評測超 Opus 4.8,有機化學提升最大;光譜推斷分子結構 +10.2 個百分點,蛋白變異功能影響預測 +7.7 個百分點。

Claude Opus 5的項目地址

  • Claude Opus 5:https://www.anthropic.com/news/claude-opus-5

Claude Opus 5的同類競品對比

對比項 Claude Opus 5 Claude Fable 5 GPT-5.6 Sol
定位 高性價比旗艦:接近前沿智能,適合高頻日常與專業工作 更高階前沿模型,Opus 5 的主要“追平對象” 外部強競品,多項跑分進入第一梯隊
價格/成本 約爲 Fable 5 一半;相比 Opus 4.8 成本不變但性能大幅提升 價格約爲 Opus 5 兩倍 成本曲線整體弱於 Opus 5,多項同成本得分落後
Frontier-Bench v0.1 終端編程 43.3%,第一 33.7% 34.4%
CursorBench 3.2 max 檔與 Fable 5 峯值只差 0.5%,成本約一半 峯值最高,但成本更高 同預算下整體低於 Opus 5
GDPval-AA v2 知識工作 1861,第一 1747 1736
ARC-AGI-3 新問題求解 30.2%,約爲第二名三倍 7.8%
BrowseComp 智能搜索 90.8%,微幅第一 87.4% 90.4%
OSWorld 2.0 電腦操作 70.6%,第一;約三分之一成本可超 Fable 5 最好成績 66.1% 62.6%
AutomationBench 商業流程 26.0%,第一;同成本約爲次優 1.5 倍 17.4% 18.1%
DeepSWE v1.1 68.8% 69.7% 72.7%,該項第一
FrontierCode v1.1 53.4% 53.5%,微幅第一;也是官方加粗烏龍所在項 47.5%
HLE 多學科推理 無工具 56.3%,有工具 64.7% 無工具 56.5% 微勝,有工具 63.9%
Legal / Health Legal 11.7%;Health 59.8% Legal 13.3% 更強;Health 表中未列 Fable,Mythos 5 爲 66.0% Legal 2.5%;Health 60.5%
更適合 追求“接近旗艦 + 控制成本”的編程、知識工作、自動化、科研日常用戶 預算充足、追求極限峯值能力的高難任務 已在 OpenAI 生態內,或看重 DeepSWE/Health 個別強項的團隊

Claude Opus 5的應用場景

  • 軟件開發與重構:適合需求澄清、代碼生成、bug 定位、測試補全、重構解釋和終端命令輔助;Frontier-Bench 終端編程 43.3% 登頂,是其最強場景。
  • AI 編程助手日常化:在 Cursor 類工作流裏做長任務拆解、跨文件修改和迴歸檢查;CursorBench 最高檔接近 Fable 5 峯值但成本約半,適合高頻調用。
  • 企業知識工作:寫方案、做研究、整理會議紀要、生成彙報、改簡歷/公文/商業文檔;GDPval-AA v2 1861 領先,適合辦公室高頻使用。
  • 深度檢索與綜述:給課題後自動檢索、比對來源、歸納結論並標註不確定性;BrowseComp 90.8%,適合競品調研、行業研究、文獻梳理。
  • 商業流程自動化:把表單處理、數據搬運、審批草稿、客戶跟進、報表生成等流程端到端跑起來;AutomationBench 同成本通過率約爲次優 1.5 倍。
  • 電腦操作與輕量 RPA:在明確權限邊界內操作軟件、整理文件、批量處理表格和網頁流程;OSWorld 2.0 70.6%,且成本效率優於 Fable 5。

Claude Opus 5的常見問題

Q:和 Claude Fable 5 怎麼選?
A:要極限峯值、預算充足選 Fable 5;要性價比和日常高頻選 Opus 5。CursorBench 最高檔下 Opus 5 與 Fable 5 峯值只差 0.5%,成本約一半。


Q:它和 Opus 4.8 比提升在哪?
A:官方口徑是成本不變、性能大幅提升;Frontier-Bench 編程任務中得分從 21.1% 到 43.3%,並稱性能提升一倍以上、單任務成本更低。


Q:Claude 現在的模型層級怎麼理解?
A:可粗略理解爲 Opus 5 主打高性價比旗艦,Fable 5 更高階,Mythos 5 在少數高難項更強;Opus 5 僅網絡安全等任務明確落後 Mythos 5。


Q:在哪裏能用 Claude Opus 5?
A:Claude Max 已將其作爲默認模型;Claude Pro 用戶可把它作爲最高能力選擇。界面中可見類似 “Opus 5 High” 的檔位入口。


Q:effort 檔位是什麼,怎麼用?
A:effort 是思考強度檔位,調高更聰明、調低更快更省 token。簡單任務用低檔,代碼、研究、自動化等難任務再升到 high/xhigh/max。


Q:最擅長什麼?
A:最強是軟件工程與終端編程;其次是知識工作、智能搜索、商業流程自動化、電腦操作和新問題求解。對應 Frontier-Bench、GDPval-AA、BrowseComp、AutomationBench、OSWorld、ARC-AGI 3 多項領先。
© 版權聲明

相關文章

暫無評論

暫無評論...