根據 Artificial Analysis 最新基準測試,Claude Opus 5 在智慧指數上取得 61 分,僅以 1 分之差領先 Fable 5 的 60 分成績。GPT-5.6 Sol 得分 59,Kimi K3 得分 57。
Opus 5 平均每個任務成本 2.03 美元,較 Fable 5 的 2.75 美元低 26%。該模型在 GDPval-AA v2 與 AA-Briefcase 的知識工作測試中拿下最高評估,並在與 Claude Code 搭配時於程式設計 Agent 指數中排名第一。其在 Terminal-Bench v2.1 上取得 89%,幾乎與 GPT-5.6 Sol 相當。