Claude Opus 5 反超 Fable 5 了吗:官方基准、API 价格与仓库实测方法
编辑标准与来源政策: 编辑标准, 团队. 内容均链至原始来源,见 方法论.
Last checked: 2026-07-27.
先说结论:有几项赢了,但不能写成全面反超
Claude Opus 5 在 2026 年 7 月 24 日上线,API 型号是 claude-opus-5,基础价格为 $5/M 输入、$25/M 输出。它最吸引人的地方,不是某一张“总榜”,而是用 Fable 5 一半的标价,在几个重要任务上逼近甚至超过后者。
但“Opus 5 反超 Fable 5”只能算一个有条件成立的标题。Anthropic 公布的 Frontier-Bench v0.1 和 OSWorld 2.0 结果里,Opus 5 确实领先;到了 CursorBench 3.2,最高推理档与 Fable 5 峰值相差不到 0.5%,Cursor 的措辞仍是 just under Fable 5。所以更准确的说法是:Opus 5 把性价比和部分任务上限推高了,不能写成全面反超。
| 三项测试 | Opus 5 的结果 | 这项测试主要在看什么 |
|---|---|---|
| Frontier-Bench v0.1 | Anthropic 所述运行中领先其他模型 | 在 mini-SWE-agent、GKE 环境处理真实软件任务;结果按 5 次尝试的平均奖励计算 |
| CursorBench 3.2 | 最高推理档距 Fable 5 峰值不到 0.5% | Cursor 自己的编码任务;这里仍是略低于 Fable 5 |
| OSWorld 2.0 | 以略高于三分之一的成本超过 Fable 5 最佳结果 | 让模型操作电脑界面的能力,不代表所有编码任务 |

图:Anthropic Claude Opus 5 发布页,访问于 2026-07-27。本文的价格与基准描述均回到发布页、模型页和系统卡核对。
真正值得注意的是价格
Fable 5 的基础 API 价格是 $10/M 输入、$50/M 输出,刚好是 Opus 5 的两倍。以一组 24 个仓库任务为例,如果总共消耗 18M 输入 token 和 1.2M 输出 token,按目录价计算,Opus 5 约为 $120,Fable 5 约为 $240。
这笔账很直观,但不能把它误读成“同样花费一定获得两倍产出”。不同模型可能使用不同数量的 token,也可能在重试、拒绝或工具调用上表现不同。真正该比较的是:完成同一组任务,最终通过了多少测试,人工返工了多久,总账单是多少。
Fast mode 也要单独算。Anthropic 表示它大约能达到默认模式 2.5 倍的速度,价格则是基础价的 2 倍。对于等待成本高的交互任务,这可能划算;对于可以排队跑的离线任务,默认模式可能更合适。速度数字来自厂商测量,团队仍要在自己的仓库里记录首 token、总耗时和失败重试。
别只看 token 单价,要算有效完成成本
选型表里最好再加一列“有效完成成本”:模型总账单,加上维护者返工时间的内部成本,再除以最终通过验收的任务数。这个指标不会因为模型生成了补丁就提前记为成功,只有测试通过、改动范围可接受、维护者确认能合并的任务才进入分母。
例如,同一轮测试中,一个模型账单更低,却需要频繁补上下文、重跑工具或人工修正无关改动,它的真实成本可能反而更高。相反,Fast mode 即使目录价翻倍,只要显著缩短高价值交互任务的等待时间,也可能值得使用。团队因此应同时保留四条记录:模型费用、机器运行时间、人工返工分钟和通过验收的任务数。
这也解释了为什么公开 benchmark 只能负责筛选候选者。Frontier-Bench、CursorBench 和 OSWorld 的任务环境不同,不能被压成一个平均分;内部测试则要把“写出答案”与“交付可合并结果”分开计数。若模型在某类任务上连续失败,不要用其他任务的高分抵消,直接把该任务类型列为暂不迁移。
支付服务仓库:24 个任务怎么公平比较
RadarAI 建议用一个固定提交的支付服务仓库,准备 24 个缺陷修复与跨文件改造任务。两个模型必须看到完全相同的代码、任务描述和测试环境,不能一个用新提交、另一个用旧提交。
每次运行记录精确 model ID、是否开启 Fast mode、输入输出 token、补丁内容和可重建账单。补丁落地后先跑原有测试,再跑针对缺陷新增的回归测试,最后由维护者检查有没有顺手修改无关文件。测试没跑、账单还原不出来,或者自动 fallback 把拒绝隐藏掉,这条结果就不进入比较。
最终表格不必复杂:任务是否完成、测试是否通过、人工返工分钟、无关文件数和真实成本。这样得到的结果,才比一句“某模型登顶”更能指导选型。
现在怎么选
如果团队已经在使用 Fable 5,Opus 5 最值得做的是一次同任务、同提交、同验收的替换测试,而不是立刻全量切换。CursorBench 告诉我们两者在高强度编码任务上非常接近;Frontier-Bench 和 OSWorld 则提示 Opus 5 在仓库任务与电脑操作上有潜力。价格减半让这次测试很有价值,但最终决定仍应来自自己的补丁、测试和账单。