Claude Sonnet 5 与 Opus 5:翻一倍的价格什么时候值得?
Anthropic 的 Claude 5 这一代分两次发布,相隔约四周。Sonnet 5 能接住大多数人本想交给 Opus 的活,本文讲清差距真正出现在哪里。

Anthropic 在 2026 年 6 月 30 日发布 Claude Sonnet 5,四周后的 7 月 24 日发布 Claude Opus 5。在 FrameTide 里,两者每条消息分别是 50 和 100 积分 —— 这是全表中同一家实验室内部差距最大的一组。
有意思的问题不是"哪个更强"。Opus 更强。问题是这个差距多久才真正改变一次你的结果 —— 因为不管改不改变,你每条消息都在为它付费。
数字
| Claude Sonnet 5 | Claude Opus 5 | |
|---|---|---|
| 发布时间 | 2026 年 6 月 30 日 | 2026 年 7 月 24 日 |
| API 价格 | 每百万 token $2 / $10 | 每百万 token $5 / $25 |
| FrameTide 积分 | 50 | 100 |
| 上下文 | 输入 100 万,输出 12.8 万 | 100 万 |
| SWE-bench Verified | 72.7% | 更高,接近前沿水平 |
| 知识截止 | 更早 | 2026 年 5 月 |
Sonnet 5 这一代最亮眼的提升在智能体方向:Terminal-bench 从 Sonnet 4.6 的 55.4% 提到 76.1%,在真实终端里的多步任务上涨了 20 分。同期 SWE-bench Verified 从 62.3% 提到 72.7%。
Opus 5 的卖点不一样。它相对 Sonnet 5 并不是跑分上的大跨越,而是一个更认真检查自己工作、知识截止更新、在长尾情况下更稳的模型;而 $5/$25 的价格,比它对标的其他前沿模型要低。
Sonnet 5 就够用的场景
对大多数工作来说,它确实够。Sonnet 5 能接住:
- 你合并前会 review 的代码;
- 有真实读者、还要改几轮的文案;
- 长文档上的研究和总结 —— 100 万上下文和 Opus 是一样的;
- 带工具调用的智能体任务,这正是它 Terminal-bench 大涨所衡量的;
- 任何"你会先读一遍再照做"的产出。
最后一条才是真正的分界线。如果反正有人会仔细读结果,那么 Opus 多出来的那层自我校验,边际价值就很小 —— 你就是那层校验。
什么时候值得再花 50 积分
三种情况,而且比多数人以为的窄:
你不会去检查产出。 跨四十个文件的重构、一个迁移脚本、一次批量转换。如果你打算不逐行读就接受结果,那就买那个会自己检查的模型。
这个任务"错得不明显"的可能性很多。 法律或财务表述、有下游连锁影响的架构决策,以及任何"看起来对但其实错"比"明显错"代价更高的场合。明显的失败很便宜,有说服力的失败不便宜。
时效性重要。 Opus 5 的知识截止在 2026 年 5 月,明显更新。面对迭代很快的库和 API,这不是锦上添花,而是"能跑的代码"和"很自信但已经过时的代码"之间的差别。
除这三类之外,诚实的答案是:Sonnet 5 产出的东西,你多半分辨不出和 Opus 5 有什么可靠差别 —— 而你为验证这件事只花了一半的钱。
一个能替你拍板的测试
不要跑基准测试,跑这个:
- 从你真实的待办里挑十个任务,不要用玩具提示词。
- 每个都在两个模型上跑一遍。
- 在不知道谁是谁的情况下评审这二十份产出。
- 数一数有多少次你选了 Opus 那份,并且这个差别会改变你最终交付的东西。
如果这个数小于三,那你应该把 50 积分当默认、100 积分当应急出口 —— 这是多数团队的正确配置。如果大于七,说明你的工作确实活在长尾里,Opus 值得常驻。
中间结果(四到六)通常意味着差距集中在某一类任务上。把那一类找出来,单独路由给 Opus,其余的留在 Sonnet。
它们在整个阵容里的位置
50 和 100 积分是 FrameTide 里最贵的两个模型,所以真正该比的不是 Sonnet 对 Opus,而是 Anthropic 对所有更便宜的选项。
- 对比 GPT-5.6 Sol(40)。 在这批模型里 Sol 的 Terminal-Bench 2.1 领先。如果你的活是智能体编码而不是写作,它是更便宜的前沿选项。
- 对比 DeepSeek V4 Pro(8)。 用 Opus 十六分之一的价格拿到接近前沿的编码分数。反正你都要 review 的代码,先试它,再判断是不是真的需要 Anthropic。
- 对比 Kimi K3(8)。 在前端代码这一项上领跑开源模型。在自己的主场,它的表现远高于价格所暗示的位置。
Anthropic 真正的优势是文字质量和判断力 —— 这两样最难被基准测试衡量,也最容易被人感觉到。给人读的东西,值得为它付费;给机器执行的东西,就没那么值。
一句话总结
把 Sonnet 5 设成默认,把 Opus 5 当成需要主动触发的例外:不会复核的批量改动、"错得不明显代价很高"的判断,以及依赖最新知识的任务。全程用 Opus,等于把开销翻倍去买一层你本来就自己在做的校验。
资料来源
用 Claude Sonnet 5 开始创作
打开 FrameTide 创作助手时会自动选中 Claude Sonnet 5,可以直接处理自己的创作任务。