2026 年 7 月 24 日——Anthropic 在不到两个月里发布了第四款模型。Claude Opus 5 来了。
一句话概括:Fable 5 级别的推理能力,半价。但让开发者社区真正炸锅的,不是性价比,而是一个前所未有的控制杆——Effort Toggle。调低,Opus 5 干活飞快还省 Token。调高,它就变成一台不惜代价给出正确答案的机器。
Opus 5 是 Anthropic 的刻度尺——多数时候不需要花旗舰模型的钱,但需要的时候,随时切到”战场模式”。
Claude 5 家族最后一块拼图
2026 年 6 月,Anthropic 一口气砸出 Mythos 5、Fable 5 和 Sonnet 5。定位泾渭分明:
- Mythos 5:天花板,但只对少数机构开放
- Fable 5:公开旗舰,定价高昂、带 30 天数据留存期
- Sonnet 5:性价比之王,接近 Opus 4.8、价格亲民
但中间有缺口。Mythos 5 看不着。Fable 5 买得起但跑不起。Sonnet 5 够用但啃不动硬骨头。
Opus 5 就是填这个坑的。 官方口径是”close to the frontier intelligence of Claude Fable 5 at half the price”——够走近旗舰,又能天天跑。在非榜首位置,它可能是 Claude 5 家族里最适合生产环境批量部署的模型。
基准成绩:两个维度直接赢了旗舰
数据先甩出来。即使看 Anthropic 官方成绩和 codersera.com 的整理,一个惊人事实很清楚:Opus 5 在两项基准上正面压过 Fable 5 和 GPT-5.6 Sol。
| 基准 | Opus 5 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Frontier-Bench v0.1(Agent 编程) | 43.3% | 33.7% | 34.4% |
| ARC-AGI-3(新问题求解) | 30.2% | — | 7.8% |
| GDPval-AA v2(知识工作 Elo) | 1,861 | 1,747 | 1,736 |
| SWE-bench Pro | 79.2% | 80.0% | — |
Frontier-Bench v0.1 衡量的是模型在多步自主编码中规划、纠错和完成 Agent 任务的能力——不是”补全这段代码”,是真正的自动化。Opus 5 的 43.3% 超出 Fable 5 近 10 个点,而且成本是一半。
ARC-AGI-3 更是差距悬殊。这个基准测”未见过的新问题求解”——背题没用,得真理解结构。Opus 5 拿到 30.2%,目前第二名只有 7.8%。差了一个量级。这意味着 Opus 5 面对陌生问题时的应变力跨上了新台阶。
SWE-bench Pro 是唯一维度 Opus 5 没夺冠——79.2% 对 80.0%,不到 1 个点。可忽略。
「努力值」旋钮:财务和工程师都开心的设计
Opus 5 最独特的卖点不是数字,是 Effort Toggle——低/中/高三档推理力度。
低档: 最少推理,速度快、费用低。Lint 修复、短摘要、单函数开发。
中档: 默认平衡,大部分日常知识工作。
高档: 不设上限的推理时间。架构决策、复杂 Bug 定位、安全分析。
为什么这个设计聪明?把”省钱”从被迫妥协变成了可控行为。团队把 80% 的日常请求走低/中档,20% 硬骨头走高——总花费大幅低于”全高档”,但关键决策点质量不降。
定价跟 Opus 4.8 一样:每百万输入 Token $5、输出 $25。同样的钱,一代能力跳跃。加 1M Token 上下文(够装整个代码库),生产部署门槛远低于 Fable 5。
还有一个被忽略的细节:和 Fable 5 不同,Opus 5 不受 30 天数据留存政策约束。对关注隐私的团队,这是决定性差异。
比 Opus 4.8 提升多少?
Opus 4.8 是 2026 年 5 月 28 日发的,才过去两个月。但 Opus 5 是代际跳。
自我验证。 Anthropic 强调 Opus 5 擅长”验证自己的输出并迭代到成功”。案例:从不完整 Prompt 出发,自己搭建计算机视觉管线——补需求、测试、修错误,全程不需要人在中间说”重做”。Agent 工作流里”改三遍才过”的回合数大幅减少。
生命科学 +10 分以上。 有机化学等评估中全面超越 Opus 4.8,成绩提升超 10 个百分点。Anthropic 称它为”最强公开科研模型”。
安全默认值更强。 比 4.8 更强的网络护栏——可检查源代码但不对编译后二进制做漏洞扫描。自动化审计打出了”迄今最对齐”的评分。
Automatic Fallbacks。 安全分类器误报导致请求被拒时,Platform 自动降级到稍弱模型仍返回可用响应——自动化流水线不会被偶尔的假阳性卡死。
在哪用?怎么用?
- Claude.ai:Claude Max 默认模型,Pro 最高能力选项
- Claude Code:终端 Agent 编程,支持 Fast Mode
- Claude API/Platform:
claude-opus-5,effort 参数可选低/中/高 - Fast Mode:$10/$50(标准 $5/$25),约快 2.5 倍,适合时延敏感场景
- 云平台:AWS Bedrock、Google Vertex AI、Microsoft Foundry 同步上线
选 Opus 5 还是 Fable 5 还是 Mythos 5?
| 场景 | 推荐 | 理由 |
|---|---|---|
| 日常编程/Agent | Opus 5 | 性价比最高,多基准追平/超过 Fable 5 |
| 24h+ 长周期 Agent | Fable 5 | 跑几天不衰减,Opus 目前还没到这耐力级 |
| 科学前沿 | Opus 5 / Fable 5 | 生命科学 Opus 5 分更高 |
| 渗透/安全挖掘 | Mythos 5 | 唯一选项,需审批 |
| 高数据安全需求 | Opus 5 | 无 30 天留存限制 |
| 省钱优先 | Sonnet 5 | 日常轻量够用 |
三个关键观察:
-
性价比成为模型竞争下一战场。 Anthropic、OpenAI、Moonshot(月之暗面 Kimi K3)、DeepSeek——2026 上半年每家都在做同一件事:把旗舰能力压缩到更便宜的模型。Opus 5 是这条线的最新里程碑。
-
“努力值”可能是未来标配。 之前的模型要么”扩展思考”要么”关”。Opus 5 把量程分成三档,精度和成本的 tradeoff 从一个开关变成旋钮。大概率被其他实验室效仿。
-
安全合规变成产品设计。 无 30 天留存、85% 更低误报率——这不是附加项,而是决定一个团队能否在生产环境安心部署模型的门槛。

评论0