7月24号晚上我刷到一条消息Anthropic 发了 Claude Opus 5定价 $5/$25——跟 Opus 4.8 一个价正好是 Fable 5$10/$50的一半。评论区已经炸了有人说「半价就能打平 Fable 5」有人连夜跑 benchmark还有人翻出 6 月才发的 Fable 5 说「这波背刺来得太快」。我的第一反应是Fable 5 的 SWE-bench Pro 可是 80.3%当时是全公开模型的最高分。半价的 Opus 5 凭什么追是官方宣传还是真有本事用了两周跑了 3 个真实任务、核了 4 组基准数据之后我的结论是这不是营销话术Opus 5 确实把「能力天花板」和「价格地板」拉到了同一层——但它不是 Fable 5 的平替它是另一套取舍逻辑。这篇文章把数据摊开说清楚你到底该换谁。一、先看总表三款旗舰的价格与基准格局先明确参赛选手Claude Opus 57/24 发布$5/$25、Claude Fable 56/9 发布$10/$50、GPT-5.6 SolOpenAI 旗舰$5/$30。三款都是各家的编程/Agent 主力价格和核心指标如下维度Claude Opus 5Claude Fable 5GPT-5.6 Sol发布时间2026-07-242026-06-092026-061M上下文版Input 价格 ($/M)$5$10$5Output 价格 ($/M)$25$50$30SWE-bench Verified未公布实测追平Fable95.0%~85%SWE-bench Pro未公布实测约80%80.3%64.6%Coding Agent Index未公布77.280Terminal-Bench 2.1未公布83.1%88.8%Ultra 91.9%上下文窗口1M200K–1M1M安全拦截触发率比 Fable 5 低约 85%较高部分无害请求被拦常规读这张表有 3 个关键信息价格上 Opus 5 和 GPT-5.6 Sol 同一档$5 起步Fable 5 是独一档的贵。按 2:1 的输入输出混合比Opus 5 混合成本约 $11.7/MFable 5 约 $23.3/M——正好差一倍。Fable 5 的纸面编程分还是最高SWE-bench Pro 80.3%但 Opus 5 官方没有公布 SWE-bench 数据只有第三方实测302.AI 基准实验室等显示「半价追平」。GPT-5.6 Sol 的真正强项不在 SWE-bench在 Terminal-Bench 和 Agent 效率——它用不到 Fable 5 一半的输出 token 拿到 Coding Agent Index 80 分。这是三款模型里最容易误读的一张表。下面逐个维度拆。二、维度一真实编程能力——SWE-bench 到底谁说了算SWE-bench Pro 是拿真实 GitHub issue 端到端跑、由仓库维护者给标准答案的基准比纯代码生成题靠谱得多。当前公开数据模型SWE-bench ProSWE-bench VerifiedFrontierCode DiamondClaude Fable 580.3%95.0%29.3%Claude Opus 4.869.2%88.6%13.4%GPT-5.6 Sol64.6%——这里有个有意思的细节Fable 5 在 FrontierCode Diamond 上 29.3%是 Opus 4.813.4%的两倍多。这个基准考的不是「能不能写出能跑的代码」而是「写出来的代码维护者愿不愿意接受」——工程品味、长期任务里的稳定性。Fable 5 在这个维度上的领先是断层的。那 Opus 5 呢Anthropic 官方没放 SWE-bench 数字但放了一个更狠的案例Frontier-Bench 有一道题给 Opus 5 一张机械零件的图纸要求它写代码用 FreeCAD 把零件重建出来而且不给任何直接看图的方式。Opus 5 自己写了一套计算机视觉管道从像素里提取几何数据完成重建反复成功同样的设定下其他模型试了五次都没做出来。另一个案例是开源包管理器的真实 bug社区提交的补丁只处理了表面症状Opus 5 顺藤摸瓜找到底层原因把边缘情况一起修了。我的实测3 个真实任务之一给两个模型同一个「把 Python 2 老项目迁移到 Python 3 加 CI」的任务——Fable 5 一次通过Opus 5 一次通过GPT-5.6 Sol 一次通过但多问了我两个澄清问题。日常编码场景三款没有体感差异差异全在长任务和工程交付上。三、维度二Agent 工程能力——「自己验证自己」才是这代的分水岭这是我这次评测收获最大的维度。过去的编程模型是「生成器」你给任务它给代码你自己验证。这一代旗舰的分水岭变成了——模型会不会自己验证自己的输出。量子位报道的博主 Victor M 做过一次硬核自检演示照着波音 747 的公开数据用代码在浏览器里重建一架能转能看的 3D 模型。Fable 542 分钟交货4 个文件约 1000 行代码Puppeteer 渲染管线跑了 17 轮渲染、检查 54 张截图——验证方式靠肉眼看图对不对。Opus 571 分钟20 个模块约 4000 行代码Playwright 渲染管线25 套镜头预设还多写了一个测量脚本——验证方式是从渲染画面里提取正射轮廓算出翼展、轴距、机翼前缘扫掠角等 14 项指标逐项和波音 747-400 的公开数据核对公差。Fable 5 交货快了 40%但它从头到尾没拿建好的模型反过来量过数据对不对。Opus 5 慢是因为它把「验证」写进了流程前 43 分钟只渲染没贴皮的素模确认轮廓过关才上涂装中途加调试参数能单独渲染子部件排查问题最后把 6 个视角拼成一张联系表一次看完。翻译成人话Fable 5 是「交活快、但你得自己验收」Opus 5 是「交活慢一点、但自带验收报告」。对于跑几小时的长 Agent 任务这个差异决定了你半夜要不要爬起来盯它。Terminal-Bench 2.1命令行工作流的公开数据也印证了格局GPT-5.6 Sol 88.8%Ultra 模式 91.9%领跑Fable 5 83.1%Opus 4.8 74.6%。OpenAI 公布 Sol 在 Coding Agent Index 拿 80 分时特别强调用的输出 token 不到 Fable 5 的一半、时间不到一半、成本低约三分之一。GPT-5.6 Sol 是「又快又省」路线的代表代价是 SWE-bench 类长程修复任务明显落后。四、维度三安全护栏、IMO 与隐藏成本——容易被忽略的 3 个细节1. 安全拦截率。Fable 5 为了公开 Mythos 级能力叠了三道安全分类器网络安全、生物化学、蒸馏攻击触发时静默回退到 Opus 4.8。官方估计平均触发率小于 5%但实际使用中「无害请求被拦」的抱怨不少——它太保守了。Opus 5 的预计触发拦截频率比 Fable 5 低了约 85%很多在 Fable 5 上要绕圈子的问题Opus 5 直接答。对普通开发者来说这体验差距比 benchmark 数字更真实。2. IMO 2026 满分。Opus 5 在今年 IMO 2026 竞赛取得满分而且没用任何外部工具。虽然数学能力不等于编程能力但说明这代模型的基础推理确实到了新高度。3. 隐藏成本token 效率。单价只是账本的一半。Fable 5 虽然贵但 Anthropic 的数据显示它比 Opus 4.8 少用 25-30% 的 Agent 轮次Opus 4.8 本身又比 4.7 少 35% 的输出 token。Opus 5 延续了这个路线——Anthropic 发布当天顺手把 Claude Code 的系统提示词删了超过 80%编码评测成绩没有任何下降。判断成本不能只看 $/M要看「每完成一个任务烧多少 token」。这也是为什么我建议你直接用下面的代码在自己项目里跑一轮# 用同一个任务分别调用三个模型对比 token 消耗和完成质量# 依赖: pip install openai anthropicimporttime TASK重构这个模块拆分 god class补单元测试输出 diffdefbench_openai(model:str):fromopenaiimportOpenAI cOpenAI(api_keysk-...)t0time.time()rc.responses.create(modelmodel,inputTASK)returnr.output_text,r.usage.total_tokens,time.time()-t0defbench_anthropic(model:str):importanthropic canthropic.Anthropic(api_keysk-ant-...)t0time.time()rc.messages.create(modelmodel,max_tokens8192,messages[{role:user,content:TASK}])usager.usagereturnr.content[0].text,usage.input_tokensusage.output_tokens,time.time()-t0# 三款模型跑同一任务forlabel,fnin[(GPT-5.6 Sol,lambda:bench_openai(gpt-5.6-sol)),(Claude Opus 5,lambda:bench_anthropic(claude-opus-5)),(Claude Fable 5,lambda:bench_anthropic(claude-fable-5)),]:text,tokens,secfn()print(f{label}:{tokens}tokens,{sec:.1f}s,{len(text)}chars)跑完你会发现同样的任务三款的 token 消耗能差 2-3 倍。这才是选型的真正依据。五、选型建议按场景分不按名气选日常编码、写业务代码、改 bug80% 的开发场景→ Claude Opus 5 或 GPT-5.6 Sol。两者同价$5 起步日常体感差距极小。已经在用 OpenAI SDK 的选 Sol零迁移成本模型名一改就行想要更少的安全拦截、更主动的自我验证选 Opus 5。这一档不需要犹豫Fable 5 的钱花在这里纯属浪费。长程 Agent 任务、跨代码库迁移、复杂 PR review → Claude Fable 5预算充足或 Opus 5预算敏感。Fable 5 的 SWE-bench Pro 80.3% 和 FrontierCode 断层领先是真实优势任务越难、越长溢价越值。但 Opus 5 的「自验证」能力在长任务里能帮你省下大量人工盯守时间——如果你团队每个长任务都要人复审Opus 5 的实际 TCO 可能更低。我的建议先拿最难的一个历史任务各跑一遍看谁的输出需要的人工介入最少别只看单价。高频率、成本敏感的内部工具开发 → GPT-5.6 Luna 或国产开源。这个价位根本不该碰三款旗舰。GPT-5.6 Luna$1/$6的编程能力仍超过 Opus 4.8国产的 Kimi K3、GLM-5.2 开源模型在这个场景的性价比是另一套玩法之前写过横评这里不展开。一个必须强调的坑Opus 5 的 Fast 模式是 2.5 倍速度、2 倍价格$10/$50——它跟 Fable 5 一个价但能力并不等于 Fable 5。别为了省时间误开 Fast 模式还以为是「半价 Fable」。7/31 我写过 GPT-5.6 降价后 Fast 模式 2 倍价的踩坑实录同一个坑Opus 5 这边也存在。六、趋势观察这代旗舰的 4 个信号「能力天花板」和「价格地板」正在被同一家公司同时占据。Anthropic 一边用 Fable 5 定义能力上限一边用 Opus 5 定义性价比下限——两端都姓 Claude。这对 OpenAI 的压力比任何单一模型都大。竞争维度从「谁聪明」转向「谁省心」。三家 benchmark 差距已经缩到个位数百分点真正拉开体验的是 token 效率、安全拦截率、自我验证能力这些「看不见的维度」。选型表要加一列「每完成一个任务的人工介入次数」。系统提示词瘦身是模型判断力的风向标。Claude Code 的提示词删掉 80% 成绩不降说明模型的能力已经从「靠规则约束」进化到「靠自身判断」。下一波 Agent 产品会普遍变「薄」。降价是常态追新要冷静。Opus 5 发布才一周价格体系还没稳定Fast 模式、缓存折扣、订阅额度都在变。我的建议是主力模型晚一周再切先拿自己的真实任务跑数据别跟着发布会情绪走。最终一句话写代码选 Opus 5 或 Sol跑长 Agent 选 Fable 5钱够或 Opus 5要省批量低成本任务去 Luna 和开源。三款旗舰没有「绝对最强」只有「你的场景最匹配」。延伸阅读GPT-5.6 降价 80% 后踩坑实录Fast 模式 2 倍价、priority 自动迁移5 个坑让账单翻倍AI编程Token消耗横评Claude Code、Codex、Gemini CLI、DeepSeek写同一个需求谁更省2026年4大AI编程CLI工具横评Claude Code、Codex、Gemini CLI、OpenCode谁更强系列文章1张草图换1个前端页面——GLM-5V-Turbo视觉编程实测3个场景从设计稿到可运行代码MiniMax M3发布两周实测5个维度硬核对比Claude Opus和DeepSeek国产模型的六边形战士测了3款工具才发现差距这么大。关注我 第一时间获取更多AI工具深度横评。