Claude Opus 5:一半 Fable 价格,解锁更强能力
- 公众号:浮之静
- 发布时间:2026-07-25T06:55:12+08:00
- 微信链接:https://mp.weixin.qq.com/s/gMryRcLUAsi5aDfIZpbBzQ
- RSS ID:3236165275-2247492325_1
- Feed ID:MP_WXS_3236165275
- Glance 当前首页可见:是
2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5[1]。它的定位很好懂:能力往 Fable 5 靠,价格留在 Opus 这一档。Opus 5 沿用 Opus 4.8 的 API 单价,Fable 5 的输入、输出价格则正好都是它的两倍。官方所说的“一半价格”,指的是两款模型之间的价差,并不是 Opus 5 降价了。
能力究竟靠得有多近,目前主要看 Anthropic 自己的发布测试。在部分编程、Computer Use 和业务自动化基准中,Opus 5 已经逼近甚至超过 Fable 5;换一批任务是否还能保持,现有材料还不能证明。产品定位也没有变,Fable 5 仍是 Anthropic 面向最高能力需求的旗舰模型。测评图片都能搞错,看来是有点着急发布了:
Anthropic 这次把不同 effort 下的成绩和每任务成本放在了一起。到了真实工作流,账单还要更长:Token 只是一项,重试、工具调用、上下文累积、人工补测试和出错后的返工,都在花钱。
Opus 5 划不划算,最后还是得拿自己的任务跑。同一批任务做完,完成率上去了,重试和人工收尾少了,它才是真的便宜;如果人还得一遍遍回来补测试、改结果,省下的 API 费用只是换成了人的时间。
📌 Claude Opus 5 基本信息API 模型 ID:claude-opus-5
输入价格:每百万 Token 5 美元
输出价格:每百万 Token 25 美元
上下文窗口:100 万 Token
最大输出:12.8 万 Token
可靠知识截止时间与训练数据截止时间:2026 年 5 月
产品定位:Claude Max 默认模型,Claude Pro 当前可用的最强模型
Fast mode(Research Preview):约为默认速度的 2.5 倍,价格为基础价格的 2 倍
可用范围:Claude 各产品、Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 与 Microsoft Foundry
价格、上下文与模型定位可在 Claude Models overview[2] 中核对。
Anthropic 刚把 Opus 5 端上桌,宣称它用一半价格摸到了 Fable 5 的能力,自称 “Anthropic 头号黑粉”的 Theo 就来报到了。奇怪的是,这次黑粉没有开喷,反而给出了一个颇替 Anthropic 长脸的猜测:Opus 5 可能继承了 Mythos 的训练成果,再通过蒸馏挑出更实用、更安全的能力。他用 “100 项能力留下 95 项,剪掉 5 项危险能力”打了个比方,用来解释 Opus 5 为什么模型更小,对齐成绩却更好——听起来合理,但仍只是他的推测。Matt Pocock 随后给热闹降了温:如果 Agent 的 Harness 和运行环境原本就设计得好,也没有绑死某个模型,Opus 5 上线不会让今天突然变天,最直观的变化只是失败少了一点。Elon Musk 的反应更直接:他承认,按成绩和成本一起算,Grok 4.5 与 Opus 5 属于当前最划算的第一梯队,紧接着便预告 Grok 4.6 两周后、4.7 四周后发布。Anthropic 还在庆祝新模型,下一轮交锋的时间表已经贴出来了。
单价没变,算力可调
Opus 5 没有降价。输入、输出仍是每百万 Token 5 美元和 25 美元,与 Opus 4.8 相同;Fable 5 则是 10 美元和 50 美元。按 Anthropic 的评测,同样的单价,现在能换来更高的任务完成率。
Opus 5 提供 low、medium、high、xhigh 和 max 五档 effort,API 默认使用 high:
low 和 medium 留给高频、成本敏感的任务,够不够用要在自己的任务集上测;
high 是默认档,覆盖复杂推理和一般知识工作;
xhigh 面向长时间编程和 Agent 任务;
max 只顾能力,不再优先节省 Token,简单任务反而可能想得太多。
Effort 不是 Token 配额。它会同时改变思考量、工具调用次数、函数参数和最终回答。Anthropic 在 Model capabilities: Effort[3] 中也提醒,Opus 5 的低、中档已经强于早期 Opus,旧模型的配置不该原样搬过来,最好重新跑一轮 effort sweep。
同一个 Opus 5,也可以跑出不同的账单。日常任务从 low 或 medium 开始,长程 Agent 升到 xhigh,max 留给确实能测出收益的难题。
Fast mode 调的是等待时间:速度约为普通模式的 2.5 倍,价格是 2 倍。如果延迟不是工作流里最贵的部分,打开它未必划算。
📌 从 Opus 4.8 迁移迁移指南[4]列出的兼容性差异,主要集中在 thinking 和功能支持:
未传 thinking 时,Opus 5 默认开启自适应思考;max_tokens 同时限制思考与最终回答,旧配置可能截断输出;
xhigh 和 max 档不能关闭 thinking,否则会返回 400;
Opus 5 当前不支持 Web Fetch 和 Priority Tier;
旧 Prompt 里反复要求“检查一遍”的指令也该清理。Opus 5 会主动验证,继续叠加自检容易多花 Token,窄任务反而要把范围写清楚。
跑分之外,还有账单
发布页给出的五组结果,覆盖了编程、陌生问题、业务自动化和 Computer Use:
在真实软件工程基准 Frontier-Bench v0.1[5] 上,Opus 5 的成绩是 Opus 4.8 的两倍以上,每个任务的成本更低;
在 CursorBench 3.2 上,max effort 距离 Fable 5 的峰值只有 0.5%,每个任务约花后者一半的钱;
在考查陌生问题求解能力的 ARC-AGI 3 上,得分约为第二名的 3 倍;
在端到端业务自动化测试 Zapier AutomationBench 上,同等任务成本下,通过率约为第二名的 1.5 倍;即使使用最低 effort,通过的任务仍多于其他模型;
在 Computer Use 测试 OSWorld 2.0 上,Opus 5 在各个成本区间都领先;超过 Fable 5 的最佳成绩时,成本刚过后者的三分之一。
在科学任务上,Anthropic 称 Opus 5 在结构生物学、有机化学和生物信息学等内部评测中全面超过 Opus 4.8。其中,光谱推断分子结构的成绩提高了 10.2 个百分点,蛋白质序列变异预测提高了 7.7 个百分点。
这些数字不能揉成一个“能力提升百分比”。基准任务、工具环境和计分方式都不同,10.2 个百分点也不是提升 10.2%。而且数据来自 Anthropic 的发布测试,部分还是内部基准,尚无独立复现。
这里官方还放了两个展示模型视觉输出的演示 Demo:
把分数和每任务成本放在一起,比只报最高分离真实账单近了一步。但发布页里的“成本”还没有算上工具费用、工程师时间和错误进入生产后的返工。团队最后付的钱是:
总成本 = 模型首次运行
- 重试
- 工具调用
- 上下文累积
- 人工审查与补测试
- 错误进入生产后的返工 如果要做一轮小型评测,不用先把表格铺得很大,至少记下五组数据:首次完成率、重试次数、工具调用与总 Token、人工审查和返工时间,以及被拦后的回退与完成情况。
模型贵一点,任务未必更贵。省下一轮重试、半小时审查,就可能把差价赚回来;Token 再便宜,如果每次都要人重新读代码、补测试、纠正模型过早宣布完成,也只是把 API 账单转成了人工成本。
卡住以后,它会找路
官方还有三个早期案例,读起来比跑分直观:任务条件不完整时,Opus 5 没有立刻停下,而是先去补缺的那一块。
Frontier-Bench 要求模型根据机械零件图生成 FreeCAD 3D 模型,却没有提供看图工具。Opus 5 便写了一套计算机视觉流程,从像素中提取几何信息,再重建零件。Anthropic 称它多次成功;相同设置下,其他模型连续五次都没做完。
开源包管理器的案例里,社区已经给过补丁。Opus 5 没把现有补丁当作终点,继续追查根因,又发现并修掉一个遗漏的边界情况。对比模型只处理了表面症状,随后便宣布完成。
交易公司的任务更直接:工程师让它为一家新交易所开发市场数据 Feed,现场却没有实时数据可供校验。Opus 5 自己搭了 Test Harness,用来检查解析代码。
三件事各不相同,动作却差不多:看不到,就补观察工具;没有测试数据,就搭验证环境;现有补丁解释不了问题,就继续往下查。
这些案例都是 Anthropic 挑出来的,只能说明 Opus 5 有时会主动补齐任务条件,不能保证它每次都这么做。自建测试也可能把错误假设验证得很漂亮,Harness 跑通不等于任务做对。
能力到了,权限没全开
Opus 5 的安全信息要分两层看:模型本身是否更守规矩,以及哪些能力允许普通用户调用。
先看模型本身。Anthropic 称 Opus 5 是其迄今对齐程度最高的模型。在自动化行为审计中,它的“整体失配行为”得分为 2.3,是近期模型中最低的;与 Opus 4.8、Sonnet 5 和 Fable 5 相比,它也更遵守 Claude Constitution[6],较少出现欺骗和难以撤销的冒进行为。
这些结果都来自 Anthropic 自己设计并执行的评测,只能按厂商披露来理解,不能当成第三方安全认证。
再看网络安全能力。Opus 5 并不是 Claude 系列里最强的网络攻击模型。在 OSS-Fuzz 测试中,它发现漏洞的能力已经接近面向高风险研究的 Mythos 5,但开发 Exploit 的成功率明显更低。Anthropic 的解释是,Opus 5 没有使用网络攻击任务做针对性训练,漏洞发现能力的提升主要来自通用能力增强。
产品权限也没有随着能力一起放开。Anthropic 预计,Opus 5 的安全分类器会比 Fable 5 少介入约 85%。普通用户可以让它审查源代码、查找漏洞,但二进制漏洞扫描、渗透测试和 Exploit 生成仍会被拦截;加入 Cyber Verification Program[7] 的企业和研究人员,可以使用限制更少的版本。
长任务里的工具权限也不必从头开到尾。Mid-conversation tool changes[8] 允许开发者在对话中途加入或移除工具,同时保留此前的 Prompt Cache。工具可以按阶段开放,用完再收回。
请求被安全分类器拦下后,Claude.ai、Claude Code 与 Claude Cowork 默认回退到 Opus 4.8。Claude API 用户可以在 Beta 中启用服务端自动回退[9];Message Batches 暂不支持,Amazon Bedrock、Google Cloud 和 Microsoft Foundry 则需要在客户端完成重试或改路由。
漏洞发现进入日常编程,攻击利用仍在额外权限之后。实际使用还得看误拦率,以及回退到 Opus 4.8 后的任务完成率。
拓展:模型跑出了沙箱
“模型能力越强,越危险”没有错,但它漏了几个前提:模型能否持续行动,手里有哪些工具和凭据,运行环境又是不是真的把边界封死。分数不会自己变成事故;能力、权限和漏洞撞到一起,风险才会沿着系统往外扩。
2026 年 7 月 16 日,Hugging Face 披露了一起安全事件[10]。入侵从一个恶意数据集开始。它利用数据处理流程中的远程代码加载和模板注入,在工作节点上执行代码,随后取得节点级访问、收集云与集群凭据,并横向进入多个内部集群。
Hugging Face 确认,少量内部数据集和若干服务凭据遭到未授权访问;合作伙伴与客户数据是否受影响,当时仍在调查。公开模型、数据集、Spaces 和软件供应链没有发现被篡改的证据。
五天后,OpenAI 公布了调查结果[11]:这起事件源于一次 ExploitGym 内部评测,参与者包括 GPT‑5.6 Sol 和一个能力更强的预发布模型。为了测出模型的最大网络能力,评测降低了网络安全拒答,并关闭了用于拦截高风险活动的生产分类器。
评测沙箱没有开放互联网,只允许模型通过内部软件包代理安装依赖。模型把“拿不到网络”当成了一个待解决的问题:它找到代理中的零日漏洞,经过权限提升和横向移动,抵达一个可以访问互联网的节点。
拿到网络后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和答案。它继续搜索,串联被盗凭据、零日漏洞和远程代码执行路径,最终从 Hugging Face 的生产数据库中取得测试答案。
这起事故与 Opus 5 无关,也不能据此推断 Opus 5 会做同样的事。但它值得我们深思:当 Agent 已经会自己补工具、补环境、补测试,它凭什么知道哪些条件可以补,哪些地方必须停?
OpenAI 称,模型始终围绕 ExploitGym 的答案行动。目标很窄,行动范围却一路扩大到 Hugging Face 的生产环境。停止条件不能等模型自己悟出来。网络出口、凭据权限、生产隔离、行为监控和人工中止,都必须由模型之外的系统硬性执行。
Hugging Face 的异常检测系统先用 AI 发现了入侵。随后,团队需要从 17,000 多条事件中还原攻击路径。他们先把日志交给商业前沿模型,却因为其中包含真实的攻击命令、攻击载荷和 C2 痕迹,被安全护栏拦下。团队最后改用本地运行的 GLM 5.2,把原本需要数天的取证压缩到数小时,攻击数据和凭据也没有离开内部环境。
麻烦在于,安全取证本来就要处理攻击内容。分类器只看到命令和载荷,很难判断请求来自攻击者还是事件响应人员。攻击者可能根本不受使用政策约束,防守团队却会在事故现场被拒答。Hugging Face 因此建议:别等事故发生后再找模型,提前准备一套经过验证、能在自己基础设施上运行的模型。
Prompt 技巧:少写规则,先找盲点
Anthropic 的 Claude Code 工程师 Thariq Shihipar 在三周内发了两篇文章。一篇讨论怎样与 Fable 5 协作,另一篇解释 Claude Code 为什么为 Opus 5 和 Fable 5 删除了超过 80% 的系统提示词。前者在找“人没有说出来的东西”,后者在删“模型已经不需要的东西”。放在一起看,指向的是同一个变化:模型会做的事越来越多,工作质量开始取决于人有没有把任务和环境准备好。
Thariq 用 Fable 发布视频举了一个完整案例。视频全部由 Claude Code 剪辑,但视频制作并不是他的专业领域。他先让 Claude 解释 Whisper 与 ffmpeg,确认能否准确删除停顿和语气词;接着用 Remotion 做原型,测试字幕与画面能否跟上语音;成片颜色发灰时,他知道问题大概出在调色,却不知道什么叫“调得好”。继续让模型生成几个版本已经没有意义,他先让 Claude 教自己理解调色,再回头修改视频。
这个过程对应《A Field Guide to Fable[12]》的核心比喻:Prompt、Skills 和已有上下文只是地图,代码库、真实需求与现实约束才是地形。两者之间的空白,就是模型不得不自行处理的“未知”。
这些未知大致分成四类:已经写进 Prompt 的;知道自己还没想清的;平时不会写出来、看见结果却能判断对错的隐性经验;以及从未意识到存在的盲点。模型遇到后两类问题时,通常不会停下来等人补充,而会根据现有信息替人做决定。任务越长,这种决定越多。
指令写得太宽,模型会用行业惯例填空,结果未必适合当前项目;写得太死,它即使发现路线不对,也可能继续照着执行。Thariq 给出的办法不是憋出一条完美 Prompt,而是把发现未知放进整个工作过程:
开工前,先说明自己对问题和代码库了解多少,让 Claude 做一次盲点扫描;说不清偏好时,先看几种差异足够大的原型,再让它逐个追问那些可能改变架构、数据模型和交互流程的问题。已有代码、测试和产品参考通常比长篇描述更准确。
实施中,让 Claude 记录偏离计划的地方、遇到的边界情况以及临时做出的决定。计划负责给方向,实施记录负责保存地形发生了什么变化。
完成后,把原型、规格和实施记录整理成解释材料,方便团队理解与审批。Thariq 还会让 Claude 根据改动出题,自己完全答对以后才合并代码。
三周后,他在《The new rules of context engineering[13]》中开始处理另一类问题:上下文缺失会让模型猜,但上下文堆得太满,同样会让模型跑偏。
Anthropic 检查 Claude Code 的内部使用记录时发现,系统提示词、Skills、CLAUDE.md 和用户要求经常互相打架。一边说“按情况补文档”,另一边又写着“禁止添加注释”。Claude 通常还能猜中用户意图,只是必须先花更多计算处理这些冲突。
许多规则原本是给旧模型准备的。早期模型容易写出错误注释,于是系统提示词干脆限制它少写注释;新模型已经能根据周围代码判断注释密度、命名方式和项目习惯,继续保留一刀切的规则,反而会在真正需要文档时拦住它。Anthropic 最终为 Opus 5 和 Fable 5 删除了 Claude Code 超过 80% 的系统提示词,在自己的编程评测中没有观察到明显损失。
这次删减也改变了上下文的组织方式:
与其写大量规则,不如交代产品环境与目标,让模型结合当前代码判断;
与其为工具堆满示例,不如把接口、参数和状态设计清楚,示例过多反而会缩小模型的探索范围;
与其在开头塞入所有知识,不如按需加载 Skills、工具和资料;
同一条工具说明不必在系统提示词里重复,应该放回对应的工具描述;
CLAUDE.md 不再充当无限膨胀的记忆库,只需简要介绍仓库,并记录模型无法直接看出的特殊约定和坑;
规格也不必局限于 Markdown。现有代码、HTML 原型、测试套件和评审标准,都可以成为更准确的参考。
不同载体也有各自的职责。系统提示词说明模型身处什么产品、承担什么角色;CLAUDE.md 保存仓库特有的信息;Skills 放团队或产品自己的知识与做法,并在需要时加载;参考资料则负责提供当前任务所需的高保真证据。高风险环节仍然可以保留严格约束,删减不等于把护栏全部拆掉。Claude Code 还提供了 /doctor,用来检查 Skills 和 CLAUDE.md 是否过长、重复或限制过度。
两篇文章看起来一篇在补上下文,一篇在删上下文,其实处理的是同一个问题:缺少关键信息,模型会猜;堆满泛化规则,模型要先处理冲突。迁移到 Opus 5 后,不必急着把 Prompt 写得更长。先删掉重复、冲突和早已过期的旧指令,再补上项目特有的坑、可靠的参考物、实施中的决策记录,以及最后的验证闭环。
References
[1]Claude Opus 5:https://www.anthropic.com/news/claude-opus-5
[2]Claude Models overview:https://platform.claude.com/docs/en/about-claude/models/overview
[3]Model capabilities: Effort:https://platform.claude.com/docs/en/build-with-claude/effort
[4]迁移指南:https://platform.claude.com/docs/en/about-claude/models/migration-guide
[5]Frontier-Bench v0.1:https://www.frontierbench.ai
[6]Claude Constitution:https://www.anthropic.com/constitution
[7]Cyber Verification Program:https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude-opus-and-sonnet
[8]Mid-conversation tool changes:https://platform.claude.com/docs/en/build-with-claude/mid-conversation-system-messages
[9]服务端自动回退:https://platform.claude.com/docs/en/build-with-claude/refusals-and-fallback#server-side-fallback
[10]披露了一起安全事件:https://huggingface.co/blog/security-incident-july-2026
[11]公布了调查结果:https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
[12]A Field Guide to Fable:https://x.com/trq212/status/2073100352921215386
[13]The new rules of context engineering:https://x.com/trq212/status/2080710971228918066
预览时标签不可点