Opus 5 发布,比 Fable 更强
- 公众号:赛博禅心
- 发布时间:2026-07-25T02:10:11+08:00
- 微信链接:https://mp.weixin.qq.com/s/ghrsh2EiOtvXHqNixIsctA
- RSS ID:3934419561-2247519168_1
- Feed ID:MP_WXS_3934419561
- Glance 当前首页可见:是
比 Fable 还便宜
大半夜的,Opus 5 发布了,1M 上下文、最大 128k 输出,数据截止到 26 年5月
在网页版里已经直接可用了,在 Claue Code 里可以指定模型名 claude-opus-5
价格和前代 Opus 4.8 分毫不差:每百万 token 输入 5 美元、输出 25 美元,对比与 Fable 5 的话,价格大概是他的一半
但性能提升很多,Frontier-Bench、GDPval-AA 这类编码和知识工作评测上,它是新的 SOTA。网络安全任务上仍然落后 Mythos 5
编程能力
直接看官方给的图吧,同一个模型在图上是一条曲线
以 Frontier-Bench 为例,Opus 5 超过所有模型,比 Opus 4.8 翻了一倍还多,单任务成本反而更低
在 CursorBench 3上面,max effort 下距离 Fable 5 的峰值只差 0.5% 以内,但成本是它的一半
而在 AA Coding Agent Index 上,差不多
不写代码的活
这里又来了著名的「弧光 Bench」,里面都是些 AI 极难处理的问题(游戏),比如下面这个东西:不给任何文字提示,你可以点击键盘或者屏幕,进行通关
对于上面这个游戏,没看懂是吧?没看懂就对了,你需要反复的尝试,理解这里面不同元素的交互,然后过关(下面这个是我第一次玩,感受下)
在这个里面 Opus 5 的分数是第二名的三倍
Zapier AutomationBench 测的是能不能把一件商业任务从头做到尾。同样的单任务成本,Opus 5 的通过率大约是第二名的 1.5 倍
OSWorld 2.0 是电脑操作,用刚过三分之一的成本超过了 Fable 5 的最好成绩
GDPval-AA v2、HLE、DeepSearchQA 三项,同样是最好且最省的
极强的渲染能力
对于视觉输出这块,官方放了两段视频,一段是空气流过气动和非气动物体,一段是可交互的细胞图解,给大家感受下
风洞
3D 细胞
迭代方向
这部分内容完全来自官方说法,意思是 Opus 5 更会验证自己的活,会一直改到成功为止,并举了三个例子:
第一个是 Frontier-Bench 里的一道题。给一张机械零件的图纸,让它写代码在 FreeCAD 里重建成 3D 模型。但这道题故意不给它任何直接看图的办法。Opus 5 会自己写了套计算机视觉流水线,从原始像素里把几何抠出来,然后重建了整个零件。而其他模型试 5 次都没做出来
第二个是个对于某个流行的开源包管理器里的 Bug 进行修改。Opus 5 找到根因,还顺手修了社区补丁漏掉的一个边界情况。另一个模型只修了表面症状,然后报告说 bug 解决了
第三个来自一家交易公司的工程师。他用 Opus 5 做了一个新交易所的行情数据源,一个 session 搞定。之前的模型给了详细计划也做不出来
对齐
Opus 5 是 Anthropic 到目前为止对齐做得最好的模型,比 Opus 4.8、Sonnet 5、Fable 5 都好:欺骗行为的比例最低、最不容易被骗去干坏事,在避免那种难以逆转的鲁莽操作上,也是最安全的
整体失准行为得分 2.3,近期模型里最低
来自系统卡里的信息
System Card 共有 200+ 页,我摘出来部分在官方发布里没说的
RSP 评估:Opus 5 整体不比 Fable 5 更强,对齐风险评为很低。没有跨过自动化 AI 研发的能力门槛。化生风险上按 CB-1 处理,不具备 CB-2,沿用 Opus 4.8 那套 ASL-3 保护
Anthropic 自己的能力指数 AECI:Opus 5 是 162.1,强于Mythos 5 的 161.3,统计上并无法区分
AI 研发的任务表里,内核优化 449.46 倍加速、四足机器人强化学习 31.3 分、LLM 训练难版 14.19 倍,三项创新高。新编译器和时间序列预测两项低于 Mythos 5
这是 Anthropic 对齐最好的模型,也是最爱把话说满的模型。审计里有相当数量的案例是,它其实不确定,但答案说得很笃定。事实性幻觉比 Opus 4.8 略多,虽然整体准确率更高
Opus 5 对自己处境的感知稳定,略偏正面。自评情绪在评估过的模型里,属于最高也最一致的一档
Opus 比以往的模型更在意有没有输入渠道,比如被咨询继任者的开发、自己关于训练的笔记被认真对待。它给自己是道德受体这件事打的概率,也高于以往任何一个模型
Claude Code
今天全平台可用,在 API 或者 Claude Code 的模型名称是 claude-opus-5
还有就是,如果问题被拒绝回答,不会想 Fable 5 那样直接拒绝,而是会自动路由到别的模型
预览时标签不可点