Opus 5 任务成本评测与迁移

模型性价比不看 Token 单价,而看同一真实任务集的总完成成本:首次完成率、重试次数、工具调用与总 Token、人工审查/补测试时间,以及错误进入生产后的返工。先用 low/medium 跑高频窄任务,再对长程 Agent 做 effort sweep;只有可测收益的难题才上 xhigh/max。

迁移时重点检查 thinking 与 max_tokens 的新语义、暂不支持的功能、旧 Prompt 中重复自检指令,以及 Harness 是否绑死旧模型。Fast mode 速度约 2.5 倍、价格 2 倍,只适合延迟本身比推理费更贵的流程。

适用边界:官方基准只能用于建立候选假设;最终选择必须由自己的任务集和人工返工成本决定。

原文:浮之静 - Claude Opus 5:一半 Fable 价格,解锁更强能力 - 3236165275-2247492325_1