GPT-5.6 即将发布,Fable 延期退出


凌晨我写了篇 GPT-5.6 还没来,Fable 又延长使用期了,没想到这么快就看到 OpenAI 宣布 GPT-5.6 周四推出。两家是彻底卷起来了,神仙打架。

GPT-5.6 发布

官方帖子写的很含糊:GPT-5.6 Sol 将与 Terra、Luna 一起于本周四正式发布,我们现在正在全球范围内扩大预览访问权限。如果是太平洋时间周四,那需要到周四下午 3 点以后了。至于所说的访问权限就不好说了,不过这次应该是大规模开放。

GPT-5.6 开放的早期玩家,现在都出来发言了,褒贬不一。基本可以肯定的是,Fable 还是公认自主能力最强(总感觉 OpenAI 在压能力,避免出现 Fable 一样的下场)。

Theo - t3.gg:我现在终于可以聊 GPT-5.6 了,这模型真的很强。它不一定有 Fable 那种“聪明到离谱”的感觉,但能力非常扎实,能干的事很多,而且我之前在 GPT-5.5 上遇到的那些问题,它基本都修掉了。最明显的感觉是,它特别有韧性,特别能跑,不用 /goal,也能连续干上一整天;它对 subagents 的理解也非常好,很擅长做任务编排和调度,在 OpenClaw、Hermes Agent 这种场景里用起来非常顺手。还有一点挺意外,它对 iOS 开发也懂得很深。当然,它也不是完美的,还有一些毛边,但相比 GPT-5.5,问题已经少太多了。对很多任务来说,gpt-5.6-sol 很可能会直接变成我的默认首选,后面我会分享更多。顺便也想补一句,虽然这中间明显有一些和政府相关的波折,但这次和 OpenAI 合作的体验真的不错。他们比我预期中透明很多,在那段混乱时期也一直同步进展,没有让我们完全摸黑。唯一的“限制”就是希望我们等到周四之后,再发布正式内容,比如博客、视频、播客之类;除此之外,他们完全没有限制我们能说什么、不能说什么。参与 early access program 的每个员工都值得升职,也值得被狠狠夸一顿。他们真的挺难得的,不知道怎么形容,就是很真实、很有人味。我只是很感谢他们把这件事做得这么顺。

Theo 又补充了一条:差点忘了,gpt-5.6-sol 在 Computer Use 这块真的强到离谱,基本是世界第一梯队。它直接让我使用这类能力的频率暴涨了 100 倍。后来我们一度失去 5.6 访问权限,我很快就开始受不了了,甚至有点戒断反应——没有它之后,很多原本顺手的事突然又变得很蠢、很累(评价这么高,期待值拉满)。

Ethan Mollick:我是 GPT-5.6 Sol 的早期测试用户。之前被要求正式发布前不要放 demo,但可以说,它确实是一个非常好的模型。它和 Fable 的能力大致在同一档,但用起来的感觉完全不一样。Fable 更像是自己跑出去,按自己的节奏把活干完;Sol 则更快,也更像是一步一步跟你一起推进。所以实际用下来,我会根据任务在 Fable 和 Sol 之间切换:需要来回讨论、不断澄清需求,尤其是我自己还没完全想明白到底要什么的时候,我会用 Sol;如果是特别长、但目标已经定义清楚的任务,我会用 Fable;真正很难的问题,则会交给 Sol Pro。Fable 和 Opus 的感觉差别很大,但 GPT-5.6 依然明显属于 GPT-5 家族。后来我甚至发展出了一套很复杂的判断规则,专门决定什么时候该用哪个模型。Fable 很多时候更“聪明”,但它也太有自己的主意了,有些任务反而不适合;可换到另一些任务里,这种强自驱又刚好是它最可怕、也最有价值的地方。

Matt Shumer:我也提前体验了 GPT-5.6 Sol。它确实是一个很惊艳的模型,但在我测试的大多数任务里,Fable 还是明显更强一些,而且更有 agentic 的感觉:Fable 一轮能做完的事,5.6 往往需要来回好几轮。不过别误会,GPT-5.6 相比 5.5 绝对是一次巨大跃升,只是 Fable 用起来更像一个“大很多”的模型,我也更愿意把一些复杂任务交给它。完整评测会在发布当天发出来。我也相信,OpenAI 很快会拿出真正回应 Fable 的东西。

Pietro Schirano:终于可以聊 GPT-5.6 了。我已经测了几个月,毫不夸张地说,这是我用过最好的模型。它很快,很聪明,也真的有创造力,而且你没猜错,他们终于把前端设计修好了。过去两个月里,我写出来的代码基本都不需要再回头检查。我们已经到了这样一个阶段:只要你能想象出来,就应该直接把它做出来。

Fable 延期

凌晨发的那篇文章,这里再重复一次。

Fable 延期至太平洋时间 2026 年 7 月 12 日晚 11:59:59。用量和之前一样,还是周额度的 50%(不过我感觉又缩水了)。

昨晚又睡得很晚,那是因为我还在努力蹬额度中。最近睡眠都紊乱了,经常处于半睡半醒中,半夜下意识起来瞟一眼 AI 工作进度(也算是理解老板为啥都喜欢 996 了,我这 PUA AI 都快赶上 007 了)。我自己订阅了两个 200 太贵了),在辅助配合 codex 做一些架构设计。

Claude 评论区还是很热闹的,大家都在吐槽晒额度,一片红…

最有意思的评论是这个,她道出了大家的真实状态,原来熬夜的不止你一个,大家都一样 😂…

大概翻译下,尤其是最后一句表达诉求,让我看到了疯狂星期四的烂梗(大意就是用一大段没用的故事,铺垫最后 V 我五十的诉求):

你们给了一个截止日期,让一群人按着这个时间去花自己根本负担不起的钱,熬夜,透支身体,提前把额度刷爆。结果呢?你们明明可以提前计划、说清楚,却偏偏拖到最后一刻才宣布。到底有什么特别的理由,非要这么搞吗?

我知道,这就是一场故意设计的营销游戏:制造稀缺感,制造焦虑,让人上瘾,让人怕错过,让人不断掏钱。可你们有没有意识到,你们影响的不是网页上的数字,而是别人的真实生活?你们知不知道,真的有人会因为觉得 Fable 可能帮他做出一个生意、翻一次身,就省吃俭用,甚至不吃饭?你们知不知道,被你们制造出来的那些上瘾用户里,有人花掉的是本来该给孩子买饭的钱?你们知不知道,有些人本来就有心脏问题,却还在狂灌能量饮料、不睡觉,因为他们真的相信,你们的 API 价格和这套等级制度,会把他们永久踢进底层?

你们当然知道。

但你们需要更多的几十亿美元。比起这些人的生活,那当然更重要。

至少,把这些“草民”的额度重置一下吧。

结语

虽然只挑选了几个测评,但已经能看出 Sol 相比于上代模型有巨大提升:Fable 5 > GPT-5.6(Sol) > GTP-5.5。如果是这样,基本可以得出结论:Fable 适合自主推进,Sol 适合协同规划。在复杂编程问题上,Fable 很容易超出安全护栏,降级到 Opus 4.8,希望 Sol 在这方面能更可靠一点(Noi 编程实战:Fable 没那么强,GPT 也没那么弱)。

我现在感受越来越强烈,模型最后会在“写代码”这件事上趋同。只要需求足够清楚、边界足够明确、验收标准足够具体,用哪个顶级模型写代码的差距会越来越小。代码生成会逐渐变成基础能力,甚至变成廉价执行层。

真正没有趋同的,反而是任务被定义之前的那一段混沌:你到底想要什么,为什么要这个,什么是好,什么可以牺牲,什么必须坚持。顶级模型厉害的地方,也不在于多会写几行代码,而是它能扛住更多不确定性。目标还模糊,它也能往前推;上下文很长,它还能抓住主线;任务复杂,它能自己拆解、检查、修正,一路往前走。

所以顶级模型的价值,更像是一种“自主智能”。当你已经知道方向,它帮你把事情做出来;当你还没完全想清楚,它能陪你把方向一点点逼出来。前一种能力会越来越普及,后一种才是稀缺的。

这也意味着,未来真正重要的,不是你绑定了哪个最强模型,而是你有没有一套稳定的意图和判断。你知道自己要什么,知道怎么验收,知道哪里该放权,哪里该收紧,那模型就只是一个可以替换的执行层。反过来,如果只有最强模型才能让你做成事,那你依赖的其实不是工具,而是借来的认知能力。推荐阅读:AI 时代下的“认知投降”

代码会越来越便宜,真正贵的是定义问题的能力、判断好坏的能力,以及把模糊欲望变成可执行系统的能力。

📌 使用 Fable 小感受我总觉得 Anthropic 的模型,多少和他们 CEO 是一个味儿——孤僻邪门、偏执狂、不走寻常路。或许正是这种另辟蹊径,也是它比较强的原因之一吧。就像研究大模型中的 J-space 就不是一般人会去琢磨的事,结果还被他们写成了技术论文(深度解析:Claude J-space)。

Ethan Mollick 最后的观点基本也符合我的感受,它很适合做自主推进/探索,比如解决一头雾水的 Bug,不知道如何下手的架构等等。你不知道怎么做,这种自由度反而是极大优势,它可以打破僵局。

最后再分享几个编程 Skills(第一个是我的,Noi 目前写代码和架构设计就在高频使用):

lencx/skills[1]:keel 和 coding-protocol 可以理解成一套面向长期代码库的结构治理与执行规范:前者负责架构设计和系统治理,约束系统结构、边界、接口契约、迁移路径和长期健康,确保真正承重的核心足够小、有人负责、可检查,并且随着时间推移仍然可以被删除或替换(抽象自这篇 深度思考:架构腐朽 & Loop Engineering);后者则是一套面向编码任务的环境化执行协议,会根据任务风险动态调整执行强度,参考 Andrej Karpathy 对 AI 编程实践的公开观察,让模型在不同复杂度和风险等级下,以更合适的方式推进代码实现。

vercel-labs/skills[2]:Skills 生态的安装与分发工具,更像 agent skills 的包管理器。它的重点不是提供某一套方法论,而是让不同来源的 skills 可以被搜索、安装、更新、共享和迁移,让团队把 agent 约束像依赖包一样管理起来。

pbakaus/impeccable[3]:面向 AI coding agent 的前端设计协议,核心是给模型补上“设计判断”和“审美约束”。它不是单纯让 AI 写 UI,而是通过设计上下文、反模式检测和 polish/audit 流程,减少 AI 前端常见的模板味、渐变味、卡片味。

mattpocock/skills[4]:Matt Pocock 日常使用的一组轻量 agent skills,更偏真实工程里的基本功。它强调先把需求问透,再做 TDD、调试、代码评审和架构改进,本质是把高级开发者的工作习惯拆成小而可复用的 agent 流程。

obra/superpowers[5]:一套完整的 AI 编程方法论,覆盖从 brainstorm、规格、计划、TDD、subagent 执行到 review、merge 的全流程。它的特点是约束很强,目标不是让 agent 更快乱写,而是让 agent 按软件工程生命周期一步步交付。

addyosmani/agent-skills[6]:面向生产级交付的 agent skills 集合,覆盖 spec、plan、build、test、review、web performance、code simplify、ship 等环节。它更像一套“高级工程师纪律层”,强迫 AI 在写代码前先明确目标,写完后用测试、评审和证据闭环验证结果。

References

[1]lencx/skills:https://github.com/lencx/skills

[2]vercel-labs/skills:https://github.com/vercel-labs/skills

[3]pbakaus/impeccable:https://github.com/pbakaus/impeccable

[4]mattpocock/skills:https://github.com/mattpocock/skills

[5]obra/superpowers:https://github.com/obra/superpowers

[6]addyosmani/agent-skills:https://github.com/addyosmani/agent-skills

            预览时标签不可点