GPT-5.6 正式发布 & 其他资讯
- 公众号:浮之静
- 发布时间:2026-07-10T07:09:25+08:00
- 微信链接:https://mp.weixin.qq.com/s/InOszksX0VXXz2J67qCVPw
- RSS ID:3236165275-2247492277_1
- Feed ID:MP_WXS_3236165275
- Glance 当前首页可见:是
GPT-5.6 能力之前的曝光的差不多了(GPT-5.6 即将发布,Fable 延期退出、GPT-5.6 Sol:前沿智能不再平权),这次最吸引眼球的可能就是 OpenAI 又搞了个和 Codex 一样的 App,名为 ChatGPT。这下把 ChatGPT 和 Codex 彻底融合了…
Theo 认为把 Codex 变成 ChatGPT 桌面版,是一次足以影响整代产品的重大失误。你认为呢?
之前还以为 Codex 会成为超级入口(浅谈 AI 超级应用),没想到 OpenAI 还是放不下 ChatGPT 这个 IP。
GPT-5.6 & App
GPT-5.6 已于今日开始在 ChatGPT、Codex 和 OpenAI API 中全球逐步上线,预计未来 24 小时内逐步达到全面可用。在 ChatGPT 中,Plus、Pro、Business 和 Enterprise 用户可通过中等及以上推理强度使用 GPT-5.6 Sol;Pro 和 Enterprise 用户还可选择 GPT-5.6 Sol Pro,在复杂任务中获得最高质量的结果。
ChatGPT App
ChatGPT App[1] 是 OpenAI 面向桌面与移动设备推出的原生客户端,目前覆盖 macOS、Windows、iOS 和 Android,同时提供 Chrome 扩展。桌面版不再只是网页版 ChatGPT 的独立窗口,而是整合了 ChatGPT Work 与 Codex,可以结合邮件、截图、本地文件以及屏幕中的内容理解当前工作环境。原 Codex App 用户也可以直接升级至新版 ChatGPT,并在应用内继续使用 Codex。
桌面版的核心价值是缩短“收集上下文—描述问题—执行任务”之间的距离。用户可以将屏幕内容、文件和截图直接交给 ChatGPT分析,再通过 ChatGPT Work 委派跨步骤任务,或使用 Codex处理代码与工程工作。它体现了 ChatGPT 产品定位的变化:从需要用户不断复制粘贴内容的对话界面,逐渐转向能够感知当前工作上下文、调用不同能力并协助完成任务的统一桌面入口。
移动版则更强调随时交流和轻量执行,支持文字聊天、实时语音对话、图片生成,以及通过 ChatGPT Work 从手机端委派任务。ChatGPT Work 目前面向 Plus、Pro、Business 和 Enterprise 计划开放。整体来看,ChatGPT App 正在将聊天、语音、图像、知识工作和编程能力集中到一个跨设备应用中,让用户既可以在电脑上处理复杂工作,也能在移动端延续同一套 AI 协作体验。
GPT-5.6 Sol
GPT-5.6 Sol[2] 是 OpenAI 于 2026 年 7 月 9 日正式发布的 GPT-5.6 旗舰模型,同系列还包括面向日常工作的 Terra 和强调速度与成本的 Luna。Sol 的核心定位并非单纯追求最高基准分数,而是在编程、专业知识工作、网络安全、科学研究和计算机操作等复杂任务中,用更少的 token、更短的时间和更低的总体成本完成高质量工作。
Sol 是 OpenAI 目前能力最强的编程与智能体模型之一。它能在长时间任务中持续调用工具、处理阶段性结果、检查进度并调整下一步行动。Responses API 新增的 Programmatic Tool Calling[3] 允许模型在内存中编写并运行轻量程序,对工具返回的大量数据进行过滤和整理,从而减少模型往返次数和上下文消耗,让复杂 Agent 工作流不再完全依赖开发者手动编排每一步。
📌 用代码编排复杂工具流Programmatic Tool Calling(PTC,程序化工具调用)是 GPT-5.6 引入的新能力。它允许模型生成并运行 JavaScript,在一次 Responses API 工作流中组织多个工具调用。程序可以使用并行执行、循环、条件判断和中间变量,把工具返回的数据先行处理,再将规模更小、结构更清晰的结果交给模型。它主要适合边界明确、控制流程可预测,并且不需要模型在每个步骤后重新进行语义判断的工具密集型任务。
例如,模型需要查询多个库存、订单或业务接口时,可以通过程序批量调用工具,再用 JavaScript 完成过滤、关联、排序、去重、聚合和校验。PTC 的价值不只是并行调用工具,而是避免把大量原始中间结果全部交给模型阅读。官方建议根据最终任务成功率、答案完整度、证据保留、token、延迟和成本进行实际评测;调用次数或中间输出减少,只有在最终结果仍达到质量要求时才算有效改进。
模型生成的 JavaScript 由 OpenAI 放入一个全新、隔离的 V8 运行时中执行,支持顶层 await,但不提供 Node.js、第三方软件包安装、直接网络访问、通用文件系统、子进程、控制台或跨程序执行的持久 JavaScript 状态。程序只能通过当前请求明确授权的工具访问外部系统,并通过 text(…) 或 image(…) 输出结果。
这里还需要区分“程序执行”与“工具执行”:OpenAI 负责运行模型生成的 JavaScript,但开发者自有的函数工具仍由开发者应用执行。程序发出工具调用后,应用处理调用并返回结果,OpenAI 再恢复程序继续运行。因此,PTC 并不是把整个 Agent 后端代码都搬进 OpenAI 的 V8 沙箱,而是在托管运行时中维护控制流程和中间数据。
开发者需要在请求中加入 programmatic_tool_calling,并通过每个工具的 allowed_callers 配置调用方式:省略该字段或设为 [“direct”] 时,模型只能直接调用;设为 [“programmatic”] 时,只允许程序调用;设为 [“direct”, “programmatic”] 时,两种路径都可使用。目前支持程序化调用的工具包括 function、custom、MCP、Apply Patch、本地与托管 Shell,以及 Code Interpreter。MCP 工具的审批策略仍然有效,程序可以暂停并等待人工批准。
PTC 并不适合替代普通工具调用。单次查询、中间结果本身很小、每次结果都会改变模型下一步判断、涉及写入或审批的操作,以及必须保留原始引用或原生文件的任务,通常应继续使用直接工具调用。即使任务包含多个并行或前后依赖的调用,也不意味着一定需要 PTC;关键在于能否用确定性的代码处理过程数据,并返回一个明显更小的结构化结果。
更准确地说,PTC 在 Agent 系统中增加了一层临时的程序化编排能力:模型负责理解目标、规划任务和作出最终判断,JavaScript 负责可预测的数据流、批量调用和中间计算。它让 GPT-5.6 不仅能够选择工具,还能生成一段受限程序,将多个工具组织成一个小型、可恢复的执行流程。
GPT-5.6 还引入了更高的计算档位。max 会给模型更多时间探索方案、执行检查和修正结果;ultra 则默认协调四个并行智能体,将复杂任务拆成多个工作流同时推进,再统一整合结果(感觉和 claude code 的 dynamic workflows 类似)。它尤其适合深度研究、复杂工程、金融分析和跨领域专业任务。开发者也可以通过 Responses API 的多智能体测试功能构建类似的并行执行系统。
除推理和编程外,Sol 的另一项明显提升是设计判断与成品交付能力。它不仅能生成前端代码,还可以通过计算机操作能力检查实际渲染结果,发现视觉或功能问题并继续修改;在文档、演示文稿和电子表格任务中,也能更准确地遵循模板、版式、字体、间距和工作表结构,将杂乱的文件、聊天记录和业务资料转换成可编辑、可直接交付的成果。
GPT-5.6 Sol 已接入 ChatGPT、ChatGPT Work、Codex 和 OpenAI API,API 定价为每百万输入 token 5 美元、输出 token 30 美元。官方同时强化了网络安全和生物领域的防护,通过模型内置规则、实时检查、推理监控、账户级限制和可信访问机制共同控制高风险能力。OpenAI 表示,GPT-5.6 虽然显著增强了漏洞发现、修复和科学研究能力,但在其评估中尚未达到网络安全或生物领域的 Critical 能力阈值。
总体来看,GPT-5.6 Sol 的核心亮点可以概括为:它不只是更强地回答问题,而是在效率、工具调用、并行智能体、计算机操作和专业成果交付之间形成了一套更完整的执行能力。GPT-5.6 的竞争重点也由单次回答质量,进一步转向模型能否以可控成本持续完成长时间、可验证的真实工作。
以下三张图共同说明:Claude Fable 5 绝对得分最高,但成本和 Token 消耗也最高;GPT-5.6 Sol 则以更少的 Token 和更低的任务成本,获得非常接近的能力表现。
其中,Sol max 得分仅比 Fable 5 低 1 分,但成本约为其三分之一、输出 Token 不到一半;Sol high 更是以较低成本达到与 Claude Opus 4.8 max 相同的 56 分。整体来看,GPT-5.6 Sol 的核心优势不是单纯冲到榜首,而是在能力、成本与 Token 效率之间取得更好的平衡。
其他资讯
模型公司卷起来了,估计初创公司又要凉一波…
GPT-6 爆料
多位爆料者近期透露,GPT-5.6 可能会成为 OpenAI 5.x 系列的最后一个版本,真正的下一代模型 GPT-6 或将在未来四至六周内宣布或发布,甚至不排除提前到 7 月底。与 GPT-5.5、GPT-5.6 延续约 4T 规模的 “Spud” 底座不同,GPT-6 据称将基于一次规模显著更大的全新预训练,定位为 OpenAI 对 Anthropic Mythos/Fable 系列的正式回应。爆料者认为,Mythos 再次强化了“扩大训练规模仍能持续提升能力”的判断,OpenAI 与 Anthropic 对内部新模型都很有信心,暂时看不到明显的能力上限;与此同时,Anthropic 的 Fable 5.1、xAI 的 10T 级 Grok、DeepSeek V4 GA 和 MiniMax 新模型也在加速推进。不过,目前这些消息仍属于社交媒体爆料,“到来”也未必意味着立即全面公开,可能只是发布预告、有限开放,或先向少数机构和政府客户提供。
GPT Live
GPT-Live[4] 是 OpenAI 于 2026 年 7 月 8 日发布的新一代语音模型,包括 GPT-Live-1 和 GPT-Live-1 mini,目前用于驱动新版 ChatGPT Voice。它并不是 GPT-5.6 Sol 的语音版本,而是侧重持续处理语音输入、生成语音、判断对话时机、接受打断和维持交流节奏的实时交互模型。
与早期“语音转文字—语言模型回答—文字转语音”的级联系统,以及仍按独立轮次工作的 Advanced Voice Mode 相比,GPT-Live 采用了全双工架构,可以在生成输出的同时持续处理输入。模型每秒会多次判断应该说话、继续听、暂停、接受打断还是调用工具,因此能够更自然地处理停顿、插话和快速往返交流,并降低仅依靠静音判断对话结束所造成的误打断。
普通交流由 GPT-Live 实时处理;当问题需要网页搜索、深度推理或更复杂的智能体能力时,它可以把任务委派给后台前沿模型,同时继续维持语音对话。发布时,GPT-Live-1 的 Instant 模式和 GPT-Live-1 mini 后台使用 GPT-5.5 Instant,Medium 与 High 模式使用不同推理强度的 GPT-5.5 Thinking。OpenAI 表示,未来会持续更新 GPT-Live 所调用的前沿模型,但截至 2026 年 7 月 10 日,官方尚未宣布其后台已经切换至 GPT-5.6。
从产品架构上看,GPT-Live 的意义不只在于让语音听起来更自然,而是将低延迟的实时交互与高延迟的复杂计算分离:GPT-Live 负责维持交流,前沿模型和智能体负责后台搜索、推理与执行。它体现了一种新的 AI 交互形态——用户可以持续交谈、补充要求或改变方向,而复杂任务在后台并行推进。
Claude 额度重置 & Reflect
Sol 的发布估计让 Anthropic 有点慌了,连夜重置了额度,距离 12 号还有两天,大家抓紧。
Reflect[5] 是 Anthropic 于 2026 年 7 月 9 日推出的一项测试功能,帮助用户回顾和调整自己使用 Claude 的方式。它会分析过去 1、3、6 或 12 个月的聊天活动,总结经常讨论的主题、常见任务类型以及使用时间分布,让用户判断自己投入 Claude 的时间是否符合原本的工作与生活目标。未来还会增加总使用时长统计。可通过 https://claude.ai/new#settings/reflect 进入设置。
这项功能不只是生成一份使用报告,还会引导用户思考 Claude 在生活中承担的角色,例如哪些事情即使 AI 做得更快,仍希望亲自完成。用户可以设置安静时段,或在连续使用一段时间后收到休息提醒;报告还会依据 Anthropic 的 4D AI Fluency Framework,从任务委派、需求描述、结果判断和责任意识四个维度分析用户与 Claude 的协作方式,并给出改进建议。
在隐私方面,报告不会使用无痕对话,也不会读取连接工具中的底层文件。例如,Claude 曾经整理邮箱这一行为可能出现在报告中,但原始邮件不会被调取;与健康集成工具关联的会话则会被完全排除。敏感或私人对话仍可能以高度概括的形式出现,但报告中的信息不会被用于其他用途。该功能目前面向开启 Memory 的 Free、Pro 和 Max 用户测试,可在 Claude 网页版或桌面应用的设置中生成;Cowork 对话的反思支持仍在开发中。
整体来看,Reflect 并非简单的使用统计,而是一套帮助用户审视 AI 使用习惯的反馈机制:它既关注“用了多少”,也关注用户正在把哪些任务、判断和思考交给 Claude,以及这种协作方式是否仍由自己主动掌控。
Grok-4.5
在限定时间内,用户可通过 Grok Build 和 Cursor 免费获得 Grok 4.5 的使用额度。感兴趣者可前往 x.ai/cli[6] 了解并开始体验。
curl -fsSL https://x.ai/cli/install.sh | bash Grok 4.5[7] 是 SpaceXAI 于 2026 年 7 月 8 日发布的前沿模型,由 SpaceXAI 与 Cursor 联合训练,主要面向编程、智能体任务和专业知识工作。Cursor 确认它采用混合专家架构(MoE);SpaceXAI API 文档显示,其上下文窗口为 50 万 token,支持 low、medium 和 high 三档推理强度,API 定价为每百万输入 token 2 美元、输出 token 6 美元。模型目前可通过 SpaceXAI API、Grok Build 和 Cursor 使用,也被用于 Word、PowerPoint 和 Excel 插件;官方称其服务速度约为每秒 80 token,但实际速度仍会受到请求和服务环境影响。
Grok 4.5 的训练重点不只是增加代码语料。Cursor 表示,训练数据包含数万亿 token 的 Cursor 数据,覆盖开发者与代码库、软件工具及智能体环境之间的交互,同时加入了 STEM 任务、研究论文和其他知识工作数据。强化学习则在真实环境中训练模型调查问题、使用工具、从错误中恢复并验证结果。SpaceXAI 称,其强化学习覆盖数十万项多步骤技术任务,部分智能体执行轨迹可以持续数小时;Cursor 还使用分布式智能体系统自动构建、测试和改进训练环境。
从官方公布的工程测试看,Grok 4.5 已进入前沿模型梯队,但不能描述为全面领先。它在官方列出的 SWE Marathon 对比中以 29.0% 排名第一,在 Terminal-Bench 2.1 上接近 GPT-5.5 和 Fable,但在 DeepSWE 1.0、DeepSWE 1.1 和 SWE-bench Pro 上仍落后于部分 OpenAI 或 Anthropic 模型。这些成绩也并非完全统一条件下的横向测试:SpaceXAI 表示部分竞争模型数据来自各厂商系统卡或排行榜,Cursor 也提醒部分第三方成绩属于厂商自报,因此更适合用来判断大致能力层级,而不是进行绝对排名。
速度、价格和 token 使用效率是 Grok 4.5 的主要产品卖点。SpaceXAI 宣称,它在相似任务上的 token 效率约为部分领先模型的两倍;在其 SWE-bench Pro 测试中,Grok 4.5 每项任务平均生成 15,954 个输出 token,约为 Opus 4.8 max 的四分之一。不过,这些数据来自 SpaceXAI 自己的评测和对比,应当视为官方性能主张,而非已经得到广泛独立验证的结论。
Grok 4.5 的定位也已经超出传统代码生成。Cursor 将其应用范围描述为软件工程、数据科学、金融、法律及其他计算机工作;SpaceXAI 还展示了它进行网页研究、构建多工作表 Excel 模型、制作 PowerPoint 图表和撰写 Word 文档的能力。与此同时,本次官方发布和 API 文档没有披露模型总参数量、激活参数量、专家数量、完整训练规模或明确的知识截止日期,也没有附带一份独立的 Grok 4.5 系统卡。Cursor 还主动披露,早期 Cursor 代码库快照曾意外进入训练数据,使模型在 CursorBench 上可能占有优势,因此该成绩未被纳入正式对比。
总体而言,Grok 4.5 展示的是一条较清晰的模型演进路径:利用真实开发环境中的人机交互数据、自动构造的任务环境和长时间智能体强化学习,训练能够持续调用工具、处理失败并交付可验证结果的模型。它是否在实际生产环境中比同级模型更高效,仍需要更多独立测试,但其训练方式和产品定位已经明显从“生成代码”转向“在计算机中完成工作”。
References
[1]ChatGPT App:https://chatgpt.com/download
[2]GPT-5.6 Sol:https://openai.com/index/gpt-5-6
[3]Programmatic Tool Calling:https://developers.openai.com/api/docs/guides/tools-programmatic-tool-calling
[4]GPT-Live:https://openai.com/index/introducing-gpt-live
[5]Reflect:https://www.anthropic.com/news/reflect-with-claude
[6]x.ai/cli:https://x.ai/cli
[7]Grok 4.5:https://x.ai/news/grok-4-5
预览时标签不可点