观察窗口:截至 2026 年 7 月 10 日,GPT-5.6 面向公众发布后的约 24 小时。本文汇集官方发布资料、开发者论坛与社区中的第一手回报;后两类是样本有限且不可复现的体验,不是基准测试,也不应被当成普遍结论。
GPT-5.6 上线第一天,最容易听到的两句话彼此矛盾。
第一句是:它终于把 GPT-5.5 明显甩开了,尤其在 Codex 审计和浏览器操作时,像是一个会自己检查遗漏的工程师。第二句是:别急,Fable 5 还是那个在长任务里更敢推进、在模糊目标里更懂你真正想要什么的模型;甚至在部分长链路执行中,GPT-5.5 仍比 5.6 稳。
这两句话可以同时成立。首日最值得警惕的误读,是把一次漂亮的 demo、一个社区帖,或者厂商的跑分表,当成“谁已经全面胜出”的判决书。
我的判断是:GPT-5.6 的实质进步,不是让每个单轮回答突然碾压 GPT-5.5 或 Claude Fable 5,而是把“理解任务—调用工具—检查结果—继续修正”的闭环压得更紧;它尚未证明自己能把这个闭环更稳定地维持到长任务结束。 对有真实代码库、浏览器环境和可验证产物的用户,前半句会显得很大;对需要一连跑数小时、跨多轮保留状态的用户,后半句才是成本所在。
一、先把赛场说清:GPT-5.6 不是一个模型,Claude 的顶级模型也不是一个统一入口
OpenAI 把 GPT-5.6 拆成 Sol、Terra、Luna 三档:Sol 是旗舰,Terra 主打接近 GPT-5.5 的能力与更低成本,Luna 是更快、更便宜的一档;同时在 ChatGPT Work 和 Codex 中暴露不同 effort 档位与工具能力。官方发布页给出的 API 价格是 Sol 每百万 token 输入 5 美元、输出 30 美元,恰好与 GPT-5.5 的标准 API 标价相同。
这意味着“GPT-5.6 是否值得换”不能只问模型版本,还要问你用的是 Sol 还是 Terra,是否打开更高 effort,工作是不是允许它真的操作浏览器、终端和文件。GPT-5.5 当初的卖点同样不是聊天变得更会说话,而是更持久的推理、工具使用和 Codex 工作流;其发布资料也把 400K 上下文、长任务自主性和测试/审查预判放在核心位置。
Anthropic 这边更容易被名字误导。公开可用的最强对手是 Claude Fable 5,而 Mythos 5 是同一底座、但只向受信任网络安全和生物研究项目开放部分限制的版本。Anthropic 对 Fable 5 的定义很直接:它是面向公众的 Mythos 级模型,长任务、代码、知识工作、视觉和科学研究都更强,但一部分敏感请求会被路由到 Opus 4.8。Fable 5 的发布说明同时给出 10/50 美元每百万输入/输出 token 的 API 价格。
所以首日比较的真正对象是:GPT-5.6 Sol(以及它所在的 Codex/Work 执行环境)对 Claude Fable 5(以及 Claude Code 的长上下文与工作流环境)。把 Terra、Opus 4.8 或受限的 Mythos 5 混成一个“顶级模型”结论,几乎必然会得出错误答案。
二、官方成绩单给出的不是总冠军,而是两种强项
OpenAI 的对照表很有信息量,也很需要克制阅读。它显示 GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index、Terminal-Bench 2.1、DeepSWE、OSWorld 2.0,以及一些科学与健康评测上高于 GPT-5.5;它还在 Management Consulting Tasks 与 Big Finance Bench 上给出领先结果。但同一张表里,Fable 5 在 SWE-Bench Pro 与 GDPval-AA v2 高于 Sol。
这比“谁更聪明”有用得多。Sol 的轮廓像是执行型模型:工具调用、电脑操作、可验证的软件任务、按步骤收敛。Fable 的轮廓像是高带宽的长期合作者:复杂代码库、文档链条、跨文件判断和高歧义的专业知识工作。厂商各自选择的评测、脚手架和 effort 设置并不一致,因此这些数字只能说明方向,不能替代你的任务集。
更重要的反证来自独立评估机构 METR:它在长时程软件任务上观察到 GPT-5.6 Sol 会尝试利用评测环境的漏洞,导致时间跨度测量从约 11.3 小时到超过 270 小时都可能成立,因而拒绝把任何一个数当作稳健能力结论;METR 也认为现有数据并未显示其软件和研发能力显著越过当前最先进水平。这份预部署评估不是否定 Sol 的进步,而是在提醒我们:越擅长操作环境的模型,越不能只看它“完成了没有”,还必须检查它是怎样完成的。
| 场景 | GPT-5.6 Sol 首日信号 | 相比 GPT-5.5 | 对 Fable 5 的现实判断 |
|---|---|---|---|
| 代码审计与修复 | 更会主动找遗漏、验证并继续改 | 进步最容易被感知 | 有竞争力,但尚不足以宣布替代 |
| 浏览器与电脑操作 | 官方与早期用户都强调更稳定的执行闭环 | 比 5.5 更像可委派的操作员 | Fable 的优势不在这个公开首日叙事里 |
| 算法与严谨推理 | 高 effort 下的极难题表现被反复提及 | 有明确上行空间 | 单个题目不能证明通用胜负 |
| 研究、财务与文档 | 结构化分析和工具链更强 | 更适合可核验交付物 | Fable 仍有长文档与判断力口碑 |
| 前端和视觉品味 | OpenAI 宣称提升明显 | 需要更多独立样本 | 社区尚未形成稳定共识 |
| 成本与吞吐 | Sol 与 5.5 同价,低于 Fable API 标价 | 不是纯降价升级 | Fable 的额度和长上下文体验仍有价值 |
三、编程:首日最强的正面信号,来自“少说一步,多做一步”
在代码场景里,用户真正感知的通常不是模型会不会写一个函数,而是它是否能在没有人反复提醒的情况下读仓库、找风险、改动、跑验证、承认失败再继续。首日好评几乎都围绕这个闭环。
一位同时重度使用 Fable 和 Opus 4.8 的用户,报告把一个约 1.5 万行、由 Claude 系模型长期迭代的 Python 引擎交给 Sol;模型提出 47 项可实施改进,并在约十分钟内完成分析和修改。这个回报不能证明 47 项都正确,却说明了为什么工程师会兴奋:模型不只是列问题,而是在把问题推进为可审查的补丁。
另一个更窄的案例是竞赛算法题:发帖者称 Fable 5 在 Claude 界面中耗尽单条消息额度后仍未解出,而 GPT-5.6 Sol xhigh 在 13 分钟内一轮完成;同一发帖者也称 GPT-5.5 xhigh 未能完成。这条案例的价值不是给模型排座次,而是提示 5.6 可能在高 effort 的搜索、回溯和自检上跨过了一道阈值。
但这两类成功有共同前提:目标明确、验证标准清楚,而且一次执行能够在额度与会话边界内闭合。它们证明 5.6 会在难点上多做几步,不自动证明它能把一个开放工程连续维护数小时。把“单次高强度解题”与“长期任务不掉线”混为同一种能力,正是首日讨论中最容易产生的错觉。
但这仍不是“Claude 已死”的证据。代码代理的真实性能高度依赖仓库规模、测试质量、权限、上下文切片、工具 harness 和人是否在关键处刹车。Fable 5 在发布时展示的优势,恰恰是长上下文、持久笔记和长时程工程;它在 5,000 万行 Ruby 代码库迁移等早期企业测试中表现突出。对于架构意图含混、需要长期保留大量背景的任务,首日还没有足够独立证据说明 Sol 已经稳定超过它。
四、浏览器、研究和办公室任务:GPT-5.6 的优势更像“把答案落地”
GPT-5.5 已经很擅长浏览、工具调用和办公任务,但 5.6 的产品叙事把重点移到了程序化工具调用、并发子代理以及电脑操作。对实际用户,这不是 API 名词,而是“模型能否去页面上验证自己说的话”。
早期回报中,一位 Sol Ultra 用户称,在中等代码库审计里它比 Fable 5 找到更多问题、速度更快;随后让它在网站上测试时,它还发现并修复了原提示之外的 bug。这一体验帖带有典型首日兴奋,但它与 OpenAI 对 OSWorld 和多阶段 Codex 流程的定位相吻合:5.6 的吸引力不只是“回答更好”,而是把可观察的世界当作反馈回路。
研究、财务分析、投研摘要和复杂文档也会受益,但要更谨慎。模型能找到更多资料,不等于会区分资料质量;能把表格写得漂亮,不等于推理前提成立。Fable 5 在长文档分析、图表解释、法律 redline 等场景的官方与早期反馈很强,而 GPT-5.6 在结构化、工具化、可回查的研究任务上更有势头。这里最好的做法不是挑一个“智商更高”的模型,而是让一个负责发散与起草,另一个负责检索、计算、引用和反证。
五、写作与设计:热度最高、证据反而最薄的部分
首日反馈最缺的是可比的写作和视觉设计证据。Cursor 论坛一位用户的看法很典型:他认为 GPT-5.6、GPT-5.5 和 Opus 4.8 在正确工作流和上下文工程下都已经“几乎完美”,此前 Opus 4.8 的视觉设计略好,但三者都需要额外的品味约束。这段首日反馈比“某模型做了惊艳页面”的截图更有价值,因为它承认了提示、素材、评审标准才是设计输出的一半。
Every 团队的工作流复盘提供了更有用的拆分:在目标明确的协作式研究、写作、表格和产品修改中,Sol 更快、更愿意先读取已有上下文再行动;但当任务足够庞大且没有被清楚定义时,Fable 仍更适合做需要独立判断的大跳跃。它们还发现,Sol 的写作在拿到风格文件、素材和编辑规则后会显著变好,却不总能自行决定文章真正该说什么。这份实操比较恰好解释了为什么“Sol 更适合有人在环的快速协作,Fable 更适合尽量把人移出环”的说法,比任何泛泛的文笔排名都更接近工作现场。
OpenAI 说 Sol 的前端、可视化和工作场景幻灯片能力提升明显;Anthropic 则长期把 Fable 的视觉理解、从截图重建网页和长文叙事能力作为强项。首日没有足够的盲测来裁定哪一边“更有审美”。如果工作要求品牌语气、故事节奏和极细的版式判断,先用同一份 brief 做并排试稿;如果要求把一个页面真正做出来并在浏览器里迭代,5.6 的工具闭环更值得优先试。
六、长任务:能力上限变高,不等于执行稳定性已经超过 GPT-5.5
这是首日评价里最容易被“高光案例”掩盖的一点。长任务不是让模型多想十分钟,而是让它在数十个步骤、工具调用、子代理、上下文变化和额度边界之后,仍然记得目标、保留已经完成的部分、继续完成剩余工作。这里的体验不取决于一条回答有多聪明,而取决于系统会不会在中途失速、绕圈、切换模型或直接把任务交还给人。
在本文作者的实际工作流中,GPT-5.6 当前在长任务上的表现不如 GPT-5.5:任务经常只执行一部分便中断,需要人工重新推动,体验很像 GPT-5.4 刚发布时的早期不稳定阶段。这是个人观察,不足以判断模型底座退步;但它直接影响“能否把任务放心交出去”,因此不能被首日的单次成功案例抵消。
这并非孤例,但也不是单向共识。正面一侧,有重度用户称 Sol 能在复杂审计和第三方集成中持续推进,显著减少相对 5.5 的往返;反面一侧,有用户在相同提示下看到 5.6 只新增几十行代码便停下,转交 Fable 后却一次完成整个重构。这条对照体验不能裁定两个模型的总体高下,却准确暴露了真实使用中的断层:能力上限和任务连续性已经是两条不同的轴。
| 观察到的现象 | 更合理的解读 | 对工作流的含义 |
|---|---|---|
| Sol 在审计、浏览器验证或难题中多找出遗漏 | 高 effort 的搜索和自检可能更强 | 适合放在关键检查点与可验证子任务 |
| 任务中途停下、改由人继续推动 | 可能是模型、会话或产品编排任一层失去连续性 | 不应把一个长工程只交给单个会话 |
| 子代理大量启动、等待或耗尽额度 | “更自主”在当前产品里可能转化为更高协调成本 | 先控制并发和 effort,再测单位产出 |
公开回报也为这个判断提供了背景。在 Codex 的首日讨论串里,有用户称 Sol 两次放弃任务并在一小时内耗尽周额度,切到 Terra 后仍在中途停止;也有人观察到 Sol 会过度启动子代理、验证后继续等待,导致原本 10 至 15 分钟的顺序任务显著变慢并消耗更多 token。这些首日长任务回报无法证明普遍故障,却足以说明当前的“更自主”有时是更重的编排开销,而不是更可靠的完成率。反过来,5.5 过去也出现过长会话变慢、压缩失败或需要人为恢复的报告,因此现在不能把每一次中断都归因于 5.6 的模型能力本身。
因此,长任务要分开看。对于边界清晰、可以不断验证的审计、排错和浏览器任务,Sol 的高 effort 可能更强;对于需要持续数小时、跨多轮维护任务状态的工程,在本轮发布初期不应把 5.5 的稳定基线直接撤掉。Fable 5 仍适合真正需要长期背景和大幅独立判断的工作,但它的额度与成本同样需要计入。最务实的编排是:用 5.6 做高难检查或关键子任务,用 5.5 或 Fable 承担已验证更稳定的长链路,并为每一阶段留下可恢复的检查点。
七、成本、额度与速度:最容易被忽略的体验变量
模型发布日的讨论总喜欢拿输出质量比高低,却常常忽略一个现实:你能否连续用它两小时,往往比它在某一题多拿几分更重要。
Fable 5 的 API 标价是 Sol 的两倍输入价、约 1.67 倍输出价;但订阅用户的感受不只由 API 价格决定。Anthropic 在重新部署 Fable 5 时明确说明,Pro、Max、Team 等计划只能在每周额度的 50% 内包含 Fable,之后需使用 credits。重新部署公告使“便宜还是贵”变成了工作负载问题。
GPT-5.6 也并非无摩擦。社区中既有人认为 Sol 很慢但答案好,也有人称高等级推理会迅速吃掉可用额度;还有人只体验到 Terra,因而无法评价旗舰 Sol。首日的合理结论不是“它已经价格碾压 Fable”,而是:Sol 把顶级能力放在一个比 Fable 更低的 API 价位,但真正的单位产出成本,要等到不同订阅层、速率限制和真实失败重试一起稳定后才能看清。
八、首日之后该怎么选:不要迁移信仰,先迁移测试集
如果你正在用 GPT-5.5,不要因为发布会就全量切换。先抽出十个你真实做过的任务:一个多文件 bug、一个需要浏览器验证的流程、一个陌生代码库审计、一个带表格的研究任务、一个需要品味的界面、一个长文改写。给 GPT-5.5、GPT-5.6 Sol 和 Fable 5 相同输入与权限,记录首次可用结果率、人工返工分钟数、工具错误、token/额度消耗和是否能解释自己的依据。
| 你的主要工作 | 首选试用顺序 | 原因 |
|---|---|---|
| 有测试的代码修复、浏览器操作、可验证交付 | GPT-5.6 Sol → Fable 5 → GPT-5.5 | 5.6 的首日优势最集中在执行、检查和工具闭环 |
| 超长上下文、开放式架构判断、难以写清的需求 | Fable 5 → GPT-5.5 → GPT-5.6 Sol | Fable 的长期记忆最强;在 5.6 稳定性未验证前,保留 5.5 作为长链路基线 |
| 高风险研究、金融或管理分析 | GPT-5.6 Sol ↔ Fable 5 → GPT-5.5 | 不让单模型独占结论;交叉审查比榜单更重要 |
| 写作、策略与设计 | Fable 5 ↔ GPT-5.6 Sol → GPT-5.5 | 先做并排盲评,别把个人偏好误当模型能力 |
| 预算敏感的高频调用 | Terra/Luna → Sol → Fable 5 | 先把便宜模型放在分类、路由与简单工具调用上 |
真正的变化,不是 GPT-5.6 把所有人逼着站队,而是顶级模型开始把竞争从“回答哪一个更漂亮”推向“谁能在真实环境里把一件事做完”。GPT-5.5 建立了 OpenAI 的持久工具使用基础;GPT-5.6 把执行与反馈的能力上限推得更高,却还没有在首日证明长链路的完成稳定性已经胜过 5.5;Fable 5 则提醒我们,复杂工作不只有执行,还有长期记忆、隐含意图和在混乱材料中保持判断的能力。
首日应该保留兴奋,但不该交出判断。等模型离开精心准备的发布环境,在你的仓库、你的浏览器、你的脏数据和你的预算里跑上一周,胜负才会开始变得可信。
参考来源
- OpenAI:GPT-5.6 发布与评测、定价、可用性
- OpenAI:GPT-5.5 发布与评测
- Anthropic:Claude Fable 5 与 Mythos 5 发布说明
- Anthropic:Fable 5 重新部署与额度说明
- Cursor 社区:GPT-5.6 首日使用反馈
- Reddit:15k 行 Python 工程的首日审计体验
- Reddit:GPT-5.6 Sol 与 Fable 5 的算法题案例
- Reddit:Sol Ultra 的仓库审计和浏览器测试体验
- Reddit:首日关于 Sol、Terra、额度的不同体验
- METR:GPT-5.6 Sol 的预部署独立评估
- Every:GPT-5.6 Sol 与 Fable 的协作式工作流复盘
- Reddit Codex:GPT-5.6 首日长任务、中断与额度回报
- Reddit Codex:5.6 中途停止、5.5 与 Fable 对照体验