GPT-5.6上线!对话框式AI将死——这篇文图完全都是5.6做的!

2026 年 7 月 9 日,OpenAI 发布 GPT‑5.6 Sol、Terra、Luna,并同步推出 ChatGPT Work 与统一桌面应用。本文依据 OpenAI 当日公告、产品文档及首批独立体验整理。

一、chatgpt正在整合一切
GPT‑5.6 变强当然重要,可这次发布更大的信号,落在 OpenAI 对产品边界的重新划定。
过去几年,OpenAI 的能力散落在聊天框、Codex、浏览器、连接器、文件工具和各种独立入口里。用户每换一种工作,就要换一个前台窗口。
7 月 9 日之后,这些窗口开始被收进同一栋楼:Chat 负责问答与讨论,Work 负责拆解并执行知识工作,Codex 负责开发任务;浏览器、Computer Use、插件、文件与定时任务则成为共享的行动层。

从分散工具到统一工作台:本次发布的主线落在产品整合。
这使 OpenAI 的目标显得更清晰。
它想争夺的已超出“最好用的聊天机器人”,更接近 AI 时代的生产力入口。Google Workspace 与 Microsoft 365 掌握文档、表格、邮箱、会议和组织协作,OpenAI 选择从另一个方向切入:先用模型理解任务,再把应用、文件和网页接到模型周围。
时间点也很微妙。
OpenAI 在 6 月 8 日宣布已向美国证券交易委员会秘密提交 S‑1 草案。几个月前,公司还披露企业业务已贡献超过 40% 的收入,并预计在 2026 年底接近消费业务。一个能进入企业日常工作流、承接更多任务并持续消耗算力的平台,显然比单个明星模型更适合支撑上市叙事。
二、GPT‑5.6:三档模型正式上线
GPT‑5.6 从 6 月 26 日的有限预览转为全球 GA,一次发布三档。它们更像长期能力层级,后续可以按各自节奏更新,名称也开始承担产品定位。

三档模型对应三类预算:复杂任务、日常主力与大批量处理。
Sol 是旗舰层,重点能力覆盖 coding、科学研究、网络安全、Computer Use 与长时间 Agent 任务。
它新增 max 推理强度,让单个 Agent 用更多时间搜索、核验和修订;ultra 再向前走一步,默认调度 4 个 Agent 并行工作。OpenAI 的评测图表还展示了 16 Agent 配置,但官方产品页没有把 16 写成统一固定上限。
Terra 是平衡层。
OpenAI 给它的定位很坦白:性能可与 GPT‑5.5 竞争,价格约为后者的一半。它大概率会成为最常用的一档,像办公室里那台很少被讨论、每天却承担最多任务的主力电脑。
Luna 是速度与成本层,
面向分类、整理、批量生成、轻量工具调用等高频任务。模型产业走到今天,小模型的意义早已超出“缩水版旗舰”。当任务量从几十次上升到几百万次,延迟和单位成本会直接决定产品能否成立。
在 ChatGPT 的普通 Chat 中,Plus、Pro、Business、Enterprise 用户可通过 medium 及以上推理强度使用 Sol;Pro 与 Enterprise 还可选择 Sol Pro。
ChatGPT Work 与 Codex 的规则略有差别:Free、Go 默认使用 Terra;Plus 及以上可在 Sol、Terra、Luna 之间选择。
具体上线采用 24 小时渐进式推送,首日看不到某个模型并不罕见。
API 标准价格如下,单位为每百万 token:
| 模型 | 输入 | 输出 | 适合任务 |
| GPT‑5.6 Sol | 5 美元 | 30 美元 | 高难 coding、研究、安全、复杂 Agent |
| GPT‑5.6 Terra | 2.5 美元 | 15 美元 | 日常知识工作与主力应用 |
| GPT‑5.6 Luna | 1 美元 | 6 美元 | 低延迟、大批量、成本敏感任务 |
参照 Anthropic 的官方价格,Claude Fable 5 为每百万输入 10 美元、输出 50 美元。Sol 的输入价格只有一半,输出低 40%
Terra 与 Luna 的价差更大。当然,每百万 token 的标价无法直接等同于完整任务成本,推理 token、工具调用次数和任务成功率都会改写账单。这也是今天看模型价格时最容易被忽略的一层。
三、更高的 Agent 效率
这次最醒目的成绩来自 Terminal‑Bench 2.1。
GPT‑5.6 Sol 得分 88.8%,Ultra 提升到 91.9%,创下当时最高结果。这个基准考查命令行环境中的规划、迭代与工具协调,比单轮代码补全更接近真实开发 Agent 的工作方式。

Sol 的重点优势落在长流程任务的成功率与单位成本。
在覆盖 55 个专业领域长流程任务的 Agents’ Last Exam 上,OpenAI 给出的旗舰成绩是 53.6,比 Claude Fable 5 的 adaptive reasoning 高 13.1 分。
这里需要拆开看成本口径
Sol 在 medium 推理强度下仍领先 11.4 分,估算成本约为 Fable 5 的四分之一。高分与低成本分别来自不同配置,混成同一组数字会夸大优势。
网络安全和生物学同样有明显提升。
Sol 在 ExploitBench 2 上达到 73.5%,GPT‑5.5 为 47.9%;在 SEC‑Bench Pro 上为 71.2%,Ultra 为 74.3%。GeneBench Pro 上,Sol 从 GPT‑5.5 的 12% 提升到 28.7%。
这些数字支持一个相对稳妥的判断:GPT‑5.6 的进步主要体现在更长的任务链、更强的工具协调,以及更少 token 完成同类工作的能力。
早期独立体验也给这份成绩单留了一道边
Simon Willison 在首日文章中写道,Sol “非常有能力”,但在他常做的复杂 coding 任务上,暂时没有让他感到明显强于 Fable 5。他同时强调,单看 token 标价已很难衡量模型,因为不同模型完成相同任务时会消耗完全不同的推理量。
这份反馈很重要。基准告诉我们能力边界在移动,真实项目才会暴露模型的工作习惯、持续性和返工成本。就发布首日的证据看,Sol 的性价比优势更稳,复杂 coding 的绝对领先仍需更多公开案例。
四、ChatGPT 与 Codex 合并:一个应用,三种工作界面
统一桌面应用把 Chat、Work、Codex 放进同一工作台。任务、项目、文件和长时间运行的工作都留在一个界面内,用户再按目标选择入口。三种模式调用的能力有大量重叠,主要差异落在交互重点和结果呈现。

同一工作台之上,三种模式面向不同工作语言。
Codex 继续服务开发者,展示代码 diff、内联编辑、PR 审查侧栏和多仓库项目;
Work 面向更广泛的知识工作,用文档、表格、幻灯片、站点和任务进度承接结果。
Chat 保留低门槛的讨论与问答入口。
可以把它们理解成同一套生产系统的三张操作台:开发者需要看到齿轮,普通办公用户更关心成品与审批节点。
这条产品路线早在 3 月已有预告。
Fidji Simo 的内部备忘录经媒体批量后,外界得知 OpenAI 认为过多应用和技术栈造成分散,拖慢开发并影响质量标准。
7 月的统一应用,正是那次收缩与聚焦的落地版本。
五、ChatGPT Work:助手开始接管完整任务链
如果只挑本次发布里最值得关注的一项,我会选 ChatGPT Work。
它把用户的目标拆成步骤,从 Google Drive、Slack、Teams、邮箱、日历、SharePoint、CRM 等连接源收集上下文,再生成文档、表格、幻灯片、分析报告或站点。任务可以运行数小时,遇到缺失信息、权限动作或关键决策时再请求确认。用户仍能查看进度、补充材料、改变方向和批准敏感操作。

目标进入后,Work 负责取数、拆解、执行、核验与交付。
它还支持规划任务:既能定时运行,也能由事件触发,或持续监控变化。
比如每周读取 Slack 更新并刷新会议议程,每天检查网页与仪表盘,发现变化后发送报告;也可以在收到新邮件时更新一份演示文稿。
这也是 OpenAI 直接对标办公套件的地方。
Google 和 Microsoft 的优势来自现成的企业数据与应用入口;OpenAI 的筹码则是跨应用规划与执行。哪一边先把权限、可靠性和组织治理磨平,哪一边就更接近企业真正愿意长期付费的 Agent。
六、其余更新
GPT‑5.6 与 Work 占据了发布会中心,周围几项更新同样指向统一平台。

生成、浏览、操作与开发被收进同一条工作链。
第一项是 Sites。
ChatGPT 生成的可视化、仪表盘、项目追踪器、内部入口和轻量工具,可以直接转成可交互站点,通过 URL 向团队或公众分享。它还能随底层信息变化继续更新。过去对话里的产物常停在聊天记录中,Sites 给这些产物加了一扇对外打开的门。
第二项是 内置浏览器与 Computer Use。
桌面应用拥有独立浏览器 profile,可在任务需要时登录网站,并把下载文件保存到系统下载目录;Computer Use 可以执行打开页面、点击、输入、截图和核验等动作。若任务需要沿用用户现有的 Chrome 登录态、标签页与扩展,则通过 Chrome 扩展接入。这里的分工很清晰:内置浏览器提供隔离环境,Chrome 扩展负责复用真实工作现场。
第三项落在 Codex。
新版支持在 diff 中直接编辑、侧栏查看 PR 与审查反馈、单项目连接多个仓库,并使用 GPT‑5.6 加速 Computer Use。Ultra 也进入 Codex,Plus 及以上套餐可用。
还有一个容易被低估的动作:统一桌面应用新增“从其他 Agent 导入”。官方文档列出的可迁移内容包括 instructions、settings、skills、plugins、项目、近 30 天聊天、MCP 配置、hooks、slash commands 与 subagents。导入不会删除原有 Agent 配置。即便文档正文采用中性称呼,它瞄准的用户群并不难辨认——已经在 Claude Code 等工具里积累大量偏好与工作流的人,如今获得了一条更低摩擦的迁移路径。
七、最后:奥特曼拯救世界
把这些更新放在一起看,OpenAI 的商业逻辑已经从“卖更聪明的 token”延伸到“占据工作发生的界面”。模型负责推理,插件和浏览器负责接触外部世界,Computer Use 负责操作,Sites 和办公文件负责交付,统一桌面应用负责留住任务历史与组织关系。

模型、工具、任务与企业治理形成同一套平台循环。
这套组合对企业客户很有吸引力。
企业采购看重的从来不只是一张跑分表,还包括权限、审计、连接器、稳定容量、人员迁移成本,以及员工能否在同一个入口完成更多工作。统一平台让 OpenAI 有机会把这些条件打包,也让客户一旦形成工作习惯后更难替换。
它同样服务于 IPO。
单个模型的领先可能只维持几个月,生产力平台的价值来自长期使用、企业数据接入和任务迁移成本。对于一家刚秘密提交 S‑1、企业收入占比已经超过 40% 的公司,后者显然能讲出更大、也更容易被资本市场计价的故事。
当然,平台故事能否成立,最后仍要回到很朴素的检验:Work 能否稳定交付,Computer Use 能否少走弯路,企业管理员能否放心给权限,用户能否在关键节点看懂并接管。模型更强只是入场券。OpenAI 今天真正押下的筹码,是让 ChatGPT 从一个回答问题的窗口,变成越来越多工作开始、推进并完成的地方。
资料来源
-
OpenAI:GPT‑5.6 正式发布、基准、访问规则与 API 定价
-
OpenAI:ChatGPT Work 与统一桌面应用
-
OpenAI Learn:本周 ChatGPT 与 Codex 更新
-
OpenAI Learn:内置浏览器与 Computer Use
-
OpenAI Learn:从其他 Agent 导入设置与工作
-
OpenAI:企业业务收入占比与统一 AI 超级应用战略
-
OpenAI:秘密提交 S‑1 草案
-
Anthropic:Claude Fable 5 定价与定位
-
Simon Willison:GPT‑5.6 首日体验