这一周,OpenAI 不再只是一家销售模型访问权限的公司,而开始成为一家以咨询规模销售企业成果的公司。GPT-5.1-Codex-Max 成为所有 Codex 产品面的默认模型——这是首款原生经过训练、可在多个上下文窗口之间自行压缩上下文、以支撑数小时长任务的模型。IBM 推出了专门的 OpenAI Practice,拥有数千名认证顾问,OpenAI 的企业收入也正式超过了消费者收入。与此同时,网络安全领域的形势也在加剧:GPT-5.6-Cyber 通过扩展后的 Daybreak 计划交付给获批研究人员,未发布的 Astra 模型则成为 OpenAI 首款逼近其 Preparedness Framework(准备框架)“Critical”(临界)阈值的模型。
而且,弃用倒计时仍在继续。gpt-5.2-chat-latest 和 gpt-5.3-chat-latest 已于 8 月 10 日从 API 中移除。Assistants API 将于 8 月 26 日关闭——还有 12 天。o3 在同一天离开 ChatGPT,DALL·E GPT 则于 8 月 30 日退役。
以下是我们围绕 Codex CLI、模型层、企业推动力和安全格局的本周全面梳理。
1. GPT-5.1-Codex-Max——面向长周期任务的新默认模型
8 月 11 日,OpenAI 宣布 GPT-5.1-Codex-Max 已取代 GPT-5.1-Codex,成为 Codex 各产品面(CLI、IDE 扩展、云端和代码审查)的默认模型。
核心的架构创新是压缩(compaction)。 GPT-5.1-Codex-Max 是首款原生经过训练、可在多个上下文窗口之间运行的模型。当接近上下文上限时,它会自动修剪不太重要的历史内容,同时保留关键决策、改动过的文件、错误、命令、测试结果和实现方向——然后在新窗口中继续。这一过程会一直重复,直到任务完成,从而让项目级重构、深度调试会话,以及单个任务中跨越数百万 token 的连贯工作成为可能。
| 规格 | 数值 |
|---|---|
| 模型 ID | gpt-5.1-codex-max |
| 上下文窗口 | 400,000 tokens |
| 最大输出 | 128,000 tokens |
| 输入 / 输出 | 文本 + 图像 / 文本 |
| API | 仅限 Responses API |
| 定价 | 输入 $1.25/M,缓存 $0.125/M,输出 $10.00/M |
基准测试提升显著:
| 基准测试 | GPT-5.1-Codex (high) | GPT-5.1-Codex-Max (xhigh) |
|---|---|---|
| SWE-bench Verified (n=500) | 73.7% | 77.9% |
| SWE-Lancer IC SWE | 66.3% | 79.9% |
| Terminal-Bench 2.0 | 52.8% | 58.1% |
新的 Extra High(xhigh)推理档位面向对延迟不敏感的任务,而在中等努力程度下,Max 模型的性能优于之前的默认模型,同时少用 30% 的思考 token。GPT-5.1-Codex-Max 也是 OpenAI 首款原生经过训练、可在 Windows 环境中运行的模型——对于任何拥有混合操作系统开发者群体的企业都直接相关。
一个重要的注意事项: 该模型仅推荐用于 Codex 或类 Codex 环境中的智能体编码,而非通用聊天。它是在真实的软件工程工作(PR 创建、代码审查、前端编码、问答)上训练的,并且专门为在 Codex CLI 内协作而打造。
2. Codex CLI v0.148.0-alpha.5——导出、分叉、归档
CLI 继续保持着惊人的发布节奏:平均约 2.2 天发布一次,过去一个月发布了 14 个版本,2026 年已跟踪到 73 个版本。 8 月 8 日,v0.148.0-alpha.5 上线,新增了三个工作流功能:
/export——将会话完整内容以结构化 Markdown 写入剪贴板或文件。无需粘贴原始记录即可进行便于审计的会话共享。codex exec fork <SESSION_ID> [PROMPT]——从现有会话创建新线程,让你可以把一个冗长的调试会话分支成并行的探索。- 会话归档 ——长时间运行的会话可以归档而非删除,既保留可浏览的历史记录,又不会让活动列表变得杂乱。
这些功能与此前版本互为补充:8 月 7 日的 v0.147.0 稳定版(可移植 Agent Plugins、--approve-for-me、MCP 2026-07-28 支持、机密信息脱敏)以及 7 月 29 日的 v0.146.0 版本(Agent Plugins 1.0、命名会话、线程分叉、通过 WebSocket 的远程 Code Mode)。趋势很清晰:Codex 正在针对长周期、多会话的智能体工作进行调优——模型侧做压缩,客户端侧做会话管理。
平台侧同样值得注意: 8 月 11 日,OpenAI 发布了 ChatGPT Linux 桌面应用公开预览版(Ubuntu 24.04/26.04 LTS、Debian 13、Fedora 43/44;支持 x64 和 ARM64;原生 .deb/.rpm)。它将 ChatGPT、ChatGPT Work 和 Codex 整合到一个原生应用中——在 Anthropic 推出 Claude Linux 桌面应用约一个月后,填补了最后一个主要的操作系统空白。导入功能可从其他 AI 工具带入项目、聊天、技能和插件。
3. GPT-5.6-Cyber、Daybreak Blue/Red 与 Astra 阈值
GPT-5.6-Cyber(8 月 10 日)。 OpenAI 推出了一款基于 GPT-5.6 Sol 构建的网络安全专用模型,用于经授权的漏洞研究、漏洞利用验证和安全测试:
- 高级网络任务完成率达到 95.0% ——相比之下,标准 Sol 为 1.5%,此前的 GPT-5.5-Cyber 为 57.3%
- 已经发现了真实的零日漏洞,包括 CVE-2026-15903(Chrome V8 越界读写,已在 Chrome 150.0.7871.128 中修复)以及一条移动操作系统权限提升攻击链
- 在 OpenAI 的 Preparedness Framework 中被评为 “High”(高) ——低于“Critical”
- 不在公共 API 上 ——通过 Daybreak Red 计划受限访问,仅限申请制
Daybreak 扩展为两个层级。 Daybreak Blue 为防御团队提供带有定制护栏的 GPT-5.6 Sol,用于漏洞发现、安全代码审查、恶意软件分析、事件响应和补丁验证。Daybreak Red 则为获批研究人员提供 GPT-5.6-Cyber,用于漏洞利用验证和红队演练。值得信赖的合作伙伴包括 Accenture、Akamai、Cisco、Cloudflare、CrowdStrike、Fortinet、IBM、Palo Alto Networks、PwC 和 Sophos——其中多家正在将 OpenAI 的网络模型整合进自己的安全产品。治理非常严格:身份验证、监控、经批准的使用限制、法律声明——而且从 9 月 1 日起,所有个人 Daybreak 账户必须使用硬件安全密钥。
Astra 逼近“Critical”线。 在 8 月 7 日至 10 日发布的一则披露中,OpenAI 表示“无法排除”其未发布的 Astra 模型已达到其 Preparedness Framework 的 Critical 级别——这是 OpenAI 任何模型的首例。Critical 意味着一个模型能够自主识别并开发针对加固的真实世界系统的可用零日漏洞利用,或者仅凭一个高层目标就设计并执行端到端的新颖网络攻击策略。OpenAI 的应对措施包括:暂停不符合强化安全要求的内部 Astra 活动、隔离测试环境、加强权重保护和加密、在智能体应用中全面监控思维链、构建可在高风险活动进行中予以中断的自动响应系统、与政府机构和英国 AI 安全研究所(UK AI Security Institute)进行外部测试——以及美国政府依据 2026 年 6 月的行政命令,首次对任何模型开展的发布前网络安全审查。目前没有发布日期;措辞暗示延期幅度是数月而非数周。
4. IBM、企业跨越与 IPO 倒计时
IBM 战略合作(8 月 13 日)。 IBM 正在将 OpenAI 的前沿模型(GPT-5.6)、Codex 和 ChatGPT Work 整合进 IBM Consulting Advantage,并设立专门的 OpenAI Practice,拥有数千名通过 OpenAI Partner Network 认证的顾问。IBM 加入了 OpenAI 的 Elite 合作伙伴层级,合作包含三大支柱:将传统业务流程改造为 AI 就绪的工作流、开发行业特定的 AI 解决方案,以及通过 Daybreak 和 IBM Autonomous Security 扩展网络安全合作。这是迄今最深入的咨询渠道交易——它把 OpenAI 直接嵌入 IBM 的服务交付平台,而非转介安排。它建立在 Frontier Alliances(Accenture、BCG、Capgemini、McKinsey、Infosys、TCS)以及 6 月的 IBM-OpenAI Daybreak Cyber Partner Program 的基础上。
企业收入超过了消费者收入。 CFO Sarah Friar 于 8 月 14 日告诉股东,企业收入现已超过 ChatGPT 消费者收入——这一跨越此前预计在 2026 年底实现,如今提前了数月。年化收入运行率已攀升至约 400 亿美元(2026 年 7 月),环比增长 20%,企业客户数量增长 32%。作为参考:2025 年官方收入为 131 亿美元,2026 年 3 月约为每月 20 亿美元以上。本周的其他商业动态还包括:以 8520 亿美元估值完成的70 亿美元要约收购(8 月 10 日)、收购演示文稿技术公司 NextSlide(8 月 10 日)、ChatGPT Business Premium 席位层级(8 月 11 日),以及让 ChatGPT 用户可以直接预订餐厅的 Yelp 合作(8 月 14 日)。
公开 S-1 即将到来。 预计在 8 月中下旬——截至 8 月 13 日尚未出现在 SEC EDGAR 上。承销商:Goldman Sachs、Morgan Stanley、JPMorgan。目标是在 2026 年 9 月以 8520 亿至 1 万亿美元的估值上市,不过有报道称仍可能推迟到 2027 年。S-1 将披露经审计的财务数据、消费者/企业/API 收入拆分、精确的微软收入分成条款(微软持有约 26.79% 的完全稀释股份)、包括 Astra 暂停和苹果诉讼在内的风险因素,以及发行价格区间。它还将恰逢科技史上最大的潜在 IPO 季——Anthropic 已于 6 月 1 日提交机密 S-1,目标 10 月上市、估值 2 万亿美元;xAI 在 SpaceX 合并后已经上市,估值 1.25 万亿美元。
5. 八月弃用考验
截止日期堆积得越来越密集,而且其中几项已经生效:
gpt-5.2-chat-latest和gpt-5.3-chat-latest已于 8 月 10 日从 API 中移除(5 月 8 日宣布)。固定到已退役快照的请求会失败——OpenAI 不会自动路由。推荐替代:gpt-5.6-sol(每 100 万 token 5 美元/30 美元,上下文 1,050,000 token)。- Assistants API 将于 8 月 26 日关闭——还有 12 天——在 OpenAI 和 Azure 上均如此。没有自动迁移、没有宽限期,退役后返回 410 Gone,对话历史也不会迁移。替代方案:Responses API + Conversations API(OpenAI)或 Foundry Agent Service(Microsoft)。
- o3 于 8 月 26 日离开 ChatGPT(API o3 快照保留至 12 月 11 日)。
- DALL·E GPT 于 8 月 30 日退役——用户应现在下载已保存的图像。替代:GPT Image 2。
- 旧版模型(gpt-3.5-turbo、gpt-4)将于 10 月 23 日从 API 退役。
- GPT-5.4 和 GPT-5.4 mini 将于 8 月 31 日从 Codex 的 ChatGPT 认证会话中移除——它们仍可通过 API 密钥使用。请检查工作区默认设置和托管配置。
供规划参考的定价说明: GPT-5.6 Luna 每 100 万 token 0.20 美元/1.20 美元(降价 80%,7 月 30 日生效)仍是最便宜的前沿层级选项之一——适合大批量批处理工作、分类和轻量任务。Claude Sonnet 5 的入门定价将于 8 月 31 日到期,届时调整为 3.00 美元/15.00 美元。
结语
工程领导者本周应着手处理三件事。
第一,评估 GPT-5.1-Codex-Max 用于长周期自动化。 压缩架构改变了一次智能体运行所能完成的事——项目级重构和数小时的循环如今切实可行,400K 上下文加上 128K 输出足以覆盖大型单体仓库(monorepo)。如果你此前已统一采用旧的 Codex 默认模型,请用 xhigh 档位针对你的工作负载重新进行基准测试;SWE-Lancer 的跃升(66.3% → 79.9%)就是那种足以覆盖迁移成本的数字。
第二,把 8 月 26 日 Assistants API 的关闭当作硬性截止日期。 还有 12 天。盘点助手、备份配置、迁移到 Responses/Conversations API 或 Foundry Agent Service,并在截止前用测试验证。如果任何生产代码仍引用 gpt-5.2-chat-latest 或 gpt-5.3-chat-latest,它已经坏了——先修它。
第三,把 Astra 披露当作治理信号来重视。 一个逼近“Critical”网络阈值的模型会改变监管对话的格局——美国政府的发布前审查流程如今已成为前沿实验室的现实。对企业而言,实际影响没有变,但更加尖锐:智能体部署需要分层防御模式——执行框架(harness)与计算的分离、热路径中的护栏、对不可逆操作的审批门控,以及让凭据远离模型生成的执行环境。
接下来的 90 天将由公开 S-1、9 月的上市窗口、IBM 的 OpenAI Practice 上线,以及 Astra 的审查流程是否会为前沿模型发布树立新先例来定义。平台正在成熟;风险正在上升。
在 X 上关注对话。