上周启动的平台构建阶段正在加速推进。OpenAI 发布了 Codex CLI v0.146.0,带来 Agent Plugins、命名会话、线程分叉(thread forking)以及基于 WebSocket 的远程 Code Mode——相较 v0.145.0 领先 222 个提交。他们还低调地在 Apache 2.0 协议下开源了 Codex Security CLI,将基于代理的漏洞扫描器免费交到开发者手中。Anthropic 则以 Claude Opus 5 作为回应,这款接近前沿水平的模型定价仅为 Fable 5 的一半,发布后立刻成为 Claude Code 的默认模型。在开放权重模型领域,32 个 Kimi K3 代理在 90 分钟内发现了 19 个 Redis 零日漏洞——这证明代理式安全研究已不再是纸上谈兵。

以下是我们本周关于 OpenAI 模型、Codex 生态以及更广泛竞争格局的要点梳理。

1. Codex CLI v0.146.0——Agent Plugins、会话管理与远程执行

7 月 29 日的这次发布是自 v0.145.0 稳定多代理 V2 以来,Codex CLI 在架构层面最重要的一次更新。它让 Codex 从一个对话式终端工具,朝着更接近"代理操作系统"的方向演进。

Agent Plugins 1.0。 Codex 现在能够识别根目录下的 plugin.json 清单文件,用于描述可复用的代理能力——包括可移植的元数据、skills/ 目录下的直接技能,以及 mcp.json 中的 MCP 配置。插件可以在工作区层面发布,Codex 还在自有市场之外新增了 Amazon Bedrock 和 Claude Code 的插件市场。其架构意义重大:一个插件包现在可以在 Codex、Claude Code 和 Bedrock 之间迁移,无需针对每个主机重新配置。而仍然与主机绑定的部分——hooks、权限、UI 元素——则存在于同一清单文件中的独立扩展层(extension overlay)里。这是跨竞争平台实现可移植代理工具链的第一个实质性步骤。

命名会话、固定线程与侧边对话。 /new/clear 现在接受可选的会话名称。重要线程可以固定以便快速访问,ctrl-/ 可在侧边对话之间切换,而无需关闭侧边对话或父线程。会话状态——已发送消息、最终回复、失败轮次的错误、导入时间以及审批设置——会在中断、回放、导入和分叉之后持续保留。会话正在成为一种被管理的对象,而不再是附着于某个终端窗口的回滚缓冲区。

带分页历史的线程分叉。 线程现在可以在完整的分页历史下进行分叉,包括不会让线程列表变得杂乱的一次性分叉。这使得从共享上下文中并行探索不同方案成为可能——此前这类工作流需要外部编排。

基于 WebSocket 的远程 Code Mode。 Codex app-server 现在可以通过 ws://wss:// 连接远程 Code Mode 主机。省略该参数时,行为与之前相同,启动本地主机。这实现了代理控制平面与代码执行平面的分离,支持瘦客户端架构——本地界面驱动功能更强大的远程主机。已经为团队配置了云工作站的用户,不再需要手工搭建中继来访问它们。

代理与 MCP 生命周期修复。 配置的代理现在会在身份验证、插件下载、MCP 授权、远程执行和 WebSocket 连接中全部生效。MCP 连接在认证和配置变更后保持存活——此前这常常导致静默重连失败。执行器提供的技能现在可以在会话内被发现和读取,当上下文预算限制迫使技能被截断时会发出警告。

2. Codex Security CLI——以 Apache 2.0 协议开源

OpenAI 于 7 月 28 日至 29 日在 GitHub 和 npm 上低调发布了 @openai/codex-security。Hacker News 在官方公告之前就发现了它。该包采用 Apache-2.0 许可证,包含 CLI、TypeScript SDK、Dockerfile 以及用于 CI 集成的 GitHub Actions 工作流。

它做什么。 Codex Security 会构建针对仓库的威胁模型,探索真实可行的攻击路径,在隔离沙箱中验证发现,并提出供人工审核的补丁建议。它支持全仓库扫描、定向路径审查、Git diff 扫描、工作区检查,以及通过 CSV 输入对多个仓库进行批量扫描。扫描历史持久化存储在 SQLite 中,支持跨时间的发现追踪——周一检测到的漏洞,在周五再次扫描同一代码路径时仍会保持其身份标识。

输出与 CI 集成。 扫描完成后会生成 report.mdfindings.jsoncoverage.json 以及一份扫描清单。导出格式包括 SARIF、JSON 和 CSV——也就是说,结果可以直接接入 GitHub Code Scanning、Azure DevOps 或任何现有的安全仪表盘。--fail-on-severity 标志会在发现项超过阈值时返回失败退出码,从而可作为 CI 门禁使用。Git hooks 可以在提交前扫描暂存区更改。

需要注意的地方。 客户端是开源的,但"大脑"不是。运行扫描仍然需要访问 OpenAI 侧的 Codex Security 服务。默认模型是采用超高推理强度的 gpt-5.6-sol。运行时要求 Node.js 22+、Python 3.10+,以及你的 OpenAI 账户具备 Codex Security 访问权限。源代码是公开的,但扫描器后端仍然只对获得批准的 Enterprise、Business 和 Education 客户开放。

命令速览:

  • scan——全仓库扫描,支持 --path--diff 或工作区
  • bulk-scan——从 CSV 批量扫描多个仓库,可用 --workers 并行处理
  • scans list/show/rerun/match/compare——历史记录与回归追踪
  • export --export-format sarif——面向安全工具的结构化输出
  • validate / patch——验证发现并生成建议修复
  • install-hook——提交前扫描暂存区更改

对于已经深度使用 OpenAI 生态的工程团队来说,这是对 CI/CD 流水线的重要补充。对于将其与独立 SAST 工具对比评估的团队而言,受限的访问权限和对 OpenAI 模型的依赖是关键的制约因素。

3. ChatGPT Work——企业注册与积分激励

OpenAI 已向企业客户开放 ChatGPT Work,并附带一项旨在推动采用的积分激励。企业客户可在 8 月 21 日前完成注册。每位在注册后两周内首次试用 Work 的团队成员可获得最高 200 美元的积分,有效期为 14 天。现有客户联系各自的客户团队;新客户则通过 OpenAI 的销售渠道接洽。

这是针对 Work 代理界面的一次获客策略,而非定价调整。积分按用户而非按组织发放,这意味着激励与个人采用对齐,而非批量采购。对于正在评估将 ChatGPT Work 作为生产力工具的工程负责人来说,14 天的积分窗口是端到端跑通一个真实工作流试点的合理周期。

Assistants API——还剩 26 天。 8 月 26 日的关停期限距今已不到四周。不会提供自动化迁移工具。Responses API 加 Conversations API 是替代方案,目前已达到完整的功能对等,包括深度研究、MCP 工具连接和计算机使用(computer use)。Azure OpenAI 遵循相同的时间表。微软 Fabric Data Agent 团队建议迁移到 MCP,而不是直接针对 OpenAI 的 Responses API 重建——这释放出一个信号:平台合作伙伴已经在围绕后 Assistants 时代的格局进行构建。仍在依赖 Assistants API 的团队应将其视为具有硬性截止日期的 P0 级迁移任务。

4. Anthropic——Claude Opus 5 与编程技术栈

Anthropic 于 7 月 24 日发布了 Claude Opus 5,它立刻成为 Claude Code 在 Claude Max 和 Claude Pro 两个套餐中的默认模型。卖点很直接:接近 Fable 5 的智能水平,价格只有一半。

定价与定位。 Opus 5 的输入/输出 token 价格分别为每百万 5/25 美元——与 Opus 4.8 相同,是 Fable 5(10/50 美元)的一半。Artificial Analysis 智能指数给 Opus 5 打出 61 分,比 Fable 5 高 1 分,比 GPT-5.6 Sol 高 2 分。在 Frontier-Bench v0.1(代理式编程)上,Opus 5 的得分是 Opus 4.8 的两倍多。在最高努力模式下,CursorBench 3.2 上它的表现与 Fable 5 的峰值相差不到 0.5%,而每任务成本只有一半。在 ARC-AGI-3 上,它的得分是次优模型的 3 倍。

努力程度调节。 五级努力阶梯(low、medium、high、xhigh、max)默认为自适应。在低努力模式下,Opus 5 在综合基准上取得 62.8% 的成绩,每任务成本 2.55 美元——与 Opus 4.8 在最高努力模式下的表现(62.3%,每任务 5.77 美元)相当。快速模式定价为 10/50 美元,速度约为 2.5 倍,可通过 Claude API 以研究预览形式使用。

系统提示词瘦身。 Anthropic 发布了新的上下文工程指南,显示将 Claude Code 的系统提示词削减 80% 以上,编码评测性能没有可测量的下降。这对代理开发者来说是一个信号:冗长的系统提示词会带来真实的 token 成本,而激进地裁剪可能是安全的。

Claude Code v2.1.219。 与 Opus 5 一同于 7 月 24 日发布。/fork 命令现在会创建真正的后台会话(在 claude agents 中拥有独立行),而原先的会话内子代理路径则变为 /subtask。会话级上限仍为 200 次网络搜索和 200 个子代理。MCP 对长时间运行调用的自动后台化得到保留。Claude Sonnet 5 的促销定价(每百万 token 2/10 美元)将持续到 8 月 31 日,之后调整为 3/15 美元。

5. 竞争格局——代理式安全、并行代理群与 MCP 的无状态未来

Kimi K3——32 个代理发现 19 个 Redis 零日漏洞

安全研究员 Chaofan Shou 针对 Redis 代码库部署了 32 个并行的 Kimi K3 子代理。这些代理自主完成了仓库克隆、构建自定义模糊测试框架、在 GDB 中调试崩溃,并生成了可用的概念验证(PoC)利用——在大约 90 分钟内发现了 19 个此前未知的漏洞,其中包括一个仅用 27 分钟构建的已认证 RCE 利用链。

Redis 于 7 月 23 日发布了 7 个安全补丁版本。底层漏洞已确认为真实存在;但 19 个零日漏洞的数量和 27 分钟的时间线均为自行报告,未经独立验证。同日发布的英国 AISI 与美国 CAISI 联合研究发现,Kimi K3 在 ExploitBench 上的得分为 32.2%,而未具名的美国前沿模型为 76.2%,为这条头条新闻提供了恰当的背景参照。

对安全团队的启示:借助开放权重模型,代理式漏洞发现如今已被证明可以在有意义的规模上实现。在安全任务上,前沿专有模型与开放权重替代方案之间的差距仍然存在,但正在快速缩小,值得认真评估。

xAI——Grok Build 工作流支持 1,024 个并行代理

xAI 的 Grok Build 新增了 Workflows 编排层。单个自然语言请求会被拆解为多个阶段,每个阶段分配给并行的子代理。默认并发为 128 个代理,最大的任务可扩展至 1,024 个。独立的"怀疑者"代理会在结果整合前进行验证。工作流以可复用的斜杠命令形式保存在 .grok/workflows/ 目录中。

底层模型 grok-build-0.1 的定价为每百万输入/输出 token 1/2 美元——极具进攻性的低价。访问需要 SuperGrok(每月 30 美元)或 X Premium+(每月 40 美元)订阅,运行 1,024 代理的任务则需要 SuperGrok Heavy(每月 300 美元)。xAI 还在 7 月 20 日为 Excel、Word 和 PowerPoint 推出了免费的 Grok 4.5 插件,将触角扩展到 Office 工作流。

MCP 规范——发布以来最大规模修订

2026-07-28 版 MCP 规范修订是 MCP 发布以来最大的一次协议变更。关键改动包括:协议核心现在是无状态的——移除了 initialize/initialized 握手和 Mcp-Session-Id 头。每个请求都在 _meta 中携带其协议版本和客户端能力。多轮往返请求(Multi Round-Trip Requests,MRTR)取代了服务器发起的请求。MCP Apps(在沙箱化 iframe 中呈现的服务器渲染 HTML UI)现已成为官方扩展。扩展框架使用反向 DNS 标识符并独立管理版本。授权机制向 OAuth 2.0 和 OpenID Connect 收紧。正式的弃用政策要求至少 12 个月的过渡期。

微软发布了实现新规范的 MCP C# SDK v2.0,并向后兼容 v1 代码。对于构建 MCP 服务器的团队来说,无状态核心意味着普通的 HTTP 基础设施现在就可以路由 MCP 流量——无需会话粘性(session affinity)。这对负载均衡器、CDN 和 API 网关来说是一项实实在在的运维简化。

Google——Gemini 3.5 Pro:第四次跳票在即

Gemini 3.5 Pro 已经连续错过三个发布窗口——最初的 6 月目标、泄露的 7 月 17 日,以及整个 7 月窗口。Google 的模型目录中至今仍没有 gemini-3.5-pro 条目。该公司已悄悄停止公布目标日期,有报道称它已转而开始预训练 Gemini 4。预测市场目前将发布时间押在 7 月底至 8 月初,并认为再次跳票的几率相当高。Google 在前沿模型竞赛中的竞争地位仍在持续削弱。

结语

本周,代理平台层初步成型。Codex CLI v0.146.0 的 Agent Plugins 让工具链能够跨平台移植——这在编程代理生态中尚属首次。Codex Security CLI 将代理式安全扫描交到开发者手中,尽管其"大脑"仍然受限。Opus 5 的定价将前沿水平的编程智能带到 5/25 美元,为标准化采用 Anthropic 的团队将成本上限砍掉一半。而 MCP 规范的无状态核心,则为每一个依赖它的代理平台简化了基础设施叙事。

本周给工程负责人的三项行动建议:第一,对照团队的可复用工具链评估 Codex CLI v0.146.0 的 Agent Plugins——跨平台清单格式是代理技能第一个可信的移植方案。第二,如果你的 OpenAI Enterprise 或 Business 账户具备 Codex Security 访问权限,对一个生产仓库运行一次扫描,并将发现与你现有的 SAST 流水线进行对比。第三,如果尚未开始 Assistants API 迁移,你还有 26 天——现在就开始。

代理式安全时代在本周正式到来。无论是 32 个 Kimi K3 代理发现 Redis 零日漏洞,还是 Codex Security 扫描你的 CI 流水线,传递的信息都是一样的:漏洞发现的时间窗口正在不断压缩,而参与其中的工具正变得越来越触手可及。

X 上关注讨论。