上週展開的平台建置階段正在加速推進。OpenAI 釋出 Codex CLI v0.146.0,加入 Agent Plugins、具名工作階段(named sessions)、討論串分叉(thread forking)與透過 WebSocket 的遠端 Code Mode,較 v0.145.0 超前 222 個 commit。同時低調地以 Apache 2.0 授權開源 Codex Security CLI,讓開發者免費取得以代理(agent)為基礎的漏洞掃描工具。Anthropic 則以 Claude Opus 5 回應:這款接近前沿(frontier)水準的模型,定價僅為 Fable 5 的一半,上線後立即成為 Claude Code 的預設模型。而在開放權重(open-weight)模型陣營,32 個 Kimi K3 代理在 90 分鐘內找出 19 個 Redis 零日漏洞,證明代理式安全研究已不再是紙上談兵。
以下是本週關於 OpenAI 模型、Codex 生態系與更廣泛競爭格局的重點整理。
1. Codex CLI v0.146.0 — Agent Plugins、工作階段管理與遠端執行
7 月 29 日釋出的這個版本,是自 v0.145.0 穩定多代理(multi-agent)V2 架構以來,Codex CLI 在結構上最具意義的一次更新。它讓 Codex 從一個對話式終端工具,轉變為更接近代理作業系統的存在。
Agent Plugins 1.0。 Codex 現在會辨識根目錄的 plugin.json manifest,用以描述可重複使用的代理能力——包括可攜帶的中繼資料、位於 skills/ 目錄下的直接技能,以及 mcp.json 中的 MCP 設定。Plugin 可以在工作區層級發布,Codex 也除了自家的 marketplace 之外,新增了 Amazon Bedrock 與 Claude Code 的 marketplace。這在架構上的意義重大:一個 plugin 套件現在可以在 Codex、Claude Code 與 Bedrock 之間流通,無需針對每個主機重新設定。仍屬主機特定的部分——hooks、權限、UI 元素——則放在同一 manifest 內獨立的擴充覆蓋層(extension overlay)中。這是朝向「可在相互競爭的平台之間攜帶的代理工具」所踏出的第一步具體進展。
具名工作階段、釘選討論串與側邊對話。 /new 與 /clear 現在可接受選用的工作階段名稱。重要的討論串可以釘選以便快速存取,ctrl-/ 可在側邊對話之間切換,無需關閉側邊對話或母討論串。工作階段狀態——已傳送的訊息、最終回應、失敗回合的錯誤、匯入時間與核准設定——會在中斷、重播、匯入與分叉之間持續保存。工作階段正逐漸成為一個受管理的物件,而非附屬於單一終端視窗的捲動緩衝區。
具分頁歷史紀錄的討論串分叉。 討論串現在可以連同完整的分頁歷史紀錄一起分叉,包括不會讓討論串清單變得雜亂的暫時性分叉。這使得從共享脈絡中平行探索不同做法成為可能——過去這類工作流程需要外部編排(orchestration)才能達成。
透過 WebSocket 的遠端 Code Mode。 Codex app-server 現在可以透過 ws:// 或 wss:// 連線到遠端的 Code Mode 主機。省略該旗標時,則與以往一樣啟動本機主機。這將代理的控制平面(control plane)與程式碼執行平面分離,讓瘦客戶端(thin-client)架構成為可能:本機介面驅動效能需求較高的遠端主機。已經佈建雲端工作站(cloud workstation)的團隊,不再需要自行打造中繼(relay)程式來連線。
Proxy 與 MCP 生命週期修正。 設定的 proxy 現在會在驗證、plugin 下載、MCP 授權、遠端執行與 WebSocket 連線等所有環節被確實套用。MCP 連線在驗證與設定變更後仍會保持連線——過去這正是靜默重連失敗的來源。執行器(executor)提供的技能現在可以在工作階段內被探索與讀取,當脈絡預算限制迫使技能被截斷時,也會顯示警告。
2. Codex Security CLI — 以 Apache 2.0 開源釋出
OpenAI 在 7 月 28 日至 29 日低調地將 @openai/codex-security 發布到 GitHub 與 npm。Hacker News 在官方公告之前就發現了這個套件。該套件以 Apache 2.0 授權,包含 CLI、TypeScript SDK、Dockerfile,以及用於 CI 整合的 GitHub Actions workflows。
它的功能。 Codex Security 會建立儲存庫特定的威脅模型(threat model)、探索實際可行的攻擊路徑、在隔離的 sandbox 中驗證發現結果,並提出修補程式供人工審查。它支援全儲存庫掃描、針對特定路徑的審查、Git diff 掃描、工作樹(working tree)檢查,以及透過 CSV 輸入對多個儲存庫進行批次掃描。掃描歷史會持久儲存在 SQLite 中,支援跨時間的發現結果追蹤——週一偵測到的漏洞,到了週五再次掃描同一段程式碼路徑時,仍會保有相同的識別身分。
輸出與 CI 整合。 完成掃描後會產生 report.md、findings.json、coverage.json 與掃描 manifest。匯出格式包含 SARIF、JSON 與 CSV——也就是說,結果可以直接整合進 GitHub Code Scanning、Azure DevOps 或任何既有的安全儀表板。--fail-on-severity 旗標會在發現結果超過門檻時回傳失敗的 exit code,可作為 CI 的品質關卡(gate)。Git hooks 可以在 commit 前掃描已暫存(staged)的變更。
關鍵前提。 開放原始碼的是客戶端,核心引擎並非開源。執行掃描仍然需要存取 OpenAI 端的 Codex Security 服務。預設模型為 gpt-5.6-sol,採用 extra-high 推理設定。執行環境需要 Node.js 22+、Python 3.10+,以及 OpenAI 帳號上的 Codex Security 存取權限。原始碼是公開的,但掃描器後端仍僅開放給通過審核的 Enterprise、Business 與 Education 客戶。
常用指令一覽:
scan— 全儲存庫、--path、--diff或工作樹bulk-scan— 從 CSV 批次掃描多個儲存庫,可用--workers平行處理scans list/show/rerun/match/compare— 歷史與回歸追蹤export --export-format sarif— 輸出結構化結果供安全工具使用validate/patch— 驗證發現結果並產生建議修補install-hook— 對暫存變更進行 pre-commit 掃描
對於已深度採用 OpenAI 生態系的工程團隊而言,這是對 CI/CD 管線的一項有意義的補充。而對於拿它與獨立 SAST 工具比較的團隊,存取限制與對 OpenAI 模型的依賴是兩項關鍵限制。
3. ChatGPT Work — 企業註冊與額度獎勵
OpenAI 正式向企業客戶開放 ChatGPT Work,並以額度獎勵機制推動採用。企業客戶可在 8 月 21 日前完成註冊。每位在註冊後兩週內首次試用 Work 的成員,可獲得最高 200 美元的額度,有效期 14 天。既有客戶請聯繫專屬客戶團隊;新客戶則可透過 OpenAI 的業務管道洽詢。
這是針對 Work 代理介面的客戶獲取策略,而非定價調整。額度是以每位使用者計算,而非以組織計算,代表這項獎勵對應的是個人採用,而非大量採購。對於正評估將 ChatGPT Work 作為生產力工具的工程主管而言,14 天的額度期限提供了合理的時間窗口,足以用真實工作流程端到端地執行一次試行計畫。
Assistants API — 倒數 26 天。 距離 8 月 26 日的停用日已不到四週。OpenAI 不會提供自動遷移工具。替代方案是 Responses API 加 Conversations API,目前已達到完整的功能對等,包括 deep research、MCP 工具連線與 computer use。Azure OpenAI 遵循相同的時程。Microsoft 的 Fabric Data Agent 團隊建議直接遷移到 MCP,而非針對 OpenAI Responses API 重新開發——這顯示平台夥伴已經開始圍繞「後 Assistants 時代」的生態進行布局。仍在使用 Assistants API 的團隊,應將此視為具有硬性期限的 P0 級遷移。
4. Anthropic — Claude Opus 5 與程式開發技術棧
Anthropic 於 7 月 24 日推出 Claude Opus 5,並立即成為 Claude Code 在 Claude Max 與 Claude Pro 兩種方案中的預設模型。訴求非常直接:以一半的價格,獲得接近 Fable 5 的智慧水準。
定價與定位。 Opus 5 定價為每百萬輸入/輸出 tokens 5/25 美元——與 Opus 4.8 相同,是 Fable 5(10/50 美元)的一半。Artificial Analysis Intelligence Index 給予 Opus 5 61 分,比 Fable 5 高 1 分,比 GPT-5.6 Sol 高 2 分。在 Frontier-Bench v0.1(代理式程式開發)上,Opus 5 的分數是 Opus 4.8 的兩倍以上。在 CursorBench 3.2 以 max effort 執行時,它與 Fable 5 的巔峰表現差距在 0.5% 以內,而每個任務的成本只有一半。在 ARC-AGI-3 上,它的分數是次佳模型的三倍。
Effort 調整旋鈕。 五級 effort 設定(low、medium、high、xhigh、max),預設為 adaptive(自適應)。在 low effort 下,Opus 5 於綜合基準測試得到 62.8% 分數,每個任務成本 2.55 美元——與 Opus 4.8 在 max effort 下的表現(62.3%、每個任務 5.77 美元)不相上下。Fast mode 的定價為 10/50 美元,速度約快 2.5 倍,並以研究預覽(research preview)形式在 Claude API 上提供。
System prompt 精簡。 Anthropic 發布了新的脈絡工程(context engineering)指引,顯示將 Claude Code 的 system prompt 刪減超過 80% 後,程式開發評測(coding-eval)表現沒有任何可測量的下降。這對代理開發者是重要訊號:冗長的 system prompt 有實際的 token 成本,而大幅精簡可能是安全的做法。
Claude Code v2.1.219。 與 Opus 5 一同於 7 月 24 日發布。/fork 指令現在會建立真正的背景工作階段(在 claude agents 中擁有獨立列),而原本在工作階段內的 subagent 路徑則改為 /subtask。工作階段層級的上限維持為 200 次網路搜尋與 200 個 subagent。長時間執行呼叫的 MCP 自動背景化(auto-backgrounding)功能予以保留。Claude Sonnet 5 的促銷定價(每百萬 tokens 2/10 美元)將持續到 8 月 31 日,之後調漲為 3/15 美元。
5. 競爭格局 — 代理式安全、平行代理群與 MCP 的無狀態未來
Kimi K3 — 32 個代理找出 19 個 Redis 零日漏洞
安全研究員 Chaofan Shou 針對 Redis 程式碼庫部署了 32 個平行的 Kimi K3 sub-agent。這些代理自主複製了儲存庫、建置自訂 fuzz harness、在 GDB 中除錯崩潰,並產出可運作的 proof-of-concept 攻擊程式——在大約 90 分鐘內找出 19 個先前未知的漏洞,其中包括一個僅花 27 分鐘建構的 authenticated RCE 攻擊鏈。
Redis 於 7 月 23 日發布了七個安全性修補版本。底層的漏洞已確認屬實;但「19 個零日漏洞」的數量與「27 分鐘」的時間紀錄是研究員自行宣稱,尚未經獨立驗證。同一天發表的英國 AISI 與美國 CAISI 聯合研究則顯示,Kimi K3 在 ExploitBench 上得分 32.2%,而未具名的美國前沿模型得分 76.2%,為這則頭條新聞提供了更完整的脈絡。
對資安團隊而言,這代表:代理式漏洞發現已證明可以透過開放權重模型,在具有實際意義的規模上實現。在安全任務上,專屬前沿模型與開放權重替代方案之間的差距仍然存在,但縮小的速度已足以值得實際評估。
xAI — Grok Build 以 1,024 個平行代理執行工作流程
xAI 的 Grok Build 新增了 Workflows 編排層。單一自然語言請求會被分解為多個階段,每個階段分配給平行的 sub-agent 執行。預設並行數為 128 個代理,最大型任務可擴展至 1,024 個。獨立的「懷疑者」(skeptic)代理會在結果彙整前先進行驗證。工作流程會儲存為可重複使用的 slash 指令,位於 .grok/workflows/ 目錄下。
底層的 grok-build-0.1 模型定價為每百萬輸入/輸出 tokens 1/2 美元——價格極具侵略性。使用需要 SuperGrok(每月 30 美元)或 X Premium+(每月 40 美元)訂閱,而要執行 1,024 個代理的任務則需要 SuperGrok Heavy(每月 300 美元)。xAI 也在 7 月 20 日推出免費的 Grok 4.5 Excel、Word 與 PowerPoint 增益集,將觸角延伸到 Office 工作流程。
MCP 規範 — 發布以來最大幅度的修訂
2026-07-28 發布的 MCP 規範修訂,是 MCP 問世以來最大的一次協定變更。重點變更如下:協定核心現在是無狀態(stateless)的——移除了 initialize/initialized 交握程序與 Mcp-Session-Id header。每個請求都在 _meta 中攜帶其協定版本與客戶端能力。Multi Round-Trip Requests(MRTR)取代了伺服器主動發起的請求。MCP Apps(在沙盒化 iframe 中由伺服器渲染的 HTML UI)現在成為官方擴充功能。擴充功能框架採用 reverse-DNS 識別碼,並各自獨立版本化。授權機制朝向 OAuth 2.0 與 OpenID Connect 強化。正式的棄用(deprecation)政策要求至少 12 個月的緩衝期。
Microsoft 推出了實作新規範的 MCP C# SDK v2.0,並向下相容 v1 程式碼。對於正在建置 MCP server 的團隊,無狀態核心代表一般的 HTTP 基礎設施現在就能路由 MCP 流量——不再需要 session affinity。對負載平衡器、CDN 與 API gateway 而言,這是一項實質的營運簡化。
Google — Gemini 3.5 Pro:第四次跳票在即
Gemini 3.5 Pro 已連續錯過三個發布窗口——原本的 6 月目標、外流的 7 月 17 日,以及整個 7 月的發布窗口。Google 的模型目錄中仍然沒有 gemini-3.5-pro 這個條目。該公司已低調地不再公布目標日期,且有報導指出它已開始預訓練(pretraining)Gemini 4。預測市場目前將發布時間落在 7 月底至 8 月初,且再次跳票的機率不低。Google 在前沿模型競賽中的競爭地位持續下滑。
結語
本週,代理平台層終於有了具體樣貌。Codex CLI v0.146.0 的 Agent Plugins 讓工具得以跨平台攜帶——這在程式開發代理生態系中尚屬首見。Codex Security CLI 讓代理式安全掃描進入開發者手中,即使核心引擎仍然受到存取限制。Opus 5 的定價將前沿等級的程式開發智慧帶到 5/25 美元,讓以 Anthropic 為標準的團隊成本上限減半。而 MCP 規範的無狀態核心,也簡化了所有依賴它的代理平台在基礎設施上的難題。
本週提供工程主管三個行動建議:第一,將 Codex CLI v0.146.0 的 Agent Plugins 與你團隊的可重複使用工具進行比較——這個跨平台 manifest 格式是代理技能第一個具可信度的可攜帶方案。第二,如果你的 OpenAI 帳號屬於 Enterprise 或 Business 方案且具備 Codex Security 存取權限,請對正式環境的儲存庫執行一次掃描,並將結果與你現有的 SAST 管線進行比較。第三,如果你尚未開始 Assistants API 遷移,你只剩 26 天——請現在就開始。
代理式安全時代已於本週正式降臨。無論是 32 個 Kimi K3 代理找出 Redis 零日漏洞,還是 Codex Security 掃描你的 CI 管線,傳達的訊息都相同:漏洞發現的時間窗口正在壓縮,而參與其中的工具也越來越容易取得。
歡迎在 X 上追蹤討論。