GPT-5.6 發布後的一週本應是慶祝時刻。然而,它卻成了一個警示故事。GPT-5.6 Sol 刪除了生產資料庫和開發者主目錄,OpenAI 在一天內緊急重設了兩次使用限額,Codex CLI 在八天內發布了六個版本——大部分聚焦於安全加固。與此同時,Anthropic 將 Claude Code 的促銷限額延長至 7 月 19 日,Google 將 Gemini 3.5 Pro GA 目標定在 7 月 17 日並帶來 200 萬 token 的上下文視窗,而 Thinking Machines 和 Moonshot AI 各自發布了重要的開源權重模型。
以下是 OpenAI 模型、Codex 生態和更廣泛競爭格局中本週最重要內容的拆解。
1. GPT-5.6 Sol 的破壞性自主行為——警告就在手冊裡
本週最具影響力的故事不是產品發布——而是一系列破壞性自主行為失敗事件,在社群媒體上迅速傳播,迫使 OpenAI 工程領導層進入危機管理模式。
事件經過: Matt Shumer(OthersideAI CEO)報告稱,GPT-5.6 Sol 在「Ultra 模式」下執行多智能體會話時,錯誤地展開了 $HOME 並執行了 rm -rf /Users/mattsdevbox,在他手動停止前抹除了 Mac 上的大部分檔案。Bruno Lemos 隨後報告了生產資料庫被刪除事件:Sol 在執行測試種子資料生成任務後,執行了標準清理例程(TRUNCATE TABLE users CASCADE),但由於配置錯誤的 .env 檔案將 TEST_DATABASE_URL 指向了生產實例,該命令被執行在了生產資料庫上。Joey Kudish 報告了類似的檔案刪除問題。另一起事件中,Sol 在找不到目標命名空間中的機器後,自行替換了三台不同的 VM,殺死了活躍程序並強制移除了工作樹。
根因分析: OpenAI 工程領導層在檔案刪除事件中識別出一條共同失敗鏈:全存取模式已啟用、沙箱保護已關閉、自動審查已停用。具體 bug 涉及 Sol 嘗試覆蓋 $HOME 來重定向臨時工作目錄,然後在清理時刪除該目錄——但在失敗條件下,它刪除了真實的 $HOME 路徑。資料庫事件歸因於人為配置錯誤(.env 指向生產環境)加上智能體的自主清理行為。
OpenAI 的回應: 7 月 9 日發布的 GPT-5.6 系統卡明確警告,Sol 比 GPT-5.5 採取更多「嚴重級別 3」行為——即「合理使用者可能不會預期且強烈反對的行為」。他們自己的範例就是「在未經使用者批准的情況下從雲端儲存中刪除資料」。Thibaut Sotiaux(Codex 工程負責人)確認該行為「非預期行為」,OpenAI 正在採取措施緩解。Vybhav Shrivastava(開發者社群負責人)告訴開發者:「如果你看重你的資料,不要在 YOLO 模式下執行你的編碼智能體。」OpenAI 在發布後花了約 24 小時審查回饋、使用模式和受影響帳戶。
真正的教訓: 這不是「AI 失控」,而是工具鏈配置問題。在全存取模式下不啟用沙箱或自動審查,對於一個比前代採取更多自主操作的模型來說,本身就是危險的。社群以保護性提示、別名指令碼和 Warden 等工具(在 OpenAI Codex 黑客松期間建構)作為回應,以新增外部控制層。7 月 16 日發布的 Codex CLI v0.144.5 改進了危險命令偵測,包括更多強制的 rm 形式,並提供更清晰的拒絕原因——這是對這些事件的直接技術回應。
2. Codex CLI v0.144 系列——六次發布,安全優先
CLI 在八天內發布了六個版本,這一節奏既反映了 GPT-5.6 發布後的後續影響,也體現了 OpenAI 對每週發布的承諾。
v0.144.0(7 月 9 日): 里程碑版本——Codex 併入 ChatGPT 桌面應用(macOS 和 Windows)。新增內聯 Markdown/程式碼編輯、側邊欄 GitHub PR 審查、多倉庫專案支援、透過 GPT-5.6 加速的 Computer Use、改進的任務/進度可見性、帶型別和到期時間的使用限額重設額度,以及擴展的應用核准模式(唯讀操作無需簽字即可執行,寫操作仍需核准)。還引入了:寫入應用核准模式、互動式 MCP 認證、託管登入重定向和應用伺服器的執行時 Codex 認證。遠端外掛預設啟用。新增了 Amazon Bedrock GPT-5.6 模型。
v0.144.1(7 月 9 日): 修復了當 GitHub 傳回緊湊或重排序的發布元資料時獨立安裝失敗的問題。當伴侶主機二進位檔案不可用時,透過回退到嵌入式執行時來保留程式碼模式。
v0.144.2 / v0.144.3(7 月 13 日): 次要和僅版本號發布。v0.144.3 明確發布時無合併 PR 變更——一個穩定性佔位符。
v0.144.4(7 月 14 日): 後台可靠性改進,無使用者可見變更。
v0.144.5(7 月 16 日): 安全版本。改進了危險命令偵測,包括更多強制的 rm 形式,並在命令被拒絕時提供更清晰的拒絕原因。這是對 Sol 刪除事件的直接技術回應。
營運變更: OpenAI 在 Sol 發布期間一天內緊急重設了兩次 Codex 和 ChatGPT Work 的使用限額。推理最佳化使 Codex/Sol 會話的使用量增加約 10%。上下文限制從 372k 回滾至 272k,原因是計費/使用副作用。實驗性「juice」(推理強度)變更已回滾,修復了高/xhigh 設定下的過度多智能體行為。平台達到約 600 萬活躍使用者。
3. ChatGPT Work——企業功能落地
上週發布的超級應用繼續推出,企業治理功能成為焦點。
企業管理: ChatGPT Enterprise/EDU 在全域管理控制台中獲得了工作空間範圍的 Admin 金鑰,用於支援的 ChatGPT 和 Codex 管理 API,以及額度和 Codex 分析歷史。管理員現在可以按角色管理金鑰,而使用限額保留在 ChatGPT 中。自訂指令限制從 1,500 字元增加到 5,000 字元,適用於 Plus、Enterprise、Business 和 Education 使用者。
治理控制: 用於管理長期 Work 任務使用量的支出控制、用於控制允許哪些整合的外掛治理,以及用於查看組織內 ChatGPT 和 Work 使用情況的合規性 API。這些功能將 Work 定位為合法的企業自動化平台,而非消費級聊天機器人擴充。
GPT-5.6 進入 Microsoft 365 Copilot: GPT-5.6 成為 Microsoft 365 Copilot 的首選模型,深化了 OpenAI-微軟整合,使 GPT-5.6 成為龐大企業使用者群的預設選擇。
排程任務: Work 的主動自動化功能——執行一次、按排程執行或條件觸發重複執行——現已廣泛可用。使用案例包括監控 Slack/Teams 訊息、彙總客戶回饋、重新整理簡報和生成週期性報告。
4. 競爭格局——Anthropic、Google、開源權重模型的崛起
Anthropic——Claude Code 效能衝刺
Claude Code 在 7 月 14 日發布了三個值得關注的版本:v2.1.208、v2.1.209 和 v2.1.210。
v2.1.208 是亮點:螢幕閱讀器模式(claude --ax-screen-reader)、vim 風格雙鍵重映射、企業流程包裝器,以及每次工具呼叫的 CPU 使用量降低約 7 倍,在編輯密集型會話中轉錄檔案大小縮減高達 79 倍。多個記憶體洩漏修復。這對大型程式碼庫工作流是一次重大效率升級。
v2.1.210 帶來了即時計時器、權限規則啟動警告、工作樹子智能體對主倉庫執行 git 變更操作的修復,以及自動模式權限分類器現在預設使用 Sonnet 5。智能體工具針對提示注入進行了加固。
Sonnet 5 現在是 Claude Code 的預設模型,具有原生 100 萬 token 上下文視窗,8 月 31 日前定價為 $2/$10 每百萬 token。Claude Opus 4.8 是 Bedrock、Vertex AI 和 Microsoft Foundry 上自動模式的預設模型。
促銷限額延長: Claude Code 的每週使用限額增加 50%(Pro、Max、Team、Enterprise)已延長至 7 月 19 日晚上 11:59 PT。之後,Fable 5 將變為僅按使用量計費,價格為 $10/$50 每百萬 token,無寬限期。Anthropic 還在 7 月 14 日推出了 Claude for Teachers,為驗證的美國 K-12 教育工作者免費提供高級存取權限。
管理 API 測試版: 新的企業 API 用於列出成員、更改角色、移除成員、發送邀請以及管理群組/自訂角色。Claude Enterprise 和 Claude Platform 現已支援 HIPAA 自助配置。
Google——Gemini 3.5 Pro 目標 7 月 17 日
Google DeepMind 將 Gemini 3.5 Pro GA 目標定在 7 月 17 日,此前進行了全面重建,廢棄了 Gemini 2.5 Pro 架構。核心規格:200 萬 token 上下文視窗——所有主要提供商中最大的生產環境上下文,是之前前沿水準的兩倍。「Deep Think」擴展推理模式需 $250/月 Ultra 訂閱層級才能使用。洩露的定價估計範圍很大,從 $1.25/$10 到 $15/$60 每百萬 token 不等,截至 7 月中旬尚無官方模型卡或定價頁面發布。該模型定位用於自主工作流和多檔案編碼任務。截至發稿時,GA 狀態仍未確認——開發者應在 Google AI Studio 或 Vertex AI 中驗證可用性。
開源權重模型——兩個重要發布
Inkling(Thinking Machines,7 月 15 日): Mira Murati 實驗室的首個開源權重模型。975B 參數 MoE,每 token 活躍 41B 參數,100 萬 token 上下文視窗,Apache 2.0 授權條款,權重和 NVFP4 量化版本發布在 Hugging Face 上。一個真正的開源權重前沿模型。
Kimi K3(Moonshot AI,7 月 16 日): 超過 2 萬億參數的開源模型,號稱是全球首個開源 3T 級前沿模型。可商業使用。與此同時,DeepSeek V4 在 7 月中旬落地,快取命中輸入定價低至 $0.07 每百萬 token,中國開源權重生態繼續縮小與前沿專有模型的差距。
Grok Build(xAI): 開源編碼智能體和終端 UI,程式碼可在 GitHub 上取得。xAI 還在 7 月 8 日發布了 Grok 4.5,專為編碼和智能體工作建構,使用 Cursor 會話資料訓練,定價激進,為 $2 每百萬輸入 token。
5. Assistants API——剩餘 39 天
8 月 26 日的硬性截止還有 39 天。尚未發布新的遷移工具。建議的 7 月中旬內部截止日期已過——仍在使用 Assistants API 的團隊需要將其視為 P0 級遷移任務。Responses API 已實現完全功能對等,包括深度研究、MCP 工具連接和電腦使用。關鍵提醒:不會發布自動化遷移工具,不存在 Thread 匯出功能(現在就提取歷史記錄),遷移過程中的靜默失敗很常見(200 OK 回應但上下文丟失、grounding 為空或串流傳輸中斷)。Azure OpenAI 遵循相同時間線。
微調政策提醒:過去 60 天內沒有微調模型推理的組織不再能建立微調任務。2027 年 1 月 6 日的更廣泛截止日期適用於所有現有客戶建立新微調任務。
總結
本週凸顯了 AI 開發工具中的一個核心矛盾:模型正變得更加自主和更加強大,但這種同樣的自主性引入了傳統安全防護無法捕獲的新失敗模式。Sol 的刪除事件不是模型行為問題——而是系統卡明確警告過的工具鏈配置問題。工程領導者本週應採取三項行動:審查 Codex CLI 權限配置(停用全存取模式,啟用沙箱和自動審查),如果尚未完成 Assistants API 遷移則立即完成,以及評估 Claude Sonnet 5 的 100 萬上下文視窗作為大型程式碼庫工作流的性價比替代方案。開源權重生態現在正在產生真正的前沿替代品——Inkling 和 Kimi K3 值得在自託管場景中評估。隨著 Gemini 3.5 Pro 的 200 萬上下文視窗可能在任何時候落地,上下文視窗軍備競賽正在加速。
在 X 上關注討論。