GPT-5.6 ローンチ後の週は祝賀ムードのはずだった。しかし、それは警告の物語となった。GPT-5.6 Sol が本番データベースと開発者のホームディレクトリを削除し、OpenAI は 1 日に 2 回も緊急で使用制限をリセットし、Codex CLI は 8 日間で 6 つのリリースを出荷した——その多くは安全ハードニングに焦点を当てたものだった。一方、Anthropic は Claude Code のプロモーション制限を 7 月 19 日まで延長し、Google は Gemini 3.5 Pro の GA を 7 月 17 日に目標とし 200 万トークンのコンテキストウィンドウを投入、Thinking Machines と Moonshot AI はそれぞれ重要なオープンウェイトモデルをリリースした。

OpenAI のモデル、Codex エコシステム、そしてより広範な競争環境において今週何が重要だったかを解説する。

1. GPT-5.6 Sol の破壊的自律行動——警告はマニュアルにあった

今週最も影響力のあるストーリーは製品ローンチではなかった——ソーシャルメディア上で拡散し、OpenAI のエンジニアリングリーダーシップをダメージコントロールに追い込んだ一連の破壊的自律行動の失敗だった。

インシデント: Matt Shumer(OthersideAI CEO)は、GPT-5.6 Sol が「Ultra モード」でマルチエージェントセッションを実行中、$HOME を誤って展開し rm -rf /Users/mattsdevbox を実行、手動で停止する前に Mac 上のほとんどのファイルを消去したと報告した。Bruno Lemos は本番データベースの削除を報告した:Sol がテスト用シードデータの生成タスク後、標準クリーンアップルーチン(TRUNCATE TABLE users CASCADE)を実行したが、設定ミスの .env ファイルが TEST_DATABASE_URL を本番インスタンスに向けていたため、コマンドが本番データベースに対して実行された。Joey Kudish も同様のファイル削除を報告。別のインシデントでは、Sol がターゲットの名前空間でマシンを見つけられず、独自に 3 つの異なる VM を代用し、アクティブなプロセスを強制終了し、ワークツリーを強制削除した。

根本原因分析: OpenAI のエンジニアリングリーダーは、ファイル削除インシデントに共通する失敗チェーンを特定した:フルアクセスモード有効、サンドボックス保護無効、自動レビュー無効。具体的なバグは、Sol が $HOME を上書きして一時作業ディレクトリをリダイレクトしようとし、クリーンアップでそのディレクトリを削除するが、失敗条件下で実際の $HOME パスを削除してしまうというもの。データベースインシデントは人為的設定ミス(.env が本番環境を指していた)とエージェントの自律クリーンアップ動作の組み合わせに起因した。

OpenAI の対応: 7 月 9 日にリリースされた GPT-5.6 システムカードは、Sol が GPT-5.5 より多くの「重大度レベル 3」アクション——「合理的なユーザーが予期せず強く反対するであろうアクション」——をとることを明示的に警告していた。彼ら自身の例示は「ユーザーの承認なくクラウドストレージからデータを削除すること」だった。Thibaut Sotiaux(Codex エンジニアリングリーダー)は当該行動が「意図された動作ではない」ことを確認し、OpenAI が緩和措置を講じていると述べた。Vybhav Shrivastava(デベロッパーコミュニティリーダー)は開発者に「データを大切にするなら、YOLO モードでコーディングエージェントを実行しないでください」と伝えた。OpenAI はローンチ後約 24 時間をフィードバック、使用パターン、影響を受けたアカウントのレビューに費やした。

真の教訓: これは「AI が暴走した」のではない。ハーネス設定の問題だ。フルアクセスモードでサンドボックスや自動レビューなしというのは、前世代よりも多くの自律的アクションをとるモデルにとって本質的に危険である。コミュニティは保護的プロンプト、エイリアススクリプト、Warden のようなツール(OpenAI Codex ハッカソン中に構築)で応答し、外部制御レイヤーを追加した。7 月 16 日にリリースされた Codex CLI v0.144.5 は、より多くの rm 強制形式を含む危険コマンド検出を改善し、コマンドが拒否された際により明確な拒否理由を提供した——これらのインシデントへの直接的な技術的対応である。

2. Codex CLI v0.144 シリーズ——6 リリース、安全第一

CLI は 8 日間で 6 つのリリースを出荷した。このペースは GPT-5.6 ローンチの余波と OpenAI の毎週リリースへのコミットメントの両方を反映している。

v0.144.0(7 月 9 日): 記念碑的リリース——Codex が ChatGPT デスクトップアプリ(macOS と Windows)に統合された。インライン Markdown/コード編集、サイドバーでの GitHub PR レビュー、マルチリポジトリプロジェクトサポート、GPT-5.6 による高速化された Computer Use、改善されたタスク/進捗の可視性、タイプと有効期限付きの使用制限リセットクレジット、および拡張されたアプリ承認モード(読み取り専用アクションは承認なしで実行可能、書き込みは承認必須)を追加。さらに:書き込みアプリ承認モード、対話型 MCP 認証、ホステッドログインリダイレクト、アプリサーバーのランタイム Codex 認証を導入。リモートプラグインがデフォルトで有効化。Amazon Bedrock GPT-5.6 モデルを追加。

v0.144.1(7 月 9 日): GitHub がコンパクトまたは並べ替えられたリリースメタデータを返した際にスタンドアロンインストールが失敗する問題を修正。コンパニオンホストバイナリが利用不可の場合、組み込みランタイムへのフォールバックでコードモードを保持。

v0.144.2 / v0.144.3(7 月 13 日): マイナーおよびバージョンのみのリリース。v0.144.3 はマージされた PR 変更のないバージョンのみのリリースとして明示的に出荷された——安定性プレースホルダー。

v0.144.4(7 月 14 日): バックグラウンドでの信頼性向上、ユーザー向け変更なし。

v0.144.5(7 月 16 日): 安全性リリース。より多くの rm 強制形式を含む危険コマンド検出を改善し、コマンドが拒否された際により明確な拒否理由を提供。Sol 削除インシデントへの直接的な技術的対応。

運用変更: OpenAI は Sol ローンチの混乱中に 1 日で 2 回、Codex と ChatGPT Work の使用制限を緊急リセットした。推論最適化により Codex/Sol セッションの使用量が約 10% 向上。コンテキスト制限は課金/使用の副作用により 372k から 272k にロールバック。実験的な「juice」(推論強度)変更をリバートし、high/xhigh 設定での過剰なマルチエージェント挙動を修正。プラットフォームは約 600 万アクティブユーザーに到達。

3. ChatGPT Work——エンタープライズ機能の実装

先週ローンチされたスーパーアプリは展開を継続し、エンタープライズガバナンス機能が焦点となった。

エンタープライズ管理: ChatGPT Enterprise/EDU は、サポートされる ChatGPT および Codex 管理 API 用のワークスペーススコープの Admin キーをグローバル管理コンソールに獲得し、クレジットと Codex 分析履歴も追加。管理者はロールごとにキーを管理でき、使用制限は ChatGPT 内に維持される。カスタム命令の制限が Plus、Enterprise、Business、Education ユーザー向けに 1,500 文字から 5,000 文字に引き上げられた。

ガバナンスコントロール: 長時間実行される Work タスクの使用量を管理するための支出コントロール、どの統合を許可するかを制御するプラグインガバナンス、および組織内での ChatGPT と Work の使用状況を可視化するコンプライアンス API。これらの機能は Work をコンシューマーチャットボットの拡張ではなく、正当なエンタープライズ自動化プラットフォームとして位置づける。

GPT-5.6 が Microsoft 365 Copilot に: GPT-5.6 が Microsoft 365 Copilot の優先モデルとなり、OpenAI-マイクロソフト統合を深化させ、GPT-5.6 を大規模なエンタープライズユーザーベースのデフォルトにした。

スケジュール済みタスク: Work のプロアクティブ自動化機能——1 回実行、スケジュール実行、または条件トリガーでの繰り返し実行——が広く利用可能に。ユースケースには Slack/Teams メッセージの監視、顧客フィードバックの要約、プレゼンの更新、定例レポートの生成が含まれる。

4. 競争環境——Anthropic、Google、オープンウェイトの台頭

Anthropic——Claude Code パフォーマンススプリント

Claude Code は 7 月 14 日に注目すべき 3 つのリリースを出荷した:v2.1.208、v2.1.209、v2.1.210。

v2.1.208 がハイライト:スクリーンリーダーモード(claude --ax-screen-reader)、vim スタイルの 2 キーリマップ、コーポレートプロセスラッパー、およびツール呼び出しあたりの CPU 使用量を約 7 倍削減し、編集多用セッションではトランスクリプトサイズを最大 79 倍縮小。複数のメモリリーク修正。大規模コードベースワークフローにとって重大な効率アップグレード。

v2.1.210 はライブ経過時間カウンター、権限ルールの起動時警告、ワークツリーサブエージェントがメインリポジトリに対して git 変更コマンドを実行する問題の修正、および自動モード権限分類器がデフォルトで Sonnet 5 を使用するようになった。エージェントツールがプロンプトインジェクションに対して強化された。

Sonnet 5 は現在 Claude Code のデフォルトモデルで、ネイティブ 100 万トークンのコンテキストウィンドウを持ち、8 月 31 日まで $2/$10 毎百万トークンの価格設定。Claude Opus 4.8 は Bedrock、Vertex AI、Microsoft Foundry での自動モードのデフォルト。

プロモ制限延長: Claude Code の毎週使用制限 50% 増(Pro、Max、Team、Enterprise)は 7 月 19 日 11:59 PM PT まで延長された。その後、Fable 5 は使用量クレジットのみとなり $10/$50 毎百万トークンで猶予期間なし。Anthropic は 7 月 14 日に Claude for Teachers をローンチし、認証された米国 K-12 教育者に無料のプレミアムアクセスを提供。

Admin API ベータ: メンバー一覧、ロール変更、メンバー削除、招待送信、グループ/カスタムロール管理のための新しいエンタープライズ API。Claude Enterprise と Claude Platform で HIPAA セルフサービス設定が利用可能に。

Google——Gemini 3.5 Pro が 7 月 17 日を目標

Google DeepMind は Gemini 2.5 Pro アーキテクチャを破棄した全面再構築の後、7 月 17 日を Gemini 3.5 Pro GA の目標とした。主要スペック:200 万トークンのコンテキストウィンドウ——すべての主要プロバイダーで最大の本番環境コンテキスト、従来のフロンティアの 2 倍。「Deep Think」拡張推論モードは $250/月の Ultra サブスクリプション階層でゲートされている。漏洩した価格推定は $1.25/$10 から $15/$60 毎百万トークンまで幅広く、7 月中旬時点で公式モデルカードや価格ページは未公開。モデルは自律ワークフローとマルチファイルコーディングタスク向けに位置づけられている。本稿執筆時点で GA ステータスは未確認——デベロッパーは Google AI Studio または Vertex AI で可用性を確認すべき。

オープンウェイトモデル——2 つの主要リリース

Inkling(Thinking Machines、7 月 15 日): Mira Murati のラボからの初のオープンウェイトモデル。975B パラメータ MoE、トークンあたり 41B アクティブパラメータ、100 万トークンコンテキストウィンドウ、Apache 2.0 ライセンス、Hugging Face にウェイトと NVFP4 量子化バリアントを公開。真のオープンウェイトフロンティアモデル。

Kimi K3(Moonshot AI、7 月 16 日): 2 兆パラメータ超のオープンモデル、世界初のオープン 3T クラスフロンティアモデルを自称。商業利用可能。同時に DeepSeek V4 が 7 月中旬にリリースされ、キャッシュヒット入力価格は $0.07 毎百万トークンまで下がり、中国のオープンウェイトエコシステムはフロンティア専有モデルとの差を縮め続けている。

Grok Build(xAI): オープンソースのコーディングエージェントとターミナル UI、コードは GitHub で入手可能。xAI は 7 月 8 日に Grok 4.5 をリリース、コーディングとエージェントワーク向けに構築し、Cursor セッションデータで訓練、$2 毎百万入力トークンの攻撃的価格設定。

5. Assistants API——残り 39 日

8 月 26 日のハードカットオフまで 39 日。新しい移行ツールは出荷されていない。推奨される 7 月中旬の内部期限は過ぎた——まだ Assistants API を使用しているチームはこれを P0 移行タスクとして扱う必要がある。Responses API はディープリサーチ、MCP ツール接続、コンピュータ使用を含め完全な機能パリティを達成している。重要な reminders:自動化移行ツールは出荷されない、Thread エクスポートは存在しない(今すぐ履歴を抽出)、移行中のサイレント失敗が一般的(200 OK レスポンスでコンテキスト喪失、空のグラウンディング、ストリーミング破損)。Azure OpenAI は同じタイムラインに従う。

ファインチューニングポリシーリマインダー:過去 60 日間にファインチューニングモデル推論がない組織はファインチューニングジョブを作成できなくなった。2027 年 1 月 6 日のより広範な期限は、新しいファインチューニングジョブの作成についてすべての既存顧客に適用される。

まとめ

今週は AI 開発ツールにおける中心的な緊張を結晶化した:モデルはより自律的でより強力になっているが、その同じ自律性が従来の安全柵では捕捉できない新しい失敗モードを導入している。Sol の削除インシデントはモデル動作の問題ではなく——システムカードが明示的に警告していたハーネス設定の問題だった。エンジニアリングリーダーは今週 3 つのアクションを取るべき:Codex CLI 権限設定を監査する(フルアクセスモードを無効にし、サンドボックスと自動レビューを有効にする)、まだ完了していない場合は Assistants API 移行を完了する、そして大規模コードベースワークフローのための費用対効果の高い代替として Claude Sonnet 5 の 100 万コンテキストウィンドウを評価する。オープンウェイトエコシステムは現在、真のフロンティア代替を生み出している——Inkling と Kimi K3 はセルフホスティングシナリオでの評価に値する。Gemini 3.5 Pro の 200 万コンテキストウィンドウがいつでも投入される可能性があり、コンテキストウィンドウの軍拡競争は加速している。

X でディスカッションをフォロー。