지난주 시작된 플랫폼 구축 단계가 가속화되고 있다. OpenAI는 Agent Plugins, 세션 이름 지정, 스레드 포크, WebSocket 기반 원격 Code Mode를 포함한 Codex CLI v0.146.0을 배포했다 — v0.145.0보다 222개 커밋 앞선 버전이다. 또한 Codex Security CLI를 Apache 2.0 라이선스로 조용히 오픈소스화하여 에이전트 기반 취약점 스캐너를 개발자 손에 무료로 쥐여주었다. Anthropic은 Fable 5의 절반 가격에 프런티어에 근접한 모델인 Claude Opus 5로 응수했고, 이 모델은 즉시 Claude Code의 기본 모델이 되었다. 오픈웨이트(open-weight) 진영에서는 32개의 Kimi K3 에이전트가 90분 만에 Redis 제로데이 19개를 발견했다 — 에이전트 기반 보안 연구가 더 이상 이론이 아님을 보여주는 증거다.

다음은 OpenAI 모델, Codex 생태계, 그리고 더 넓은 경쟁 구도를 아우르는 이번 주의 주간 분석이다.

1. Codex CLI v0.146.0 — Agent Plugins, 세션 관리, 원격 실행

7월 29일 배포는 v0.145.0의 멀티에이전트 V2 안정화 이후 가장 구조적으로 중요한 Codex CLI 업데이트다. Codex를 대화형 터미널 도구에서 에이전트 운영체제에 가까운 존재로 전환시킨다.

Agent Plugins 1.0. Codex는 이제 재사용 가능한 에이전트 역량을 기술하는 루트 plugin.json 매니페스트를 인식한다 — 휴대 가능한 메타데이터, skills/ 아래에 배치되는 직접 스킬, mcp.json의 MCP 설정이 그것이다. 플러그인은 워크스페이스 레벨에서 게시할 수 있으며, Codex는 자체 마켓플레이스와 함께 Amazon Bedrock 및 Claude Code용 마켓플레이스를 추가했다. 아키텍처적 함의는 크다: 이제 플러그인 패키지는 호스트별 재구성 없이 Codex, Claude Code, Bedrock 사이를 이동할 수 있다. 훅, 권한, UI 요소처럼 호스트별로 달라지는 부분은 동일한 매니페스트 내의 별도 확장 오버레이(extension overlay)에 담긴다. 이는 경쟁 플랫폼을 아우르는 휴대형 에이전트 도구를 향한 첫 번째 구체적 단계다.

세션 이름 지정, 고정 스레드, 사이드 대화. /new/clear는 이제 선택적으로 세션 이름을 받는다. 중요한 스레드는 빠른 접근을 위해 고정할 수 있으며, ctrl-/는 사이드 대화나 상위 스레드를 닫지 않고 사이드 대화 사이를 전환한다. 세션 상태 — 전송된 메시지, 최종 응답, 실패한 턴의 오류, 가져오기(import) 시점, 승인 설정 — 는 중단, 재생, 가져오기, 포크를 거쳐도 유지된다. 세션은 단일 터미널 창에 묶인 스크롤백 버퍼가 아니라 관리되는 객체로 진화하고 있다.

페이지네이션 기록이 포함된 스레드 포크. 스레드는 이제 전체 페이지네이션 기록과 함께 포크할 수 있으며, 스레드 목록을 어지럽히지 않는 임시 포크도 지원한다. 이를 통해 공유 컨텍스트에서 서로 다른 접근 방식을 병렬로 탐색할 수 있다 — 이전에는 외부 오케스트레이션이 필요했던 워크플로우다.

WebSocket 기반 원격 Code Mode. Codex 앱 서버는 ws:// 또는 wss://를 통해 원격 Code Mode 호스트에 연결할 수 있다. 플래그를 생략하면 기존과 동일하게 로컬 호스트가 시작된다. 이는 에이전트 제어 플레인(control plane)과 코드 실행 플레인을 분리하여, 로컬 인터페이스가 더 무거운 원격 호스트를 구동하는 씬 클라이언트(thin-client) 구성을 가능하게 한다. 이미 클라우드 워크스테이션을 프로비저닝한 팀은 더 이상 이들에 도달하기 위한 수제 릴레이를 구축할 필요가 없다.

프록시 및 MCP 수명주기 수정. 구성된 프록시는 이제 인증, 플러그인 다운로드, MCP 권한 부여, 원격 실행, WebSocket 연결 전반에서 적용된다. MCP 연결은 인증 및 구성 변경을 거쳐도 유지된다 — 이전에는 조용한 재연결 실패의 원인이었다. 실행자(executor)가 제공하는 스킬은 이제 세션 내에서 검색하고 읽을 수 있으며, 컨텍스트 예산 제약으로 스킬이 강제로 잘릴 때는 경고가 표시된다.

2. Codex Security CLI — Apache 2.0으로 오픈소스 공개

OpenAI는 7월 28~29일에 @openai/codex-security를 GitHub와 npm에 조용히 게시했다. Hacker News가 공식 발표보다 먼저 이를 발견했다. 이 패키지는 Apache-2.0 라이선스이며 CLI, TypeScript SDK, Dockerfile, CI 통합용 GitHub Actions 워크플로우를 포함한다.

기능. Codex Security는 저장소별 위협 모델을 구축하고, 현실적인 공격 경로를 탐색하며, 격리된 샌드박스에서 발견 사항을 검증하고, 사람의 검토를 위해 패치를 제안한다. 전체 저장소 스캔, 특정 경로 검토, Git diff 스캔, 작업 트리 검사, CSV 입력을 통한 다중 저장소 일괄 스캔을 지원한다. 스캔 이력은 SQLite에 저장되어 시간 경과에 따른 발견 추적을 가능하게 한다 — 월요일에 탐지된 취약점은 금요일 스캔이 동일한 코드 경로를 다시 검사해도 그 정체성을 유지한다.

출력물 및 CI 통합. 완료된 스캔은 report.md, findings.json, coverage.json 및 스캔 매니페스트를 생성한다. 내보내기 형식은 SARIF, JSON, CSV를 포함한다 — 즉 결과물을 GitHub Code Scanning, Azure DevOps 또는 기존 보안 대시보드에 바로 연결할 수 있다. --fail-on-severity 플래그는 발견 사항이 임계값을 초과하면 실패 종료 코드를 반환하므로 CI 게이트로 활용할 수 있다. Git 훅은 커밋 전에 스테이징된 변경 사항을 스캔할 수 있다.

한계점. 클라이언트는 오픈소스지만 두뇌는 그렇지 않다. 스캔 실행에는 여전히 OpenAI 측 Codex Security 서비스 접근 권한이 필요하다. 기본 모델은 extra-high 추론 설정의 gpt-5.6-sol이다. 런타임에는 Node.js 22+, Python 3.10+ 및 OpenAI 계정의 Codex Security 접근 권한이 필요하다. 소스 코드는 공개되어 있지만, 스캐너 백엔드는 승인된 Enterprise, Business, Education 고객에게만 제공된다.

주요 명령어:

  • scan — 전체 저장소, --path, --diff 또는 작업 트리
  • bulk-scan — CSV에 담긴 여러 저장소, 병렬 처리는 --workers
  • scans list/show/rerun/match/compare — 이력 및 회귀 추적
  • export --export-format sarif — 보안 도구용 구조화된 출력
  • validate / patch — 발견 사항 검증 및 수정 제안 생성
  • install-hook — 스테이징된 변경 사항의 커밋 전 스캔

이미 OpenAI 생태계에 투자한 엔지니어링 팀에게 이는 CI/CD 파이프라인에 의미 있는 추가 요소다. 독립형 SAST 도구와 비교해 평가하는 팀에게는 게이트된 접근 권한과 OpenAI 모델 의존성이 핵심 제약 조건이다.

3. ChatGPT Work — 엔터프라이즈 등록과 크레딧 인센티브

OpenAI는 채택을 촉진하기 위한 크레딧 인센티브와 함께 ChatGPT Work를 엔터프라이즈 고객에게 개방했다. 엔터프라이즈 고객은 8월 21일까지 등록할 수 있다. 등록 후 2주 이내에 Work를 처음 사용하는 팀원에게는 14일간 유효한 최대 $200 크레딧이 지급된다. 기존 고객은 담당 계정 팀에 문의하고, 신규 고객은 OpenAI 영업 채널을 통해 접촉하면 된다.

이는 가격 변경이 아니라 Work 에이전트 서피스(surface)를 겨냥한 고객 확보 전략이다. 크레딧은 조직 단위가 아니라 사용자 단위로 지급되므로, 이 인센티브는 대량 구매가 아닌 개별 채택에 맞춰져 있다. ChatGPT Work를 생산성 도구로 평가하는 엔지니어링 리더에게 14일 크레딧 기간은 실제 워크플로우를 처음부터 끝까지 파일럿으로 운영하기에 합리적인 기간이다.

Assistants API — 종료까지 26일. 8월 26일 종료가 4주도 채 남지 않았다. 자동 마이그레이션 도구는 출시되지 않는다. 대체재는 Responses API와 Conversations API의 조합이며, deep research, MCP 도구 연결, computer use를 포함한 완전한 기능 패리티에 도달했다. Azure OpenAI도 동일한 일정을 따른다. Microsoft의 Fabric Data Agent 팀은 OpenAI의 Responses API를 직접 대상으로 재구축하기보다 MCP로 마이그레이션할 것을 권장한다 — 플랫폼 파트너들이 이미 Assistants 이후의 환경을 중심으로 구축하고 있다는 신호다. 아직 Assistants API를 사용 중인 팀은 이를 확정 기한이 있는 P0 마이그레이션으로 간주해야 한다.

4. Anthropic — Claude Opus 5와 코딩 스택

Anthropic은 7월 24일 Claude Opus 5를 출시했으며, 이 모델은 Claude Max와 Claude Pro 플랜 모두에서 즉시 Claude Code의 기본 모델이 되었다. 포지셔닝은 단순하다: Fable 5에 근접한 지능을 절반 가격에 제공한다.

가격 및 포지셔닝. Opus 5는 입력/출력 100만 토큰당 $5/$25 — Opus 4.8과 동일하고 Fable 5의 $10/$50의 절반이다. Artificial Analysis Intelligence Index는 Opus 5를 61점으로 평가하는데, 이는 Fable 5보다 1점, GPT-5.6 Sol보다 2점 높은 수치다. Frontier-Bench v0.1(에이전트 코딩)에서 Opus 5는 Opus 4.8 점수의 2배 이상을 기록한다. CursorBench 3.2 최대 노력(max effort)에서는 작업당 비용이 절반이면서 Fable 5 최고점의 0.5% 이내에 도달한다. ARC-AGI-3에서는 차점 모델의 3배 점수를 기록한다.

Effort 다이얼. 5단계 노력 수준(low, medium, high, xhigh, max)의 기본값은 adaptive다. low 노력에서 Opus 5는 작업당 $2.55로 복합 벤치마크 62.8%를 기록한다 — max 노력의 Opus 4.8(작업당 $5.77, 62.3%)과 경쟁력 있는 수준이다. 패스트 모드는 $10/$25로 약 2.5배 빠르며, Claude API에서 리서치 프리뷰로 제공된다.

시스템 프롬프트 축소. Anthropic은 Claude Code의 시스템 프롬프트를 80% 이상 줄여도 코딩 평가(coding-eval) 성능에 측정 가능한 하락이 없었다는 새로운 컨텍스트 엔지니어링 가이드를 공개했다. 이는 에이전트 개발자에게 주는 신호다: 장황한 시스템 프롬프트는 실질적인 토큰 비용을 수반하며, 과감한 축소가 안전할 수 있다.

Claude Code v2.1.219. Opus 5와 함께 7월 24일에 출시되었다. /fork 명령은 이제 claude agents에 자체 행을 갖는 정식 백그라운드 세션을 생성하며, 기존의 세션 내 서브에이전트 경로는 /subtask가 된다. 세션 전체 상한은 웹 검색 200회, 서브에이전트 200개로 유지된다. 장기 실행 호출에 대한 MCP 자동 백그라운딩도 유지된다. Claude Sonnet 5의 프로모션 가격(100만 토큰당 $2/$10)은 8월 31일까지 적용되며, 이후 $3/$15로 변경된다.

5. 경쟁 구도 — 에이전트 보안, 병렬 스웜, MCP의 무상태 미래

Kimi K3 — 32개 에이전트, Redis 제로데이 19개 발견

보안 연구원 Chaofan Shou는 Redis 코드베이스를 상대로 32개의 병렬 Kimi K3 서브에이전트를 배치했다. 에이전트는 자율적으로 저장소를 클론하고 맞춤형 퍼즈 하네스(fuzz harness)를 구축했으며, GDB에서 크래시를 디버깅하고 실제 작동하는 개념 증명(PoC) 익스플로잇을 만들어냈다 — 약 90분 만에 이전에 알려지지 않은 취약점 19개를 발견했으며, 여기에는 27분 만에 구축된 인증된 RCE 체인도 포함된다.

Redis는 7월 23일에 보안 패치 릴리스 7건을 배포했다. 기저 버그가 실제임은 확인됐지만, 제로데이 19개라는 숫자와 27분 타임라인은 자체 보고에 따른 것으로 독립적으로 검증되지는 않았다. 같은 날 발표된 영국 AISI와 미국 CAISI의 공동 연구는 Kimi K3가 ExploitBench에서 32.2%를 기록한 반면 이름이 공개되지 않은 미국 프런티어 모델은 76.2%를 기록했다고 밝혀, 헤드라인에 적절한 맥락을 더했다.

보안 팀에 대한 시사점: 에이전트 기반 취약점 발견이 이제 의미 있는 규모에서 오픈웨이트 모델로 실증 가능하다는 점이다. 보안 작업에서 프런티어 독점 모델과 오픈웨이트 대안 간의 격차는 여전히 실재하지만, 평가를 고려할 만큼 빠르게 좁혀지고 있다.

xAI — Grok Build 워크플로우, 병렬 에이전트 1,024개

xAI의 Grok Build에 Workflows 오케스트레이션 계층이 추가됐다. 단일 자연어 요청이 여러 단계로 분해되며, 각 단계는 병렬 서브에이전트에 할당된다. 기본 동시성은 128개 에이전트이며, 가장 큰 작업에서는 1,024개로 확장된다. 독립적인 “skeptic(회의론자)” 에이전트가 결과를 통합하기 전에 발견 사항을 검증한다. 워크플로우는 .grok/workflows/에 재사용 가능한 슬래시 명령으로 저장된다.

기반 모델인 grok-build-0.1은 입력/출력 100만 토큰당 $1/$2로 책정됐다 — 파격적으로 저렴하다. 사용에는 SuperGrok(월 $30) 또는 X Premium+(월 $40)이 필요하며, 1,024개 에이전트 실행에는 SuperGrok Heavy(월 $300)가 필요하다. xAI는 또한 7월 20일 Excel, Word, PowerPoint용 무료 Grok 4.5 애드인을 출시하며 영향 범위를 Office 워크플로우로 확장했다.

MCP 스펙 — 출시 이후 최대 개정

2026-07-28 MCP 스펙 개정판은 MCP 출시 이후 가장 큰 프로토콜 변경으로 배포됐다. 주요 변경 사항: 프로토콜 코어가 이제 무상태(stateless)가 됐으며 — initialize/initialized 핸드셰이크와 Mcp-Session-Id 헤더가 제거됐다. 모든 요청은 _meta에 프로토콜 버전과 클라이언트 기능을 담는다. MRTR(Multi Round-Trip Requests)이 서버 주도 요청을 대체한다. MCP Apps(샌드박스 처리된 iframe의 서버 렌더링 HTML UI)는 이제 공식 확장 기능이 됐다. 확장 프레임워크는 독립적인 버전 관리를 갖춘 역방향 DNS 식별자를 사용한다. 권한 부여는 OAuth 2.0과 OpenID Connect 방향으로 강화된다. 공식 폐기(deprecation) 정책은 최소 12개월의 유예 기간을 요구한다.

Microsoft는 새 스펙을 구현한 MCP C# SDK v2.0을 v1 코드에 대한 하위 호환성과 함께 출시했다.

MCP 서버를 구축하는 팀에게 무상태 코어는 이제 일반 HTTP 인프라로 MCP 트래픽을 라우팅할 수 있음을 의미한다 — 세션 선호도(session affinity)가 필요 없다. 이는 로드 밸런서, CDN, API 게이트웨이에 의미 있는 운영 단순화다.

Google — Gemini 3.5 Pro: 4연속 릴리스 실패 임박

Gemini 3.5 Pro는 이제 세 번 연속 릴리스 시점을 놓쳤다 — 당초 6월 목표, 유출됐던 7월 17일 날짜, 그리고 7월 전체 기간이 그것이다. Google의 모델 카탈로그에는 여전히 gemini-3.5-pro 항목이 없다. 회사는 조용히 목표 날짜 공개를 중단했으며, 보고에 따르면 대신 Gemini 4 사전 학습을 시작했다. 예측 시장은 이제 릴리스 시점을 7월 말에서 8월 초로 보면서도, 또 한 번의 실패 가능성에 의미 있는 확률을 부여하고 있다. 프런티어 모델 경쟁에서 Google의 경쟁적 위치는 계속 약화되고 있다.

마무리

이번 주 에이전트 플랫폼 계층이 구체적인 형태를 갖췄다. Codex CLI v0.146.0의 Agent Plugins는 코딩 에이전트 생태계에서 처음으로 도구를 플랫폼 간에 휴대 가능하게 만든다. Codex Security CLI는 두뇌가 여전히 게이트된 상태임에도 에이전트 기반 보안 스캐닝을 개발자 손에 쥐여준다. Opus 5의 가격 책정은 프런티어 수준의 코딩 지능을 $5/$25에 제공하며, Anthropic으로 표준화하는 팀의 비용 상한을 절반으로 낮춘다. 그리고 MCP 스펙의 무상태 코어는 이에 의존하는 모든 에이전트 플랫폼의 인프라 구성을 단순화한다.

이번 주 엔지니어링 리더를 위한 세 가지 행동: 첫째, Codex CLI v0.146.0의 Agent Plugins를 팀의 재사용 도구와 비교 평가하라 — 크로스 플랫폼 매니페스트 형식은 에이전트 스킬의 첫 번째 신뢰할 수 있는 휴대성 스토리다. 둘째, Codex Security 접근 권한이 있는 OpenAI Enterprise 또는 Business 계정이 있다면 프로덕션 저장소에 대해 스캔을 실행하고 기존 SAST 파이프라인과 발견 사항을 비교하라. 셋째, Assistants API 마이그레이션을 아직 시작하지 않았다면 남은 시간은 26일 — 지금 시작하라.

에이전트 보안 시대가 이번 주 도래했다. 32개의 Kimi K3 에이전트가 Redis 제로데이를 찾아내든, Codex Security가 CI 파이프라인을 스캔하든 메시지는 동일하다: 취약점 발견의 시간 지평이 압축되고 있으며, 여기에 참여할 수 있는 도구는 점점 더 접근하기 쉬워지고 있다.

X에서 대화에 참여하세요.