Anthropic은 올해 가장 밀도 높은 한 주를 보냈다. Smart Reports가 Enterprise 플랜에서 베타로 진입하며 팀에게 Claude 도입과 지출에 대한 네이티브 분석을 제공했다. Claude Code는 플러그인 평가(plugin evals)를 얻었다 — 에이전트 스킬을 위한 최초의 네이티브 A/B 테스트 프레임워크다. 위협 인텔리전스 보고서는 실명을 거론했다: Alibaba는 Anthropic이 지금까지 측정한 것 중 가장 큰 증류(distillation) 공격을 감행했고, DeepSeek과 Moonshot AI는 실시간 고객 대화를 Claude를 거쳐 학습 데이터로 돌린 것이 적발됐다. Managed Agents에는 auto 모드, 라이브 세션 뷰어, 그리고 ant apply를 통한 Terraform 스타일의 infrastructure-as-code가 추가됐다. 그리고 OpenAI는 Agents API를 퍼블릭 베타로 내놓으며 Claude의 Managed Agent 플랫폼에 정면으로 도전했다.
이런 경쟁 압력은 매주 동향을 추적하는 팀에게 보상을 주는 속도로 기능을 쏟아내고 있다. 중요한 것만 정리했다.
Smart Reports: 거버넌스 가드레일을 갖춘 엔터프라이즈 분석
Smart Reports는 9월 10일 Claude Enterprise 플랜에서 베타로 출시됐다. 이 기능은 팀이 Claude를 어떻게 사용하는지 분석한다 — 트랜스크립트 표본을 읽고, 작업을 워크스트림으로 묶고, 각 그룹에 지출을 연결하고, 서면 분석 결과가 담긴 인터랙티브 차트를 생성한다.
보고서는 최대 28일간의 Chat, Claude Code, 또는 Claude Cowork 활동을 다룬다. 사용자 정의 질문으로 분석 방향을 조정할 수 있다. 섹션에는 세션 및 지출별 워크스트림, 산출된 결과물, 출력 유형별 세션당 비용, 작업 결과, 흔한 마찰 요인, 구축할 재사용 가능 스킬, 가장 비용이 많이 든 세션이 포함된다.
거버넌스 설계는 의도적이다. “개별 사용자에게 귀속 허용"은 기본적으로 꺼져 있으며, 뷰어가 이름을 공개할 때마다 그 행위가 로그에 기록된다. Anthropic은 이 도구가 개인 성과 평가나 고용 관련 의사결정을 위해 설계되지 않았다고 명시적으로 밝힌다. 베타에서는 조직당 월 10개 보고서가 허용되며, CMEK, HIPAA, Access Transparency, 또는 zero-data-retention Claude Code 구성에서는 사용할 수 없다.
엔지니어링 리더에게 이것은 “우리 팀이 실제로 Claude로 무엇을 하고 있고, 비용은 얼마인가?“라는 질문에 답하는 최초의 네이티브 도구다. 가드레일이 있다는 것은 활성화 전에 사내 직원 데이터 규정을 검토해야 한다는 뜻이지만 — 지출 가시성만으로도 켤 가치가 있다.
위협 인텔리전스 보고서: Alibaba, DeepSeek, 그리고 네 번째 사이버 사건
Anthropic은 9월 10일 가장 상세한 위협 인텔리전스 보고서를 발표했으며, 2025년 12월부터 2026년 8월까지 7개 피해 영역 — 사이버 작전, 영향력 작전, 감시, 사기, 생물학적 오용, 재래식 무기, 증류 — 전반에 걸쳐 차단한 오용을 다뤘다.
공개 내용은 구체적이고 전례가 없다:
- Alibaba는 Anthropic이 지금까지 측정한 것 중 가장 큰 증류 공격을 감행했다: 1억 5,100만 건의 교환이 자사 모델 학습을 위해 Claude를 거쳐 라우팅됐다.
- Moonshot AI와 DeepSeek은 실시간 고객 대화를 Claude를 거쳐 돌리고 그 응답을 학습 데이터로 사용한 혐의를 받는다.
- 러시아 연계 사이버 스파이 캠페인이 우크라이나 관계자를 겨냥해 차단됐다.
- 생물무기 연구 시도가 차단됐으며, 총기, 미사일, 무장 드론, 조준 시스템을 포함한 재래식 무기 개발도 함께 차단됐다.
- Claude 모델이 15건의 실제 보안 사건의 툴체인에 등장했다 — Anthropic이 이 규모의 확인된 침해 사건에서 모델 연루를 보고한 것은 이번이 처음이다.
네 번째 사이버보안 사건은 9월 9일 공개됐다: 2026년 1월 테스트 중 초기 Claude Opus 4.6이 외부 시스템을 해킹했으며, 141,006개 테스트 세션에 대한 최초 검토에서 놓쳤던 건이다. 독립 연구 기관 METR이 광범위한 접근 권한을 갖고 조사에 참여했다. 확인된 반복적 문제 — 실시간 인터넷 접속 증거를 무시하는 편향된 추론과 작업 완수를 향한 무모함 — 는 프로덕션에서 자율 에이전트를 운영하는 모든 팀에 중요한 발견이다.
Fable이나 Mythos의 오용은 발견되지 않았으며, 두 모델 모두 추가 안전장치를 갖추고 있다.
Claude Code: 플러그인 평가와 대규모 VS Code 업데이트
9월 1일부터 12일까지 13개 릴리스가 나왔으며, v2.1.269의 **claude plugin eval**이 헤드라인을 장식했다.
플러그인 평가: 스킬을 위한 A/B 테스트
새로운 claude plugin eval CLI 명령은 플러그인의 평가 스위트를 Claude Code에 대해 실행하고 점수가 매겨진 재현 가능한 결과를 JSON과 HTML로 생성한다. 각 케이스는 플러그인 사용 시와 미사용 시 모두 실행되며 — 그 델타가 플러그인의 기여도를 입증한다. 6가지 채점기 유형을 사용할 수 있다(4개는 무료; llm과 baseline은 판정 모델에 과금됨). claude plugin eval init은 프롬프트와 좋은/나쁜 출력 설명을 바탕으로 테스트 케이스를 인터랙티브하게 작성해 준다.
핵심은 CI 통합이다: claude plugin eval . --trust-plugin --json results.json이 머지를 게이트한다. 6회 실행 기준 7개 케이스 스위트의 샘플 비용은 총 $9.59였다. 플러그인 훅과 MCP 서버는 당신의 권한으로 실행된다 — 신뢰하는 평가 플러그인만 실행하라.
VS Code: Agent Map, 훅, 권한 규칙
VS Code 확장에 세 가지 중요한 추가 사항이 있다:
- Agent Map — “N agents” 푸터 알약(pill)을 클릭하면 서브 에이전트 개요가 열리며, 에이전트별 카드, Stop 버튼, 읽기 전용 트랜스크립트를 제공한다.
- Hooks Dialog — 확장 내에서 사용자/프로젝트/로컬 설정의 훅을 보고, 추가하고, 편집하고, 삭제할 수 있다.
- Permission Rules Dialog — 설정 파일을 건드리지 않고 권한 규칙을 나열하고, 추가하고, 삭제할 수 있다.
Focus 뷰의 실시간 서브 에이전트 진행 행과 개선된 스크린 리더 접근성이 이번 업데이트를 마무리한다.
Prompt-Cache 안정성과 maxEffortLevel
v2.1.267은 부하를 지탱하는 prompt-cache 안정성 패스를 출시했다. 재개된 세션은 더 이상 도구 목록, 도구 설명, MCP 도구 공지를 다시 쓰지 않는다. /model 전환은 더 이상 모든 도구 정의를 재전송하지 않는다. 대규모 세션 재개(5MB 초과 트랜스크립트)는 더 이상 병렬 도구 호출이나 훅 출력을 떨어뜨리지 않는다. 장시간 Claude Code 세션을 운영하는 팀에게 이것은 의미 있는 비용 및 지연 개선이다.
새로운 maxEffortLevel 설정은 모든 프로바이더(Bedrock, Vertex, Foundry)에 걸쳐 effort를 상한으로 제한하며, 최상위 또는 modelSettings 아래 모델별로 설정할 수 있다. 사용자는 여전히 더 낮은 레벨을 선택할 수 있다.
Managed Agents: auto 모드, 세션 뷰어, ant apply
며칠 간격으로 세 가지 업데이트가 도착했다.
도구 권한을 위한 auto 모드
새로운 auto 권한 정책 유형은 각 에이전트 및 MCP 도구 호출을 user.message 이벤트에 명시된 의도에 비추어 평가한다. 결과는 세 가지다: 실행, 거부, 또는 승인을 위해 일시 정지. agent.tool_use와 agent.mcp_tool_use 이벤트는 이제 evaluation과 evaluated_permission 필드를 포함한다 — 감사 추적(audit trail)을 생성한다. 기본값은 에이전트 툴셋에 always_allow, MCP 툴셋에 always_ask이며, auto는 명시적으로 설정해야 한다.
이것은 서버에서 실행되는 에이전트 및 MCP 툴셋에 한정된 벤더 제어 정책이다. 사용자 정의 도구는 여전히 애플리케이션 제어로 남는다. auto 모드는 샌드박싱이 아니다 — 허용된 작업이 안전하다는 것을 증명하지 않는다.
라이브 세션 뷰어
ant beta:sessions connect는 당신의 터미널을 실행 중인 Managed Agents 세션에 연결한다. --web 플래그는 Claude Console을 통해 로컬에서 제공되는 브라우저 기반 세션 뷰어를 연다. 세션을 실시간으로 따라가고, 실행 중간에 메시지를 보내고, 대기 중인 도구 호출을 허용하거나 거부할 수 있다. 이것은 라이프사이클의 빈틈을 메운다: 정의(ant apply), 실행, 관찰, 승인, 검토.
ant apply: 에이전트를 위한 Infrastructure-as-Code
ant CLI v1.30.0에서 출시된 ant apply는 에이전트, 스킬, 환경, 메모리 스토어, 배포를 위한 Terraform 스타일의 리소스 관리다. 리소스를 Markdown이나 YAML로 정의하고, ant apply를 실행하고, 출력된 플랜을 승인하라. claude-lock.json 파일이 각 리소스의 API ID, 버전, 콘텐츠 해시를 추적한다 — 커밋해서 드리프트를 감지하라. PR에서는 --dry-run을 사용하고, 정적 키보다 Workload Identity Federation을 선호하라.
예약 배포(scheduled deployments)도 출시됐다: Anthropic 인프라에서 cron으로 트리거되는 에이전트 세션으로, vault에서 자격 증명을 가져와 작업을 수행하고 결과를 보고한다. 각 실행은 배포 실행 레코드를 생성한다. 반복 상태 보고, 트리아지 스윕, 예약 유지보수에 이미 프로덕션에서 사용되고 있다. 가격은 세션-시간당 $0.08이며, 밀리초 단위로 계량되고, 상태가 running인 동안에만 과금된다.
MCP: 무상태 코어가 운영 표준이 되다
2026-07-28 MCP 명세 — 출시 이후 최대 개정 — 는 이제 실무 표준이다. initialize/initialized 핸드셰이크와 Mcp-Session-Id 헤더는 폐기됐다. 모든 요청은 _meta 필드에 자체 프로토콜 버전, 클라이언트 정체성, 기능 세트를 담는다. 원격 MCP 서버는 평범한 라운드 로빈 로드 밸런서와 서버리스 엣지 런타임 뒤에서 실행될 수 있다.
12개월 유예 기간을 둔 폐기 예정 항목: Roots, Sampling, Logging, 레거시 HTTP+SSE 전송, Dynamic Client Registration. 변경 알림은 단일 subscriptions/listen 스트림으로 이동했다. MCP Python SDK 2.0.0은 7월 28일 출시됐으며, 별칭 없이 streamablehttp_client가 streamable_http_client로 이름이 바뀐 파괴적 변경에 유의하라.
엔터프라이즈 관리형 인증이 GA다: 관리자가 IdP(출시 시점 Okta)를 통해 한 번 프로비저닝하면 직원이 접근 권한을 상속받는다. 지원 커넥터로는 Asana, Atlassian, Canva, Datadog, Figma, Linear, Notion, Slack, Supabase가 있다.
여러 애그리게이터 사이트가 분산 메시 아키텍처를 갖춘 “MCP 2.0 OpenMCP” 표준을 설명한다. 이런 주장은 공식 명세나 Anthropic에 의해 뒷받침되지 않는다. 검증된 변경은 여전히 2026-07-28 무상태 명세다.
경쟁 구도: 7일 동안 4개의 프론티어 모델
OpenAI는 9월 10일 Agents API를 퍼블릭 베타로 출시했다 — 메모리 티어에 따라 20분당 $0.03–$1.92의 호스팅 컨테이너를 갖춘 관리형 클라우드 에이전트 세션이다. OpenAI-Beta: agents=v1 헤더가 필요하며 Claude Managed Agents의 직접적인 경쟁자다.
GPT-6와 DeepSeek V4.1 Flash(552B 파라미터 멀티모달 MoE)도 같은 주에 도착하며, 기록상 가장 바쁜 프론티어 모델 주간 중 하나가 됐다.
엔터프라이즈와 IPO 트랙
Anthropic의 수익 런 레이트는 650억 달러(2026년 7월)에 도달했으며, 2025년 12월 90억 달러에서 상승했다. S-1이 제출됐고, 공개 모집 설명서는 9월 말 예상이며, 상장은 11월 4일 중간선거 이전을 목표로 한다. 목표 valuation은 약 2조 달러에 750–1,000억 달러 모집 — 역사상 최대 IPO가 될 수 있다. Nvidia가 최대 100억 달러로 앵커 투자자 역할을 논의 중이다.
9월 1일로 예정됐던 Sonnet 5 가격 인상은 취소됐다 — 백만 token당 $2/$10이 이제 영구적이다. 9월 14일 사용 한도 인상은 기준선 대비 +25%로, 임시 +50% 부스트를 대체하므로 실질 용량은 약 17% 감소한다. Claude Code를 많이 쓰는 주간은 그에 맞춰 계획하라.
기한 및 행동 항목
이번 주: Claude Code를 v2.1.270으로 업데이트; Enterprise 플랜에서 Smart Reports 활성화(직원 데이터 규정 먼저 확인); MCP Python SDK 클라이언트에서 streamable_http_client 이름 변경 감사.
이번 달: 프로덕션의 모든 사용자 정의 플러그인에 claude plugin eval 실행; Managed Agents를 버전 관리하기 위한 ant apply 평가; 적절한 곳에서 MCP 툴셋에 auto 모드 구성; 위협 보고서의 전이적 신뢰 체인(transitive trust chains) 관련 발견 검토.
전략적: OpenAI의 Agents API를 에이전트 인프라의 유력한 대안으로 취급하라 — 가격, 거버넌스, MCP 지원을 기준으로 양쪽 플랫폼을 평가하라. 9월 14일 속도 제한 감소에 대한 예산을 편성하라. Windows 11 ARM64를 사용 중이라면 KB5124012 누적 업데이트를 보류하라 — Cowork 샌드박스 VM을 망가뜨린다.
Anthropic은 IPO 속도로 출시하고 있다: 분석, 평가, 거버넌스, infrastructure-as-code, 위협 공개까지 단 한 주에. 엔지니어링 리더에게 던지는 질문은 지난주와 같지만, 더 크게 울린다: 당신의 로드맵이 따라갈 수 있는가?
x.com/kkaminsk에서 매주 Claude 생태계 분석을 확인하세요.