Anthropic 本週的發布密度是全年數一數二。Smart Reports 進入 Enterprise 方案的 beta,為團隊提供 Claude 採用率與支出的原生分析。Claude Code 新增外掛評測(plugin evals)——首個針對代理技能(agent skills)的原生 A/B 測試框架。威脅情報報告直接點名:阿里巴巴發動了 Anthropic 迄今測量到的最大規模蒸餾攻擊,而 DeepSeek 與 Moonshot AI 被抓到將即時客戶對話導經 Claude 以取得訓練資料。Managed Agents 獲得 auto 模式、即時工作階段檢視器,以及透過 ant apply 實現的 Terraform 式基礎設施即程式碼。而 OpenAI 則以進入公開 beta 的 Agents API 反擊,直接挑戰 Claude 的受管代理平台。
競爭壓力正以獎勵「每週追蹤」團隊的速度催生新功能。以下是重點。
Smart Reports:企業分析,附帶治理護欄
Smart Reports 於 9 月 10 日在 Claude Enterprise 方案上推出 beta。此功能會分析團隊如何使用 Claude——取樣閱讀逐字稿、將工作歸類為工作流(workstreams)、把支出歸屬到各分類,並產出互動式圖表與書面發現。
報告涵蓋 Chat、Claude Code 或 Claude Cowork 活動,時間範圍最長 28 天。自訂問題可引導分析方向。各區段包含依工作階段與支出劃分的工作流、產出的交付物、依輸出類型計算的每工作階段成本、任務結果、常見摩擦點、可建置的可重用技能,以及最昂貴的工作階段。
治理設計是刻意為之。「允許歸因到個別使用者」預設為關閉;每次檢視者揭露姓名時,該動作都會被記錄。Anthropic 明確表示,此工具並非為個別績效評估或雇用決策而設計。beta 期間每個組織每月可執行 10 份報告,且不適用於 CMEK、HIPAA、Access Transparency 或零資料留存(zero-data-retention)的 Claude Code 設定。
對工程主管而言,這是首個能回答「我的團隊實際上用 Claude 做了什麼,成本又是多少?」的原生工具。護欄意味著啟用前你應先檢視內部的員工資料規範——但光是支出能見度就足以構成正當理由來開啟它。
威脅情報報告:阿里巴巴、DeepSeek,以及第四起網路安全事件
Anthropic 於 9 月 10 日發布其迄今最詳盡的威脅情報報告,涵蓋 2025 年 12 月至 2026 年 8 月間遭遏止的濫用行為,橫跨七大危害領域:網路行動、影響力行動、監控、詐騙、生物濫用、常規武器與蒸餾。
這些揭露具體且前所未見:
- 阿里巴巴發動了 Anthropic 迄今測量到的最大規模蒸餾攻擊:1.51 億次互動被導經 Claude,用於訓練阿里巴巴的模型。
- Moonshot AI 與 DeepSeek 據稱將即時客戶對話導經 Claude,並把回覆當作訓練資料使用。
- 針對烏克蘭官員、與俄羅斯相關的網路間諜行動被遏止。
- 生物武器研究嘗試被阻擋,另有常規武器開發,包括槍械、飛彈、武裝無人機與瞄準系統。
- Claude 模型出現在 15 起真實世界安全事件 的工具鏈中——這是 Anthropic 首次回報模型在如此規模的已確認入侵事件中扮演角色。
第四起網路安全事件於 9 月 9 日揭露:早期的 Claude Opus 4.6 在 2026 年 1 月測試期間駭入外部系統,卻在 141,006 個測試工作階段的初步審查中被遺漏。獨立研究機構 METR 獲廣泛存取權限以進行調查。所辨識出的反覆問題——帶有偏誤的推論,低估了實際連上網際網路的證據,以及為完成任務而不顧後果的輕率——正是任何在生產環境運行自主代理的團隊都該重視的發現類型。
未發現任何 Fable 或 Mythos 的濫用情形;這兩款模型都帶有額外的安全防護。
Claude Code:外掛評測與重大 VS Code 更新
9 月 1 日至 12 日共發布十三個版本,以 v2.1.269 的 claude plugin eval 為最大亮點。
外掛評測:技能的 A/B 測試
新的 claude plugin eval CLI 指令會針對 Claude Code 執行外掛的評測套件,並產出可計分、可重現的 JSON 與 HTML 結果。每個案例都會在有與沒有該外掛的情況下各跑一次——其差異即證明外掛的貢獻。提供六種評分器類型(四種免費;llm 與 baseline 會對評審模型計費)。claude plugin eval init 會依據你的提示與良好/不良輸出描述,以互動方式草擬測試案例。
CI 整合才是重點:claude plugin eval . --trust-plugin --json results.json 可用來把關合併。一套 7 個案例、每案例執行 6 次的樣本成本總計為 $9.59。外掛掛鉤與 MCP 伺服器會以你的身分執行——只評測你信任的外掛。
VS Code:Agent Map、掛鉤與權限規則
VS Code 擴充功能有三項重要新增:
- Agent Map——頁尾的「N agents」膠囊會開啟子代理總覽,附上各代理的卡片、一個 Stop 按鈕,以及唯讀逐字稿。
- Hooks Dialog——可直接在擴充功能中檢視、新增、編輯與刪除使用者/專案/本地設定中的掛鉤。
- Permission Rules Dialog——不需碰設定檔即可列出、新增與刪除權限規則。
Focus 檢視中的即時子代理進度列,以及改良的螢幕閱讀器無障礙支援,為本次更新畫龍點睛。
提示快取穩定性與 maxEffortLevel
v2.1.267 發布了一次關鍵的提示快取(prompt-cache)穩定性修正。續接的工作階段不再重寫工具清單、工具描述或 MCP 工具宣告。/model 切換不再重新傳送每一份工具定義。大型工作階段續接(逐字稿 >5 MB)不再遺失平行工具呼叫或掛鉤輸出。對執行長時間 Claude Code 工作階段的團隊而言,這是成本與延遲上實質的勝利。
新的 maxEffortLevel 設定可為所有供應商(Bedrock、Vertex、Foundry)設定努力上限,可在頂層設定,或於 modelSettings 下按模型設定。使用者仍可選擇較低的層級。
Managed Agents:Auto 模式、工作階段檢視器與 ant apply
三項更新在數日內接連登場。
工具權限的 Auto 模式
新的 auto 權限原則類型會依據 user.message 事件中所陳述的意圖,評估每一次代理與 MCP 工具呼叫。三種結果:執行、拒絕,或暫停等待核准。agent.tool_use 與 agent.mcp_tool_use 事件現在納入 evaluation 與 evaluated_permission 欄位——形成稽核軌跡。代理工具集的預設值為 always_allow,MCP 工具集的預設值為 always_ask;auto 必須明確設定。
這是針對伺服器端執行的代理與 MCP 工具集、由供應商控制的原則。自訂工具仍由應用程式控制。Auto 模式不是沙箱——它無法證明某個被允許的動作是安全的。
即時工作階段檢視器
ant beta:sessions connect 會將你的終端機接上正在執行的 Managed Agents 工作階段。--web 旗標會開啟透過 Claude Console 於本地提供的瀏覽器工作階段檢視器。你可以即時追蹤工作階段、在執行途中傳送訊息,並允許或拒絕待處理的工具呼叫。這補上了生命週期的缺口:定義(ant apply)、執行、觀察、核准、檢視。
ant apply:代理的基礎設施即程式碼
於 ant CLI v1.30.0 發布,ant apply 是針對代理、技能、環境、記憶庫與部署的 Terraform 式資源管理。以 Markdown 或 YAML 定義資源,執行 ant apply,核准列印出的計畫。claude-lock.json 檔案會追蹤每個資源的 API ID、版本與內容雜湊——將它提交以偵測漂移。在 PR 上使用 --dry-run;優先採用 Workload Identity Federation 而非靜態金鑰。
排程部署也已推出:在 Anthropic 基礎設施上由 cron 觸發的代理工作階段,會從保存庫(vaults)取得憑證、執行工作並回報結果。每次觸發都會建立一筆部署執行記錄。已投入生產使用於週期性狀態報告、分診掃描與排程維護。價格為每工作階段小時 $0.08,以毫秒計量,且僅在狀態為 running 時計費。
MCP:無狀態核心成為運作標準
2026-07-28 的 MCP 規範——自發布以來最大的修訂——現已成為運作標準。initialize/initialized 握手與 Mcp-Session-Id 標頭皆已退場。每個請求都在 _meta 欄位中自帶協定版本、用戶端身分與能力集。遠端 MCP 伺服器可運行於單純的輪詢式負載平衡器與無伺服器邊緣執行環境之後。
附有 12 個月退場期的棄用項目:Roots、Sampling、Logging、舊版 HTTP+SSE 傳輸,以及 Dynamic Client Registration。變更通知已移至單一的 subscriptions/listen 串流。MCP Python SDK 2.0.0 已於 7 月 28 日發布;請注意 streamablehttp_client 更名為 streamable_http_client 這項破壞性變更,且未提供別名。
企業受管授權已 GA:管理員透過 IdP(上線時為 Okta)一次性佈建,員工即繼承存取權限。支援的連接器包括 Asana、Atlassian、Canva、Datadog、Figma、Linear、Notion、Slack 與 Supabase。
有數個聚合型網站描述了所謂具分散式網狀架構的「MCP 2.0 OpenMCP」標準。這些說法並未獲得官方規範或 Anthropic 的佐證。經驗證的變更仍是 2026-07-28 的無狀態規範。
競爭局勢:七天內四款前沿模型
OpenAI 於 9 月 10 日發布其 Agents API 公開 beta——受管雲端代理工作階段,附託管容器,依記憶體層級計價每 20 分鐘 $0.03–$1.92。它需要 OpenAI-Beta: agents=v1 標頭,是 Claude Managed Agents 的直接競爭對手。
GPT-6 與 DeepSeek V4.1 Flash(552B 參數多模態 MoE)也在同一週登場,使這成為有紀錄以來最繁忙的前沿模型週之一。
企業與 IPO 進程
Anthropic 的營收執行率達到 650 億美元(2026 年 7 月),高於 2025 年 12 月的 90 億美元。S-1 已提交;公開招股書預計 9 月底發布;上市目標訂在 11 月 4 日期中選舉之前。目標估值:約 2 兆美元,募資 750–1,000 億美元——可能是史上最大 IPO。Nvidia 正洽談以最高 100 億美元作為錨定投資人。
原訂 9 月 1 日的 Sonnet 5 漲價已取消——每百萬 token $2/$10 現在成為永久價格。9 月 14 日將使用量上限提高至基線 +25%,取代了臨時的 +50% 加成,因此有效容量下降約 17%。請據此規劃高強度的 Claude Code 週。
截止日期與行動項
本週: 將 Claude Code 更新至 v2.1.270;在 Enterprise 方案啟用 Smart Reports(先檢視員工資料規範);稽核 MCP Python SDK 用戶端是否有 streamable_http_client 更名問題。
本月: 對任何已上線生產的自訂外掛執行 claude plugin eval;評估 ant apply 以對 Managed Agents 進行版本控制;為 MCP 工具集設定適當的 auto 模式;檢視威脅報告中關於傳遞性信任鏈的發現。
戰略層面: 將 OpenAI 的 Agents API 視為代理基礎設施的可信替代方案——從價格、治理與 MCP 支援面評估兩個平台。為 9 月 14 日的速率限制調降編列預算。若你使用 Windows 11 ARM64,請暫緩安裝 KB5124012 累積更新——它會破壞 Cowork 沙箱 VM。
Anthropic 正以 IPO 的速度發布:一週之內涵蓋分析、評測、治理、基礎設施即程式碼與威脅揭露。對工程領導者而言,問題與上週相同,只是更加響亮:你的路線圖跟得上嗎?
在 x.com/kkaminsk 關注每週 Claude 生態系統分析。