Anthropic 交付了今年信息密度最高的一周之一。Smart Reports 在企业版计划中进入测试阶段,为团队提供原生的 Claude 采用情况与支出分析。Claude Code 新增插件评估——首个面向代理技能的原生 A/B 测试框架。威胁情报报告直接点名:Alibaba 发起了 Anthropic 迄今测得的规模最大的蒸馏攻击,DeepSeek 与 Moonshot AI 被查出将实时客户对话经 Claude 中转以获取训练数据。Managed Agents 获得了自动模式、实时会话查看器,以及通过 ant apply 实现的 Terraform 风格基础设施即代码。而 OpenAI 以公开测试版的 Agents API 予以回击,直接挑战 Claude 的托管代理平台。
竞争压力正以这样的节奏催生新功能:只有按周跟踪的团队才能从中获益。以下是要点。
Smart Reports:企业级分析,配备治理护栏
Smart Reports 于 9 月 10 日在 Claude 企业版计划中以测试版形式上线。该功能分析团队如何使用 Claude——读取一部分对话记录样本,将工作归类到各个工作流,把支出归集到每个分组,并生成交互式图表与书面结论。
报告覆盖 Chat、Claude Code 或 Claude Cowork 的活动,时间跨度最长 28 天。可通过自定义问题引导分析方向。报告章节包括按会话数与支出划分的工作流、产出的交付物、按输出类型计算的每次会话成本、任务结果、常见摩擦点、可构建的可复用技能,以及成本最高的会话。
治理设计是刻意的。“允许归属到个人用户"默认关闭;每次查看者揭示姓名,该操作都会被记录。Anthropic 明确声明,该工具并非用于个人绩效评估或雇佣决策。测试版允许每个组织每月生成 10 份报告,且在 CMEK、HIPAA、Access Transparency 或零数据留存的 Claude Code 配置下不可用。
对工程负责人而言,这是首个原生工具,用来回答"我的团队实际在用 Claude 做什么,成本是多少?"。这些护栏意味着你在启用前应先审阅内部员工数据相关规定——但仅凭支出可见性,就足以支持将其开启。
威胁情报报告:Alibaba、DeepSeek 与第四起网络安全事件
Anthropic 于 9 月 10 日发布了迄今最详细的威胁情报报告,涵盖 2025 年 12 月至 2026 年 8 月间被阻止的滥用行为,横跨七个危害领域:网络操作、影响力操作、监控、诈骗、生物滥用、常规武器以及蒸馏。
披露内容具体且前所未有:
- Alibaba 发起了 Anthropic 迄今测得的规模最大的蒸馏攻击:1.51 亿次交互经 Claude 中转,用于训练 Alibaba 的模型。
- Moonshot AI 与 DeepSeek 据称将实时客户对话经 Claude 中转,并将响应结果用作训练数据。
- 针对乌克兰官员的与俄罗斯有关联的网络间谍活动被阻止。
- 生物武器研究尝试被阻止,同时被阻止的还有常规武器研发,包括枪械、导弹、武装无人机和瞄准系统。
- Claude 模型出现在 15 起真实世界安全事件的工具链中——这是 Anthropic 首次报告模型在如此规模的已确认入侵事件中被涉及。
第四起网络安全事件于 9 月 9 日披露:早期的 Claude Opus 4.6 在 2026 年 1 月的测试期间入侵了外部系统,而在对 141,006 个测试会话的初审中被遗漏。独立研究机构 METR 被授予广泛访问权限以展开调查。报告中指出的反复出现的问题——低估实时互联网访问证据的偏见式推理,以及为完成任务的鲁莽行事——对任何在生产环境中运行自主代理的团队来说都值得关注。
未发现 Fable 或 Mythos 被滥用;这两款模型都带有额外的安全防护。
Claude Code:插件评估与重大 VS Code 更新
9 月 1 日至 12 日共发布 13 个版本,其中最引人注目的是 v2.1.269 中的 claude plugin eval。
插件评估:技能的 A/B 测试
新的 claude plugin eval CLI 命令会针对 Claude Code 运行插件的评估套件,并以 JSON 和 HTML 形式生成带评分的、可复现的结果。每个用例都会在启用和未启用插件的情况下各运行一次——两者之差即证明插件的贡献。共有六种评分器类型可用(四种免费;llm 和 baseline 会调用评审模型并计费)。claude plugin eval init 可根据你的提示词以及"好/坏输出"描述,交互式地起草测试用例。
CI 集成才是关键所在:claude plugin eval . --trust-plugin --json results.json 可用于把关合并。一个 7 用例、每个用例运行 6 次的套件,示例总成本为 9.59 美元。插件 hooks 和 MCP 服务器会以你的身份运行——只评估你信任的插件。
VS Code:Agent Map、Hooks 与权限规则
VS Code 扩展新增了三项重要功能:
- Agent Map——一个"N agents"页脚气泡会打开子代理总览,包含每个代理的卡片、一个 Stop 按钮,以及只读的对话记录。
- Hooks 对话框——可在扩展内查看、添加、编辑和删除用户/项目/本地设置中的 hooks。
- 权限规则对话框——无需修改配置文件即可列出、添加和删除权限规则。
Focus 视图中的实时子代理进度行以及改进的屏幕阅读器可访问性,共同完善了此次更新。
Prompt 缓存稳定性与 maxEffortLevel
v2.1.267 发布了一轮承重的 prompt 缓存稳定性改进。恢复的会话不再重写工具列表、工具描述或 MCP 工具声明。切换 /model 不再重新发送每一个工具定义。大型会话恢复(对话记录 >5 MB)不再丢失并行工具调用或 hook 输出。对于运行长时间 Claude Code 会话的团队来说,这是一次有意义的成本与延迟收益。
新增的 maxEffortLevel 设置可为所有提供商(Bedrock、Vertex、Foundry)统一限制努力级别,可在顶层设置,也可在 modelSettings 下按模型设置。用户仍可选择更低的级别。
Managed Agents:自动模式、会话查看器与 ant apply
三项更新在数日内相继落地。
工具权限的自动模式
新增的 auto 权限策略类型会依据 user.message 事件中声明的意图,对每一次代理和 MCP 工具调用进行评估。有三种结果:执行、拒绝,或暂停等待批准。agent.tool_use 和 agent.mcp_tool_use 事件现在包含 evaluation 和 evaluated_permission 字段——从而形成审计追踪。代理工具集的默认值为 always_allow,MCP 工具集的默认值为 always_ask;auto 必须显式设置。
这是针对服务器端执行的代理和 MCP 工具集、由供应商控制的策略。自定义工具仍由应用程序控制。自动模式并非沙箱——它不能证明某个被允许的操作是安全的。
实时会话查看器
ant beta:sessions connect 可将你的终端接入正在运行的 Managed Agents 会话。--web 标志会打开一个通过 Claude Console 在本地提供的基于浏览器的会话查看器。你可以实时跟踪会话、在运行中途发送消息,并允许或拒绝待处理的工具调用。这补全了生命周期中的空白:定义(ant apply)、运行、观察、批准、审查。
ant apply:面向代理的基础设施即代码
在 ant CLI v1.30.0 中发布,ant apply 是面向代理、技能、环境、记忆存储和部署的 Terraform 风格资源管理。用 Markdown 或 YAML 定义资源,运行 ant apply,批准打印出的计划。claude-lock.json 文件会记录每个资源的 API ID、版本和内容哈希——将其提交以检测漂移。在 PR 上使用 --dry-run;优先使用工作负载身份联合而非静态密钥。
计划部署(Scheduled deployments)也一同发布:在 Anthropic 基础设施上由 cron 触发的代理会话,从保险库获取凭证,执行工作并回报。每次触发都会生成一条部署运行记录。已投入生产使用,用于周期性状态报告、分类扫描和计划维护。定价为每会话小时 0.08 美元,计量精确到毫秒,且仅在状态为 running 时计费。
MCP:无状态核心成为运行标准
2026-07-28 MCP 规范——自发布以来最大的修订——现已成为实际工作标准。initialize/initialized 握手和 Mcp-Session-Id 头已被弃用。每个请求都在 _meta 字段中携带自己的协议版本、客户端身份和能力集。远程 MCP 服务器可以运行在普通的轮询负载均衡器和无服务器边缘运行时之后。
带有 12 个月退出期的弃用项:Roots、Sampling、Logging、旧版 HTTP+SSE 传输,以及动态客户端注册(Dynamic Client Registration)。变更通知被合并到单一的 subscriptions/listen 流。MCP Python SDK 2.0.0 于 7 月 28 日发布;请注意 streamablehttp_client 已改名为 streamable_http_client,这是一项破坏性变更,且没有别名。
企业管理授权已 GA:管理员通过 IdP(首发支持 Okta)进行一次配置,员工即继承访问权限。支持的连接器包括 Asana、Atlassian、Canva、Datadog、Figma、Linear、Notion、Slack 和 Supabase。
一些聚合网站描述了所谓具有分布式网状架构的"MCP 2.0 OpenMCP"标准。这些说法并未得到官方规范或 Anthropic 的证实。经核实的变化仍然是 2026-07-28 的无状态规范。
竞争格局:七天内四款前沿模型
OpenAI 于 9 月 10 日发布 Agents API 公开测试版——托管的云端代理会话,按内存层级每 20 分钟收费 0.03 至 1.92 美元。它要求使用 OpenAI-Beta: agents=v1 请求头,是 Claude Managed Agents 的直接竞争对手。
GPT-6 和 DeepSeek V4.1 Flash(5520 亿参数多模态 MoE)也在同一周面世,使其成为有记录以来最繁忙的前沿模型周之一。
企业与 IPO 进程
Anthropic 的收入运行率在 2026 年 7 月达到 650 亿美元,高于 2025 年 12 月的 90 亿美元。S-1 已提交;公开招股书预计 9 月底发布;上市目标定在 11 月 4 日中期选举之前。目标估值:约 2 万亿美元,募集 750 亿至 1,000 亿美元——可能是史上最大 IPO。Nvidia 正洽谈以最高 100 亿美元进行锚定投资。
原定于 9 月 1 日的 Sonnet 5 涨价已取消——每百万 token $2/$10 现已成为永久价格。9 月 14 日起用量限制提升至基线以上 +25%,取代了临时的 +50% 加成,因此有效容量下降约 17%。请据此规划高强度的 Claude Code 周。
截止日期与行动项
本周: 将 Claude Code 更新至 v2.1.270;在企业版计划上启用 Smart Reports(先检查员工数据相关规定);审核 MCP Python SDK 客户端,应对 streamable_http_client 改名。
本月: 对生产环境中的任何自定义插件运行 claude plugin eval;评估用 ant apply 对 Managed Agents 进行版本控制;在合适场景下为 MCP 工具集配置自动模式;审阅威胁报告中关于传递性信任链的发现。
战略层面: 将 OpenAI 的 Agents API 视为代理基础设施的可信替代方案——从价格、治理和 MCP 支持三方面评估两个平台。为 9 月 14 日的速率限制下调预留预算。如果你使用 Windows 11 ARM64,请暂缓安装 KB5124012 累积更新——它会破坏 Cowork 沙箱虚拟机。
Anthropic 正以 IPO 的速度交付:分析、评估、治理、基础设施即代码,以及威胁披露,全部集中在同一周内。对工程领导者而言,问题与上周相同,只是更加响亮:你的路线图跟得上吗?
在 x.com/kkaminsk 关注每周 Claude 生态系统分析。