本周标志着 Claude 平台的一个拐点。Anthropic 发布了四项重要的 Managed Agents 能力,完成了 MCP 协议历史上最大规模的一次规范修订,并悄然跨过了一个业务里程碑——按当前势头,公司有望在十月以接近一万亿美元的估值进行 IPO。与此同时,Claude Code 的 auto 模式今日起成为默认设置——其 89% 的危险命令拦截率正在重塑关于 AI 编程安全性的讨论。

对于工程负责人而言,实际影响是立竿见影的:会话预算上限(session budget caps)改变了你管控 Agent 支出的方式,无状态 MCP 协议改变了你架构工具服务器的方式,而 Sonnet 5 于 8 月 31 日的涨价则改变了你的成本预测。让我们逐项拆解重点。

Managed Agents:会话预算、Advisor 与地理锁定

本轮 API 更新的核心是 8 月 7 日发布的四项 Managed Agents 新能力。它们共同回应了企业对 Agent 工作负载最关心的三大问题:成本可预测性、模型灵活性和数据驻留。

Session Budgets(会话预算) 在运维层面最具意义。你可以设定一个硬性的单会话支出上限——按公共列表价格以整美分计价——当会话达到预算时,它会以 budget_reached 停止原因暂停,而不是继续发起新的模型请求。检查发生在模型请求之间,因此正在执行中的请求会正常完成。每个线程最多只会超出一次模型请求的量。你可以提高或移除预算以恢复会话,但移除是单向操作——无法为现有会话重新添加上限。部署可以为启动的每个会话统一应用预算。

这是自 Managed Agents 上线以来企业一直要求的成本治理工具。不再有失控的 Agent 循环产生意外的 Token 账单。在创建会话时设定预算,平台便会强制执行。

Advisor Model(顾问模型) 为多 Agent 阵容增加了一个新角色。在任务执行过程中,会话可以就较难的步骤咨询另一个模型以获取第二意见——而无需将整个任务交给更强的模型。顾问模型的能力至少必须与 Agent 本身相当。配置只需一条 roster 条目。这实现了分层策略:成本效益高的模型处理大部分工作,仅在遇到真正困难的步骤时才咨询更强的模型。

Inference Geo-Pinning(推理地域锁定)inference_geo)控制模型推理实际运行的地点。可在创建 Agent 时于 model 对象内设置,或按会话覆盖,取值为 us(仅限美国,2026 年 2 月 1 日之后发布的模型按 1.1 倍计费)或 global(标准定价,在任意有容量的位置运行)。这直接回应了数据驻留要求——这是许多受监管行业的硬性门槛。

GitHub Skills Auto-Loading(GitHub Skills 自动加载) 补齐了整套能力。Managed Agents 会话现在可以直接从挂载的 GitHub 仓库加载 skills。位于 .claude/skills 根目录下的任何 skills 都会在会话启动时被自动发现,无需手动复制到 Agent 环境中。

MCP 2026-07-28:无状态协议修订

7 月 28 日定稿的 MCP 规范是协议发布以来最大的一次架构修订。核心转变在于:MCP 现在是一个完全无状态的协议。

initialize/initialized 握手已移除。Mcp-Session-Id 头已移除。每个请求都是自描述的——在 _meta 字段内联携带协议版本、客户端身份和客户端能力。可选的 server/discover RPC 取代了前置握手,供需要先了解能力再发起调用的客户端使用。

为什么这很重要:任何请求现在都可以落在普通轮询负载均衡器后面的任意服务器实例上。不再需要粘性会话,也不再需要开放的流。MCP 服务器可以作为一等 HTTP 工作负载部署到 serverless 和边缘基础设施上。

基于头的路由(Header-based routing) 放大了这一优势。Mcp-MethodMcp-Name 通过 Streamable HTTP 请求的 HTTP 头传输,因此网关、限流器和 WAF 无需解析 JSON 请求体即可进行路由和授权。标准 HTTP 基础设施现在可以原生处理 MCP 流量。

多往返请求(Multi-Round-Trip Requests,MRTR) 处理交互式工具工作流——确认、消歧——而无需持久流。工具可以在调用中途暂停、返回 input_required,客户端随后携带所需输入重试。这取代了依赖流的交互式提示机制。

可缓存的列表结果tools/listprompts/listresources/listresources/read 响应新增了 ttlMscacheScope 字段。客户端可以缓存工具目录,将冗余往返减少约 85%,并通过稳定的提示词缓存实现更快的重连。

在认证方面,该规范新增了 RFC 9207 签发方校验,从 Dynamic Client Registration 迁移到 Client ID Metadata Documents(CIMD),并引入 Enterprise Managed Authorization 扩展以支持集中式身份提供商管理。DCR 已正式弃用,预计在 2027 年夏季之后移除。

正式的弃用政策引入了至少 12 个月的过渡窗口。本版本弃用了三项功能:Roots(由显式工具参数取代)、Sampling(由直接调用 LLM 提供商 API 取代)以及 Logging(stdio 场景由 stderr 取代,云端由 OpenTelemetry 取代)。传统 HTTP+SSE 传输也已弃用。

各 SDK 的就绪程度不一。 C# SDK v2.0 于 7 月 28 日作为稳定版发布——向后兼容且默认无状态。Ruby 以 100% 符合率达到 Tier 2 的 v1.0 稳定版。TypeScript、Python、Go 和 Rust 处于 beta 阶段。Cloudflare 通过 Agents SDK v0.20.0 中的 createMcpHandler 提供了首发日支持,无需 Durable Objects 即可无状态地提供 MCP 工具。

这是一次真实的破坏性变更,且不向后兼容。12 个月的弃用窗口提供了喘息空间,但新实现应从第一天起就以无状态协议为目标。

Claude Code:Auto 模式成为默认

从今天(8 月 14 日)起,auto 模式成为 Pro、Max 和 Team 套餐中新建 Claude Code 会话的默认权限模式。Auto 模式使用分类器筛选工具调用,而非提示人工审批。Anthropic 报告其危险命令拦截率为 89%,而人工审批仅为 13.6%——这一反直觉的结果表明,人工审核者才是安全链条中的薄弱环节。

分类器的开销在 Pro、Max 和 Team 套餐上不再计费。Enterprise、API、Bedrock、Google Cloud 和 Microsoft Foundry 目前仍为可选加入。

8 月 6 日至 8 日期间发布了四个版本(v2.1.223 至 v2.1.226)。值得注意的新增功能包括跨会话 SendMessage——会话现在可以借助 ListAgents 发现机制跨机器互相发送消息。子 Agent 生成上限已移除。archive 插件源支持通过 HTTPS 使用基于 zip 的插件,并可选 SHA-256 校验。沙箱凭据掩蔽现已支持 JWT,并具备 AWS SigV4 重新签名能力。

另一个值得关注的独立进展:Anthropic 将 Claude 5 模型的 Claude Code 系统提示词缩减了 80% 以上,而内部编码评估没有任何可衡量的损失。六项上下文构建转变以基于判断的指导取代僵化规则,通过 skills 渐进式披露,并以自动记忆取代手动维护的 CLAUDE.md 文件。新的 claude doctor 命令可审计并简化 CLAUDE.md 文件。

Inference Hooks:提示词层面的企业 DLP

Anthropic 于 8 月 5 日以 Claude Enterprise beta 形式推出了 Inference Hooks——这是首个对组织发送给模型的内容进行原生内联控制的功能点。

当员工在受管界面(claude.ai、Claude Code、Claude Cowork)提交提示词时,Anthropic 会暂停流程,通过签名 HTTPS 将对话记录 POST 到组织配置的安全服务器,并在推理运行前等待允许/拒绝的裁决。被拒绝的请求永远不会到达 Claude。一个组织级配置即可覆盖 Web、桌面和 CLI 上的聊天、Claude Code 和 Claude Cowork。来自 MCP、skills 和插件的工具调用响应也会在 Claude 看到之前接受检查。

目前的限制相当明显:仅支持二元裁决(无法改写或脱敏);上线初期仅覆盖提示词侧(响应侧强制检查已列入计划);原始图片和文件不会发送检查(仅限文本);默认超时 5 秒。已命名的集成包括 Netskope、Palo Alto Networks、Proofpoint 和 Zscaler,同时支持自定义服务器。

发布控制包括影子模式(shadow mode,始终放行但记录决策)、基于角色的排除和基于百分比的灰度发布。该功能已捆绑进 Enterprise 套餐,价格为每席位每月 20 美元加用量费——不单独收费。

这是企业 DLP 领域值得关注的重头戏。没有任何其他主流 AI 厂商提供原生内联提示词检查。但目前的限制意味着它是一个基础框架,而非成品。

破坏性变更与截止日期

日期事项需要采取的行动
8 月 5 日(已过)Opus 4.1 从 API 永久移除迁移至 claude-opus-4-8;非默认 temperaturetop_ptop_k 将返回 HTTP 400
8 月 17 日旧版 Workbench 访问终止从 Console 导出已保存的提示词、变量和评估集
8 月 31 日Sonnet 5 首发定价结束:$2/$10 → $3/$15 每 MTok重新预测支出;新 tokenizer 使等效文本的 token 数增加约 10-35%
9 月 29 日Sonnet 4.5 拟定退役迁移至受支持的模型
10 月 15 日Haiku 4.5 拟定退役迁移至受支持的模型
11 月 24 日Opus 4.5 拟定退役迁移至受支持的模型

Sonnet 5 涨价尤其值得注意。从 $2/$10 到 $3/$15 每百万 token 的 50% 涨幅,还叠加了 tokenizer 变更——等效文本产生的 token 数将多出约 10-35%。对高用量 API 消费者的综合影响是实质性的。请在 8 月 31 日前提前执行批量任务,并在适用场景启用提示词缓存。

SDK 更新:周更节奏持续

Anthropic Python SDK 于 8 月 7 日发布 v0.121.0,包含全部四项 Managed Agents 能力、对话中工具变更 beta,并移除了已退役的 Opus 4.1 模型。v0.122.0 随后于 8 月 12 日左右发布,为 Dreams 带来 output_behavior,并修复了 Bedrock 流式传输和异步 AWS SigV4 签名的问题。TypeScript SDK 于 8 月 7 日发布 v0.116.0,轨迹与之同步。

Claude Agent SDK TypeScript(v0.3.214)和 Python(v0.2.126)均于 7 月 18-22 日发布,新增类型化的 model_usage、结果消息上的 terminal_reason,以及通过 'max' 实现的 effort 级别支持。

八个官方 MCP SDK 现在会在所有内存存储调用中发送 agent-memory-2026-07-22 beta 头,取代旧的 managed-agents-2026-04-01 头。关键行为变化:服务器定义的稳定排序、depth 限制为 0/1/省略,以及 path_prefix 必须以 / 结尾。旧头下的分页游标在新头下无效——必须从第一页重新开始。

更新节奏约为每周一次。请在生产环境固定版本并有计划地升级。

Anthropic 的 IPO 轨迹与算力建设

这些平台变更背后的商业背景值得了解。Anthropic 的 H 轮融资于 5 月筹集了 650 亿美元,投后估值达 9650 亿美元——超越 OpenAI 的 8520 亿美元。收入运行率从 2 月的 140 亿美元 ARR 增长到 5 月的 470 亿美元以上,三个月内翻了近五倍。

一份保密的 S-1 文件已于 6 月 1 日提交给美国证券交易委员会(SEC)。纳斯达克上市目标为 2026 年 10 月,承销商为高盛(Goldman Sachs)、摩根大通(JPMorgan)和摩根士丹利(Morgan Stanley)。部分投资方预计,基于 2026 年底前 1000-1200 亿美元的年化收入预期,IPO 估值可能超过 2 万亿美元。

支撑这一增长的算力建设规模前所未有。Anthropic 已与 AMD(最高 50 亿美元用于 2 GW 的 MI450 GPU)、SpaceX(每月 12.5 亿美元用于孟菲斯 Colossus 1,持续至 2029 年 5 月)、Amazon(数十亿美元级)、Google 加 Broadcom(多吉瓦级)、Volta Infra Holdings(100 亿美元、为期 6 年的挪威协议)、Riot Platforms(90 亿美元)达成协议,并与 Macquarie-GIC 合资成立 Theseus Infrastructure,Anthropic 作为锚定租户。Google 另提供了 350 亿美元贷款,用于在五个数据中心租赁芯片。Anthropic 承诺投入 500 亿美元建设美国定制数据中心,并正在组建自研芯片团队。

行动清单

  1. 为所有 Managed Agents 部署设置会话预算——这是本季度发布的最具影响力的成本治理功能。在部署层面应用,为每个会话设置上限。
  2. 现在就开始规划 MCP 2026-07-28 迁移——无状态协议是一次破坏性变更。12 个月的窗口相当宽裕,但新服务器应从第一天起就以此为目标。评估你的哪些 MCP 服务器使用了 Roots、Sampling 或 HTTP+SSE 传输——这三者均已弃用。
  3. 在 8 月 31 日前提前执行 Sonnet 5 批量任务——50% 的涨价叠加 tokenizer 变更会形成复合效应。启用提示词缓存。
  4. 在 8 月 17 日前导出 Workbench 资产——已保存的提示词和评估集将被永久删除。
  5. 评估 Inference Hooks 用于企业 DLP——如果你使用的是 Claude Enterprise,beta 现已可用。先从影子模式开始,了解你的安全服务器会拦截什么。
  6. 在生产环境固定 SDK 版本——周更节奏意味着不固定的依赖会逐渐漂移。使用 Python v0.121.0+ 或 TypeScript v0.116.0+ 以获得完整的 Managed Agents 功能集。
  7. 对 CLAUDE.md 文件运行 claude doctor——80% 系统提示词缩减策略同样适用于你的项目上下文。简化内容,让基于判断的指导取代僵化规则。

平台正在以不容忽视的速度变成基础设施。会话预算、无状态 MCP 和 auto 模式默认化都不是渐进式改进——它们是改变你构建 Claude 应用方式的架构级转变。十月的 IPO 将带来更多审视和更快的节奏。对工程负责人而言,问题在于:你的架构是否为两者都做好了准备。

关注 x.com/kkaminsk,获取 Claude 生态的每周分析。