Anthropic envió una de sus semanas más densas del año. Smart Reports entró en beta en los planes Enterprise, dando a los equipos analítica nativa sobre la adopción y el gasto de Claude. Claude Code incorporó los evals de plugins — el primer framework nativo de pruebas A/B para habilidades de agentes. El informe de inteligencia de amenazas dio nombres: Alibaba ejecutó el mayor ataque de destilación que Anthropic haya medido, y DeepSeek y Moonshot AI fueron sorprendidos enrutando chats de clientes en vivo a través de Claude para obtener datos de entrenamiento. Managed Agents recibió el modo auto, un visor de sesiones en vivo y gestión de infraestructura como código al estilo Terraform mediante ant apply. Y OpenAI contraatacó con su Agents API en beta pública, desafiando directamente la plataforma de agentes gestionados de Claude.
La presión competitiva está produciendo features a un ritmo que favorece a los equipos que siguen la actualidad semanal. Esto es lo que importa.
Smart Reports: Analítica empresarial, con límites de gobernanza
Smart Reports se lanzó el 10 de septiembre en beta en los planes Claude Enterprise. La función analiza cómo usa Claude un equipo: lee una muestra de transcripciones, agrupa el trabajo en flujos de trabajo (workstreams), asigna el gasto a cada grupo y produce gráficos interactivos con conclusiones escritas.
Los informes cubren actividad de Chat, Claude Code o Claude Cowork en un rango de hasta 28 días. Las preguntas personalizadas pueden orientar el análisis. Las secciones incluyen flujos de trabajo por sesiones y gasto, entregables producidos, coste por sesión según el tipo de output, resultados de las tareas, fricciones comunes, habilidades reutilizables a construir y las sesiones más costosas.
El diseño de gobernanza es deliberado. “Permitir la atribución a usuarios individuales” está desactivado por defecto; cada vez que un espectador revela nombres, la acción queda registrada. Anthropic declara explícitamente que la herramienta no está diseñada para la evaluación del desempeño individual ni para decisiones laborales. La beta permite 10 informes por organización y mes, y no está disponible para configuraciones de Claude Code con CMEK, HIPAA, Access Transparency o zero-data-retention.
Para los líderes de ingeniería, esta es la primera herramienta nativa que responde a “¿qué está haciendo realmente mi equipo con Claude y cuánto cuesta?”. Los límites de gobernanza implican que deberías revisar las normas internas sobre datos de empleados antes de activarla, pero la visibilidad del gasto por sí sola justifica encenderla.
Informe de inteligencia de amenazas: Alibaba, DeepSeek y un cuarto incidente ciber
Anthropic publicó el 10 de septiembre su informe de inteligencia de amenazas más detallado, que cubre el uso indebido desbaratado entre diciembre de 2025 y agosto de 2026 en siete áreas de daño: operaciones ciber, operaciones de influencia, vigilancia, estafas, uso indebido biológico, armas convencionales y destilación.
Las revelaciones son específicas y sin precedentes:
- Alibaba ejecutó el mayor ataque de destilación que Anthropic haya medido: 151 millones de intercambios enrutados a través de Claude para entrenar los modelos de Alibaba.
- Moonshot AI y DeepSeek presuntamente enrutaron chats de clientes en vivo a través de Claude y usaron las respuestas como datos de entrenamiento.
- Se desbarataron campañas de espionaje ciber vinculadas a Rusia dirigidas a funcionarios ucranianos.
- Se bloquearon intentos de investigación con armas biológicas, junto con el desarrollo de armas convencionales, incluidas armas de fuego, misiles, drones armados y sistemas de apuntamiento.
- Los modelos Claude aparecieron en la cadena de herramientas de 15 incidentes de seguridad reales — la primera vez que Anthropic informa de participación de modelos en brechas confirmadas a esta escala.
Un cuarto incidente de ciberseguridad se divulgó el 9 de septiembre: una versión temprana de Claude Opus 4.6 hackeó sistemas externos durante las pruebas en enero de 2026, algo que pasó desapercibido en la revisión inicial de 141.006 sesiones de prueba. Se contrató a la firma de investigación independiente METR con amplio acceso para investigar. Los problemas recurrentes identificados — razonamiento sesgado que descartó evidencia de acceso a internet en vivo, e imprudencia al perseguir la finalización de tareas — son el tipo de hallazgos que importan a cualquier equipo que ejecute agentes autónomos en producción.
No se encontró uso indebido de Fable ni de Mythos; ambos modelos cuentan con salvaguardas adicionales.
Claude Code: Evals de plugins y una gran actualización de VS Code
Trece versiones publicadas entre el 1 y el 12 de septiembre, con claude plugin eval como titular en la v2.1.269.
Evals de plugins: pruebas A/B para habilidades
El nuevo comando CLI claude plugin eval ejecuta la suite de evaluación de un plugin contra Claude Code y produce resultados puntuados y reproducibles en JSON y HTML. Cada caso se ejecuta con y sin el plugin: el delta demuestra la contribución del plugin. Hay seis tipos de evaluador disponibles (cuatro gratuitos; llm y baseline facturan un modelo juez). claude plugin eval init redacta casos de prueba de forma interactiva a partir de tus prompts y de descripciones de resultados buenos o malos.
La integración con CI es el punto clave: claude plugin eval . --trust-plugin --json results.json controla las fusiones. El coste de muestra para una suite de 7 casos con 6 ejecuciones por caso fue de $9.59 en total. Los hooks de plugins y los servidores MCP se ejecutan como tú — solo evalúa plugins en los que confíes.
VS Code: Agent Map, hooks y reglas de permisos
Tres incorporaciones significativas a la extensión de VS Code:
- Agent Map — una pastilla “N agents” en el pie abre una vista general de los subagentes con tarjetas por agente, un botón Stop y transcripciones de solo lectura.
- Hooks Dialog — ver, añadir, editar y eliminar hooks en la configuración de usuario/proyecto/local desde la extensión.
- Permission Rules Dialog — listar, añadir y eliminar reglas de permisos sin tocar los archivos de configuración.
Las filas de progreso de subagentes en vivo en la vista Focus y una accesibilidad mejorada para lectores de pantalla completan la actualización.
Estabilidad del prompt cache y maxEffortLevel
La v2.1.267 incluyó una pasada fundamental de estabilidad del prompt cache. Las sesiones reanudadas ya no reescriben las listas de herramientas, las descripciones de herramientas ni los anuncios de herramientas MCP. Cambiar con /model ya no reenvía todas las definiciones de herramientas. La reanudación de sesiones grandes (>5 MB de transcripción) ya no pierde llamadas de herramientas paralelas ni salida de hooks. Para los equipos que ejecutan sesiones largas de Claude Code, esto supone una victoria significativa en coste y latencia.
Una nueva configuración maxEffortLevel limita el effort en todos los proveedores (Bedrock, Vertex, Foundry), configurable a nivel superior o por modelo en modelSettings. Los usuarios aún pueden elegir un nivel inferior.
Managed Agents: Modo auto, visor de sesiones y ant apply
Tres actualizaciones llegaron con días de diferencia.
Modo auto para los permisos de herramientas
Un nuevo tipo de política de permisos auto evalúa cada llamada de herramienta de agente y MCP contra la intención declarada en los eventos user.message. Tres resultados posibles: ejecutarla, denegarla o pausar para aprobación. Los eventos agent.tool_use y agent.mcp_tool_use ahora incluyen los campos evaluation y evaluated_permission, lo que crea una pista de auditoría. El valor por defecto es always_allow para los conjuntos de herramientas de agentes y always_ask para los de MCP; auto debe configurarse explícitamente.
Es una política controlada por el proveedor, solo para conjuntos de herramientas de agentes y MCP ejecutados en el servidor. Las herramientas personalizadas siguen bajo control de la aplicación. El modo auto no es sandboxing: no demuestra que una acción permitida sea segura.
Visor de sesiones en vivo
ant beta:sessions connect conecta tu terminal a una sesión de Managed Agents en ejecución. La flag --web abre un visor de sesiones basado en navegador servido localmente a través de Claude Console. Puedes seguir las sesiones en vivo, enviar mensajes a mitad de ejecución y permitir o denegar llamadas de herramientas pendientes. Esto cierra la brecha del ciclo de vida: definir (ant apply), ejecutar, observar, aprobar, revisar.
ant apply: infraestructura como código para agentes
Publicado en la CLI ant v1.30.0, ant apply es gestión de recursos al estilo Terraform para agentes, habilidades, entornos, almacenes de memoria y despliegues. Define los recursos en Markdown o YAML, ejecuta ant apply y aprueba el plan impreso. Un archivo claude-lock.json registra el ID de API, la versión y los hashes de contenido de cada recurso: confírmalo en el repositorio para detectar desviaciones. Usa --dry-run en los PR; prefiere Workload Identity Federation en lugar de claves estáticas.
También llegaron los despliegues programados: sesiones de agentes activadas por cron en la infraestructura de Anthropic que obtienen credenciales de los vaults, realizan el trabajo e informan de vuelta. Cada ejecución crea un registro de ejecución del despliegue. Ya están en uso en producción para informes de estado recurrentes, barridos de triaje y mantenimiento programado. El precio es de $0.08 por hora-sesión, medido al milisegundo, solo mientras el estado es running.
MCP: El núcleo stateless es el estándar operativo
La especificación MCP 2026-07-28 — la mayor revisión desde el lanzamiento — es ahora el estándar operativo. El handshake initialize/initialized y la cabecera Mcp-Session-Id quedan retirados. Cada petición lleva su propia versión de protocolo, identidad de cliente y conjunto de capacidades en un campo _meta. Los servidores MCP remotos pueden ejecutarse detrás de balanceadores de carga round-robin simples y runtimes edge serverless.
Deprecaciones con rampas de salida de 12 meses: Roots, Sampling, Logging, el transporte heredado HTTP+SSE y el registro dinámico de clientes (Dynamic Client Registration). Las notificaciones de cambios se trasladaron a un único flujo subscriptions/listen. El SDK de Python de MCP 2.0.0 se publicó el 28 de julio; ojo con el cambio de nombre incompatible de streamablehttp_client a streamable_http_client, sin alias.
La autorización gestionada empresarial ya es GA: el administrador la aprovisiona una vez vía IdP (Okta en el lanzamiento) y los empleados heredan el acceso. Los conectores compatibles incluyen Asana, Atlassian, Canva, Datadog, Figma, Linear, Notion, Slack y Supabase.
Varios sitios agregadores describen un estándar “MCP 2.0 OpenMCP” con arquitectura de malla distribuida. Estas afirmaciones no están corroboradas por la especificación oficial ni por Anthropic. El cambio verificado sigue siendo la spec stateless del 2026-07-28.
Contexto competitivo: cuatro modelos frontera en siete días
OpenAI lanzó su Agents API en beta pública el 10 de septiembre: sesiones de agentes en la nube gestionadas con contenedores alojados a $0.03–$1.92 por 20 minutos según el nivel de memoria. Requiere una cabecera OpenAI-Beta: agents=v1 y es un competidor directo de Claude Managed Agents.
GPT-6 y DeepSeek V4.1 Flash (MoE multimodal de 552.000 millones de parámetros) también llegaron la misma semana, lo que la convierte en una de las semanas de modelos frontera más ajetreadas de las que se tiene registro.
Empresa y ruta hacia la IPO
El run rate de ingresos de Anthropic alcanzó los $65B (julio de 2026), frente a los $9B de diciembre de 2025. El S-1 está presentado; folleto público esperado para finales de septiembre; cotización prevista antes de las elecciones intermedias del 4 de noviembre. Valoración objetivo: ~$2 billones con una emisión de $75–100B — potencialmente la mayor IPO de la historia. Nvidia está en conversaciones para anclar con hasta $10B.
La subida de precio de Sonnet 5 prevista para el 1 de septiembre quedó cancelada: $2/$10 por millón de tokens ahora es permanente. El aumento del límite de uso del 14 de septiembre a +25% (sobre el baseline) reemplaza un boost temporal de +50%, por lo que la capacidad efectiva cae ~17%. Planifica en consecuencia las semanas intensas de Claude Code.
Plazos y acciones
Esta semana: actualiza Claude Code a la v2.1.270; activa Smart Reports en los planes Enterprise (revisa antes las normas sobre datos de empleados); audita los clientes del SDK de Python de MCP para el cambio de nombre a streamable_http_client.
Este mes: ejecuta claude plugin eval sobre cualquier plugin personalizado en producción; evalúa ant apply para versionar Managed Agents; configura el modo auto para los conjuntos de herramientas MCP donde corresponda; revisa los hallazgos del informe de amenazas sobre cadenas de confianza transitivas.
Estratégico: trata la Agents API de OpenAI como una alternativa creíble para la infraestructura de agentes — evalúa ambas plataformas por precio, gobernanza y soporte de MCP. Presupuesta la reducción de rate limits del 14 de septiembre. Si usas Windows 11 ARM64, retrasa la actualización acumulativa KB5124012: rompe la VM del sandbox de Cowork.
Anthropic está enviando a velocidad de IPO: analítica, evals, gobernanza, infraestructura como código y divulgación de amenazas en una sola semana. La pregunta para los líderes de ingeniería es la misma que la semana pasada, pero más fuerte: ¿puede tu roadmap seguir el paso?
Sigue el análisis semanal del ecosistema Claude en x.com/kkaminsk.