La fase de construcción de plataforma que comenzó la semana pasada se está acelerando. OpenAI publicó Codex CLI v0.146.0 con Agent Plugins, sesiones con nombre, bifurcación de hilos y Code Mode remoto sobre WebSocket — 222 commits por delante de v0.145.0. También publicó discretamente como código abierto el Codex Security CLI bajo licencia Apache 2.0, poniendo un escáner de vulnerabilidades basado en agentes en manos de los desarrolladores de forma gratuita. Anthropic respondió con Claude Opus 5, un modelo casi de nivel frontera a la mitad del precio de Fable 5 que se convirtió de inmediato en el modelo predeterminado de Claude Code. Y en el mundo de los pesos abiertos, 32 agentes de Kimi K3 encontraron 19 vulnerabilidades de día cero en Redis en 90 minutos — una demostración de que la investigación de seguridad agéntica ya no es teórica.
Este es nuestro desglose semanal de lo que importa en los modelos de OpenAI, el ecosistema de Codex y el panorama competitivo en general.
1. Codex CLI v0.146.0 — Agent Plugins, gestión de sesiones y ejecución remota
La versión del 29 de julio es la actualización estructuralmente más significativa del Codex CLI desde la estabilización del V2 multiagente en v0.145.0. Desplaza a Codex de ser una herramienta conversacional de terminal hacia algo más cercano a un sistema operativo de agentes.
Agent Plugins 1.0. Codex ahora reconoce un manifiesto raíz plugin.json que describe capacidades de agente reutilizables: metadatos portables, skills directas en skills/ y configuración MCP en mcp.json. Los plugins pueden publicarse a nivel de workspace, y Codex añadió marketplaces para Amazon Bedrock y Claude Code junto al suyo propio. La implicación arquitectónica es significativa: un paquete de plugin ahora puede viajar entre Codex, Claude Code y Bedrock sin reconfiguración por host. Lo que sigue siendo específico del host — hooks, permisos, elementos de UI — reside en una superposición de extensión separada dentro del mismo manifiesto. Este es el primer paso concreto hacia herramientas de agente portables entre plataformas competidoras.
Sesiones con nombre, hilos fijados y conversaciones laterales. /new y /clear ahora aceptan un nombre de sesión opcional. Los hilos importantes pueden fijarse para acceso rápido, y ctrl-/ alterna entre conversaciones laterales sin cerrar ni la conversación lateral ni el hilo principal. El estado de la sesión — mensajes enviados, respuestas finales, errores de turnos fallidos, tiempo de importación y ajustes de aprobación — persiste entre interrupciones, reproducciones, importaciones y bifurcaciones. La sesión se está convirtiendo en un objeto gestionado, en lugar de un búfer de desplazamiento adjunto a una ventana de terminal.
Bifurcación de hilos con historial paginado. Los hilos ahora pueden bifurcarse con historial completo paginado, incluidas bifurcaciones temporales que no saturan la lista de hilos. Esto permite la exploración paralela de distintos enfoques desde un contexto compartido — un flujo de trabajo que antes requería orquestación externa.
Code Mode remoto sobre WebSocket. El app-server de Codex puede conectarse a un host remoto de Code Mode mediante ws:// o wss://. Cuando se omite la bandera, inicia un host local como antes. Esto separa el plano de control del agente del plano de ejecución de código, lo que permite configuraciones de cliente ligero donde la interfaz local controla un host remoto más potente. Los equipos que ya aprovisionan estaciones de trabajo en la nube ya no necesitan un relay construido a mano para acceder a ellas.
Correcciones en el ciclo de vida de proxy y MCP. Los proxies configurados ahora se respetan en la autenticación, las descargas de plugins, la autorización MCP, la ejecución remota y las conexiones WebSocket. Las conexiones MCP permanecen activas ante cambios de autenticación y configuración — antes una fuente de fallos silenciosos de reconexión. Las skills proporcionadas por el ejecutor ahora son descubribles y legibles desde la sesión, con advertencias cuando las restricciones del presupuesto de contexto obligan a truncar skills.
2. Codex Security CLI — código abierto bajo Apache 2.0
OpenAI publicó discretamente @openai/codex-security en GitHub y npm entre el 28 y el 29 de julio. Hacker News lo encontró antes del anuncio oficial. El paquete tiene licencia Apache-2.0 e incluye un CLI, un SDK de TypeScript, un Dockerfile y flujos de trabajo de GitHub Actions para la integración en CI.
Qué hace. Codex Security construye un modelo de amenazas específico del repositorio, explora rutas de ataque realistas, valida los hallazgos en un sandbox aislado y propone parches para revisión humana. Admite escaneos de repositorio completo, revisiones de rutas específicas, escaneo de diffs de Git, inspección del árbol de trabajo y escaneos masivos de muchos repositorios mediante entrada CSV. El historial de escaneos persiste en SQLite, lo que permite el seguimiento longitudinal de hallazgos: una vulnerabilidad detectada el lunes conserva su identidad cuando el escaneo del viernes revisita la misma ruta de código.
Salidas e integración en CI. Los escaneos completados generan report.md, findings.json, coverage.json y un manifiesto de escaneo. Los formatos de exportación incluyen SARIF, JSON y CSV, lo que significa que los resultados se integran directamente en GitHub Code Scanning, Azure DevOps o cualquier panel de seguridad existente. La bandera --fail-on-severity devuelve un código de salida de error cuando los hallazgos superan un umbral, lo que permite usarla como compuerta de CI. Los Git hooks pueden escanear los cambios en staging antes del commit.
La salvedad. El cliente es código abierto; el cerebro no. Ejecutar un escaneo aún requiere acceso al servicio Codex Security del lado de OpenAI. El modelo predeterminado es gpt-5.6-sol con razonamiento extra-alto. El runtime requiere Node.js 22+, Python 3.10+ y acceso a Codex Security en tu cuenta de OpenAI. El código fuente es público; el backend del escáner sigue restringido a clientes Enterprise, Business y Education aprobados.
Comandos de un vistazo:
scan— repositorio completo,--path,--diffo árbol de trabajobulk-scan— muchos repositorios desde un CSV, con--workerspara paralelismoscans list/show/rerun/match/compare— historial y seguimiento de regresionesexport --export-format sarif— salida estructurada para herramientas de seguridadvalidate/patch— verificar hallazgos y generar correcciones propuestasinstall-hook— escaneo pre-commit de los cambios en staging
Para los equipos de ingeniería que ya han invertido en el ecosistema de OpenAI, esta es una adición significativa a los pipelines de CI/CD. Para los equipos que lo evalúan frente a herramientas SAST independientes, el acceso restringido y la dependencia de los modelos de OpenAI son las limitaciones clave.
3. ChatGPT Work — inscripción empresarial e incentivo de créditos
OpenAI abrió ChatGPT Work a clientes empresariales con un incentivo de créditos diseñado para impulsar la adopción. Los clientes empresariales pueden inscribirse hasta el 21 de agosto. Cada miembro del equipo que pruebe Work por primera vez dentro de las dos semanas posteriores a la inscripción recibe hasta $200 en créditos, válidos durante 14 días. Los clientes existentes contactan a su equipo de cuentas; los nuevos prospectos lo hacen a través del canal de ventas de OpenAI.
Esta es una jugada de adquisición de clientes para la superficie del agente Work, no un cambio de precios. Los créditos son por usuario, no por organización, lo que significa que el incentivo se alinea con la adopción individual en lugar de la compra al por mayor. Para los líderes de ingeniería que evalúan ChatGPT Work como herramienta de productividad, la ventana de créditos de 14 días es un período razonable para ejecutar un piloto con un flujo de trabajo real de principio a fin.
Assistants API — 26 días y contando. El cierre del 26 de agosto está a menos de cuatro semanas. No se publicará ninguna herramienta de migración automatizada. La Responses API junto con la Conversations API es el reemplazo, y ha alcanzado paridad de funciones total, incluidos deep research, las conexiones de herramientas MCP y computer use. Azure OpenAI sigue el mismo cronograma. El equipo de Fabric Data Agent de Microsoft recomienda migrar a MCP en lugar de reconstruir directamente contra la Responses API de OpenAI — una señal de que los socios de plataforma ya están construyendo en torno al panorama posterior a Assistants. Los equipos que aún están en la Assistants API deberían tratar esto como una migración P0 con fecha límite inamovible.
4. Anthropic — Claude Opus 5 y el stack de desarrollo
Anthropic publicó Claude Opus 5 el 24 de julio, y de inmediato se convirtió en el modelo predeterminado de Claude Code tanto en los planes Claude Max como en Claude Pro. El argumento es directo: inteligencia cercana a la de Fable 5 a la mitad del precio.
Precios y posicionamiento. Opus 5 cuesta $5/$25 por millón de tokens de entrada/salida — idéntico a Opus 4.8 y la mitad de los $10/$50 de Fable 5. El Artificial Analysis Intelligence Index puntúa a Opus 5 con 61, un punto por encima de Fable 5 y dos por encima de GPT-5.6 Sol. En Frontier-Bench v0.1 (codificación agéntica), Opus 5 más que duplica la puntuación de Opus 4.8. En CursorBench 3.2 con esfuerzo máximo, se sitúa a menos del 0.5% del pico de Fable 5 a la mitad del costo por tarea. En ARC-AGI-3, puntúa tres veces más que el siguiente mejor modelo.
Dial de esfuerzo. Una escalera de esfuerzo de cinco niveles (low, medium, high, xhigh, max) se establece por defecto en adaptativo. Con esfuerzo bajo, Opus 5 puntúa 62.8% en un benchmark compuesto a $2.55 por tarea — competitivo con Opus 4.8 a esfuerzo máximo (62.3% a $5.77). El modo rápido se ejecuta a $10/$50, aproximadamente 2.5× más rápido, y está disponible como vista previa de investigación en la Claude API.
Reducción del system prompt. Anthropic publicó nuevas guías de ingeniería de contexto que muestran que reducir el system prompt de Claude Code en más de un 80% no produjo una caída medible en el rendimiento de las evaluaciones de codificación. Esta es una señal para los desarrolladores de agentes: los system prompts verbosos tienen un costo real en tokens, y una poda agresiva puede ser segura.
Claude Code v2.1.219. Publicada el 24 de julio junto con Opus 5. El comando /fork ahora crea una sesión en segundo plano adecuada (con su propia fila en claude agents), mientras que la antigua ruta de subagente dentro de la sesión pasa a ser /subtask. Los límites por sesión siguen siendo 200 búsquedas web y 200 subagentes. Se mantiene el auto-backgrounding de MCP para llamadas de larga duración. El precio promocional de Claude Sonnet 5 ($2/$10 por millón de tokens) estará vigente hasta el 31 de agosto, tras lo cual pasará a $3/$15.
5. Panorama competitivo — seguridad agéntica, enjambres paralelos y el futuro sin estado de MCP
Kimi K3 — 32 agentes encuentran 19 vulnerabilidades de día cero en Redis
El investigador de seguridad Chaofan Shou desplegó 32 subagentes paralelos de Kimi K3 contra la base de código de Redis. Los agentes clonaron el repositorio de forma autónoma, construyeron harnesses de fuzzing personalizados, depuraron los crashes en GDB y produjeron exploits de prueba de concepto funcionales — encontrando 19 vulnerabilidades previamente desconocidas en aproximadamente 90 minutos, incluida una cadena de RCE autenticada construida en 27 minutos.
Redis publicó siete versiones de parches de seguridad el 23 de julio. Los bugs subyacentes están confirmados como reales; la cifra de 19 días cero y el tiempo de 27 minutos son autodeclarados y no han sido verificados de forma independiente. Un estudio conjunto del AISI del Reino Unido y el CAISI de EE. UU. publicado el mismo día encontró que Kimi K3 obtuvo un 32.2% en ExploitBench frente al 76.2% de modelos frontera estadounidenses sin nombrar, lo que añade contexto apropiado al titular.
La implicación para los equipos de seguridad: el descubrimiento agéntico de vulnerabilidades ya es demostrablemente posible con modelos de pesos abiertos a una escala que importa. La brecha entre los modelos propietarios de frontera y las alternativas de pesos abiertos para tareas de seguridad sigue siendo real, pero se está cerrando lo bastante rápido como para merecer una evaluación.
xAI — Flujos de trabajo de Grok Build con 1,024 agentes en paralelo
Grok Build de xAI ganó una capa de orquestación de Workflows. Una única solicitud en lenguaje natural se descompone en fases, cada una asignada a subagentes paralelos. La concurrencia predeterminada es de 128 agentes, con escala hasta 1,024 para los trabajos más grandes. Agentes “escépticos” independientes verifican los hallazgos antes de la consolidación. Los workflows se guardan como comandos slash reutilizables en .grok/workflows/.
El modelo subyacente grok-build-0.1 tiene un precio de $1/$2 por millón de tokens de entrada/salida — agresivamente barato. El acceso requiere SuperGrok ($30/mes) o X Premium+ ($40/mes), y las ejecuciones con 1,024 agentes requieren SuperGrok Heavy ($300/mes). xAI también lanzó complementos gratuitos de Grok 4.5 para Excel, Word y PowerPoint el 20 de julio, ampliando su superficie de acción hacia los flujos de trabajo de Office.
Especificación MCP — la revisión más grande desde su lanzamiento
La revisión de la especificación MCP del 2026-07-28 se publicó como el mayor cambio de protocolo desde el lanzamiento de MCP. Cambios clave: el núcleo del protocolo ahora es sin estado (stateless) — se eliminan el handshake initialize/initialized y el encabezado Mcp-Session-Id. Cada solicitud lleva su versión de protocolo y las capacidades del cliente en _meta. Las Multi Round-Trip Requests (MRTR) reemplazan las solicitudes iniciadas por el servidor. MCP Apps (interfaces HTML renderizadas por el servidor en iframes con sandbox) es ahora una extensión oficial. El marco de extensiones utiliza identificadores reverse-DNS con versionado independiente. La autorización se endurece en dirección a OAuth 2.0 y OpenID Connect. Una política formal de deprecación exige una ventana mínima de 12 meses.
Microsoft publicó el SDK de MCP para C# v2.0 implementando la nueva especificación, con compatibilidad hacia atrás para código v1. Para los equipos que construyen servidores MCP, el núcleo sin estado significa que la infraestructura HTTP ordinaria ahora puede enrutar tráfico MCP — sin necesidad de afinidad de sesión. Esta es una simplificación operativa significativa para load balancers, CDNs y API gateways.
Google — Gemini 3.5 Pro: cuarto fallo inminente
Gemini 3.5 Pro ya ha fallado tres ventanas de lanzamiento consecutivas — el objetivo original de junio, una fecha filtrada del 17 de julio y la ventana más amplia de julio. El catálogo de modelos de Google aún no lista ninguna entrada gemini-3.5-pro. La compañía ha dejado silenciosamente de nombrar fechas objetivo, e informes indican que en su lugar ha comenzado el preentrenamiento de Gemini 4. Los mercados de predicción ahora sitúan el lanzamiento a finales de julio o principios de agosto, con probabilidades significativas de otro fallo. La posición competitiva de Google en la carrera de modelos de frontera continúa erosionándose.
Reflexiones finales
Esta semana la capa de plataforma de agentes tomó forma concreta. Los Agent Plugins de Codex CLI v0.146.0 hacen que las herramientas sean portables entre plataformas — algo inédito en el ecosistema de agentes de codificación. El Codex Security CLI pone el escaneo de seguridad agéntico en manos de los desarrolladores, aunque el cerebro siga restringido. Los precios de Opus 5 sitúan la inteligencia de codificación de nivel frontera en $5/$25, reduciendo a la mitad el techo de costos para los equipos que estandarizan en Anthropic. Y el núcleo sin estado de la especificación MCP simplifica la historia de infraestructura para cada plataforma de agentes que depende de ella.
Tres acciones para los líderes de ingeniería esta semana: Primero, evalúa los Agent Plugins de Codex CLI v0.146.0 frente a las herramientas reutilizables de tu equipo — el formato de manifiesto multiplataforma es la primera historia de portabilidad creíble para las skills de agentes. Segundo, si tienes una cuenta Enterprise o Business de OpenAI con acceso a Codex Security, ejecuta un escaneo contra un repositorio de producción y compara los hallazgos con tu pipeline SAST existente. Tercero, si aún no has comenzado la migración de la Assistants API, te quedan 26 días — empieza ahora.
La era de la seguridad agéntica llegó esta semana. Ya sea 32 agentes de Kimi K3 encontrando días cero en Redis o Codex Security escaneando tu pipeline de CI, el mensaje es el mismo: el horizonte temporal para el descubrimiento de vulnerabilidades se está comprimiendo, y las herramientas para participar son cada vez más accesibles.
Sigue la conversación en X.