Las tres principales plataformas de codificación agentica — Claude Code CLI de Anthropic, Codex CLI de OpenAI y Gemini CLI de Google — han madurado hasta convertirse en herramientas de nivel productivo. Ya no son juguetes experimentales. Escriben código, ejecutan comandos de shell, gestionan flujos de trabajo de git y orquestan pipelines multi-agente en bases de código completas. Si eres un líder de TI empresarial y no estás evaluando estas herramientas, ya estás quedándote atrás.
En Big Hat Group, hemos estado implementando estos arneses de agentes en Windows 365 Cloud PCs gestionados a través de Azure e Intune para clientes empresariales. Esto es lo que hemos aprendido sobre la arquitectura de seguridad, los modelos de gobierno y las compensaciones prácticas que realmente importan para la automatización empresarial con IA.
Sandboxing y Seguridad: El Aislamiento a Nivel de SO No Es Negociable
La decisión arquitectónica más importante en cualquier sistema de codificación agentica es cómo aísla la ejecución del agente del sistema operativo anfitrión. Estas herramientas ejecutan comandos de shell arbitrarios. Si el sandboxing falla, un agente puede eliminar archivos, robar credenciales o exfiltrar datos.
Claude Code utiliza primitivas a nivel de SO — el framework Seatbelt de Apple en macOS y bubblewrap (seccomp + Landlock) en Linux — para imponer aislamiento de sistema de archivos y red a nivel de kernel. En Windows, donde estas primitivas nativas de Unix no están disponibles, Claude Code soporta sandboxing basado en Docker para lograr un aislamiento equivalente. Incluso si el agente se ve comprometido a través de inyección de prompts, el kernel del SO (o el límite del contenedor) bloquea el acceso no autorizado a archivos y conexiones de red. El tráfico de red se enruta a través de un proxy aprobado con listas de dominios permitidos, evitando la exfiltración de datos a servidores controlados por atacantes.
Codex CLI utiliza los mismos mecanismos Seatbelt y Landlock pero los configura de manera diferente según la política de aprobación seleccionada en tiempo de ejecución. Implementa un concepto de “workspace” donde el directorio actual y /tmp son el ámbito activo. En Windows, Codex también depende de contenedores Docker para sandboxing cuando las primitivas nativas del SO no están disponibles. Un detalle crítico: en entornos Docker containerizados, Codex reconoce que los mecanismos estándar de sandbox pueden no funcionar si el contenedor carece de soporte Landlock, y proporciona orientación explícita para configurar Docker adecuadamente o deshabilitar el sandboxing.
Gemini CLI adopta un enfoque más ligero, basándose principalmente en aislamiento de procesos y scripts proxy configurables (GEMINI_SANDBOX_PROXY_COMMAND) en lugar de aplicación a nivel de kernel del SO. En Google Cloud Shell, el sandboxing es manejado por la infraestructura de Google. En máquinas locales, el aislamiento es menos robusto que lo que proporcionan Claude Code y Codex.
El incidente de escape de sandbox de n8n hace esto concreto. Los investigadores encontraron que los controles de seguridad basados en sanitización en la plataforma de automatización de flujos de trabajo n8n podían eludirse mediante sintaxis JavaScript alternativa, llevando a un compromiso completo del servidor — robo de credenciales, exposición de variables de entorno y movimiento lateral a cuentas en la nube. La lección: el aislamiento de ejecución a nivel de SO es fundamentalmente más robusto que intentar filtrar entradas peligrosas en la capa de aplicación.
Conclusión empresarial: Para cualquier implementación donde los agentes ejecuten comandos en máquinas con acceso a credenciales de producción, recursos de red o código sensible, exige sandboxing a nivel de SO. En Windows — incluyendo Windows 365 Cloud PCs — el aislamiento basado en Docker es el enfoque estándar tanto para Claude Code como para Codex. El aislamiento a nivel de aplicación por sí solo es insuficiente. Claude Code y Codex proporcionan aplicación a nivel de kernel o contenedor; Gemini CLI no lo hace — todavía.
Modelos de Permisos: Fatiga de Aprobación vs. Postura de Seguridad
Los sistemas de permisos deben navegar una compensación brutal: demasiadas solicitudes causan fatiga de aprobación (los desarrolladores dejan de leer y auto-aprueban todo), mientras que muy pocas dejan operaciones destructivas sin supervisión.
Claude Code implementa un sistema escalonado con tres categorías: operaciones de solo lectura (sin aprobación necesaria), comandos bash (aprobados una vez por sesión) y modificaciones de archivos (aprobadas cada vez). Las reglas siguen una cadena de prioridad estricta denegar → preguntar → permitir, y las reglas de denegación siempre ganan. Puedes ser granular — Bash(npm run build) coincide solo con ese comando exacto. El modo bypassPermissions omite todas las solicitudes pero requiere un entorno seguro (contenedor CI/CD o VM de desarrollo), y Anthropic reporta una reducción del 84% en solicitudes de permisos solo mediante sandboxing cuando este modo está activo.
Codex CLI combina modos de sandbox con políticas de aprobación y distingue entre comandos confiables y no confiables. Las operaciones destructivas de git — force-push, anulaciones de configuración — requieren aprobación incluso en modo automático. Cualquier llamada a herramienta MCP que anuncie una anotación destructive requiere aprobación independientemente de otras configuraciones. La bandera --dangerously-bypass-approvals-and-sandbox (sí, ese es el nombre real de la bandera) existe pero explícitamente no se recomienda.
Gemini CLI tiene un sistema menos granular, funcionando a nivel de herramienta o servidor en lugar de por patrón de comando. Y aquí está la advertencia: en 2025, un agente de Gemini CLI eliminó un directorio de proyecto completo sin confirmación explícita del usuario. El agente técnicamente se mantuvo dentro de los límites de su sandbox, pero el usuario esperaba un mensaje de confirmación para operaciones destructivas del sistema de archivos. La brecha entre “técnicamente permitido” y “el usuario esperaba ser preguntado” es donde ocurre el daño real.
Conclusión empresarial: Implementa Claude Code o Codex en entornos que requieran control granular sobre operaciones destructivas. Configura reglas de denegación para comandos de alto riesgo a nivel de configuración gestionada para que los desarrolladores individuales no puedan anularlas. Trata el incidente de eliminación de Gemini como un caso de estudio en tu capacitación de gobierno y seguridad de IA.
Gestión de Contexto: CLAUDE.md vs AGENTS.md vs GEMINI.md
Cada plataforma utiliza archivos de configuración markdown para inyectar instrucciones específicas del proyecto en el contexto del agente. Las diferencias son más que cosméticas.
Los archivos CLAUDE.md siguen un modelo de descubrimiento jerárquico: global (~/.claude/CLAUDE.md), raíz del proyecto y luego anulaciones específicas de subdirectorios. Un directorio de API backend puede tener pautas especializadas que anulan las instrucciones padre solo para archivos en ese subárbol. Estos archivos se inyectan en el prompt del sistema al inicio. Claude Code soporta una ventana de contexto de 1 millón de tokens con Opus 4.6, permitiendo el análisis de arquitecturas completas de microservicios en una sola sesión.
AGENTS.md (Codex) sigue un patrón más simple: los archivos se fusionan desde la raíz del repositorio hasta el directorio de trabajo actual, cada uno apareciendo como un mensaje separado de rol de usuario en el historial de la conversación. Codex muestra a los desarrolladores exactamente qué instrucciones están activas. El sistema de skills añade paquetes de procedimientos reutilizables que se cargan solo cuando se invocan, evitando el desperdicio de tokens. Codex también soporta compaction — compresión automática del contexto del lado del servidor para sesiones de varias horas.
GEMINI.md refleja el enfoque jerárquico de Claude pero añade importaciones modulares mediante la sintaxis @file.md, permitiendo a los equipos dividir archivos de contexto grandes en componentes mantenibles. El comando /memory add agrega instrucciones persistentes entre sesiones, y /memory reload fuerza un nuevo escaneo después de ediciones.
Para equipos empresariales, la diferencia crítica es la aplicación de políticas. La capa de configuración gestionada de Claude Code permite a los administradores imponer restricciones a nivel de organización que los desarrolladores individuales no pueden anular. Codex incorpora la política en archivos AGENTS.md controlados por versión — excelente para visibilidad del desarrollador, más difícil para aplicación centralizada. Gemini ofrece un punto intermedio con archivos jerárquicos más memoria persistente.
Conclusión empresarial: Estandariza los archivos de configuración a nivel de proyecto (CLAUDE.md, AGENTS.md o GEMINI.md) en cada repositorio. Codifica tus estándares de codificación, requisitos de seguridad y pautas de revisión directamente. Para entornos regulados, la configuración gestionada de Claude Code proporciona la aplicación de políticas centralizadas más sólida para la IA agentica en operaciones de TI.
Orquestación Multi-Agente: La Ejecución en Segundo Plano lo Cambia Todo
Los flujos de trabajo de un solo agente chocan con un muro en tareas complejas. Las plataformas divergen marcadamente en cómo manejan el paralelismo.
Claude Code soporta ejecución de agentes en segundo plano real. Genera un sub-agente para una tarea de larga duración, presiona Ctrl+B para ponerlo en segundo plano y continúa trabajando con el agente principal. Monitorea todos los agentes en segundo plano a través de /tasks. Los sub-agentes se ejecutan en ventanas de contexto independientes con prompts de sistema personalizados, acceso a herramientas específicas y sus propios permisos. Los sub-agentes integrados incluyen Explore (descubrimiento de archivos), Plan (planificación estratégica) y agentes de propósito general. También puedes crear equipos de agentes para ejecución paralela sostenida en sesiones separadas — crítico para refactorizaciones de bases de código a gran escala.
Codex CLI implementa orquestación a través de CSV fan-out: spawn_agents_on_csv lee un archivo CSV y genera un sub-agente trabajador por fila. Un equipo de seguridad crea un CSV con una fila por componente, Codex genera un agente de revisión por componente y recopila todos los resultados en un CSV de salida. Los parámetros de configuración como agents.max_threads y agents.job_max_runtime_seconds evitan el agotamiento de recursos. Codex también implementa worktrees — checkouts aislados por Git que permiten que múltiples agentes trabajen en el mismo repositorio sin interferencia.
Gemini CLI aún carece de procesamiento nativo de tareas en segundo plano. Una solicitud de GitHub pidiendo esta función fue marcada como P1 (importante) después de que los usuarios informaran que el análisis de bases de código grandes que toma 20+ minutos bloquea todo el uso de la CLI. La solución alternativa — ejecutar múltiples pestañas de terminal con nohup — demuestra la carga operativa cuando el soporte en segundo plano no es nativo.
Conclusión empresarial: Para flujos de trabajo de automatización empresarial de IA que involucren revisión de código paralela, auditorías de seguridad o migraciones por lotes, los agentes en segundo plano de Claude Code y el CSV fan-out de Codex son patrones listos para producción. Gemini CLI aún no está listo para cargas de trabajo empresariales paralelas.
MCP e Integración de Herramientas: La Capa de Extensibilidad
El Model Context Protocol (MCP) es el mecanismo estandarizado para conectar agentes a herramientas, APIs y servicios externos. Las tres plataformas lo soportan, pero la madurez de implementación varía.
Claude Code trata MCP como un mecanismo de extensión principal. Tres tipos de transporte: stdio (procesos locales), HTTP (servidores remotos, recomendado) y SSE (obsoleto). Agregar un servidor MCP de GitHub es un comando: claude mcp add --transport http github https://api.githubcopilot.com/mcp/. Los flujos OAuth se activan automáticamente para servidores autenticados. Las integraciones comunes incluyen Sentry, PostgreSQL, Figma y herramientas internas personalizadas. La sustitución de variables de entorno mantiene las claves API fuera del control de versiones.
Codex CLI soporta MCP a través de la Responses API y lo extiende con el sistema de skills — paquetes de procedimientos reutilizables que invocan herramientas tanto integradas como externas. Las skills demostraron ser efectivas en Glean, donde agregar ejemplos negativos (“cuándo NO usar esta skill”) mejoró la precisión de enrutamiento en un 20%.
Gemini CLI implementa MCP con descubrimiento OAuth automático — detectando respuestas 401, descubriendo endpoints OAuth, realizando registro dinámico de clientes y manejando el flujo automáticamente. Esto reduce la sobrecarga de configuración. Sin embargo, una restricción notable: el uso de software de terceros para acceder a Gemini CLI más allá de las herramientas oficiales viola los términos de Google y puede resultar en suspensión de la cuenta.
En Big Hat Group, implementamos servidores MCP para Jira, Microsoft Graph y herramientas internas en entornos de clientes, permitiendo a los agentes crear tickets, enviar notificaciones y consultar documentación sin salir de la terminal.
Conclusión empresarial: MCP es el futuro de la integración de herramientas de consultoría de agentes de IA. Estandariza los servidores MCP para tus herramientas internas ahora. Claude Code y Codex tienen las implementaciones más maduras. Observa el descubrimiento OAuth automático de Gemini — es genuinamente inteligente y probablemente se convertirá en el patrón estándar.
Gobierno Empresarial: SOC 2, Pistas de Auditoría y Cumplimiento
La implementación empresarial exige pistas de auditoría, controles de cumplimiento y aplicación de políticas que van mucho más allá del uso individual del desarrollador.
Claude Code proporciona exportación de registros para Propietarios de Organización, control de acceso basado en roles que restringe el acceso a herramientas por rol de usuario y configuraciones gestionadas que imponen políticas a nivel de organización anulando preferencias individuales. El sistema de permisos escalonado se mapea directamente a objetivos de control SOC 2 en torno a gestión de acceso y control de cambios.
Codex CLI aborda el gobierno a través de la integración con pipelines CI/CD (GitHub Actions), archivos AGENTS.md controlados por versión (los cambios de política pasan por revisión PR) y orientación explícita de que la configuración generada por IA debe tratarse como código de producción con atribución clara a un desarrollador responsable.
La investigación de Teleport identificó que el cumplimiento SOC 2 para agentes de IA requiere registro centralizado con almacenamiento inmutable durante al menos un año, registros sincronizados en el tiempo, alertas automatizadas que correlacionen eventos contra umbrales de riesgo y flujos de trabajo de investigación documentados. Las organizaciones deben superponer gestión de riesgos específica de IA — evaluación de riesgos, gobierno del ciclo de vida, monitoreo continuo, red teaming — sobre los objetivos de control SOC 2 existentes.
Conclusión empresarial: Ninguna herramienta de codificación agentica cumple con SOC 2 de fábrica. Necesitas registro centralizado, pistas de auditoría inmutables, identidades de agentes con alcance definido y aplicación de políticas gestionadas. La capa de configuración gestionada de Claude Code es la más cercana a estar lista para gobierno y seguridad de IA empresarial. Construye tu marco de cumplimiento en torno a ella.
Qué Herramienta Cuándo: Recomendaciones Prácticas
Evitemos el “depende” — aquí está qué implementar dónde:
| Escenario | Recomendación |
|---|---|
| Migración/refactorización de bases de código grandes | Claude Code — contexto de 1M tokens, agentes en segundo plano, memoria estructurada |
| Automatización CI/CD y flujos de PR | Codex CLI — GitHub Actions nativo, creación de PRs, revisiones automatizadas |
| Exploración rápida y correcciones pequeñas | Gemini CLI — 1,000 solicitudes gratuitas/día, iteración rápida |
| Entornos regulados (SOC 2, HIPAA) | Claude Code — configuraciones gestionadas, aplicación de reglas de denegación, exportación de auditoría |
| Auditorías de seguridad por lotes | Codex CLI — CSV fan-out, un agente por componente |
| Trabajo arquitectónico de múltiples pasos | Claude Code — sub-agentes, ejecución en segundo plano, razonamiento profundo |
| Equipos sensibles al costo evaluando IA | Gemini CLI nivel gratuito → Claude Code Pro cuando estén listos para comprometerse |
Los equipos empresariales más inteligentes adoptan una estrategia multi-herramienta: Gemini CLI para escaneos rápidos y exploración (gratuito), Claude Code para decisiones arquitectónicas y ejecución compleja, Codex CLI para automatización integrada con GitHub. Empareja la herramienta con la tarea, no al proveedor con el contrato.
Tus Acciones Pendientes
Audita tus implementaciones actuales de agentes en busca de sandboxing a nivel de SO. Si los agentes ejecutan comandos en máquinas con credenciales de producción y sin aislamiento a nivel de kernel, arréglalo inmediatamente.
Crea archivos de contexto estandarizados (CLAUDE.md, AGENTS.md, GEMINI.md) para cada repositorio activo. Codifica tus requisitos de seguridad, estándares de codificación y pautas de revisión.
Implementa reglas de denegación para operaciones destructivas (eliminación de archivos, force-push, modificación de configuración) a nivel de configuración gestionada. No confíes en la disciplina del desarrollador.
Implementa servidores MCP para tus herramientas internas — ticketing, monitoreo, documentación. Esta es la capa de extensibilidad que hace que los agentes sean genuinamente útiles más allá de la generación de código.
Establece identidad de agente y registro de auditoría antes de escalar. Cada agente debe tener permisos con alcance definido y su propia identidad para atribución SOC 2.
Realiza un piloto con Claude Code en una base de código no crítica. Prueba agentes en segundo plano, orquestación de sub-agentes y aplicación de configuraciones gestionadas antes de implementar en equipos de producción.
Capacita a tu equipo sobre riesgos de inyección de prompts — tanto directa como indirectamente. La superficie de ataque incluye comentarios de Jira, documentación, descripciones de PR y cualquier contenido que los agentes procesen de forma autónoma.
Construye una biblioteca de skills para tu organización. Las skills son paquetes de procedimientos reutilizables — estándares de codificación, listas de verificación de revisión, flujos de trabajo de implementación, plantillas de auditoría de seguridad — que los agentes invocan cuando son relevantes. El sistema de skills de Codex mejoró la precisión de enrutamiento en un 20% en Glean una vez que se agregaron ejemplos negativos. Claude Code soporta sub-agentes personalizados con prompts especializados y acceso a herramientas. Codifica tu conocimiento institucional en skills para que cada agente opere con las mejores prácticas de tu equipo, no con valores predeterminados genéricos.
Adopta plugins para extensibilidad más allá del código. Los plugins extienden las capacidades del agente a dominios que le importan a tu equipo — flujos de trabajo de diseño a código (Figma), monitoreo de errores (Sentry), consultas de bases de datos (PostgreSQL/Supabase) y herramientas internas personalizadas. Las características de gobierno de plugins de Claude Code (eventos hook, controles de configuración, diálogos de confianza para configuraciones de servidor MCP) brindan a las organizaciones control sobre qué plugins se cargan y a qué pueden acceder. Trata la configuración de plugins con el mismo rigor que las dependencias de producción — revisa, controla versiones y audita lo que está instalado.
Obtén Consultoría Empresarial de Agentes de IA
Big Hat Group implementa arneses de codificación agentica en Windows 365 Cloud PCs con Azure e Intune para clientes empresariales. Manejamos la arquitectura de seguridad, los marcos de gobierno, la integración MCP y la aplicación de políticas gestionadas para que tus equipos puedan centrarse en construir.
Contáctanos para comenzar tu implementación empresarial de agentes de IA →
Relacionado: OpenClaw vs GitHub Copilot — Comparación Empresarial · Casos de Estudio