La semana del 12 al 19 de agosto de 2026 trajo la secuencia de lanzamientos más trascendente de SpaceXAI hasta la fecha. Grok 4.6 se lanzó el 12 de agosto con un AA Intelligence Index de 61 — igualando a GPT-5.6 Sol y ubicándose en tercer lugar a nivel mundial. Grok Bot entró en beta el 11 de agosto como compañeros de IA persistentes que comparten una sola computadora en la nube. Grok Imagine Image 2.0 se desplegó el 7 de agosto con edición por regiones y un ranking #2 en Arena. Detrás de los lanzamientos de productos, sin embargo, hay dos historias que exigen un escrutinio serio: el plan de Musk de entrenar a Grok con “la suma total de toda la información de SpaceX” — incluyendo la producción laboral de ~14,000–15,000 empleados sin exclusión voluntaria divulgada — y un informe de amenazas deepfake que vincula a Grok con el 87% de los archivos de ataques deepfake trazables en la primera mitad de 2026.

Este es nuestro análisis profesional de los acontecimientos que importaron esta semana.


Grok 4.6: Inteligencia frontera, precios agresivos, brechas reales

El 12 de agosto de 2026, SpaceXAI lanzó Grok 4.6, su nuevo modelo frontera insignia. El lanzamiento llegó unas cinco semanas después de Grok 4.5 y representa el posicionamiento competitivo más sólido de la empresa hasta la fecha — aunque el panorama de benchmarks es más matizado de lo que sugiere el marketing de xAI.

Arquitectura y entrenamiento

Grok 4.6 está construido sobre la misma base V9 de 1.5 billones de parámetros que Grok 4.5. Las mejoras provinieron enteramente del post-entrenamiento: una ejecución de entrenamiento suplementario más larga, un fine-tuning supervisado (SFT) y un reinforcement learning (RL) mejorados, y lo que xAI describe como un mayor comportamiento de auto-verificación en trayectorias de razonamiento largas. El modelo usa Grok 4.5 para regenerar trayectorias SFT en esfuerzos de razonamiento, harnesses de agentes y dominios que incluyen STEM, ingeniería de software y trabajo de conocimiento.

Especificaciones clave:

  • Ventana de contexto de 500,000 tokens — diseñada específicamente para tareas de agentes de horizonte largo
  • Corte de conocimiento: 1 de febrero de 2026
  • Entrada multimodal (texto + imágenes), salida solo de texto
  • Cuatro niveles de esfuerzo de razonamiento: low / medium / high (predeterminado) / xhigh (nuevo)
  • Herramientas nativas: function calling, búsqueda web, búsqueda en X, ejecución de código, salidas estructuradas
  • APIs Responses y Chat Completions compatibles con OpenAI
  • Prompt caching (75% más barato en entrada en caché) y compactación de contexto para loops de agentes largos

Rendimiento en benchmarks

Grok 4.6 muestra números sólidos, pero el panorama varía significativamente según la carga de trabajo:

BenchmarkGrok 4.6Grok 4.5GPT-5.6 Sol MaxClaude Fable 5 Max
AA Intelligence Index61566162
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
Terminal-Bench v3.026%15.7%34.6%34.1%
GPQA Diamond94.9%~94%
GDPVal-AA v21753152617281741
AA-Briefcase Elo1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%
Databricks OfficeQA Pro63.2%
APEX-Agents57.5%47.1%56.7%59.2%

Grok 4.6 iguala a GPT-5.6 Sol en el AA Intelligence Index (61 vs. 61) — una puntuación compuesta que pondera inteligencia, velocidad y costo. Supera a GPT-5.6 Sol en CursorBench (69.9% vs. 67.2%), GDPVal-AA (1753 vs. 1728), AA-Briefcase (1577 vs. 1502), APEX-Agents (57.5% vs. 56.7%) y Harvey LAB (15.8% vs. 2.5%). El resultado de Harvey LAB — una ventaja de 6× en la evaluación de trabajo profesional legal — es particularmente llamativo, aunque puede reflejar una optimización específica del benchmark más que una ventaja general de razonamiento legal.

Frente a Claude Fable 5 Max, el panorama cambia. El modelo de Anthropic lidera en el AA Intelligence Index (62 vs. 61), Terminal-Bench (34.1% vs. 26%), DeepSWE (70% vs. 65.9%), APEX-SWE (58.8% vs. 56.4%) y FrontierCode (63.6% vs. 61.3%). Grok 4.6 gana en GDPVal-AA, CursorBench, AA-Briefcase y Harvey LAB. El patrón es claro: Grok 4.6 sobresale en trabajo de conocimiento y tareas sensibles al costo; Anthropic conserva la ventaja en ingeniería de software y terminal agéntica.

Un resultado notable: xAI afirma ser #1 en CursorBench 3.2 para codificación del mundo real según una fuente, aunque Claude Fable 5 Max registra una puntuación más alta (70.5% vs. 69.9%) en otros reportes — la discrepancia probablemente refleja diferentes configuraciones del benchmark o condiciones de evaluación.

Precios: la cuña competitiva

La estructura de precios de Grok 4.6 es su arma competitiva más afilada:

NivelEntradaEntrada en cachéSalida
Standard (<200K tokens)$2/M$0.50/M$6/M
Long-context (≥200K tokens)$4/M$1/M$12/M

Comparado con GPT-5.6 Sol a $5/$30 por millón de tokens, Grok 4.6 cuesta aproximadamente el 40% del precio de entrada y el 20% del precio de salida. Frente a Claude Fable 5 Max, el ahorro alcanza el 80–88%. Este es el precio de modelo frontera más agresivo del mercado.

Un detalle crítico: cruzar el umbral de 200K tokens de prompt reprecia toda la solicitud a la tarifa más alta de contexto largo — no solo los tokens por encima de 200K. Las empresas que operan cerca de ese límite deberían diseñar sus prompts cuidadosamente para evitar una escalada de costos accidental.

La eficiencia de costos en ejecuciones de Artificial Analysis muestra a Grok 4.6 completando tareas a aproximadamente $0.66–0.84 por tarea — 32–73% más barato que los equivalentes de GPT-5.6 Sol o Fable 5. Las evaluaciones de ejecución larga promediaron ~53 turnos y ~500M de tokens de entrada, frente a ~103 turnos y ~2B de tokens para Claude Opus 5 Max, lo que sugiere una eficiencia materialmente mejor en cargas de trabajo de agentes sostenidas.

Disponibilidad

Grok 4.6 se lanzó con disponibilidad el mismo día en:

  • xAI API, Cursor, Grok Build, Grok Bot, OpenRouter, Vercel, Cloudflare (12 de agosto)
  • GitHub Copilot (14 de agosto) — añadido a los niveles Pro, Pro+, Max, Business y Enterprise en VS Code, Visual Studio, Copilot CLI, JetBrains, Xcode, Eclipse y cloud agent

La integración con GitHub Copilot es significativa: pone a Grok 4.6 frente a la enorme base de desarrolladores de GitHub a las 48 horas del lanzamiento. Los suscriptores de SuperGrok ($30/mes) obtienen acceso dentro de Grok Build, y una promo de la primera semana ofreció 2× de uso incluido en Cursor y Grok Build.

Advertencias

Varias advertencias matizan los números destacados:

  • Varias tablas de benchmarks son reportadas por el proveedor; la afirmación de “igualar a GPT-5.6 Sol” aparece en algunos medios como aseveración propia de xAI en lugar de verificación independiente
  • Algunos revisores señalan latencia lenta del primer token — un problema significativo para flujos de trabajo de codificación interactivos
  • Persisten brechas en benchmarks de codificación frente a los mejores modelos, particularmente en Terminal-Bench y DeepSWE
  • El giro hacia el posicionamiento empresarial es deliberado: SpaceXAI llama a Grok 4.6 “el primer modelo de SpaceXAI construido desde cero para agentes de larga duración” — un pivote del chatbot de consumo a la plataforma de agentes empresariales

Grok Bot: compañeros de IA persistentes — y una brecha en la arquitectura de seguridad

El 11 de agosto de 2026, SpaceXAI lanzó Grok Bot en beta — su entrada en la categoría de “AI teammate”. El producto propone agentes de IA siempre activos que inician sesión en las herramientas del cliente, trabajan entre aplicaciones y completan trabajos de múltiples pasos sin supervisión continua.

Lo que se lanzó

Cada Bot es un agente persistente con nombre en una computadora en la nube (una VM de Linux con navegador, sistema de archivos y terminal) que sigue trabajando después de que cierras tu laptop. Los Bots inician sesión en tus apps existentes con tus credenciales, usando computer-use para manejar UIs que carecen de APIs limpias — Gmail, Slack, CRMs y herramientas similares.

Capacidades clave:

  • Aprendizaje por demostración: Observa una tarea una vez; el Bot la guarda como una rutina que se dispara con un horario o un disparador de evento (hasta ~50 rutinas por Bot)
  • Coordinación bot-a-bot: Varios Bots pueden enviarse mensajes entre sí, compartir contexto en hilos y coordinarse en chats grupales — pasándose trabajo y asignando responsabilidades entre ellos
  • Contexto persistente: Los Bots retienen información entre conversaciones, aprendiendo preferencias y casos límite con el tiempo
  • Disponibilidad de plataformas: macOS, Windows, Linux, iOS (Android “próximamente”); acceso empresarial vía lista de espera con SSO, SCIM y RBAC

El modelo subyacente pasó de Grok 4.5 al inicio de la beta a Grok 4.6 después del 12 de agosto.

El problema de la computadora compartida

El detalle más trascendente del lanzamiento de Grok Bot es la brecha entre el marketing y la documentación sobre la arquitectura de seguridad.

La página de lanzamiento afirma: “Los Bots tienen su propia computadora”. Esta redacción implica aislamiento — que cada Bot opera en su propio entorno sandbox con credenciales separadas y un radio de impacto contenido.

La propia documentación de xAI dice lo contrario. Según la página de descripción general de Grok Bot: “Todos tus Bots usan la misma computadora persistente en la nube”. La computadora está aislada para tu cuenta, no para Bots individuales. Cada Bot obtiene su propia pantalla en esa máquina, pero los archivos, las sesiones de navegador y las credenciales de línea de comandos se comparten en todo el roster de Bots.

La documentación lo afirma explícitamente:

“No uses Bots separados como frontera de seguridad.”

Esto significa que una credencial que un Bot establece — un inicio de sesión, una API key, un token de sesión — es accesible para todos los demás Bots de la misma cuenta. La eliminación de un Bot es blanda: eliminar un Bot quita su perfil, conversación y rutinas, pero los archivos e inicios de sesión en la computadora compartida pueden persistir, alcanzables por el resto del roster hasta que se revoquen en el origen.

Para la evaluación empresarial, esta arquitectura es defendible — permite que los Bots se pasen trabajo entre sí de forma económica — pero requiere tratar todo el roster de Bots como una única superficie de identidad. Cualquier revisión de seguridad debe modelar el acceso como “todo lo que cualquier Bot puede alcanzar” en lugar de una contención por Bot. El lenguaje de marketing hace más difícil comunicar esto a las partes interesadas que razonablemente infieren aislamiento a partir de “su propia computadora”.

Precios y acceso

Grok Bot no tiene un precio independiente. El acceso se incluye en tres niveles de suscripción existentes:

NivelPrecioProveedor
SuperGrok Heavy$300/mes (promo de $99 por 3 meses)SpaceXAI
Cursor Ultra$200/mesCursor
Cursor Teams Premium$120/asiento/mesCursor

xAI lo llama “beta temprana” con límites de uso. Musk dijo que el acceso se ampliará después de las correcciones. El acceso empresarial (SSO, SCIM, RBAC) está detrás de una lista de espera.

La estrategia de distribución es notable: Grok Bot viaja dentro de suscripciones que los clientes ya pagan, atando la estrategia de agentes de SpaceXAI a la infraestructura de Cursor — reflejando la adquisición de Cursor (Anysphere) por parte de SpaceX por $60B en junio de 2026.


Grok Imagine Image 2.0: edición por regiones, ranking #2 en Arena

El 7 y 8 de agosto de 2026, SpaceXAI desplegó Grok Imagine Image 2.0 como el nuevo Quality Mode en grok.com/imagine y en las apps de iOS y Android. El modelo aparece en Arena bajo el nombre de SpaceXAI.

Nuevas capacidades

  • Edición por regiones: Una herramienta de varita mágica edita la región que señalas y deja el resto intacto; la segmentación selecciona áreas precisas; la eliminación de fondo exporta cualquier sujeto con fondo transparente
  • Combinación multi-referencia: Hasta 5 imágenes de entrada pueden usarse en una sola generación (3 según una fuente), eliminando la necesidad de composición manual
  • Un solo modelo para generación y edición — sin flujos de trabajo separados
  • Niveles de resolución 1K/2K, 13 relaciones de aspecto
  • Templates: Puntos de partida listos para flujos de trabajo comunes — edición de fotos, tomas de producto, headshots, iconos, assets de juegos

Ranking en Arena y un matiz de marketing

Image 2.0 ocupa el #2 a nivel mundial tanto en el leaderboard de Arena Text-to-Image (Elo ~1,320) como en el de Arena Image Edit (Elo ~1,439) al 7 de agosto — detrás del GPT Image 2 de OpenAI (1,380 / 1,463). Una fuente reporta que después fue desplazado al #3 por el MAI-Image-2.6 de Microsoft.

Un matiz de marketing que vale la pena señalar: la entrada #2 en Arena es la variante de cómputo “low” (grok-imagine-image-2 (low)); la variante de calidad ocupa un puesto más bajo en los leaderboards. El “Quality Mode” orientado al consumidor usa el modelo de mayor cómputo, por lo que los usuarios que obtienen el mejor resultado no necesariamente están usando el modelo que ganó el ranking. Esto no es engañoso — los rankings de Arena reflejan lo que se envía — pero enturbia la afirmación competitiva.


Grok 4.7: entrenamiento con datos de SpaceX y una tormenta de privacidad

De cara al futuro, Musk usó una reunión all-hands (publicada públicamente en X) para anunciar que Grok 4.7 está en entrenamiento suplementario con “una cantidad masiva de datos de la empresa SpaceX” y estará “listo en 3 a 4 semanas” — apuntando a principios o mediados de septiembre de 2026. Especificaciones reportadas (sin confirmar, sin model card): ~2.1T de parámetros vs. 1.5T para 4.6.

Musk afirma que Grok 4.7 “superará a todos los modelos actuales” y que le “sorprendería que cualquier modelo fuera mejor en ingeniería del mundo real” dado el corpus único de SpaceX — telemetría de Starlink, logs de motores Raptor, datos de reentrada de Starship y artefactos de Slack/Jira/GitHub/ERP.

El problema de los datos de los empleados

La controversia no es sobre el modelo. Es sobre los datos de entrenamiento.

Musk les dijo a los empleados de SpaceX que Grok será entrenado con “la suma total de toda la información de SpaceX” — añadiendo: “Así que en cierto modo, será entrenado con ustedes. Ustedes serán efectivamente los padres de la IA”.

Lo que falta en este anuncio:

  • Sin divulgación de qué categorías de datos se incluyen (comunicaciones, logs, métricas, datos de comportamiento)
  • Sin mecanismo de exclusión voluntaria descrito
  • Sin protocolos de privacidad sobre cómo se recopilan, filtran o protegen los datos
  • Sin limitaciones de alcance — “suma total” implica todo, incluidas las comunicaciones internas y los patrones de toma de decisiones

Aproximadamente 14,000–15,000 empleados de SpaceX están potencialmente dentro del alcance. El panorama legal no está definido: la doctrina de work-for-hire cubre la producción laboral, pero la captura conductual continua (pulsaciones de teclas, patrones de decisión, metadatos de comunicación) se encuentra en una zona gris. Los empleados de SpaceX no pueden presentar cargos ante la NLRB debido a una brecha jurisdiccional, según el reporte de TechTimes.

El precedente de Meta

El paralelo más cercano es la Model Capability Initiative de Meta (abril de 2026), que capturó pulsaciones de teclas, clics de ratón y capturas de pantalla de los empleados para entrenar modelos de IA internos. El resultado:

  • ~1,600 empleados firmaron una petición oponiéndose al programa
  • Un incidente SEV 2 en junio cuando datos privados se filtraron a toda la empresa
  • El programa fue pausado después de la filtración

SpaceXAI no ha abordado si estudió el fracaso de Meta o implementó salvaguardas contra resultados similares. La ausencia de cualquier marco de gobernanza divulgado — combinada con el encuadre público y expansivo de Musk — crea un riesgo regulatorio y reputacional real. La Comisión Europea, el AG de California y las autoridades del Reino Unido y Australia ya han abierto investigaciones sobre X y Grok por asuntos separados.

Preguntas de gobernanza que las empresas deberían hacerse

Para cualquier empresa que evalúe modelos de SpaceXAI, el programa de entrenamiento de SpaceX plantea preguntas de gobernanza que van más allá de la controversia inmediata:

  1. Procedencia de los datos: ¿Puede SpaceXAI certificar que los modelos distribuidos vía API no fueron entrenados con datos conductuales de empleados obtenidos de forma indebida?
  2. Exposición regulatoria: Si las investigaciones encuentran que el programa de entrenamiento violó leyes de privacidad en alguna jurisdicción, ¿cuál es el camino de remediación para los clientes que usan esos modelos en producción?
  3. Infraestructura de consentimiento de empleados: ¿Tiene SpaceX un marco para el consentimiento informado en el entrenamiento de IA, o es “ustedes serán los padres de la IA” la totalidad de la divulgación?

Estas no son preocupaciones hipotéticas. Son preguntas de due diligence de procurement que cualquier equipo de cumplimiento debería hacerse antes de comprometerse con Grok como dependencia de producción.


La crisis de los deepfakes: Grok vinculado al 87% de los ataques trazables

El dato más alarmante de esta semana proviene del Deepfake Threat Report H1 2026 de Resemble AI, publicado el 12 de agosto.

Los números

  • 821 ataques deepfake documentados a partir de 1,760 reportes de noticias
  • ~3.46 millones de archivos sintéticos generados
  • ≥15,736 víctimas confirmadas
  • Alcance mediático de seis meses: 292.8 mil millones de impresiones — casi igual a todo 2025 (296.4B)
  • 87% de los archivos trazables atribuidos a Grok
  • 1 de cada 6 ataques (137) involucró imágenes íntimas no consensuales (NCII) de adultos o menores

La escala es asombrosa. El dominio de Grok en el panorama de deepfakes trazables — 87% de los archivos donde se pudo identificar el modelo generador — refleja tanto la posición de mercado de Grok como la relativa accesibilidad de sus herramientas de generación de imágenes. El informe no alega que xAI pretenda o facilite estos usos; la atribución se basa en el fingerprinting técnico de los archivos generados.

Múltiples reguladores han abierto investigaciones:

  • Comisión Europea — investigando a X y Grok bajo las disposiciones de la DSA
  • AG de California — examinando el cumplimiento de las leyes estatales de deepfakes y NCII
  • Reino Unido y Australia — investigaciones separadas sobre las prácticas de la plataforma Grok

La exposición civil estatutaria se estima en ~$2.24 mil millones bajo 15 U.S.C. §6851 para empresas que permiten o distribuyen imágenes no consensuales.

Advertencias metodológicas

El informe se basa únicamente en incidentes reportados públicamente y archivos trazables. Es probable que los números reales sean más altos. Resemble AI también lanzó DETECT-World, un modelo de detección diseñado para identificar contenido sintético de generadores no vistos — una herramienta defensiva útil, pero que aborda los síntomas en lugar de las causas raíz.

Lo que esto significa para las empresas

El informe de deepfakes no significa que las empresas deban evitar Grok. Sí significa que cualquier organización que use las capacidades de generación de imágenes de Grok necesita:

  • Políticas de uso aceptable que prohíban explícitamente los medios sintéticos de personas reales sin consentimiento
  • Monitoreo de salidas del contenido generado que pueda violar las leyes de NCII o difamación
  • Evaluación de riesgo del proveedor que contemple la infraestructura de moderación de contenido de xAI (o su ausencia)
  • Planes de respuesta a incidentes para deepfakes rastreados hasta el uso de la API de la organización

Adyacente: la ronda de $1.1B de River AI

Vale la pena señalar esta semana: River AI, fundada por Igor Babuschkin (cofundador de xAI; ex-DeepMind/OpenAI), recaudó $1.1 mil millones en financiamiento seed + Serie A con una valoración post-money de ~$5B. La ronda fue co-liderada por General Catalyst y AMP PBC, con participación de Nvidia, AMD Ventures, Temasek, Y Combinator y a16z.

River AI tiene solo dos meses y aún no tiene producto. La propuesta: IA personal y empresarial de pesos abiertos, propiedad del usuario e inferible localmente. La financiación es notable porque Babuschkin ayudó a diseñar el Grok original — y su salida de xAI, seguida de una megafinanciación inmediata para un competidor de pesos abiertos, señala que el mercado de modelos frontera está lejos de estar definido. El roster de inversores (Nvidia, AMD Ventures) también sugiere que las empresas de hardware están cubriendo sus apuestas en los ecosistemas de modelos abiertos y cerrados.

Contexto competitivo: Qwen 3.8-Max lanzó pesos abiertos el 12 de agosto (licencia personalizada, no Apache; visión + 1M de contexto solo API). DeepSeek V4 Pro recibió una actualización de API. Meta lanzó Muse Glimmer 30B (Apache 2.0). El ecosistema de pesos abiertos continúa produciendo alternativas creíbles a los modelos frontera cerrados.


Qué vigilar

  • Cronología del lanzamiento de Grok 4.7: El objetivo de “3 a 4 semanas” de Musk sitúa el lanzamiento a principios o mediados de septiembre. Observa si la controversia del entrenamiento con datos de SpaceX fuerza alguna divulgación o cambio de gobernanza antes del lanzamiento. Aún no existen detalles de model card, precios o ventana de contexto en docs.x.ai.
  • Gobernanza de los datos de empleados de SpaceX: Observa el rechazo de los empleados, la acción regulatoria o la divulgación por parte de SpaceXAI de marcos de gobernanza de datos de entrenamiento. El precedente de Meta (petición → filtración → pausa) es una trayectoria plausible.
  • Acción regulatoria sobre deepfakes: El informe de Resemble AI ha llamado la atención de los reguladores europeos, de California, del Reino Unido y de Australia. Observa acciones de cumplimiento específicas contra X o SpaceXAI, particularmente bajo la DSA o 15 U.S.C. §6851.
  • Benchmarks independientes de Grok 4.6: El modelo está listado para evaluación en LMArena. La validación independiente de benchmarks — especialmente en Terminal-Bench y DeepSWE, donde los números de xAI son más débiles — determinará si la puntuación compuesta se sostiene fuera del propio suite de evaluación de xAI.
  • Divulgación de seguridad de Grok Bot: La brecha entre “su propia computadora” y “una computadora compartida” saldrá a la superficie en las revisiones de seguridad empresariales. Observa si xAI actualiza su lenguaje de marketing, añade controles técnicos de aislamiento o publica un documento de arquitectura de seguridad.
  • Divulgación del modelo de Grok Bot: El silencio de xAI sobre qué modelo impulsa a Grok Bot es inusual. Si los Bots se ejecutan en un modelo más pequeño o más barato, el techo de capacidades y la economía de costos difieren de lo que los compradores pueden suponer.
  • Trayectoria de River AI: Con $1.1B y un fundador creíble, observa el primer lanzamiento de producto. Un modelo frontera de pesos abiertos de un ex arquitecto de xAI reconfiguraría el panorama competitivo.
  • Cascada de lockup de SpaceX: El primer tramo de desbloqueo de acciones de insiders comenzó el 6 de agosto, con tramos adicionales cada dos semanas hasta diciembre. La presión de venta moldea el rendimiento de la acción de SPCX y el apetito del mercado por el gasto en infraestructura de IA a la escala de capex actual de SpaceX ($18.4B de capex trimestral según la última llamada de resultados).

Sigue a Kevin Kaminski en X para actualizaciones diarias del ecosistema de IA. Vuelve la próxima semana para el siguiente xAI Weekly.