La semana del 29 de julio de 2026 estuvo dominada por un solo evento: la primera llamada de resultados pública de SpaceX el 4 de agosto, que destapó la mecánica financiera de la era SpaceXAI. Elon Musk aprovechó la llamada para esbozar una agresiva hoja de ruta de Grok — Grok 4.6 la próxima semana, Grok 4.7 en tres o cuatro semanas y Grok 5 antes de fin de año entrenado con todo el corpus de datos históricos de SpaceX. Fuera del foco de los resultados, Grok Voice Think Fast 2.0 completó su migración a producción y Grok Imagine Video 1.5 lanzó una importante actualización de funciones que añade generación de texto a video y salida 1080p nativa.
Aquí está nuestro análisis profesional de los acontecimientos que importaron esta semana.
La Primera Llamada de Resultados de SpaceX: $7.8B de Ingresos, $2.56B de IA y $18.4B de Capex
SpaceX celebró su primera llamada trimestral de resultados el 4 de agosto de 2026 — la primera divulgación financiera pública desde su IPO del 12 de junio bajo el ticker SPCX. Las cifras fueron llamativas:
- Ingresos del Q2 2026: $7.8 mil millones, un 92% más interanual, superando el consenso de los analistas de ~$6.8–6.9B
- Ingresos del segmento de IA: $2.56 mil millones, un 247% más interanual, incluyendo xAI y las suscripciones de Grok
- EBITDA ajustado: $3.5 mil millones, un 191% más interanual
- Pérdida neta: $541 millones, reducida desde ~$1B el año anterior
- Gastos de capital: $18.4 mil millones en un solo trimestre, casi siete veces más que los $2.8B de hace un año — impulsados abrumadoramente por la infraestructura de IA
La reacción del mercado fue negativa. Las acciones cayeron aproximadamente un 7% en las operaciones posteriores al cierre, principalmente por la cifra de capex. Dos días después, el 6 de agosto, el vencimiento del período de bloqueo libera aproximadamente mil millones de acciones de insiders — unos $106.4 mil millones al precio de cierre del lunes — con tramos adicionales desbloqueándose cada dos semanas hasta que el 100% esté desbloqueado en diciembre de 2026.
La IA como Segmento de Negocio Formal
SpaceX ahora reporta tres segmentos: Espacio (lanzamiento), Conectividad (Starlink) e IA. La división de IA — que abarca xAI, las suscripciones de Grok y el arrendamiento de cómputo — generó $2.56B en un solo trimestre. Para contexto, eso se anualiza en aproximadamente $10B+ de ingresos de IA, lo que sitúa el negocio de IA de SpaceXAI en la misma vecindad de ingresos que los proveedores establecidos de IA empresarial.
Gwynne Shotwell, Presidenta y COO de SpaceX, reveló en la llamada que el consumo de tokens se triplicó tras el lanzamiento de Grok 4.5 en julio. Esa métrica — el uso bruto del modelo — es el indicador más fuerte que xAI ha compartido hasta la fecha de que la adopción de Grok se está acelerando de forma material, incluso mientras la meseta de crecimiento de usuarios en 117 millones de usuarios activos mensuales (reportada a finales de julio) sugiere que la captación de consumidores se ha estancado.
La Historia del Capex: Exclusividad con Nvidia, 2 GW para Fin de Año
Musk confirmó en la llamada que SpaceX construirá sus centros de datos de IA exclusivamente sobre la arquitectura Nvidia Vera Rubin, calificándola como “actualmente el mejor computador de IA del mercado”. La hoja de ruta de cómputo es agresiva:
- Cómputo actual en línea: ~1.4 GW
- Objetivo para finales de 2026: 2 GW
- Objetivo para finales de 2027: 10–15 GW
Musk declaró que el cuello de botella ha pasado del suministro de GPU a la infraestructura de energía y refrigeración, y que la inversión de recursos se centrará allí de ahora en adelante.
El programa de satélites Starmind añade una dimensión espacial: SpaceX ha desarrollado conjuntamente cargas útiles de cómputo de IA con Nvidia para sus satélites Starmind AI 1, con cada satélite portando GPUs Nvidia Rubin y CPUs Vera. Se espera que el primer lote comience a lanzarse el año que viene, extendiendo el cómputo de IA a la órbita terrestre baja.
Plataforma de Preguntas y Respuestas para Inversores Impulsada por Grok
En una medida que atrajo una atención significativa, SpaceX prescindió de la plataforma estándar del sector SAY (utilizada por Tesla para sus llamadas de resultados) en favor de una herramienta de preguntas y respuestas para inversores construida a medida con Grok. La plataforma aceptó preguntas de los accionistas antes de la llamada, con Grok manejando la deduplicación, la agrupación de temas y la clasificación.
Esta es posiblemente la implementación empresarial de Grok más visible hasta la fecha — poniendo el modelo frente a analistas institucionales, accionistas minoristas y medios financieros simultáneamente. Si la herramienta funciona limpiamente, crea un caso de estudio que cualquier otra empresa pública podría adoptar. Las propias llamadas de resultados de Tesla, que actualmente dependen de SAY, se convierten en el siguiente candidato obvio.
Grok 4.6 Previsto para la Próxima Semana — Grok 5 Incorporará Todos los Datos de SpaceX
La llamada de resultados sirvió de plataforma para que Musk presentara la hoja de ruta de Grok más detallada hasta la fecha:
- Grok 4.6: Se espera “probablemente la próxima semana” (semana del 7 de agosto)
- Grok 4.7: “Unas tres o cuatro semanas a partir de hoy”
- Grok 5: “Antes de fin de año”
Grok 4.6 se describe como un modelo de 1.5 billones de parámetros con ajuste fino supervisado (SFT) y aprendizaje por refuerzo (RL) significativamente mejorados respecto a Grok 4.5. Los reportes secundarios han producido recuentos de parámetros contradictorios — algunas fuentes mencionan un “modelo 2T” — pero la caracterización más consistente según las propias declaraciones de Musk es 1.5T con mejoras de entrenamiento, no una arquitectura más grande.
Grok 4.7 se reporta como un modelo de 2.1 billones de parámetros que será “mejor en todos los aspectos excepto ligeramente más lento de servir”, con mayor eficiencia de tokens. Esto coincide con lo reportado la semana anterior.
El titular de la llamada fue la declaración de Musk sobre los datos de entrenamiento de Grok 5:
“Incorporaremos todo el corpus de datos de SpaceX… todos los datos que SpaceX haya producido jamás en el transcurso de un cuarto de siglo.”
Esto significa que los registros de lanzamiento de cohetes, la telemetría, los datos de fabricación, los datos de operaciones de satélites y los conjuntos de datos de ingeniería propietarios se alimentarán al pipeline de entrenamiento de Grok 5. Esta es la señal estratégica más clara hasta ahora de que la consolidación de SpaceXAI se trata de sinergia de datos, no solo de reestructuración corporativa — los datos de ingeniería propietarios de SpaceX se convierten en un foso competitivo duradero para las capacidades de IA de Grok.
La Verificación de la Realidad de la API
Al 5 de agosto, Grok 4.5 sigue siendo el último modelo documentado en la documentación oficial de SpaceXAI. No hay:
- ID de modelo público para Grok 4.6 en
docs.x.ai - Fila de precios en la documentación de la API
- Especificación de ventana de contexto
- Puntuaciones de benchmarks
La señal real de que Grok 4.6 se ha lanzado será una entrada grok-4.6 en el listado de modelos en docs.x.ai/developers/models. LMArena anunció el 29 de julio que Grok 4.6 aparecerá en los rankings de Arena la semana siguiente a su lanzamiento, lo que proporcionaría validación independiente de benchmarks.
Grok Voice Think Fast 2.0 Completa su Migración a Producción
El 5 de agosto de 2026, el alias grok-voice-latest cambió automáticamente de Grok Voice Think Fast 1.0 a Grok Voice Think Fast 2.0, completando un plan de migración que xAI anunció el 29 de julio. Cualquier desarrollador que no esté explícitamente fijado a grok-voice-think-fast-1.0 ahora está ejecutando 2.0.
Especificaciones
| Métrica | Think Fast 1.0 | Think Fast 2.0 |
|---|---|---|
| Índice de Calidad AA STS | 75.7% | 82.9% |
| Agentic τ-voice Bench | 52.1% | 56.5% |
| Tiempo hasta el primer audio | 1.25s | 0.70s |
| Tokens de razonamiento (P50) | Base | ~40% de 1.0 |
| Precio por minuto | $0.05 | $0.08 |
El modelo es un sistema speech-to-speech de extremo a extremo — audio de entrada, audio de salida — sin pipeline separado de ASR → LLM → TTS. Soporta 24+ idiomas, maneja condiciones telefónicas ruidosas y razona mientras habla sin latencia añadida. Las llamadas a herramientas pueden comenzar antes de que termine la primera frase.
La precisión de transcripción mejoró 1.4× respecto a 1.0 y 1.5–2× respecto a los principales modelos STT dedicados (Deepgram Nova 3, ElevenLabs Scribe v2) en el benchmark de 24 idiomas de xAI. En condiciones telefónicas ruidosas, la mejora alcanza hasta 10×.
Posicionamiento Competitivo
A $0.08 por minuto ($4.80 por hora), Think Fast 2.0 cuesta aproximadamente el 45% del precio de GPT-Realtime-2.1 High de OpenAI. En el Índice Speech-to-Speech de Artificial Analysis, Grok Voice TF 2.0 obtiene 82.9% frente al 79.1% de GPT-Realtime-2.1 y el 69.5% de Gemini 3.1 Flash. En el benchmark agentic τ-voice, Grok lidera con 56.5% frente al 45.7% de OpenAI.
Para los equipos empresariales que construyen agentes de voz — centros de llamadas, sistemas IVR, IA conversacional — Think Fast 2.0 es ahora el líder de referencia sobre el papel. El aumento de precio de $0.05 a $0.08 por minuto (60% más) es significativo para implementaciones de alto volumen, pero la reducción del 60% en tokens de razonamiento compensa parcialmente el costo por minuto al reducir la carga de cómputo por interacción.
Notas de Migración
Los desarrolladores deberían:
- Fijar
grok-voice-think-fast-1.0en producción si no están listos para 2.0 - Recalcular costos a $0.08/min frente a los supuestos anteriores de $0.05
- Habilitar el transporte de audio binario si controlan ambos extremos
- Añadir keyterms para nombres de productos y replace para correcciones de pronunciación
- Implementar el orden tool → wait-for-playback → response.create para evitar la superposición de audio
- Usar tokens efímeros para cualquier cliente que no sea tu servidor
El endpoint WebSocket es wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0. Códecs compatibles: PCM (8–48 kHz), μ-law, A-law y Opus (24 kHz).
Grok Imagine Video 1.5: Texto a Video, 1080p Nativo, Referencia de Voz
El 31 de julio de 2026, xAI lanzó una actualización significativa de Grok Imagine Video 1.5, añadiendo cuatro capacidades que la plataforma no había tenido desde su lanzamiento en mayo:
Generación de Texto a Video
Los usuarios ahora pueden generar videos solo a partir de prompts de texto sin proporcionar una imagen de referencia. La implementación combina el pipeline de generación de imágenes de xAI con el motor de imagen-a-video — el modelo sintetiza un fotograma inicial a partir del prompt de texto y luego lo anima. Esto cierra una brecha de funciones con Google Veo 3.1 y Seedance 2.0, ambos con texto a video a nivel de API desde sus lanzamientos.
Salida 1080p Nativa
La salida anterior de Grok Imagine Video estaba limitada a 720p (con un breve “interruptor de 1080p” que en realidad era 720p reescalado). La actualización ofrece renderizado 1080p nativo real. Los precios revelan el costo arquitectónico: Aurora es un sistema autorregresivo que genera cada fotograma secuencialmente, por lo que escalar de 720p a 1080p multiplica los tokens de píxeles por ~2.25×. Los precios de la API lo reflejan:
| Resolución | Precio por segundo |
|---|---|
| 480p | $0.08 |
| 720p | $0.14 |
| 1080p | $0.25 |
A 1080p, generar 60 minutos de video a través de la API cuesta $900 — en comparación con $504 a 720p y aproximadamente $540 con los precios del nivel Fast de Google Veo 3.1. La capacidad de 1080p cierra la brecha de formato con los competidores; no cierra la brecha de costo en esa resolución.
Referencia de Voz: Consistencia de Rostro y Voz
La característica nueva más distintiva: los usuarios proporcionan una foto del personaje y una muestra de voz, y el modelo mantiene tanto el rostro como la voz en cada escena generada. El mecanismo subyacente es un sistema de embeddings de hablante que extrae las características de identidad de voz (tono, pitch, prosodia, acento) por separado del contenido lingüístico.
Esto elimina un paso de postproducción que tradicionalmente requería combinar herramientas separadas. La API de Avatar de HeyGen, por comparación, cobra $3 por minuto por clips de talking-head. La referencia de voz de Grok Imagine está integrada en la generación de video de escena completa — no solo avatares — representando una categoría de capacidad diferente.
Acceso: La referencia de voz se está implementando primero para los suscriptores de SuperGrok Heavy y SuperGrok Plus en Estados Unidos, con una implementación más amplia indicada en cuestión de días. Los desarrolladores de API deben contactar al equipo de ventas de xAI para solicitar acceso.
Brecha de consentimiento: El anuncio de xAI no incluye ninguna discusión sobre salvaguardas de consentimiento. La característica requiere una foto y una muestra de voz, pero no parece requerir que pertenezcan a la misma persona, ni que la persona retratada haya dado su consentimiento. Dada la historia de Grok con imágenes no consentidas — se estima que 3 millones de imágenes sexualizadas fueron generadas en una ventana de 11 días a finales de 2025/principios de 2026, seguidas de demandas federales e investigaciones de 35 fiscales generales estatales — combinar la referencia de rostro y voz en una sola llamada de generación crea una capacidad de video íntimo no consentido más completa que la generación de imágenes por sí sola. La política de uso aceptable de xAI prohíbe dicho contenido, pero el historial de cumplimiento le da a esa prohibición una garantía limitada sin controles técnicos divulgados.
Control de Escena con Múltiples Referencias
Hasta siete imágenes de referencia simultáneas pueden usarse en una sola generación. Cada referencia fija un elemento visual — un rostro, un producto, una ubicación, un accesorio — mientras permite que otros elementos varíen. Este es un número de anclas mayor que el que ofrecen la mayoría de las herramientas de referencia dedicadas y, combinado con la referencia de voz, produce un pipeline de personajes donde el rostro, la voz y el contexto ambiental pueden fijarse simultáneamente.
Disponibilidad de la API: Texto a video, 1080p nativo y referencias de imagen están disponibles ahora con una clave de API estándar. La cadena de modelo grok-imagine-video-1.5 reemplaza al alias -preview anterior. La referencia de voz requiere acceso del equipo de ventas.
Panorama Competitivo: OpenAI GPT-5.6 Sol, Terra y Luna
OpenAI lanzó GPT-5.6 el 9 de julio como una familia de tres modelos — el lanzamiento competitivo más significativo durante este período:
| Modelo | Posicionamiento | Precio (por 1M de tokens) |
|---|---|---|
| Sol | Insignia, mayor capacidad | $5 entrada / $30 salida |
| Terra | Equilibrado, nivel GPT-5.5 a menor costo | $2.50 entrada / $15 salida |
| Luna | Más rápido, más barato, alto volumen | $1 entrada / $6 salida |
OpenAI también introdujo el modo Ultra — su configuración de mayor capacidad que coordina múltiples agentes en flujos de trabajo paralelos — y un nivel de razonamiento Max disponible en ChatGPT Work y Codex.
La estrategia de tres niveles contrasta fuertemente con el enfoque de xAI. SpaceXAI ha estado consolidando su API en torno a un único modelo insignia (Grok 4.3, luego 4.5) y usando niveles de suscripción para la distribución en lugar de niveles de modelo. La división Sol/Terra/Luna de OpenAI ofrece a los compradores un equilibrio de precio-rendimiento dentro de una sola familia de modelos — una ventaja de adquisición para organizaciones que necesitan diferentes niveles de capacidad para diferentes cargas de trabajo.
Mientras tanto, Kimi K3 de Moonshot AI — un modelo open-weight de 2.8 billones de parámetros con 896 expertos en una arquitectura Mixture-of-Experts y una ventana de contexto de 1 millón de tokens — fue lanzado a finales de julio, reclamando el título del modelo open-weight más grande jamás creado. La presión competitiva sobre xAI se está intensificando desde las direcciones propietaria y de código abierto.
Qué Vigilar
- Confirmación del lanzamiento de Grok 4.6: Observa si el ID del modelo aparece en la documentación de la API de xAI y en el ranking de LMArena. La brecha entre “la próxima semana” y la disponibilidad real en la API indicará cuánto tiempo de anticipación incorporar a la planificación. El ritmo de entrega de Musk se está acelerando, pero sus fechas son objetivos, no compromisos.
- Cascada de desbloqueo de SpaceX: El 6 de agosto comienza el primer tramo de desbloqueos de acciones de insiders — aproximadamente mil millones de acciones, ~$106B. Tramos adicionales cada dos semanas hasta diciembre. La presión de venta moldeará el rendimiento de la acción de SPCX y, por extensión, el apetito del mercado por el gasto en infraestructura de IA a esta escala.
- Grok 5 y la integración de datos de SpaceX: La promesa de entrenar con “todos los datos que SpaceX haya producido jamás” es estratégicamente significativa. Si la telemetría de ingeniería, los datos de fabricación y los registros operativos de SpaceX producen ganancias de capacidad medibles en Grok 5, valida toda la tesis de la consolidación de SpaceXAI. Observa cualquier divulgación técnica sobre la arquitectura del pipeline de datos.
- Rendimiento de producción de Voice Think Fast 2.0: Las cifras de benchmarks son sólidas sobre el papel. Las implementaciones empresariales revelarán si la reducción del 60% en tokens y los 0.70s de tiempo hasta el primer audio se traducen en ahorros de costos reales y mejoras en la experiencia del usuario. Observa las evaluaciones de terceros y los casos de estudio.
- Salvaguardas de consentimiento de Grok Imagine: La referencia de voz combinada con la referencia de rostro crea riesgo de video íntimo no consentido. Observa si xAI divulga controles técnicos — no solo prohibiciones de política — antes de la implementación más amplia.
- Lanzamientos de los satélites Starmind: El primer lote de satélites equipados con IA está programado para el año que viene. Si tiene éxito, el cómputo de IA en el espacio se convierte en un diferenciador que ningún competidor puede replicar.
- Respuesta competitiva de OpenAI: GPT-5.6 Sol obtiene 80 en el Índice de Agentes de Codificación de Artificial Analysis. Las cifras de benchmarks de Grok 4.6 — cuando lleguen — se compararán directamente. El modelo de precios de tres niveles Sol/Terra/Luna puede obligar a xAI a reconsiderar su estrategia de API de insignia única.
Sigue a Kevin Kaminski en X para actualizaciones diarias del ecosistema de IA. Vuelve la próxima semana para el siguiente xAI Weekly.