Agosto de 2026 marca un punto de inflexión en la estrategia de IA de primera parte de Microsoft. La empresa ya no solo construye modelos — está enrutando tráfico de producción de Copilot a ellos a escala. MAI-Code-1-Flash se convierte en el modelo predeterminado de GitHub Copilot este mes. MAI-Cyber-1-Flash entró en vista previa pública el 3 de agosto vía Project Perception. MAI-Image-2.5-Pro y MAI-Voice-2-Flash alcanzaron vista previa pública. Y un modelo de voz de dúplex completo oculto apareció en el MAI Playground.

Para los CTO y líderes de ingeniería, la pregunta ya no es si Microsoft tiene sus propios modelos — es si su arquitectura está lista para ellos.

La Familia MAI: De Investigación a Producción

La familia MAI de Microsoft, presentada en Build 2026, consta de siete modelos de nivel en la nube entrenados completamente internamente usando lo que Microsoft llama la pipeline “Hill-Climbing Machine” — cero destilación de OpenAI, Anthropic o cualquier laboratorio de terceros. Cuatro meses después, estos modelos pasan de vitrina a cargas de trabajo de producción.

MAI-Code-1-Flash: El Nuevo Modelo Predeterminado de GitHub Copilot

El cambio más trascendental este mes es MAI-Code-1-Flash convirtiéndose en el modelo predeterminado de GitHub Copilot en todos los niveles. Este modelo MoE disperso de 137B total / ~5B activos alcanza 51.2% en SWE-Bench Pro — una ventaja de 16 puntos sobre Claude Haiku 4.5. Microsoft reporta ~10% más de tasa de aceptación de código en VS Code frente a GPT-5.4 Mini y Claude Haiku 4.5, con ~10% menos de uso mediano de tokens.

A $0.75/1M tokens de entrada y $4.50/1M de salida, la economía es agresiva. GPT-4 Turbo sigue como fallback hasta noviembre de 2026, luego MAI-Code-1-Flash se convierte en el único modelo predeterminado. El mismo checkpoint impulsa la generación de fórmulas en Excel, descrito como “a la par con GPT-5.6 para las tareas más comunes”. El modelo también está disponible vía OpenRouter, Fireworks AI y Baseten — las rutas de migración existen.

MAI-Thinking-1: Prometedor pero No Validado

El modelo insignia de razonamiento (~962B total / ~34.7B activos, 256K de contexto) sigue en vista previa privada en Azure Foundry. Los benchmarks auto-reportados son sólidos — 97.0% en AIME 2025, 52.8% en SWE-Bench Pro, y preferido sobre Claude Sonnet 4.6 en pruebas a ciegas en Surge en 1,276 tareas. Sin embargo, reportes independientes de Bloomberg y ByteIota lo sitúan aproximadamente al nivel de DeepSeek V3.2 en uso práctico — capaz, pero no un salto claro. Vista previa pública esperada “en cuestión de semanas”. Los CTO deben tratar los benchmarks como prometedores pero no validados hasta que exista acceso independiente a la API.

MAI se Expande: Imagen, Voz y Seguridad

MAI-Image-2.5-Pro y la Historia de Costos

MAI-Image-2.5-Pro alcanzó vista previa pública el 23 de julio, completando una línea de tres niveles: MAI-Image-2.5 (GA, $47/1M tokens de salida de imagen), Flash (GA, $19.50/1M), y Pro (vista previa, $106/1M). Las pruebas en producción son convincentes — PowerPoint reporta 84% de reducción de costos de GPU vs. GPT-Image-2, OneDrive vio 26% de aumento en tasa de guardado y 25% de reducción de latencia P95, y Bing Image Creator es ahora 100% interno.

MAI-Voice-2-Flash y la Sorpresa Realtime

MAI-Voice-2-Flash entró en vista previa pública — 2× la velocidad de MAI-Voice-2 a 32% menos de costo ($15/1M caracteres). Mientras tanto, un modelo de voz de dúplex completo (MAI Realtime) fue descubierto en el MAI Playground el 2 de agosto. Procesa audio nativamente de entrada y salida, sin paso intermedio de texto, en 17 idiomas. No hay anuncio oficial aún, pero indica que Microsoft está construyendo voz conversacional en tiempo real como una capacidad de primera clase.

MAI-Cyber-1-Flash y Project Perception

Project Perception es la nueva plataforma de seguridad agéntica de Microsoft impulsada por MAI-Cyber-1-Flash (137B / ~5B activos, derivado del entrenamiento de MAI-Thinking-1). Puntúa 95.95% en CyberGym — primer lugar, superando al siguiente competidor por 12 puntos a ~mitad del costo. La plataforma despliega agentes rojo (ataque), azul (triage) y verde (parche). Microsoft ya lo ejecuta en el 90% de su escaneo de vulnerabilidades interno, con GPT-5.4 manejando escalamientos complejos. Vista previa pública pero requiere verificación — no acceso general.

Phi-4: El Modelo Abierto de Borde

La familia Phi-4 sigue sin rival en el rango de 3.8B–15B. Siete modelos con licencia MIT cubren desde despliegue en borde hasta razonamiento multimodal.

Phi-4-mini (3.8B) se envió a PCs Windows 12 Copilot+ el 19 de julio — 42 tokens/seg en Snapdragon X Elite, ~3GB VRAM en cuantización Q4, habilitando autocompletado de código sin conexión y edición de imágenes local. Para escenarios de soberanía de datos y conectividad intermitente, esto está listo para producción.

Phi-4-mini-flash-reasoning merece particular atención. Utiliza una arquitectura híbrida SambaY — modelos de espacio de estados de Mamba con atención de ventana deslizante, Unidades de Memoria Compuerta y Atención Diferencial — logrando 10× de rendimiento y 2-3× de mejora de latencia frente a Phi-4-mini-reasoning. Esta es una salida arquitectónica genuina del Transformer estándar, ejecutándose sin RL. Si su hoja de ruta de IA de borde asume la economía del Transformer estándar, este modelo cambia el cálculo.

Phi-4-reasoning-vision-15B (marzo 2026) sustituye efectivamente a Florence-2 para razonamiento multimodal. Su 88.2% en ScreenSpot v2 (anclaje de GUI) lo convierte en base para agentes UI autónomos y herramientas RPA. Conmuta dinámicamente modos de razonamiento por tarea, evitando la sobrecarga de cadena de pensamiento forzada.

Aion 1.0: La Transición On-Device

La estrategia on-device de Microsoft se consolida en torno a Aion 1.0. Aion 1.0 Instruct — un SLM ligero para CPU/GPU/NPU — está en vista previa de desarrollador, reemplazando a Phi Silica como el modelo Windows on-device de producción. Aion 1.0 Plan (14B, 32K contexto) es el lanzamiento más ambicioso: un runtime de agente on-device que soporta razonamiento, llamada a herramientas y orquestación de sub-agentes vía Windows Agent Framework. Requiere NPU ≥40 TOPS o GPU discreta calificada.

La línea de tiempo de transición es firme: 1 de octubre trae un paquete de prueba independiente, 23 de octubre se despliega a Windows Insiders, 24 de noviembre es GA — Phi Silica se elimina de dispositivos minoristas. Críticamente, a diferencia de Phi Silica, Aion Instruct no requiere tokens LAF — eliminando un punto significativo de fricción para desarrolladores.

Florence-2 y la Fecha Límite de Septiembre

Florence-2 sigue estable como el caballo de batalla empresarial para visión por computadora pura — detección de objetos, segmentación, subtitulado, OCR en 164 idiomas, un único conjunto de pesos, licencia MIT. Impulsa Azure AI Vision Image Analysis 4.0.

Urgente: las APIs heredadas de Azure Vision (v1.0–3.1) se retiran el 13 de septiembre de 2026 — 35 días. Las organizaciones en APIs antiguas deben migrar antes de esa fecha. Image Analysis 4.0 en sí se retira el 25 de septiembre de 2028.

La Realidad del Enrutamiento de Copilot

Copilot no es un producto de un solo modelo. Una capa de categorización de tareas clasifica cada interacción antes de seleccionar un modelo. Redacción de correos, resumen, generación de fórmulas, generación de imágenes, transcripción de Teams y escaneo de seguridad se enrutan a modelos MAI. El razonamiento complejo de múltiples pasos, la generación creativa y el análisis novedoso de documentos se enrutan a modelos frontera de terceros — GPT-5.6 sigue siendo el modelo preferido para Microsoft 365 Copilot. Para fin de 2026, Microsoft espera que la mayoría de las tareas de rutina de Copilot se ejecuten en modelos MAI. Si su plan de dependencia de Copilot asume OpenAI para todo, necesita actualizarse.

Elementos de Acción

  1. Migración de GitHub Copilot: Prepárese para MAI-Code-1-Flash como único modelo predeterminado para noviembre. Pruebe ahora mientras el fallback de GPT-4 Turbo sigue disponible.
  2. Migración de Azure Vision API: Mueva a Image Analysis 4.0 antes del 13 de septiembre. Fecha límite estricta.
  3. Revisión de costos de generación de imágenes: Evalúe MAI-Image-2.5 contra GPT-Image-2 — la reducción del 84% en costos de GPU en PowerPoint es una señal fuerte.
  4. Arquitectura de IA de borde: Phi-4-mini en Windows 12 y la arquitectura SambaY de Phi-4-mini-flash-reasoning merecen una revisión fresca de la economía on-device.
  5. Operaciones de seguridad: Solicite acceso a Project Perception si su equipo maneja escaneo de vulnerabilidades a escala.
  6. Planificación on-device: Si construye con Phi Silica, la transición Aion comienza el 1 de octubre. Comience la preparación de entrenamiento LoRA.

Microsoft es ahora la única empresa además de Google y Apple con un portafolio completo de IA que abarca silicio personalizado, modelos frontera en la nube, modelos abiertos de borde, modelos on-device, modelos de fundación de visión, orquestación y frameworks de agentes. La pregunta para el resto de nosotros es qué tan rápido nos adaptamos.


Este artículo es parte de la serie Microsoft AI Semanal. Siga el análisis continuo en x.com/kkaminsk.