Mediados de 2026 fue el punto de inflexión. Agosto de 2026 es cuando se convierte en realidad operativa. Bloomberg confirmó que Microsoft está enrutando activamente decenas de miles de prompts de Excel y Outlook hacia sus propios modelos MAI en lugar de APIs de terceros. GitHub Copilot está migrando a MAI-Code-1-Flash como su backend predeterminado este mes. La pregunta para los líderes de ingeniería ha pasado de “¿Puede Microsoft construir modelos de frontera?” a “¿Con qué rapidez deberías re-arquitecturar tu stack en torno a ellos?”

El análisis de esta semana cubre la pila completa de modelos de primera parte de Microsoft tal como está en agosto de 2026 — siete modelos MAI en la nube, siete variantes Phi-4 para edge, la familia Aion en el dispositivo, el cronograma de transición de Phi Silica, la fecha límite de retiro de Florence-2 y la capa de orquestación de Copilot que lo une todo.


La Familia MAI: Construida Desde Cero

Presentada en Build 2026 en junio, la familia MAI (Microsoft AI) es la inversión interna en IA más significativa de Microsoft. Siete modelos, todos entrenados desde cero por el AI Superintelligence Team de Mustafa Suleyman utilizando un pipeline interno que denominan “Hill-Climbing Machine.” Sin destilación de OpenAI, Anthropic ni de ningún laboratorio de terceros. Los datos de entrenamiento son de grado empresarial, con licencia comercial y trazables — una distinción crítica para organizaciones con requisitos de cumplimiento.

MAI-Thinking-1: El Buque Insignia

El buque insignia de razonamiento utiliza una arquitectura dispersa de Mixture-of-Experts con ~35B de parámetros activos de ~1T en total y una ventana de contexto de 256K tokens. Los benchmarks reportados por Microsoft son contundentes: 97.0% en AIME 2025, 94.5% en AIME 2026 y ~52.8% en SWE-Bench Pro — igualando a Claude Opus 4.6. En evaluación humana ciega a través de 1,276 tareas, MAI-Thinking-1 fue preferido sobre Claude Sonnet 4.6. Actualmente está en preview privada en Azure Foundry, con preview pública esperada en cuestión de semanas.

MAI-Code-1-Flash: Ya en Producción

Este es el modelo que está reemplazando activamente a GPT-4 Turbo en GitHub Copilot. Estuvo disponible de forma general el 26 de junio de 2026, con un precio de $0.75/1M de tokens de entrada y $4.50/1M de tokens de salida. Obtuvo 51.2% en SWE-Bench Pro — una ventaja de 16 puntos sobre Claude Haiku 4.5 — mientras utiliza hasta un 60% menos de tokens que modelos comparables. Es el modelo predeterminado en VS Code y está desplegándose en todos los niveles de GitHub Copilot. GPT-4 Turbo sigue disponible como respaldo hasta noviembre de 2026, pero los indicios son claros.

Modelos de Imagen, Voz y Transcripción

MAI-Image-2.5 ocupa el puesto #2 en el leaderboard de edición de imágenes de Arena.ai, superando a Nano Banana Pro, y está integrado en PowerPoint y OneDrive. Una variante Flash ofrece generación a aproximadamente un tercio del costo. MAI-Transcribe-1.5 afirma tener la mejor Word Error Rate de su clase en 43 idiomas y se está desplegando en la transcripción de Teams. MAI-Voice-2 es el modelo TTS más expresivo de Microsoft hasta la fecha. Los tres están disponibles de forma general en Azure Foundry.

Ajuste de Frontera: Modelos de Propiedad del Cliente

Quizás la capacidad más interesante desde el punto de vista estratégico son los Reinforcement Learning Environments (RLEs), que permiten a las organizaciones ajustar modelos MAI con sus propios datos de flujo de trabajo. Microsoft reporta que su modelo de Excel ajustado iguala a GPT-5.4 siendo hasta 10× más eficiente. El modelo ajustado permanece en propiedad del cliente — el conocimiento institucional se convierte en parte del propio modelo. Mayo Clinic ya está co-creando un modelo de frontera específico para el sector salud con Microsoft, combinando datos clínicos desidentificados con la IA fundacional de Microsoft. El modelo será propiedad de Mayo Clinic y se desplegará primero en su entorno, para luego estar disponible a través de Microsoft Foundry.


Phi-4: El Portafolio SLM para Edge

Siete variantes, todas con licencia MIT, que cubren escenarios de razonamiento, visión, multimodalidad y edge. Es el portafolio de modelos de lenguaje pequeños más convincente de la industria.

El Phi-4 base (14B) rivaliza con Llama 3.3 70B y Qwen 2.5 72B en MMLU mientras requiere 4–5× menos VRAM. Fue entrenado con 4.8 billones de tokens de datos web y de código curados y consume un 85% menos de cómputo que GPT-4o mini. Ahora está integrado en Azure AI Studio con contexto de 128K y soporte de fine-tuning a través de Azure Machine Learning.

Phi-4-mini (3.8B) se ejecuta en máquinas con 8GB de RAM e incluso en Raspberry Pi 5 con ~3GB de VRAM con cuantización Q4. Llegó a las PC Copilot+ con Windows 12 el 19 de julio, ejecutándose a 42 tokens/seg en Snapdragon X Elite — habilitando autocompletado de código offline y edición de imágenes local.

Las variantes de razonamiento merecen especial atención. Phi-4-reasoning supera a o1-mini de OpenAI y a DeepSeek-R1-Distill-Llama-70B en la mayoría de los benchmarks y es comparable al DeepSeek-R1 completo (671B de parámetros) en AIME 2025. Phi-4-reasoning-plus añade mejora por RL. Phi-4-mini-reasoning (3.8B) fue entrenado con ~1M de problemas matemáticos sintéticos generados por DeepSeek R1 — diseñado para tutoría embebida en dispositivos ligeros.

Phi-4-reasoning-vision-15B, lanzado en marzo de 2026, combina un encoder de visión SigLIP-2 con el backbone de Phi-4-Reasoning. Alterna entre modos de razonamiento y no razonamiento, soporta screen grounding (identificación de elementos de UI por coordenadas) y es el mejor candidato para cargas de trabajo de visión-razonamiento on-premise con 15B de parámetros. Si estás construyendo agentes autónomos de UI o tooling de RPA, este es tu modelo.


Aion 1.0: Inteligencia en el Dispositivo

Aion 1.0, anunciado en Build 2026, representa lo que Microsoft denomina “inteligencia sin medidor” — cero dependencia de la nube, cero costo marginal por inferencia.

Aion 1.0 Instruct es un SLM ligero que se ejecuta en CPU, GPU o NPU sin requerir una GPU dedicada. Maneja tareas de resumen, reescritura, clasificación de intención y accesibilidad, y actualmente está en developer preview a través de los canales Edge Canary/Dev. Se esperan pesos abiertos en Hugging Face este mes. De forma crítica, Aion Instruct reemplazará a Phi Silica como el modelo de producción en el dispositivo el 24 de noviembre de 2026 — con un paquete de pruebas independiente disponible el 1 de octubre y el despliegue para Windows Insiders el 23 de octubre.

Aion 1.0 Plan (14B, contexto de 32K) es más ambicioso. No es un chatbot — es un runtime de agentes que razona sobre la intención del usuario y orquesta sub-agentes localmente. Se incluye de fábrica en dispositivos Windows capaces como parte del Windows Agent Framework, que Microsoft open-sourceó en Build 2026. Requiere una PC Copilot+ con NPU de ≥40 TOPS, o una GPU NVIDIA RTX 30+ / AMD Radeon RX 9060+. Para organizaciones que construyen arquitecturas de agentes local-first, esta es la plataforma a seguir.


Florence-2: Visión Estable, Fecha Límite Firme

No se ha anunciado Florence-3. Microsoft ha optado por la estabilidad y la utilidad empresarial amplia en lugar de un ciclo de lanzamiento apresurado. Florence-2 sigue siendo el motor de visión detrás de Azure AI Vision Image Analysis 4.0, soportando más de 12 tareas de visión — detección de objetos, segmentación, captioning, grounding visual, OCR en 164 idiomas — desde un único conjunto de pesos. Disponible en variantes base (~0.23B, desplegable en CPU) y large (~0.77B, grado producción) bajo licencia MIT.

La fecha límite crítica: Las APIs heredadas de Azure Vision (v1.0–3.1) se retiran el 13 de septiembre de 2026. Si aún no has migrado al SDK de Image Analysis 4.0 basado en Florence-2, esta es tu advertencia de 30 días.


Copilot: Orquestación, No un Modelo

Microsoft 365 Copilot no es un solo modelo — es una capa de orquestación. Una capa de categorización de tareas clasifica cada interacción por tipo de tarea, complejidad y requisito de calidad, y luego enruta en consecuencia.

Desde julio de 2026, las tareas commodity de alto volumen — redacción de correos, resumen de hilos, generación de fórmulas en hojas de cálculo, codificación en VS Code, generación de imágenes en PowerPoint, transcripción en Teams — se enrutan a los modelos MAI de primera parte. El análisis novedoso de documentos largos no estructurados, el razonamiento multi-paso con dependencias complejas y la generación creativa que requiere juicio estilístico siguen enrutándose a modelos de frontera de terceros como GPT-5.6 y Claude. La inferencia en el dispositivo utiliza Phi Silica, en transición hacia Aion 1.0.

Esta arquitectura de enrutamiento es el enfoque pragmático. Captura ahorros de costos en tareas de alto volumen donde los modelos de primera parte son competitivos, mientras preserva el acceso a las capacidades de frontera donde más importan. Para finales de 2026, se espera que la mayoría de las tareas commodity de Copilot se ejecuten íntegramente en modelos MAI.


Turing: Superado

Sin actualizaciones significativas ni nuevos lanzamientos para la familia de modelos Turing en 2025–2026. La familia MAI ha asumido las cargas de trabajo de producción. Turing está efectivamente retirado para nuevo desarrollo.


La Pila Completa

Microsoft es ahora la única empresa, además de Google y Apple, con un portafolio de IA completo que abarca todas las capas:

  • Silicio personalizado: Aceleradores Maia 200 (1.4× de mejora de eficiencia gracias al co-design)
  • Frontera en la nube: Familia MAI (7 modelos)
  • Edge de pesos abiertos: Familia Phi-4 (7 variantes, licencia MIT)
  • En el dispositivo: Aion 1.0 y Phi Silica
  • Fundación de visión: Florence-2 (licencia MIT)
  • Orquestación: Enrutamiento multi-modelo de Copilot
  • Framework de agentes: Windows Agent Framework (open-source)

Qué Significa Esto para los Líderes de Ingeniería

Tres conclusiones accionables:

  1. Planifica tu migración de modelos de Copilot. MAI-Code-1-Flash se está convirtiendo en el predeterminado este mes, con respaldo de GPT-4 Turbo hasta noviembre. Si tienes integraciones con Copilot, prueba contra los modelos MAI ahora y actualiza tu estrategia de fallback antes de que cierre la ventana de noviembre.

  2. Migra las APIs heredadas de Azure Vision antes del 13 de septiembre. El reemplazo es Image Analysis 4.0 basado en Florence-2. Treinta días es poco — empieza hoy.

  3. Evalúa Phi-4 para cargas de trabajo edge y on-prem. La licencia MIT, combinada con la amplitud de la línea de variantes, convierte a Phi-4 en la opción más sólida para organizaciones que necesitan modelos de IA capaces que controlan por completo. La variante de razonamiento-visión con 15B de parámetros es particularmente convincente para cargas de trabajo de agentes de visión-razonamiento on-premise.

La era MAI no está por llegar — ya está aquí. El tráfico de producción está fluyendo. La pila está completa. La pregunta es si tu arquitectura está lista para ella.


Este análisis es parte de la serie Microsoft AI Weekly de Big Hat Group. Síguela en x.com/kkaminsk para comentarios continuos.