Agosto de 2026 marca un punto de inflexión en la estrategia de IA propia de Microsoft. La familia de modelos MAI — entrenada íntegramente in-house en el silicio Maia 200 de Microsoft — ya enruta tráfico de producción de Copilot. Phi-4 cubre siete escenarios edge bajo licencia MIT. Florence-2 sustenta todo Azure AI Vision, pero enfrenta el retiro crítico de una API heredada en 30 días. Y Aion 1.0 se prepara para reemplazar a Phi Silica como modelo on-device para Windows. Si estás trazando tu grafo de dependencias de IA, esta es la semana para reevaluar qué significa realmente “con tecnología Copilot” bajo el capó.

Familia MAI: del anuncio en Build al tráfico de producción

En Build 2026, el CEO de Microsoft AI, Mustafa Suleyman, presentó la familia MAI: siete modelos entrenados desde cero con el pipeline “Hill-Climbing Machine”. Cero destilación de OpenAI, Anthropic o cualquier laboratorio de terceros. Todos los modelos se ejecutan en aceleradores Maia 200: chips de 3 nm con 140 mil millones de transistores y 216 GB de HBM3e.

Tres meses después, esto ya no es una historia de roadmap. Bloomberg confirmó en julio que decenas de miles de prompts de Excel y Outlook ahora se enrutan a modelos MAI en lugar de APIs de terceros. Microsoft 365 Copilot opera como una capa de orquestación de categorización de tareas: redacción de correos, resumen de hilos, fórmulas de hojas de cálculo, código en VS Code, generación de imágenes y escaneo de seguridad; todo se enruta a MAI. Los modelos frontier de terceros, como GPT-5.6, siguen siendo el “modelo preferido” para el razonamiento complejo de múltiples pasos, pero el nivel commodity ahora pertenece a MAI.

MAI-Code-1.1-Flash: 75% más barato, visión nativa

MAI-Code-1.1-Flash alcanzó GA el 11 de agosto con una reducción de costos del 75% frente a su predecesor: $0.20/1M de entrada, $0.02/1M en caché, $1.20/1M de salida. El streaming de tokens es 25% más rápido, las tareas consumen 25% menos tokens y añade entrada de visión nativa para flujos de trabajo screenshot-to-code. Benchmarks: 72.6% en SWE-Bench Verified, 62.9% en Terminal-Bench 2.1 (un 22% más) y una mejora del 15% en tareas .NET. Ya está disponible en todos los niveles de GitHub Copilot. MAI-Code-1-Flash queda deprecado el 10 de septiembre: migra ahora.

MAI-Thinking-1: razonamiento insignia en vista previa pública

MAI-Thinking-1 entró en vista previa pública en Foundry el 12 de agosto. Con ~962B de parámetros totales / ~34.7B activos y contexto de 256K, es el modelo frontier de razonamiento de Microsoft. Cifras autodeclaradas: 97.0% en AIME 2025, 94.5% en AIME 2026, ~52.8% en SWE-Bench Pro — comparable a Claude Opus 4.6. Precio por definir.

MAI-Image-2.6 y MAI-Cyber-1-Flash

MAI-Image-2.6 entró en vista previa privada el 10 de agosto, reclamando de inmediato el puesto #2 en text-to-image de Arena (1,336 Elo) y el #1 en imágenes 3D, superando a GPT Image 2 en esa categoría. Mejoras notables: +91 Elo en renderizado de texto y +79 Elo en general frente a la versión 2.5.

MAI-Cyber-1-Flash llegó a vista previa pública el 3 de agosto como parte de Project Perception. Gestiona el 90% del escaneo de vulnerabilidades a la mitad del costo de cómputo de GPT-5.4, con puntuaciones CyberGym que saltaron de 88.4% a 95.95%.

Phi-4: el portafolio edge se profundiza

La familia Phi-4 sigue siendo el portafolio de modelos de lenguaje pequeños más completo de la industria: siete variantes con licencia MIT entre 3.8B y 15B de parámetros. Ningún otro proveedor iguala esta amplitud.

Phi-4 (14B) rivaliza con Llama 3.3 70B en MMLU con un 84.8%, usando 4-5× menos VRAM. Phi-4-mini (3.8B) se ejecuta con 8 GB de RAM y en Raspberry Pi 5, llegó incluido en los PC Windows 12 Copilot+ y alcanzó 1,955 tokens/seg en Intel Xeon 6 en modo solo CPU. Phi-4-reasoning-vision-15B combina un encoder de visión SigLIP-2 con la base Phi-4-Reasoning, permite alternar modos de razonamiento y soporta screen grounding, lo que lo convierte en el mejor candidato on-premise de visión y razonamiento con 15B de parámetros.

Precios en Azure: $0.07/1M de entrada, $0.14/1M de salida, $0.088/1M combinado. Se esperan variantes de visión y audio de Phi-4 para octubre.

El valor estratégico para los CTO: despliegues de IA offline, on-premise y con soberanía de datos, con cero fricción de licencias.

Florence-2: fecha límite de 30 días para las APIs heredadas

Florence-2 sigue siendo el modelo fundacional de visión de Microsoft, impulsando Azure AI Vision Image Analysis 4.0. No hay un Florence-3 planeado: Microsoft prioriza la estabilidad sobre la velocidad de lanzamiento. El modelo maneja más de 12 tareas de visión desde un único conjunto de pesos: detección, segmentación, captioning, grounding, OCR en 164 idiomas y captioning denso por regiones.

Crítico: las APIs heredadas de Azure Vision (v1.0-3.1) se retiran el 13 de septiembre de 2026 — a 30 días. Migra al SDK de Image Analysis 4.0 basado en Florence-2 antes de esa fecha. Florence-2-large (770M) alcanzó 81.5% en TextVQA sin OCR externo, y el fine-tuning con LoRA muestra >98% de precisión en conjuntos de datos especializados. Un paquete NuGet nativo de C#/.NET soporta ejecución ONNX local.

Es un retiro definitivo, no una deprecación suave.

Aion 1.0: la transición on-device

Aion 1.0 es la apuesta de Microsoft por la “inteligencia sin medición”: cero dependencia de la nube, cero costo marginal por inferencia. Aion 1.0 Instruct (SLM ligero) se ejecuta en CPU/GPU/NPU sin GPU dedicada, llega ahora a vista previa para desarrolladores vía Edge Canary, con pruebas independientes el 1 de octubre y GA el 24 de noviembre. Notablemente, elimina el requisito de token Limited Access Feature que hacía de Phi Silica un dolor de cabeza para los desarrolladores. Aion 1.0 Plan (14B, contexto de 32K) maneja flujos de trabajo agénticos on-device — razonamiento, tool-calling, orquestación de subagentes — y se incluye de fábrica en los PC Copilot+ a través de Windows Agent Framework.

Phi Silica está en fase de retiro: las optimizaciones de AMD en mayo lograron respuestas 30% más rápidas, pero el modelo se eliminará de los dispositivos comerciales el 24 de noviembre. Microsoft afirma que se preservará la compatibilidad de las APIs LanguageModel e ImageDescription.

Lanzamientos de investigación: Orchard y EvoLib

Microsoft Research publicó dos frameworks con licencia MIT este mes. Orchard (3 de agosto) es un framework nativo de Kubernetes para entrenar agentes de IA: las recetas de dominio alcanzaron 69.7% en SWE-Bench Verified con ~3B de parámetros activos y 74.1% en WebVoyager para agentes GUI. EvoLib (30 de julio) ofrece mejoras del 11-20% en tareas de matemáticas, código y agentes mediante test-time learning, sin modificar los pesos del modelo. Ambos operan alrededor de LLMs de caja negra.

El stack completo

Microsoft es ahora una de las tres empresas (junto con Google y Apple) que posee un portafolio de IA completo: silicio personalizado (Maia 200), modelos frontier en la nube (MAI), SLM edge de pesos abiertos (Phi-4), modelos on-device (Aion 1.0), modelos fundacionales de visión (Florence-2), orquestación (enrutamiento de Copilot) y un framework de agentes. El stack puede evaluarse de extremo a extremo sin dependencias de terceros, aunque el enrutamiento híbrido sigue siendo lo más pragmático para la mayoría de las empresas.

Acciones recomendadas

  1. Migra de MAI-Code-1-Flash a 1.1-Flash antes del 10 de septiembre — 75% de ahorro de costos más entrada de visión
  2. Migra las APIs heredadas de Azure Vision a Image Analysis 4.0 antes del 13 de septiembre — retiro definitivo
  3. Actualiza los supuestos de dependencia de Copilot — los modelos MAI ahora manejan la mayoría de las tareas commodity, lo que afecta la planificación de costos y residencia de datos
  4. Evalúa Aion 1.0 para escenarios on-device — paquete de pruebas disponible el 1 de octubre; fecha límite de transición de Phi Silica el 24 de noviembre
  5. Prueba Phi-4-mini para despliegues offline/edge — viable hoy en hardware corporativo con 8 GB de RAM

Kevin Kaminski es fundador de Big Hat Group Inc., socio de Microsoft enfocado en estrategia de adopción de IA. Síguelo en https://x.com/kkaminsk para análisis continuo del ecosistema de modelos de IA de Microsoft.