Si Build 2025 señaló la intención de Microsoft de construir sus propios modelos de IA, Build 2026 fue el año en que lo cumplió.

El 2 de junio, Microsoft presentó siete modelos MAI (Microsoft AI) propios — su mayor lanzamiento de IA propia hasta la fecha. Desarrollados desde cero por el equipo de Mustafa Suleyman sin destilación de OpenAI ni de ningún tercero, esto es Microsoft afirmándose como constructor de modelos, no como revendedor.

Para CTOs y líderes de ingeniería, la señal es inequívoca: el ecosistema de modelos propios de Microsoft ha alcanzado masa crítica. Esto es lo que se lanzó, lo que significa y hacia dónde se dirige.


La Familia MAI: Siete Modelos, Una Estrategia

La keynote de Build 2026 se centró en la familia de modelos MAI — la nueva línea insignia de modelos de IA propietarios de Microsoft construidos sobre el pipeline de entrenamiento “Hill-Climbing Machine”.

MAI-Thinking-1: Un Competidor Fronterizo Genuino

El más destacado es MAI-Thinking-1, un modelo sparse Mixture-of-Experts con aproximadamente 35 mil millones de parámetros activos (de ~1 billón total) y una ventana de contexto de 256K tokens.

Los benchmarks lo sitúan en territorio de clase fronteriza:

  • AIME 2025: 97.0%
  • AIME 2026: 94.5%
  • SWE-Bench Pro: 53% — igualando a Claude Opus 4.6 en codificación
  • Evaluadores humanos ciegos (vía Surge) lo prefirieron sobre Sonnet 4.6 en evaluaciones comparativas

Microsoft lo posiciona como “el modelo fronterizo más rentable en su categoría”. Crucialmente, la compañía lo entrenó desde cero solo con datos con licencia comercial — sin destilación de OpenAI ni de ningún otro modelo externo. Para los compradores empresariales que han desconfiado de los riesgos de contaminación de propiedad intelectual en otros modelos fronterizos, esto importa.

MAI-Code-1-Flash: Diseñado para Flujos de Trabajo de Desarrolladores

Con 5 mil millones de parámetros, MAI-Code-1-Flash rinde muy por encima de su categoría. Obteniendo un 51.2% en SWE-Bench Pro, supera a Claude Haiku 4.5 en los cuatro benchmarks de codificación principales por un margen de 16 puntos (51.2% vs. 35.2%) mientras usa hasta un 60% menos de tokens.

Entrenado directamente con harnesses de producción de GitHub Copilot y repositorios de código con licencia, este modelo ya se está implementando en todos los niveles de Copilot — Free, Student, Pro, Pro+ y Max. Se puede seleccionar directamente desde el selector de modelos de VS Code. Para equipos que ejecutan Copilot a escala, solo la eficiencia de tokens se traduce en ahorros de costos significativos.

Modelos MAI de Apoyo: Imagen, Transcripción y Voz

MAI-Image-2.5 saltó 75 puntos Elo sobre su predecesor, ocupando ahora el #2 en edición de imágenes en el leaderboard de Arena. Está disponible en PowerPoint y está integrándose en OneDrive. MAI-Transcribe-1.5 maneja 43 idiomas con una tasa de error de palabras del 2.4% — transcribiendo una hora de audio en menos de 15 segundos a una velocidad de procesamiento por lotes 276× en tiempo real. MAI-Voice-2 soporta 15 idiomas con clonación de voz zero-shot a partir de 5–60 segundos de audio de referencia, con un 72% de preferencia ciega sobre su predecesor.

Nota estratégica: Por primera vez, Microsoft está distribuyendo estos modelos en plataformas de inferencia que no son Azure — OpenRouter, Fireworks AI y Baseten. Esta es una estrategia de distribución deliberada. Microsoft quiere que sus modelos se usen en todas partes, no solo dentro de su jardín amurallado.


Familia Phi-4: Densidad, Diversidad y una Arquitectura Novedosa

La familia Phi-4 continúa siendo la línea de modelos de pesos abiertos más prolífica de Microsoft, y este mes trajo dos adiciones significativas.

Phi-4-mini-flash-reasoning: Arquitectura SambaY

Con solo 3.8 mil millones de parámetros, Phi-4-mini-flash-reasoning introduce SambaY — una arquitectura de decodificador híbrido que combina Mamba (modelo de espacio de estados), atención de ventana deslizante y capas de atención completa con Unidades de Memoria de Compuerta intercaladas.

Esta es una auténtica desviación arquitectónica de los Transformers estándar, y los resultados hablan por sí solos:

BenchmarkPhi-4-mini-reasoning (3.8B)DeepSeek-R1-Distill-Llama-8BLlama-3.2-3B
AIME57.543.36.7
MATH-50094.686.944.4
GPQA Diamond52.047.325.3

Un modelo de 3.8B que supera a un modelo destilado de 8B en matemáticas de competencia es digno de mención. La arquitectura SambaY ofrece hasta 10× más rendimiento que el Phi-4-mini-reasoning estándar con una reducción de latencia de 2–3×. Con licencia MIT, esto es inmediatamente viable para implementaciones on-premise o en el borde donde el presupuesto de GPU es limitado.

Phi-4-Reasoning-Vision-15B

Lanzado en marzo, este modelo multimodal de 15B combina un codificador de visión SigLIP-2 con la base Phi-4-Reasoning, obteniendo puntuaciones competitivas con modelos ~10× su tamaño en benchmarks de visión: 84.8% en AI2D, 83.3% en ChartQA. Sus modos <think> y <nothink> brindan a los desarrolladores flexibilidad en la profundidad del razonamiento frente a la latencia.

Phi-4-Medium y Orca-3

Dos modelos propietarios de nivel medio lanzados en Build 2026. Phi-4-Medium se dirige a aplicaciones de producción con una ventana de contexto de 128K, logrando un 82% en HumanEval y subcotizando las tarifas estándar de OpenAI en ~40%. Orca-3 maneja tareas basadas en plantillas: validación de JSON, redacción de correos electrónicos y análisis de registros.


Aion 1.0: IA en el Dispositivo como Estrategia de Plataforma

Microsoft también anunció Aion 1.0 en Build 2026 — la familia de modelos de IA en el dispositivo para Windows, reemplazando a Phi Silica como el SLM incorporado.

  • Aion 1.0 Instruct está en vista previa para desarrolladores en Edge Canary/Dev, funciona en CPU, GPU o NPU (sin GPU dedicada requerida) y maneja resúmenes, reescritura, detección de intenciones y accesibilidad. Se planean pesos abiertos en Hugging Face para julio de 2026.

  • Aion 1.0 Plan (14B, 32K de contexto) se dirige a flujos de trabajo agentivos en el dispositivo — razonamiento, llamada a herramientas, gestión de archivos y orquestación de subagentes. Se enviará incorporado en Windows en hardware compatible en los próximos meses.

Esta es la capa de modelo que sustenta el Windows Agent Framework (de código abierto en Build), junto con las APIs de Copilot Runtime para inferencia local Win32/WinUI 3. El encuadre de Nadella de “inteligencia sin medición” — Aion en el dispositivo, RTX Spark de peso medio, razonamiento fronterizo en la nube — articula claramente la arquitectura de IA de borde a nube de Microsoft.


Project Polaris: El Futuro de Copilot con Modelos Propios

Project Polaris — un modelo de codificación MoE con submódulos especializados por lenguaje — reemplazará a GPT-4 Turbo como el modelo predeterminado de GitHub Copilot a partir de agosto de 2026. Se ejecuta en los aceleradores de IA Maia personalizados de Microsoft, reduciendo la latencia de inferencia frente al hardware de Nvidia. Un período de transición de tres meses permite a los equipos permanecer en GPT-4 si es necesario. Para clientes empresariales, el silicio Maia + modelos propios significa que Microsoft controla toda la pila, desde el entrenamiento hasta la inferencia.


Qué Significa Todo Esto

Varias líneas estratégicas convergen:

  1. La independencia de OpenAI es real. MAI-Thinking-1 demuestra capacidad fronteriza sin datos de OpenAI. La estrategia de distribución multiplataforma confirma que están compitiendo, no cubriendo apuestas.

  2. Densidad sobre escala bruta. Un modelo de 14B compitiendo con alternativas de clase 70B, y un modelo de 3.8B superando a rivales destilados de 8B — Microsoft apuesta por la eficiencia como diferenciador.

  3. La innovación arquitectónica continúa. SambaY en Phi-4-mini-flash-reasoning muestra que Microsoft irá más allá de los Transformers estándar cuando esté justificado.

  4. El control de pila completa se acelera. Silicio Maia + Aion + Windows Agent Framework + Foundry + plataformas de terceros = Microsoft construyendo su propia pila de IA desde el chip hasta la aplicación.

Para los líderes de ingeniería, los criterios de evaluación están cambiando. La pregunta ya no es “¿debería usar los modelos de IA de Microsoft?” sino “¿cuál de los modelos propios de Microsoft y dónde en mi pila?”

La respuesta, cada vez más, es todos ellos — desde Aion en el borde hasta MAI-Thinking-1 en la nube, con Phi-4 llenando cada espacio intermedio.