Mediados de 2026 marca un punto de inflexión para la estrategia de IA de Microsoft. La compañía ha ensamblado una pila completa de modelos propios — desde silicio personalizado hasta modelos fronterizos en la nube e IA de Windows en el dispositivo — y ya no es teórica. El tráfico de producción está fluyendo a través de los modelos propios de Microsoft.
Bloomberg confirmó a principios de este mes que Microsoft está enrutando decenas de miles de prompts de Excel y Outlook desde modelos de OpenAI y Anthropic a sus propios modelos MAI. GitHub Copilot está en transición a MAI-Code-1-Flash como su backend predeterminado para agosto. Phi Silica recibe actualizaciones regulares de componentes a través de Windows Update. La pregunta para los líderes de ingeniería ya no es si Microsoft puede construir sus propios modelos — es si deberías estar construyendo alrededor de ellos.
La Familia MAI: Desde Cero, No Destilación
La familia MAI de siete modelos, presentada en Build 2026 por el CEO de Microsoft AI, Mustafa Suleyman, representa la afirmación más agresiva de independencia de IA de Microsoft. Estos modelos fueron entrenados desde cero con datos comercialmente licenciados y trazables utilizando el pipeline “Hill-Climbing Machine” de Microsoft y los aceleradores Maia 200 — chips de 3nm con 140 mil millones de transistores y 216GB de HBM3e.
MAI-Thinking-1: Clase Fronteriza, Pero No Probado de Forma Independiente
El modelo de razonamiento insignia es una arquitectura sparse Mixture-of-Experts con ~35 mil millones de parámetros activos de ~1 billón total y una ventana de contexto de 256K tokens. Los benchmarks auto-reportados por Microsoft son sólidos: 97.0% en AIME 2025, 73.5% en SWE-Bench Verified y una evaluación humana ciega de Surge donde los evaluadores lo prefirieron sobre Claude Sonnet 4.6 en 1,276 tareas.
La advertencia: estos son números auto-publicados. Reportes independientes de Bloomberg y ByteIota sitúan a MAI-Thinking-1 aproximadamente equivalente a DeepSeek V3.2 en la práctica — capaz pero no un salto claro sobre los modelos fronterizos existentes. Permanece en vista previa privada sin precios publicados. Por ahora, es una señal prometedora, no una decisión de adquisición.
MAI-Code-1-Flash: El Impacto Empresarial Inmediato
Este es el modelo que importa hoy. Con ~5 mil millones de parámetros activos (137B total), MAI-Code-1-Flash ya está generalmente disponible en todos los niveles de GitHub Copilot y a través de la API de Azure Foundry. Obtiene un 51.2% en SWE-Bench Pro — una ventaja de 16 puntos sobre Claude Haiku 4.5 — mientras usa hasta un 60% menos de tokens. A $0.75 por millón de tokens de entrada y $4.50 por millón de tokens de salida, es aproximadamente 3× más barato que GPT-4o a escala.
Microsoft ha confirmado que MAI-Code-1-Flash se convertirá en el modelo predeterminado de Copilot para agosto de 2026, con una ventana de transición de tres meses para GPT-4 Turbo hasta noviembre. Si estás ejecutando GitHub Copilot en tu organización de ingeniería, esta transición ya está en tu hoja de ruta, hayas planeado para ella o no.
Modelos MAI Especializados: Imagen, Transcripción, Voz
Los modelos MAI restantes cubren modalidades más allá del texto y el código:
- MAI-Image-2.5 ocupa el puesto #2 en el leaderboard de edición de imágenes de Arena.ai y está integrado en PowerPoint y OneDrive. Una variante Flash ofrece generación de menor costo a aproximadamente un tercio del precio.
- MAI-Transcribe-1.5 maneja 43 idiomas con una tasa de error de palabras FLEURS del 4.86% — la más baja de cualquier competidor — a aproximadamente 5× la velocidad de modelos rivales. Ya se está implementando en Teams, Copilot y Dynamics 365 Contact Centre.
- MAI-Voice-2 soporta más de 15 idiomas con TTS de sonido natural, adaptación de voz a partir de muestras cortas y salvaguardas integradas contra el uso indebido de clonación de voz.
Los tres están generalmente disponibles en Azure Foundry hoy.
Phi-4: El Estándar de Oro de los SLMs
Ningún otro proveedor iguala a la familia Phi-4 de Microsoft en el rango de 3.8B–15B parámetros. La amplitud de variantes — siete modelos distintos que cubren razonamiento, visión, multimodal y escenarios de borde — combinada con la licencia MIT hace de este el portafolio de modelos de lenguaje pequeños más convincente de la industria.
La Alineación Actual
| Modelo | Parámetros | Contexto | Mejor Para |
|---|---|---|---|
| Phi-4 | 14B | 16K | Matemáticas, codificación, razonamiento |
| Phi-4-mini | 3.8B | 128K | Dispositivos de borde, contexto largo |
| Phi-4-multimodal | 5.6B | 128K | Texto + audio + visión |
| Phi-4-reasoning | 14B | — | Lógica, razonamiento extendido |
| Phi-4-reasoning-plus | 14B | — | Razonamiento mejorado con RL |
| Phi-4-mini-reasoning | 3.8B | 32K–64K | Razonamiento ligero |
| Phi-4-reasoning-vision-15B | 15B | — | Razonamiento multimodal + visión |
Phi-4 base obtiene un 84.8% en MMLU — rivalizando con Llama 3.3 70B y Qwen 2.5 72B mientras requiere 4–5× menos VRAM. Phi-4-mini funciona en máquinas con 8GB de RAM y dispositivos Raspberry Pi 5 con ~3GB de VRAM (cuantización Q4). Phi-4-reasoning-plus supera a o1-mini de OpenAI en los clasificatorios de matemáticas AIME 2025.
El destacado para los arquitectos empresariales es Phi-4-reasoning-vision-15B. Lanzado en marzo de 2026, combina un codificador de visión SigLIP-2 con la base Phi-4-Reasoning y puede alternar entre modos de razonamiento y no razonamiento — sin cadena de pensamiento forzada para cada entrada. Su capacidad de screen grounding (identificar elementos de UI por coordenadas) lo hace fundamental para agentes de UI autónomos y herramientas RPA. Con 15B parámetros compitiendo con modelos que requieren 10× el cómputo, es un candidato sólido para cargas de trabajo de visión-razonamiento on-premise.
La única limitación que vale la pena señalar: Phi-4 base tiene una ventana de contexto de 16K — corta para su clase. Si necesitas procesamiento de contexto largo, la ventana de 128K de Phi-4-mini es la mejor opción a pesar de la menor calidad por parámetro.
Phi-3 y Phi-3.5 están oficialmente reemplazados. Microsoft recomienda que todos los proyectos nuevos usen Phi-4-mini. Las variantes heredadas permanecen disponibles en Hugging Face bajo licencia MIT pero están en el cronograma de retiro de Foundry.
Aion 1.0: IA en el Dispositivo como Capa de Plataforma
Aion 1.0, anunciado en Build 2026, es la familia de modelos en el dispositivo más nueva de Microsoft — y representa un enfoque categóricamente diferente para la IA local.
Aion 1.0 Instruct es un SLM ligero para resúmenes, reescritura, clasificación de intenciones y accesibilidad. Funciona en CPU, GPU o NPU sin GPU dedicada requerida, y está actualmente disponible en Edge Canary/Dev con pesos abiertos esperados en Hugging Face este mes.
Aion 1.0 Plan es la oferta más ambiciosa: un modelo de 14B parámetros con una ventana de contexto de 32K diseñado para flujos de trabajo agentivos en el dispositivo — razonamiento, llamada a herramientas, gestión de archivos y orquestación de subagentes. Se envía incorporado en dispositivos Windows compatibles como parte del Windows Agent Framework (de código abierto en Build 2026) y requiere una PC Copilot+ con NPU de ≥40 TOPS (Snapdragon X Elite, Intel Lunar Lake) o una GPU NVIDIA RTX 30+ / AMD Radeon RX 9060+.
La distinción clave: Aion 1.0 Plan no es un chatbot. Es un runtime de agente que razona sobre la intención del usuario y orquesta subagentes localmente. Para equipos de ingeniería que construyen aplicaciones Windows nativas de IA, esta es la base para “inteligencia sin medición” — cero dependencia de la nube, cero costo marginal por inferencia.
Phi Silica: Un Componente de Plataforma Windows con Servicio
Phi Silica merece atención porque representa un nuevo paradigma operativo: modelos de IA como componentes del sistema operativo. Este modelo Transformer optimizado para NPU se envía con PC Windows Copilot+ y recibe actualizaciones regulares a través de Windows Update, completas con números de versión, registros de cambios y paquetes KB por proveedor de silicio.
Las actualizaciones de mayo de 2026 (v1.2605.856.0) trajeron optimizaciones específicas para AMD que afirman hasta un 30% más de rapidez en respuestas en el dispositivo. Una ruta de GPU experimental ahora extiende la IA local a PC que no son Copilot+ con tarjetas NVIDIA RTX 30+ (6GB VRAM). El acceso para desarrolladores requiere un token de desbloqueo de funcionalidad de acceso limitado a través del Windows App SDK.
Si estás implementando PC Copilot+ en tu organización, Phi Silica ya se está ejecutando — y actualizándose — ya sea que lo rastrees o no. Los equipos de TI deberían agregarlo a su inventario y monitoreo de actualizaciones.
Florence-2: El Caballo de Batalla Silencioso
No se ha anunciado Florence-3. Florence-2, introducido en junio de 2024, sigue siendo el motor de visión de facto en todos los servicios de Azure AI de Microsoft — y por una buena razón. Su arquitectura unificada secuencia a secuencia basada en prompts maneja más de 12 tareas de visión con un único conjunto de pesos: detección de objetos, segmentación, descripción, anclaje visual, OCR y descripción de regiones densas.
Con variantes que van desde 0.23B (base, implementable en CPU) hasta 0.77B (large, grado de producción), Florence-2 impulsa Azure AI Vision Image Analysis 4.0 y soporta OCR en 164 idiomas. Las APIs heredadas de Azure Vision (v1.0–3.1) se retirarán el 13 de septiembre de 2026 — si no has migrado al SDK Image Analysis 4.0 basado en Florence, esa fecha límite se acerca.
El ajuste fino con LoRA en conjuntos de datos especializados ha demostrado >98% de precisión en aplicaciones de dominio específico. La comunidad de Hugging Face sigue activa, y el paquete NuGet nativo de C#/.NET facilita la integración .NET a través del runtime ONNX.
MAI-DS-R1: Post-Entrenamiento de Seguridad en Pesos Abiertos
Distinto del MAI-Thinking-1 entrenado desde cero, MAI-DS-R1 es la variante post-entrenada de Microsoft de DeepSeek-R1 (671B). El equipo de Microsoft AI modificó el modelo para seguridad y capacidad de respuesta: responde al 99.3% de los prompts previamente bloqueados (una mejora de 2.2×), reduce el contenido dañino en más del 50% en HarmBench y mantiene las capacidades de razonamiento originales en matemáticas, codificación y conocimiento general.
Publicado bajo licencia MIT con API alojada (Azure Foundry) y pesos abiertos (Hugging Face), incluyendo una variante cuantizada FP8 para requisitos de VRAM más bajos. Para organizaciones que desean el poder de razonamiento de DeepSeek-R1 con salvaguardas de seguridad de grado empresarial, esta es la versión a evaluar.
El Intercambio de Modelos de Copilot Está en Curso
La arquitectura multi-modelo de Copilot no es marketing — es infraestructura de producción. A julio de 2026:
- Microsoft 365 Copilot enruta prompts de Excel y Outlook a modelos MAI (confirmado por Bloomberg)
- GitHub Copilot transiciona a MAI-Code-1-Flash como predeterminado para agosto de 2026
- La generación de imágenes en PowerPoint y OneDrive usa MAI-Image-2.5
- La transcripción de Teams está implementando MAI-Transcribe-1.5
- La inferencia de Windows en el dispositivo usa Phi Silica y Aion 1.0
- GPT-5.6 sigue siendo el “modelo preferido” designado para Microsoft 365 Copilot (a partir del 9 de julio), pero la lógica de enrutamiento favorece cada vez más a los modelos propios donde la economía lo permite
El objetivo declarado de Suleyman: “Pagamos mucho dinero a Anthropic — así que nuestro objetivo es reducir y finalmente eliminar ese costo.” La trayectoria es clara.
Evaluación Estratégica
Microsoft es ahora la única empresa además de Google y Apple con un portafolio de IA completo: silicio personalizado (Maia 200), modelos fronterizos en la nube (MAI), SLMs en el borde (Phi-4), modelos en el dispositivo (Aion, Phi Silica), un modelo fundacional de visión (Florence-2) y una capa de orquestación (Copilot).
Para CTOs y líderes de ingeniería, las conclusiones prácticas:
MAI-Code-1-Flash es el punto de decisión inmediato. Si usas GitHub Copilot, el cambio de modelo se acerca. Pruébalo ahora a través del selector de modelos de VS Code y mide el impacto en los flujos de trabajo de tu equipo.
Phi-4 sigue siendo la mejor opción de SLM para implementación on-premise o en el borde. Licencia MIT, benchmarks probados y una variante para casi cada caso de uso. Comienza con Phi-4-mini para el borde y Phi-4-reasoning-vision-15B para tareas de visión-razonamiento.
MAI-Thinking-1 merece seguimiento pero no compromiso todavía. Vista previa privada, benchmarks auto-reportados, sin precios publicados. Haz seguimiento, solicita acceso a la vista previa si tienes la relación, pero no bases las decisiones de arquitectura de 2026 en ello.
La migración de Florence-2 es una fecha límite, no una opción. Las APIs heredadas de Azure Vision se retiran el 13 de septiembre de 2026. Migra a Image Analysis 4.0 ahora.
Aion 1.0 Plan es el que hay que observar para aplicaciones Windows nativas. Un runtime de agente en el dispositivo de 14B con llamada a herramientas y orquestación de subagentes es un paso significativo hacia la IA agentiva local. Evalúalo junto con tu cronograma de implementación de PC Copilot+.
Espera un uso creciente de modelos MAI en Copilot, lo configures o no. Los incentivos de costos de Microsoft se alinean con el enrutamiento a sus propios modelos. Planifica una experiencia de Copilot que sea progresivamente menos OpenAI y más MAI.
La jugada de IA de pila completa ya no es aspiracional. Se está enviando — en producción, a escala, con una trayectoria clara hacia la autosuficiencia.
Sigue la conversación en x.com/kkaminsk para análisis semanales de Microsoft AI.