La semana pasada cubrimos la confirmación de Bloomberg de que Microsoft está enrutando tráfico de producción de Copilot a sus propios modelos MAI. Esta semana, surge el panorama más profundo: Microsoft ha ensamblado una pila de IA de primera parte completa que abarca silicio personalizado, modelos frontera en la nube, modelos edge de pesos abiertos, agentes en el dispositivo y la capa de orquestación que los une. La dependencia de OpenAI que definió la primera ola de Copilot está disminuyendo — no por antagonismo, sino mediante un reemplazo arquitectónico deliberado.
Para los líderes de TI, esta es la semana para comprender la forma completa del portafolio de modelos de Microsoft. Las decisiones de arquitectura que se tomen ahora — qué modelos estandarizar, dónde ejecutar la inferencia, cómo gobernar las identidades de los agentes — estarán moldeadas por esta pila durante los próximos años.
1. La Familia MAI: Siete Modelos, Cero Destilación
La familia MAI (Microsoft AI), presentada en Build 2026, representa la inversión interna en IA más significativa de Microsoft. Siete modelos, todos entrenados desde cero por el Equipo de Superinteligencia de IA de Mustafa Suleyman utilizando el pipeline interno de entrenamiento “Hill-Climbing Machine”. Sin destilación de OpenAI ni de ningún tercero. Sin datos de entrenamiento sintéticos. Solo contenido generado por humanos con licencia comercial, con benchmarks descontaminados.
MAI-Thinking-1 es el modelo de razonamiento insignia — una arquitectura sparse Mixture-of-Experts con aproximadamente 35B parámetros activos de ~1T totales, una ventana de contexto de 256K y puntuaciones de referencia que igualan a Claude Opus 4.6 en SWE-Bench Pro (~53%). Obtiene 97.0% en AIME 2025 y 94.5% en AIME 2026. Microsoft afirma aproximadamente 10× de eficiencia de tokens frente a GPT-5.5. Actualmente está en vista previa privada en Microsoft Foundry, con acceso de nivel gratuito en GitHub Models y disponibilidad en OpenRouter, Fireworks AI y Baseten — la primera vez que Microsoft lanza modelos de primera parte en plataformas de inferencia que no son Azure.
MAI-Code-1-Flash es el modelo que la mayoría de las empresas encontrarán primero. Con ~5B parámetros activos de ~137B totales mediante sparse MoE, obtiene 51.2% en SWE-Bench Pro — una ventaja de 16 puntos sobre Claude Haiku 4.5 con 35.2% — mientras usa hasta un 60% menos de tokens. Está disponible de forma general en GitHub Copilot en todos los niveles desde el 26 de junio y está en camino de reemplazar a GPT-4 Turbo como modelo predeterminado de Copilot en agosto de 2026. Una ventana de retroceso de tres meses a GPT-4 Turbo estará vigente hasta noviembre de 2026, después de lo cual MAI-Code-1-Flash se convertirá en el predeterminado ejecutándose en los aceleradores Maia 200 de Microsoft.
La familia se extiende más allá del razonamiento y el código. MAI-Image-2.5 ocupa el puesto #2 en el ranking Arena de edición de imágenes por IA y está integrado en PowerPoint y OneDrive. MAI-Transcribe-1.5 cubre 43 idiomas con una tasa de error de palabras del 4.86% en el benchmark FLEURS — la más baja de cualquier competidor — a aproximadamente 5× la velocidad de los modelos competidores, integrándose en Copilot, Teams y Dynamics 365 Contact Centre. MAI-Voice-2 soporta 15+ idiomas con clonación de voz zero-shot a partir de 5-60 segundos de audio de referencia y una tasa de preferencia ciega del 72% sobre su predecesor.
Lo que esto significa para los líderes de TI: La familia MAI no es un proyecto de investigación — es infraestructura de producción. MAI-Code-1-Flash ya está GA en GitHub Copilot. MAI-Transcribe-1.5 se está integrando en Teams y Copilot. MAI-Image-2.5 está activo en PowerPoint. La capa de enrutamiento de modelos dentro de Copilot está favoreciendo cada vez más a estos modelos de primera parte por razones de costo y latencia. Las organizaciones deben esperar que la mayoría de las tareas comunes de Copilot — redacción, resumen, transcripción, generación de imágenes — se ejecuten en modelos MAI para finales de 2026, con modelos frontera como GPT-5.6 y Claude reservados para razonamiento complejo.
2. Phi-4: SLMs de Pesos Abiertos que Rinden por Encima de su Categoría
La familia Phi-4 ahora abarca 10+ modelos desde 3.8B hasta 15B parámetros, todos con licencia MIT. El tema es la densidad — modelos de 14B compitiendo con modelos de clase 70B en benchmarks de matemáticas y codificación.
Phi-4-reasoning-plus (14B) obtiene 82.5% en AIME 2025 y ocupa el puesto #1 entre los modelos open-source en HumanEval+ con 0.929, competitivo con DeepSeek-R1-Distill-Llama-70B con una quinta parte del tamaño. Phi-4-mini (3.8B) se ejecuta en una Raspberry Pi 5 con 73% MMLU — superando a muchos modelos de clase 8B. Phi-4-mini-flash-reasoning utiliza una arquitectura SambaY (una hibridación de modelos de espacio de estados Mamba, atención de ventana deslizante y unidades de memoria compuerta) que logra hasta 10× más rendimiento y 2-3× de reducción de latencia frente a Phi-4-mini-reasoning. Esta es una auténtica desviación arquitectónica de los Transformers vanilla, no solo un modelo más pequeño.
La adición más significativa reciente es Phi-4-reasoning-vision-15B (marzo de 2026), que combina generación de texto con comprensión visual profunda y razonamiento de cadena de pensamiento. Obtiene 88.2% en ScreenSpot v2 para anclaje de GUI, 75.2% en MathVista y 84.8% en diagramas científicos AI2D. Utiliza un codificador de visión SigLIP-2 con modos duales — modo de razonamiento para análisis complejo y modo de respuesta directa para consultas simples. Este modelo efectivamente reemplaza la línea de visión Florence para nuevos casos de uso multimodales.
Lo que esto significa para los líderes de TI: Los modelos Phi-4 son la historia del despliegue en el borde. Se ejecutan en portátiles estándar, teléfonos inteligentes e incluso navegadores mediante WebLLM. Para organizaciones que construyen capacidades de IA en el dispositivo — transcripción offline, análisis de documentos, asistencia de código local — Phi-4 proporciona modelos de grado de producción sin costo de licencia. La licencia MIT significa que no hay restricciones comerciales. La arquitectura SambaY en Phi-4-mini-flash-reasoning es particularmente interesante para escenarios IoT e integrados donde la latencia importa.
3. Aion 1.0: Inteligencia en el Dispositivo sin Medición
Aion 1.0 es la nueva familia de modelos en el dispositivo de Microsoft, diseñada para Windows y Edge, representando “inteligencia sin medición” — procesamiento de IA local con cero dependencia de la nube y cero costo marginal por inferencia.
Aion 1.0 Instruct es un SLM ligero para tareas de texto cotidianas — resumen, reescritura, clasificación de intenciones. Se ejecuta en CPU, GPU o NPU sin requerir una GPU dedicada. Está disponible ahora en Edge Canary/Dev con Prompt API y Writing Assistance APIs, y se esperan pesos abiertos en Hugging Face en julio de 2026. También impulsa la conversión de voz a texto en el dispositivo mediante la WebSpeech API en Edge 150+.
Aion 1.0 Plan es el modelo más ambicioso — 14B parámetros con una ventana de contexto de 32K, diseñado para flujos de trabajo agénticos en el dispositivo que incluyen razonamiento, llamada a herramientas, gestión de archivos y orquestación de subagentes. Se envía integrado en dispositivos Windows capaces como parte de Windows Agent Framework, que fue open-sourced en Build 2026. Esto no es un chatbot; es un runtime de agente que puede razonar sobre la intención del usuario y orquestar subagentes localmente.
La ruta de hardware es clara: PCs Copilot+ con un mínimo de 40 TOPS NPU (Snapdragon X Elite, Intel Lunar Lake) para la ruta NPU, NVIDIA RTX 30+ o AMD Radeon RX 9060+ para la ruta GPU, y retroceso estándar a CPU de Windows 11. Phi Silica, el modelo anterior en el dispositivo, también se ha expandido de solo NPU a soporte de GPU.
Lo que esto significa para los líderes de TI: Aion completa la pila de modelos de dispositivo a nube de Microsoft: Aion para tareas ligeras en el dispositivo, Phi-4 para razonamiento edge de peso medio, MAI para inferencia frontera en la nube. Para organizaciones preocupadas por la residencia de datos, la latencia o los costos de inferencia en la nube, la pila en el dispositivo se está volviendo viable para cargas de trabajo reales. Windows Agent Framework significa que el propio Windows se está convirtiendo en una plataforma de agentes — los equipos de TI deben comenzar a evaluar qué cargas de trabajo de agentes pueden ejecutarse localmente versus requerir inferencia en la nube, y actualizar las políticas de gestión de dispositivos en consecuencia.
4. La Arquitectura Multi-Modelo de Copilot: El Paradigma del Orquestador
Microsoft 365 Copilot no es un solo modelo — es una capa de orquestación. Una capa de categorización de tareas clasifica cada interacción del usuario por tipo de tarea, complejidad y requisito de calidad, luego enruta al modelo apropiado.
La lógica de enrutamiento actual divide las cargas de trabajo entre modelos MAI para inferencia de alto volumen y modelos frontera (GPT-5.6, Anthropic Claude) para tareas complejas. MAI maneja la redacción de respuestas de correo electrónico, el resumen de hilos y reuniones, la generación de fórmulas de hojas de cálculo, la extracción de datos estructurados y la codificación agéntica. Los modelos frontera manejan análisis novedosos en documentos largos no estructurados, razonamiento de múltiples pasos con dependencias complejas y generación creativa que requiere juicio estilístico.
Notablemente, Copilot Cowork — el producto de agente autónomo de Microsoft — se ejecuta principalmente en Anthropic Claude (Opus 4.8 y Sonnet 4.6), no en MAI. El modelo afinado “Cowork 1” de Microsoft fue anunciado pero aún no impulsa el agente en su lanzamiento. Esta es una elección pragmática: los modelos de Anthropic actualmente lideran en tareas agénticas, y Microsoft no va a sacrificar la calidad del producto por nacionalismo de modelos.
GPT-5.6 fue anunciado como el “modelo preferido” para M365 Copilot el 9 de julio, pero “preferido” no es “exclusivo.” La arquitectura está diseñada para expandir la cuota de enrutamiento de MAI incrementalmente a medida que se validan las capacidades del modelo.
Lo que esto significa para los líderes de TI: La arquitectura multi-modelo es una característica, no una limitación. Significa que Copilot selecciona automáticamente el mejor modelo para cada tarea sin requerir intervención del usuario. Pero también significa que la calidad y el costo del modelo pueden cambiar bajo tus pies a medida que Microsoft ajusta el enrutamiento. Las organizaciones deben monitorear la telemetría de Copilot para entender qué modelos están manejando qué tareas, y validar que la calidad se mantenga consistente a medida que el enrutamiento se desplaza hacia MAI.
5. Maia 200: La Capa de Silicio
Apoyando toda la estrategia MAI está el silicio personalizado de Microsoft. Maia 200 es un acelerador de IA de 3nm con 140 mil millones de transistores y 216GB de memoria HBM3e a 7 TB/s de ancho de banda, ofreciendo un 30% mejor rendimiento por dólar que la generación anterior. Los clústeres escalan hasta 6,144 aceleradores.
Maia 200 está diseñado específicamente para inferencia — específicamente, para ejecutar modelos MAI de manera eficiente en los centros de datos de Azure. El despliegue predeterminado de MAI-Code-1-Flash en GitHub Copilot se ejecutará en Maia 200, no en hardware NVIDIA. Microsoft está controlando toda la pila de inferencia: silicio, arquitectura de modelo, pipeline de entrenamiento y capa de aplicación.
Lo que esto significa para los líderes de TI: La capa de silicio es poco probable que afecte tus operaciones diarias directamente, pero es el fundamento económico de la independencia de modelos de Microsoft. El silicio personalizado significa que Microsoft puede ejecutar sus propios modelos a un costo menor que alquilando capacidad GPU de NVIDIA para modelos de terceros. Esa ventaja de costo se reflejará cada vez más en las decisiones de precios y enrutamiento de Copilot.
6. Florence-2 y la Capa de Infraestructura de Visión
Florence-2 sigue siendo el estándar empresarial para visión por computadora pura, incluso cuando Phi-4-reasoning-vision-15B toma la corona del razonamiento multimodal. No hay Florence-3 en la hoja de ruta. En cambio, Florence-2 (0.23B base, 0.77B grande) continúa impulsando Azure AI Vision Image Analysis 4.0, soportando OCR en 164 idiomas, detección de objetos, segmentación y subtitulado denso en 12+ tareas de visión a través de una única interfaz basada en prompts.
El ecosistema está maduro: un paquete NuGet en C#/.NET para ejecución ONNX local, integración con NVIDIA DeepStream para análisis de video en tiempo real en el borde, y ajuste fino LoRA logrando precisión del 98%+ en conjuntos de datos especializados. Florence-2 es infraestructura — funciona, está implementado y no hay razón para interrumpirlo.
Lo que esto significa para los líderes de TI: Si estás construyendo pipelines de visión por computadora en Azure, Florence-2 sigue siendo la elección correcta. Para nuevos casos de uso multimodales que combinan razonamiento de texto y visión, Phi-4-reasoning-vision-15B es la mejor opción. Los dos modelos sirven propósitos diferentes y coexistirán en el portafolio de Microsoft en el futuro previsible.
Próximos Pasos Estratégicos
- Prepararse para MAI-Code-1-Flash como predeterminado — la transición de agosto de 2026 está a semanas de distancia. Inventaria tu uso de GitHub Copilot y compara la experiencia del desarrollador con el nuevo modelo antes de que sea obligatorio
- Evaluar Phi-4 para despliegue en el borde — si tienes escenarios que requieren IA en el dispositivo (offline, baja latencia, soberanía de datos), la familia Phi-4 con licencia MIT está lista para producción y es gratuita de implementar
- Planificar para Windows Agent Framework — Aion 1.0 Plan se envía en dispositivos Windows capaces y permite la orquestación local de agentes. Actualiza tus políticas de gestión de dispositivos para tener en cuenta los agentes de IA en el dispositivo
- Monitorear el enrutamiento de modelos de Copilot — a medida que Microsoft desplaza más tráfico a modelos MAI, rastrea las métricas de calidad a través de los análisis de Copilot para asegurar que el rendimiento de las tareas se mantenga consistente
- Vigilar los pesos abiertos de Aion — se esperan en Hugging Face en julio de 2026, los pesos abiertos de Aion 1.0 Instruct permitirán escenarios personalizados de IA en el dispositivo sin costo de licencia
- Mapear tu estrategia de modelos — entiende cuáles de tus cargas de trabajo encajan en los niveles Aion (en dispositivo), Phi-4 (borde) o MAI (nube), y comienza a arquitectar para un despliegue de modelos multi-nivel en lugar de un único endpoint en la nube
La pila de modelos de primera parte de Microsoft ahora está completa: silicio Maia 200 en la base, modelos frontera MAI en la nube, modelos de pesos abiertos Phi-4 para el borde, modelos en el dispositivo Aion para Windows, y Copilot como la capa de orquestación. La pregunta para los líderes de TI ya no es si Microsoft puede construir IA competitiva sin OpenAI — han demostrado que pueden. La pregunta es qué tan rápido puede tu organización adaptarse a un mundo multi-nivel y multi-modelo donde el mejor modelo para cada tarea puede ejecutarse en un dispositivo diferente, en un centro de datos diferente o en una arquitectura de silicio completamente diferente.