La semana pasada cubrimos la confirmación de Bloomberg de que Microsoft está enrutando cargas de trabajo de Office de producción a sus propios modelos MAI. Esta semana, el panorama es más claro: la pila de IA propia de Microsoft ya no es aspiracional. Está desplegada, con precios y arquitectada como una vertical completa desde el dispositivo hasta la nube. Para CTOs y líderes de ingeniería, la pregunta ha pasado de “¿están listos los modelos de Microsoft?” a “¿cómo arquitectamos alrededor de una pila donde un solo proveedor controla silicio, modelos y aplicaciones?”
La Pila Propia Completa
Microsoft ahora opera el único portafolio de IA de pila completa fuera de Google y Apple. Esta es la arquitectura a julio de 2026:
En el dispositivo (Aion 1.0): Inferencia ligera para resúmenes, reescritura y clasificación de intenciones — funcionando en CPU, GPU o NPU dentro de Edge y Windows. La variante Aion 1.0 Plan de 14B parámetros maneja flujos de trabajo agentivos con llamada a herramientas y orquestación de subagentes a través del Windows Agent Framework. Se esperan pesos abiertos en Hugging Face este mes.
En el borde (Familia Phi-4): Diez modelos con licencia MIT que abarcan de 3.8B a 15B parámetros. Phi-4-mini funciona en Raspberry Pi 5. Phi-4-mini-flash-reasoning utiliza la arquitectura híbrida SambaY (Mamba + atención de ventana deslizante + Unidades de Memoria de Compuerta) para ganancias de rendimiento de 10×. Phi-4-reasoning-vision-15B maneja razonamiento multimodal con un codificador de visión SigLIP-2.
Frontera en la nube (Familia MAI): Siete modelos anunciados en Build 2026, cubriendo razonamiento (MAI-Thinking-1), codificación agentiva (MAI-Code-1-Flash), generación de imágenes (MAI-Image-2.5 y Flash), voz a texto (MAI-Transcribe-1.5) y texto a voz (MAI-Voice-2 y Flash). Todos entrenados desde cero con datos con licencia comercial con cero destilación de modelos de terceros.
Silicio (Maia 200): Proceso de 3nm, 140B transistores, 216GB HBM3e. Ejecutando inferencia MAI en producción hoy. MAI-Code-1-Flash migrará completamente a Maia 200 para agosto de 2026.
Modelos fundacionales (MAI-1-preview): El primer modelo fundacional de Microsoft entrenado de extremo a extremo, actualmente en pruebas en LMArena. Información pública limitada, pero señala la intención de Microsoft de competir al nivel de modelo fronterizo — no solo en modelos específicos de tareas.
Esto no es una colección de soluciones puntuales. Es una pila arquitectónica deliberada donde cada capa alimenta a la siguiente.
Dentro de la Arquitectura de Enrutamiento de Copilot
El detalle más estratégicamente importante de las últimas dos semanas no es el lanzamiento de un modelo — es la divulgación de cómo Microsoft 365 Copilot enruta el tráfico. Copilot no es un producto de un solo modelo. Utiliza una capa de categorización de tareas que clasifica cada interacción por tipo de tarea, complejidad y requisito de calidad antes de seleccionar un modelo.
Lo que se enruta a MAI (propio, alto volumen):
- Redacción de respuestas de correo electrónico desde el contexto del hilo (Outlook)
- Resumen de hilos y reuniones
- Generación de fórmulas de hoja de cálculo desde lenguaje natural (Excel)
- Generación de líneas de asunto y encabezados
- Extracción de datos estructurados de documentos de formato fijo
- Extracción de tareas y elementos de acción de transcripciones de reuniones
- Codificación agentiva en VS Code y GitHub Copilot CLI (MAI-Code-1-Flash)
- Generación y edición de imágenes en PowerPoint y OneDrive (MAI-Image-2.5)
Lo que se enruta a modelos fronterizos de terceros:
- Análisis novedoso en documentos largos no estructurados
- Razonamiento de múltiples pasos con dependencias complejas
- Generación creativa que requiere criterio estilístico
- Tareas sensibles o ambiguas donde el costo del error es alto
El enrutamiento es dinámico. A medida que los modelos MAI mejoran, el envolvente de enrutamiento se expande. Microsoft tiene todos los incentivos para trasladar más tráfico a sus propios modelos — cada consulta enrutada a MAI en Maia 200 elimina el margen por token pagado a OpenAI o Anthropic.
Notablemente, Copilot Cowork — el producto de agente autónomo de Microsoft lanzado el 16 de junio — funciona con Anthropic Claude (Opus 4.8 y Sonnet 4.6), no con MAI. El modelo Cowork 1 ajustado de Microsoft fue anunciado pero aún no está impulsando el agente. Esta es una señal honesta: los modelos MAI están listos para producción para inferencia de productos básicos, pero Microsoft reconoce dónde los modelos fronterizos de terceros aún tienen ventaja.
Precios de MAI: La Historia de la Economía Unitaria
Microsoft ha publicado precios para sus modelos MAI en Foundry, y los números merecen ser examinados por cualquier equipo que haga modelos de costos:
- MAI-Transcribe-1: $0.36/hora de habla transcrita (43 idiomas, 4.86% WER en FLEURS — el más bajo de cualquier competidor)
- MAI-Voice-1: $22/1M caracteres (15+ idiomas con adaptación de voz y control emocional)
- MAI-Image-2.5: $5/1M tokens de entrada de texto, $8/1M tokens de entrada de imagen, $47/1M tokens de salida de imagen
- MAI-Code-1-Flash: Posicionado más barato que Claude Haiku mientras obtiene un 51.2% en SWE-Bench Pro (vs 35.2% de Haiku) y usando 60% menos tokens
El patrón de precios es agresivo. Microsoft no está poniendo precio a MAI a la par con alternativas de terceros — está poniendo precios por debajo mientras afirma mejor rendimiento en benchmarks específicos. Para cargas de trabajo de alto volumen (transcripción, generación de imágenes, finalización de código), el diferencial de costos se acumula rápidamente.
La historia de distribución también importa aquí. Los modelos MAI están disponibles en Microsoft Foundry, el MAI Playground (pruebas web gratuitas) y — notablemente — en OpenRouter, Fireworks AI y Baseten. Esta es la primera vez que Microsoft distribuye modelos propios en plataformas de inferencia que no son Azure. Los equipos empresariales bloqueados con otros proveedores de nube ahora pueden acceder a los modelos MAI sin compromisos con Azure.
Florence-2: Estabilidad Sobre Hype
Mientras que Phi-4-reasoning-vision-15B acapara titulares como el sucesor multimodal, Florence-2 continúa como el caballo de batalla empresarial para visión por computadora pura. No hay Florence-3 en la hoja de ruta. En cambio, Microsoft está invirtiendo en la madurez del ecosistema: el paquete NuGet de C#/.NET para ejecución local de ONNX, la integración con NVIDIA DeepStream para análisis de video en tiempo real en el borde y el SDK Azure AI Vision Image Analysis 4.0 con OCR en 164 idiomas.
La arquitectura unificada basada en prompts de Florence-2 — un conjunto de pesos manejando más de 12 tareas de visión mediante prompts de texto — sigue siendo arquitectónicamente elegante. Para equipos que construyen pipelines de CV de producción, la elección es clara: Florence-2 para tareas de visión ligeras y de alto rendimiento; Phi-4-reasoning-vision-15B para razonamiento multimodal que requiere generación de lenguaje y cadena de pensamiento.
La Jugada de Densidad de Phi-4
La familia Phi-4 merece atención específica de los líderes de ingeniería que evalúan IA en el borde. La tesis central es la densidad — modelos de 14B compitiendo con modelos de clase 70B en benchmarks de matemáticas y código.
Phi-4-reasoning-plus obtiene un 82.5% en AIME 2025, competitivo con DeepSeek-R1-Distill-Llama-70B con un quinto del tamaño. Phi-4-mini (3.8B) supera a muchos modelos de clase 8B en MMLU con un vocabulario de 200K tokens y llamada a funciones nativa en más de 22 idiomas. La advertencia de SimpleQA es importante — Phi-4 obtiene solo un 3.0 en recuerdo factual, lo que lo hace inadecuado como asistente de conocimiento general sin aumento de recuperación.
La innovación arquitectónica en Phi-4-mini-flash-reasoning es el destacado. La arquitectura SambaY — que combina modelos de espacio de estados Mamba, atención de ventana deslizante y Unidades de Memoria de Compuerta — representa una auténtica desviación de los Transformers estándar. Una mejora de rendimiento de 10× con 2-3× menor latencia no es una optimización incremental. Es el tipo de cambio arquitectónico que transforma la economía de implementación para la IA en el borde.
Qué Significa Esto para la Estrategia Empresarial
Tres conclusiones para los CTOs que toman decisiones de infraestructura este trimestre:
1. El cálculo del bloqueo de proveedor ha cambiado. La integración vertical de Microsoft — desde silicio hasta modelos y aplicaciones — era históricamente una preocupación de bloqueo. En 2026, es una estrategia de reducción de costos. Los modelos MAI en silicio Maia eliminan los márgenes de terceros. La pregunta es si los ahorros de costos justifican el compromiso arquitectónico.
2. La evaluación de modelos debe ser específica para la carga de trabajo. La arquitectura de enrutamiento de Microsoft dentro de Copilot es la plantilla. No estandarices en un modelo para todas las tareas. Enruta la inferencia de productos básicos (resúmenes, extracción estructurada, generación de fórmulas) a modelos rentables como MAI. Enruta el razonamiento complejo a modelos fronterizos. Los ahorros están en el enrutamiento, no en la elección del modelo.
3. La familia Phi-4 de pesos abiertos es la apuesta más segura para el borde. Con licencia MIT, más de 10 variantes, funcionando en todo, desde Raspberry Pi hasta NVIDIA Jetson. Sin bloqueo de proveedor, sin riesgo de licencias y competitivo con modelos 5× su tamaño. Para equipos que implementan inferencia local — ya sea por costo, latencia o soberanía de datos — Phi-4 es la elección predeterminada.
La estrategia de IA de Microsoft en 2026 no se trata de alcanzar a OpenAI o Anthropic. Se trata de construir una pila completa, verticalmente integrada, donde Microsoft controla cada capa. Los modelos están listos. El silicio está listo. La pregunta para los compradores empresariales es si la prima de integración vale la pena la compensación en flexibilidad.
Sigue los desarrollos en X: https://x.com/kkaminsk