La estrategia de modelos de IA propios de Microsoft ha llegado al punto en que las piezas no solo se lanzan — están desplazando a los modelos de terceros en producción. El punto de inflexión de esta semana: MAI-Code-1-Flash es ahora el modelo de codificación predeterminado en todo GitHub Copilot, reemplazando a GPT-4 Turbo con una ventana de respaldo de tres meses que termina en noviembre de 2026.
Para los líderes de ingeniería, la pregunta ha pasado de “¿puede Microsoft construir sus propios modelos?” a “¿con qué agresividad debo trasladar las cargas de trabajo a los MAI de primera parte frente a seguir con GPT-5.6 y Claude?” Esta edición cubre la transición de enrutamiento de Copilot, el calendario del modelo local Aion 1.0, la fecha límite de Azure Vision API en seis días, y el modelo Phi-4-reasoning-vision que está estableciendo silenciosamente un nuevo estándar en razonamiento multimodal de pesos abiertos.
MAI-Code-1-Flash: el predeterminado de Copilot ahora es de primera parte
MAI-Code-1-Flash alcanzó disponibilidad general el 26 de junio en todos los niveles de Copilot — de Free a Max — y se convirtió en el modelo de codificación predeterminado en agosto de 2026. La arquitectura es un diseño de mezcla dispersa de expertos — 5 mil millones de parámetros activos de un total de 137 mil millones, contexto de 256K — optimizado para los entornos de VS Code y GitHub Copilot CLI.
SWE-Bench Pro se sitúa en 51,2%, superando a Claude Haiku 4.5 por 16 puntos (35,2%) usando hasta un 60% menos de tokens. Precio: $0,75/1M de entrada y $4,50/1M de salida — muy por debajo de los comparables de terceros. El modelo se entrenó directamente sobre los entornos de producción de GitHub Copilot y repositorios de código con licencia, lo que explica su fortaleza en codificación agéntica.
El plan de transición importa si ejecuta Copilot en producción: GPT-4 Turbo permanece disponible como respaldo hasta noviembre de 2026, después de lo cual MAI-Code-1-Flash se ejecutará exclusivamente en los aceleradores Maia 200 de Microsoft. Si tiene ingeniería de prompts o pipelines de evaluación fijados al comportamiento de GPT-4 Turbo, ahora es el momento de probar contra MAI-Code-1-Flash.
Enrutamiento de Copilot: qué corre en MAI frente a terceros
Bloomberg confirmó que Microsoft 365 Copilot ahora enruta los prompts de Excel y Outlook a los modelos MAI. La división actual:
Las tareas habituales — redacción de respuestas de correo en Outlook, resumen de reuniones, generación de fórmulas en Excel, codificación en VS Code (MAI-Code-1-Flash), generación de imágenes en PowerPoint y OneDrive (MAI-Image-2.5) y transcripción en Teams (MAI-Transcribe-1.5) — se enrutan a MAI de primera parte. El análisis novedoso de documentos largos no estructurados, el razonamiento complejo de varios pasos y la generación creativa que requiere criterio estilístico siguen enrutándose a GPT-5.6 y Claude; GPT-5.6 sigue siendo el modelo preferido para Microsoft 365 Copilot, pero el enrutamiento favorece cada vez más a la primera parte donde la economía lo permite.
La trayectoria es clara: para finales de 2026, la mayoría de las tareas habituales de Copilot se ejecutarán en modelos MAI. Presupueste los costos de API de las implementaciones de Microsoft 365 Copilot asumiendo que el enrutamiento de primera parte se expande, no se contrae.
Aion 1.0: la IA local de Windows recibe un calendario real
Aion 1.0, anunciado en Build 2026, es la apuesta de “inteligencia sin medidor” de Microsoft — cero dependencia de la nube, cero costo marginal de inferencia. Reemplaza a Phi Silica como modelo local de Windows, en dos variantes:
Aion 1.0 Instruct maneja resúmenes, reescritura, clasificación de intenciones y accesibilidad en CPU, GPU o NPU — sin necesidad de hardware dedicado. La vista previa para desarrolladores ya está disponible en las versiones Edge Canary y Dev (edge://flags, “Enable prerelease on-device language model”).
Aion 1.0 Plan es la variante más pesada: 14 mil millones de parámetros, contexto de 32K, diseñada para razonamiento agéntico local, incluida la llamada de herramientas, la gestión de archivos y la orquestación de subagentes. Se incluirá de fábrica en dispositivos Windows capaces a través de Windows Agent Framework, que Microsoft publicó como código abierto en Build 2026. Requisitos de hardware: PC Copilot+ con NPU de 40+ TOPS (Snapdragon X Elite, Intel Lunar Lake) o GPU NVIDIA RTX 30+ / AMD Radeon RX 9060+.
Calendario: paquete de pruebas independiente el 1 de octubre, despliegue a Windows Insiders el 23 de octubre y disponibilidad general el 24 de noviembre de 2026 — Phi Silica se elimina de los dispositivos minoristas el mismo día. Los adaptadores LoRA existentes de Phi Silica no se transferirán a Aion — planifique el reentrenamiento ahora.
Azure Vision API: retiro definitivo en seis días
Lo más urgente de la semana: las API heredadas de Azure Vision (versiones 1.0–3.1) se retiran el 13 de septiembre de 2026 — un retiro definitivo, no una desaprobación suave. Cualquier aplicación que aún llame a esos endpoints recibirá respuestas 410 Gone.
El destino de migración es el SDK de Image Analysis 4.0 basado en Florence-2. Florence-2 sigue siendo el modelo fundacional de visión de Microsoft: una arquitectura seq2seq unificada que maneja más de 12 tareas de visión con un solo conjunto de pesos, incluida la detección de objetos, segmentación, captioning, OCR en 164 idiomas y anclaje visual. La variante grande (0,77 mil millones de parámetros) es de grado de producción; la variante base (0,23 mil millones) se ejecuta en CPU estándar.
La adopción subraya su estabilidad: alrededor de 2,66 millones de descargas mensuales para el modelo base y 813.000 para large en Hugging Face hasta julio de 2026. No se ha anunciado Florence-3. Después del 13 de septiembre, Florence-2 a través de Image Analysis 4.0 es la única ruta compatible para nuevos pipelines de visión en Azure.
Phi-4-Reasoning-Vision-15B: el avance multimodal de pesos abiertos
Publicado el 4 de marzo de 2026 bajo licencia MIT, Phi-4-reasoning-vision-15B es el lanzamiento Phi más significativo del año. Combina la columna vertebral lingüística de Phi-4-reasoning con un codificador de visión SigLIP-2 mediante fusión intermedia, totalizando aproximadamente 15 mil millones de parámetros con una ventana de entrada de 16.384 tokens.
La característica destacada: activación dinámica de razonamiento. El modelo emite un bloque de pensamiento solo cuando la tarea requiere razonamiento de cadena de pensamiento — para tareas de percepción como OCR, captioning y anclaje, devuelve respuestas directas. Los desarrolladores pueden forzar el comportamiento con las etiquetas think y nothink. El mecanismo: un conjunto de datos de modo mixto con 20% de ejemplos de pensamiento y 80% sin pensamiento.
Los puntos de referencia impresionan para un modelo de pesos abiertos de 15B: ScreenSpot v2 alcanza 88,2% (frente al 28,5% del anterior Phi-4-multimodal-instruct), MathVista 75,2, AI2D 84,8 y ChartQA 83,3. El entrenamiento tomó cuatro días en 240 GPU NVIDIA B200 con aproximadamente 200 mil millones de tokens multimodales curados.
Para los CTO que evalúan razonamiento multimodal local, este modelo ocupa un punto ideal: supera a modelos 10 veces más grandes en puntos de referencia de razonamiento visual mientras se ejecuta en hardware que un solo equipo puede aprovisionar. Complementa, no reemplaza, a Florence-2 — Florence-2 es la capa de infraestructura de visión de alto rendimiento; Phi-4-reasoning-vision es la capa de razonamiento encima.
Phi-Ground-Any-4B: anclaje de GUI para uso de computadora
Publicado en mayo de 2026 por Microsoft Research Asia, Phi-Ground-Any-4B es un modelo de anclaje de GUI de 4 mil millones de parámetros ajustado a partir de Phi-3.5-vision-instruct. Produce coordenadas de clic directamente desde capturas de pantalla para pipelines de agentes de uso de computadora, con los mejores resultados de la familia en la clase de menos de 10B: ScreenSpot-Pro en aproximadamente 55,0 y UI-Vision en 36,2.
La tecnología ya está integrada en la función “Vision Highlighting” de Windows Copilot. Los pesos están en Hugging Face (microsoft/Phi-Ground-Any, licencia MIT) y requieren aproximadamente 8GB+ de VRAM para inferencia. Para los equipos que construyen agentes de uso de computadora, este es el modelo de pesos abiertos contra el cual compararse.
VibeVoice: TTS en tiempo real de menos de 300 ms con 0,5B
VibeVoice-Realtime-0.5B (licencia MIT) ofrece una latencia de menos de 300 ms hasta el primer token audible para conversión de texto a voz en streaming. La arquitectura combina una columna vertebral Qwen2.5-0.5B con un tokenizador acústico sigma-VAE y un cabezal de decodificación por difusión, y soporta inglés y otros nueve idiomas, compitiendo con VALL-E 2 y Voicebox a una fracción de su escala. Nota sobre la columna vertebral Qwen2.5: es un modelo de procedencia híbrida, no un entrenamiento puro desde cero — pero el pipeline de TTS y el entrenamiento son de Microsoft.
Qué seguir la próxima semana
- 13 de septiembre: las API heredadas de Azure Vision se retiran — verifique su estado de migración hoy.
- 1 de octubre: paquete de pruebas independiente de Aion 1.0 Instruct.
- 23 de octubre: Aion 1.0 Instruct llega a Windows Insiders.
- 24 de noviembre: GA de Aion 1.0; Phi Silica deja el Windows minorista.
- Noviembre de 2026: termina el respaldo de GPT-4 Turbo — MAI-Code-1-Flash es el único predeterminado.
El patrón es consistente: Microsoft está reemplazando metódicamente las dependencias de modelos de terceros con alternativas de primera parte en las capas de nube, edge y dispositivo. Los modelos no siempre lideran la frontera — las pruebas independientes sitúan a MAI-Thinking-1 aproximadamente en la clase de DeepSeek V3.2 — pero la economía y la profundidad de integración se están convirtiendo en una ventaja estructural. Para los equipos de ingeniería, la postura pragmática es comenzar a evaluar los modelos MAI ahora para cargas de trabajo habituales, manteniendo los modelos frontera de terceros para tareas donde las diferencias medibles de calidad aún justifican la prima.
Siga https://x.com/kkaminsk para análisis en tiempo real a medida que estos modelos se lanzan.