Dos lanzamientos en dos días. MAI-Code-1.1-Flash se publicó el 11 de agosto con una reducción de costos del 75% frente a su predecesor y nuevo soporte de entrada de imágenes. MAI-Image-2.6 aterrizó el 10 de agosto en el No. 2 de la clasificación text-to-image de Arena, por delante de Google, Meta y xAI. Ambos son modelos de primera parte de Microsoft — entrenados internamente, enrutados a través de Copilot y disponibles en Azure Foundry y en todos los niveles de GitHub Copilot.
La señal es clara: la familia MAI está iterando lo bastante rápido como para desplazar a los modelos de terceros en cargas de trabajo sensibles al costo, al tiempo que mejora la calidad.
MAI-Code-1.1-Flash: más rápido, más barato, multimodal
Las cifras principales son contundentes. En comparación con MAI-Code-1-Flash (publicado en Build 2026 en junio), la versión 1.1 ofrece:
- Reducción de costos del 75%: $0.20/1M de entrada, $0.02/1M en caché, $1.20/1M de salida — frente a $0.75/$0.075/$4.50
- Streaming de tokens un 25% más rápido y 25% menos tokens por tarea
- +22% en Terminal-Bench 2.1 (CLI de GitHub Copilot): 51.7% → 62.9%
- +15% en tareas .NET, con +4% de supervivencia del código y +9% de visitas recurrentes
- 72.6% en SWE-Bench Verified con 8.6K tokens en promedio por tarea resuelta
- Entrada de imágenes — una primicia para la línea MAI-Code, que habilita flujos de trabajo de captura de pantalla a código
La arquitectura sigue siendo un MoE disperso de 138B en total / ~5B activos, con contexto de 256K y salida máxima de 128K, entrenado con 2M de tareas sintéticas y 150K entornos de RL. Ahora es el modelo de producción en todos los niveles de GitHub Copilot — desde Free hasta Enterprise (Business/Enterprise requieren la aceptación del administrador). MAI-Code-1-Flash queda en desuso el 10 de septiembre; el respaldo de GPT-4 Turbo se mantiene hasta noviembre. Si llamas a MAI-Code directamente a través de Azure Foundry, actualiza tus endpoints ahora.
MAI-Image-2.6: persiguiendo a OpenAI en Arena
MAI-Image-2.6 se lanzó el 10 de agosto e inmediatamente se hizo con el No. 2 de la clasificación text-to-image de Arena — por detrás de OpenAI, pero por delante de todos los demás competidores. Las mejoras frente a MAI-Image-2.5 son amplias: +79 Elo en general, +91 Elo específicamente en renderizado de texto, con mejores retratos, imágenes 3D y resultados comerciales fotorrealistas.
Ya está disponible en Arena; MAI Playground, Foundry y otras superficies se desplegarán en las próximas semanas. Microsoft ha mantenido la compatibilidad de API en toda la línea 2.x, por lo que el camino de actualización desde MAI-Image-2.5 ($47/1M) o Flash ($19.50/1M) es sencillo. La implicación práctica: los datos internos de Microsoft muestran una reducción del 84% en costos de GPU frente a GPT-Image-2 en producción. Para la generación de imágenes a escala, esa es una partida que importa.
MAI-Thinking-1: vista previa pública, benchmarks independientes aún pendientes
El modelo de razonamiento insignia (~1T en total / ~35B activos, MoE disperso, contexto de 256K) entró en vista previa pública en Azure Foundry el 12 de agosto. Los benchmarks reportados por Microsoft siguen siendo impresionantes: 97.0% en AIME 2025, 94.5% en AIME 2026, 52.8% en SWE-Bench Pro y una victoria en preferencia a ciegas sobre Claude Sonnet 4.6 en 1,276 tareas a través de Surge.
Pero los benchmarks independientes siguen siendo escasos. La vista previa pública en Foundry significa que el acceso a la API está disponible para tu propia evaluación — ejecuta tus propios benchmarks antes de comprometerte.
Phi-4: la historia del edge madura
La familia Phi-4 ahora abarca más de 10 variantes con licencia MIT, de 3.8B a 15B. Los desarrollos clave de esta semana:
Integración con Azure AI Studio (25 de julio): llevó Phi-4 a la nube con contexto de 128K y fine-tuning con Azure ML — práctico para despliegues híbridos donde el mismo modelo se ejecuta en el dispositivo y en la nube.
Phi-4-mini-flash-reasoning utiliza una arquitectura SambaY (espacio de estados Mamba + atención de ventana deslizante + Gated Memory Units) que ofrece un rendimiento 10× y una mejora de latencia de 2-3× frente a Phi-4-mini-reasoning. Si tu hoja de ruta de IA en el edge no ha tenido en cuenta las arquitecturas no basadas en Transformer, esto merece atención.
Phi-4-reasoning-vision-15B (marzo de 2026) ahora se recomienda para nuevas cargas de trabajo de razonamiento multimodal — 88.2% en ScreenSpot v2 para el grounding de GUI, modos de razonamiento duales y un reemplazo efectivo de Florence-2 donde se requiere razonamiento.
Florence-2: 28 días para la fecha límite innegociable
Las API heredadas de Azure Vision (v1.0–3.1) se retiran el 13 de septiembre de 2026 — a 28 días de hoy. Las organizaciones deben migrar al SDK de Image Analysis 4.0 basado en Florence-2. Es un corte definitivo, no un desuso gradual.
No se ha anunciado Florence-3. La estrategia: la visión pura se queda en Florence-2, y el razonamiento más visión se mueve a Phi-4-reasoning-vision-15B. Ambos tienen licencia MIT; el fine-tuning con LoRA logra >98% de precisión en conjuntos de datos especializados.
Aion 1.0: el ocaso de Phi Silica
Aion 1.0 Instruct está en vista previa para desarrolladores (Edge Canary/Dev 150.0.4070+) y reemplazará a Phi Silica como modelo en el dispositivo de Windows. El cronograma de transición:
- 1 de octubre: paquete de pruebas independiente de Aion Instruct
- 23 de octubre: despliegue en Windows Insider (Phi Silica permanece, selección de modelo mediante CFR)
- 24 de noviembre: GA — Aion Instruct pasa a producción, Phi Silica se elimina de los dispositivos comerciales
Aion 1.0 Plan (14B, contexto de 32K) es el lanzamiento más ambicioso — un runtime de agentes en el dispositivo con tool-calling y orquestación de subagentes a través del Windows Agent Framework, que requiere una NPU de ≥40 TOPS o una GPU discreta que cumpla los requisitos. Es crucial que Aion Instruct no requiere tokens LAF, a diferencia de Phi Silica — lo que elimina un punto de fricción real para los desarrolladores. Phi Silica recibió una actualización final en PowerToys v0.101 (10 de agosto), pero si hoy estás desarrollando con él, empieza ya tu plan de migración a Aion.
La comprobación de la realidad del enrutamiento de Copilot
CNBC informó el 5 de agosto que Microsoft configuró GitHub Copilot con OpenAI GPT-5.6 Sol como opción predeterminada para el uso del personal, ofreciendo los modelos MAI como opciones. Esto no es una contradicción — es la estrategia funcionando como fue diseñada. La capa de categorización de tareas de Copilot enruta las tareas rutinarias a los modelos MAI por eficiencia de costos; el razonamiento complejo y la generación creativa van a los modelos frontier. El matiz: los modelos de primera parte ganan en tareas de alto volumen y sensibles al costo, y los modelos frontier ganan en razonamiento complejo. Tu arquitectura debería soportar ambos — la capa de enrutamiento de Copilot ya lo hace automáticamente.
Acciones recomendadas
- Actualiza los despliegues de MAI-Code: si llamas a MAI-Code a través de Azure Foundry, migra a 1.1-Flash antes de la retirada de la v1.0 el 10 de septiembre.
- Evalúa MAI-Image-2.6: generación de imágenes a escala — compara con tu proveedor actual. La propuesta de costos es convincente.
- Ejecuta tus propios benchmarks de MAI-Thinking-1: la vista previa pública ya está activa en Foundry. No te fíes de las cifras reportadas por el proveedor.
- Migración de Florence-2: fecha límite el 13 de septiembre. 28 días. Actúa ya.
- Planificación de la migración a Aion: si desarrollas con Phi Silica, el paquete de pruebas del 1 de octubre está a cuatro semanas. Prepara los datos de entrenamiento LoRA.
- Revisa los supuestos de enrutamiento de Copilot: tu plan de dependencia de Copilot debería reflejar la división MAI/terceros, no asumir OpenAI para todo.
El stack de primera parte de Microsoft abarca silicio personalizado (Maia 200), modelos en la nube (MAI), modelos edge de pesos abiertos (Phi-4), modelos en el dispositivo (Aion), visión fundacional (Florence-2) y orquestación (Copilot). Dos lanzamientos importantes de modelos en una semana — esto ya no es un proyecto de investigación. Es una plataforma de producción.
Este artículo forma parte de la serie Microsoft AI Weekly. Sigue el análisis en curso en x.com/kkaminsk.