El volante de modelos de IA de primera parte de Microsoft ahora se auto-refuerza. La evidencia de esta semana: MAI-Transcribe-2 reclama el primer puesto en FLEURS en 60 idiomas con un 5.2% de tasa media de error de palabra (WER), MAI-Image-2.6 debuta en el puesto No. 2 del ranking Arena de texto a imagen, y MAI-Code-1.1-Flash es ahora el modelo de codificación predeterminado de GitHub Copilot — con una reducción de costos del 75% respecto a su predecesor. Mientras tanto, las API heredadas de Azure Vision que impulsaron una generación de pipelines de visión devolvieron 410 Gone el 13 de septiembre.

Para los líderes de ingeniería, el panorama estratégico se está cristalizando. Microsoft ya no publica modelos de primera parte como alternativas a opciones de terceros — está enrutando tráfico de producción a ellos por defecto, fijando precios agresivos y retirando la infraestructura de la que dependen las rutas competidoras. Esta edición cubre los tres lanzamientos de MAI de las últimas dos semanas, el cambio de enrutamiento de primera parte en Copilot, las consecuencias de la retirada del API de Azure Vision, y la línea de tiempo de la transición a Aion que los equipos de Windows deben planificar ahora.

MAI-Transcribe-2: Reconocimiento de voz más rápido, barato y preciso

MAI-Transcribe-2 entró en vista previa pública el 3 de septiembre de 2026, y las afirmaciones de Microsoft son contundentes: No. 1 en FLEURS en 60 idiomas con un WER medio del 5.2%, No. 2 en Artificial Analysis AA-WER con un 2.0%, y aproximadamente 10× la velocidad de GPT-Transcribe, 7× Scribe v2, y 5× Gemini 3.5 Transcribe. El precio es agresivo: $0.10 por hora de audio transcrito, una tarifa limitada vigente hasta finales de 2026.

El modelo soporta diarización y marcas de tiempo a nivel de palabra de forma nativa — sin pipeline de post-procesamiento. Para equipos que ejecutan cargas de transcripción a gran escala (análisis de centros de llamadas, captura de reuniones, indexación de medios), la economía es significativa. A $0.10/hora, transcribir 10,000 horas de audio cuesta $1,000 — una fracción de lo que cobran APIs de voz en la nube comparables. La cobertura de 60 idiomas con un solo modelo elimina la complejidad de enrutamiento multi-modelo que afecta a los pipelines existentes.

La advertencia: estos son benchmarks reportados por Microsoft. La validación independiente seguirá a medida que se abra el acceso a la API. Pero el precio es verificable en Microsoft Foundry hoy, y las afirmaciones de rendimiento son consistentes con la trayectoria de MAI-Transcribe-1 y 1.5.

MAI-Image-2.6: No. 2 en Arena con 84% de reducción de costos de GPU

MAI-Image-2.6 se lanzó el 10 de agosto de 2026, con la presentación completa el 4 de septiembre. Los titulares: No. 2 en el ranking Arena de texto a imagen (+79 Elo sobre la versión 2.5) y No. 1 en Artificial Analysis en edición de imágenes. La variante Flash es 2.8× más rápida y 72% más eficiente que GPT-Image-2-Medium.

La historia de costos es donde esto se vuelve interesante para despliegues de producción. Microsoft reporta una reducción del 84% en costos de GPU frente a GPT-Image-2 en cargas de producción. El modelo soporta edición por referencia multi-imagen, fundamentación web para generación de imágenes con verificación de hechos, y relaciones de aspecto dinámicas — funciones que antes requerían pipelines separados.

Precios en Microsoft Foundry: los niveles de MAI-Image-2.5 están en $19.50 (Flash), $47 (estándar), y $106 (Pro) por millón de imágenes de salida. Para organizaciones que generan imágenes a escala — equipos de marketing, catálogos de e-commerce, producción de contenido — la reducción de costos de GPU se traduce directamente en gasto de infraestructura. La capacidad de edición de imágenes subiendo del No. 5 al No. 3 en Arena (+19 Elo) significa que no es solo un modelo de generación; es una herramienta de edición creíble.

MAI-Code-1.1-Flash: 75% de reducción de costos, ahora predeterminado en Copilot

MAI-Code-1.1-Flash alcanzó disponibilidad general el 11 de agosto de 2026 e inmediatamente se convirtió en el modelo de codificación predeterminado de GitHub Copilot en todos los niveles — de Free a Max. Precios: $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida, una reducción del 75% respecto al MAI-Code-1-Flash original. El streaming de tokens es 25% más rápido, el consumo de tokens por tarea es 25% menor, y el modelo ahora acepta entradas de imagen para escenarios de diagrama a código.

El MAI-Code-1-Flash anterior se retiró el 10 de septiembre de 2026. Los equipos con prompts fijados o harnesses de evaluación dirigidos a ese modelo deben migrar a 1.1-Flash. GPT-4 Turbo sigue disponible como respaldo hasta noviembre de 2026, tras lo cual MAI-Code-1.1-Flash funcionará exclusivamente en los aceleradores Maia 200 de Microsoft.

La realidad del enrutamiento: Bloomberg confirmó que Microsoft 365 Copilot ahora enruta prompts de Excel y Outlook a modelos MAI en producción. Copilot no es un solo modelo — es una capa de orquestación con un enrutador de clasificación de tareas. Redacción de correos, resúmenes, generación de fórmulas de Excel y extracción de datos estructurados se enrutan a MAI. Codificación agéntica se enruta a MAI-Code-1.1-Flash. Generación de imágenes se enruta a MAI-Image-2.5 y 2.6. Transcripción de Teams se enruta a MAI-Transcribe. Escaneo de seguridad se enruta a MAI-Cyber-1-Flash. Solo el razonamiento complejo multi-paso y la generación creativa que requiere juicio estilístico sigue enrutándose a modelos frontera de terceros.

La implicación para la planificación de arquitectura: presupuestar asumiendo que el enrutamiento de primera parte se expande, no se contrae. Microsoft proyecta que la mayoría de tareas de Copilot de commodity funcionarán en MAI para finales de 2026.

Retirada del API de Azure Vision: 410 Gone desde ayer

El 13 de septiembre de 2026 fue la fecha de retirada forzada de las API heredadas de Azure Vision versiones 1.0 a 3.1. Cualquier aplicación que aún llame a estos endpoints ahora recibe respuestas 410 Gone. Esto no es una deprecación suave — no hay rampa de bajada gradual ni período de gracia extendido.

El objetivo de migración es el SDK de Image Analysis 4.0 basado en Florence-2. Florence-2 sigue siendo el modelo fundacional de visión de Microsoft: una arquitectura unificada de secuencia a secuencia que maneja 12+ tareas de visión con un solo conjunto de pesos — detección, segmentación, descripción, descripción de regiones densas, anclaje visual, y OCR en 164 idiomas. La variante large (771M de parámetros) es de grado producción; la variante base (232M) corre en CPUs estándar. Ambas están licenciadas bajo MIT en Hugging Face con aproximadamente 2.66 millones y 813,000 descargas mensuales respectivamente.

No hay Florence-3 planeado. Microsoft prioriza la estabilidad sobre la velocidad de lanzamiento en la capa fundacional de visión. Image Analysis 4.0 mismo se retira el 25 de septiembre de 2028 — dando a los equipos un horizonte de dos años para planificar.

Si aún no ha migrado, esto es una interrupción con impacto en producción. Audite sus aplicaciones hoy para detectar llamadas restantes a los endpoints de visión heredados.

Aion 1.0: La línea de tiempo del cambio de Phi Silica

Aion 1.0 es el reemplazo en dispositivo de Phi Silica de Microsoft, anunciado en Build 2026. Dos variantes: Aion 1.0 Instruct (SLM ligero para resumen, reescritura, clasificación de intenciones — corre en CPU, GPU o NPU sin hardware dedicado) y Aion 1.0 Plan (14B de parámetros, contexto de 32K, para razonamiento agéntico en dispositivo vía Windows Agent Framework).

La transición tiene fechas fijas:

  • 1 de octubre de 2026: Paquete de pruebas independiente de Aion Instruct con soporte de entrenamiento LoRA.
  • 23 de octubre de 2026: Despliegue a Windows Insiders — Phi Silica y Aion coexisten, con un Controlled Feature Rollout seleccionando el modelo activo por dispositivo.
  • 24 de noviembre de 2026: Disponibilidad general — Aion Instruct se convierte en el modelo de producción y Phi Silica se elimina de dispositivos comerciales.

El elemento crítico de planificación: los adaptadores LoRA existentes de Phi Silica no se transferirán a Aion. Si su equipo ha invertido en fine-tuning personalizado de Phi Silica, comience el reentrenamiento ahora. La compatibilidad de API se preserva en las APIs LanguageModel e ImageDescription, pero los pesos del modelo subyacente son diferentes. Las listas finales de compatibilidad de GPU y versiones requeridas de drivers de NVIDIA aún no se han publicado — vigílelas antes de las fechas de octubre.

Phi-4: El caballo de batalla de pesos abiertos continúa

Mientras MAI domina la frontera en la nube, Phi-4 sigue siendo la familia de modelos de lenguaje pequeño de pesos abiertos de Microsoft para edge e IoT. El último lanzamiento, Phi-4-reasoning-vision-15B (marzo de 2026), combina el backbone Phi-4-reasoning con un codificador de visión SigLIP-2 para razonamiento multimodal — 15B de parámetros, licencia MIT, activación dinámica de pensamiento. Phi-4-mini se envió a PCs Windows 12 Copilot+ en julio de 2026, entregando 42 tokens por segundo en Snapdragon X Elite con aproximadamente 3GB de VRAM para completación de código offline y edición local de imágenes.

La historia de Phi de rendir por encima de su peso continúa: Phi-4 (14B) supera a modelos 5× su tamaño en benchmarks de matemáticas y razonamiento, impulsado por la calidad de datos sintéticos y curricula de entrenamiento refinados en lugar del conteo de parámetros. Para equipos que necesitan despliegues on-premise o en entornos aislados, Phi-4 sigue siendo el benchmark.

Turing: Tratar como retirado

Sin actualizaciones significativas de la familia de modelos Turing en 2025–2026. MAI ha absorbido cada carga de producción que Turing servía. Si los modelos Turing aún aparecen en sus diagramas de arquitectura, esos diagramas son ahora documentos históricos — planee el reemplazo.

Qué seguir la próxima semana

  • 1 de octubre: Paquete de pruebas independiente de Aion 1.0 Instruct.
  • 23 de octubre: Aion 1.0 Instruct llega a Windows Insiders.
  • 24 de noviembre: GA de Aion 1.0; Phi Silica se elimina de Windows comercial.
  • Noviembre de 2026: Termina el respaldo de GPT-4 Turbo — MAI-Code-1.1-Flash se convierte en el único predeterminado.
  • Lista de vigilancia: MAI-Realtime (voz full-duplex) avistado en MAI Playground pero no anunciado oficialmente — lanzamiento probablemente inminente. Benchmarks independientes de MAI-Thinking-1 aún pendientes de mayor acceso a la API.

El volante de primera parte de Microsoft ahora gira con su propio impulso: nuevos modelos, precios agresivos, enrutamiento predeterminado en Copilot, y fechas de retirada forzada para infraestructura competidora. La postura pragmática para equipos de ingeniería es comenzar a evaluar modelos MAI para cargas de commodity ahora — la economía y la profundidad de integración se están convirtiendo en una ventaja estructural que las alternativas de terceros no pueden igualar en plataformas de Microsoft.

Siga el análisis en tiempo real en https://x.com/kkaminsk a medida que estos modelos se lanzan.