Esta fue la semana en que el ecosistema de IA de China dejó de especular sobre la autosuficiencia. DeepSeek confirmó que su próximo modelo V4 se ejecutará exclusivamente en silicio de Huawei — sin NVIDIA, sin respaldo. Zhipu AI lanzó GLM-5.1 bajo licencia MIT, un modelo de pesos abiertos que supera a Claude Opus 4.6 y GPT-5.4 en benchmarks de codificación de larga duración. Y Alibaba fue descubierto como el creador anónimo de HappyHorse-1.0, un modelo de generación de video que ocupó el puesto #1 en todos los rankings principales el día que apareció. Para los equipos empresariales que siguen el panorama global de IA, este es un China AI Weekly que vale la pena leer con atención.
DeepSeek V4: Un Billón de Parámetros en Silicio Nacional
La historia principal es estratégica, no técnica. DeepSeek V4 — un modelo Mixture-of-Experts de aproximadamente 1 billón de parámetros con una ventana de contexto reportada de 1 millón de tokens — se lanzará a finales de abril ejecutándose exclusivamente en chips Huawei Ascend 950PR. DeepSeek colaboró directamente con Huawei y Cambricon, reescribiendo su base de código para la arquitectura Ascend. NVIDIA y AMD fueron excluidas explícitamente.
El modelo activa 32 a 37 mil millones de parámetros por token mediante enrutamiento MoE, y las pruebas de estrés tempranas de API de una variante V4-Lite ya están en marcha. Huawei afirma velocidades de inferencia 1.8 veces más rápidas frente a generaciones anteriores de hardware.
Esto no es un experimento. Alibaba, ByteDance y Tencent han realizado pedidos de cientos de miles de chips Ascend 950PR para cargas de trabajo de IA en producción, según The Information. Un modelo de clase fronteriza ejecutándose a escala en hardware completamente nacional es hacia lo que el ecosistema de IA chino ha estado trabajando desde que llegaron las primeras restricciones de exportación de EE. UU. Si V4 ofrece benchmarks competitivos, el caso de una pila de hardware de IA global bifurcada será mucho más difícil de descartar.
Conclusión empresarial: Si tu organización depende del dominio de NVIDIA para la planificación de la cadena de suministro o supuestos de ventaja competitiva, este es un dato que merece atención. La narrativa de “China está 2-3 años atrás en chips” está siendo puesta a prueba activamente.
Zhipu AI Lanza GLM-5.1: Código Abierto, Larga Ejecución, Agéntico
Zhipu AI lanzó GLM-5.1 bajo licencia MIT — un modelo de 754 mil millones de parámetros diseñado específicamente para tareas de codificación agénticas de larga ejecución. Las afirmaciones principales son agresivas: ejecución autónoma de 8 horas, replanteamiento de estrategia a través de cientos de iteraciones y hasta más de 6,000 llamadas a herramientas por sesión.
En SWE-Bench Pro, Zhipu reporta que GLM-5.1 supera tanto a Claude Opus 4.6 como a GPT-5.4. El modelo cuenta con una ventana de contexto de 128K y “pensamiento intercalado” — un enfoque de razonamiento paso a paso donde el modelo puede abandonar y reiniciar estrategias durante la ejecución. Está disponible ahora en Hugging Face, ModelScope y la API de Zhipu.
Zhipu también lanzó GLM-5V-Turbo el 1 de abril — un modelo de visión-codificación nativo multimodal que genera código a partir de imágenes y videos. Y en una señal comercial digna de mención, la empresa aumentó los precios de API en un 10% — el segundo aumento este año — mientras se mantiene por debajo de los precios de sus rivales occidentales.
Conclusión empresarial: Un modelo de 754B con licencia MIT y benchmarks de codificación competitivos es una adición seria al panorama de pesos abiertos. Los equipos que evalúan alternativas a los agentes de codificación propietarios deberían poner GLM-5.1 en su lista corta — pero verificar las afirmaciones de SWE-Bench Pro de forma independiente (ver la sección de benchmarks más abajo).
HappyHorse de Alibaba: El Modelo de Video #1 Anónimo
El 7 de abril, un modelo llamado HappyHorse-1.0 apareció en el Artificial Analysis Video Arena e inmediatamente ocupó el #1 tanto en las categorías de texto a video como de imagen a video, manteniendo una ventaja de 116 puntos sobre el modelo anterior líder. No se acreditó a ningún equipo. Dos días después, The Information reportó que Alibaba estaba detrás de él.
El enfoque técnico es distintivo: un transformador unificado de flujo único de 15 mil millones de parámetros (no difusión) que genera video nativo en 1080p con audio sincronizado — diálogo, sonido ambiental y efectos Foley — en una sola pasada hacia adelante. Soporta siete idiomas con sincronización de labios a nivel de fonema y, según se informa, genera salida en 1080p en aproximadamente 38 segundos en una sola H100.
Aún no se han lanzado pesos, API o demostraciones reproducibles. Alibaba ha indicado que los lanzamientos de código abierto están “próximamente”. El patrón de lanzamiento anónimo — visto anteriormente con Pony Alpha y GLM-5 — se está convirtiendo en una estrategia recurrente en la IA china: demostrar el benchmark primero, revelar la marca después.
Conclusión empresarial: Si los pesos de HappyHorse se lanzan como código abierto, podría reducir significativamente el costo de la generación de video empresarial. La arquitectura conjunta de audio y video es particularmente relevante para equipos que construyen pipelines de contenido multilingüe.
Kimi K2.5 Impulsa Composer 2 de Cursor
Kimi K2.5 de Moonshot AI es ahora el modelo base del motor de agente Composer 2 de Cursor, que se lanzó con Cursor 3 el 2 de abril. Composer 2 obtiene 61.3 en CursorBench — una mejora del 39% sobre su predecesor — y supera a Claude Opus 4.6 en esas tareas a aproximadamente un 90% menos de costo por token. El cofundador de Cursor, Aman Sanger, reconoció la base Kimi después de omitirla inicialmente en los materiales de lanzamiento.
Esta es una validación comercial significativa. Kimi K2.5 no solo es competitivo en benchmarks — es el modelo de producción que impulsa una de las herramientas de codificación con IA más utilizadas del mundo.
El Problema de Credibilidad de los Benchmarks
El hallazgo más aleccionador de la semana provino de SWE-Rebench, una versión descontaminada de SWE-bench que utiliza tareas nuevas de GitHub que ningún modelo ha visto en el entrenamiento. Los modelos chinos que obtuvieron puntuaciones competitivas en el SWE-bench original sufrieron caídas dramáticas en la versión limpia, mientras que los modelos occidentales mantuvieron su rendimiento.
La implicación: algunos benchmarks de modelos chinos pueden reflejar superposición con datos de entrenamiento en lugar de capacidad genuina de ingeniería de software. En el Pencil Puzzle Benchmark — una prueba de razonamiento novedosa — la brecha fue aún más marcada: DeepSeek obtuvo un 2%, Qwen 3.5 un 0.7% y Kimi K2 un 6%, en comparación con GPT-5.2 con un 56% y Claude Opus 4.6 con un 36.7%.
Esto no invalida el progreso real que está ocurriendo en la IA china. Pero sí significa que los equipos empresariales deberían dar más peso a los benchmarks descontaminados al evaluar modelos para uso en producción — independientemente de su origen.
Industria y Política
China emitió borradores de regulaciones sobre humanos digitales con IA el 3 de abril. Las nuevas reglas de la Administración del Ciberespacio requieren marcas de identificación prominentes de “humano digital”, prohíben su uso para evadir la autenticación biométrica, exigen consentimiento explícito para datos de imagen y voz, y restringen el contenido de compañeros de IA dirigido a menores. La consulta pública se extiende hasta el 6 de mayo, con medidas provisionales sobre servicios de interacción emocional que entrarán en vigor el 15 de julio.
Por separado, está surgiendo una tendencia más amplia en torno a las contribuciones a Hugging Face. China ahora supera a EE. UU. en cargas de modelos públicos a la plataforma, con el ecosistema alcanzando 11 millones de usuarios y más de 2 millones de modelos públicos. El flujo de pesos abiertos de los laboratorios chinos no muestra señales de desaceleración.
Qué Observar
- Lanzamiento de DeepSeek V4 (finales de abril). El primer modelo de clase fronteriza que se ejecuta exclusivamente en silicio chino nacional. El rendimiento en benchmarks frente a GPT-5.4 y Claude Opus 4.6 — especialmente en pruebas descontaminadas como SWE-Rebench — determinará si la apuesta por Huawei vale la pena técnica, no solo estratégicamente.
- Lanzamiento de código abierto de HappyHorse. Alibaba prometió pesos en GitHub y Hugging Face. Si se entrega, podría reconfigurar el panorama de generación de video abierto y presionar significativamente a las alternativas propietarias.
- Finalización de la regulación de humanos digitales. La fecha límite de consulta del 6 de mayo definirá cómo las empresas chinas implementan avatares de IA, compañeros virtuales e influencers digitales — un mercado donde China lidera globalmente. Las empresas con implementaciones de IA transfronterizas deben seguir el texto final.
Eso es todo por el China AI Weekly de esta semana. El hilo conductor es claro: el ecosistema de IA de China no solo está construyendo modelos competitivos — está construyendo la infraestructura para ejecutarlos de forma independiente. Si esa independencia se extiende a la credibilidad de los benchmarks sigue siendo la pregunta abierta. Vuelve la próxima semana para las últimas novedades.