Z.ai lanza GLM-5.3-Flash: ¿la mejor relación calidad-precio del mercado?

Z.ai lanza GLM-5.3-Flash: ¿la mejor relación calidad-precio del mercado?

Este artículo también está disponible en: Português English

Con una consistencia impresionante, Z.ai no dio tiempo ni de que se asentara el polvo del GLM-5.3 antes de anunciar su próximo modelo. Esta semana, el gigante chino lanzó GLM-5.3-Flash, la versión compacta y económica de la familia GLM-5. Lo más destacado del comunicado oficial: el modelo no solo hereda la arquitectura de la generación actual, sino que supera a GLM-5.2, el modelo anterior de la empresa, en prácticamente todos los benchmarks.

Tipo de modelo

GLM-5.3-Flash es un modelo de tipo MoE (Mixture of Experts), con 320 mil millones de parámetros totales, pero solo 18 mil millones activos por token durante la inferencia. Para tener una idea, su predecesor directo, GLM-5.2, activaba 40 mil millones de parámetros por cada token procesado.

Arquitectura híbrida: menos memoria, más contexto

Una de las novedades técnicas más relevantes de GLM-5.3-Flash es la combinación de dos arquitecturas de atención: lineal y dispersa. En pocas palabras: la atención lineal se encarga de las dependencias locales del texto, mientras que la dispersa garantiza que el modelo capture conexiones relevantes en el contexto global.

Para gestionar contextos tan largos sin disparar los costos de memoria, el modelo utiliza una técnica llamada IndexPool, que comprime grupos de vectores clave para reducir la latencia y el uso de memoria en tiempo de ejecución. El resultado, según Z.ai, es una reducción de aproximadamente 3x en el costo computacional de atención y un KV cache 4.4x menor en comparación con el GLM-5.3 convencional.

GLM-5.3-Flash en el Artificial Analysis Agentic Index, empatado con los principales modelos del mercado

En el Artificial Analysis Agentic Index, GLM-5.3-Flash aparece entre los primeros puestos, junto a Claude Opus 5, GLM-5.3 y Grok 4.6.

Rendimiento: empatando con modelos que cuestan mucho más

En el Artificial Analysis Intelligence Index, referencia independiente del sector para comparar modelos por inteligencia, GLM-5.3-Flash obtuvo 57 puntos — la misma puntuación del GPT-5.6 Terra de OpenAI. Mientras que el GPT-5.6 Terra cuesta alrededor de US$ 0,51 por tarea en ese mismo índice, GLM-5.3-Flash hace el mismo trabajo por US$ 0,09.

Para ponerlo en perspectiva: el modelo también supera en inteligencia a Gemini 3.7 Flash (56 puntos) y a DeepSeek V4 Pro (~53 puntos), modelos ampliamente utilizados en el mercado como referencia de costo-beneficio.

En los benchmarks de la propia Z.ai, GLM-5.3-Flash obtuvo 63,4 puntos en DeepSWE frente a 46,2 del GLM-5.2, y 48,8 en AutomationBench frente a solo 26,2 de su predecesor. En tareas agénticas evaluadas por GDPval-AA v2, el modelo alcanzó un Elo de aproximadamente 1770, empatando con el propio GLM-5.3 y con Grok 4.6 — quedando detrás únicamente de Claude Opus 5.

Rendimiento en codificación agéntica por nivel de esfuerzo: GLM-5.3-Flash supera a GLM-5.2 en todos los niveles

En Z.ai Code Bench v1.0, evaluado en Claude Code 2.1.207, GLM-5.3-Flash (morado) supera a GLM-5.2 en todos los niveles de esfuerzo, consumiendo menos tokens por tarea.

Costo: más barato que el modelo “básico” de Anthropic

GLM-5.3-Flash cuesta US$ 0,15 por millón de tokens de entrada y US$ 0,50 por millón de tokens de salida en la API de Z.ai. Para comparar: Claude Haiku 4.5, el modelo más accesible de la línea Anthropic, cuesta US$ 1,00 por millón de tokens de entrada y US$ 5,00 por millón de tokens de salida, es decir, respectivamente 6,7x y 10x más caro por token.

La identidad secreta: “Ox Alpha”

Antes del lanzamiento oficial, GLM-5.3-Flash pasó una semana entera funcionando de forma completamente anónima en OpenCode y OpenRouter, bajo el nombre en clave “Ox Alpha”. Aun sin saber qué modelo era, la comunidad lo adoptó rápidamente y se convirtió en el modelo más utilizado de la semana en ambas plataformas. Solo entonces Z.ai confirmó la identidad y anunció el lanzamiento oficial. Una forma bastante elegante de hacer una prueba ciega de mercado a escala real.

ox-alpha como el modelo número 1 de OpenRouter, con 23,2 billones de tokens procesados en 6 días

Bajo el nombre en clave “ox-alpha”, el modelo procesó 23,2 billones de tokens en seis días en OpenRouter — 2,3x más que el segundo clasificado.

Servido íntegramente con chips chinos

Todos estos resultados se entregaron en una infraestructura compuesta exclusivamente por chips de fabricación china, en un clúster de gran escala. Z.ai construyó un stack propio basado en SGLang, separando las etapas de encoding, prefill y decoding para extraer el máximo rendimiento de los aceleradores domésticos. El resultado fue una ganancia de 3x en el rendimiento de serving en decenas de miles de aceleradores.

En palabras de la propia documentación oficial de la empresa:

“This demonstrates that Chinese chips can support frontier-model inference efficiently and economically at scale.”

Costo promedio por tarea en dólares: GLM-5.3-Flash entre los modelos más baratos del índice

En la comparativa de costo por tarea de Artificial Analysis, los modelos más económicos ejecutan tareas por centavos de dólar, mientras que las configuraciones con Claude Opus 5 o Fable 5 superan los US$ 8.

Inteligencia visual: de verdad, no como un add-on

Algo que ha venido atrayendo cada vez más atención en los últimos lanzamientos en general es la inteligencia visual integrada. GLM-5.3-Flash representa un paso relevante en esa dirección. A diferencia de los modelos que “acoplan” la visión como una capacidad adicional, aquí la visión es nativa desde el preentrenamiento, parte del mismo stack que procesa el texto.

Esto importa especialmente para quienes trabajan con desarrollo de interfaces, edición de diapositivas o debugging visual: el modelo puede, de hecho, “mirar” una captura de pantalla y razonar sobre ella como lo haría un humano: identificar errores de layout, entender la jerarquía de componentes, comparar estados de una UI antes y después. La documentación de Z.ai destaca que el modelo es capaz de transformar capturas de pantalla, grabaciones de pantalla y URLs de sitios web en aplicaciones front-end funcionales, yendo más allá de la simple reproducción visual para entender sistemas de diseño, estados de interacción y lógica de animación.

Comparación de una diapositiva generada por el modelo antes y después de la verificación visual automática

Ejemplo de la documentación oficial: a la izquierda, la versión inicial de una diapositiva con problemas de layout; a la derecha, el resultado tras la autoverificación visual del modelo.

Disponibilidad

GLM-5.3-Flash ya está disponible para todos los usuarios del GLM Coding Plan de Z.ai, con 3x la cuota del GLM-5.3. El modelo también está en chat.z.ai, en ZCode y en AutoClaw.

Para quienes deseen alojarlo por cuenta propia, los pesos están disponibles en Hugging Face bajo licencia MIT: uso comercial permitido para quien disponga de la infraestructura necesaria (aproximadamente 306 GB en FP8 con GPUs Hopper o más recientes).

Fuentes