Z.ai ha presentado GLM-5.3, una nueva versión de su modelo de inteligencia artificial orientada a la programación, los agentes capaces de ejecutar tareas largas y el análisis de vulnerabilidades. La compañía sostiene que no ha cambiado el modelo base de GLM-5.2: todas las mejoras proceden del posentrenamiento, ampliado durante el último mes con más entornos, tareas más diversas y más capacidad de cálculo.
El anuncio sitúa el foco en trabajos que se parecen a proyectos reales y no a ejercicios aislados. En esos entornos, el modelo puede tener que consultar documentación y repositorios, detectar un cuello de botella, modificar código, ejecutar experimentos y comprobar que el resultado mantiene la corrección. Es una evolución relevante frente al asistente que se limita a completar fragmentos de código, aunque los resultados publicados siguen siendo evaluaciones del propio fabricante y de bancos de pruebas.
Mejoras concretas frente a GLM-5.2
Z.ai atribuye a GLM-5.3 una mejora del 50% frente a GLM-5.2 en Z.ai Code Bench, su prueba interna para agentes de programación. En mediciones públicas, el salto más llamativo aparece en Terminal-Bench 3.0, donde pasa de 4,6 a 28,3 puntos. También sube de 46,2 a 66,9 en DeepSWE v1.1 y de 23,8 a 28,5 en Agents’ Last Exam.
Los datos no significan que GLM-5.3 gane en todas las pruebas. En Terminal-Bench 2.1 obtiene 88,2 puntos, prácticamente empatado con varios rivales; en otras evaluaciones aún queda por detrás de modelos cerrados. La comparación útil, por tanto, está en la magnitud del avance respecto a su predecesor y en el tipo de tareas largas para las que ha sido ajustado.

Una capacidad de seguridad que exige cautela
La otra novedad es el rendimiento en análisis de vulnerabilidades. Z.ai afirma que GLM-5.3 alcanza un 84,5% en CyberGym, frente al 77,2% de GLM-5.2. En ExploitBench pasa del 24,4% al 54,4%, mientras que en ExploitGym completa 105 tareas con un presupuesto normalizado de dos horas y 130 con seis horas; su antecesor resolvía 29 y 39, respectivamente.
La mejora puede ayudar a revisar código y priorizar fallos, pero también aumenta la capacidad de construir cadenas de explotación. La propia empresa reconoce que el progreso es mayor en las fases avanzadas del ataque. Z.ai dice haber trabajado con equipos de seguridad sobre proyectos reales y haber identificado 2.436 vulnerabilidades en 269 proyectos, después de revisión experta, filtrado y eliminación de duplicados.
Ese componente de seguridad explica una limitación importante del lanzamiento. Aunque Z.ai describe GLM-5.3 como un modelo de pesos abiertos, los pesos no se publicarán hasta dos semanas después, una vez concluidas las evaluaciones de seguridad y las medidas de refuerzo. Mientras tanto, el acceso se ofrece a los usuarios de GLM Coding Plan y mediante herramientas compatibles.
Qué cambia para desarrolladores
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max. El fabricante recomienda el nivel máximo para programación y avisa de un cambio incompatible: ya no se puede desactivar el razonamiento. Las aplicaciones que usen thinking.type como disabled deben activarlo y elegir un nivel de esfuerzo antes de cambiar el identificador del modelo, o la petición fallará.
El avance también pone presión sobre los modelos propietarios especializados en código, pero no basta para declarar un vencedor. Z.ai compara GLM-5.3 con sistemas de Anthropic, OpenAI y otros laboratorios en numerosos bancos de pruebas, con resultados variables. A la hora de elegir, además de la puntuación importan la disponibilidad, el coste, las integraciones y el comportamiento sobre el repositorio concreto. La reciente presentación de Gemini 3.7 Flash para agentes y programación muestra hasta qué punto se ha acelerado esta competencia.
En la práctica, GLM-5.3 es una actualización centrada en la ejecución prolongada, no una nueva arquitectura base. Su propuesta se apoya en entrenar sobre entornos verificables más cercanos al trabajo profesional y en reutilizar la infraestructura de GLM-5.2. Queda por comprobar cómo se comportará fuera de los escenarios publicados y qué condiciones acompañarán a los pesos cuando estén disponibles.







