Z.ai afirma que GLM‑5.3 supera a su predecesor en pruebas de ciberseguridad

Por Redacción ChatAmigos·
Imagen de recurso de la sección de tecnología: Z.ai afirma que GLM‑5.3 supera a su predecesor en pruebas de ciberseguridad

Z.ai ha anunciado que el modelo de inteligencia artificial GLM‑5.3, entrenado para programar, muestra mejoras notables en tareas de ciberseguridad respecto a la versión anterior GLM‑5.2. El salto se observó durante el último mes, cuando la compañía amplió entornos, diversificó tareas y destinó más capacidad de cómputo a simulaciones largas similares a las que afrontaría un ingeniero. El entrenamiento no implicó un modelo base nuevo; GLM‑5.3 parte del mismo núcleo que GLM‑5.2 y todas las mejoras provienen del post‑training. En esta fase se introdujeron deliberadamente datos y entornos orientados a descubrir vulnerabilidades, con el objetivo de pasar de la simple detección a la explotación de fallos. Para medir el progreso, la empresa utilizó tres suites de pruebas: CyberGym, que evalúa la capacidad de reproducir vulnerabilidades mediante pruebas de concepto; ExploitBench, que mide la capacidad de avanzar desde la generación de fallos hasta la lectura, escritura o ejecución arbitraria de código; y ExploitGym, centrada en completar tareas de explotación. Los resultados publicados revelan un patrón claro: cuanto más avanzan las pruebas en la cadena de explotación, mayor es la diferencia frente a GLM‑5.2. En CyberGym, GLM‑5.3 eleva su puntuación del 77,2 % al 84,5 %. En ExploitBench, la mejora pasa del 24,4 % al 54,4 %. En ExploitGym, el modelo completa 105 tareas con un presupuesto de dos horas y 130 con seis horas, frente a las 29 y 39 tareas de su predecesor. Z.ai interpreta este comportamiento como una señal de que las fases más avanzadas del proceso de explotación progresaron especialmente rápido. Al comparar GLM‑5.3 con Mythos 5 de Anthropic (versión de Claude Fable 5 sin salvaguardas de ciberseguridad), los números indican que GLM‑5.3 supera ligeramente a Mythos 5 en CyberGym (84,5 % frente a 83,8 %). Sin embargo, en la fase de explotación, el modelo de Anthropic alcanza un 78 % en ExploitBench frente al 54,4 % de GLM‑5.3, y completa 181 tareas en ExploitGym frente a las 105 del modelo chino. Estas cifras sugieren que GLM‑5.3 ya compite en la detección inicial de vulnerabilidades, pero todavía queda rezagado frente a los mejores modelos cerrados en la conversión de esas vulnerabilidades en ataques funcionales.

Contexto y análisis

El anuncio de Z.ai sitúa a GLM‑5.3 en una posición de relevancia dentro del ecosistema de modelos de IA orientados a la seguridad informática, un campo que ha cobrado urgencia a medida que los atacantes emplean cada vez más herramientas automáticas para descubrir y explotar vulnerabilidades. Hasta ahora, la mayor parte de los desarrollos se centraba en la detección de fallos; el salto que muestra GLM‑5.3, según las métricas de CyberGym, ExploitBench y ExploitGym, indica que la capacidad de generar pruebas de concepto y de avanzar hasta la ejecución arbitraria de código está empezando a ser alcanzable por sistemas de IA sin intervención humana directa. Este progreso se ha conseguido sin cambiar la arquitectura base del modelo, sino mediante un post‑training enfocado en datos y entornos de ciberseguridad, lo que sugiere que la mejora proviene más de la calidad y la especificidad del entrenamiento que de la potencia bruta del modelo. El impacto potencial se extiende tanto a los equipos de defensa como a los de ataque. Para los defensores, un modelo que simula la cadena completa de explotación puede servir como herramienta de auditoría interna, permitiendo identificar puntos débiles antes de que sean explotados en la vida real. Por otro lado, la existencia de una IA capaz de generar exploits de forma más eficaz plantea un riesgo de proliferación de técnicas automatizadas, sobre todo si el modelo se difunde fuera de entornos controlados. La comparación con Mythos 5 de Anthropic, aunque se menciona solo de forma parcial, sugiere que la competencia entre proveedores de IA está acelerando la carrera por modelos que pueden operar en los límites de la ciberseguridad, lo que probablemente impulsará una mayor inversión en salvaguardas y en la regulación del uso de estas tecnologías.

Análisis de la redacción de ChatAmigos.

Comenta esta noticia en el chat

Debate sobre tecnología en tiempo real con miles de usuarios, sin registro.

Más noticias de Tecnología

Ver todas las noticias de tecnología
← Volver a todas las noticias

También te puede interesar