En un golpe de autoridad técnica que resuena en el tablero geopolítico de la inteligencia artificial, Alibaba Security AGI Lab ha colocado a su modelo XekRung-27B en la cima del exigente benchmark CyberGym. Con una tasa de éxito del 88.9% en la reproducción de vulnerabilidades reales, superó a contendientes de peso como Gemini 3.8 Flash Cyber de Google (86.3%) y GPT-5.5-Cyber de OpenAI (85.6%). Este resultado, reportado por medios tecnológicos chinos el 28 de septiembre y correspondiente a una evaluación del 13 del mismo mes, marca la primera vez que un modelo de un desarrollador chino lidera este ranking, tradicionalmente dominado por firmas estadounidenses.
La batalla técnica: de un 54% a un 89% de eficacia
La hazaña es aún más notable considerando el punto de partida. El modelo base Qwen3.8-27B, sobre el cual se afinó XekRung, había obtenido un 54.51% en las mismas condiciones. El proceso de post-entrenamiento aplicado por el laboratorio de Alibaba, liderado por Huang Longtao, añadió la friolera de 34.39 puntos porcentuales de rendimiento. La clave, según el equipo, residió en una combinación de fine-tuning supervisado con trayectorias anónimas de las operaciones de seguridad internas de Alibaba, un refuerzo de aprendizaje dentro de un marco de herramientas generales, y la reutilización de intentos fallidos como pares de entrenamiento correctivo. Cabe destacar que el modelo no fue entrenado con las tareas, parches o pruebas de concepto de referencia de CyberGym.
Eficiencia como arma estratégica
Más allá del rendimiento bruto, Alibaba enfatiza la eficiencia como ventaja disruptiva. XekRung es un modelo de 27 mil millones de parámetros, lo que, según la compañía, lo hace entre 27 y 370 veces más pequeño que otros modelos de ciberseguridad comparables. Esta compacidad podría reducir drásticamente el costo computacional del análisis automatizado de vulnerabilidades, haciendo que esta tecnología de vanguardia sea más accesible y escalable. La evaluación se realizó con inferencia en FP8 y una ventana de contexto de 256K, bajo condiciones restringidas que simulan un entorno real: sin frameworks de fuzzing preinstalados y con acceso a red limitado.
El panorama actual en el track de modelos individuales de CyberGym, que alberga 1,507 vulnerabilidades reales de 188 proyectos de código abierto, muestra ahora el dominio chino en los primeros puestos. Detrás de XekRung y los modelos occidentales, se ubican GLM-5.3 de Zhipu AI (84.5%) y DeepSeek-V4-Pro (83.3%), consolidando una fuerte presencia asiática. Los mantenedores del benchmark advierten que las brechas pequeñas pueden no reflejar diferencias significativas de capacidad y que los resultados son estocásticos, pero el salto de XekRung es demasiado grande para ser ignorado.
Por ahora, los pesos de XekRung no se han liberado y Alibaba no ha dado un cronograma para el acceso externo. Sin embargo, Huang Longtao ha señalado que la tecnología de seguridad del laboratorio se ofrecerá de manera más amplia en el futuro, con versiones posteriores apuntando a inteligencia adversarial, auto-evolución y tareas agenticas. Este triunfo en CyberGym no es solo un punto en un ranking; es un anuncio claro de que la carrera por la IA aplicada a la ciberseguridad, un campo de importancia crítica, tiene un nuevo y poderoso contendiente que juega con sus propias reglas de eficiencia y especialización.
Fuente: Pandaily (China AI)
