El panorama de la evaluación de modelos de lenguaje grande (LLM) en árabe ha experimentado una transformación significativa con el lanzamiento de la segunda versión del Open Arabic LLM Leaderboard (OALL v2). Esta plataforma, fruto de la colaboración entre 2A2I, TII y HuggingFace, busca superar las limitaciones de las versiones anteriores para ofrecer una evaluación más justa, transparente y alineada con las particularidades del idioma árabe.
De las traducciones a los benchmarks nativos
Una de las principales críticas a la versión inicial fue el uso de tareas traducidas del inglés, que no reflejaban la riqueza morfológica ni las complejidades sintácticas del árabe. La nueva versión elimina benchmarks saturados y traducciones, incorporando tareas desarrolladas natively en árabe, como ALRAGE, Aratrust y MadinaQA. Estos benchmarks están diseñados para capturar la autenticidad del idioma, desde su gramática compleja hasta la diversidad de dialectos y consideraciones culturales de seguridad.
Corrección de errores y metodología rigurosa
Además, se identificó un error silencioso en la tarea AlGhafa, que afectaba desproporcionadamente a modelos pequeños. La corrección de este bug, junto con la introducción de la métrica LLM-as-judge en ALRAGE, garantiza una evaluación más consistente y equitativa. ALRAGE, en particular, utiliza un modelo de juez (Qwen2.5-72B-Instruct) para valorar respuestas en una escala del 0 al 10, normalizada posteriormente, asegurando precisión y reproducibilidad.
Impacto en la comunidad y resultados
En menos de siete meses, la versión inicial atrajo a más de 46,000 visitantes y 700 modelos de 180 organizaciones. La v2, aunque con menos modelos (80 actualmente), muestra rankings más dispersos y relevantes. Modelos como Llama3.3-70B-Instruct y Qwen dominan las categorías, mientras que la eliminación de benchmarks sesgados revela diferencias clave en el rendimiento. La correlación con otras leaderboards, como AraGen y SEAL Arabic, refuerza la validez de la plataforma.
Un paso hacia la equidad en IA árabe
Con esta actualización, el OALL v2 no solo mejora la precisión técnica sino también la representatividad cultural. La comunidad espera que esto impulse el desarrollo de modelos más adaptables a las necesidades reales de los usuarios árabes, sentando las bases para un futuro donde la IA en árabe sea tan diversa y robusta como el idioma mismo.