El paisaje de los LLMs acaba de recibir un terremoto tecnológico desde Abu Dabi. El Institute of Foundation Models (IFM), brazo investigativo de la MBZUAI, desembarcó en septiembre de 2026 con K2 Horizon: seis modelos open-weight que redefinen la eficiencia computacional. La estrella es la K2-Horizon-MoVA-36B-A4B, una bestia de 36B parámetros totales que activa solo 4B por token gracias a su innovadora arquitectura Mixture-of-Value Attention (MoVA).
MoVA: Cuando la atención se vuelve selectiva
Mientras los modelos MoE tradicionales aplican mezcla de expertos solo en las capas FFN, MoVA traslada este principio al mecanismo de atención. Aquí radica la genialidad: las proyecciones de valor (V) se calculan mediante un router que selecciona dinámicamente entre 64 expertos especializados, activando solo los 4 más relevantes por token. Q y K permanecen densos para mantener la coherencia contextual, pero V adopta esta capa adicional de esparsidad.
Benchmarks que desafían la lógica
Los resultados son contundentes: en tau3-Banking (26.8 vs 14.2) y Terminal-Bench 2.1 (58.6 vs 53.9), esta ‘ligera’ de 4B activos supera al Nemotron 3 Ultra de 55B parámetros activos. Sin embargo, como contrapartida, muestra debilidad en tareas de razonamiento puro y contexto extenso, donde modelos densos como Muse Glimmer-30B mantienen ventaja.
La arquitectura, compatible con FlashAttention y GQA, ya tiene soporte en vLLM y SGLang, aunque su integración con llama.cpp sigue en desarrollo. Para ejecución local, las versiones cuantizadas Q8_0 requieren al menos 48GB de VRAM, manteniendo un contexto de 252K tokens.
IFM no solo publicó los pesos, sino también checkpoints intermedios, datasets y logs de entrenamiento completos, estableciendo un nuevo estándar de transparencia. MoVA representa más que un tweak arquitectural: es la materialización de ideas académicas como SwitchHead y MoEUT, escaladas a nivel producción con un enfoque pragmático oriental donde la eficiencia computacional prima sobre el hype.