MERCADOS:
BTC $81,317 ▲ +4.29%
ETH $2,529 ▲ +5.04%
SOL $184 ▲ +3.57%
IA STATUS Online RELOJ --:--:-- ART
📅 viernes, 11 de septiembre de 2026

TecnoSaberes

Inteligencia Artificial y Educación para Todos

🐉 LLMs de Oriente

MoVA: La revolución silenciosa de los modelos de lenguaje en Oriente

MoVA: La revolución silenciosa de los modelos de lenguaje en Oriente

El paisaje de los LLMs acaba de recibir un terremoto tecnológico desde Abu Dabi. El Institute of Foundation Models (IFM), brazo investigativo de la MBZUAI, desembarcó en septiembre de 2026 con K2 Horizon: seis modelos open-weight que redefinen la eficiencia computacional. La estrella es la K2-Horizon-MoVA-36B-A4B, una bestia de 36B parámetros totales que activa solo 4B por token gracias a su innovadora arquitectura Mixture-of-Value Attention (MoVA).

MoVA: Cuando la atención se vuelve selectiva

Mientras los modelos MoE tradicionales aplican mezcla de expertos solo en las capas FFN, MoVA traslada este principio al mecanismo de atención. Aquí radica la genialidad: las proyecciones de valor (V) se calculan mediante un router que selecciona dinámicamente entre 64 expertos especializados, activando solo los 4 más relevantes por token. Q y K permanecen densos para mantener la coherencia contextual, pero V adopta esta capa adicional de esparsidad.

Benchmarks que desafían la lógica

Los resultados son contundentes: en tau3-Banking (26.8 vs 14.2) y Terminal-Bench 2.1 (58.6 vs 53.9), esta ‘ligera’ de 4B activos supera al Nemotron 3 Ultra de 55B parámetros activos. Sin embargo, como contrapartida, muestra debilidad en tareas de razonamiento puro y contexto extenso, donde modelos densos como Muse Glimmer-30B mantienen ventaja.

La arquitectura, compatible con FlashAttention y GQA, ya tiene soporte en vLLM y SGLang, aunque su integración con llama.cpp sigue en desarrollo. Para ejecución local, las versiones cuantizadas Q8_0 requieren al menos 48GB de VRAM, manteniendo un contexto de 252K tokens.

IFM no solo publicó los pesos, sino también checkpoints intermedios, datasets y logs de entrenamiento completos, estableciendo un nuevo estándar de transparencia. MoVA representa más que un tweak arquitectural: es la materialización de ideas académicas como SwitchHead y MoEUT, escaladas a nivel producción con un enfoque pragmático oriental donde la eficiencia computacional prima sobre el hype.

Fuente: Habr AI (Rusia & Europa del Este)

AL

Sobre Andrés LLM

Especialista en Modelos Asiáticos (DeepSeek, Kimi, Qwen, GLM)

Periodista y analista en Tecno Saberes especializado en la cobertura de Inteligencia Artificial y Educación para Todos.

🚀 Potenciá tu criterio digital y habilidades en IA

Tecno Saberes es una iniciativa de divulgación tecnológica asistida por Inteligencia Artificial y orquestada por el equipo de TucMara.com.