Pensar que ejecutar un modelo de 70 mil millones de parámetros es una simple división matemática entre el tamaño del modelo y la memoria de una tarjeta gráfica es el primer error de cualquier novato. La realidad de la infraestructura de Inteligencia Artificial en 2026 es mucho más salvaje y fascinante. Cuando llegan los primeros usuarios con documentos extensos, el sistema colapsa. Un LLM no es el único inquilino de la memoria de video; a su lado convive el KV-cache, y detrás, una red de hardware que decide quién domina el mercado.
El cuello de botella invisible: Memoria y KV-Cache
En formato BF16, un modelo de 70B pesa unos 140 GB solo en sus pesos. Pero el verdadero devorador de recursos es el KV-cache, esa memoria que guarda las claves y valores de cada token procesado para no releer todo el diálogo. Un contexto de 128.000 tokens se traga unos 43 GB. Si diez usuarios cargan documentos de 32.000 tokens, consumen 107 GB, casi tres cuartos del peso del modelo. La memoria se agota antes que la capacidad de cálculo, y los nuevos pedidos quedan en cola.
El dominio de Oriente y la arquitectura MoE
Mientras Occidente discute filosofía de modelos, los gigantes de Oriente como DeepSeek y Kimi están redefiniendo el hardware. Modelos como DeepSeek-V3, con 671 mil millones de parámetros totales pero solo 37 mil millones activos por token (arquitectura Mixture of Experts), generan una asimetría brutal. Hay que almacenar los 671B completos, pero calcular a la velocidad de un modelo de 37B. En los benchmarks de MLPerf Inference 6.1, la empresa Lambda ejecutó a Kimi K2.6, una bestia MoE de un billón de parámetros. La red se convierte en el cuello de botella definitivo, exigiendo un tráfico constante de todos contra todos para enrutar cada token hacia el experto adecuado.
Redes, NVLink y la topología del poder
El paralelismo tensorial exige sincronización en cada capa, lo que para un modelo de 70B significa más de un centenar de intercambios por token. Dentro de un servidor, el NVLink del H100 ofrece 450 GB/s en cada dirección, pero entre servidores, InfiniBand cae a unos 50 GB/s. DeepSeek reportó en su clúster H800 velocidades de 160 GB/s por NVLink frente a 50 GB/s por InfiniBand. Para sortear esto, NVIDIA presentó durante el CES 2026 sistemas como el Vera Rubin NVL72, que extienden NVLink a 72 GPUs dentro de un mismo rack, eliminando la red lenta entre nodos. La frontera del hardware dejó de ser el teraflop y pasó a ser la topología de conexión.
Almacenamiento y el fin del 'cold start'
El procesador y los discos NVMe dejaron de ser meros espectadores. Hoy gestionan las colas y almacenan el KV-cache que no entra en la VRAM. En el CES 2026, NVIDIA mostró su plataforma de almacenamiento con DPU BlueField-4, optimizada para este caché, con entregas prometidas para el segundo semestre de 2026. Si un usuario retoma un chat, es más eficiente traer el caché desde el NVMe que recalcular todo el prefill. En la era de los billones de parámetros, la victoria no la da el modelo más grande, sino la infraestructura más inteligente.
