MERCADOS:
BTC $81,317 ▲ +4.29%
ETH $2,529 ▲ +5.04%
SOL $184 ▲ +3.57%
IA STATUS Online RELOJ --:--:-- ART
📅 miércoles, 7 de octubre de 2026

TecnoSaberes

Inteligencia Artificial y Educación para Todos

🐉 LLMs de Oriente

La infraestructura secreta de la IA: Por qué DeepSeek no corre en una GPU

La infraestructura secreta de la IA: Por qué DeepSeek no corre en una GPU

Pensar que ejecutar un modelo de 70 mil millones de parámetros es una simple división matemática entre el tamaño del modelo y la memoria de una tarjeta gráfica es el primer error de cualquier novato. La realidad de la infraestructura de Inteligencia Artificial en 2026 es mucho más salvaje y fascinante. Cuando llegan los primeros usuarios con documentos extensos, el sistema colapsa. Un LLM no es el único inquilino de la memoria de video; a su lado convive el KV-cache, y detrás, una red de hardware que decide quién domina el mercado.

El cuello de botella invisible: Memoria y KV-Cache

En formato BF16, un modelo de 70B pesa unos 140 GB solo en sus pesos. Pero el verdadero devorador de recursos es el KV-cache, esa memoria que guarda las claves y valores de cada token procesado para no releer todo el diálogo. Un contexto de 128.000 tokens se traga unos 43 GB. Si diez usuarios cargan documentos de 32.000 tokens, consumen 107 GB, casi tres cuartos del peso del modelo. La memoria se agota antes que la capacidad de cálculo, y los nuevos pedidos quedan en cola.

El dominio de Oriente y la arquitectura MoE

Mientras Occidente discute filosofía de modelos, los gigantes de Oriente como DeepSeek y Kimi están redefiniendo el hardware. Modelos como DeepSeek-V3, con 671 mil millones de parámetros totales pero solo 37 mil millones activos por token (arquitectura Mixture of Experts), generan una asimetría brutal. Hay que almacenar los 671B completos, pero calcular a la velocidad de un modelo de 37B. En los benchmarks de MLPerf Inference 6.1, la empresa Lambda ejecutó a Kimi K2.6, una bestia MoE de un billón de parámetros. La red se convierte en el cuello de botella definitivo, exigiendo un tráfico constante de todos contra todos para enrutar cada token hacia el experto adecuado.

Redes, NVLink y la topología del poder

El paralelismo tensorial exige sincronización en cada capa, lo que para un modelo de 70B significa más de un centenar de intercambios por token. Dentro de un servidor, el NVLink del H100 ofrece 450 GB/s en cada dirección, pero entre servidores, InfiniBand cae a unos 50 GB/s. DeepSeek reportó en su clúster H800 velocidades de 160 GB/s por NVLink frente a 50 GB/s por InfiniBand. Para sortear esto, NVIDIA presentó durante el CES 2026 sistemas como el Vera Rubin NVL72, que extienden NVLink a 72 GPUs dentro de un mismo rack, eliminando la red lenta entre nodos. La frontera del hardware dejó de ser el teraflop y pasó a ser la topología de conexión.

Almacenamiento y el fin del 'cold start'

El procesador y los discos NVMe dejaron de ser meros espectadores. Hoy gestionan las colas y almacenan el KV-cache que no entra en la VRAM. En el CES 2026, NVIDIA mostró su plataforma de almacenamiento con DPU BlueField-4, optimizada para este caché, con entregas prometidas para el segundo semestre de 2026. Si un usuario retoma un chat, es más eficiente traer el caché desde el NVMe que recalcular todo el prefill. En la era de los billones de parámetros, la victoria no la da el modelo más grande, sino la infraestructura más inteligente.

AL

Sobre Andrés LLM

Especialista en Modelos Asiáticos (DeepSeek, Kimi, Qwen, GLM)

Periodista y analista en Tecno Saberes especializado en la cobertura de Inteligencia Artificial y Educación para Todos.

🚀 Potenciá tu criterio digital y habilidades en IA

Tecno Saberes es una iniciativa de divulgación tecnológica asistida por Inteligencia Artificial y orquestada por el equipo de TucMara.com.

←
→