DeepSeek acaba de publicar V4, un modelo que no solo presume de una ventana de contexto de un millón de tokens, sino que está diseñado específicamente para que los agentes de IA la utilicen en producción. La diferencia no es menor: hasta ahora, esa capacidad era teórica porque el costo computacional hacía imposible explotarla en flujos de trabajo reales.
Por qué 1M de tokens no servían antes
Correr un modelo frontier en modo agente hoy fracasa de formas predecibles. El modelo se detiene, se repromptea, el trace supera el presupuesto de contexto, o la caché KV llena la GPU. Cada resultado de herramienta se añade al contexto, y cada token subsiguiente paga el costo completo de atención contra todo lo anterior.
La arquitectura que cambia las reglas
DeepSeek-V4 introduce dos mecanismos de atención entrelazados que reducen drásticamente los recursos necesarios. El Compressed Sparse Attention (CSA) comprime las entradas KV en 4x usando pooling con sesgo posicional aprendido, mientras que el Heavily Compressed Attention (HCA) comprime 128x y usa atención densa sobre la secuencia comprimida. El resultado: V4-Pro requiere solo el 27% de los FLOPs de inferencia de un solo token comparado con V3.2, y usa apenas el 10% de la memoria de caché KV. En términos absolutos, necesita aproximadamente el 2% del tamaño de caché frente a arquitecturas tradicionales con atención de consulta agrupada.
Razonamiento persistente para agentes multi-turno
Uno de los cambios más relevantes para workflows de agentic AI: V4 preserva el contenido de razonamiento a través de los límites de mensajes del usuario cuando la conversación incluye llamadas a herramientas. Esto permite una cadena de pensamiento coherente y acumulativa sobre tareas de largo plazo, algo que V3.2 no podía hacer.
Formato XML y token especial para herramientas
V4 introduce un token especial |DSML| y un formato XML para llamadas a herramientas. La ventaja sobre JSON embebido es concreta: elimina una clase de errores de parsing relacionados con números y booleanos que los formatos JSON routinely golpean.
Benchmarks: supera a Sonnet 4.5 en codificación
En el benchmark interno de codificación R&D de DeepSeek—30 tareas curadas en PyTorch, CUDA, Rust y C++—V4-Pro-Max alcanza un 67% de tasa de paso, contra el 47% de Sonnet 4.5 y el 70% de Opus 4.5. En una encuesta con 85 desarrolladores de DeepSeek que usan V4-Pro como driver diario, el 52% dijo que estaba listo para reemplazar su modelo de codificación principal.
Los números de recuperación en contexto largo son igual de impresionantes: la precisión MRCR 8-needle se mantiene por encima de 0.82 hasta 256K tokens y sostiene 0.59 en el millón completo.
Disponibilidad y modos de razonamiento
Cuatro checkpoints están disponibles en el Hub. Los modelos instruct usan FP4 para pesos MoE y FP8 para el resto; los modelos base son FP8 en su totalidad. Los modelos instruct soportan tres modos de razonamiento: Non-think (rápido, sin cadena de pensamiento), Think High (razonamiento explícito en bloques ) y Think Max (máximo esfuerzo con prompt de sistema dedicado, requiere al menos 384K tokens de contexto).