Un equipo de investigación ha recreado con éxito el célebre "momento eureka" de DeepSeek R1, el modelo que rivaliza con OpenAI o1 en razonamiento complejo, utilizando exclusivamente aprendizaje por refuerzo puro y el juego Countdown, sin ningún tipo de retroalimentación humana.
Qué es el "momento eureka" de DeepSeek R1
El fenómeno, descrito en el paper original de DeepSeek, ocurre cuando DeepSeek-R1-Zero —la primera iteración del modelo— aprende a asignar más tiempo de razonamiento a un problema mediante la reevaluación de su enfoque inicial, sin datos ni instrucciones humanas. Este comportamiento demuestra cómo el aprendizaje por refuerzo puede generar resultados inesperados y sofisticados en modelos de lenguaje.
Cómo se recreó: GRPO y el juego Countdown
Los investigadores utilizaron Group Relative Policy Optimization (GRPO), un algoritmo de aprendizaje por refuerzo que elimina la necesidad de un modelo de valor tradicional, reduciendo el consumo de memoria y la sobrecarga computacional. El experimento se basó en:
-
Modelo base: Qwen/Qwen2.5-3B-Instruct, un modelo de 3.000 millones de parámetros.
-
Dataset: Jiayi-Pan/Countdown-Tasks-3to4, con ejercicios de 3 a 4 números.
-
Entrenamiento: 450 pasos en 4 GPUs NVIDIA H100 de 80 GB usando DeepSpeed y vLLM.
-
Duración: aproximadamente 6 horas para el entrenamiento completo.
-
Recompensas: dos funciones de recompensa basadas en reglas para verificar la corrección de las ecuaciones generadas.
Resultados y observaciones clave
Durante el entrenamiento, el modelo mostró una transición notable: pasó de un razonamiento basado en palabras a una ejecución programática, imitando el comportamiento observado en DeepSeek R1. Los checkpoints del modelo están disponibles públicamente en philschmid/qwen-2.5-3b-r1-countdown, y las muestras de razonamiento exitoso se pueden inspeccionar en tiempo real.
El experimento, inspirado en el trabajo previo de Jiayi Pan, demuestra que el método GRPO funciona para inducir capacidades de razonamiento en modelos abiertos, aunque con un alcance limitado a tareas específicas.
¿Qué viene para 2025?
La liberación de DeepSeek R1 y su paper representan un punto de inflexión para la ciencia abierta. Con GRPO ahora adoptado también por el equipo de Qwen, se espera que el aprendizaje por refuerzo se vuelva más accesible, aunque requiera mayor capacidad de cómputo que el ajuste supervisado tradicional.