DeepMath es un agente de razonamiento matemático alineado que utiliza Qwen3‑4B Thinking y se ajusta con GRPO. En lugar de generar texto extenso, produce fragmentos de Python que se ejecutan en un sandbox seguro, devolviendo resultados que alimentan su proceso de pensamiento.
Innovación y resultados
El modelo se evalúa en los conjuntos MATH500, AIME, HMMT y HLE, demostrando que la combinación de agente y entrenamiento GRPO reduce la longitud de salida hasta un 66% y mejora la precisión en la mayoría de los benchmarks.
-
Offload determinista a un executor seguro.
-
Entrenamiento con GRPO que premia fragmentos de código y acorta la traza.
-
Ejecución en sandbox con límites de tiempo y recursos.