¿De verdad los modelos de lenguaje piensan cuando encadenan tokens de razonamiento, o simplemente nos muestran una explicación de teatro? Un nuevo trabajo publicado en arXiv (2604.23351) pone sobre la mesa una respuesta fascinante: la información clave para resolver un problema ya está presente en los estados ocultos del modelo, incluso cuando la cadena de pensamiento (CoT) visible termina en una respuesta incorrecta.
Qué hicieron y por qué importa
El equipo aplicó un análisis mecanístico-causal sobre GSM8K, el clásico benchmark de problemas matemáticos, usando una técnica llamada activation patching: tomaron los estados ocultos de tokens generados durante una corrida con CoT y los transfirieron a una ejecución de respuesta directa para la misma pregunta. El resultado fue contundente: al generar la respuesta después de este parcheo, la precisión superó tanto a la respuesta directa como a la cadena de razonamiento original.
En criollo: tokens individuales del razonamiento contienen suficiente información para recuperar la respuesta correcta, aunque el razonamiento completo haya fallado. La información relevante se concentra en las capas intermedias y tardías del modelo, aparece temprano en la traza y es más abundante en las corridas que ya eran correctas. Además, no todos los tokens valen lo mismo: los lingüísticos (verbos, entidades) guían al modelo hacia el razonamiento correcto, mientras que los tokens matemáticos cargan contenido cercano a la respuesta pero rara vez la resuelven por sí solos.
Implicancias para los LLMs occidentales
Para modelos como GPT-4o, Claude o Gemini, este hallazgo abre una línea prometedora: intervenir quirúrgicamente en los estados internos podría corregir razonamientos fallidos sin reentrenar nada. También sugiere que las cadenas completas no siempre son necesarias; los resultados parcheados fueron, muchas veces, más cortos y más precisos que la traza original.
Tips prácticos para llevar a tu flujo de trabajo
- Menos puede ser más: si tu prompt con razonamiento extenso falla, probá pedir una versión condensada; la cadena completa no garantiza mejor respuesta.
- Investigá el razonamiento temprano: los primeros pasos de la traza suelen contener la información más valiosa; pedile al modelo que revise sus premisas iniciales.
- Prompt sugerido: “Resolvé el problema paso a paso. Luego identificá qué token o premisa de tu razonamiento fue decisivo y reintentá la respuesta usando solo esa información”.
- Para desarrolladores: si trabajás con APIs que expongan logits o estados internos, el patching de activaciones es una herramienta de debugging cognitivo que merece tu atención.
La conclusión de Lucas Ferreira: la IA occidental sabe más de lo que dice. Y ahora tenemos evidencia causal de dónde esconde ese conocimiento.