Imaginen un agente de IA que escribe código durante horas, no minutos. Cada edición, cada prueba, cada lectura de registro se acumula en su contexto, inflando la factura de la API hasta niveles insostenibles. Este era el dolor de cabeza oculto detrás de herramientas como el agente Pi, hasta que un consorcio de NVIDIA, la Universidad Tecnológica de Nanyang y el MIT decidió enfrentar el problema desde un ángulo radical: atacar no el costo por token, sino la cantidad de tokens que un trabajo consume. El resultado es SoL-Pi, un conjunto de cuatro mecanismos de eficiencia descubiertos por una IA mediante bucles de auto-investigación.
El truco está en el arnés
Mientras la industria se obsesiona con kernels más rápidos, modelos más baratos o técnicas de cuantización, el equipo detrás de SoL-Pi apuntó a la capa de ‘harness’ o arnés: ese sistema que maneja las llamadas a herramientas, el contexto, las observaciones y la delegación dentro del agente. Modificarlo manualmente es lento y sus componentes están tan acoplados que un ajuste en un lugar puede desplazar el costo a pasos posteriores. La solución fue poner a una IA de investigación a observar miles de trazas de ejecución del Pi base, proponer cambios en el arnés y probarlos automáticamente en más de 500 entornos ejecutables.
Los cuatro supervivientes de la búsqueda automática
De las 152 direcciones propuestas, solo cuatro mecanismos superaron el riguroso proceso de selección. Action Fusion es el primero: fusiona la edición de un archivo y el comando para probarlo en una sola solicitud, eliminando un viaje de ida y vuelta al modelo. Online Context Compact es un compactador de contexto inteligente que decide cuándo reescribir la caché de prompts para ahorrar tokens. ObservationPack archiva localmente salidas de herramientas grandes y las reemplaza por un ‘handle’ estable después de dos peticiones. Y el Evidence-Preserving Reducer delega en un modelo más barato la tarea de resumir logs extensos de compilación y pruebas, pero con un verificador determinista que garantiza la integridad de la información.
Los números que hacen temblar a la competencia
En la evaluación EdgeBench de 51 tareas, SoL-Pi reduce el tráfico de tokens registrado entre un 44.7% y un 49.0% respecto a Pi, mientras el costo de la API cae aproximadamente un 33%. Lo más importante: mantiene cerca del 94% del puntaje promedio de Pi. Traducido a ahorros horarios, estamos hablando de entre 4.36 y 5.71 dólares menos que usar Pi de forma nativa. El mecanismo se distribuye en GitHub bajo licencia MIT como una extensión ‘opt-in’ que funciona sobre una versión sin modificar de Pi, haciendo su adopción ridículamente sencilla.
Las implicaciones son profundas. No se trata solo de ahorrar dinero; es sobre hacer sostenible la ejecución prolongada de agentes de código, permitir ‘swarms’ o enjambres de agentes más grandes por el mismo presupuesto, y democratizar el acceso a esta tecnología. SoL-Pi no reinventa el modelo de lenguaje, sino que optimiza radicalmente cómo lo usamos. En un mundo donde la eficiencia computacional es la nueva moneda, este trabajo marca un antes y un después en la economía real del desarrollo asistido por IA.
