El universo de la generación de imágenes por IA sigue su vertiginoso avance, y OpenAI no se queda atrás. Con el lanzamiento de GPT Images 2.5, la compañía busca pulir una herramienta que ya moviliza miles de millones de creaciones semanales, enfocándose en resolver los puntos flacos que generaban más de un dolor de cabeza a sus usuarios. Lejos de ser una revolución arquitectónica, esta actualización se presenta como una evolución inteligente, una versión 2.0 llevada a su máxima expresión, y es precisamente en ese ‘llevar a la perfección’ donde reside lo más interesante.
Adiós a las ‘Mutaciones’: Precisión y Velocidad como Ejes Centrales
La principal promesa de GPT Images 2.5 es clara: mayor velocidad y una edición ‘quirúrgica’. Según los datos de OpenAI, la generación de imágenes se ha acelerado hasta un 50%, y la capacidad de edición se ha vuelto notablemente más precisa. Esto se traduce en una experiencia menos frustrante para quienes buscan refinar sus creaciones. Los días de ver cómo un sujeto deseado se ‘mutaba’ o cómo una edición puntual desbarataba toda la composición parecen estar contados. La nueva versión promete mantener la coherencia de los sujetos en referencias, preservar el estilo y la composición, y asegurar que las correcciones se apliquen de manera aislada, sin afectar al resto de la imagen. Un desarrollador que probó la API reportó una reducción en los tiempos de espera de más de la mitad, pasando de 104 segundos a unos escasos 35-40 segundos en promedio. ¡La diferencia es palpable!
Los tres pilares de mejora anunciados por OpenAI son:
- Reconocimiento y preservación de sujetos: Los rostros y objetos en las imágenes de referencia ahora se mantienen intactos al ser transferidos a nuevas escenas, asegurando que el sujeto principal siga siendo reconocible sin importar los cambios de estilo, fondo o composición.
- Edición focalizada: Las correcciones se aplican de manera precisa. Si se solicita cambiar un elemento específico, como un producto o un texto, solo ese elemento se modifica, dejando el resto de la imagen inalterado. Esto permite, por ejemplo, adaptar una foto de producto a diferentes campañas o temporadas sin necesidad de recrear la escena completa.
- Estabilidad en las iteraciones: Las modificaciones anteriores se conservan, y la calidad de la imagen no se degrada con cada nueva edición. Esto es crucial para flujos de trabajo complejos donde se realizan múltiples ajustes, garantizando que cada paso se construya sobre el anterior sin perder fidelidad.
Innovación en la Interacción: Sketch y Comentarios Directos
GPT Images 2.5 no solo mejora la edición, sino que también introduce nuevas formas de interactuar con la IA. El modo Sketch permite a los usuarios dibujar bocetos rápidos para guiar a la IA, una alternativa intuitiva cuando las palabras no son suficientes. Además, la función de comentarios directos sobre la imagen transforma la edición en algo similar a trabajar en herramientas como Figma, donde se puede hacer clic en un área específica y solicitar cambios puntuales. Para los desarrolladores, se presentan dos modelos: GPT-Image-2.5 Flare, optimizado para velocidad y volumen, y GPT-Image-2.5 Sunburst, enfocado en la precisión para escenarios creativos de alta gama. Ambos modelos destacan en la gestión de fondos transparentes y en la comprensión de instrucciones complejas, consolidando a OpenAI como un jugador clave en la vanguardia de la generación de imágenes.