El mundo de la síntesis de voz acaba de dar un salto cuántico. Gradium, la startup parisina surgida del laboratorio de investigación Kyutai, presentó Voice Design, una tecnología que permite crear voces sintéticas completamente nuevas en cuestión de segundos usando únicamente descripciones textuales. ¿El resultado? Voces únicas y personalizadas sin necesidad de muestras de audio originales ni complicados procesos de licenciamiento.
Así funciona la magia de Voice Design
El sistema es tan simple como revolucionario: escribís una descripción detallada (entre 1 y 500 caracteres) indicando género, rango etario, acento, tono, energía y hasta el propósito de la voz (narración, atención al cliente, etc.), y la IA genera hasta 5 variantes vocales en 3-5 segundos. El ‘briefing de casting’ se convierte literalmente en una llamada API, disponible gratuitamente en todos los planes de Gradium, incluido el nivel free.
Ventajas competitivas y benchmarks
En pruebas ciegas con 7,627 comparaciones, Voice Design obtuvo un 72.6% de preferencia frente a competidores como ElevenLabs e Inworld, destacándose especialmente en acentos regionales (97% para el francés quebequense, 86% para el español rioplatense). La herramienta ya está operativa en cinco idiomas (inglés, francés, español, portugués y alemán) y las voces generadas pueden integrarse directamente en flujos de producción mediante API REST.
Para desarrolladores, el workflow es claro: generás candidatos, los evaluás mediante el endpoint TTS estándar y convertís el elegido en una voz permanente (que ocupa uno de los slots disponibles según tu plan). Eso sí: el sampling es no determinístico, por lo que si no guardás un candidato, se perderá después de 30 días.