Llama 3.2, el modelo de inteligencia artificial de Meta, ya está disponible en Keras desde el mismo día de su lanzamiento en Hugging Face. No hay que esperar: el framework permite cargar los checkpoints en formato safetensors directamente, con conversión automática si es necesario.
Modelos preentrenados y herramientas listas para usar
Keras, a través de su repositorio keras-hub (antes KerasNLP y KerasCV), ofrece una colección de modelos preentrenados que incluyen Llama 3.2, Gemma, StableDiffusion y Segment Anything, todos con su implementación canónica. El tokenizer está incluido y model.generate() funciona directamente sobre cadenas de texto.
Entrenamiento y ajuste fino simplificado
El ajuste fino de Llama 3.2 se puede realizar directamente sobre conjuntos de cadenas de texto. El método model.fit(ds) es compatible con entrenamiento distribuido, precisión mixta, cuantización y técnicas LoRA/QLoRA. En una demostración práctica, el modelo fue ajustado para hablar como un pirata en menos de 8 minutos sobre una TPU v5e de Google.
Paralelismo de modelos con JAX y XLA
Una de las ventajas clave de Keras es su capacidad para ejecutar modelos de miles de millones de parámetros mediante paralelismo en múltiples aceleradores. Un modelo Llama 3.1 de 8B parámetros, por ejemplo, puede distribuirse entre varias GPUs o TPUs sin necesidad de cuantización. Los mapas de distribución de pesos se pueden personalizar para optimizar el rendimiento, logrando mejoras de hasta un 13% en velocidad de entrenamiento.
-
Keras soporta JAX, PyTorch y TensorFlow con un simple selector de backend
-
Las variantes instruccionales de Llama 3.2 permiten conversaciones turn-by-turn con formato automático
-
El modelo ajustado puede subirse directamente a Hugging Face desde Keras
Con keras-hub, los desarrolladores tienen acceso a un ecosistema completo que incluye tokenizadores, preprocesadores y clases auxiliares como ChatState para gestionar conversaciones, todo dentro de un framework flexible y escalable.