¿Por qué el Aprendizaje por Refuerzo (RL) está de repente en todas partes y realmente es efectivo? ¿Han alcanzado los LLMs un estancamiento en términos de inteligencia y capacidades, o es el RL el avance que necesitan?
En este taller, profundizaremos en los fundamentos del RL, qué hace que una función de recompensa sea buena y cómo el RL puede ayudar a crear agentes.
También hablaremos sobre kernels, si todavía valen tu tiempo y en qué deberías enfocarte. Y finalmente, exploraremos cómo los LLMs como DeepSeek-R1 pueden ser cuantizados a 1.58 bits y aún así funcionar bien, junto con técnicas para mantener la precisión.
Sobre Daniel Han
Estoy construyendo Unsloth y somos una startup de código abierto que intenta hacer que la IA sea más accesible y precisa para todos. Tenemos 40K estrellas en GitHub, 10M descargas mensuales en Hugging Face y hemos trabajado con Google, Meta y equipos de Hugging Face para corregir errores en modelos de código abierto como Llama, Phi y Gemma. Anteriormente trabajé en NVIDIA haciendo que TSNE fuera 2000 veces más rápido.
Grabado en la Feria Mundial de Ingenieros de IA en San Francisco. Mantente al día sobre nuestros próximos eventos y contenido uniéndote a nuestro boletín aquí:
https://www.ai.engineer/newsletterTiempos
00:00 Introducción y Contribuciones de Unsloth
03:25 La Evolución de los Modelos de Lenguaje Grande (LLMs)
09:47 Etapas de Entrenamiento de LLM y la Analogía del Pastel de Yann LeCun
16:56 Agentes y Principios del Aprendizaje por Refuerzo
23:17 PPO y la Introducción de GRPO
48:12 Modelo de Recompensa vs. Función de Recompensa
51:22 La Matemática Detrás del Algoritmo Reinforce
01:08:50 Desglose de la Fórmula PPO
01:16:29 Profundización en GRPO
02:00:20 Implementación Práctica y Demostración con Unsloth
02:33:07 Cuantización y el Futuro de las GPUs
02:41:59 Conclusión y Llamado a la Acción