¿Por qué el Aprendizaje por Refuerzo (RL) está de repente en todas partes y es realmente efectivo? ¿Han alcanzado los LLMs un estancamiento en términos de inteligencia y capacidades, o es el RL el avance que necesitan?
En este taller, profundizaremos en los fundamentos del RL, qué hace que una función de recompensa sea buena y cómo el RL puede ayudar a crear agentes.
También hablaremos sobre kernels, si aún valen tu tiempo y en qué deberías enfocarte. Y finalmente, exploraremos cómo los LLMs como DeepSeek-R1 pueden ser cuantificados a 1.58 bits y aún así funcionar bien, junto con técnicas para mantener la precisión.
Sobre Daniel Han
Estoy construyendo Unsloth y somos una startup de código abierto que intenta hacer que la IA sea más accesible y precisa para todos. ¡Tenemos 40K estrellas en GitHub, 10M de descargas mensuales en Hugging Face y hemos trabajado con Google, Meta y los equipos de Hugging Face para corregir errores en modelos de código abierto como Llama, Phi y Gemma! Anteriormente trabajé en NVIDIA haciendo que TSNE fuera 2000 veces más rápido.
Grabado en la Feria Mundial de Ingenieros de IA en San Francisco. Mantente al día sobre nuestros próximos eventos y contenido uniéndote a nuestro boletín aquí:
https://www.ai.engineer/newsletterTiempos
00:00 Introducción y Contribuciones de Unsloth
03:25 La Evolución de los Modelos de Lenguaje Grande (LLMs)
09:47 Etapas de Entrenamiento de LLM y la Analogía del Pastel de Yann LeCun
16:56 Agentes y Principios del Aprendizaje por Refuerzo
23:17 PPO y la Introducción de GRPO
48:12 Modelo de Recompensa vs. Función de Recompensa
51:22 La Matemática Detrás del Algoritmo Reinforce
01:08:50 Desglose de la Fórmula PPO
01:16:29 Profundización en GRPO
02:00:20 Implementación Práctica y Demostración con Unsloth
02:33:07 Cuantización y el Futuro de las GPUs
02:41:59 Conclusión y Llamado a la Acción
---
Mira junto con la transcripción corregida, resumen, tiempos y recursos en la página oficial de AIE de esta charla:
- AIE Nueva York, del 12 al 14 de octubre — la primera cumbre principal de AI Engineer Finance
- AIEi Shanghái, del 5 al 6 de noviembre — la primera para conocer a los mejores laboratorios e ingenieros chinos
- AIE CODE en SF, del 10 al 12 de noviembre — regresa la mejor conferencia de Codificación de IA
- AIEi Sídney, del 7 al 8 de diciembre — la primera AIEi junto a NeurIPS 2026 en Sídney
---