Pourquoi l'apprentissage par renforcement (RL) est-il soudainement partout, et est-il vraiment efficace ? Les LLM ont-ils atteint un plateau en termes d'intelligence et de capacités, ou le RL est-il la percée dont ils ont besoin ?
Dans cet atelier, nous plongerons dans les fondamentaux du RL, ce qui constitue une bonne fonction de récompense, et comment le RL peut aider à créer des agents.
Nous parlerons également des noyaux, s'ils valent encore votre temps et sur quoi vous devriez vous concentrer. Enfin, nous explorerons comment des LLM comme DeepSeek-R1 peuvent être quantifiés jusqu'à 1,58 bits tout en performants bien, ainsi que des techniques pour maintenir la précision.
À propos de Daniel Han
Je construis Unsloth et nous sommes une startup open-source essayant de rendre l'IA plus accessible et précise pour tout le monde ! Nous avons 40K étoiles sur GitHub, 10M de téléchargements mensuels sur Hugging Face et avons travaillé avec les équipes de Google, Meta et Hugging Face pour corriger des bugs dans des modèles open-source comme Llama, Phi & Gemma. J'ai précédemment travaillé chez NVIDIA à rendre TSNE 2000x plus rapide.
Enregistré à la Foire Mondiale des Ingénieurs en IA à San Francisco. Restez informé de nos événements et contenus à venir en rejoignant notre newsletter ici :
https://www.ai.engineer/newsletterHorodatages
00:00 Introduction et Contributions d'Unsloth
03:25 L'Évolution des Modèles de Langage de Grande Taille (LLMs)
09:47 Étapes de Formation des LLM et Analogie du Gâteau de Yann LeCun
16:56 Agents et Principes de l'Apprentissage par Renforcement
23:17 PPO et Introduction de GRPO
48:12 Modèle de Récompense vs. Fonction de Récompense
51:22 Les Mathématiques Derrière l'Algorithme Reinforce
01:08:50 Décomposition de la Formule PPO
01:16:29 Plongée dans GRPO
02:00:20 Mise en Œuvre Pratique et Démo avec Unsloth
02:33:07 Quantification et l'Avenir des GPU
02:41:59 Conclusion et Appel à l'Action