Pourquoi l'apprentissage par renforcement (RL) est-il soudainement partout, et est-il vraiment efficace ? Les LLMs ont-ils atteint un plateau en termes d'intelligence et de capacités, ou le RL est-il la percée dont ils ont besoin ?
Dans cet atelier, nous plongerons dans les fondamentaux du RL, ce qui constitue une bonne fonction de récompense, et comment le RL peut aider à créer des agents.
Nous parlerons également des noyaux, s'ils valent encore votre temps et sur quoi vous devriez vous concentrer. Enfin, nous explorerons comment des LLMs comme DeepSeek-R1 peuvent être quantifiés jusqu'à 1,58 bits tout en performants bien, ainsi que des techniques pour maintenir la précision.
À propos de Daniel Han
Je construis Unsloth et nous sommes une startup open-source essayant de rendre l'IA plus accessible et précise pour tout le monde ! Nous avons 40K étoiles sur GitHub, 10M de téléchargements mensuels sur Hugging Face et avons travaillé avec les équipes de Google, Meta et Hugging Face pour corriger des bugs dans des modèles open-source comme Llama, Phi et Gemma. J'ai précédemment travaillé chez NVIDIA pour rendre TSNE 2000 fois plus rapide.
Enregistré à la Foire Mondiale des Ingénieurs en IA à San Francisco. Restez à jour sur nos événements et contenus à venir en rejoignant notre newsletter ici :
https://www.ai.engineer/newsletterHorodatages
00:00 Introduction et contributions d'Unsloth
03:25 L'évolution des modèles de langage de grande taille (LLMs)
09:47 Étapes de formation des LLM et analogie du gâteau de Yann LeCun
16:56 Agents et principes de l'apprentissage par renforcement
23:17 PPO et introduction de GRPO
48:12 Modèle de récompense vs. fonction de récompense
51:22 Les mathématiques derrière l'algorithme Reinforce
01:08:50 Décomposition de la formule PPO
01:16:29 Plongée approfondie dans GRPO
02:00:20 Mise en œuvre pratique et démo avec Unsloth
02:33:07 Quantification et avenir des GPU
02:41:59 Conclusion et appel à l'action
---
Regardez avec la transcription corrigée, le résumé, les horodatages et les ressources sur la page officielle AIE de cette conférence :
- AIE New York, du 12 au 14 octobre — le premier sommet principal AI Engineer Finance
- AIEi Shanghai, les 5 et 6 novembre — le premier pour rencontrer les meilleurs laboratoires et ingénieurs chinois
- AIE CODE à SF, du 10 au 12 novembre — la meilleure conférence de codage en IA revient
- AIEi Sydney, les 7 et 8 décembre — le premier AIEi organisé en parallèle de NeurIPS 2026 à Sydney
---