L'apprentissage par renforcement devient central pour les systèmes agents, mais passer de RL pour les LLM à RL pour les agents introduit un nouvel ensemble de défis : environnements, déploiements, utilisation d'outils, goulets d'étranglement d'inférence, conception de récompenses et évaluation du comportement multi-étapes dans le monde réel.
Dans cet atelier en direct de Hugging Face, nous rassemblons des chercheurs et des créateurs travaillant à la pointe de RL pour agents. La session comprendra des présentations courtes suivies d'une discussion sur ce qui fonctionne aujourd'hui, où les méthodes ouvertes sont encore insuffisantes et ce qui vient ensuite.
Les intervenants incluent :
- Lewis Tunstall, Hugging Face
- Will Brown, Prime Intellect
- Ofir Press, Université de Princeton
- Alex Zhang, MIT CSAIL
invités supplémentaires à confirmer
Les sujets incluent :
- formation des agents avec des outils open source
- mise à l'échelle de RL pour les agents linguistiques
- vérification multi-étapes et conception de récompenses
- évaluation des capacités des agents au-delà des tâches statiques
- raisonnement récursif et nouvelles architectures d'agents