El aprendizaje por refuerzo se está convirtiendo en un elemento central para los sistemas agentes, pero pasar de RL para LLMs a RL para agentes introduce un nuevo conjunto de desafíos: entornos, implementaciones, uso de herramientas, cuellos de botella en la inferencia, diseño de recompensas y evaluación del comportamiento en múltiples pasos en el mundo real.
En este taller en vivo de Hugging Face, reunimos a investigadores y creadores que trabajan en la vanguardia de RL para agentes. La sesión contará con charlas breves seguidas de una discusión sobre lo que está funcionando hoy, dónde los métodos abiertos aún tienen deficiencias y qué viene a continuación.
Los ponentes incluyen:
- Lewis Tunstall, Hugging Face
- Will Brown, Prime Intellect
- Ofir Press, Universidad de Princeton
- Alex Zhang, MIT CSAIL
- invitados adicionales por anunciar
Los temas incluyen:
- entrenamiento de agentes con herramientas de código abierto
- escalado de RL para agentes de lenguaje
- verificación en múltiples pasos y diseño de recompensas
- evaluación de la capacidad del agente más allá de tareas estáticas
- razonamiento recursivo y nuevas arquitecturas de agentes