O aprendizado por reforço está se tornando central para sistemas agentes, mas a transição de RL para LLMs para RL para agentes traz um novo conjunto de desafios: ambientes, execuções, uso de ferramentas, gargalos de inferência, design de recompensas e avaliação de comportamentos em múltiplas etapas no mundo real.
Neste workshop ao vivo da Hugging Face, reunimos pesquisadores e criadores que trabalham na vanguarda do RL para agentes. A sessão contará com palestras curtas seguidas de uma discussão sobre o que está funcionando hoje, onde os métodos abertos ainda falham e o que vem a seguir.
Os palestrantes incluem:
- Lewis Tunstall, Hugging Face
- Will Brown, Prime Intellect
- Ofir Press, Universidade de Princeton
- Alex Zhang, MIT CSAIL
- convidados adicionais a serem anunciados
Os tópicos incluem:
- treinamento de agentes com ferramentas de código aberto
- escalonamento de RL para agentes de linguagem
- verificação em múltiplas etapas e design de recompensas
- avaliação da capacidade de agentes além de tarefas estáticas
- raciocínio recursivo e novas arquiteturas de agentes