Por que o Aprendizado por Reforço (RL) de repente está em toda parte, e ele é realmente eficaz? Os LLMs atingiram um platô em termos de inteligência e capacidades, ou o RL é o avanço que eles precisam?
Nesta oficina, vamos mergulhar nos fundamentos do RL, o que torna uma boa função de recompensa e como o RL pode ajudar a criar agentes.
Também falaremos sobre kernels, se ainda valem seu tempo e no que você deve se concentrar. E, finalmente, vamos explorar como LLMs como o DeepSeek-R1 podem ser quantizados para 1,58 bits e ainda assim ter um bom desempenho, juntamente com técnicas para manter a precisão.
Sobre Daniel Han
Estou construindo a Unsloth e somos uma startup de código aberto tentando tornar a IA mais acessível e precisa para todos! Temos 40 mil estrelas no GitHub, 10 milhões de downloads mensais no Hugging Face e trabalhamos com as equipes do Google, Meta e Hugging Face para corrigir bugs em modelos de código aberto como Llama, Phi e Gemma. Anteriormente, trabalhei na NVIDIA tornando o TSNE 2000x mais rápido.
Gravado na Feira Mundial de Engenheiros de IA em San Francisco. Fique por dentro dos nossos próximos eventos e conteúdos se inscrevendo na nossa newsletter aqui:
https://www.ai.engineer/newsletterMarcos de Tempo
00:00 Introdução e Contribuições da Unsloth
03:25 A Evolução dos Modelos de Linguagem de Grande Escala (LLMs)
09:47 Estágios de Treinamento de LLM e a Analogia do Bolo de Yann LeCun
16:56 Agentes e Princípios do Aprendizado por Reforço
23:17 PPO e a Introdução do GRPO
48:12 Modelo de Recompensa vs. Função de Recompensa
51:22 A Matemática por trás do Algoritmo Reinforce
01:08:50 Análise da Fórmula PPO
01:16:29 Mergulho Profundo no GRPO
02:00:20 Implementação Prática e Demonstração com a Unsloth
02:33:07 Quantização e o Futuro das GPUs
02:41:59 Conclusão e Chamada à Ação