Por que o Aprendizado por Reforço (RL) de repente está em toda parte, e ele é realmente eficaz? Os LLMs atingiram um platô em termos de inteligência e capacidades, ou o RL é o avanço que eles precisam?
Neste workshop, vamos mergulhar nos fundamentos do RL, o que torna uma boa função de recompensa e como o RL pode ajudar a criar agentes.
Também falaremos sobre kernels, se ainda valem a pena e no que você deve se concentrar. E, finalmente, exploraremos como LLMs como o DeepSeek-R1 podem ser quantizados para 1,58 bits e ainda assim ter um bom desempenho, juntamente com técnicas para manter a precisão.
Sobre Daniel Han
Estou construindo a Unsloth e somos uma startup de código aberto tentando tornar a IA mais acessível e precisa para todos! Temos 40 mil estrelas no GitHub, 10 milhões de downloads mensais no Hugging Face e trabalhamos com as equipes do Google, Meta e Hugging Face para corrigir bugs em modelos de código aberto como os modelos Llama, Phi e Gemma. Eu trabalhei anteriormente na NVIDIA, tornando o TSNE 2000x mais rápido.
Gravado na Feira Mundial de Engenheiros de IA em San Francisco. Fique por dentro dos nossos próximos eventos e conteúdos juntando-se à nossa newsletter aqui:
https://www.ai.engineer/newsletterTimestamps
00:00 Introdução e Contribuições da Unsloth
03:25 A Evolução dos Modelos de Linguagem de Grande Escala (LLMs)
09:47 Estágios de Treinamento de LLM e a Analogia do Bolo de Yann LeCun
16:56 Agentes e Princípios do Aprendizado por Reforço
23:17 PPO e a Introdução do GRPO
48:12 Modelo de Recompensa vs. Função de Recompensa
51:22 A Matemática por trás do Algoritmo Reinforce
01:08:50 Análise da Fórmula PPO
01:16:29 Mergulho Profundo no GRPO
02:00:20 Implementação Prática e Demonstração com a Unsloth
02:33:07 Quantização e o Futuro das GPUs
02:41:59 Conclusão e Chamada à Ação
---
Assista junto com a transcrição corrigida, resumo, timestamps e recursos na página oficial AIE desta palestra:
Participe das nossas próximas conferências de Engenheiros de IA (veja a página inicial
https://ai.engineer):- AIE Nova York, de 12 a 14 de outubro — a primeira cúpula principal de Finanças de Engenheiros de IA
- AIEi Xangai, de 5 a 6 de novembro — a primeira para encontrar os principais laboratórios e engenheiros chineses
- AIE CODE em SF, de 10 a 12 de novembro — a principal conferência de Codificação de IA retorna
- AIEi Sydney, de 7 a 8 de dezembro — a primeira AIEi realizada ao lado do NeurIPS 2026 em Sydney
---