Warum ist Reinforcement Learning (RL) plötzlich überall, und ist es wirklich effektiv? Haben LLMs in Bezug auf Intelligenz und Fähigkeiten ein Plateau erreicht, oder ist RL der Durchbruch, den sie brauchen?
In diesem Workshop werden wir in die Grundlagen von RL eintauchen, was eine gute Belohnungsfunktion ausmacht und wie RL helfen kann, Agenten zu erstellen.
Wir werden auch über Kerne sprechen, ob sie immer noch Ihre Zeit wert sind und worauf Sie sich konzentrieren sollten. Und schließlich werden wir erkunden, wie LLMs wie DeepSeek-R1 auf 1,58 Bit quantisiert werden können und dennoch gut funktionieren, sowie Techniken zur Wahrung der Genauigkeit.
Über Daniel Han
Ich baue Unsloth und wir sind ein Open-Source-Startup, das versucht, KI für alle zugänglicher und genauer zu machen! Wir haben 40K GitHub-Sterne, 10M monatliche Downloads auf Hugging Face und haben mit Google, Meta und Hugging Face-Teams zusammengearbeitet, um Fehler in Open-Source-Modellen wie Llama, Phi & Gemma-Modellen zu beheben. Zuvor habe ich bei NVIDIA gearbeitet und TSNE 2000x schneller gemacht.
Aufgenommen auf der AI Engineer World's Fair in San Francisco. Bleiben Sie über unsere kommenden Veranstaltungen und Inhalte auf dem Laufenden, indem Sie hier unseren Newsletter abonnieren:
https://www.ai.engineer/newsletterZeitstempel
00:00 Einführung und Unsloaths Beiträge
03:25 Die Entwicklung großer Sprachmodelle (LLMs)
09:47 Trainingsphasen von LLMs und Yann LeCuns Kuchenanalogie
16:56 Agenten und Prinzipien des Reinforcement Learning
23:17 PPO und die Einführung von GRPO
48:12 Belohnungsmodell vs. Belohnungsfunktion
51:22 Die Mathematik hinter dem Reinforce-Algorithmus
01:08:50 PPO-Formelaufgliederung
01:16:29 GRPO-Vertiefung
02:00:20 Praktische Implementierung und Demo mit Unsloth
02:33:07 Quantisierung und die Zukunft von GPUs
02:41:59 Fazit und Handlungsaufforderung