Warum ist Reinforcement Learning (RL) plötzlich überall und ist es wirklich effektiv? Haben LLMs ein Plateau in Bezug auf Intelligenz und Fähigkeiten erreicht, oder ist RL der Durchbruch, den sie brauchen?
In diesem Workshop werden wir die Grundlagen von RL, was eine gute Belohnungsfunktion ausmacht und wie RL helfen kann, Agenten zu erstellen, näher betrachten.
Wir werden auch über Kerne sprechen, ob sie weiterhin Ihre Zeit wert sind und worauf Sie sich konzentrieren sollten. Und schließlich werden wir erkunden, wie LLMs wie DeepSeek-R1 auf 1,58 Bit quantisiert werden können und dennoch gut funktionieren, sowie Techniken zur Aufrechterhaltung der Genauigkeit.
Über Daniel Han
Ich baue Unsloth und wir sind ein Open-Source-Startup, das versucht, KI für alle zugänglicher und genauer zu machen! Wir haben 40K GitHub-Sterne, 10M monatliche Downloads auf Hugging Face und haben mit Google, Meta, Hugging Face-Teams zusammengearbeitet, um Fehler in Open-Source-Modellen wie Llama, Phi und Gemma zu beheben. Zuvor habe ich bei NVIDIA gearbeitet und TSNE 2000x schneller gemacht.
Aufgenommen auf der AI Engineer World's Fair in San Francisco. Bleiben Sie über unsere bevorstehenden Veranstaltungen und Inhalte auf dem Laufenden, indem Sie hier unseren Newsletter abonnieren:
https://www.ai.engineer/newsletterZeitstempel
00:00 Einführung und Unsloaths Beiträge
03:25 Die Evolution der großen Sprachmodelle (LLMs)
09:47 LLM-Trainingsphasen und Yann LeCuns Kuchenanalogie
16:56 Agenten und Prinzipien des Reinforcement Learning
23:17 PPO und die Einführung von GRPO
48:12 Belohnungsmodell vs. Belohnungsfunktion
51:22 Die Mathematik hinter dem Reinforce-Algorithmus
01:08:50 PPO-Formel-Analyse
01:16:29 GRPO-Vertiefung
02:00:20 Praktische Implementierung und Demo mit Unsloth
02:33:07 Quantisierung und die Zukunft der GPUs
02:41:59 Fazit und Handlungsaufforderung
---
Sehen Sie sich die korrigierte Transkription, Zusammenfassung, Zeitstempel und Ressourcen auf der offiziellen AIE-Seite dieses Vortrags an:
Nehmen Sie an unseren bevorstehenden AI Engineer-Konferenzen teil (siehe
https://ai.engineer Landingpage):
- AIE New York, 12.–14. Oktober — der erste AI Engineer Finance Hauptgipfel
- AIEi Shanghai, 5.–6. November — das erste Treffen mit führenden chinesischen Laboren und Ingenieuren
- AIE CODE in SF, 10.–12. November — die beste AI Coding-Konferenz kehrt zurück
- AIEi Sydney, 7.–8. Dezember — das erste AIEi, das parallel zu NeurIPS 2026 in Sydney stattfindet
---