Hier behandeln wir sechs Optimierungsverfahren für tiefe neuronale Netzwerke: stochastischer Gradientabstieg (SGD), SGD mit Momentum, SGD mit Nesterov-Momentum, RMSprop, AdaGrad und Adam.
Kapitel
---------------
Einführung 00:00
Kurze Auffrischung 00:27
Stochastischer Gradientabstieg (SGD) 03:16
SGD mit Momentum 05:01
SGD mit Nesterov-Momentum 07:02
AdaGrad 09:46
RMSprop 12:20
Adam 13:23
SGD vs Adam 15:03