¿Cómo influyen las recompensas y las penalizaciones en los agentes de aprendizaje por refuerzo? | Knoovi