"Por qué deberías preprocesar tus datos. Todo sobre normalización, eliminación de valores atípicos, imputación de datos faltantes y transformaciones de variables.
___________________________________________
___________________________________________
Parte 1: Regresión en Aprendizaje Automático y el Modelo de Regresión Lineal
Parte 2: Las Diferentes Funciones de Costo para Regresión - Entender MAE, MSE, WMAE
Parte 3: Cómo Funciona el Entrenamiento de Modelos con Minimización Basada en Gradientes
Parte 4: Preprocesamiento de Datos - Normalización, Valores Atípicos, Datos Faltantes, Transformación de Variables
Parte 5: Validación Cruzada - ¿Cómo Seleccionar el Mejor Modelo de Aprendizaje Automático?
Parte 6: Regularización - Parada Temprana, Regresión Ridge (L2) y Regresión Lasso (L1)
___________________________________________
- La normalización es especialmente importante para una minimización basada en gradientes. Los datos pueden ser normalizados a través de normalización min-max o estandarización.
- La detección de valores atípicos se puede utilizar para eliminar valores atípicos. Los valores atípicos pueden ser identificados a través de diagramas de caja. Un diagrama de caja muestra la mediana y el rango intercuartílico con "bigotes".
- Los datos faltantes pueden ser eliminados o imputados, por ejemplo, mediante la media o la mediana.
- La transformación de variables se puede aplicar a variables numéricas. Por ejemplo, se puede utilizar una modificación funcional, combinación de variables o modelos complejos. Una transformación de variable para variables categóricas puede transformar características categóricas en variables binarias. Esto se llama codificación one-hot.