Hoy echamos un vistazo a cómo podemos aplicar el escalado de características a conjuntos de datos dentro de scikit-learn en Python. Esto es útil al aplicar normalización o estandarización a los datos, lo que permite que los modelos de aprendizaje automático funcionen mejor.
El conjunto de datos está disponible en mi Github
📧 Correo: ryannolandata@gmail.com
🍿 MIRA A CONTINUACIÓN
En este video, te guío a través del escalado de características en Python usando scikit-learn para mejorar tus modelos de aprendizaje automático. El escalado de características transforma valores numéricos a la misma escala, haciendo que tus datos sean más consistentes y tus modelos más precisos. Cubro dos métodos esenciales: normalización y estandarización.
La normalización escala los datos entre 0 y 1 usando el MinMaxScaler, que funciona restando tu valor mínimo y dividiendo por el rango. La estandarización, por otro lado, crea una media de cero y una desviación estándar de uno usando el StandardScaler, similar a una distribución normal. A diferencia de la normalización, la estandarización puede manejar valores negativos y números mayores que uno, lo que la hace más adecuada para conjuntos de datos con valores atípicos.
Demuestro ambas técnicas usando datos reales de estadísticas de béisbol con 465 jugadores y 13 características diferentes. Verás exactamente cómo importar los escaladores de sklearn.preprocessing, ajustar y transformar tus datos, y convertir los resultados de nuevo en dataframes limpios de pandas. También comparo los resultados lado a lado para que puedas ver cómo cada método cambia tus datos de manera diferente, incluyendo la revisión de la media, desviación estándar, valores mínimos y máximos antes y después del escalado.
MARCAS DE TIEMPO
00:00 Introducción al Escalado de Características
01:35 Configuración de Datos con Pandas
03:00 Visión General y Preparación de Datos
04:40 Creando Variables X1 y X2
05:17 Implementación del Escalador Estándar
06:45 Revisión de Datos Estandarizados
08:15 Implementación del Escalador Min Max
09:27 Comparando Estandarización vs Normalización
10:45 Resultados Finales y Conclusión
OTROS REDES SOCIALES:
¿Quién es Ryan?
Ryan es Científico de Datos en una empresa fintech, donde se enfoca en la prevención de fraudes en la suscripción y el riesgo. Antes de eso, trabajó como Analista de Datos en una empresa de software de impuestos. Tiene un título en Ingeniería Eléctrica de UCF.
¿Quién es Matt?
Matt es el fundador de Width.ai, una agencia de IA y Aprendizaje Automático. Antes de iniciar su propia empresa, fue Ingeniero de Aprendizaje Automático en Capital One.
*Este es un programa de afiliados. Recibimos una pequeña parte de la venta final sin costo adicional para ti.