En este tutorial completo, nos sumergimos en el mundo de la validación de modelos utilizando técnicas de validación cruzada con Python y Scikit-Learn. La validación cruzada juega un papel fundamental en la evaluación del verdadero rendimiento de los modelos de aprendizaje automático, ayudándonos a construir soluciones robustas y confiables.
📧 Correo: ryannolandata@gmail.com
🍿 MIRA A CONTINUACIÓN
Aprende a implementar la validación cruzada en Python utilizando scikit-learn para construir modelos de aprendizaje automático más confiables. En este tutorial completo, desgloso las técnicas de validación cruzada desde un nivel principiante hasta intermedio, mostrándote por qué una única división de entrenamiento-prueba puede dar resultados sesgados y cómo la validación cruzada resuelve este problema.
Comenzamos con un ejemplo simple de división de entrenamiento-prueba que demuestra cómo diferentes estados aleatorios pueden producir puntuaciones de precisión muy diferentes (0.71 vs 0.80), destacando las limitaciones de este enfoque. Luego, te guío a través de la implementación de la validación cruzada básica con cross_val_score, que proporciona múltiples mediciones de precisión en lugar de solo una, dándote una evaluación mucho más confiable del rendimiento de tu modelo.
A lo largo del video, aprenderás a calcular puntuaciones promedio y desviaciones estándar para comprender mejor la consistencia de tu modelo. Demuestro cómo definir la validación cruzada K-Fold con parámetros personalizados, incluyendo n_splits, opciones de barajado y estados aleatorios para resultados reproducibles. También exploramos la validación K-Fold estratificada, que mantiene los porcentajes de distribución de clases a través de los pliegues para pruebas más equilibradas.
Como bono, te muestro cómo usar diferentes métricas de puntuación como F1 y puntuaciones de precisión, y lo más importante, cómo combinar la validación cruzada con los pipelines de scikit-learn. Esta técnica avanzada te permite validar todo el flujo de trabajo de preprocesamiento y modelado juntos, lo cual es esencial para proyectos de aprendizaje automático en el mundo real.
Al final de este tutorial, entenderás cuándo usar la validación cruzada en lugar de simples divisiones de entrenamiento-prueba, cómo interpretar múltiples puntuaciones de validación y cómo integrar estas técnicas en tu pipeline de aprendizaje automático para una evaluación de modelos más robusta.
MARCAS DE TIEMPO
00:00 Introducción a la Validación Cruzada
01:12 Configuración de Datos e Importaciones
03:19 Creando Variables X e Y
05:06 Ejemplo de División de Entrenamiento-Prueba
07:42 Modelo de Regresión Logística
09:42 Pruebas con Diferentes Estados Aleatorios
11:52 Puntuación de Validación Cruzada Básica
14:01 Definiendo K-Fold
16:10 K-Fold Estratificada
19:13 Ejemplo de Pipeline con Validación Cruzada
22:02 Resumen de Resultados y Recapitulación
OTROS REDES SOCIALES:
¿Quién es Ryan?
Ryan es Científico de Datos en una empresa fintech, donde se enfoca en la prevención de fraudes en la suscripción y el riesgo. Antes de eso, trabajó como Analista de Datos en una empresa de software de impuestos. Tiene un título en Ingeniería Eléctrica de UCF.
¿Quién es Matt?
Matt es el fundador de Width.ai, una agencia de IA y Aprendizaje Automático. Antes de iniciar su propia empresa, fue Ingeniero de Aprendizaje Automático en Capital One.
*Este es un programa de afiliados. Recibimos una pequeña parte de la venta final sin costo adicional para ti.