En este tutorial de 365 Data Science nos enfocaremos en una de las prácticas más importantes en el aprendizaje automático: la validación cruzada, también conocida como validación cruzada N-fold o K-fold. La validación cruzada es una técnica que se utiliza en muchas áreas del aprendizaje automático. La utilizaremos específicamente para elegir el mejor conjunto de parámetros para nuestro clasificador de vectores de soporte. Es importante conocer el significado general de la validación cruzada y sus diferentes aplicaciones.
Primero, digamos que tienes un conjunto de datos ya etiquetado y deseas entrenarlo en modelos de aprendizaje automático y elegir el que mejor rendimiento tenga. Lo que probablemente sucedería si utilizamos solo un conjunto de entrenamiento es que uno de los modelos tendría un mejor desempeño en él. Sin embargo, a menudo sucede que durante la prueba en un nuevo conjunto de datos, el modelo no rinde tan bien en comparación con la fase de entrenamiento. En la mayoría de los casos, la razón es que el modelo ha incorporado parte del sesgo de los datos de entrenamiento y, como resultado, no puede generalizar con la misma precisión en un nuevo conjunto de datos durante la prueba. En otras situaciones, deseas entrenar el modelo de aprendizaje automático con tus datos, pero no tienes un tamaño de muestra lo suficientemente grande.
Podrías pensar que en esta era impulsada por datos, la abundancia de datos causa problemas en lugar de no tener suficientes, lo cual es cierto en la mayoría de los casos. Sin embargo, en algunas áreas como las ciencias de la vida, obtener una muestra lo suficientemente grande a menudo es más fácil decirlo que hacerlo. Para obtener datos, necesitamos idear experimentos que a menudo son costosos y consumen mucho tiempo.
Aquí es donde entra en juego la validación cruzada, ya que nos permite aumentar artificialmente la cantidad de datos de entrenamiento sin muestrear nuevos puntos. La idea de la validación cruzada se basa en dividir nuestros datos en N o K partes iguales y luego crear nuevas variaciones de ellos. Mira hasta el final del video para ver cómo funciona exactamente, cómo calcular el rendimiento promedio de nuestros algoritmos en todos los conjuntos de datos y descubrir otras instancias donde la validación cruzada podría ser beneficiosa.
365 Data Science es un sitio web educativo en línea que ofrece la increíble oportunidad de encontrar tu camino en el mundo de la ciencia de datos, sin importar tu conocimiento y experiencia previos. Por eso hemos dedicado este canal a aquellos que son completamente nuevos y tienen curiosidad por explorar el maravilloso mundo de la ciencia de datos. Una vez que hayas construido un conocimiento teórico básico, puedes inscribirte en nuestro currículo integral donde hemos preparado numerosos cursos que se adaptan a las necesidades de los aspirantes a Analistas de BI, Analistas de Datos y Científicos de Datos.
#validacioncruzada #aprendizajeautomatico #tutoriales365datascience