El aprendizaje no supervisado (Unsupervised Learning) es una técnica de Machine Learning muy popular. En este tutorial de Python sobre sklearn en español, te revelo los algoritmos más importantes: K-Means Clustering, IsolationForest y PCA (Análisis de Componentes Principales)
0:00 : Intro
00:33 : Aprendizaje No Supervisado
03:17 : K-Means Clustering
06:04 : K-Means Sklearn
11:00 : K-Means – Método del Codo
14:50 : Detección de Anomalías (Isolation Forest)
19:52 : Isolation Forest Sklearn
22:03 : Aplicación Isolation Forest (dígitos)
26:54 : Reducción de Dimensión (PCA)
30:14 : Visualización de Datos
33:14 : Compresión de Datos
40:00 : Conclusión y ejercicio
Para recordar, el aprendizaje supervisado es una técnica de aprendizaje que consiste en mostrar a la máquina ejemplos X, y de lo que debe aprender.
En cambio, el aprendizaje no supervisado consiste en proporcionar a la máquina únicamente datos X, y pedirle que analice la estructura de esos datos para aprender por sí misma a realizar ciertas tareas.
1. Clustering
Una de las aplicaciones más populares del aprendizaje no supervisado es el Clustering. El principio es dejar que la máquina aprenda a clasificar datos según sus similitudes (y por lo tanto analizando únicamente las características X).
Los algoritmos a conocer:
- K-Means: Muy rápido, pero no efectivo en clusters no convexos.
- AgglomerativeClustering: bastante lento, pero efectivo en datos no convexos.
- DBSCAN: efectivo en datos no convexos, pero selección automática del número de clusters.
Aplicaciones:
- Clasificar documentos, fotos, tweets.
- Segmentar la clientela de una empresa.
- Optimizar la organización de un sistema informático, etc…
2. Detección de Anomalías
Otro ejemplo de aplicación del aprendizaje no supervisado es la Detección de Anomalías. Al analizar la estructura X de los datos, la máquina es capaz de encontrar muestras cuyas características están muy alejadas de las de otras muestras. Estas muestras son consideradas como anomalías.
Los algoritmos a conocer:
- IsolationForest: Efectivo para detectar outliers en el train_set.
- Local Outlier Factor: Efectivo para detectar anomalías futuras.
Aplicaciones:
- Limpiar un Dataset de los valores atípicos que lo componen.
- Detectar un comportamiento anormal en un sitio web o en una cámara de vigilancia.
- Mantenimiento predictivo de las máquinas de una fábrica.
3. Reducción de Dimensión
La última aplicación muy importante del aprendizaje no supervisado es la reducción de dimensión. El principio es reducir la complejidad superflua de un dataset proyectando sus datos en un espacio de menor dimensión (un espacio con menos variables). El objetivo es Acelerar el aprendizaje de la máquina y Luchar contra el flagelo de la dimensión.
Algoritmos a conocer:
- Análisis de Componentes Principales (PCA): el más popular y el más fácil de entender.
- TSNE.
- Isomap.
Aplicaciones:
- Visualización de datos: mostrar en un gráfico 2D un espacio de alta dimensión.
- Compresión de dataset: reducir al máximo el peso de un dataset manteniendo la máxima calidad.
► Apóyame financieramente en Tipeee (y obtén videos BONUS)
► ÚNETE A NUESTRA COMUNIDAD DISCORD
► MI SITIO WEB:
► Recibe gratis mi Libro:
APRENDER MACHINE LEARNING EN UNA SEMANA
HAZ CLIC AQUÍ:
► Descarga gratis mis códigos en github:
► ¿Quién soy?
Soy Guillaume Saint-Cirgue, Senior Data Scientist con más de 8 años de experiencia en los sectores de la tecnología, la aviación, la robótica, la energía y las fábricas conectadas.
En 2019, creé Machine Learnia con el objetivo de compartir mis conocimientos en el campo de la inteligencia artificial. Mi objetivo es explicar en detalle el funcionamiento del Machine Learning y de sus algoritmos, mientras hago que estos conceptos sean accesibles para todos.
Estoy convencido de que no basta con sobrevolar el aspecto matemático de este campo; es esencial profundizar para destacar. Este enfoque ya ha convencido a más de 150,000 personas, y aquellos a los que formo hoy cuentan entre los mejores del sector.
► ¿Tienes una pregunta? Contáctame: contact@machinelearnia.com