O Aprendizado Não Supervisionado (Unsupervised Learning) é uma técnica de Machine Learning muito popular. Neste tutorial Python sobre sklearn em português, eu revelo os algoritmos mais importantes: K-Means Clustering, Isolation Forest e PCA (Análise de Componentes Principais)
0:00 : Introdução
00:33 : Aprendizado Não Supervisionado
03:17 : K-Means Clustering
06:04 : K-Means Sklearn
11:00 : K-Means – Método do Cotovelo
14:50 : Detecção de Anomalias (Isolation Forest)
19:52 : Isolation Forest Sklearn
22:03 : Aplicação Isolation Forest (dígitos)
26:54 : Redução de Dimensão (PCA)
30:14 : Visualização de Dados
33:14 : Compressão de Dados
40:00 : Conclusão e Exercício
Para lembrar, o aprendizado supervisionado é uma técnica de aprendizado que consiste em mostrar à máquina exemplos X, y do que ela deve aprender.
Em contrapartida, o aprendizado não supervisionado consiste em fornecer à máquina apenas dados X e pedir que ela analise a estrutura desses dados para aprender sozinha a realizar certas tarefas.
1. Clustering
Uma das aplicações mais populares do aprendizado não supervisionado é o Clustering. O princípio é deixar a máquina aprender a classificar dados de acordo com suas semelhanças (analisando apenas as features X).
Os algoritmos a conhecer:
- K-Means: Muito rápido, mas não eficaz em clusters não convexos.
- Agglomerative Clustering: bastante lento, mas eficaz em dados não convexos
- DBSCAN: eficaz em dados não convexos, mas seleção automática do número de clusters
Aplicações:
- Classificar documentos, fotos, tweets
- Segmentar a clientela de uma empresa
- Otimizar a organização de um sistema informático, etc…
2. Detecção de Anomalias
Outro exemplo de aplicação do aprendizado não supervisionado é a Detecção de Anomalias. Ao analisar a estrutura X dos dados, a máquina é capaz de encontrar os amostras cujas features estão muito distantes das de outras amostras. Essas amostras são então consideradas anomalias.
Os algoritmos a conhecer:
- Isolation Forest: Eficaz para detectar outliers no train_set
- Local Outlier Factor: Eficaz para detectar anomalias futuras
Aplicações:
- Limpar um Dataset de valores aberrantes que o compõem
- Detectar um comportamento anormal em um site ou em uma câmera de vigilância
- Manutenção preditiva das máquinas de uma fábrica
3. Redução de Dimensão
A última aplicação muito importante do aprendizado não supervisionado é a redução de dimensão. O princípio é reduzir a complexidade desnecessária de um dataset projetando seus dados em um espaço de menor dimensão (um espaço com menos variáveis). O objetivo é Acelerar o aprendizado da máquina e Combater o problema da dimensionalidade.
Algoritmos a conhecer:
- Análise de Componentes Principais (PCA): o mais popular e o mais simples de entender
- TSNE
- Isomap
Aplicações:
- Visualização de dados: exibir em um gráfico 2D um espaço de alta dimensão
- Compressão de dataset: reduzir ao máximo o peso de um dataset mantendo a máxima qualidade
► Me apoiar financeiramente no Tipeee (e obter vídeos BÔNUS)
► Junte-se à nossa COMUNIDADE DISCORD
► MEU SITE:
► Receba gratuitamente meu Livro:
APRENDER MACHINE LEARNING EM UMA SEMANA
CLIQUE AQUI:
► Baixe gratuitamente meus códigos no github:
► Quem sou eu?
Eu sou Guillaume Saint-Cirgue, Senior Data Scientist com mais de 8 anos de experiência nos setores de tecnologia, aviação, robótica, energia e fábricas conectadas.
Em 2019, criei a Machine Learnia com o objetivo de compartilhar meus conhecimentos na área de inteligência artificial. Meu objetivo é explicar em detalhes o funcionamento do Machine Learning e de seus algoritmos, tornando esses conceitos acessíveis a todos.
Estou convencido de que não basta apenas passar superficialmente pelo aspecto matemático deste campo; é essencial mergulhar profundamente para se destacar. Essa abordagem já convenceu mais de 150.000 pessoas, e aqueles que estou formando hoje estão entre os melhores do setor.
► Uma pergunta? Entre em contato: contact@machinelearnia.com