Neste tutorial abrangente, mergulhamos no mundo da validação de modelos usando técnicas de validação cruzada com Python e Scikit-Learn. A validação cruzada desempenha um papel fundamental na avaliação do verdadeiro desempenho dos modelos de aprendizado de máquina, ajudando-nos a construir soluções robustas e confiáveis.
📧 Email: ryannolandata@gmail.com
🍿 ASSISTA A SEGUIR
Aprenda como implementar validação cruzada em Python usando scikit-learn para construir modelos de aprendizado de máquina mais confiáveis. Neste tutorial abrangente, explico as técnicas de validação cruzada do nível iniciante ao intermediário, mostrando por que uma única divisão de treino-teste pode dar resultados tendenciosos e como a validação cruzada resolve esse problema.
Começamos com um exemplo simples de divisão de treino-teste que demonstra como diferentes estados aleatórios podem produzir pontuações de precisão muito diferentes (0.71 vs 0.80), destacando as limitações dessa abordagem. Em seguida, eu o guio na implementação da validação cruzada básica com cross_val_score, que fornece múltiplas medições de precisão em vez de apenas uma, oferecendo uma avaliação muito mais confiável do desempenho do seu modelo.
Ao longo do vídeo, você aprenderá como calcular médias e desvios padrão para entender melhor a consistência do seu modelo. Demonstro como definir a validação cruzada K-Fold com parâmetros personalizados, incluindo n_splits, opções de embaralhamento e estados aleatórios para resultados reprodutíveis. Também exploramos a validação K-Fold estratificada, que mantém as porcentagens de distribuição de classes entre as divisões para testes mais equilibrados.
Como bônus, mostro como usar diferentes métricas de pontuação, como F1 e pontuações de precisão, e, mais importante, como combinar a validação cruzada com pipelines do scikit-learn. Essa técnica avançada permite validar todo o fluxo de trabalho de pré-processamento e modelagem juntos, o que é essencial para projetos de aprendizado de máquina do mundo real.
Ao final deste tutorial, você entenderá quando usar validação cruzada em vez de simples divisões de treino-teste, como interpretar múltiplas pontuações de validação e como integrar essas técnicas em seu pipeline de aprendizado de máquina para uma avaliação de modelo mais robusta.
CARACTERÍSTICAS DO TEMPO
00:00 Introdução à Validação Cruzada
01:12 Configurando Dados e Importações
03:19 Criando Variáveis X e Y
05:06 Exemplo de Divisão de Treino e Teste
07:42 Modelo de Regressão Logística
09:42 Testando com Diferentes Estados Aleatórios
11:52 Pontuação Básica de Validação Cruzada
14:01 Definindo K-Fold
16:10 K-Fold Estratificado
19:13 Exemplo de Pipeline com Validação Cruzada
22:02 Visão Geral dos Resultados e Recapitulação
OUTRAS REDES SOCIAIS:
Quem é Ryan
Ryan é Cientista de Dados em uma empresa de fintech, onde se concentra na prevenção de fraudes em subscrição e risco. Antes disso, trabalhou como Analista de Dados em uma empresa de software tributário. Ele possui um diploma em Engenharia Elétrica pela UCF.
Quem é Matt
Matt é o fundador da Width.ai, uma agência de IA e Aprendizado de Máquina. Antes de iniciar sua própria empresa, ele foi Engenheiro de Aprendizado de Máquina na Capital One.
*Este é um programa de afiliados. Recebemos uma pequena parte da venda final sem custo adicional para você.