Neste Tutorial de 365 Data Science, vamos nos concentrar em uma das práticas mais importantes em aprendizado de máquina – validação cruzada, também conhecida como validação cruzada N-fold ou K-fold. A validação cruzada é uma técnica utilizada em muitas áreas do aprendizado de máquina. Vamos usá-la especificamente para escolher o melhor conjunto de parâmetros para nosso classificador de vetor de suporte. É importante conhecer o significado geral da validação cruzada e suas diferentes aplicações.
Primeiro, digamos que você tenha um conjunto de dados já rotulado e deseja treiná-lo em modelos de aprendizado de máquina e escolher o que apresenta o melhor desempenho. O que provavelmente aconteceria se usássemos apenas um conjunto de treinamento é que um dos modelos teria um desempenho melhor nele. No entanto, muitas vezes, durante o teste em um novo conjunto de dados, o modelo não teria um desempenho tão bom em comparação com a fase de treinamento. Na maioria dos casos, a razão é que o modelo incorporou algum viés dos dados de treinamento e, como resultado, não consegue generalizar com a mesma precisão em um novo conjunto de dados durante o teste. Em outras situações, você deseja treinar o modelo de aprendizado de máquina em seus dados, mas não tem um tamanho de amostra grande o suficiente.
Você pode pensar que, nesta era orientada por dados, a abundância de dados causa problemas em vez de não ter dados suficientes – o que é verdade na maioria dos casos. No entanto, em algumas áreas, como ciências da vida, obter uma amostra grande o suficiente é muitas vezes mais fácil de dizer do que fazer. Para obter dados, precisamos elaborar experimentos que muitas vezes são demorados e caros.
É aqui que a validação cruzada entra em cena, pois nos permite aumentar artificialmente a quantidade de dados de treinamento sem realmente amostrar novos pontos. A ideia da validação cruzada é baseada em dividir nossos dados em N ou K partes iguais e, em seguida, criar novas variações deles. Assista até o final do vídeo para ver como isso funciona exatamente, como calcular o desempenho médio de nossos algoritmos em todos os conjuntos de dados e descobrir outras situações em que a validação cruzada pode ser benéfica.
365 Data Science é um site educacional online que oferece a incrível oportunidade de encontrar seu caminho no mundo da ciência de dados, não importa seu conhecimento e experiência anteriores. É por isso que dedicamos este canal àqueles que são completamente novos e estão curiosos para explorar o maravilhoso mundo da ciência de dados. Uma vez que você tenha construído um conhecimento teórico básico, pode se inscrever em nosso currículo abrangente, onde preparamos numerosos cursos que atendem às necessidades de aspirantes a Analistas de BI, Analistas de Dados e Cientistas de Dados.
#validaçãocruzada #aprendizado de máquina #365datasciencetutorials