Summary
Full Transcript
---------------------------------------------------------------------------------------------------------------------- ⇒Aprofunde seus conhecimentos em estatística e ciência de dados com meu livro: •https://maironchaves.manus.space/ ⇒Podcast de apresentação do livro: •https://www.youtube.com/watch?v=8QoNOpgDWqY ---------------------------------------------------------------------------------------------------------------------- 📊 Resumo do Vídeo: "Curso Ciência de Dados - Do Zero ao Iniciante (Aula 5: Engenharia de Variáveis)" No vídeo, StatiR explica a importância da Engenharia de Variáveis no contexto de projetos de Ciência de Dados. Essa prática busca transformar ou criar variáveis a partir de dados existentes, aumentando o poder preditivo dos modelos de Machine Learning. 🔍 1. O que é Engenharia de Variáveis? A Engenharia de Variáveis consiste em criar novas variáveis a partir das existentes, aproveitando informações adicionais que podem melhorar o desempenho do modelo. Exemplos: De um campo data, é possível extrair mês, ano, hora ou período do dia. Transformar variáveis numéricas em categorias, como criar faixas de idade (jovem, adulto, idoso). No caso de códigos complexos, dividir em componentes úteis, como tipo de carga ou destino. 🧠 2. Importância da Engenharia de Variáveis Segundo estudos, essa etapa pode ser mais importante que a escolha do algoritmo, pois influencia diretamente na qualidade dos resultados. Com variáveis bem trabalhadas, até algoritmos mais simples podem apresentar excelente desempenho preditivo. 🔧 3. Técnicas de Engenharia de Variáveis 1. Discretização de Variáveis Transformar uma variável contínua em categorias. Exemplo: Renda pode ser dividida em "abaixo da média" e "acima da média". Usada para simplificar interpretações e melhorar separações entre classes no modelo. 2. Tratamento de Valores Faltantes Abordagens simples: Substituir valores nulos pela média, mediana ou moda. Remover observações inteiras em bases de dados grandes. Abordagens complexas: Usar algoritmos como Random Forest ou KNN para prever valores ausentes baseando-se em outras variáveis. Considerar a relação entre variáveis (ex.: renda média por nível educacional) para imputação. 3. Identificação de Outliers Detectar valores atípicos que podem distorcer análises. Técnicas para tratá-los são mencionadas como parte essencial do pré-processamento. 📈 4. Exemplos Práticos Variáveis Categóricas: Um código de trem foi decomposto em três novas variáveis (tipo de carga, dia da semana de saída e destino). Variáveis Numéricas: Discretização da renda em classes melhora a separação de clientes adimplentes e inadimplentes. 🤔 5. Dúvidas Frequentes "Quando devo remover valores faltantes?" Se o dataset for muito grande, remover linhas com dados faltantes pode ser viável. "Como lidar com muitos valores em variáveis categóricas?" Variáveis com muitas categorias podem ser discretizadas em faixas ou agrupadas em classes.
