Course Hive
Search

Welcome

Sign in or create your account

Continue with Google
or
5. Aula 5 - Engenharia de Variáveis
Play lesson

Curso: Ciência de Dados - Do Zero a Iniciante - 5. Aula 5 - Engenharia de Variáveis

5.0 (0)
11 learners

What you'll learn

This course includes

  • 8 hours of video
  • Certificate of completion
  • Access on mobile and TV

Summary

Full Transcript

---------------------------------------------------------------------------------------------------------------------- ⇒Aprofunde seus conhecimentos em estatística e ciência de dados com meu livro: •https://maironchaves.manus.space/ ⇒Podcast de apresentação do livro: •https://www.youtube.com/watch?v=8QoNOpgDWqY ---------------------------------------------------------------------------------------------------------------------- 📊 Resumo do Vídeo: "Curso Ciência de Dados - Do Zero ao Iniciante (Aula 5: Engenharia de Variáveis)" No vídeo, StatiR explica a importância da Engenharia de Variáveis no contexto de projetos de Ciência de Dados. Essa prática busca transformar ou criar variáveis a partir de dados existentes, aumentando o poder preditivo dos modelos de Machine Learning. 🔍 1. O que é Engenharia de Variáveis? A Engenharia de Variáveis consiste em criar novas variáveis a partir das existentes, aproveitando informações adicionais que podem melhorar o desempenho do modelo. Exemplos: De um campo data, é possível extrair mês, ano, hora ou período do dia. Transformar variáveis numéricas em categorias, como criar faixas de idade (jovem, adulto, idoso). No caso de códigos complexos, dividir em componentes úteis, como tipo de carga ou destino. 🧠 2. Importância da Engenharia de Variáveis Segundo estudos, essa etapa pode ser mais importante que a escolha do algoritmo, pois influencia diretamente na qualidade dos resultados. Com variáveis bem trabalhadas, até algoritmos mais simples podem apresentar excelente desempenho preditivo. 🔧 3. Técnicas de Engenharia de Variáveis 1. Discretização de Variáveis Transformar uma variável contínua em categorias. Exemplo: Renda pode ser dividida em "abaixo da média" e "acima da média". Usada para simplificar interpretações e melhorar separações entre classes no modelo. 2. Tratamento de Valores Faltantes Abordagens simples: Substituir valores nulos pela média, mediana ou moda. Remover observações inteiras em bases de dados grandes. Abordagens complexas: Usar algoritmos como Random Forest ou KNN para prever valores ausentes baseando-se em outras variáveis. Considerar a relação entre variáveis (ex.: renda média por nível educacional) para imputação. 3. Identificação de Outliers Detectar valores atípicos que podem distorcer análises. Técnicas para tratá-los são mencionadas como parte essencial do pré-processamento. 📈 4. Exemplos Práticos Variáveis Categóricas: Um código de trem foi decomposto em três novas variáveis (tipo de carga, dia da semana de saída e destino). Variáveis Numéricas: Discretização da renda em classes melhora a separação de clientes adimplentes e inadimplentes. 🤔 5. Dúvidas Frequentes "Quando devo remover valores faltantes?" Se o dataset for muito grande, remover linhas com dados faltantes pode ser viável. "Como lidar com muitos valores em variáveis categóricas?" Variáveis com muitas categorias podem ser discretizadas em faixas ou agrupadas em classes.

Course Hive

Continue this lesson in the app

Install CourseHive on Android or iOS to keep learning while you move.

Related Courses

FAQs

Course Hive
Download CourseHive
Keep learning anywhere