Trilha de revisão de conteúdos de Data Science, organizada seguindo as fases do CRISP-DM, com foco em preparação para vaga júnior.
- Cada pasta abaixo representa um bloco de estudo, ligado a uma fase do CRISP-DM.
- Dentro de cada pasta: notebooks/anotações + um
README.mdpróprio resumindo o que foi aprendido. - O checklist de cada tópico é atualizado conforme o conteúdo é revisado.
- Ao consolidar um tópico, ele vira post no LinkedIn (link registrado na tabela no final deste arquivo).
- Como pensar um problema (árvore de hipóteses)
- Caracterização dos dados
- Dados estruturados (tipos, escalas, etc.)
- Exploração de dados (gráficos para EDA)
- Estatística básica para EDA
- Experimentação / A/B Testing
Curso Rocketseat como base
- Fundamentos de SQL
- Joins complexos
- Window functions
- CTEs
- Integração de dados
- Eliminação de atributos
- Amostragem
- Dados desbalanceados
- Limpeza de dados
- Dados ausentes
- Outliers
- Duplicados
- Incongruentes
- Ruidosos
- Conversão de tipos de dados
- Redução de dimensionalidade
- Feature Engineering
- Divisão treino / teste / validação
Para cada algoritmo: entender métricas e forma de validação
- KNN
- Árvore de Decisão
- Ensemble Learning
- Classificador Bayesiano
- SVM
- Regressão
- k-fold Cross Validation
- GridSearchCV / RandomizedSearchCV
- Consolidação de métricas de avaliação
Para cada algoritmo: entender métricas e forma de validação
- K-Médias
- Agrupamento hierárquico
- Agrupamento por densidade
Ligado à matéria de Redes Neurais e Aprendizado Profundo da faculdade
- Redes Neurais — fundamentos
- API simples (FastAPI/Flask)
- Docker (visão geral)
- Fluxo de Git organizado
- Cloud básico
- Apresentação final (Storytelling with data)
| Pasta | Tópico | Post | Data |
|---|---|---|---|