Pular para o conteúdo principal

Estudo de Caso · Formação SENAI SP (Unidade 390)

Data Science & Machine Learning

Jornada prática de 6 semanas em Ciência de Dados, Engenharia de Recursos, Modelagem Preditiva e Web Scraping. Evolução de estatística descritiva e visualização estatística com Pandas, Seaborn e Matplotlib até a extração automatizada com Scrapy e treinamento de modelos de Regressão Linear com Scikit-Learn.

Python 3.x Pandas & NumPy Scikit-Learn Seaborn & Matplotlib Scrapy Framework Streamlit

O Desafio do Dado Bruto ao Insight Preditivo

Em cenários reais de engenharia de dados, informações brutas chegam desestruturadas, com valores nulos, registros truncados ou codificados em strings JSON complexas dentro de células de planilhas.

O objetivo central deste repositório foi construir um ciclo completo de tratamento de dados: desde a raspagem de sites com Scrapy, sanitização e junção relacional em Pandas, exploração gráfica detalhada com Seaborn, até a criação e validação de modelos de Machine Learning para predições com métricas de erro ($MSE, RMSE, R^2$).

🗺️ Arquitetura do Pipeline de Dados

🕸️ 1. Coleta Scrapy & APIs (TMDB, Quotes, E-commerce)
🧹 2. Ingestão & Limpeza Pandas DataFrames, Imputação & JSON Parsing
📈 3. EDA & Estatística Boxplots, Histogramas, Matriz de Correlação
🤖 4. Modelagem ML Scikit-Learn (LinearRegression, Train/Test Split)
🚀 5. Entrega Dashboards Streamlit & Relatórios de Validação

🔬 Projetos & Módulos Desenvolvidos

Desafio Final · Capstone

MovieScope — Análise Preditiva no Dataset TMDB 5000

Código no GitHub

Aplicação completa de inteligência de dados sobre 5.000 filmes e suas equipes técnicas. O projeto unifica os datasets tmdb_5000_movies.csv e tmdb_5000_credits.csv via relacional Pandas merge. Desserializa JSONs embutidos para extrair gênero principal e diretor, trata discrepâncias estatísticas (outliers de orçamento vs bilheteria) e aplica um modelo de Regressão Linear com o Scikit-Learn.

Dataset Integrado 5.000 Filmes & Créditos
Modelo Scikit-Learn LinearRegression
Variância Explicada ($R^2$) R² = 0.33
Pandas Merge JSON Deserialization Scikit-Learn Train/Test Outlier Analysis Seaborn Charts

Análise Físico-Química: Wine Quality

Investigação das propriedades químicas de vinhos tintos e brancos. Construção de matrizes de correlação entre acidez volátil, pH, sulfatos e teor alcoólico vs notas de degustação.

Seaborn Heatmaps Pandas Correlation

Web Scraping Distribuído (Scrapy)

Desenvolvimento de Spiders assíncronos no framework Scrapy para extração de dados estruturados, tratamento de paginação automática e exportação em formatos JSON e JSONL.

Scrapy Spiders CSS/XPath Selectors