Olist: um Case de E-commerce Brasileiro de Ponta a Ponta
Esse projeto é diferente de qualquer playlist daqui. Playlist é aula, um conceito de cada vez, post independente do anterior. Isso aqui é um case de ciência de dados de ponta a ponta: eu pego um dataset real, sujo, com nove tabelas relacionadas entre si, e vou até o fim, EDA, visualização, engenharia de feature, treino de modelo, interpretabilidade e conclusão de negócio. Os capítulos se constroem uns em cima dos outros, o capítulo 3 assume que você já leu o 1 e o 2.
O dataset é o Brazilian E-Commerce Public Dataset, da Olist, disponível no Kaggle. São dados reais (anonimizados) de mais de 100 mil pedidos feitos entre 2016 e 2018 num marketplace brasileiro de verdade, cliente, vendedor, produto, pagamento, avaliação, tudo interligado por chave. Todo o processamento pesado (pandas, scikit-learn, XGBoost, SHAP) roda num notebook que eu executo no Google Colab, com GPU T4 quando o capítulo precisar. Os resultados reais desses notebooks é que viram gráfico interativo aqui no blog, nunca um número inventado.
Os quatro cenários
Definidos já no primeiro capítulo, porque eles guiam o projeto inteiro:
- Previsão de atraso na entrega (classificação binária): o pedido chega depois da data estimada ou não?
- Previsão da nota de avaliação (classificação/regressão): quantas estrelas o cliente vai dar?
- Previsão do valor do frete ou do pedido (regressão): quanto vai custar?
- Segmentação de clientes (clustering, RFM): que tipos de cliente existem nessa base?
Cada um puxa um recorte diferente do mesmo dataframe, e o objetivo é te mostrar como a mesma base de dado serve pra perguntas de negócio bem diferentes.
Começa por Capítulo 1: modelo relacional e primeira exploração.
Projetos · 4 capítulos
- Nove Tabelas, Um Só Negócio: o Modelo Relacional da Olist
Primeiro capítulo do case Olist: carrego os nove CSVs, monto o dataframe mestre, checo a qualidade real do dado, e defino os quatro cenários de ML que o resto do projeto vai cobrir.
- O Brasil Compra de Dia Útil: Storytelling Exploratório da Olist
Segundo capítulo do case Olist: mapa de calor de horário de compra, mapa coroplético de atraso por estado, categorias que mais faturam, forma de pagamento, e a correlação que já entrega o punchline antes de qualquer modelo: atraso mata nota.
- Vazamento de Dado: o Jeito Mais Fácil de Enganar a Si Mesmo
Terceiro capítulo do case Olist: engenharia de feature e seleção pros quatro cenários, com uma demonstração ao vivo de vazamento de dado (um modelo com 100% de AUC que não serve pra nada) e uma descoberta real sobre sazonalidade.
- AUC Boa, F1 Zero: a Armadilha do Threshold Padrão
Quarto capítulo do case Olist: treino os quatro modelos de verdade (atraso, nota, frete, RFM) com tracking via MLflow, e pego um Random Forest com AUC 0,74 que não acerta um único caso positivo no threshold padrão.