case técnico

Data Tool • Limpeza e análise de dados

Data Cleaner

Pipeline em Python para limpeza, análise exploratória e validação de hipóteses em uma base de cancelamentos de clientes.

Análise de dados, limpeza, visualização e interpretação Concluído Proof of concept finalizado
Python Pandas Plotly Jupyter Notebook Data Analysis
resumo executivo

Problema

A base de clientes possuía dados brutos, campos irrelevantes e registros incompletos, dificultando a identificação dos fatores associados ao cancelamento.

Solução

Foi criado um fluxo em notebook para limpar a base, remover ruído, visualizar distribuições e testar hipóteses sobre os principais fatores ligados ao churn.

Resultado

A análise apontou cinco sinais relevantes: idade acima de 50 anos, muitas ligações ao call center, atraso superior a 20 dias, contrato mensal e baixo gasto total.

Estado atual

POC concluído, pronto para evoluir para dashboard, pipeline reutilizável ou modelo preditivo.

contexto

Transformar dados brutos em leitura de negócio

O projeto começou como uma análise exploratória sobre cancelamentos. A primeira etapa foi limpar a base, remover o identificador de cliente e descartar linhas incompletas. Depois, a análise passou a comparar a proporção de cancelamentos antes e depois de filtros baseados em hipóteses de comportamento.

objetivos e restrições

Objetivos

  • Importar e preparar uma base de clientes para análise
  • Remover campos irrelevantes e registros incompletos
  • Visualizar a relação entre variáveis e cancelamento
  • Testar hipóteses de fatores associados ao churn
  • Gerar uma leitura clara para orientar decisões de negócio

Restrições

  • Base analisada em ambiente de notebook, sem interface final
  • Análise exploratória, sem inferência causal definitiva
  • Hipóteses baseadas em filtros manuais
  • Necessidade futura de transformar o fluxo em pipeline reutilizável
arquitetura da solução

Front-end

Uso de gráficos interativos com Plotly para comparar distribuições por coluna, destacando diferenças entre clientes que cancelaram e clientes que permaneceram.

Back-end

Pipeline em Python com Pandas para leitura do CSV, remoção de colunas, tratamento de valores nulos, contagem de proporções e filtragem progressiva por hipótese.

Banco de dados

Base tabular em CSV com atributos de cliente, contrato, uso, atraso, suporte, gasto total e status de cancelamento.

segurança e prevenções

Remoção de identificador

O identificador do cliente foi removido antes da análise, reduzindo ruído e evitando uso de um campo sem valor analítico direto.

Tratamento de registros incompletos

Linhas com dados faltantes foram descartadas para evitar distorções nos cálculos e nas visualizações.

Limite interpretativo

Os resultados são tratados como análise exploratória, não como prova causal automática. A leitura final exige validação de negócio.

processo
01

Importação da base

Leitura do arquivo CSV e primeira inspeção da tabela com Pandas.

02

Limpeza inicial

Remoção do CustomerID e descarte de registros com informações faltantes.

03

Análise exploratória

Cálculo da proporção de cancelamentos e criação de gráficos por variável.

04

Validação de hipóteses

Aplicação de filtros para testar o impacto de idade, suporte, atraso, contrato e gasto total.

05

Leitura final

Síntese dos fatores mais associados ao cancelamento e indicação de caminhos para redução de churn.

bastidores técnicos
impacto

Resultados

A análise saiu de uma taxa inicial de cancelamento próxima de 56,7% e, ao simular a remoção dos cinco fatores de risco, encontrou uma base filtrada com permanência próxima de 95,2%.

Aprendizados

O principal aprendizado foi transformar limpeza e exploração de dados em leitura acionável, mantendo cuidado para não confundir correlação com causalidade.