Problema
A base de clientes possuía dados brutos, campos irrelevantes e registros incompletos, dificultando a identificação dos fatores associados ao cancelamento.
case técnico
Data Tool • Limpeza e análise de dados
Pipeline em Python para limpeza, análise exploratória e validação de hipóteses em uma base de cancelamentos de clientes.
Importação da base, remoção de identificadores e tratamento de registros incompletos antes da análise.
Geração de histogramas por variável para visualizar padrões de cancelamento e comportamento dos clientes.
Testes de hipóteses aplicando filtros sobre idade, chamadas ao call center, atraso, contrato e gasto total.
A base de clientes possuía dados brutos, campos irrelevantes e registros incompletos, dificultando a identificação dos fatores associados ao cancelamento.
Foi criado um fluxo em notebook para limpar a base, remover ruído, visualizar distribuições e testar hipóteses sobre os principais fatores ligados ao churn.
A análise apontou cinco sinais relevantes: idade acima de 50 anos, muitas ligações ao call center, atraso superior a 20 dias, contrato mensal e baixo gasto total.
POC concluído, pronto para evoluir para dashboard, pipeline reutilizável ou modelo preditivo.
O projeto começou como uma análise exploratória sobre cancelamentos. A primeira etapa foi limpar a base, remover o identificador de cliente e descartar linhas incompletas. Depois, a análise passou a comparar a proporção de cancelamentos antes e depois de filtros baseados em hipóteses de comportamento.
Uso de gráficos interativos com Plotly para comparar distribuições por coluna, destacando diferenças entre clientes que cancelaram e clientes que permaneceram.
Pipeline em Python com Pandas para leitura do CSV, remoção de colunas, tratamento de valores nulos, contagem de proporções e filtragem progressiva por hipótese.
Base tabular em CSV com atributos de cliente, contrato, uso, atraso, suporte, gasto total e status de cancelamento.
O identificador do cliente foi removido antes da análise, reduzindo ruído e evitando uso de um campo sem valor analítico direto.
Linhas com dados faltantes foram descartadas para evitar distorções nos cálculos e nas visualizações.
Os resultados são tratados como análise exploratória, não como prova causal automática. A leitura final exige validação de negócio.
Leitura do arquivo CSV e primeira inspeção da tabela com Pandas.
Remoção do CustomerID e descarte de registros com informações faltantes.
Cálculo da proporção de cancelamentos e criação de gráficos por variável.
Aplicação de filtros para testar o impacto de idade, suporte, atraso, contrato e gasto total.
Síntese dos fatores mais associados ao cancelamento e indicação de caminhos para redução de churn.
A análise saiu de uma taxa inicial de cancelamento próxima de 56,7% e, ao simular a remoção dos cinco fatores de risco, encontrou uma base filtrada com permanência próxima de 95,2%.
O principal aprendizado foi transformar limpeza e exploração de dados em leitura acionável, mantendo cuidado para não confundir correlação com causalidade.