case técnico

IA • Machine Learning / Classificação

IA Score de Crédito

Proof of concept em machine learning para classificação de score de crédito a partir de dados financeiros e comportamentais.

Preparação de dados, treinamento, comparação de modelos e previsão Concluído POC finalizado
Python Pandas Scikit-learn Jupyter Notebook Machine Learning
resumo executivo

Problema

Análises manuais de score de crédito são lentas e dependem de múltiplas variáveis financeiras, comportamentais e cadastrais.

Solução

Foi desenvolvido um notebook de machine learning que prepara os dados, codifica variáveis categóricas, treina modelos e compara acurácia entre Random Forest e KNN.

Resultado

O modelo Random Forest apresentou melhor desempenho no teste, com acurácia aproximada de 82,4%, superando o KNN, que ficou próximo de 73,9%.

Estado atual

POC concluído, adequado para demonstração técnica e evolução futura com pipeline, validação e explicabilidade.

contexto

Classificação de risco como experimento de IA aplicada

O projeto foi criado para testar um fluxo completo de classificação: importar uma base de clientes, transformar variáveis textuais em numéricas, separar treino e teste, treinar dois algoritmos e aplicar o melhor modelo em novos clientes.

objetivos e restrições

Objetivos

  • Preparar dados financeiros e comportamentais para machine learning
  • Transformar variáveis categóricas em valores numéricos
  • Separar base em treino e teste
  • Comparar Random Forest e KNN
  • Prever score de crédito para novos clientes

Restrições

  • POC em notebook, sem API ou interface de produção
  • Modelo demonstrativo, não indicado para decisão financeira real sem auditoria
  • Necessidade futura de pipeline de pré-processamento mais robusto
  • Tema sensível, exigindo explicabilidade, governança e revisão humana
arquitetura da solução

Front-end

Notebook com displays de tabela, métricas de acurácia e previsão final para novos clientes.

Back-end

Fluxo em Python usando Pandas e Scikit-learn, com LabelEncoder, train_test_split, RandomForestClassifier, KNeighborsClassifier e accuracy_score.

Banco de dados

CSV com 100 mil registros de clientes e variáveis como profissão, salário anual, contas, cartões, empréstimos, atrasos, histórico de crédito, comportamento de pagamento e score.

segurança e prevenções

Uso responsável

O projeto é tratado como prova de conceito técnica, não como ferramenta autônoma para aprovação ou reprovação de crédito.

Explicabilidade futura

Por lidar com crédito, uma evolução real exigiria análise de viés, explicabilidade do modelo e critérios auditáveis.

Separação treino/teste

A base foi dividida para medir desempenho em dados não usados diretamente no treinamento.

processo
01

Importação dos dados

Carregamento da base de clientes e inspeção inicial das colunas.

02

Pré-processamento

Conversão de profissões, mix de crédito e comportamento de pagamento para valores numéricos.

03

Divisão da base

Separação das variáveis de entrada e saída, com divisão 70/30 entre treino e teste.

04

Treinamento

Treinamento de Random Forest e KNN para comparar abordagens de classificação.

05

Previsão

Aplicação do modelo escolhido em novos clientes para prever a classe de score.

bastidores técnicos
impacto

Resultados

O Random Forest atingiu aproximadamente 82,4% de acurácia no conjunto de teste, enquanto o KNN ficou em torno de 73,9%, indicando melhor adequação do modelo baseado em árvores para o experimento.

Aprendizados

O projeto reforçou a importância de pré-processamento, comparação de modelos e responsabilidade na apresentação de IA aplicada a crédito.