Ruta práctica de clasificación aplicada a fraude/impago crediticio con AutoML: desde los fundamentos de PyCaret hasta un flujo nivel experto con perfilado de datos, comparación de modelos, tuning por métrica (AUC vs Recall) y ensambles. En español.
Fraud/credit-default classification learning path in Spanish: PyCaret AutoML fundamentals → beginner → expert workflows (EDA profiling, model comparison, metric-driven tuning, ensembles), plus applied exercises with solutions.
| # | Notebook | Nivel | Qué cubre |
|---|---|---|---|
| 1 | 1_Fundamentos de autoML y Pycaret |
Básico | Qué es AutoML, setup de PyCaret y su flujo de trabajo |
| 2 | 2._Clasificación del fraude. Nivel principiante |
Principiante | Dataset credit (UCI), compare_models(), modelos individuales (árbol de decisión, KNN, random forest) y tuning básico |
| 2.1 | 2.1.1_Ejercicio Clasificación (+ solución en 2.1.2) |
Práctica | Ejercicio de clasificación con preprocesamiento scikit-learn (dataset Titanic) |
| 3 | 3_Clasificación del fraude. Nivel experto |
Experto | EDA con pandas-profiling, compare_models(n_select=3), tuning optimizando AUC vs Recall (clave en fraude: el costo de un falso negativo), validación por folds |
| 4 | 4._Ejercicio aplicado de Clasificacion (+ solución en 4.1) |
Aplicado | Caso completo end-to-end; la solución incorpora TPOT (AutoML genético) como segundo enfoque |
- Default of Credit Card Clients (UCI) — 30.000 clientes de tarjetas de crédito de Taiwán; objetivo: predecir el impago del próximo período. Es el dataset
creditde PyCaret; también incluido como.xlsenData/. - Titanic (Kaggle) —
train.csv/test.csvenData/, usado en los ejercicios de clasificación para practicar preprocesamiento y features.
PyCaret (AutoML) · scikit-learn · pandas / numpy · pandas-profiling (EDA) · TPOT (AutoML genético)
python -m venv .venv && source .venv/bin/activate # Windows: .venv\Scripts\activate
pip install -r requirements.txt
jupyter notebookNota de versiones: los notebooks fueron desarrollados con PyCaret 2.x y
pandas_profiling(hoy renombradoydata-profiling). Si usas PyCaret 3.x, la API de clasificación se mantiene casi igual; para el perfilado reemplaza el import porydata_profiling.
En detección de fraude las clases están desbalanceadas y un fraude no detectado (falso negativo) cuesta mucho más que una falsa alarma. Por eso el notebook experto tunea el mismo modelo dos veces — optimize='AUC' y optimize='Recall' — y compara qué se sacrifica en cada caso. Esa decisión de negocio, no el algoritmo, es el corazón del problema.
Luis Cáceres — CTO & CFO · IA aplicada en producción luiscaceres.cl · LinkedIn · GitHub
Licencia MIT.