gusdelact/credit-card-fraud-curated
credit-card-fraud-detector — Curated dataset Versión curada del dataset alenc123/credit-card-fraud con feature engineering aplicado y splits estratificados train/test. Listo para benchmarking de clasificadores binarios sobre fraude. Composición Train: 1,037,340 filas Test: 259,335 filas Features finales: 30 Tasa de fraude: ~0.579% (estratificada en ambos splits) Target: is_fraud ∈ {0, 1} Preprocesamiento aplicado Drop de columnas sin señal:… See the full description on the dataset page: https://huggingface.co/datasets/gusdelact/credit-card-fraud-curated.
credit-card-fraud-detector — Curated dataset
Versión curada del dataset `alenc123/credit-card-fraud` con feature engineering aplicado y splits estratificados train/test. Listo para benchmarking de clasificadores binarios sobre fraude.
Composición
- Train: 1,037,340 filas
- Test: 259,335 filas
- Features finales: 30
- Tasa de fraude: ~0.579% (estratificada en ambos splits)
- Target:
is_fraud∈ {0, 1}
Preprocesamiento aplicado
- Drop de columnas sin señal:
Unnamed: 0,trans_num,cc_num,first,last,street,merch_zipcode,zip,unix_time. - Features derivadas:
hour,dayofweek,month,age,distance_km(haversine),amt_log1p. - Frequency encoding:
merchant,city,job,state. - One-hot encoding:
category,gender. - Split estratificado 80/20 con
random_state=42.
Ver el detalle en notes/00_design_eda.md y notes/01_design_fe.md del proyecto fuente.
Archivos
X_train.parquet,X_test.parquet— features post-preprocessing.y_train.parquet,y_test.parquet— target binario.
Cómo usar
import pandas as pd
from huggingface_hub import hf_hub_download
X_train = pd.read_parquet(hf_hub_download("gusdelact/credit-card-fraud-curated", "X_train.parquet", repo_type="dataset"))
y_train = pd.read_parquet(hf_hub_download("gusdelact/credit-card-fraud-curated", "y_train.parquet", repo_type="dataset")).iloc[:, 0]Limitaciones
- El dataset original es sintético (familia Sparkov), por lo que las métricas pueden ser optimistas frente a fraude real.
- Frequency encoding fija las frecuencias del split de train; valores nuevos en producción se mapean a 0.
- No hay split temporal: para escenarios con concept drift se recomienda re-particionar por fecha.
Cómo citar
@dataset{credit_card_fraud_curated_2026,
author = {gusdelact},
title = {credit-card-fraud-detector curated splits},
year = {2026},
publisher = {Hugging Face}
}