CoolFace
Datasetpublic

gusdelact/credit-card-fraud-curated

credit-card-fraud-detector — Curated dataset Versión curada del dataset alenc123/credit-card-fraud con feature engineering aplicado y splits estratificados train/test. Listo para benchmarking de clasificadores binarios sobre fraude. Composición Train: 1,037,340 filas Test: 259,335 filas Features finales: 30 Tasa de fraude: ~0.579% (estratificada en ambos splits) Target: is_fraud ∈ {0, 1} Preprocesamiento aplicado Drop de columnas sin señal:… See the full description on the dataset page: https://huggingface.co/datasets/gusdelact/credit-card-fraud-curated.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes83downloads
Dataset Card

credit-card-fraud-detector — Curated dataset

Versión curada del dataset `alenc123/credit-card-fraud` con feature engineering aplicado y splits estratificados train/test. Listo para benchmarking de clasificadores binarios sobre fraude.

Composición

  • —Train: 1,037,340 filas
  • —Test: 259,335 filas
  • —Features finales: 30
  • —Tasa de fraude: ~0.579% (estratificada en ambos splits)
  • —Target: is_fraud ∈ {0, 1}

Preprocesamiento aplicado

  1. 1.Drop de columnas sin señal: Unnamed: 0, trans_num, cc_num, first, last, street, merch_zipcode, zip, unix_time.
  2. 2.Features derivadas: hour, dayofweek, month, age, distance_km (haversine), amt_log1p.
  3. 3.Frequency encoding: merchant, city, job, state.
  4. 4.One-hot encoding: category, gender.
  5. 5.Split estratificado 80/20 con random_state=42.

Ver el detalle en notes/00_design_eda.md y notes/01_design_fe.md del proyecto fuente.

Archivos

  • —X_train.parquet, X_test.parquet — features post-preprocessing.
  • —y_train.parquet, y_test.parquet — target binario.

Cómo usar

python
import pandas as pd
from huggingface_hub import hf_hub_download

X_train = pd.read_parquet(hf_hub_download("gusdelact/credit-card-fraud-curated", "X_train.parquet", repo_type="dataset"))
y_train = pd.read_parquet(hf_hub_download("gusdelact/credit-card-fraud-curated", "y_train.parquet", repo_type="dataset")).iloc[:, 0]

Limitaciones

  • —El dataset original es sintético (familia Sparkov), por lo que las métricas pueden ser optimistas frente a fraude real.
  • —Frequency encoding fija las frecuencias del split de train; valores nuevos en producción se mapean a 0.
  • —No hay split temporal: para escenarios con concept drift se recomienda re-particionar por fecha.

Cómo citar

@dataset{credit_card_fraud_curated_2026,
  author    = {gusdelact},
  title     = {credit-card-fraud-detector curated splits},
  year      = {2026},
  publisher = {Hugging Face}
}