CoolFace
Datasetpublic

federicomoreno/marketing-campaign-performance-200k

Marketing Campaign Performance Dataset (200k) Mirror de Kaggle: Marketing Campaign Performance Dataset (manishabhatt22), 200.000 filas de campañas de marketing (verificado: rango de fechas 2021-01-01 a 2021-12-31, no dos años como dice la card de Kaggle). Subido aquí para poder cargarlo con datasets.load_dataset() sin credenciales de Kaggle. Contenido data/marketing_campaign_dataset.csv — 200.000 filas, ~27 MB, 16 columnas. data/data_dictionary.md — descripción… See the full description on the dataset page: https://huggingface.co/datasets/federicomoreno/marketing-campaign-performance-200k.

sourceHugging Faceupdated 12d agoView on Hugging Face
0likes70downloads
Dataset Card

Marketing Campaign Performance Dataset (200k)

Mirror de Kaggle: Marketing Campaign Performance Dataset (manishabhatt22), 200.000 filas de campañas de marketing (verificado: rango de fechas 2021-01-01 a 2021-12-31, no dos años como dice la card de Kaggle). Subido aquí para poder cargarlo con datasets.load_dataset() sin credenciales de Kaggle.

Contenido

  • —data/marketing_campaign_dataset.csv — 200.000 filas, ~27 MB, 16 columnas.
  • —data/data_dictionary.md — descripción de columnas.

Columnas

ColumnaTipoDescripción
Campaign_IDintID único de la campaña
CompanystrEmpresa de la campaña (marcas ficticias)
Campaign_TypestrTipo: Email, Social Media, Influencer, Display, Search
Target_AudiencestrSegmento objetivo (p. ej. "Men 18-24")
DurationstrDuración como "30 days", "60 days" (extraer el número)
Channel_UsedstrCanal: Facebook, Instagram, YouTube, Google Ads, Email, Website
Conversion_RatefloatPorcentaje de conversión (0-1)
Acquisition_Coststr (USD)Costo de adquisición, formato "$13,606.00"
ROIfloatRetorno de inversión (~5-8)
LocationstrCiudad objetivo (NY, LA, Chicago, Houston, Miami)
LanguagestrIdioma de la campaña
ClicksintCantidad de clics
ImpressionsintCantidad de impresiones
Engagement_ScoreintScore de engagement 1-10
Customer_SegmentstrSegmento de cliente
DatedateFecha de la campaña (2021 completo)

Variables derivadas

  • —Spend = Acquisition_Cost (parsear el formato monetario).
  • —Revenue = spend × (1 + ROI).

Resultados de baseline (LightGBM, split temporal 80/20)

Entrenado sobre este mirror con features pre-flight (sin outcomes):

ModeloMAERMSER²MAPE
spend$3.764$4.343≈ 037%
revenue$28.680$34.860≈ 051%

R² ≈ 0: este dataset no tiene señal predictiva. Las columnas (spend, ROI, clicks, impressions, engagement) están muestreadas independientemente de distribuciones uniformes, así que ningún feature predice los targets. Converge en la iteración 1-2 de boosting. Sirve para demostrar el pipeline/EDA/dashboards, no para demostrar modelos predictivos.

Caveats

  1. 1.Sintético y sin señal — ver resultados arriba.
  2. 2.No es granularidad real de Meta: nivel campaña, Facebook es uno de 6 canales.
  3. 3.Licencia: el original está marcado "Unknown/Other". Acreditar a manishabhatt22 en Kaggle.

Cómo cargarlo

python
from datasets import load_dataset
ds = load_dataset("federicomoreno/marketing-campaign-performance-200k", split="train")