CoolFace
Datasetpublic

MothMalone/data-preprocessing-automl-benchmarks

Data Preprocessing AutoML Benchmarks This repository contains text classification datasets with known data quality issues for preprocessing research in AutoML. Usage Load a specific dataset configuration like this: from datasets import load_dataset # Example for loading the TREC dataset dataset = load_dataset("MothMalone/data-preprocessing-automl-benchmarks", "trec") Available Datasets Below are the details for each dataset configuration available… See the full description on the dataset page: https://huggingface.co/datasets/MothMalone/data-preprocessing-automl-benchmarks.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes112downloads
Dataset Card

Data Preprocessing AutoML Benchmarks

This repository contains text classification datasets with known data quality issues for preprocessing research in AutoML.

Usage

Load a specific dataset configuration like this:

python
from datasets import load_dataset
# Example for loading the TREC dataset
dataset = load_dataset("MothMalone/data-preprocessing-automl-benchmarks", "trec")

Available Datasets

Below are the details for each dataset configuration available in this repository.

Of course. Here are the completed descriptions for your dataset card.

imdb

  • Description: A large movie review dataset for binary sentiment classification, containing 25,000 highly polarized movie reviews for training and 25,000 for testing.
  • Data Quality Issue: N/A
  • Classes: 2
  • Training Samples: 18750
  • Validation Samples: 6250
  • Test Samples: 25000

twenty_newsgroups

  • Description: A collection of approximately 20,000 newsgroup documents, partitioned evenly across 20 different newsgroups, making it a classic benchmark for text classification.
  • Data Quality Issue: N/A
  • Classes: 20
  • Training Samples: 8485
  • Validation Samples: 2829
  • Test Samples: 7532

banking77

  • Description: A fine-grained dataset of 13,083 customer service queries from the banking domain, annotated with 77 distinct intents.
  • Data Quality Issue: N/A
  • Classes: 77
  • Training Samples: 7502
  • Validation Samples: 2501
  • Test Samples: 3080

trec

  • Description: The Text REtrieval Conference (TREC) question classification dataset, containing questions categorized by their answer type (e.g., Person, Location, Number).
  • Data Quality Issue: N/A
  • Classes: 6
  • Training Samples: 4089
  • Validation Samples: 1363
  • Test Samples: 500

financial_phrasebank

  • Description: A collection of sentences from English financial news, annotated for sentiment (positive, negative, or neutral) by financial experts.
  • Data Quality Issue: N/A
  • Classes: 3
  • Training Samples: 1358
  • Validation Samples: 453
  • Test Samples: 453

MASSIVE

  • Description: A multilingual dataset of 1 million utterances for intent classification and slot filling, covering 52 languages. The en-US configuration is used here.
  • Data Quality Issue: N/A
  • Classes: 60
  • Training Samples: 11514
  • Validation Samples: 2033
  • Test Samples: 2974