MothMalone/data-preprocessing-automl-benchmarks
Data Preprocessing AutoML Benchmarks This repository contains text classification datasets with known data quality issues for preprocessing research in AutoML. Usage Load a specific dataset configuration like this: from datasets import load_dataset # Example for loading the TREC dataset dataset = load_dataset("MothMalone/data-preprocessing-automl-benchmarks", "trec") Available Datasets Below are the details for each dataset configuration available… See the full description on the dataset page: https://huggingface.co/datasets/MothMalone/data-preprocessing-automl-benchmarks.
Data Preprocessing AutoML Benchmarks
This repository contains text classification datasets with known data quality issues for preprocessing research in AutoML.
Usage
Load a specific dataset configuration like this:
from datasets import load_dataset
# Example for loading the TREC dataset
dataset = load_dataset("MothMalone/data-preprocessing-automl-benchmarks", "trec")Available Datasets
Below are the details for each dataset configuration available in this repository.
Of course. Here are the completed descriptions for your dataset card.
imdb
- Description: A large movie review dataset for binary sentiment classification, containing 25,000 highly polarized movie reviews for training and 25,000 for testing.
- Data Quality Issue: N/A
- Classes: 2
- Training Samples: 18750
- Validation Samples: 6250
- Test Samples: 25000
twenty_newsgroups
- Description: A collection of approximately 20,000 newsgroup documents, partitioned evenly across 20 different newsgroups, making it a classic benchmark for text classification.
- Data Quality Issue: N/A
- Classes: 20
- Training Samples: 8485
- Validation Samples: 2829
- Test Samples: 7532
banking77
- Description: A fine-grained dataset of 13,083 customer service queries from the banking domain, annotated with 77 distinct intents.
- Data Quality Issue: N/A
- Classes: 77
- Training Samples: 7502
- Validation Samples: 2501
- Test Samples: 3080
trec
- Description: The Text REtrieval Conference (TREC) question classification dataset, containing questions categorized by their answer type (e.g., Person, Location, Number).
- Data Quality Issue: N/A
- Classes: 6
- Training Samples: 4089
- Validation Samples: 1363
- Test Samples: 500
financial_phrasebank
- Description: A collection of sentences from English financial news, annotated for sentiment (positive, negative, or neutral) by financial experts.
- Data Quality Issue: N/A
- Classes: 3
- Training Samples: 1358
- Validation Samples: 453
- Test Samples: 453
MASSIVE
- Description: A multilingual dataset of 1 million utterances for intent classification and slot filling, covering 52 languages. The en-US configuration is used here.
- Data Quality Issue: N/A
- Classes: 60
- Training Samples: 11514
- Validation Samples: 2033
- Test Samples: 2974
