sronquillo2/Enhanced_Emotion_Classification_Dataset
Enhanced Emotion Classification Dataset (v2.0) Dataset Description This dataset is an enhanced version of the emotion classification dataset, including multiple sources of emotion data with Ekman emotion mapping. It contains a total of 240,426 samples across 7 emotion categories, with each sample labeled with its original data source. Dataset Structure The dataset is split into three parts: Train: 186,619 samples (77.6%) Validation: 31,086 samples… See the full description on the dataset page: https://huggingface.co/datasets/sronquillo2/Enhanced_Emotion_Classification_Dataset.
024
1---2language:3- en4pretty_name: Enhanced Emotion Classification Dataset5version: 2.06tags:7- text-classification8- emotion9- sentiment-analysis10- ekman-emotions11- text12license: mit13task_categories:14- text-classification15task_ids:16- sentiment-classification17---18 19# Enhanced Emotion Classification Dataset (v2.0)20 21## Dataset Description22 23This dataset is an enhanced version of the emotion classification dataset, including multiple sources of emotion data with Ekman emotion mapping. It contains a total of 240,426 samples across 7 emotion categories, with each sample labeled with its original data source.24 25### Dataset Structure26 27The dataset is split into three parts:28- **Train**: 186,619 samples (77.6%)29- **Validation**: 31,086 samples (12.9%)30- **Test**: 22,721 samples (9.4%)31 32### Emotion Categories33 34The dataset includes 7 Ekman basic emotions:35- neutral36- joy37- sadness38- anger39- fear40- surprise41- disgust42 43## Data Sources44 45The dataset combines data from 7 different sources:46 471. **Movies_Reviews**48 - Movie review emotion data49 - Contains 7 emotion categories50 512. **DailyDialog**52 - Real dialog data with multi-turn conversations53 - Contains 7 emotion categories54 553. **GoEmotions**56 - Reddit comment data with colloquial expressions57 - Contains 7 emotion categories58 594. **ISEAR**60 - International emotion research data with high-quality text61 - Contains 7 emotion categories62 635. **MELD**64 - Multimodal emotion dialog data from the TV show "Friends"65 - Contains 7 emotion categories66 676. **mteb_emotion**68 - Emotion analysis dataset with various emotion expressions69 - Contains 7 emotion categories70 717. **Tweet Emotions**72 - Twitter tweet data including @mentions73 - Contains 7 emotion categories74 75## Data Format76 77Each CSV file contains the following columns:78- `text`: Text content79- `label_text`: Emotion label (one of the 7 emotion categories)80- `source`: Data source identifier (e.g., dailydialog, goemotions, tweetemotions, etc.)81 82## File Structure83 84```85dataset_huggingface_enhance/86├── train.csv # Merged training set (186,619 samples)87├── val.csv # Merged validation set (31,086 samples)88├── test.csv # Merged test set (22,721 samples)89├── README.md # Dataset documentation90├── dataset_infos.json # Hugging Face dataset configuration91├── info.md # Detailed dataset statistics92├── label_list.txt # List of emotion labels93└── stats.py # Dataset statistics script94```95 96## Usage97 98To use this dataset with Hugging Face Datasets library:99 100```python101from datasets import load_dataset102 103# Load the dataset104dataset = load_dataset("jiangchengchengNLP/Enhanced_Emotion_Classification_Dataset")105 106# Access specific splits107train_dataset = dataset["train"]108val_dataset = dataset["validation"]109test_dataset = dataset["test"]110```111 112## Emotion Distribution113 114### Training Set (186,619 samples)115- neutral: 51.11%116- joy: 21.64%117- sadness: 7.98%118- anger: 5.97%119- fear: 5.90%120- surprise: 5.11%121- disgust: 2.29%122 123### Validation Set (31,086 samples)124- neutral: 40.96%125- joy: 24.15%126- sadness: 9.38%127- fear: 8.06%128- anger: 7.49%129- surprise: 7.06%130- disgust: 2.89%131 132### Test Set (22,721 samples)133- neutral: 45.11%134- joy: 22.88%135- sadness: 9.13%136- anger: 7.61%137- fear: 6.67%138- surprise: 5.93%139- disgust: 2.67%140 141## Notes142 143- The dataset has class imbalance, with neutral being the most common category (~40-51%) and disgust being the least common (~2-3%).144- Each sample includes a `source` field indicating its original data source, which allows for source-specific analysis.145- Different data sources have different text styles, which may affect model performance.146- The dataset uses Ekman emotion mapping, which maps various emotion labels to the 7 basic emotions.147 148## License149 150The dataset is released under the MIT License.151 152## Citation153 154If you use this dataset in your research, please cite the original datasets:155 156- DailyDialog: https://aclanthology.org/I17-1099/157- GoEmotions: https://arxiv.org/abs/2005.00547158- Tweet Emotions: https://www.aclweb.org/anthology/W18-6212/159- MELD: https://arxiv.org/abs/1810.02508160- ISEAR: https://link.springer.com/article/10.1007/BF02112196161 162## Version History163 164- **v2.0** (2026-01-07): Updated dataset with merged sources and source field165 - Total samples: 240,426166 - Added `source` field to all samples167 - Updated emotion distribution statistics168 - Improved data quality and consistency169 - Filtered all NaN values from the dataset170 171- **v1.0**: Initial release172 173 