CoolFace
Datasetpublic

sronquillo2/Enhanced_Emotion_Classification_Dataset

Enhanced Emotion Classification Dataset (v2.0) Dataset Description This dataset is an enhanced version of the emotion classification dataset, including multiple sources of emotion data with Ekman emotion mapping. It contains a total of 240,426 samples across 7 emotion categories, with each sample labeled with its original data source. Dataset Structure The dataset is split into three parts: Train: 186,619 samples (77.6%) Validation: 31,086 samples… See the full description on the dataset page: https://huggingface.co/datasets/sronquillo2/Enhanced_Emotion_Classification_Dataset.

sourceHugging Facemitupdated 6mo agoView on Hugging Face
0likes25downloads
info.md193 linesDownload Raw Back to root
1# 数据集统计信息2 3## 概览4 5- **总样本数**: 240,426 条6- **训练集**: 186,619 (77.62%)7- **验证集**: 31,086 (12.93%)8- **测试集**: 22,721 (9.45%)9- **情感类别**: 7种(neutral + 6种Ekman基本情感)10- **数据源**: 7个(Movies_Reviews, dailydialog, goemotions, isear, meld, mteb_emotion, tweetemotions)11 12## 数据集列表13 14### 合并数据集(按子集)15 16| 子集 | 样本数 | 占比 | 文件名 |17|------|--------|------|--------|18| 训练集 | 186,619 | 77.62% | train.csv |19| 验证集 | 31,086 | 12.93% | val.csv |20| 测试集 | 22,721 | 9.45% | test.csv |21| **总计** | **240,426** | **100%** | |22 23## 情感分布24 25### 训练集情感分布 (186,619条)26 27| 情感 | 样本数 | 占比 |28|------|--------|------|29| neutral | 95,392 | 51.12% |30| joy | 40,380 | 21.64% |31| sadness | 14,886 | 7.98% |32| anger | 11,142 | 5.97% |33| fear | 11,011 | 5.90% |34| surprise | 9,528 | 5.11% |35| disgust | 4,280 | 2.29% |36 37### 验证集情感分布 (31,086条)38 39| 情感 | 样本数 | 占比 |40|------|--------|------|41| neutral | 12,734 | 40.96% |42| joy | 7,509 | 24.15% |43| sadness | 2,915 | 9.38% |44| fear | 2,506 | 8.06% |45| anger | 2,329 | 7.49% |46| surprise | 2,196 | 7.06% |47| disgust | 897 | 2.89% |48 49### 测试集情感分布 (22,721条)50 51| 情感 | 样本数 | 占比 |52|------|--------|------|53| neutral | 10,249 | 45.11% |54| joy | 5,198 | 22.88% |55| sadness | 2,074 | 9.13% |56| anger | 1,729 | 7.61% |57| fear | 1,516 | 6.67% |58| surprise | 1,348 | 5.93% |59| disgust | 607 | 2.67% |60 61### 整体情感分布 (240,426条)62 63| 情感 | 样本数 | 占比 |64|------|--------|------|65| neutral | 118,375 | 49.24% |66| joy | 53,087 | 22.08% |67| sadness | 19,875 | 8.27% |68| anger | 15,200 | 6.32% |69| fear | 15,033 | 6.25% |70| surprise | 13,072 | 5.44% |71| disgust | 5,784 | 2.41% |72 73## 数据源分布74 75### 训练集数据源分布76 77| 数据源 | 样本数 | 占比 |78|--------|--------|------|79| dailydialog | 87,170 | 46.71% |80| goemotions | 41,251 | 22.10% |81| tweetemotions | 21,763 | 11.66% |82| mteb_emotion | 15,956 | 8.55% |83| meld | 9,989 | 5.35% |84| Movies_Reviews | 6,725 | 3.60% |85| isear | 3,765 | 2.02% |86 87### 验证集数据源分布88 89| 数据源 | 样本数 | 占比 |90|--------|--------|------|91| goemotions | 11,786 | 37.91% |92| dailydialog | 8,069 | 25.95% |93| tweetemotions | 6,218 | 20.00% |94| mteb_emotion | 1,988 | 6.39% |95| meld | 1,109 | 3.57% |96| isear | 1,076 | 3.46% |97| Movies_Reviews | 840 | 2.70% |98 99### 测试集数据源分布100 101| 数据源 | 样本数 | 占比 |102|--------|--------|------|103| dailydialog | 7,740 | 34.06% |104| goemotions | 5,893 | 25.94% |105| tweetemotions | 3,110 | 13.69% |106| meld | 2,610 | 11.49% |107| mteb_emotion | 1,986 | 8.74% |108| Movies_Reviews | 842 | 3.71% |109| isear | 540 | 2.38% |110 111## 数据源信息112 113### Movies_Reviews114- **特点**: 电影评论情感数据115- **覆盖**: 包含7种情感类别116 117### DailyDialog118- **特点**: 真实对话数据,包含多轮对话119- **覆盖**: 包含7种情感类别120 121### GoEmotions122- **特点**: Reddit评论数据,口语化表达123- **覆盖**: 包含7种情感类别124 125### ISEAR126- **特点**: 国际情感研究数据,高质量文本127- **覆盖**: 包含7种情感类别128 129### MELD130- **特点**: 多模态情感对话数据,来自电视剧《老友记》131- **覆盖**: 包含7种情感类别132 133### mteb_emotion134- **特点**: 情感分析数据集,包含多种情感表达135- **覆盖**: 包含7种情感类别136 137### Tweet Emotions138- **特点**: Twitter推文数据,包含@mentions139- **覆盖**: 包含7种情感类别140 141## 数据质量说明142 1431. **类别不平衡**: neutral占主导(约40-51%),disgust样本最少(约2-3%)1442. **多源数据融合**: 7个数据源的文本已合并,每个样本包含`source`字段标识来源1453. **情感类别**: 统一使用7种Ekman情感类别,确保标签一致性1464. **数据分割**: 按7:2:1比例分割为训练集、验证集和测试集1475. **缺失值**: 已过滤所有缺失值,训练集、验证集和测试集均无缺失值148 149## 情感类别定义150 151- **neutral**: 中性,无情感倾向152- **joy**: 快乐,愉悦153- **sadness**: 悲伤,难过154- **anger**: 愤怒,生气155- **fear**: 恐惧,害怕156- **surprise**: 惊讶,意外157- **disgust**: 厌恶,反感158 159## 使用建议160 1611. **类别不平衡处理**: 建议使用类别权重或过采样/欠采样技术处理类别不平衡问题1622. **数据增强**: 对于样本较少的类别(如disgust),可以考虑数据增强技术1633. **多源数据融合**: 不同数据源的文本风格差异较大,建议在训练时注意数据分布1644. **评估指标**: 由于类别不平衡,建议使用F1-score、precision、recall等指标,而非仅使用准确率1655. **缺失值处理**: 训练前建议处理数据中的缺失值166 167## 文件结构168 169```170dataset_huggingface_enhance/171├── train.csv              # 合并后的训练集(186,619条)172├── val.csv                # 合并后的验证集(31,086条)173├── test.csv               # 合并后的测试集(22,721条)174├── label_list.txt         # 情感标签列表175├── info.md                # 数据集统计信息176├── README.md              # 数据集说明文档177├── stats.py               # 数据集统计脚本178└── dataset_infos.json     # Hugging Face数据集配置179```180 181## 数据格式182 183所有CSV文件包含以下列:184- `text`: 文本内容185- `label_text`: 情感标签(neutral/joy/sadness/anger/fear/surprise/disgust)186- `source`: 数据来源(如goemotions、dailydialog等)187 188---189 190*生成时间: 2026-01-07*191*数据版本: v2*192*数据源: 7个Ekman情感数据集合并*193