TTS-AGI/balanced-emotion-dataset-majestrino-withtemporal-detailed-captions
Balanced Emotion Dataset — Majestrino with Temporal Detailed Captions An emotion-balanced subset of TTS-AGI/majestrino-unified-detailed-captions-temporal. Overview Total samples: 482,594 Samples per emotion category: 12,997 Number of emotion categories: 40 Format: WebDataset (tar files with FLAC audio + JSON metadata) Number of tar files: 483 Samples per tar: ~1000 Balancing Strategy Samples were selected from the source dataset using keyword… See the full description on the dataset page: https://huggingface.co/datasets/TTS-AGI/balanced-emotion-dataset-majestrino-withtemporal-detailed-captions.
Balanced Emotion Dataset — Majestrino with Temporal Detailed Captions
An emotion-balanced subset of TTS-AGI/majestrino-unified-detailed-captions-temporal.
Overview
- Total samples: 482,594
- Samples per emotion category: 12,997
- Number of emotion categories: 40
- Format: WebDataset (tar files with FLAC audio + JSON metadata)
- Number of tar files: 483
- Samples per tar: ~1000
Balancing Strategy
Samples were selected from the source dataset using keyword matching on captions. Each of the 40 emotion categories has exactly 12,997 samples, balanced by the rarest category (Intoxication/Altered States). Samples are spread across diverse source shards for maximum variety. Some samples (~7.3%) appear in multiple categories due to multi-emotion captions.
Emotion Categories
Data Format
Each tar file contains paired .flac and .json files:
- FLAC: Audio recording
- JSON: Metadata including
caption(unified detailed caption with temporal aspects),transcription,duration,characters_per_second, quality scores, and emotion scores
Usage
import webdataset as wds
dataset = wds.WebDataset("data/{00000..00482}.tar")
for sample in dataset:
audio = sample["flac"] # FLAC bytes
meta = json.loads(sample["json"])
caption = meta["caption"]Source
Built from TTS-AGI/majestrino-unified-detailed-captions-temporal using emotion keyword matching across all 821 training shards.
