Pranavz/emilia-en-mimi-q8-s4096-smoke-20260326e
emilia-en-mimi-q8-s4096-smoke-20260326e Frozen pretokenized Emilia-English model-ready dataset for TinyAya + Mimi training. Layout train/lang=en/*.parquet optional validation/lang=en/*.parquet optional test/lang=en/*.parquet dataset_manifest.json Selection source dataset: amphion/Emilia-Dataset data files: Emilia/EN/EN-B000000.tar source split: train quantizers: 8 train samples: 8 validation samples: 0 test samples: 0 min seconds: 1.0 max… See the full description on the dataset page: https://huggingface.co/datasets/Pranavz/emilia-en-mimi-q8-s4096-smoke-20260326e.
emilia-en-mimi-q8-s4096-smoke-20260326e
Frozen pretokenized Emilia-English model-ready dataset for TinyAya + Mimi training.
Layout
train/lang=en/*.parquet- optional
validation/lang=en/*.parquet - optional
test/lang=en/*.parquet dataset_manifest.json
Selection
- source dataset:
amphion/Emilia-Dataset - data files:
Emilia/EN/EN-B000000.tar - source split:
train - quantizers:
8 - train samples:
8 - validation samples:
0 - test samples:
0 - min seconds:
1.0 - max seconds:
30.0
Audio Codec
- backend:
mimi - source:
hf_pretrained - model:
kyutai/mimi - sample rate:
24000
Notes
This repo stores pretokenized training artifacts, not raw audio. Use dataset_manifest.json as the immutable split fingerprint for ablation reproducibility.
