CoolFace
Datasetpublic

Pranavz/emilia-en-mimi-q8-s4096-smoke-20260326e

emilia-en-mimi-q8-s4096-smoke-20260326e Frozen pretokenized Emilia-English model-ready dataset for TinyAya + Mimi training. Layout train/lang=en/*.parquet optional validation/lang=en/*.parquet optional test/lang=en/*.parquet dataset_manifest.json Selection source dataset: amphion/Emilia-Dataset data files: Emilia/EN/EN-B000000.tar source split: train quantizers: 8 train samples: 8 validation samples: 0 test samples: 0 min seconds: 1.0 max… See the full description on the dataset page: https://huggingface.co/datasets/Pranavz/emilia-en-mimi-q8-s4096-smoke-20260326e.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes7downloads
Dataset Card

emilia-en-mimi-q8-s4096-smoke-20260326e

Frozen pretokenized Emilia-English model-ready dataset for TinyAya + Mimi training.

Layout

  • —train/lang=en/*.parquet
  • —optional validation/lang=en/*.parquet
  • —optional test/lang=en/*.parquet
  • —dataset_manifest.json

Selection

  • —source dataset: amphion/Emilia-Dataset
  • —data files: Emilia/EN/EN-B000000.tar
  • —source split: train
  • —quantizers: 8
  • —train samples: 8
  • —validation samples: 0
  • —test samples: 0
  • —min seconds: 1.0
  • —max seconds: 30.0

Audio Codec

  • —backend: mimi
  • —source: hf_pretrained
  • —model: kyutai/mimi
  • —sample rate: 24000

Notes

This repo stores pretokenized training artifacts, not raw audio. Use dataset_manifest.json as the immutable split fingerprint for ablation reproducibility.