anuj-inavlabs/kupe-asr-en-data
kupe-asr-en-mini-150m — data Two loadable configs, packed into ~20-25 bunch_*.parquet files each (Hub-quota friendly): raw — 24 kHz mono English audio (flac bytes) + text. The encode stage reads this. mimi — Mimi c0..c7 codes (12.5 Hz) + text. Training reads this. Ledgers under ledger/ (data.json, mimi.json) track collected/encoded hours and resume state. from datasets import load_dataset ds = load_dataset("anuj-inavlabs/kupe-asr-en-data", "mimi", split="train")
fc-encode: update fc ledger
fc: bunch_00059.parquet
fc: bunch_00058.parquet
fc: bunch_00057.parquet
fc: bunch_00056.parquet
fc: bunch_00055.parquet
fc: bunch_00054.parquet
fc: bunch_00053.parquet
fc: bunch_00052.parquet
fc: bunch_00051.parquet
fc: bunch_00050.parquet
fc: bunch_00049.parquet
fc: bunch_00048.parquet
fc: bunch_00047.parquet
fc: bunch_00046.parquet
fc: bunch_00045.parquet
fc: bunch_00044.parquet
fc: bunch_00043.parquet
fc: bunch_00042.parquet
fc: bunch_00041.parquet
fc: bunch_00040.parquet
fc: bunch_00039.parquet
fc: bunch_00038.parquet
fc: bunch_00037.parquet
fc: bunch_00036.parquet
fc: bunch_00035.parquet
fc: bunch_00034.parquet
fc: bunch_00033.parquet
fc: bunch_00032.parquet
fc: bunch_00031.parquet
fc: bunch_00030.parquet
fc: bunch_00029.parquet
fc: bunch_00028.parquet
fc: bunch_00027.parquet
fc: bunch_00026.parquet
fc: bunch_00025.parquet
fc: bunch_00024.parquet
fc: bunch_00023.parquet
fc: bunch_00022.parquet
fc: bunch_00021.parquet
fc: bunch_00020.parquet
fc: bunch_00019.parquet
fc: bunch_00018.parquet
fc: bunch_00017.parquet
fc: bunch_00016.parquet
fc: bunch_00015.parquet
fc: bunch_00016.parquet
fc: bunch_00015.parquet
fc: bunch_00014.parquet
fc: bunch_00013.parquet
