niloy629/s2m-bang
s2m-bang Bangla Stage-1 speech→transcript dataset used for speech-to-LLM adapter training (Moonshine-BN encoder + LLM adapter). Splits Manifest n Role manifests/train.json 89,275 Train (Kathbath + CV/OpenSLR short + FLEURS train) manifests/dev.json 2,638 Dev manifests/dev_fast.json 256 Fast mid-train gate manifests/fleurs_test.json 920 Held-out FLEURS test manifests/cv_bn_eval.json 260 Held-out Common Voice eval Schema Each… See the full description on the dataset page: https://huggingface.co/datasets/niloy629/s2m-bang.
s2m-bang
Bangla Stage-1 speech→transcript dataset used for speech-to-LLM adapter training (Moonshine-BN encoder + LLM adapter).
Splits
Schema
Each JSON row:
{
"video_id": "kathbath_train-00000-of-00022_000000",
"start": 0.0,
"end": 6.57,
"dur": 6.57,
"text": "...",
"src": "kathbath",
"wav_dir": "audio/kathbath_bn"
}WAV path = {wav_dir}/{video_id}.wav (16 kHz mono).
Sources
- Kathbath Bengali
- Common Voice / OpenSLR short utterances
- FLEURS Bengali
Note
CV eval IDs are excluded from train. FLEURS test is never in train/dev.
