Peacockery/farsi-asr-wer35-fastconformer
Farsi ASR WER35 FastConformer This dataset contains Farsi/Farsi ASR utterances curated with NVIDIA NeMo Curator using nvidia/stt_fa_fastconformer_hybrid_large. The uploaded training data is stored as WebDataset TAR shards because Hugging Face recommends WebDataset archives for large-scale audio datasets. The local artifact also includes a NeMo ASR manifest at manifests/train_manifest.jsonl. Curation Language: Farsi/Farsi (fa) Audio: FLAC, 16 kHz mono Source run:… See the full description on the dataset page: https://huggingface.co/datasets/Peacockery/farsi-asr-wer35-fastconformer.
Farsi ASR WER35 FastConformer
This dataset contains Farsi/Farsi ASR utterances curated with NVIDIA NeMo Curator using nvidia/stt_fa_fastconformer_hybrid_large.
The uploaded training data is stored as WebDataset TAR shards because Hugging Face recommends WebDataset archives for large-scale audio datasets. The local artifact also includes a NeMo ASR manifest at manifests/train_manifest.jsonl.
Curation
- Language: Farsi/Farsi (
fa) - Audio: FLAC, 16 kHz mono
- Source run:
full-p018-dataset-fa - Candidate rows before Curator filtering: 508,518
- Kept rows: 416,056
- Kept hours: 500.51
- WER model:
nvidia/stt_fa_fastconformer_hybrid_large - WER threshold:
<= 35 - Duration range:
1.0 <= duration <= 20.0seconds - Mean WER after filtering: 5.1240
Source Counts
{
"common_voice_17_0": 389393,
"thomcles_farsi_farsi_speech": 24407,
"fleurs": 2256
}Files
webdataset/train-*.tar: audio and per-sample JSON metadata, WebDataset formatmanifests/train_manifest.jsonl: NeMo ASR manifest for local fine-tuningmetadata/metadata.jsonl: compact row metadata for auditingmetadata/metadata.parquet: Parquet copy of row metadata for analysissummary.json: counts, thresholds, provenance, shard checksums
Verification
This artifact was built from NeMo Curator output and checked for:
- exactly 416,056 unique
sample_idvalues - every referenced FLAC exists locally while building
- every row has
wer <= 35 - every row has
1.0 <= duration <= 20.0 - source counts and total hours written to
summary.json
References
- Hugging Face audio dataset layout and WebDataset guidance: https://huggingface.co/docs/hub/en/datasets-audio
- Hugging Face audio dataset creation guide: https://huggingface.co/docs/datasets/audio_dataset
- NVIDIA NeMo ASR manifest format: https://docs.nvidia.com/nemo-framework/user-guide/latest/nemotoolkit/asr/datasets.html
- NVIDIA model used for WER scoring: https://huggingface.co/nvidia/sttfafastconformerhybridlarge
