CoolFace
Datasetpublic

Peacockery/farsi-asr-wer35-fastconformer

Farsi ASR WER35 FastConformer This dataset contains Farsi/Farsi ASR utterances curated with NVIDIA NeMo Curator using nvidia/stt_fa_fastconformer_hybrid_large. The uploaded training data is stored as WebDataset TAR shards because Hugging Face recommends WebDataset archives for large-scale audio datasets. The local artifact also includes a NeMo ASR manifest at manifests/train_manifest.jsonl. Curation Language: Farsi/Farsi (fa) Audio: FLAC, 16 kHz mono Source run:… See the full description on the dataset page: https://huggingface.co/datasets/Peacockery/farsi-asr-wer35-fastconformer.

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes5downloads
Dataset Card

Farsi ASR WER35 FastConformer

This dataset contains Farsi/Farsi ASR utterances curated with NVIDIA NeMo Curator using nvidia/stt_fa_fastconformer_hybrid_large.

The uploaded training data is stored as WebDataset TAR shards because Hugging Face recommends WebDataset archives for large-scale audio datasets. The local artifact also includes a NeMo ASR manifest at manifests/train_manifest.jsonl.

Curation

  • —Language: Farsi/Farsi (fa)
  • —Audio: FLAC, 16 kHz mono
  • —Source run: full-p018-dataset-fa
  • —Candidate rows before Curator filtering: 508,518
  • —Kept rows: 416,056
  • —Kept hours: 500.51
  • —WER model: nvidia/stt_fa_fastconformer_hybrid_large
  • —WER threshold: <= 35
  • —Duration range: 1.0 <= duration <= 20.0 seconds
  • —Mean WER after filtering: 5.1240

Source Counts

json
{
  "common_voice_17_0": 389393,
  "thomcles_farsi_farsi_speech": 24407,
  "fleurs": 2256
}

Files

  • —webdataset/train-*.tar: audio and per-sample JSON metadata, WebDataset format
  • —manifests/train_manifest.jsonl: NeMo ASR manifest for local fine-tuning
  • —metadata/metadata.jsonl: compact row metadata for auditing
  • —metadata/metadata.parquet: Parquet copy of row metadata for analysis
  • —summary.json: counts, thresholds, provenance, shard checksums

Verification

This artifact was built from NeMo Curator output and checked for:

  • —exactly 416,056 unique sample_id values
  • —every referenced FLAC exists locally while building
  • —every row has wer <= 35
  • —every row has 1.0 <= duration <= 20.0
  • —source counts and total hours written to summary.json

References

  • —Hugging Face audio dataset layout and WebDataset guidance: https://huggingface.co/docs/hub/en/datasets-audio
  • —Hugging Face audio dataset creation guide: https://huggingface.co/docs/datasets/audio_dataset
  • —NVIDIA NeMo ASR manifest format: https://docs.nvidia.com/nemo-framework/user-guide/latest/nemotoolkit/asr/datasets.html
  • —NVIDIA model used for WER scoring: https://huggingface.co/nvidia/sttfafastconformerhybridlarge