datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
visualears-persian-asr-16k
🗂️ visualears-persian-asr-16k
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Main public Persian ASR audio/text dataset: 3.93M 16 kHz rows.
مجموعهدادهٔ اصلی و عمومی شنوا برای آموزش بازشناسی گفتار فارسی؛ شامل صوت ۱۶ کیلوهرتز، متن و فرادادهٔ منشأ در مقیاس چندمیلیونی.
🧩 Role
flagship training corpus
پیکرهٔ اصلی آموزش
📦 Snapshot
176 files; approximately 512.17 GB
176… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-persian-asr-16k.visualears-115m-pref350-curriculum-relabels
🗂️ visualears-115m-pref350-curriculum-relabels
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
115M relabel/curriculum dataset.
بازبرچسبگذاریها و برنامهٔ درسی ویژهٔ مدل ۱۱۵ میلیونی با تنظیمات ترجیحی پروژه.
🧩 Role
training-pipeline and curriculum asset
مصنوع خط لوله و برنامهٔ درسی آموزش
📦 Snapshot
65 files; approximately 1.49 GB
65 فایل؛ حدود 1.49 GB
🧱… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-115m-pref350-curriculum-relabels.visualears-hardword-sentences
🗂️ visualears-hardword-sentences
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Hard-word sentence dataset used for semantic/keyword stress cases.
جملههای دارای واژههای دشوار و معنایی برای آزمون تنش واژگانی، بازیابی کلیدواژه و S³.
🧩 Role
Persian text and linguistic asset
مصنوع متنی و زبانی فارسی
📦 Snapshot
266 files; approximately 39.23 GB
266 فایل؛ حدود 39.23… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-hardword-sentences.visualears-bench-results
🗂️ visualears-bench-results
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Benchmark result dataset and leaderboard artifacts.
دادهها و مصنوعات نتایج بنچمارک برای نگهداری خروجی مدلها، امتیازها و منشأ اجرای ارزیابی.
🧩 Role
evaluation and benchmarking asset
مصنوع ارزیابی و بنچمارک
📦 Snapshot
4 files; approximately 51.61 KB
4 فایل؛ حدود 51.61 KB
🧱 Packaging
0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-bench-results.visualears-golden-6669
🗂️ visualears-golden-6669
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Held-out VisualEars6669 / Golden6669 evaluation dataset.
مجموعهٔ ارزیابی نگهداشتهشدهٔ Golden6669 با شرایط پاک، دورمیدان و مسدود برای سنجش واقعگرایانهٔ ASR فارسی.
🧩 Role
evaluation and benchmarking asset
مصنوع ارزیابی و بنچمارک
📦 Snapshot
13 files; approximately 916.66 MB
13 فایل؛ حدود… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-golden-6669.visualears-al-32mv2-audio
🗂️ visualears-al-32mv2-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
32M v2 active-learning audio dataset.
نسخهٔ دوم صف یادگیری فعال مدل ۳۲ میلیونی با انتخابهای بهروزشده.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
3,004 files; approximately 443.66 MB
3,004 فایل؛ حدود 443.66 MB
🧱 Packaging
0 Parquet… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-32mv2-audio.visualears-al-114m-audio
🗂️ visualears-al-114m-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
114M active-learning audio dataset.
نمونههای صوتی یادگیری فعال انتخابشده با مدل ۱۱۴ میلیونی شنوا.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
3,004 files; approximately 504.53 MB
3,004 فایل؛ حدود 504.53 MB
🧱 Packaging
0 Parquet files and… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-114m-audio.visualears-al-32m-audio
🗂️ visualears-al-32m-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
32M active-learning audio dataset.
نمونههای صوتی یادگیری فعال انتخابشده با مدل ۳۲ میلیونی شنوا.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
3,004 files; approximately 447.99 MB
3,004 فایل؛ حدود 447.99 MB
🧱 Packaging
0 Parquet files and 3… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-32m-audio.visualears-al-phaseB2-audio
🗂️ visualears-al-phaseB2-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Phase B2 active-learning audio dataset.
صف صوتی یادگیری فعال فاز B2 برای بازبینی، اصلاح و ادامهٔ آموزش هدفمند.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
4,528 files; approximately 173.42 MB
4,528 فایل؛ حدود 173.42 MB
🧱 Packaging
0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-phaseB2-audio.visualears-uncertain-review-audio
🗂️ visualears-uncertain-review-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Uncertain-review active-learning audio queue.
صف بازبینی نمونههای نامطمئن برای تشخیص خطا، اصلاح برچسب و جلوگیری از ورود دادهٔ کماعتماد.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
348 files; approximately 35.98 MB
348 فایل؛ حدود… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-uncertain-review-audio.visualears-nonpersian-review-audio
🗂️ visualears-nonpersian-review-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Non-Persian review/filtering audio dataset.
صف کنترل زبان برای شناسایی و جداسازی صوتهای غیرفارسی یا مشکوک.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
528 files; approximately 31.70 MB
528 فایل؛ حدود 31.70 MB
🧱 Packaging
0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-nonpersian-review-audio.visualears-cutverify-audio
🗂️ visualears-cutverify-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Cut verification audio dataset.
نمونههای صوتی ویژهٔ کنترل مرز برش، کاملبودن گفتار و همترازی قطعه با متن.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
603 files; approximately 35.82 MB
603 فایل؛ حدود 35.82 MB
🧱 Packaging
0 Parquet files… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-cutverify-audio.visualears-pseudo-clean-train
🗂️ visualears-pseudo-clean-train
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Pseudo-clean training dataset used in the de-poisoning/data pipeline.
بخش آموزشی شبهپاک که برای کاهش آلودگی برچسبها و مقاومتر کردن آموزش استفاده شده است.
🧩 Role
training-pipeline and curriculum asset
مصنوع خط لوله و برنامهٔ درسی آموزش
📦 Snapshot
4 files; approximately 722.78 MB
4… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-pseudo-clean-train.visualears-persian-pseudo-asrvisualears-benchmark-269-gold
🗂️ visualears-benchmark-269-gold
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
269-record gold/noisy benchmark dataset.
معیار طلایی ۲۶۹ نمونهای برای بررسی سریع خطاهای گفتار نویزی و مقایسهٔ نسخههای مدل.
🧩 Role
evaluation and benchmarking asset
مصنوع ارزیابی و بنچمارک
📦 Snapshot
276 files; approximately 44.35 MB
276 فایل؛ حدود 44.35 MB
🧱 Packaging
1 Parquet… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-benchmark-269-gold.visualears-active-learning-669-audio
🗂️ visualears-active-learning-669-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Active-learning correction audio dataset.
صوتهای انتخابشده برای اصلاح فعال؛ مناسب بازبینی انسانی و افزودن نمونههای آموزنده به چرخهٔ آموزش.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
671 files; approximately 11.13 MB
671 فایل؛… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-active-learning-669-audio.visualears-telephooney-calibration-audio
🗂️ visualears-telephooney-calibration-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Telephooney calibration audio dataset.
دادهٔ کالیبراسیون گفتار تلفنی برای تشخیص کانال باریکباند و شرایط مخابراتی.
🧩 Role
quality calibration and data-selection asset
مصنوع کالیبراسیون کیفیت و انتخاب داده
📦 Snapshot
172 files; approximately 20.50 MB
172 فایل؛ حدود 20.50 MB… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-telephooney-calibration-audio.visualears-full-pipeline-state
🗂️ visualears-full-pipeline-state
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Full pipeline state and curriculum data for Phase A/B.
آرشیو وضعیت کامل خط لوله، برنامهٔ درسی و مصنوعات میانی فازهای A و B برای بازتولید مسیر آموزش.
🧩 Role
training-pipeline and curriculum asset
مصنوع خط لوله و برنامهٔ درسی آموزش
📦 Snapshot
72 files; approximately 6.28 GB
72 فایل؛… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-full-pipeline-state.visualears-gold-32kvisualears-crap-calibration-audio
🗂️ visualears-crap-calibration-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Data-quality / crap-detector calibration audio dataset.
دادهٔ کالیبراسیون کیفیت برای آموزش و ارزیابی آشکارساز نمونههای خراب یا نامناسب.
🧩 Role
quality calibration and data-selection asset
مصنوع کالیبراسیون کیفیت و انتخاب داده
📦 Snapshot
183 files; approximately 10.44 MB
183 فایل؛… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-crap-calibration-audio.visualears-corpus-transfervisualears-fa-train-audio-16k
VisualEars 115M FA training audio (16kHz mono FLAC)
3362186 clips packed into 89 tar shards (~5GB each), + NeMo manifests.
Fast download + extract on a new cluster
pip install -U huggingface_hub
hf download Reza2kn/visualears-fa-train-audio-16k --repo-type dataset --local-dir DATA # add: --token $HF_TOKEN if private
cd DATA && for t in audio/shard_*.tar; do tar xf "$t"; done # reconstructs pseudo_audio/, gold_*_audio/
Manifests in manifests/ use paths… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-fa-train-audio-16k.stallion-backup-visualears-onnx-quant-20260713
