visualears
visualears-fastconformer-fa-full-abvisualears-fastconformer-fa-depoisoned-phaseB-streaming-litert-rnntvisualears-fastconformer-fa-69m-256x40-warmstartvisualears-fastconformer-fa-full-ab-fp8visualears-fastconformer-fa-full-ab-litert-fp16visualears-fastconformer-fa-full-ab-fp16visualears-fastconformer-fa-full-ab-qat-w2-materializedvisualears-fastconformer-fa-depoisoned-phaseB-streaming-coreml-fp16
visualears-persian-asr-16k
🗂️ visualears-persian-asr-16k
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Main public Persian ASR audio/text dataset: 3.93M 16 kHz rows.
مجموعهدادهٔ اصلی و عمومی شنوا برای آموزش بازشناسی گفتار فارسی؛ شامل صوت ۱۶ کیلوهرتز، متن و فرادادهٔ منشأ در مقیاس چندمیلیونی.
🧩 Role
flagship training corpus
پیکرهٔ اصلی آموزش
📦 Snapshot
176 files; approximately 512.17 GB
176… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-persian-asr-16k.visualears-115m-pref350-curriculum-relabels
🗂️ visualears-115m-pref350-curriculum-relabels
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
115M relabel/curriculum dataset.
بازبرچسبگذاریها و برنامهٔ درسی ویژهٔ مدل ۱۱۵ میلیونی با تنظیمات ترجیحی پروژه.
🧩 Role
training-pipeline and curriculum asset
مصنوع خط لوله و برنامهٔ درسی آموزش
📦 Snapshot
65 files; approximately 1.49 GB
65 فایل؛ حدود 1.49 GB
🧱… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-115m-pref350-curriculum-relabels.visualears-hardword-sentences
🗂️ visualears-hardword-sentences
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Hard-word sentence dataset used for semantic/keyword stress cases.
جملههای دارای واژههای دشوار و معنایی برای آزمون تنش واژگانی، بازیابی کلیدواژه و S³.
🧩 Role
Persian text and linguistic asset
مصنوع متنی و زبانی فارسی
📦 Snapshot
266 files; approximately 39.23 GB
266 فایل؛ حدود 39.23… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-hardword-sentences.visualears-bench-results
🗂️ visualears-bench-results
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Benchmark result dataset and leaderboard artifacts.
دادهها و مصنوعات نتایج بنچمارک برای نگهداری خروجی مدلها، امتیازها و منشأ اجرای ارزیابی.
🧩 Role
evaluation and benchmarking asset
مصنوع ارزیابی و بنچمارک
📦 Snapshot
4 files; approximately 51.61 KB
4 فایل؛ حدود 51.61 KB
🧱 Packaging
0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-bench-results.visualears-golden-6669
🗂️ visualears-golden-6669
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
Held-out VisualEars6669 / Golden6669 evaluation dataset.
مجموعهٔ ارزیابی نگهداشتهشدهٔ Golden6669 با شرایط پاک، دورمیدان و مسدود برای سنجش واقعگرایانهٔ ASR فارسی.
🧩 Role
evaluation and benchmarking asset
مصنوع ارزیابی و بنچمارک
📦 Snapshot
13 files; approximately 916.66 MB
13 فایل؛ حدود… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-golden-6669.visualears-al-32mv2-audio
🗂️ visualears-al-32mv2-audio
English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission
🌟 At a glance | معرفی سریع
English
فارسی
🎯 Purpose
32M v2 active-learning audio dataset.
نسخهٔ دوم صف یادگیری فعال مدل ۳۲ میلیونی با انتخابهای بهروزشده.
🧩 Role
active-learning and human-review asset
مصنوع یادگیری فعال و بازبینی انسانی
📦 Snapshot
3,004 files; approximately 443.66 MB
3,004 فایل؛ حدود 443.66 MB
🧱 Packaging
0 Parquet… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-32mv2-audio.
