CoolFace
23 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01Reza2kn /visualears-persian-asr-16k 🗂️ visualears-persian-asr-16k English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Main public Persian ASR audio/text dataset: 3.93M 16 kHz rows. مجموعه‌دادهٔ اصلی و عمومی شنوا برای آموزش بازشناسی گفتار فارسی؛ شامل صوت ۱۶ کیلوهرتز، متن و فرادادهٔ منشأ در مقیاس چندمیلیونی. 🧩 Role flagship training corpus پیکرهٔ اصلی آموزش 📦 Snapshot 176 files; approximately 512.17 GB 176… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-persian-asr-16k.audio1M<n<10M1 likes555 downloads2mo agoHugging Face02Reza2kn /visualears-115m-pref350-curriculum-relabels 🗂️ visualears-115m-pref350-curriculum-relabels English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose 115M relabel/curriculum dataset. بازبرچسب‌گذاری‌ها و برنامهٔ درسی ویژهٔ مدل ۱۱۵ میلیونی با تنظیمات ترجیحی پروژه. 🧩 Role training-pipeline and curriculum asset مصنوع خط لوله و برنامهٔ درسی آموزش 📦 Snapshot 65 files; approximately 1.49 GB 65 فایل؛ حدود 1.49 GB 🧱… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-115m-pref350-curriculum-relabels.1 likes491 downloads2mo agoHugging Face03Reza2kn /visualears-hardword-sentences 🗂️ visualears-hardword-sentences English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Hard-word sentence dataset used for semantic/keyword stress cases. جمله‌های دارای واژه‌های دشوار و معنایی برای آزمون تنش واژگانی، بازیابی کلیدواژه و S³. 🧩 Role Persian text and linguistic asset مصنوع متنی و زبانی فارسی 📦 Snapshot 266 files; approximately 39.23 GB 266 فایل؛ حدود 39.23… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-hardword-sentences.audio100K<n<1M2 likes344 downloads2mo agoHugging Face04Reza2kn /visualears-bench-results 🗂️ visualears-bench-results English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Benchmark result dataset and leaderboard artifacts. داده‌ها و مصنوعات نتایج بنچمارک برای نگه‌داری خروجی مدل‌ها، امتیازها و منشأ اجرای ارزیابی. 🧩 Role evaluation and benchmarking asset مصنوع ارزیابی و بنچمارک 📦 Snapshot 4 files; approximately 51.61 KB 4 فایل؛ حدود 51.61 KB 🧱 Packaging 0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-bench-results.tabularn<1K0 likes243 downloads3d agoHugging Face05Reza2kn /visualears-golden-6669 🗂️ visualears-golden-6669 English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Held-out VisualEars6669 / Golden6669 evaluation dataset. مجموعهٔ ارزیابی نگه‌داشته‌شدهٔ Golden6669 با شرایط پاک، دورمیدان و مسدود برای سنجش واقع‌گرایانهٔ ASR فارسی. 🧩 Role evaluation and benchmarking asset مصنوع ارزیابی و بنچمارک 📦 Snapshot 13 files; approximately 916.66 MB 13 فایل؛ حدود… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-golden-6669.audioautomatic-speech-recognition1K<n<10K1 likes206 downloads2mo agoHugging Face06Reza2kn /visualears-al-32mv2-audio 🗂️ visualears-al-32mv2-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose 32M v2 active-learning audio dataset. نسخهٔ دوم صف یادگیری فعال مدل ۳۲ میلیونی با انتخاب‌های به‌روز‌شده. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 3,004 files; approximately 443.66 MB 3,004 فایل؛ حدود 443.66 MB 🧱 Packaging 0 Parquet… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-32mv2-audio.audio1K<n<10K1 likes191 downloads2mo agoHugging Face07Reza2kn /visualears-al-114m-audio 🗂️ visualears-al-114m-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose 114M active-learning audio dataset. نمونه‌های صوتی یادگیری فعال انتخاب‌شده با مدل ۱۱۴ میلیونی شنوا. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 3,004 files; approximately 504.53 MB 3,004 فایل؛ حدود 504.53 MB 🧱 Packaging 0 Parquet files and… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-114m-audio.audio1K<n<10K1 likes132 downloads2mo agoHugging Face08Reza2kn /visualears-al-32m-audio 🗂️ visualears-al-32m-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose 32M active-learning audio dataset. نمونه‌های صوتی یادگیری فعال انتخاب‌شده با مدل ۳۲ میلیونی شنوا. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 3,004 files; approximately 447.99 MB 3,004 فایل؛ حدود 447.99 MB 🧱 Packaging 0 Parquet files and 3… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-32m-audio.audio1K<n<10K1 likes124 downloads2mo agoHugging Face09Reza2kn /visualears-al-phaseB2-audio 🗂️ visualears-al-phaseB2-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Phase B2 active-learning audio dataset. صف صوتی یادگیری فعال فاز B2 برای بازبینی، اصلاح و ادامهٔ آموزش هدفمند. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 4,528 files; approximately 173.42 MB 4,528 فایل؛ حدود 173.42 MB 🧱 Packaging 0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-al-phaseB2-audio.audio1K<n<10K1 likes118 downloads2mo agoHugging Face10Reza2kn /visualears-uncertain-review-audio 🗂️ visualears-uncertain-review-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Uncertain-review active-learning audio queue. صف بازبینی نمونه‌های نامطمئن برای تشخیص خطا، اصلاح برچسب و جلوگیری از ورود دادهٔ کم‌اعتماد. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 348 files; approximately 35.98 MB 348 فایل؛ حدود… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-uncertain-review-audio.0 likes90 downloads2mo agoHugging Face11Reza2kn /visualears-nonpersian-review-audio 🗂️ visualears-nonpersian-review-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Non-Persian review/filtering audio dataset. صف کنترل زبان برای شناسایی و جداسازی صوت‌های غیرفارسی یا مشکوک. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 528 files; approximately 31.70 MB 528 فایل؛ حدود 31.70 MB 🧱 Packaging 0… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-nonpersian-review-audio.0 likes73 downloads2mo agoHugging Face12Reza2kn /visualears-cutverify-audio 🗂️ visualears-cutverify-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Cut verification audio dataset. نمونه‌های صوتی ویژهٔ کنترل مرز برش، کامل‌بودن گفتار و هم‌ترازی قطعه با متن. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 603 files; approximately 35.82 MB 603 فایل؛ حدود 35.82 MB 🧱 Packaging 0 Parquet files… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-cutverify-audio.0 likes67 downloads2mo agoHugging Face13Reza2kn /visualears-pseudo-clean-train 🗂️ visualears-pseudo-clean-train English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Pseudo-clean training dataset used in the de-poisoning/data pipeline. بخش آموزشی شبه‌پاک که برای کاهش آلودگی برچسب‌ها و مقاوم‌تر کردن آموزش استفاده شده است. 🧩 Role training-pipeline and curriculum asset مصنوع خط لوله و برنامهٔ درسی آموزش 📦 Snapshot 4 files; approximately 722.78 MB 4… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-pseudo-clean-train.text1M<n<10M1 likes66 downloads2mo agoHugging Face14Reza2kn /visualears-persian-pseudo-asraudio1M<n<10M0 likes60 downloads3mo agoHugging Face15Reza2kn /visualears-benchmark-269-gold 🗂️ visualears-benchmark-269-gold English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose 269-record gold/noisy benchmark dataset. معیار طلایی ۲۶۹ نمونه‌ای برای بررسی سریع خطاهای گفتار نویزی و مقایسهٔ نسخه‌های مدل. 🧩 Role evaluation and benchmarking asset مصنوع ارزیابی و بنچمارک 📦 Snapshot 276 files; approximately 44.35 MB 276 فایل؛ حدود 44.35 MB 🧱 Packaging 1 Parquet… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-benchmark-269-gold.audioautomatic-speech-recognitionn<1K1 likes59 downloads2mo agoHugging Face16Reza2kn /visualears-active-learning-669-audio 🗂️ visualears-active-learning-669-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Active-learning correction audio dataset. صوت‌های انتخاب‌شده برای اصلاح فعال؛ مناسب بازبینی انسانی و افزودن نمونه‌های آموزنده به چرخهٔ آموزش. 🧩 Role active-learning and human-review asset مصنوع یادگیری فعال و بازبینی انسانی 📦 Snapshot 671 files; approximately 11.13 MB 671 فایل؛… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-active-learning-669-audio.1 likes59 downloads2mo agoHugging Face17Reza2kn /visualears-telephooney-calibration-audio 🗂️ visualears-telephooney-calibration-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Telephooney calibration audio dataset. دادهٔ کالیبراسیون گفتار تلفنی برای تشخیص کانال باریک‌باند و شرایط مخابراتی. 🧩 Role quality calibration and data-selection asset مصنوع کالیبراسیون کیفیت و انتخاب داده 📦 Snapshot 172 files; approximately 20.50 MB 172 فایل؛ حدود 20.50 MB… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-telephooney-calibration-audio.0 likes57 downloads2mo agoHugging Face18Reza2kn /visualears-full-pipeline-state 🗂️ visualears-full-pipeline-state English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Full pipeline state and curriculum data for Phase A/B. آرشیو وضعیت کامل خط لوله، برنامهٔ درسی و مصنوعات میانی فازهای A و B برای بازتولید مسیر آموزش. 🧩 Role training-pipeline and curriculum asset مصنوع خط لوله و برنامهٔ درسی آموزش 📦 Snapshot 72 files; approximately 6.28 GB 72 فایل؛… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-full-pipeline-state.1 likes41 downloads2mo agoHugging Face19Reza2kn /visualears-gold-32ktext10K<n<100K0 likes31 downloads3mo agoHugging Face20Reza2kn /visualears-crap-calibration-audio 🗂️ visualears-crap-calibration-audio English + فارسی · Part of Shenava 1.0 · Project hub · SLT paper submission 🌟 At a glance | معرفی سریع English فارسی 🎯 Purpose Data-quality / crap-detector calibration audio dataset. دادهٔ کالیبراسیون کیفیت برای آموزش و ارزیابی آشکارساز نمونه‌های خراب یا نامناسب. 🧩 Role quality calibration and data-selection asset مصنوع کالیبراسیون کیفیت و انتخاب داده 📦 Snapshot 183 files; approximately 10.44 MB 183 فایل؛… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-crap-calibration-audio.1 likes29 downloads2mo agoHugging Face21Reza2kn /visualears-corpus-transfer0 likes22 downloads3mo agoHugging Face22Reza2kn /visualears-fa-train-audio-16k VisualEars 115M FA training audio (16kHz mono FLAC) 3362186 clips packed into 89 tar shards (~5GB each), + NeMo manifests. Fast download + extract on a new cluster pip install -U huggingface_hub hf download Reza2kn/visualears-fa-train-audio-16k --repo-type dataset --local-dir DATA # add: --token $HF_TOKEN if private cd DATA && for t in audio/shard_*.tar; do tar xf "$t"; done # reconstructs pseudo_audio/, gold_*_audio/ Manifests in manifests/ use paths… See the full description on the dataset page: https://huggingface.co/datasets/Reza2kn/visualears-fa-train-audio-16k.text1M<n<10M0 likes16 downloads3mo agoHugging Face23Reza2kn /stallion-backup-visualears-onnx-quant-202607130 likes3 downloads2mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.