datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
celestial-comprehensive-dataset-v2
CELESTIAL Comprehensive Spiritual AI Dataset v2.0
🌟 Overview
The most comprehensive dataset for training spiritual AI assistants, featuring 9,000+ high-quality examples across all major spiritual and astrological domains.
📊 Dataset Statistics
Total Examples: 9,000
Training Split: 7,200 examples
Validation Split: 900 examples
Test Split: 900 examples
Categories: 4 categories
Languages: English, Hindi (transliterated)
🎯 Categories Included… See the full description on the dataset page: https://huggingface.co/datasets/Amvhunt/celestial-comprehensive-dataset-v2.cmmc-training-comprehensive
CMMC Training Dataset - Comprehensive Variant
Dataset Description
This is the Comprehensive variant of the CMMC (Cybersecurity Maturity Model Certification) training dataset, containing 11,279 high-quality training examples from the complete NIST CMMC publication library.
Dataset Characteristics
Total Examples: 11,279 (9,023 train / 2,256 validation)
Source Documents: 381 NIST publications
CMMC Levels Covered: Level 1, Level 2, Level 3
CMMC Domains: All 17… See the full description on the dataset page: https://huggingface.co/datasets/ethanolivertroy/cmmc-training-comprehensive.kz-rus-articles-comprehensive
🇰🇿🇷🇺 Kazakh-Russian Articles Comprehensive Dataset
A high-quality bilingual corpus for cross-lingual NLP research
📋 Dataset Overview
The Kazakh-Russian Articles Comprehensive Dataset is a meticulously curated bilingual corpus designed to advance natural language processing research for Kazakh and Russian languages. This dataset addresses the critical need for high-quality parallel and comparable text resources in Central Asian language pairs, particularly… See the full description on the dataset page: https://huggingface.co/datasets/Adilbai/kz-rus-articles-comprehensive.celestial-comprehensive-dataset-v2
CELESTIAL Comprehensive Spiritual AI Dataset v2.0
🌟 Overview
The most comprehensive dataset for training spiritual AI assistants, featuring 9,000+ high-quality examples across all major spiritual and astrological domains.
📊 Dataset Statistics
Total Examples: 9,000
Training Split: 7,200 examples
Validation Split: 900 examples
Test Split: 900 examples
Categories: 4 categories
Languages: English, Hindi (transliterated)
🎯 Categories Included… See the full description on the dataset page: https://huggingface.co/datasets/dp1812/celestial-comprehensive-dataset-v2.
