toolevalxm/MySuperDataset-TestRepo
MySuperDataset 1. Introduction MySuperDataset is a comprehensive multi-domain text corpus designed for training and evaluating language models. This dataset has been carefully curated through multiple iterations to ensure high quality, diversity, and representativeness across various domains including science, technology, arts, and everyday conversations. The dataset includes over 10 million samples spanning 15 different quality… See the full description on the dataset page: https://huggingface.co/datasets/toolevalxm/MySuperDataset-TestRepo.
MySuperDataset
<!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header -->
<div align="center"> <img src="figures/dataset_overview.png" width="60%" alt="MySuperDataset" /> </div> <hr>
<div align="center" style="line-height: 1;"> <a href="LICENSE" style="margin: 2px;"> <img alt="License" src="figures/license_badge.png" style="display: inline-block; vertical-align: middle;"/> </a> </div>
1. Introduction
MySuperDataset is a comprehensive multi-domain text corpus designed for training and evaluating language models. This dataset has been carefully curated through multiple iterations to ensure high quality, diversity, and representativeness across various domains including science, technology, arts, and everyday conversations.
<p align="center"> <img width="80%" src="figures/quality_chart.png"> </p>
The dataset includes over 10 million samples spanning 15 different quality metrics. Through our iterative curation process, we have significantly improved data quality while maintaining diversity. The latest version shows a 25% improvement in overall quality scores compared to the initial release.
Our curation process focuses on removing harmful content, deduplication, and ensuring balanced representation across topics and demographics.
2. Quality Metrics
Comprehensive Quality Assessment
<div align="center">
</div>
Overall Quality Summary
MySuperDataset demonstrates exceptional quality across all evaluated metrics, with particularly strong performance in safety filtering and content quality dimensions.
3. Dataset Access & API
We provide direct dataset access through our platform and API endpoints. Please visit our official website for documentation and access tokens.
4. How to Use
Please refer to our documentation for detailed usage instructions.
Loading the Dataset
from datasets import load_dataset
dataset = load_dataset("MySuperDataset")Data Format
Each sample contains:
text: The main text contentdomain: The topic domain classificationquality_score: Pre-computed quality scoresource: Original data source identifier
Recommended Usage
We recommend filtering samples with quality_score >= 0.8 for training language models.
5. License
This dataset is released under the Apache 2.0 License. Commercial use is permitted with proper attribution.
6. Contact
For questions or issues, please open a GitHub issue or contact us at data@mysuperdataset.ai.
