CoolFace
Datasetpublic

Cleanlab/student-grades

Student Grades Dataset Dataset Description This dataset contains student grade data used in the cleanlab tutorial: Improving ML Performance via Data Curation with Train vs Test Splits. The task is to predict each student's final letter grade (A, B, C, D, F) based on their exam scores and notes. Dataset Summary Total Examples: ~750 (train + test) Task: Multi-class classification Features: exam_1: Score on first exam (0-100) exam_2: Score on second… See the full description on the dataset page: https://huggingface.co/datasets/Cleanlab/student-grades.

sourceHugging Facemitupdated 9mo agoView on Hugging Face
1likes27downloads
README.md132 linesDownload Raw Back to root
1---2license: mit3task_categories:4- tabular-classification5language:6- en7tags:8- education9- data-centric-ai10- label-noise11- cleanlab12pretty_name: Student Grades Dataset13size_categories:14- n<1K15---16 17# Student Grades Dataset18 19## Dataset Description20 21This dataset contains student grade data used in the cleanlab tutorial: [Improving ML Performance via Data Curation with Train vs Test Splits](https://docs.cleanlab.ai/stable/tutorials/improving_ml_performance.html).22 23The task is to predict each student's final letter grade (A, B, C, D, F) based on their exam scores and notes.24 25### Dataset Summary26 27- **Total Examples**: ~750 (train + test)28- **Task**: Multi-class classification29- **Features**:30  - `exam_1`: Score on first exam (0-100)31  - `exam_2`: Score on second exam (0-100)32  - `exam_3`: Score on third exam (0-100)33  - `notes`: Categorical notes about student (e.g., "great participation +10", "cheated on exam, gets 0pts")34  - `stud_ID`: Unique student identifier35- **Label**: `noisy_letter_grade` - Letter grade (A, B, C, D, F)36 37### Dataset Structure38 39```python40from datasets import load_dataset41 42dataset = load_dataset("cleanlab/student-grades")43 44# Access splits45train_data = dataset["train"]46test_data = dataset["test"]47 48# Convert to pandas49import pandas as pd50df_train = train_data.to_pandas()51df_test = test_data.to_pandas()52```53 54### Data Splits55 56| Split | Examples |57|-------|----------|58| train | ~600     |59| test  | ~130     |60 61### Dataset Fields62 63- **stud_ID** (string): Unique student identifier64- **exam_1** (float): First exam score (0-100)65- **exam_2** (float): Second exam score (0-100)66- **exam_3** (float): Third exam score (0-100)67- **notes** (string): Categorical notes about the student68- **noisy_letter_grade** (string): Final letter grade (A, B, C, D, F) - may contain label errors69 70## Dataset Creation71 72This dataset was created for educational purposes to demonstrate data-centric AI techniques using cleanlab. The data intentionally contains:73- **Label noise**: Some grades may be incorrectly labeled74- **Near duplicates**: Some examples are very similar or exact duplicates75- **Outliers**: Unusual data points that don't fit the distribution76 77These issues are introduced to help users learn how to detect and handle common data quality problems using cleanlab.78 79## Uses80 81### Primary Use Case82 83This dataset is designed for:841. Learning data-centric AI techniques852. Demonstrating cleanlab's capabilities for detecting label errors, outliers, and near duplicates863. Teaching proper train/test data curation workflows87 88### Example Usage89 90```python91from datasets import load_dataset92from cleanlab import Datalab93 94# Load dataset95dataset = load_dataset("cleanlab/student-grades")96df_train = dataset["train"].to_pandas()97 98# Use cleanlab to detect issues99lab = Datalab(data=df_train, label_name="noisy_letter_grade", task="classification")100lab.find_issues()101lab.report()102```103 104## Tutorial105 106For a complete tutorial using this dataset, see:107[Improving ML Performance via Data Curation with Train vs Test Splits](https://docs.cleanlab.ai/stable/tutorials/improving_ml_performance.html)108 109## Licensing Information110 111MIT License112 113## Citation114 115If you use this dataset in your research, please cite the cleanlab library:116 117```bibtex118@software{cleanlab,119  author = {Northcutt, Curtis G. and Athalye, Anish and Mueller, Jonas},120  title = {cleanlab},121  year = {2021},122  url = {https://github.com/cleanlab/cleanlab},123}124```125 126## Contact127 128- **Maintainers**: Cleanlab Team129- **Repository**: https://github.com/cleanlab/cleanlab130- **Documentation**: https://docs.cleanlab.ai131- **Issues**: https://github.com/cleanlab/cleanlab/issues132