CoolFace
Datasetpublic

sharjeelyunus/github-issues-dataset

πŸ“Œ GitHub Issues Dataset πŸ“‚ Dataset Name: github-issues-datasetπŸ“Š Total Issues: 114073πŸ“œ Format: Parquet (.parquet)πŸ” Source: GitHub Repositories (Top 100 Repos) πŸ“– Overview This dataset contains 114,073 GitHub issues collected from the top 100 repositories on GitHub.It is designed for issue classification, severity/priority prediction, and AI/ML training. βœ… This dataset is useful for: AI/ML Training: Fine-tune models for issue classification &… See the full description on the dataset page: https://huggingface.co/datasets/sharjeelyunus/github-issues-dataset.

sourceHugging Facemitupdated 2y agoView on Hugging Face
7likes710downloads
Dataset Card

πŸ“Œ GitHub Issues Dataset

![Hugging Face Dataset](https://huggingface.co/datasets/github-issues-dataset)

πŸ“‚ Dataset Name: github-issues-dataset πŸ“Š Total Issues: 114073 πŸ“œ Format: Parquet (`.parquet`) πŸ” Source: GitHub Repositories (Top 100 Repos)


πŸ“– Overview

This dataset contains 114,073 GitHub issues collected from the top 100 repositories on GitHub. It is designed for issue classification, severity/priority prediction, and AI/ML training.

βœ… This dataset is useful for:

  • β€”AI/ML Training: Fine-tune models for issue classification & prioritization.
  • β€”Natural Language Processing (NLP): Analyze software development discussions.
  • β€”Bug Severity Prediction: Train models to classify issues as Critical, Major, or Minor.

πŸ“‚ Dataset Structure

The dataset is stored in Parquet format (`github_issues_dataset.parquet`) for efficient storage and fast retrieval.

Columns in the Dataset:

ColumnTypeDescription
idintGithub issue id
repostrRepository name
titlestrIssue title
bodystrIssue description
labelslistAssigned GitHub labels
prioritystrEstimated priority (high, medium, low)
severitystrEstimated severity (Critical, Major, Minor)

πŸ“₯ Download & Use

Using datasets Library

You can easily load this dataset using Hugging Face's datasets library:

python
from datasets import load_dataset

dataset = load_dataset("sharjeelyunus/github-issues-dataset")

πŸ“Š Sample Data

idrepotitlelabelspriorityseverity
101pytorch/pytorch"RuntimeError: CUDA out of memory"["bug", "cuda"]highCritical
102tensorflow/tensorflow"Performance degradation in v2.9"["performance"]mediumMajor
103microsoft/vscode"UI freeze when opening large files"["ui", "bug"]lowMinor

πŸ›  How This Dataset Was Created

  1. 1.Collected open issues from the top 100 repositories on GitHub.
  2. 2.Filtered only English issues with assigned labels.
  3. 3.Processed priority and severity:
  4. 4.Used labels to determine priority & severity.
  5. 5.Used ML models to predict missing priority/severity values.
  6. 6.Stored dataset in Parquet format for ML processing.

πŸ” Use Cases

  • β€”AI-Powered Bug Triage: Train AI models to predict priority & severity.
  • β€”NLP Research: Analyze software engineering discussions.

πŸ“œ License

This dataset is open-source and publicly available under the MIT License. Please cite this dataset if you use it in research.


πŸ“« Feedback & Contributions

  • β€”Found an issue? Open an [issue](https://github.com/sharjeelyunus/github-issues-analyzer/issues).
  • β€”Want to contribute? Feel free to submit a PR.
  • β€”For any questions, reach out on [Hugging Face Discussions](https://huggingface.co/datasets/sharjeelyunus/github-issues-dataset/discussions).

⭐ Support

πŸ“Œ If you find this dataset useful, please like ❀️ the repository! πŸš€ Happy Coding! πŸš€