CoolFace
Datasetpublic

roshan-soni/indian-exam-corpus

Indian Exam Corpus Overview Indian Exam Corpus is an English educational text corpus designed for language model pretraining and educational NLP research. The corpus consists of long-form educational documents covering topics commonly found in Indian competitive examinations. Current subsets include: JEE (Joint Entrance Examination) NEET (National Eligibility cum Entrance Test) Each document is stored as a single training example together with its associated… See the full description on the dataset page: https://huggingface.co/datasets/roshan-soni/indian-exam-corpus.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes5downloads
Dataset Card

Indian Exam Corpus

Overview

Indian Exam Corpus is an English educational text corpus designed for language model pretraining and educational NLP research.

The corpus consists of long-form educational documents covering topics commonly found in Indian competitive examinations.

Current subsets include:

  • —JEE (Joint Entrance Examination)
  • —NEET (National Eligibility cum Entrance Test)

Each document is stored as a single training example together with its associated metadata.


Configurations

ConfigurationDescription
allComplete corpus
jeeJEE documents only
neetNEET documents only

Load the complete corpus

python
from datasets import load_dataset

dataset = load_dataset(
    "roshan-soni/indian-exam-corpus",
    "all"
)

Load only JEE

python
dataset = load_dataset(
    "roshan-soni/indian-exam-corpus",
    "jee"
)

Load only NEET

python
dataset = load_dataset(
    "roshan-soni/indian-exam-corpus",
    "neet"
)

Dataset Structure

Each row contains one document.

ColumnDescription
idUnique document identifier
examExam category
sourceSource website
titleDocument title
slugURL slug
urlOriginal document URL
textComplete Markdown document

Intended Use

This corpus is suitable for:

  • —Continued pretraining
  • —Domain-adaptive pretraining (DAPT)
  • —Language model pretraining
  • —Retrieval-Augmented Generation (RAG)
  • —Educational assistants
  • —Semantic search
  • —Information retrieval
  • —Question answering
  • —Text embedding research

Data Format

Documents are distributed as CSV files.

Each row corresponds to one complete educational document.


Acknowledgements

This corpus was compiled by Roshan Soni for educational AI research and language model pretraining experiments.