roshan-soni/indian-exam-corpus
Indian Exam Corpus Overview Indian Exam Corpus is an English educational text corpus designed for language model pretraining and educational NLP research. The corpus consists of long-form educational documents covering topics commonly found in Indian competitive examinations. Current subsets include: JEE (Joint Entrance Examination) NEET (National Eligibility cum Entrance Test) Each document is stored as a single training example together with its associated… See the full description on the dataset page: https://huggingface.co/datasets/roshan-soni/indian-exam-corpus.
Indian Exam Corpus
Overview
Indian Exam Corpus is an English educational text corpus designed for language model pretraining and educational NLP research.
The corpus consists of long-form educational documents covering topics commonly found in Indian competitive examinations.
Current subsets include:
- JEE (Joint Entrance Examination)
- NEET (National Eligibility cum Entrance Test)
Each document is stored as a single training example together with its associated metadata.
Configurations
Load the complete corpus
from datasets import load_dataset
dataset = load_dataset(
"roshan-soni/indian-exam-corpus",
"all"
)Load only JEE
dataset = load_dataset(
"roshan-soni/indian-exam-corpus",
"jee"
)Load only NEET
dataset = load_dataset(
"roshan-soni/indian-exam-corpus",
"neet"
)Dataset Structure
Each row contains one document.
Intended Use
This corpus is suitable for:
- Continued pretraining
- Domain-adaptive pretraining (DAPT)
- Language model pretraining
- Retrieval-Augmented Generation (RAG)
- Educational assistants
- Semantic search
- Information retrieval
- Question answering
- Text embedding research
Data Format
Documents are distributed as CSV files.
Each row corresponds to one complete educational document.
Acknowledgements
This corpus was compiled by Roshan Soni for educational AI research and language model pretraining experiments.
