CoolFace
Datasetpublic

model2me/scienceqa-multilingual-hindi

#ScienceQA Hindi Translation Dataset ##Dataset Description This dataset is a Hindi-translated version of the original ScienceQA dataset. It includes multiple-choice science questions, with fields for: Images (optional visual context), Hints (optional support text), English questions and their Hindi translations, Multiple answer choices, Correct answers. This translation is intended to support multilingual education research, question-answering in Hindi, and fairness studies in multilingual… See the full description on the dataset page: https://huggingface.co/datasets/model2me/scienceqa-multilingual-hindi.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes3downloads
Dataset Card

#ScienceQA Hindi Translation Dataset

##Dataset Description

This dataset is a Hindi-translated version of the original ScienceQA dataset. It includes multiple-choice science questions, with fields for:

  • Images (optional visual context),
  • Hints (optional support text),
  • English questions and their Hindi translations,
  • Multiple answer choices,
  • Correct answers.

This translation is intended to support multilingual education research, question-answering in Hindi, and fairness studies in multilingual NLP.


##Translation Process

  • The English questions were translated to Hindi using the deep-translator package with the Google Translate API.
  • Translations were run in parallel using joblib.Parallel to speed up the process and mitigate rate limits.
  • If a translation failed (e.g., due to rate limiting), a retry mechanism was used. Unresolved failures were marked with [TRANSLATION FAILED].

Example logic: python try: translated = GoogleTranslator(source='en', target='hi').translate(text) except: translated = "[TRANSLATION FAILED]"