datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
gsm8k-multilingual-reasoning
gsm8k-multilingual-reasoning
GSM8K with reasoning translated to multiple languages
Schema
{"prompt": "...", "answer": "...", "reasoning": "...", "metadata": {...}}
Usage
from datasets importload_dataset
ds = load_dataset("eddie-OB/gsm8k-multilingual-reasoning")
print(ds["train"][0])
Source
Derived from OpenAI GSM8K.
multilingual-reasoning-v2-9.8kbased off of https://hf.co/datasets/TeichAI/claude-sonnet-4.5-high-reasoning-250x, machine translated to 40 languages, filtered slightly.
multilingual-proverb-reasoning
📖 Multilingual Proverb Reasoning Dataset
This dataset contains 990 unique proverbs primarily in Japanese, with accompanying phonetic readings (Romaji), literal translations, and multilingual reasoning "Chain of Thought" (thought) fields. It is designed for training and evaluating LLMs on cultural nuance, metaphorical reasoning, and multilingual explanation tasks.
📊 Dataset Summary
The dataset was curated and cleaned to remove 182 duplicates, resulting in a high-quality… See the full description on the dataset page: https://huggingface.co/datasets/nassimjp/multilingual-proverb-reasoning.
