CoolFace
Datasetpublic

DevHunterAI/turkish-reasoning-data

Turkish Reasoning Data A large-scale synthetic Turkish logic-puzzle dataset designed for pretraining and fine-tuning language models on structured reasoning tasks. Dataset Summary Property Value Language Turkish (tr) Format Parquet (HuggingFace Datasets compatible) Approximate tokens ~100 million Number of examples ~720,000 Split train only License CC BY 4.0 Load with datasets from datasets import load_dataset ds =… See the full description on the dataset page: https://huggingface.co/datasets/DevHunterAI/turkish-reasoning-data.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
0likes78downloads
Dataset Card

Turkish Reasoning Data

A large-scale synthetic Turkish logic-puzzle dataset designed for pretraining and fine-tuning language models on structured reasoning tasks.

Dataset Summary

PropertyValue
LanguageTurkish (tr)
FormatParquet (HuggingFace Datasets compatible)
Approximate tokens~100 million
Number of examples~720,000
Splittrain only
LicenseCC BY 4.0

Load with datasets

python
from datasets import load_dataset

ds = load_dataset("DevHunterAI/turkish-reasoning-data", split="train")
print(ds[0])
# {'text': '<doc>\nAşağıdaki ipuçlarına...\n</doc>'}

Reasoning Categories

Each example belongs to one of eight logic-puzzle categories:

Category (TR)Category (EN)Weight
Sıralama bulmacalarıOrdering puzzles25 %
Doğru/Yanlış ifadeTrue/False statement evaluation15 %
Çelişki tespitiContradiction detection15 %
Kim ne yaptıPerson–action–object matching15 %
Ev/kat bulmacalarıZebra-style house/floor puzzles10 %
Seçim argümanıArgument strength evaluation10 %
Sayısal sıralamaNumerical magnitude reasoning10 %
Zaman çizelgesiTimeline / before–after reasoning10 %

Format

Every example has a single text field containing a <doc>...</doc> block:

<doc>
Aşağıdaki ipuçlarına göre Ahmet, Zeynep, Mert kişilerinin
sıralamayı belirleyin:

- Zeynep, Mert'den önce gelir.
- Ahmet 1. sıradadır.

Doğru sıralama nedir?

Adım adım çözüm:
  1. Ahmet
  2. Zeynep
  3. Mert

Sonuç: Doğru sıralama Ahmet > Zeynep > Mert şeklindedir.
</doc>

Intended Use

  • —Pretraining Turkish language models on structured reasoning
  • —Fine-tuning (split text on the solution separator to get instruction/response pairs)
  • —Evaluation of step-by-step reasoning in Turkish

Generation

Generated programmatically with random.seed(42) using randomized templates covering Turkish names, professions, cities, colors, objects, and events.

Limitations

  • —Fully synthetic — does not cover real-world or open-ended reasoning
  • —Puzzle difficulty is limited; puzzles involve 3–5 entities
  • —Solutions are template-generated

Citation

bibtex
@dataset{devhunterai2025turkish_reasoning,
  title     = {Turkish Reasoning Data},
  author    = {DevHunterAI},
  year      = {2025},
  publisher = {Hugging Face},
  url       = {https://huggingface.co/datasets/DevHunterAI/turkish-reasoning-data}
}