CoolFace
Datasetpublic

obekt/obekt-question-answer-reasoning-micro-v0.1

Obekt Micro Reasoning Dataset (v0.1) Dataset Description This is a "micro" dataset containing questions, answers, and reasoning traces. It is generated using the Xiaomi MiMo V2 Flash LLM and is intended for experimental purposes, quick prototyping, and fine-tuning trials where reasoning capability is a focus. Source Model: xiaomi/mimo-v2-flash Contains obekt-question-answer-reasoning-micro-v0.1.csv: The main data file. Columns: question: The input… See the full description on the dataset page: https://huggingface.co/datasets/obekt/obekt-question-answer-reasoning-micro-v0.1.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes47downloads
Dataset Card

Obekt Micro Reasoning Dataset (v0.1)

Dataset Description

This is a "micro" dataset containing questions, answers, and reasoning traces. It is generated using the Xiaomi MiMo V2 Flash LLM and is intended for experimental purposes, quick prototyping, and fine-tuning trials where reasoning capability is a focus.

Source Model: xiaomi/mimo-v2-flash

Contains

  • —obekt-question-answer-reasoning-micro-v0.1.csv: The main data file.
  • —Columns:
  • —question: The input query.
  • —answer: The direct answer.
  • —reasoning: The chain-of-thought or explanation leading to the answer.

Disclaimer: Unverified Synthetic Data

[!WARNING] This data is 100% synthetic and produced by an AI model. Unverified Accuracy: The content is generated and has not been verified by human experts. Experimental Use Only: Use this for testing pipelines, fine-tuning mechanics, or analyzing model outputs. Do not rely on it for factual accuracy in critical domains.

Usage

Streaming

Because this dataset is uploaded via push_to_hub, it is stored in Parquet format, enabling efficient streaming.

python
from datasets import load_dataset

# Load the dataset in streaming mode
dataset = load_dataset("obekt/obekt-question-answer-reasoning-micro-v0.1", streaming=True)

# Iterate through the first few examples
for i, example in enumerate(dataset["train"]):
    print("Q:", example['question'])
    print("Reasoning:", example['reasoning'])
    print("A:", example['answer'])
    if i == 2: break

License

MIT License