datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
arxiv-tex-corpus-mediumarxiv-tex-corpus-medium (15GB)
Medium-scale LaTeX corpus from arXiv (math, CS, physics, statistics)
📄 Paper: https://arxiv.org/abs/2602.17288
📚 Overview
arxiv-tex-corpus-medium (15GB) is a medium-sized version of the arXiv LaTeX corpus, containing structured LaTeX source content extracted from selected arXiv categories.
This dataset is restricted to the following categories:
math
cs
hep-th
hep-ph
quant-ph
stat.ML
stat.TH
This version (~15GB) is intended for:
Research… See the full description on the dataset page: https://huggingface.co/datasets/KiteFishAI/arxiv-tex-corpus-medium.polaris_filtered_nemotron_medium_math_verifiable
Polaris Filtered Nemotron Medium Sympy Verifiable (v2)
This dataset is a curated subset of reasoning data from nvidia/Nemotron-Math-v2, specifically filtered for mathematical verifiability (verified using math verify-based equivalence), not having tool-reliance (TIR), and decontamination against the POLAIRS (POLARIS-Project/Polaris-Dataset-53K) dataset.
Dataset Summary
Total Original Samples: 2,424,392
Final Kept Samples: 357,790 (14.8%)
Target Reasoning Length: 4k-8k… See the full description on the dataset page: https://huggingface.co/datasets/devvrit/polaris_filtered_nemotron_medium_math_verifiable.polaris_filtered_nemotron_medium_sympy_verifiable
Polaris Filtered Nemotron Medium Sympy Verifiable
This dataset is a curated subset of reasoning data from nvidia/Nemotron-Math-v2, specifically filtered for mathematical verifiability (verified using sympy-based equivalence), not having tool-reliance (TIR), and decontamination against the POLAIRS (POLARIS-Project/Polaris-Dataset-53K) dataset.
Dataset Summary
Total Original Samples: 2,500,820
Final Kept Samples: 263,123 (10.5%)
Target Reasoning Length: Optimized for… See the full description on the dataset page: https://huggingface.co/datasets/devvrit/polaris_filtered_nemotron_medium_sympy_verifiable.ping-technical-assistant-mediumNow 3x the size of Ping Technical Assitant Small!
NOTE: A new LoRA will be trained on this data soon!
Ping Technical Assistant Dataset Small
This is the dataset that was used to create Ping Technical Assistant LoRA which is an agent that focuses on technical support for consumer devices. It consists of a training dataset, validation dataset, and test dataset. The dataset is ready immediately for fine tuning tasks in MLX, and follows the format laid out by the example docs for fine… See the full description on the dataset page: https://huggingface.co/datasets/dzur658/ping-technical-assistant-medium.VeriReason-reasoning-reproduced-1513_luna-medium
VeriReason reasoning reproduced (Luna medium)
This dataset is a deterministic sample of the locally updated reproduced VeriReason files.
Source files: train (1).jsonl, validation (1).jsonl
Sampling: independent shuffle then prefix slice, fixed seed 42
Splits: train 1513, validation 189
Original target dataset: Jongbin-kr/VeriReason-RTL-Coder_7b_reasoning_tb (train 1513 / validation 189)
Schema: id, instruction, output, tb, tb_result
Quality checks: valid JSON, unique IDs… See the full description on the dataset page: https://huggingface.co/datasets/Jongbin-kr/VeriReason-reasoning-reproduced-1513_luna-medium.mn_business_benchmark_dataset_medium
mn_business_benchmark_dataset_10000_diverse
Монгол хэл дээрх бизнес, санхүү, борлуулалт, маркетинг, unit economics, стратегийн 10000 мөртэй синтетик benchmark dataset.
Schema
id: 1-ээс 10000 хүртэлх дараалсан дугаар
instruction: бизнесийн бодлогын өгүүлбэр
input: хоосон string
thinking: бодолт, томьёо, завсрын алхам
output: эцсийн хариу
topic: бизнесийн сэдэв
difficulty: easy эсвэл medium
image_svg: тухайн бодлогын энгийн SVG card дүрслэл
Generated deterministically by… See the full description on the dataset page: https://huggingface.co/datasets/joppari/mn_business_benchmark_dataset_medium.
