CoolFace
Datasetpublic

avewright/tabula-pretraining-corpus-v2

Tabula Pretraining Corpus v2 A large-scale synthetic tabular dataset for pretraining transformer-based in-context learning models for tabular data (similar to TabPFN). Overview Metric Value Total rows 272,271,776 Total datasets 10,867 Shards 135 Mean utility AUC 0.851 Format Parquet (float32) Schema Each shard is a Parquet file with a fixed-width schema: feat_0 through feat_63: Float32 feature columns. Unused slots are NaN.… See the full description on the dataset page: https://huggingface.co/datasets/avewright/tabula-pretraining-corpus-v2.

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes2kdownloads
Dataset Card

Tabula Pretraining Corpus v2

A large-scale synthetic tabular dataset for pretraining transformer-based in-context learning models for tabular data (similar to TabPFN).

Overview

MetricValue
Total rows272,271,776
Total datasets10,867
Shards135
Mean utility AUC0.851
FormatParquet (float32)

Schema

Each shard is a Parquet file with a fixed-width schema:

  • feat_0 through feat_63: Float32 feature columns. Unused slots are NaN.
  • target: Float32 target variable (classification label or regression target).
  • _source_meta: JSON string with dataset metadata including:
  • generator: Which synthetic generator produced this dataset
  • task_type: "binary", "multiclass", or "regression"
  • n_features: Number of active features (rest are NaN-padded)
  • n_classes: Number of target classes
  • n_samples: Number of rows in the original dataset
  • domain: Semantic domain (finance, health, etc.)
  • feature_names: Original domain-specific column names

Generators

GeneratorDatasets
GaussianMixture3,029
Polynomial2,738
SCM2,674
TreePrior2,096
Regression325
MixedType_GaussianMixture2
MixedType_SCM2
MixedType_TreePrior1

Task Types

TypeDatasets
binary8,396
multiclass2,146
regression325

Domains

DomainDatasets
hr1,033
education1,031
telecom1,028
science1,020
iot1,005
finance1,000
health985
ecommerce977
logistics972
environment935
manufacturing881

Quality Gates

Every generated dataset passes quality gates before inclusion:

  • No constant columns — all features must vary
  • No all-null columns
  • Minority class fraction ≥ 5% for classification
  • Duplicate row fraction ≤ 30%
  • RF utility AUC ≥ 0.55 — a Random Forest must achieve above-chance cross-validated AUC

Gate failure rate: 22.4%

Data Augmentation

  • Missingness injection: ~30% of datasets have random missing values injected
  • Concept drift: ~20% of datasets have feature distribution shifts

Usage

python
from datasets import load_dataset

ds = load_dataset("avewright/tabula-pretraining-corpus-v2", split="train", streaming=True)

for batch in ds.iter(batch_size=512):
    features = batch["feat_0"]  # access individual features
    target = batch["target"]
    meta = batch["_source_meta"]  # JSON metadata string

License

Apache 2.0