cminst/transcoda-random-notation-300k
Transcoda Random Notation 300k Source: train: cminst/transcoda-random-notation-normalized-v1/uniform-v3-normalized-constant-spines-marks-300k; validation: fresh generation using the same normalized uniform-v3 generator recipe This is a canonical standardized Transcoda dataset. All published splits use the standard Hugging Face Datasets Parquet layout under data/. Canonical columns: image transcription sample_id source metadata: JSON string preserving source/provenance fields… See the full description on the dataset page: https://huggingface.co/datasets/cminst/transcoda-random-notation-300k.
Transcoda Random Notation 300k
Source: train: cminst/transcoda-random-notation-normalized-v1/uniform-v3-normalized-constant-spines-marks-300k; validation: fresh generation using the same normalized uniform-v3 generator recipe
This is a canonical standardized Transcoda dataset. All published splits use the standard Hugging Face Datasets Parquet layout under data/.
Canonical columns:
imagetranscriptionsample_idsourcemetadata: JSON string preserving source/provenance fields
Splits:
train: 300000 rows, 126 Parquet shards, 57.57 GiBvalidation: 2048 rows, 4 Parquet shards, 402.61 MiB
Load splits by logical split name, not by physical shard path:
from datasets import load_dataset
dataset = load_dataset("cminst/transcoda-random-notation-300k", split="train")