CoolFace
Datasetpublic

cminst/transcoda-random-notation-300k

Transcoda Random Notation 300k Source: train: cminst/transcoda-random-notation-normalized-v1/uniform-v3-normalized-constant-spines-marks-300k; validation: fresh generation using the same normalized uniform-v3 generator recipe This is a canonical standardized Transcoda dataset. All published splits use the standard Hugging Face Datasets Parquet layout under data/. Canonical columns: image transcription sample_id source metadata: JSON string preserving source/provenance fields… See the full description on the dataset page: https://huggingface.co/datasets/cminst/transcoda-random-notation-300k.

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
0likes407downloads
Dataset Card

Transcoda Random Notation 300k

Source: train: cminst/transcoda-random-notation-normalized-v1/uniform-v3-normalized-constant-spines-marks-300k; validation: fresh generation using the same normalized uniform-v3 generator recipe

This is a canonical standardized Transcoda dataset. All published splits use the standard Hugging Face Datasets Parquet layout under data/.

Canonical columns:

  • image
  • transcription
  • sample_id
  • source
  • metadata: JSON string preserving source/provenance fields

Splits:

  • train: 300000 rows, 126 Parquet shards, 57.57 GiB
  • validation: 2048 rows, 4 Parquet shards, 402.61 MiB

Load splits by logical split name, not by physical shard path:

python
from datasets import load_dataset

dataset = load_dataset("cminst/transcoda-random-notation-300k", split="train")