CoolFace
Datasetpublic

BDRC/tibetan-script-classification-benchmark

Tibetan Script Classification Benchmark Holdout benchmark for 6-class Tibetan script classification. Test split only — not used during training. All images are BDRC manuscript page scans, balanced by subclass. Class Images Subclasses Danyig 60 DraDring: 25, DraRing: 9, Drathung: 17, Gongshabma: 3, Tsegdrig: 6 Druma 60 Dhumri: 22, DruDring: 20, DruRing: 10, Druchen: 2, Druthung: 6 Gyuyig 60 Khyuyig: 31, Tsumachug: 15, Yigchung: 14 Pedri 60 Peri: 44, Petsuk: 16… See the full description on the dataset page: https://huggingface.co/datasets/BDRC/tibetan-script-classification-benchmark.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes31downloads
Dataset Card

Tibetan Script Classification Benchmark

Holdout benchmark for 6-class Tibetan script classification. Test split only — not used during training. All images are BDRC manuscript page scans, balanced by subclass.

ClassImagesSubclasses
Danyig60DraDring: 25, DraRing: 9, Drathung: 17, Gongshabma: 3, Tsegdrig: 6
Druma60Dhumri: 22, DruDring: 20, DruRing: 10, Druchen: 2, Druthung: 6
Gyuyig60Khyuyig: 31, Tsumachug: 15, Yigchung: 14
Pedri60Peri: 44, Petsuk: 16
Tsugdri60Trinyig: 36, Tsugchung: 14, Tsugthung: 10
Uchen60Uchen SugDring: 53, Uchen SugRing: 3, Uchen Sugthung: 4
multiscript60Multi-Scripts: 60
non_tibetan60Other: 60

Total: 480 images across 8 classes.

Parquet schema

ColumnTypeDescription
idstringBDRC page id (e.g. W00KG09391-I00KG093950005)
image_bytesbinaryJPEG/PNG page image
scriptstringOne of: Danyig, Druma, Gyuyig, Pedri, Tsugdri, Uchen, multiscript, non_tibetan
script_typestringSub-script / subclass name (e.g. DraDring, Multi-Scripts, Other)

Load in Python

python
from datasets import load_dataset

ds = load_dataset("BDRC/tibetan-script-classification-benchmark", split="test")
print(len(ds))  # 480

row = ds[0]
# row["id"], row["image_bytes"], row["script"]

Evaluate a model

python
from experiments.benchmark_eval.eval import run_benchmark
run_benchmark(model, repo_id="BDRC/tibetan-script-classification-benchmark")

Citation

bibtex
@misc{bdrcscriptbenchmark,
  title  = {Tibetan Script Classification Benchmark},
  author = {Buddhist Digital Resource Center and OpenPecha},
  year   = {2026},
  url    = {https://huggingface.co/datasets/BDRC/tibetan-script-classification-benchmark},
  note   = {Images from BDRC. MIT.}
}

Acknowledgements

Images from the [Buddhist Digital Resource Center](https://www.bdrc.io) (BDRC). Developed by Dharmaduta / OpenPecha.