datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
danyig-pedri-binary-script-classifier
Danyig vs Pedri Binary Script Classification Dataset
Stage-2 binary classifier for distinguishing Danyig (5 subscripts: DraDring, DraRing, Drathung, Gongshabma, Tsegdrig) from Pedri (2 subscripts: Peri, Petsuk). Real-only, all images human-reviewed.
Images per class
Class
train
val
test
All
Danyig
480
60
60
600
Pedri
480
60
60
600
Total
960
120
120
1,200
Splits
Manuscript-stratified split — each manuscript work appears in exactly… See the full description on the dataset page: https://huggingface.co/datasets/BDRC/danyig-pedri-binary-script-classifier.tibetan-script-classification-benchmark
Tibetan Script Classification Benchmark
Holdout benchmark for 6-class Tibetan script classification. Test split only — not used during training.
All images are BDRC manuscript page scans, balanced by subclass.
Class
Images
Subclasses
Danyig
60
DraDring: 25, DraRing: 9, Drathung: 17, Gongshabma: 3, Tsegdrig: 6
Druma
60
Dhumri: 22, DruDring: 20, DruRing: 10, Druchen: 2, Druthung: 6
Gyuyig
60
Khyuyig: 31, Tsumachug: 15, Yigchung: 14
Pedri
60
Peri: 44, Petsuk: 16… See the full description on the dataset page: https://huggingface.co/datasets/BDRC/tibetan-script-classification-benchmark.
