CoolFace
Datasetpublic

olanigan/logical-transcripts

logical-transcripts Golden paired dataset for training models to transliterate Arabic Latin text into scholarly diacritized form — built from a single recorded Islamic lecture (Chapter 24, Lecture 16) with a raw ASR transcript and a human-polished scholarly transcript. Two artifacts are stored separately for provenance and review: File Rows Purpose train.jsonl 203 Golden — quality-filtered pairs for training bronze.jsonl 773 Bronze — every aligned sentence pair… See the full description on the dataset page: https://huggingface.co/datasets/olanigan/logical-transcripts.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes26downloads
8 commits on main
ca3a3212mo ago

Remove internal project references from card

olanigan
3e5c9472mo ago

Add bronze.jsonl provenance artifact

olanigan
a56ac5e2mo ago

Add golden train.jsonl

olanigan
f1652f72mo ago

Remove misplaced nested bronze file

olanigan
8540eb72mo ago

Add golden train + bronze provenance artifacts

olanigan
beb758c2mo ago

Fix task category metadata

olanigan
130cf102mo ago

Add dataset card

olanigan
03073bd2mo ago

initial commit

olanigan