bingbangboom/adaption-hinglish-transliterate-dataset
Adaption Hinglish Transliterate Dataset Dataset Description This dataset contains 77,471 pairs of raw Hindi text captured via Automatic Speech Recognition (ASR) in Devanagari script and their corresponding clean transliterations into Romanized Hinglish. The samples demonstrate the correction of ASR artifacts and the application of Anglicized Hinglish conventions while preserving the original meaning. Each entry consists of an original system prompt instructing… See the full description on the dataset page: https://huggingface.co/datasets/bingbangboom/adaption-hinglish-transliterate-dataset.
158
Create README.md
Upload images/metrics.png
Upload merged_attempt_2.jsonl
initial commit
