CoolFace
Datasetpublicgated

Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset

THE DATASET CAN BE USED AS: 1. 🎯 Diacritics Restoration Models Train sequence-to-sequence models to automatically add diacritics to plain Kashmiri text. Input: کاشر زبان (plain text)Output: کٲشُر زَبان (with diacritics) Model architectures: Transformer-based (BERT, T5, mT5) LSTM/GRU sequence-to-sequence Character-level neural networks Training approach: # Example: Fine-tuning mT5 for diacritization from transformers import MT5ForConditionalGeneration model =… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset.

sourceHugging Faceccupdated 4mo agoView on Hugging Face
0likes8downloads
Dataset Card

No card is published for this repository, or it could not be fetched from Hugging Face right now.