Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset
THE DATASET CAN BE USED AS: 1. 🎯 Diacritics Restoration Models Train sequence-to-sequence models to automatically add diacritics to plain Kashmiri text. Input: کاشر زبان (plain text)Output: کٲشُر زَبان (with diacritics) Model architectures: Transformer-based (BERT, T5, mT5) LSTM/GRU sequence-to-sequence Character-level neural networks Training approach: # Example: Fine-tuning mT5 for diacritization from transformers import MT5ForConditionalGeneration model =… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset.
08
No card is published for this repository, or it could not be fetched from Hugging Face right now.
