CoolFace
Datasetpublicgated

Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset

THE DATASET CAN BE USED AS: 1. 🎯 Diacritics Restoration Models Train sequence-to-sequence models to automatically add diacritics to plain Kashmiri text. Input: کاشر زبان (plain text)Output: کٲشُر زَبان (with diacritics) Model architectures: Transformer-based (BERT, T5, mT5) LSTM/GRU sequence-to-sequence Character-level neural networks Training approach: # Example: Fine-tuning mT5 for diacritization from transformers import MT5ForConditionalGeneration model =… See the full description on the dataset page: https://huggingface.co/datasets/Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset.

sourceHugging Faceccupdated 4mo agoView on Hugging Face
0likes8downloads
settings

This repository belongs to Omarrran on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namekashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset
visibilitypublic
licencecc
gatedyes
ownerOmarrran
Account settings
Omarrran/kashmiri_parallel_Diacratic_to_Non_diacratic_Text_dataset · CoolFace