datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
arabic_punctuation_datarestore_punctuation_tiny_num_beams_4restore_punctuation_medium_num_beams_1restore_punctuation_tiny_num_beams_2restore_punctuation_tiny_num_beams_1ru_transcription_punctuation
About
This is a dataset for training Russian punctuators/capitalizers via NeMo scripts (https://github.com/NVIDIA/NeMo)
A BERT model already fine-tuned on this dataset can be found here: https://huggingface.co/denis-berezutskiy-lad/lad_transcription_bert_ru_punctuator
Scripts for collecting/updating such a dataset, as well as training/using the model are located here: https://github.com/denis-berezutskiy-lad/transcription-bert-ru-punctuator-scripts/tree/main
The idea behind the… See the full description on the dataset page: https://huggingface.co/datasets/denis-berezutskiy-lad/ru_transcription_punctuation.restore_punctuation_medium_num_beams_2restore_punctuation_medium_num_beams_4
