CoolFace
Datasetpublic

DimitarV/bulgarian-medical-cpt-100m

Bulgarian text for MOSS continued pretraining Exactly 100 million training tokens: 10M medical and 90M general Bulgarian. An additional 100,000 tokens are provided for validation (50k per source). No audio, instruction-response pairs, or generated answers. No model training has been performed as part of this dataset build. Medical data Exactly 10,000,000 training tokens and 50,000 additional validation tokens, including one <|im_end|> EOS per record. Extracted… See the full description on the dataset page: https://huggingface.co/datasets/DimitarV/bulgarian-medical-cpt-100m.

sourceHugging Faceotherupdated 16d agoView on Hugging Face
0likes88downloads
filegeneral_train_00.parquet38.7 MBdownload
filegeneral_train_01.parquet38.4 MBdownload
filegeneral_train_02.parquet36.6 MBdownload
filegeneral_train_03.parquet38.9 MBdownload
filegeneral_train_04.parquet38.2 MBdownload
filegeneral_train_05.parquet38.0 MBdownload
filegeneral_validation.parquet143 KBdownload
filemedical_train.parquet19.2 MBdownload
filemedical_validation.parquet122 KBdownload

DimitarV/bulgarian-medical-cpt-100m · main · files are served by the source, never re-hosted here