CoolFace
Datasetpublic

lapa-llm/pretraining-lower-quality

Dataset Card for Lapa Pretraining Lower Quality Dataset Dataset Description Dataset Summary This dataset is a high quality (but lower quality than https://huggingface.co/datasets/lapa-llm/pretraining-high-qualit) subset of pretraining corpus for Ukrainian language. It was filtered using 6 models, measuring different quality aspects of the data: lapa-llm/alignment-score-model - Alignment - filtering for disinformation lapa-llm/gec-score-model - Grammatical… See the full description on the dataset page: https://huggingface.co/datasets/lapa-llm/pretraining-lower-quality.

sourceHugging Facecc-by-4.0updated 11mo agoView on Hugging Face
0likes104downloads
15 commits on main
b0b377411mo ago

Update README.md

robinhad
b68106211mo ago

Update README.md

robinhad
44695f711mo ago

Upload dataset

robinhad
ce5920e11mo ago

Upload dataset (part 00010-of-00011)

robinhad
5b4f78011mo ago

Upload dataset (part 00009-of-00011)

robinhad
72efb1011mo ago

Upload dataset (part 00008-of-00011)

robinhad
3a29a5b11mo ago

Upload dataset (part 00007-of-00011)

robinhad
abced9c11mo ago

Upload dataset (part 00006-of-00011)

robinhad
f03289c11mo ago

Upload dataset (part 00005-of-00011)

robinhad
020477a11mo ago

Upload dataset (part 00004-of-00011)

robinhad
d78a95a11mo ago

Upload dataset (part 00003-of-00011)

robinhad
ed9023d11mo ago

Upload dataset (part 00002-of-00011)

robinhad
9db3ee111mo ago

Upload dataset (part 00001-of-00011)

robinhad
66b16f411mo ago

Upload dataset (part 00000-of-00011)

robinhad
93e5aad11mo ago

initial commit

robinhad