lapa-llm/pretraining-lower-quality
Dataset Card for Lapa Pretraining Lower Quality Dataset Dataset Description Dataset Summary This dataset is a high quality (but lower quality than https://huggingface.co/datasets/lapa-llm/pretraining-high-qualit) subset of pretraining corpus for Ukrainian language. It was filtered using 6 models, measuring different quality aspects of the data: lapa-llm/alignment-score-model - Alignment - filtering for disinformation lapa-llm/gec-score-model - Grammatical… See the full description on the dataset page: https://huggingface.co/datasets/lapa-llm/pretraining-lower-quality.
Update README.md
Update README.md
Upload dataset
Upload dataset (part 00010-of-00011)
Upload dataset (part 00009-of-00011)
Upload dataset (part 00008-of-00011)
Upload dataset (part 00007-of-00011)
Upload dataset (part 00006-of-00011)
Upload dataset (part 00005-of-00011)
Upload dataset (part 00004-of-00011)
Upload dataset (part 00003-of-00011)
Upload dataset (part 00002-of-00011)
Upload dataset (part 00001-of-00011)
Upload dataset (part 00000-of-00011)
initial commit
