SlayerLab/slayer-pl-8x3b
slayer-pl-8x3b Osiem rozłącznych polskich zbiorów treningowych, po około 3 mld tokenów każdy (łącznie około 24 mld tokenów, licznik cl100k). Zbiory przeznaczone są do treningu wieloprzebiegowego: różnią się rozłącznym wycinkiem danych web (brak wspólnych dokumentów między zbiorami), natomiast współdzielą rdzeń zróżnicowany rejestrowo, warstwę prawno-urzędową oraz dosypkę angielską. Format wyjściowy: parquet. Tokenizacja pozostaje po stronie odbiorcy. Kontrakt danych… See the full description on the dataset page: https://huggingface.co/datasets/SlayerLab/slayer-pl-8x3b.
This repository belongs to SlayerLab on Hugging Face.
CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.
