SlayerLab/hplt-v3-pl-cleaned
HPLT v3 Polish — Cleaned & PII-Gated Oczyszczony, polski podzbiór korpusu web HPLT v3, przygotowany jako materiał pretreningowy. Autor / kurator zbioru: Arkadiusz Słota (SlayerLab). Wartość dodana względem surowego HPLT: wieloetapowa bramka PII (usuwanie numerów telefonów, identyfikatorów, adresów) z niezależną weryfikacją na pełnych danych + lekkie czyszczenie boilerplate. Wersja: v1.0 — floor (bins 8_5 + 8_6). Track B (bins 9_1 + 8_1, po deduplikacji względem bazy dynaword)… See the full description on the dataset page: https://huggingface.co/datasets/SlayerLab/hplt-v3-pl-cleaned.
HPLT v3 Polish — Cleaned & PII-Gated
Oczyszczony, polski podzbiór korpusu web HPLT v3, przygotowany jako materiał pretreningowy. Autor / kurator zbioru: Arkadiusz Słota (SlayerLab). Wartość dodana względem surowego HPLT: wieloetapowa bramka PII (usuwanie numerów telefonów, identyfikatorów, adresów) z niezależną weryfikacją na pełnych danych + lekkie czyszczenie boilerplate.
Wersja: v1.0 — floor (bins 8_5 + 8_6). Track B (bins 91 + 81, po deduplikacji względem bazy dynaword) dojdzie jako aktualizacja do ~15B tokenów V32k. Dataset jest wersjonowany.
Languages
Polski (pl).
Dataset Structure — Data Fields (schema dynaword)
Size
v1.0 (floor 8_5 + 8_6) — kompletny i GREEN TERAZ:
Uwaga o jednostkach: te same dokumenty liczone dwoma tokenizerami. V32k = nasz tokenizer treningowy (6.065B, licznik dokładny z tokenizacji). cl100k = natywny licznik HPLT (~10-11B — to jest „podłoga 10B", o której mowa w projekcie). Floor v1.0 to kompletny, zweryfikowany zbiór dostępny od teraz; track B rozszerza go w kolejnej wersji.
Ratio zmierzony empirycznie na floor (pełne dane): 530 tokenów V32k / dokument. Referencyjny token_count per dokument w kolumnie.
PII Processing (bramka prywatności)
Kluczowa wartość dodana. Surowy HPLT web-crawl zawiera realne dane osobowe. Zastosowano iteracyjną bramkę PII (v13 → v20): reguły regex + niezależną weryfikację przez oddzielny komponent (deep_verify) na PEŁNYCH danych (nie na próbce).
Metoda (pętla detect → pattern → regex → verify):
- Wykrywane: telefony PL/międzynarodowe (separatory: spacje, myślniki, kropki, nawiasy, multi-numer), NIP, NRB/IBAN, PESEL/NATID, adresy e-mail. Guardy anty-fałszywo-trafieniowe (NRB≠telefon, karta-16, ISBN, współrzędne, wersje jądra, KRS/BDO/IMEI z labelem).
- Malejący ogon: liczba wykrytych spadała 719 → … → 82 przez kolejne iteracje; klasy coraz węższe.
- Drop-policy: dokumenty z nieusuwalnymi/egzotycznymi formatami PII oraz zniekształcone (
mangle) są usuwane (precedens deterministyczny). Floor: 82 dokumenty (0.0007%) usunięte,mangle= 0. - Werdykt końcowy (GREEN): niezależny
deep_verifyna publikowanych parquetach: `leak = 0 ∧ idem = 0 ∧ mangle = 0` na pełnych 11 446 492 dokumentach. Integralność związana sha256 (verify == publish). Wersja bramki: v20.
Uwaga: bramka minimalizuje ryzyko PII, ale nie stanowi gwarancji prawnej. Użytkownicy przetwarzający dane osobowe powinni przeprowadzić własną ocenę zgodności (RODO/GDPR).
Quality Cleaning (inline-strip, content-preserving)
Lekki inline-strip artefaktów web — usuwa szum, ZACHOWUJE treść dokumentu (bez usuwania dokumentów):
- Podpisy/bylines z ©: segment
© Podpis: <Imię Nazwisko>(podpisy dziennikarskie, np. agencyjne) — usuwany, treść artykułu zostaje. - Blogger-UI: stringi przycisków „OdpowiedzUsuń…" (~1.23% dok.).
- Ramki tekstowe: ciągi podkreśleń
_{20,}(~0.11% dok.).
Prevalencja © = 0.485% — ~62% to legalne stopki (ZACHOWANE), ~38% bylines (strip). Blanket-drop © świadomie odrzucony (strata treści za legalne stopki).
Source & License
Pochodzi z HPLT v3 (High Performance Language Technologies), podzbiór polski. Kompilacja HPLT: CC0; prawa do treści pozostają przy autorach oryginalnych stron; przeznaczenie badawcze. Ten zbiór dodaje warstwę czyszczenia + PII-gate i publikowany jest jako osobny dataset (nie część kanonicznego polish-dynaword). Cytowanie/atrybucja HPLT v3 zgodnie z projektem HPLT.
Limitations & Biases
- Web-crawl: obecne są szum, boilerplate, keyword-spam, treści o zmiennej jakości.
- PII-gate ma wysoką czułość dla telefonów/identyfikatorów PL; egzotyczne formaty międzynarodowe mają niższe pokrycie (stąd drop-policy dla ogona).
- Poza PII: lekki inline-strip boilerplate; BRAK filtrowania toksyczności/tematycznego/jakości semantycznej.
Provenance & Citation
Autor / kurator: Arkadiusz Słota (SlayerLab). Zbiór przygotowany metodycznym pipeline'em: czyszczenie + wieloetapowa bramka PII (v13→v20) z niezależną weryfikacją (deep_verify, dwa niezależne oczy), tokenizacja i statystyki korpusu, sha-tie verify==publish.
Cytowanie:
@misc{slota_hplt_v3_pl_cleaned_2026,
author = {Słota, Arkadiusz},
title = {HPLT v3 Polish --- Cleaned \& PII-Gated},
year = {2026},
publisher = {Hugging Face (SlayerLab)},
note = {Pochodny z HPLT v3; bramka PII v20, GREEN leak=0}
}