CoolFace
Datasetpublic

SlayerLab/hplt-v3-pl-cleaned

HPLT v3 Polish — Cleaned & PII-Gated Oczyszczony, polski podzbiór korpusu web HPLT v3, przygotowany jako materiał pretreningowy. Autor / kurator zbioru: Arkadiusz Słota (SlayerLab). Wartość dodana względem surowego HPLT: wieloetapowa bramka PII (usuwanie numerów telefonów, identyfikatorów, adresów) z niezależną weryfikacją na pełnych danych + lekkie czyszczenie boilerplate. Wersja: v1.0 — floor (bins 8_5 + 8_6). Track B (bins 9_1 + 8_1, po deduplikacji względem bazy dynaword)… See the full description on the dataset page: https://huggingface.co/datasets/SlayerLab/hplt-v3-pl-cleaned.

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
0likes232downloads
Dataset Card

HPLT v3 Polish — Cleaned & PII-Gated

Oczyszczony, polski podzbiór korpusu web HPLT v3, przygotowany jako materiał pretreningowy. Autor / kurator zbioru: Arkadiusz Słota (SlayerLab). Wartość dodana względem surowego HPLT: wieloetapowa bramka PII (usuwanie numerów telefonów, identyfikatorów, adresów) z niezależną weryfikacją na pełnych danych + lekkie czyszczenie boilerplate.

Wersja: v1.0 — floor (bins 8_5 + 8_6). Track B (bins 91 + 81, po deduplikacji względem bazy dynaword) dojdzie jako aktualizacja do ~15B tokenów V32k. Dataset jest wersjonowany.

Languages

Polski (pl).

Dataset Structure — Data Fields (schema dynaword)

poletypopis
idstringstabilny identyfikator dokumentu (european_hplt_v3_pl_<bin>_<part>_<idx>)
textstringtreść dokumentu (po czyszczeniu + PII-scrub)
sourcestringźródło (hplt_v3_pl)
addedstringdata dodania do zbioru
createdstringdata utworzenia (jeśli dostępna z HPLT)
token_countintliczba tokenów (licznik referencyjny)
licensestringlicencja dokumentu
authorstringautor/atrybucja (jeśli dostępna)

Size

v1.0 (floor 8_5 + 8_6) — kompletny i GREEN TERAZ:

składnikdokumentyV32k (trening)cl100k (natywny HPLT)
floor 8_5 + 8_6 (v1.0, GREEN)11 446 4926.065B~10-11B
track B 91 + 81 (planowany update)~6.44M pre-dedup~8-9B~13-15B
razem po track B~17.9M~14-15B~23-26B
Uwaga o jednostkach: te same dokumenty liczone dwoma tokenizerami. V32k = nasz tokenizer treningowy (6.065B, licznik dokładny z tokenizacji). cl100k = natywny licznik HPLT (~10-11B — to jest „podłoga 10B", o której mowa w projekcie). Floor v1.0 to kompletny, zweryfikowany zbiór dostępny od teraz; track B rozszerza go w kolejnej wersji.

Ratio zmierzony empirycznie na floor (pełne dane): 530 tokenów V32k / dokument. Referencyjny token_count per dokument w kolumnie.

PII Processing (bramka prywatności)

Kluczowa wartość dodana. Surowy HPLT web-crawl zawiera realne dane osobowe. Zastosowano iteracyjną bramkę PII (v13 → v20): reguły regex + niezależną weryfikację przez oddzielny komponent (deep_verify) na PEŁNYCH danych (nie na próbce).

Metoda (pętla detect → pattern → regex → verify):

  • Wykrywane: telefony PL/międzynarodowe (separatory: spacje, myślniki, kropki, nawiasy, multi-numer), NIP, NRB/IBAN, PESEL/NATID, adresy e-mail. Guardy anty-fałszywo-trafieniowe (NRB≠telefon, karta-16, ISBN, współrzędne, wersje jądra, KRS/BDO/IMEI z labelem).
  • Malejący ogon: liczba wykrytych spadała 719 → … → 82 przez kolejne iteracje; klasy coraz węższe.
  • Drop-policy: dokumenty z nieusuwalnymi/egzotycznymi formatami PII oraz zniekształcone (mangle) są usuwane (precedens deterministyczny). Floor: 82 dokumenty (0.0007%) usunięte, mangle = 0.
  • Werdykt końcowy (GREEN): niezależny deep_verify na publikowanych parquetach: `leak = 0 ∧ idem = 0 ∧ mangle = 0` na pełnych 11 446 492 dokumentach. Integralność związana sha256 (verify == publish). Wersja bramki: v20.
Uwaga: bramka minimalizuje ryzyko PII, ale nie stanowi gwarancji prawnej. Użytkownicy przetwarzający dane osobowe powinni przeprowadzić własną ocenę zgodności (RODO/GDPR).

Quality Cleaning (inline-strip, content-preserving)

Lekki inline-strip artefaktów web — usuwa szum, ZACHOWUJE treść dokumentu (bez usuwania dokumentów):

  • Podpisy/bylines z ©: segment © Podpis: <Imię Nazwisko> (podpisy dziennikarskie, np. agencyjne) — usuwany, treść artykułu zostaje.
  • Blogger-UI: stringi przycisków „OdpowiedzUsuń…" (~1.23% dok.).
  • Ramki tekstowe: ciągi podkreśleń _{20,} (~0.11% dok.).

Prevalencja © = 0.485% — ~62% to legalne stopki (ZACHOWANE), ~38% bylines (strip). Blanket-drop © świadomie odrzucony (strata treści za legalne stopki).

Source & License

Pochodzi z HPLT v3 (High Performance Language Technologies), podzbiór polski. Kompilacja HPLT: CC0; prawa do treści pozostają przy autorach oryginalnych stron; przeznaczenie badawcze. Ten zbiór dodaje warstwę czyszczenia + PII-gate i publikowany jest jako osobny dataset (nie część kanonicznego polish-dynaword). Cytowanie/atrybucja HPLT v3 zgodnie z projektem HPLT.

Limitations & Biases

  • Web-crawl: obecne są szum, boilerplate, keyword-spam, treści o zmiennej jakości.
  • PII-gate ma wysoką czułość dla telefonów/identyfikatorów PL; egzotyczne formaty międzynarodowe mają niższe pokrycie (stąd drop-policy dla ogona).
  • Poza PII: lekki inline-strip boilerplate; BRAK filtrowania toksyczności/tematycznego/jakości semantycznej.

Provenance & Citation

Autor / kurator: Arkadiusz Słota (SlayerLab). Zbiór przygotowany metodycznym pipeline'em: czyszczenie + wieloetapowa bramka PII (v13→v20) z niezależną weryfikacją (deep_verify, dwa niezależne oczy), tokenizacja i statystyki korpusu, sha-tie verify==publish.

Cytowanie:

bibtex
@misc{slota_hplt_v3_pl_cleaned_2026,
  author    = {Słota, Arkadiusz},
  title     = {HPLT v3 Polish --- Cleaned \& PII-Gated},
  year      = {2026},
  publisher = {Hugging Face (SlayerLab)},
  note      = {Pochodny z HPLT v3; bramka PII v20, GREEN leak=0}
}