PiotrSty/saos-polish-court-judgments
SAOS Speeches Corpus — Orzeczenia Sądów Polskich Korpus orzeczeń sądowych z Systemu Analizy Orzeczeń Sądowych (SAOS), wygenerowany z oficjalnego API SAOS (www.saos.org.pl/api/dump/judgments). Statystyki Metryka Wartość Sądy sądy powszechne, Sąd Najwyższy, Naczelny Sąd Administracyjny, Trybunał Konstytucyjny Typy orzeczeń wyroki, postanowienia, uzasadnienia, zarządzenia, uchwały Rekordy 296,692 Znaki 5,895,441,856 Słowa 855,425,796 Tokeny… See the full description on the dataset page: https://huggingface.co/datasets/PiotrSty/saos-polish-court-judgments.
SAOS Speeches Corpus — Orzeczenia Sądów Polskich
Korpus orzeczeń sądowych z Systemu Analizy Orzeczeń Sądowych (SAOS), wygenerowany z oficjalnego API SAOS (www.saos.org.pl/api/dump/judgments).
Statystyki
Pola
Przetwarzanie
- Pobranie metadanych i pełnych tekstów przez API SAOS (
dump/judgments). - Ekstrakcja pól: dane sądowe, skład, treść, streszczenie, rozstrzygnięcie, przywołane przepisy.
- Usunięcie tagów HTML z
textContent. - Deduplikacja po
idi hashu tekstu. - Redakcja PII (numery telefonów →
[PHONE], emaile →[EMAIL], numery PESEL →[PESEL]). - Normalizacja tekstu (whitespace).
- Dekontaminacja (n-gram overlap z lokalnym korpusem referencyjnym: LLMzSzŁ, PoQuAD, PES).
- Wygenerowanie audytu jakości i próbki do ręcznego przeglądu.
Audyt jakości
- PII (przed redakcją): 2,064 telefony, 621 emaile, 175 PESEL → zredagowane
- Duplikaty: 1,608 usuniętych
- Dekontaminacja: 113 rekordów z n-gram overlap
- Werdykt: Obiecujący, gotowy do dalszej ewaluacji
Licencja
Orzeczenia sądowe są dokumentami urzędowymi i jako takie stanowią dobro publiczne. Projekt używa wyłącznie publicznie dostępnych danych z API SAOS.
Pipeline
Kod pipeline: C:/Users/Hipek/CascadeProjects/SAOS/scripts/
scrape_saos.py— pobieranie orzeczeń z API SAOS z retry logic i progressem.process_saos.py— deduplikacja, redakcja PII, normalizacja, dekontaminacja, audyt.push_to_hf.py— publikacja na Hugging Face Hub.
