CoolFace
Datasetpublic

PiotrSty/saos-polish-court-judgments

SAOS Speeches Corpus — Orzeczenia Sądów Polskich Korpus orzeczeń sądowych z Systemu Analizy Orzeczeń Sądowych (SAOS), wygenerowany z oficjalnego API SAOS (www.saos.org.pl/api/dump/judgments). Statystyki Metryka Wartość Sądy sądy powszechne, Sąd Najwyższy, Naczelny Sąd Administracyjny, Trybunał Konstytucyjny Typy orzeczeń wyroki, postanowienia, uzasadnienia, zarządzenia, uchwały Rekordy 296,692 Znaki 5,895,441,856 Słowa 855,425,796 Tokeny… See the full description on the dataset page: https://huggingface.co/datasets/PiotrSty/saos-polish-court-judgments.

sourceHugging Faceunknownupdated 3mo agoView on Hugging Face
0likes255downloads
Dataset Card

SAOS Speeches Corpus — Orzeczenia Sądów Polskich

Korpus orzeczeń sądowych z Systemu Analizy Orzeczeń Sądowych (SAOS), wygenerowany z oficjalnego API SAOS (www.saos.org.pl/api/dump/judgments).

Statystyki

MetrykaWartość
Sądysądy powszechne, Sąd Najwyższy, Naczelny Sąd Administracyjny, Trybunał Konstytucyjny
Typy orzeczeńwyroki, postanowienia, uzasadnienia, zarządzenia, uchwały
Rekordy296,692
Znaki5,895,441,856
Słowa855,425,796
Tokeny (szac.)~1.1 mld
Średnia długość19,870 znaków / 2,883 słowa
Maks. długość2,260,197 znaków / 366,497 słów
Rozmiar (ZIP)1,790 MB

Pola

PoleTypOpis
idstringIdentyfikator orzeczenia w SAOS
courtTypestringTyp sądu (COMMON, SUPREME, NATIONALAPPEALCHAMBER, CONSTITUTIONAL_TRIBUNAL)
judgmentTypestringTyp orzeczenia (SENTENCE, DECISION, REASONS, REGULATION, RESOLUTION)
judgmentDatestringData orzeczenia (ISO 8601)
caseNumberslist[string]Numery sygnatur akt
judgeslist[string]Skład sędziowski
summarystringStreszczenie orzeczenia
decisionstringTreść rozstrzygnięcia
textContentstringPełny tekst uzasadnienia/orzeczenia
legalBaseslist[string]Podstawy prawne
keywordslist[string]Słowa kluczowe
referencedRegulationslist[string]Przywołane przepisy
referencedCourtCaseslist[string]Przywołane sprawy
sourcedictŹródło orzeczenia w SAOS
receiptDatestringData wpływu
divisiondictWydział/izba
text_lengthintLiczba znaków po przetworzeniu

Przetwarzanie

  1. 1.Pobranie metadanych i pełnych tekstów przez API SAOS (dump/judgments).
  2. 2.Ekstrakcja pól: dane sądowe, skład, treść, streszczenie, rozstrzygnięcie, przywołane przepisy.
  3. 3.Usunięcie tagów HTML z textContent.
  4. 4.Deduplikacja po id i hashu tekstu.
  5. 5.Redakcja PII (numery telefonów → [PHONE], emaile → [EMAIL], numery PESEL → [PESEL]).
  6. 6.Normalizacja tekstu (whitespace).
  7. 7.Dekontaminacja (n-gram overlap z lokalnym korpusem referencyjnym: LLMzSzŁ, PoQuAD, PES).
  8. 8.Wygenerowanie audytu jakości i próbki do ręcznego przeglądu.

Audyt jakości

  • —PII (przed redakcją): 2,064 telefony, 621 emaile, 175 PESEL → zredagowane
  • —Duplikaty: 1,608 usuniętych
  • —Dekontaminacja: 113 rekordów z n-gram overlap
  • —Werdykt: Obiecujący, gotowy do dalszej ewaluacji

Licencja

Orzeczenia sądowe są dokumentami urzędowymi i jako takie stanowią dobro publiczne. Projekt używa wyłącznie publicznie dostępnych danych z API SAOS.

Pipeline

Kod pipeline: C:/Users/Hipek/CascadeProjects/SAOS/scripts/

  • —scrape_saos.py — pobieranie orzeczeń z API SAOS z retry logic i progressem.
  • —process_saos.py — deduplikacja, redakcja PII, normalizacja, dekontaminacja, audyt.
  • —push_to_hf.py — publikacja na Hugging Face Hub.