CoolFace
Datasetpublic

AccountVerify/italian-legal-corpus

Italian Legal Corpus A comprehensive corpus of Italian legal texts from 4 open-data sources, designed for training and evaluating legal NLP models. Sources Source Description Documents Normattiva All Italian national legislation (1861-2026) ~300K Corte Costituzionale Constitutional Court decisions (1956-2026) ~18K OpenGA Administrative justice metadata ~100K EUR-Lex EU legislation in Italian ~50K Schema Each record contains:… See the full description on the dataset page: https://huggingface.co/datasets/AccountVerify/italian-legal-corpus.

sourceHugging Facecc-by-4.0updated 10d agoView on Hugging Face
0likes76downloads
Dataset Card

Italian Legal Corpus

A comprehensive corpus of Italian legal texts from 4 open-data sources, designed for training and evaluating legal NLP models.

Sources

SourceDescriptionDocuments
NormattivaAll Italian national legislation (1861-2026)~300K
Corte CostituzionaleConstitutional Court decisions (1956-2026)~18K
OpenGAAdministrative justice metadata~100K
EUR-LexEU legislation in Italian~50K

Schema

Each record contains:

FieldTypeDescription
idstringGlobally unique ID ({{source}}_{{specific_id}})
sourcestringOne of: normattiva, corte_costituzionale, openga, eurlex
doc_typestringDocument type (legislation, decision, regulation, etc.)
titlestringHuman-readable title
datestring?ISO 8601 date (YYYY-MM-DD)
textstringFull cleaned text
authoritystring?Issuing authority
numberstring?Document number
yearint?Publication year
eclistring?ECLI identifier (court decisions)
text_lengthintCharacter count of text field
languagestringAlways "it"

License

The underlying legal texts are public domain (Italian law, EU law, court decisions). This dataset compilation is released under CC-BY-4.0.

Citation

bibtex
@dataset{{italian_legal_corpus_2026,
  title={{Italian Legal Corpus}},
  author={{Dossier Legal}},
  year={{2026}},
  url={{https://huggingface.co/datasets/dossier-legal/italian-legal-corpus}}
}}