CoolFace
Datasetpublic

albertobarnabo/burocrazia

BurocrazIA La burocrazia, finalmente leggibile. Il primo benchmark di IA documentale italiana. Fatture, buste paga, F24, bollette, scontrini, 730. I documenti che ogni azienda e ogni commercialista d'Italia maneggia ogni giorno — e che nessun modello di intelligenza artificiale aveva mai dovuto leggere sotto esame. Nessuno ha ancora passato l'esame. Su 255 valutazioni modello-documento, esattamente un documento è stato estratto alla perfezione. Il resto è pieno… See the full description on the dataset page: https://huggingface.co/datasets/albertobarnabo/burocrazia.

sourceHugging Faceapache-2.0updated 15d agoView on Hugging Face
0likes148downloads
Dataset Card

BurocrazIA

La burocrazia, finalmente leggibile. Il primo benchmark di IA documentale italiana.

[image]

Fatture, buste paga, F24, bollette, scontrini, 730. I documenti che ogni azienda e ogni commercialista d'Italia maneggia ogni giorno — e che nessun modello di intelligenza artificiale aveva mai dovuto leggere sotto esame.

Nessuno ha ancora passato l'esame. Su 255 valutazioni modello-documento, esattamente un documento è stato estratto alla perfezione. Il resto è pieno di errori — e, peggio, di invenzioni: sul cedolino paga il miglior modello testato si è inventato 114 valori mai stampati sul documento. Se lo usaste in produzione, sarebbero errori silenziosi nei dati di stipendio di qualcuno.

Perché esiste

Prima di BurocrazIA, l'incrocio {italiano} × {documenti fiscali/paghe} × {ground truth verificata} era vuoto. Verificato vuoto:

  • Hugging Face restituiva zero risultati per fattura, busta paga, F24, scontrino.
  • Nessun modello open pubblica un solo numero sull'italiano: olmOCR si dichiara benchmark "English-language"; docTR esce di fabbrica con un vocabolario francese che non può scrivere lunedì o più.
  • Nessun vendor — né Azure (paghe e fisco: solo en-US), né Google, né le software house italiane — pubblica un'accuratezza per l'italiano.
  • L'unica misura esistente è un avvertimento: passando da addestramento in italiano a trasferimento zero-shot dall'inglese, LayoutXLM crolla da 0,81 a 0,48 F1. Il multilingua non basta. Servono i dati.

La classifica inaugurale

Field-F1 sugli 85 documenti immagine (più alto è meglio; alluc. conta i campi predetti ma non stampati sul documento — qui inventare costa):

tipo documentodocsbaseline a regoleQwen2.5-VL-3BQwen2.5-VL-7Balluc. 7B
scontrino60.5840.8250.8812
modello 73010.0000.6150.8000
fattura (PDF)90.0410.6030.69814
bolletta200.1850.4110.56059
busta paga380.0700.2500.517114
CU20.0000.4440.38920
F2490.0000.3290.42910

Il tuo modello batte 0.517 sulla busta paga? Dimostralo: la classifica è aperta, il punteggio si calcola offline, in locale, senza account.

Per chi è

  • Software house e gestionali — misurate davvero l'estrazione automatica da fatture estere, note spese, cedolini, prima di prometterla ai clienti.
  • Team ML e ricerca — il primo eval set italiano con ground truth di campo, contratto di annotazione rigoroso e tasso d'errore pubblicato.
  • Fine-tuner — 204 annotazioni oro come seme e metro di paragone per modelli documentali italiani.

Cosa c'è dentro

  • `annotations/` — 204 annotazioni oro: 119 derivate da XML FatturaPA (esatte per costruzione) + 85 su documenti immagine, prodotte in doppio passaggio: prima annotazione assistita, poi un verificatore indipendente che ha ricontrollato i valori sui pixel. Il registro di verifica è nel dataset: 3.805 campi ricontrollati, 54 correzioni — 1,4% di errore al primo passaggio, documento per documento. Crediamo che pubblicare il proprio tasso d'errore debba diventare la norma, non l'eccezione.
  • `docs/` — gli 88 documenti redistribuibili (moduli ministeriali, file con licenza permissiva o copyleft, ognuno attribuito in LICENSES.md).
  • `fetch.py` — riscarica dai siti originali i 101 documenti che non possiamo rehostare, verificandone lo sha256. Tutto valutabile offline: niente server di valutazione, niente test set nascosto.
  • `schema/` — lo schema di annotazione: 7 tipi di documento, 104 campi tipizzati, costruito esaminando documenti veri (varianti di etichetta, trappole come i negativi col meno finale 41,25- e le tariffe paga a 5 decimali).
  • `benchmark/` — lo scorer in Python puro (score.py), il contratto per gli adapter (ADAPTERS.md) e i tre report inaugurali.

Il contratto di ground truth

  1. 1.Un campo esiste se e solo se il valore è stampato sul documento. Le caselle vuote-ma-significative (una data_cessazione vuota su un cedolino attivo) sono chiavi assenti, non stringhe vuote.
  2. 2.I valori si trascrivono come stampati — virgole decimali, trattini, segnaposto 20... Normalizza lo scorer, non l'annotatore né il modello.
  3. 3.Le sovrapposizioni didattiche delle guide (cerchietti numerati, numeri di casella) non sono contenuto del documento.

Mettilo alla prova

bash
git clone https://huggingface.co/datasets/albertobarnabo/burocrazia
cd burocrazia && python3 fetch.py
# scrivi le predizioni secondo benchmark/ADAPTERS.md, poi:
python3 benchmark/score.py --pred tue_predizioni.jsonl --subset image

Contribuisci

I due buchi che contano: CU e 730 compilati (in pubblico quasi non esistono: 3 documenti oro in tutto) e documenti fotografati (piegati, scansionati male — il mondo reale). Se hai esemplari condivisibili legalmente e senza dati personali, apri una discussione.

Limiti, detti onestamente

  • CU e 730: 3 documenti oro in totale — moduli in bianco e guide dominano il web.
  • 54 degli 85 oro immagine vengono da fonti didattiche (esercizi svolti, fac-simili annotati): layout realistici, a volte anni censurati (20..).
  • Il corpus pende verso documenti nativi digitali; la degradazione da foto e scansione è sottorappresentata.
  • fetch.py dipende dalla permanenza online delle fonti; le annotazioni restano utilizzabili per il sottoinsieme che possiedi.

Provenienza e licenze

Annotazioni, schema, scorer e script: Apache-2.0. I documenti rehostati mantengono le licenze originali (LICENSES.md); i non redistribuibili sono riferiti solo per URL + sha256. La provenienza completa di ogni documento è in manifest.jsonl. I documenti con dati personali reali sono stati messi in quarantena e non fanno parte della release in alcuna forma.

Dataset gemello: synthetic-receipts-ocr (32k scontrini sintetici, 5 locali, stessa metodologia di ground truth).


<details> <summary><b>English summary</b></summary>

BurocrazIA is the first Italian document-AI benchmark: 204 verified gold annotations over 189 real Italian business documents (invoices, payslips, F24 tax forms, utility bills, receipts, 730 declarations), a strict present-iff-printed ground-truth contract, a published 1.4% annotation error rate (3,805 fields independently re-checked), an offline stdlib scorer, and an inaugural leaderboard where the best model tested (Qwen2.5-VL-7B) extracts exactly one of 85 documents perfectly and hallucinates 114 unprinted values on payslips. Annotations/schema/code Apache-2.0; rehosted documents keep their original licenses; non-redistributable documents are fetched from their original sources with sha256 verification.

</details>

Citazione

bibtex
@misc{burocrazia-2026,
  author = {Barnabo, Alberto},
  title  = {BurocrazIA: il primo benchmark di IA documentale italiana},
  year   = {2026},
  url    = {https://huggingface.co/datasets/albertobarnabo/burocrazia}
}