albertobarnabo/burocrazia
BurocrazIA La burocrazia, finalmente leggibile. Il primo benchmark di IA documentale italiana. Fatture, buste paga, F24, bollette, scontrini, 730. I documenti che ogni azienda e ogni commercialista d'Italia maneggia ogni giorno — e che nessun modello di intelligenza artificiale aveva mai dovuto leggere sotto esame. Nessuno ha ancora passato l'esame. Su 255 valutazioni modello-documento, esattamente un documento è stato estratto alla perfezione. Il resto è pieno… See the full description on the dataset page: https://huggingface.co/datasets/albertobarnabo/burocrazia.
BurocrazIA
La burocrazia, finalmente leggibile. Il primo benchmark di IA documentale italiana.
Fatture, buste paga, F24, bollette, scontrini, 730. I documenti che ogni azienda e ogni commercialista d'Italia maneggia ogni giorno — e che nessun modello di intelligenza artificiale aveva mai dovuto leggere sotto esame.
Nessuno ha ancora passato l'esame. Su 255 valutazioni modello-documento, esattamente un documento è stato estratto alla perfezione. Il resto è pieno di errori — e, peggio, di invenzioni: sul cedolino paga il miglior modello testato si è inventato 114 valori mai stampati sul documento. Se lo usaste in produzione, sarebbero errori silenziosi nei dati di stipendio di qualcuno.
Perché esiste
Prima di BurocrazIA, l'incrocio {italiano} × {documenti fiscali/paghe} × {ground truth verificata} era vuoto. Verificato vuoto:
- Hugging Face restituiva zero risultati per
fattura,busta paga,F24,scontrino. - Nessun modello open pubblica un solo numero sull'italiano: olmOCR si dichiara benchmark "English-language"; docTR esce di fabbrica con un vocabolario francese che non può scrivere
lunedìopiù. - Nessun vendor — né Azure (paghe e fisco: solo en-US), né Google, né le software house italiane — pubblica un'accuratezza per l'italiano.
- L'unica misura esistente è un avvertimento: passando da addestramento in italiano a trasferimento zero-shot dall'inglese, LayoutXLM crolla da 0,81 a 0,48 F1. Il multilingua non basta. Servono i dati.
La classifica inaugurale
Field-F1 sugli 85 documenti immagine (più alto è meglio; alluc. conta i campi predetti ma non stampati sul documento — qui inventare costa):
Il tuo modello batte 0.517 sulla busta paga? Dimostralo: la classifica è aperta, il punteggio si calcola offline, in locale, senza account.
Per chi è
- Software house e gestionali — misurate davvero l'estrazione automatica da fatture estere, note spese, cedolini, prima di prometterla ai clienti.
- Team ML e ricerca — il primo eval set italiano con ground truth di campo, contratto di annotazione rigoroso e tasso d'errore pubblicato.
- Fine-tuner — 204 annotazioni oro come seme e metro di paragone per modelli documentali italiani.
Cosa c'è dentro
- `annotations/` — 204 annotazioni oro: 119 derivate da XML FatturaPA (esatte per costruzione) + 85 su documenti immagine, prodotte in doppio passaggio: prima annotazione assistita, poi un verificatore indipendente che ha ricontrollato i valori sui pixel. Il registro di verifica è nel dataset: 3.805 campi ricontrollati, 54 correzioni — 1,4% di errore al primo passaggio, documento per documento. Crediamo che pubblicare il proprio tasso d'errore debba diventare la norma, non l'eccezione.
- `docs/` — gli 88 documenti redistribuibili (moduli ministeriali, file con licenza permissiva o copyleft, ognuno attribuito in
LICENSES.md). - `fetch.py` — riscarica dai siti originali i 101 documenti che non possiamo rehostare, verificandone lo sha256. Tutto valutabile offline: niente server di valutazione, niente test set nascosto.
- `schema/` — lo schema di annotazione: 7 tipi di documento, 104 campi tipizzati, costruito esaminando documenti veri (varianti di etichetta, trappole come i negativi col meno finale
41,25-e le tariffe paga a 5 decimali). - `benchmark/` — lo scorer in Python puro (
score.py), il contratto per gli adapter (ADAPTERS.md) e i tre report inaugurali.
Il contratto di ground truth
- Un campo esiste se e solo se il valore è stampato sul documento. Le caselle vuote-ma-significative (una
data_cessazionevuota su un cedolino attivo) sono chiavi assenti, non stringhe vuote. - I valori si trascrivono come stampati — virgole decimali, trattini, segnaposto
20... Normalizza lo scorer, non l'annotatore né il modello. - Le sovrapposizioni didattiche delle guide (cerchietti numerati, numeri di casella) non sono contenuto del documento.
Mettilo alla prova
git clone https://huggingface.co/datasets/albertobarnabo/burocrazia
cd burocrazia && python3 fetch.py
# scrivi le predizioni secondo benchmark/ADAPTERS.md, poi:
python3 benchmark/score.py --pred tue_predizioni.jsonl --subset imageContribuisci
I due buchi che contano: CU e 730 compilati (in pubblico quasi non esistono: 3 documenti oro in tutto) e documenti fotografati (piegati, scansionati male — il mondo reale). Se hai esemplari condivisibili legalmente e senza dati personali, apri una discussione.
Limiti, detti onestamente
- CU e 730: 3 documenti oro in totale — moduli in bianco e guide dominano il web.
- 54 degli 85 oro immagine vengono da fonti didattiche (esercizi svolti, fac-simili annotati): layout realistici, a volte anni censurati (
20..). - Il corpus pende verso documenti nativi digitali; la degradazione da foto e scansione è sottorappresentata.
fetch.pydipende dalla permanenza online delle fonti; le annotazioni restano utilizzabili per il sottoinsieme che possiedi.
Provenienza e licenze
Annotazioni, schema, scorer e script: Apache-2.0. I documenti rehostati mantengono le licenze originali (LICENSES.md); i non redistribuibili sono riferiti solo per URL + sha256. La provenienza completa di ogni documento è in manifest.jsonl. I documenti con dati personali reali sono stati messi in quarantena e non fanno parte della release in alcuna forma.
Dataset gemello: synthetic-receipts-ocr (32k scontrini sintetici, 5 locali, stessa metodologia di ground truth).
<details> <summary><b>English summary</b></summary>
BurocrazIA is the first Italian document-AI benchmark: 204 verified gold annotations over 189 real Italian business documents (invoices, payslips, F24 tax forms, utility bills, receipts, 730 declarations), a strict present-iff-printed ground-truth contract, a published 1.4% annotation error rate (3,805 fields independently re-checked), an offline stdlib scorer, and an inaugural leaderboard where the best model tested (Qwen2.5-VL-7B) extracts exactly one of 85 documents perfectly and hallucinates 114 unprinted values on payslips. Annotations/schema/code Apache-2.0; rehosted documents keep their original licenses; non-redistributable documents are fetched from their original sources with sha256 verification.
</details>
Citazione
@misc{burocrazia-2026,
author = {Barnabo, Alberto},
title = {BurocrazIA: il primo benchmark di IA documentale italiana},
year = {2026},
url = {https://huggingface.co/datasets/albertobarnabo/burocrazia}
}