rafmacalaba/data-use-ner
Data-use-ner (human holdout) GLiNER-format human-adjudicated holdout: 473 spans — annotator190 (190, origin=fcv_pads_east_africa) + jdc283 (283, origin=jdc_operational). Never trained on. Source: rafmacalaba/datause-displacement-reviewed holdout (gliner_reviewed token spans + readable_reviewed passages, v2.4 labels) with v3 probe head_score (outputs/gliner_datause_v3_probe_human473.jsonl). Columns text (full passage = " ".join(tokenized_text); span char offsets… See the full description on the dataset page: https://huggingface.co/datasets/rafmacalaba/data-use-ner.
Data-use-ner (human holdout)
GLiNER-format human-adjudicated holdout: 473 spans — annotator190 (190, origin=fcv_pads_east_africa) + jdc283 (283, origin=jdc_operational). Never trained on.
Source: rafmacalaba/datause-displacement-reviewed holdout (gliner_reviewed token spans + readable_reviewed passages, v2.4 labels) with v3 probe head_score (outputs/gliner_datause_v3_probe_human473.jsonl).
Columns
text (full passage = " ".join(tokenized_text); span char offsets index into it) + tokenized_text (whitespace tokens) + ner (catch-all DATA_MENTION word spans; drops are [] by convention — truth is spans[].luna_label) + traceability corpus_id, page, chunk, split, spans (per-span text, pred @ threshold 0.5, luna_label 1/0 (v2.4 gold), human_verdict agree/disagree/unsure + human_note (raw annotator input), head_score, threshold, char start/end into " ".join(tokenized_text), key, source).
Usage
from datasets import load_dataset
ds = load_dataset("rafmacalaba/data-use-ner", "gliner", split="holdout") # 473 rowsann = load_dataset("rafmacalaba/data-use-ner", "to_annotate") # Luna-verdict spans + passages, human_verdict null