rafmacalaba/datause-encoder-data
datause-encoder-data Training data for the data-use encoder: a page-level has_data gate plus a document-level teratopic domain classifier, in one joint dataset. Columns (same schema on every row): task — gate (page-level binary) or domain (document-level multi-label) doc_id — source document id text — page text (gate) or title+abstract (domain) has_data — 0/1 for gate rows (0 placeholder on domain rows) labels — teratopic label list for domain rows (empty on gate rows) Splits… See the full description on the dataset page: https://huggingface.co/datasets/rafmacalaba/datause-encoder-data.
094
1---2task_categories:3 - text-classification4tags:5 - data-use6 - gate7 - domain8 - multi-label9license: cc-by-4.010configs:11 - config_name: default12 data_files:13 - split: train14 path: encoder_train.jsonl15 - split: val16 path: encoder_val.jsonl17 - split: holdout18 path: encoder_holdout.jsonl19---20# datause-encoder-data21 22Training data for the data-use encoder: a page-level `has_data` gate plus a23document-level `teratopic` domain classifier, in one joint dataset.24 25Columns (same schema on every row):26- `task` — `gate` (page-level binary) or `domain` (document-level multi-label)27- `doc_id` — source document id28- `text` — page text (gate) or title+abstract (domain)29- `has_data` — 0/1 for gate rows (0 placeholder on domain rows)30- `labels` — `teratopic` label list for domain rows (empty on gate rows)31 32Splits are document-id disjoint across both tasks. The 30 teratopic labels33(in column order) are in `encoder_labels.json`.34 