CoolFace
Datasetpublic

rafmacalaba/datause-encoder-data

datause-encoder-data Training data for the data-use encoder: a page-level has_data gate plus a document-level teratopic domain classifier, in one joint dataset. Columns (same schema on every row): task — gate (page-level binary) or domain (document-level multi-label) doc_id — source document id text — page text (gate) or title+abstract (domain) has_data — 0/1 for gate rows (0 placeholder on domain rows) labels — teratopic label list for domain rows (empty on gate rows) Splits… See the full description on the dataset page: https://huggingface.co/datasets/rafmacalaba/datause-encoder-data.

sourceHugging Facecc-by-4.0updated 1mo agoView on Hugging Face
0likes94downloads
README.md34 linesDownload Raw Back to root
1---2task_categories:3  - text-classification4tags:5  - data-use6  - gate7  - domain8  - multi-label9license: cc-by-4.010configs:11  - config_name: default12    data_files:13      - split: train14        path: encoder_train.jsonl15      - split: val16        path: encoder_val.jsonl17      - split: holdout18        path: encoder_holdout.jsonl19---20# datause-encoder-data21 22Training data for the data-use encoder: a page-level `has_data` gate plus a23document-level `teratopic` domain classifier, in one joint dataset.24 25Columns (same schema on every row):26- `task` — `gate` (page-level binary) or `domain` (document-level multi-label)27- `doc_id` — source document id28- `text` — page text (gate) or title+abstract (domain)29- `has_data` — 0/1 for gate rows (0 placeholder on domain rows)30- `labels` — `teratopic` label list for domain rows (empty on gate rows)31 32Splits are document-id disjoint across both tasks. The 30 teratopic labels33(in column order) are in `encoder_labels.json`.34