datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
acronym_identification
Dataset Card for Acronym Identification Dataset
Dataset Summary
This dataset contains the training, validation, and test data for the Shared Task 1: Acronym Identification of the AAAI-21 Workshop on Scientific Document Understanding.
Supported Tasks and Leaderboards
The dataset supports an acronym-identification task, where the aim is to predic which tokens in a pre-tokenized sentence correspond to acronyms. The dataset was released for a Shared Task which… See the full description on the dataset page: https://huggingface.co/datasets/amirveyseh/acronym_identification.indic-voices-hinglish-nospeakeroverlap-spon3.3-acronyms-fixed2hse-acronym-dictionary-2026
Canonical landing page: https://www.smartqhse.com/datasets/hse-acronym-dictionary-2026
HSE Acronym Dictionary 2026
Authoritative reference of 150+ HSE / EHS / occupational-safety acronyms with one-line definitions. Covers metrics (TRIR, LTIFR, DART, EMR, WBGT), regulations (OSHA, RIDDOR, COSHH, CDM, COMAH, PSM, OSHAD-SF), methodologies (HAZOP, HAZID, LOPA, SIL, FMEA, RCA, BBS, ICAM, TapRooT, Tripod Beta), bodies (NEBOSH, IOSH, IIRSM, IOGP, ACGIH, NIOSH, ANSI, ASSP), and… See the full description on the dataset page: https://huggingface.co/datasets/SmartQHSE/hse-acronym-dictionary-2026.arxiv-acronym-gen
AcronymGen-Titles 🧠
AcronymGen-Titles is a dataset of over 8,000 high-quality acronym–title pairs extracted from scientific papers on arXiv. Each entry contains a scientific acronym and the corresponding paper title in which it appears. This variant contains title-only pairs — no abstracts — offering a compact and focused dataset for acronym generation, matching, or compression tasks.
📚 Dataset Overview
📦 Size: 8,070 examples
🧠 Source: Extracted from arXiv.org… See the full description on the dataset page: https://huggingface.co/datasets/sjmoran/arxiv-acronym-gen.acronym_identification_promptsource9_8_25__acronym_4o__sft_data_mp_reflectionautoeval-eval-acronym_identification-default-d87697-95015146250
Dataset Card for AutoTrain Evaluator
This repository contains model predictions generated by AutoTrain for the following task and dataset:
Task: Token Classification
Model: lewtun/autotrain-acronym-identification-7324788
Dataset: acronym_identification
Config: default
Split: train
To run new evaluation jobs, visit Hugging Face's automatic model evaluator.
Contributions
Thanks to @ebinum for evaluating this model.
en-acronymD-ExpTracker__FinEval_16k_fulleval_AT_OURS-SFT-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_AT_OURS-SFT-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_AT_OURS-SFT
Start Time: 2025-11-10T12:12:49.546328
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_AT_OURS-SFT-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with immediate… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_AT_OURS-SFT-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3arg_OT_ours_1k_atstep100-RL-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3arg_OT_ours_1k_atstep100-RL-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3arg_OT_ours_1k_atstep100-RL
Start Time: 2025-11-27T20:12:29.357503
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3arg_OT_ours_1k_atstep100-RL-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3arg_OT_ours_1k_atstep100-RL-acronym_5o__v1.sft_llama_acronym_4oautoeval-eval-acronym_identification-default-641c5d-40516105295
Dataset Card for AutoTrain Evaluator
This repository contains model predictions generated by AutoTrain for the following task and dataset:
Task: Token Classification
Model: lewtun/autotrain-acronym-identification-7324788
Dataset: acronym_identification
Config: default
Split: validation
To run new evaluation jobs, visit Hugging Face's automatic model evaluator.
Contributions
Thanks to @wandb.init(project=PROJECT for evaluating this model.
D-ExpTracker__FinEval_16k_fulleval_3args_bolt-acronym_4o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_bolt-acronym_4o
Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_3args_bolt
Start Time: 2025-10-27T14:09:56.391372
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_bolt-acronym_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with immediate… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_bolt-acronym_4o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_STaR-SFT-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_STaR-SFT-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_STaR-SFT
Start Time: 2025-11-09T01:12:47.007472
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_STaR-SFT-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_STaR-SFT-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_OT30k_Ours-SFT
Start Time: 2025-11-19T22:29:01.296532
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_BoLT-SFT-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_BoLT-SFT-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_BoLT-SFT
Start Time: 2025-11-09T00:50:47.833435
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_BoLT-SFT-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_BoLT-SFT-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_NoDiv-RL-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_NoDiv-RL-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_NoDiv-RL
Start Time: 2025-11-09T17:44:34.025361
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_NoDiv-RL-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_NoDiv-RL-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_AT_OURS-SFT-acronym_4o__v1
Experiment Tracker: FinEval_16k_fulleval_AT_OURS-SFT-acronym_4o
Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_AT_OURS-SFT
Start Time: 2025-11-10T12:24:29.427628
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_AT_OURS-SFT-acronym_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with immediate… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_AT_OURS-SFT-acronym_4o__v1.autoeval-eval-acronym_identification-default-ef327c-37654145039
Dataset Card for AutoTrain Evaluator
This repository contains model predictions generated by AutoTrain for the following task and dataset:
Task: Token Classification
Model: lewtun/autotrain-acronym-identification-7324788
Dataset: acronym_identification
Config: default
Split: train
To run new evaluation jobs, visit Hugging Face's automatic model evaluator.
Contributions
Thanks to @qingxuwenli for evaluating this model.
acronymsD-ExpTracker__FinEval_16k_fulleval_3args_Random-RL-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_Random-RL-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_Random-RL
Start Time: 2025-11-09T12:22:31.572686
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_Random-RL-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_Random-RL-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_Random-RL-acronym_4o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_Random-RL-acronym_4o
Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_3args_Random-RL
Start Time: 2025-11-09T12:29:31.882831
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_Random-RL-acronym_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_Random-RL-acronym_4o__v1.D-ExpTracker__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_4o__v1
Experiment Tracker: FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_4o
Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_OT30k_Ours-SFT
Start Time: 2025-11-19T22:41:56.065548
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_4o__v1.D-EVAL__standard_eval_v3__FinEval_16k_fulleval_3arg_OT_ours_1k-at150-RL-acronym_4o-eval_rlD-ExpTracker__FinEval_16k_fulleval_3arg_OLMO_RLONLY-RL-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3arg_OLMO_RLONLY-RL-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3arg_OLMO_RLONLY-RL
Start Time: 2025-12-01T21:53:28.580897
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3arg_OLMO_RLONLY-RL-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3arg_OLMO_RLONLY-RL-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_InstOnly-RL-acronym_4o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_InstOnly-RL-acronym_4o
Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_3args_InstOnly-RL
Start Time: 2025-11-09T13:47:13.389968
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_InstOnly-RL-acronym_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_InstOnly-RL-acronym_4o__v1.D-EVAL__standard_eval_v3__FinEval_16k_fulleval_3args_NoDiv-RL-acronym_4o-eval_rlD-EVAL__standard_eval_v3__FinEval_16k_fulleval_OT30k_Ours-SFT-acronym_4o-eval_sftautoeval-eval-acronym_identification-default-b06490-37652145038
Dataset Card for AutoTrain Evaluator
This repository contains model predictions generated by AutoTrain for the following task and dataset:
Task: Token Classification
Model: lewtun/autotrain-acronym-identification-7324788
Dataset: acronym_identification
Config: default
Split: train
To run new evaluation jobs, visit Hugging Face's automatic model evaluator.
Contributions
Thanks to @qingxuwenli for evaluating this model.
acronym-identification-1k
Dataset Card for "acronym-identification-1k"
More Information needed
