datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
multi-domain-document-classification
multi_domain_document_classification
Multi-domain document classification datasets.
Biomedical: chemprot, rct-sample
Computer Science: citation_intent, sciie
Customer Review: amcd, yelp_review
Social Media: tweet_eval_irony, tweet_eval_hate, tweet_eval_emotion
The yelp_review dataset is randomly downsampled to 2000/2000/8000 for test/validation/train.
chemprot
citation_intent
hyperpartisan_news
rct_sample
sciie
amcd
yelp_review
tweet_eval_irony
tweet_eval_hate… See the full description on the dataset page: https://huggingface.co/datasets/asahi417/multi-domain-document-classification.klue-mrc-gpt4o-generate-multi-document-answerklue-mrc-multi-document-answerklue-mrc-multi-document-answerFinance-Law-multi-document-answerResearchAssitant-multi-document-answerklue-mrc-multi-document-answerklue-mrc-multi-document-answerklue-mrc-multi-document-answerklue-mrc-multi-document-answermultidocument_summarization_dataset
