CoolFace
Datasetpublic

ccdv/arxiv-summarization

Arxiv dataset for summarization Dataset for summarization of long documents.Adapted from this repo.Note that original data are pre-tokenized so this dataset returns " ".join(text) and add "\n" for paragraphs. This dataset is compatible with the run_summarization.py script from Transformers if you add this line to the summarization_name_mapping variable: "ccdv/arxiv-summarization": ("article", "abstract") Data Fields id: paper id article: a string containing the… See the full description on the dataset page: https://huggingface.co/datasets/ccdv/arxiv-summarization.

sourceHugging Faceupdated 2y agoView on Hugging Face
136likes8.3kdownloads
../
filetest-00000-of-00001.parquet100.6 MBdownload
filetrain-00000-of-00015.parquet219.0 MBdownload
filetrain-00001-of-00015.parquet217.9 MBdownload
filetrain-00002-of-00015.parquet217.4 MBdownload
filetrain-00003-of-00015.parquet216.4 MBdownload
filetrain-00004-of-00015.parquet215.9 MBdownload
filetrain-00005-of-00015.parquet216.4 MBdownload
filetrain-00006-of-00015.parquet218.0 MBdownload
filetrain-00007-of-00015.parquet219.2 MBdownload
filetrain-00008-of-00015.parquet219.7 MBdownload
filetrain-00009-of-00015.parquet217.5 MBdownload
filetrain-00010-of-00015.parquet218.8 MBdownload
filetrain-00011-of-00015.parquet220.6 MBdownload
filetrain-00012-of-00015.parquet219.5 MBdownload
filetrain-00013-of-00015.parquet219.3 MBdownload
filetrain-00014-of-00015.parquet223.9 MBdownload
filevalidation-00000-of-00001.parquet100.2 MBdownload

ccdv/arxiv-summarization · main · files are served by the source, never re-hosted here