ccdv/arxiv-summarization
Arxiv dataset for summarization Dataset for summarization of long documents.Adapted from this repo.Note that original data are pre-tokenized so this dataset returns " ".join(text) and add "\n" for paragraphs. This dataset is compatible with the run_summarization.py script from Transformers if you add this line to the summarization_name_mapping variable: "ccdv/arxiv-summarization": ("article", "abstract") Data Fields id: paper id article: a string containing the… See the full description on the dataset page: https://huggingface.co/datasets/ccdv/arxiv-summarization.
Convert dataset to Parquet (#7)
Update README.md (#4)
Fix task tags (#3)
Fix task_categories (#2)
Fix language tag (#1)
for windows
remove <S> </S>
back
fix
add sections
update readme
first
initial commit
