RealTimeData/arxiv_alltime
RealTimeData Monthly Collection - ArXiv This datasets contains selected papers from arXiv that were created every months from 2017 to current. To access papers in a specific month, simple run the following: ds = datasets.load_dataset('RealTimeData/arxiv_alltime', '2020-02') This will give you about 1k selected papers that were created in 2020-02. Want to crawl the data by your own? Please head to LatestEval for the crawler scripts. Credit This is… See the full description on the dataset page: https://huggingface.co/datasets/RealTimeData/arxiv_alltime.
101.2k
1---2dataset_info:3- config_name: 2017-014 features:5 - name: entry_id6 dtype: string7 - name: published8 dtype: string9 - name: title10 dtype: string11 - name: authors12 sequence: string13 - name: primary_category14 dtype: string15 - name: categories16 sequence: string17 - name: text18 dtype: string19 splits:20 - name: train21 num_bytes: 1989514822 num_examples: 48223 download_size: 987723824 dataset_size: 1989514825- config_name: 2017-0226 features:27 - name: entry_id28 dtype: string29 - name: published30 dtype: string31 - name: title32 dtype: string33 - name: authors34 sequence: string35 - name: primary_category36 dtype: string37 - name: categories38 sequence: string39 - name: text40 dtype: string41 splits:42 - name: train43 num_bytes: 2011144844 num_examples: 49945 download_size: 996741346 dataset_size: 2011144847- config_name: 2017-0348 features:49 - name: entry_id50 dtype: string51 - name: published52 dtype: string53 - name: title54 dtype: string55 - name: authors56 sequence: string57 - name: primary_category58 dtype: string59 - name: categories60 sequence: string61 - name: text62 dtype: string63 splits:64 - name: train65 num_bytes: 2081572566 num_examples: 50067 download_size: 1042565368 dataset_size: 2081572569- config_name: 2017-0470 features:71 - name: entry_id72 dtype: string73 - name: published74 dtype: string75 - name: title76 dtype: string77 - name: authors78 sequence: string79 - name: primary_category80 dtype: string81 - name: categories82 sequence: string83 - name: text84 dtype: string85 splits:86 - name: train87 num_bytes: 2157557688 num_examples: 52789 download_size: 1081599290 dataset_size: 2157557691- config_name: 2017-0592 features:93 - name: entry_id94 dtype: string95 - name: published96 dtype: string97 - name: title98 dtype: string99 - name: authors100 sequence: string101 - name: primary_category102 dtype: string103 - name: categories104 sequence: string105 - name: text106 dtype: string107 splits:108 - name: train109 num_bytes: 18573038110 num_examples: 473111 download_size: 9309268112 dataset_size: 18573038113- config_name: 2017-06114 features:115 - name: entry_id116 dtype: string117 - name: published118 dtype: string119 - name: title120 dtype: string121 - name: authors122 sequence: string123 - name: primary_category124 dtype: string125 - name: categories126 sequence: string127 - name: text128 dtype: string129 splits:130 - name: train131 num_bytes: 22890828132 num_examples: 507133 download_size: 11343584134 dataset_size: 22890828135- config_name: 2017-07136 features:137 - name: entry_id138 dtype: string139 - name: published140 dtype: string141 - name: title142 dtype: string143 - name: authors144 sequence: string145 - name: primary_category146 dtype: string147 - name: categories148 sequence: string149 - name: text150 dtype: string151 splits:152 - name: train153 num_bytes: 19960611154 num_examples: 493155 download_size: 10152091156 dataset_size: 19960611157- config_name: 2017-08158 features:159 - name: entry_id160 dtype: string161 - name: published162 dtype: string163 - name: title164 dtype: string165 - name: authors166 sequence: string167 - name: primary_category168 dtype: string169 - name: categories170 sequence: string171 - name: text172 dtype: string173 splits:174 - name: train175 num_bytes: 19273098176 num_examples: 474177 download_size: 9615408178 dataset_size: 19273098179- config_name: 2017-09180 features:181 - name: entry_id182 dtype: string183 - name: published184 dtype: string185 - name: title186 dtype: string187 - name: authors188 sequence: string189 - name: primary_category190 dtype: string191 - name: categories192 sequence: string193 - name: text194 dtype: string195 splits:196 - name: train197 num_bytes: 22552151198 num_examples: 532199 download_size: 11305139200 dataset_size: 22552151201- config_name: 2017-10202 features:203 - name: entry_id204 dtype: string205 - name: published206 dtype: string207 - name: title208 dtype: string209 - name: authors210 sequence: string211 - name: primary_category212 dtype: string213 - name: categories214 sequence: string215 - name: text216 dtype: string217 splits:218 - name: train219 num_bytes: 21441238220 num_examples: 496221 download_size: 10519666222 dataset_size: 21441238223- config_name: 2017-11224 features:225 - name: entry_id226 dtype: string227 - name: published228 dtype: string229 - name: title230 dtype: string231 - name: authors232 sequence: string233 - name: primary_category234 dtype: string235 - name: categories236 sequence: string237 - name: text238 dtype: string239 splits:240 - name: train241 num_bytes: 20655484242 num_examples: 520243 download_size: 10411397244 dataset_size: 20655484245- config_name: 2017-12246 features:247 - name: entry_id248 dtype: string249 - name: published250 dtype: string251 - name: title252 dtype: string253 - name: authors254 sequence: string255 - name: primary_category256 dtype: string257 - name: categories258 sequence: string259 - name: text260 dtype: string261 splits:262 - name: train263 num_bytes: 19708202264 num_examples: 479265 download_size: 9849435266 dataset_size: 19708202267- config_name: 2018-01268 features:269 - name: entry_id270 dtype: string271 - name: published272 dtype: string273 - name: title274 dtype: string275 - name: authors276 sequence: string277 - name: primary_category278 dtype: string279 - name: categories280 sequence: string281 - name: text282 dtype: string283 splits:284 - name: train285 num_bytes: 18090140286 num_examples: 488287 download_size: 9163072288 dataset_size: 18090140289- config_name: 2018-02290 features:291 - name: entry_id292 dtype: string293 - name: published294 dtype: string295 - name: title296 dtype: string297 - name: authors298 sequence: string299 - name: primary_category300 dtype: string301 - name: categories302 sequence: string303 - name: text304 dtype: string305 splits:306 - name: train307 num_bytes: 25638031308 num_examples: 530309 download_size: 12602449310 dataset_size: 25638031311- config_name: 2018-03312 features:313 - name: entry_id314 dtype: string315 - name: published316 dtype: string317 - name: title318 dtype: string319 - name: authors320 sequence: string321 - name: primary_category322 dtype: string323 - name: categories324 sequence: string325 - name: text326 dtype: string327 splits:328 - name: train329 num_bytes: 19922782330 num_examples: 512331 download_size: 10043038332 dataset_size: 19922782333- config_name: 2018-04334 features:335 - name: entry_id336 dtype: string337 - name: published338 dtype: string339 - name: title340 dtype: string341 - name: authors342 sequence: string343 - name: primary_category344 dtype: string345 - name: categories346 sequence: string347 - name: text348 dtype: string349 splits:350 - name: train351 num_bytes: 20318335352 num_examples: 499353 download_size: 10264944354 dataset_size: 20318335355- config_name: 2018-05356 features:357 - name: entry_id358 dtype: string359 - name: published360 dtype: string361 - name: title362 dtype: string363 - name: authors364 sequence: string365 - name: primary_category366 dtype: string367 - name: categories368 sequence: string369 - name: text370 dtype: string371 splits:372 - name: train373 num_bytes: 19116513374 num_examples: 493375 download_size: 9561998376 dataset_size: 19116513377- config_name: 2018-06378 features:379 - name: entry_id380 dtype: string381 - name: published382 dtype: string383 - name: title384 dtype: string385 - name: authors386 sequence: string387 - name: primary_category388 dtype: string389 - name: categories390 sequence: string391 - name: text392 dtype: string393 splits:394 - name: train395 num_bytes: 21277471396 num_examples: 511397 download_size: 10625238398 dataset_size: 21277471399- config_name: 2018-07400 features:401 - name: entry_id402 dtype: string403 - name: published404 dtype: string405 - name: title406 dtype: string407 - name: authors408 sequence: string409 - name: primary_category410 dtype: string411 - name: categories412 sequence: string413 - name: text414 dtype: string415 splits:416 - name: train417 num_bytes: 20322860418 num_examples: 517419 download_size: 10250233420 dataset_size: 20322860421- config_name: 2018-08422 features:423 - name: entry_id424 dtype: string425 - name: published426 dtype: string427 - name: title428 dtype: string429 - name: authors430 sequence: string431 - name: primary_category432 dtype: string433 - name: categories434 sequence: string435 - name: text436 dtype: string437 splits:438 - name: train439 num_bytes: 20466912440 num_examples: 504441 download_size: 10207103442 dataset_size: 20466912443- config_name: 2018-09444 features:445 - name: entry_id446 dtype: string447 - name: published448 dtype: string449 - name: title450 dtype: string451 - name: authors452 sequence: string453 - name: primary_category454 dtype: string455 - name: categories456 sequence: string457 - name: text458 dtype: string459 splits:460 - name: train461 num_bytes: 21521957462 num_examples: 516463 download_size: 10292535464 dataset_size: 21521957465- config_name: 2018-10466 features:467 - name: entry_id468 dtype: string469 - name: published470 dtype: string471 - name: title472 dtype: string473 - name: authors474 sequence: string475 - name: primary_category476 dtype: string477 - name: categories478 sequence: string479 - name: text480 dtype: string481 splits:482 - name: train483 num_bytes: 22892365484 num_examples: 532485 download_size: 11360268486 dataset_size: 22892365487- config_name: 2018-11488 features:489 - name: entry_id490 dtype: string491 - name: published492 dtype: string493 - name: title494 dtype: string495 - name: authors496 sequence: string497 - name: primary_category498 dtype: string499 - name: categories500 sequence: string501 - name: text502 dtype: string503 splits:504 - name: train505 num_bytes: 22750886506 num_examples: 531507 download_size: 11400549508 dataset_size: 22750886509- config_name: 2018-12510 features:511 - name: entry_id512 dtype: string513 - name: published514 dtype: string515 - name: title516 dtype: string517 - name: authors518 sequence: string519 - name: primary_category520 dtype: string521 - name: categories522 sequence: string523 - name: text524 dtype: string525 splits:526 - name: train527 num_bytes: 19157411528 num_examples: 475529 download_size: 9548624530 dataset_size: 19157411531- config_name: 2019-01532 features:533 - name: entry_id534 dtype: string535 - name: published536 dtype: string537 - name: title538 dtype: string539 - name: authors540 sequence: string541 - name: primary_category542 dtype: string543 - name: categories544 sequence: string545 - name: text546 dtype: string547 splits:548 - name: train549 num_bytes: 21024786550 num_examples: 498551 download_size: 10499015552 dataset_size: 21024786553- config_name: 2019-02554 features:555 - name: entry_id556 dtype: string557 - name: published558 dtype: string559 - name: title560 dtype: string561 - name: authors562 sequence: string563 - name: primary_category564 dtype: string565 - name: categories566 sequence: string567 - name: text568 dtype: string569 splits:570 - name: train571 num_bytes: 21517028572 num_examples: 506573 download_size: 10736779574 dataset_size: 21517028575- config_name: 2019-03576 features:577 - name: entry_id578 dtype: string579 - name: published580 dtype: string581 - name: title582 dtype: string583 - name: authors584 sequence: string585 - name: primary_category586 dtype: string587 - name: categories588 sequence: string589 - name: text590 dtype: string591 splits:592 - name: train593 num_bytes: 21397298594 num_examples: 500595 download_size: 10804690596 dataset_size: 21397298597- config_name: 2019-04598 features:599 - name: entry_id600 dtype: string601 - name: published602 dtype: string603 - name: title604 dtype: string605 - name: authors606 sequence: string607 - name: primary_category608 dtype: string609 - name: categories610 sequence: string611 - name: text612 dtype: string613 splits:614 - name: train615 num_bytes: 23049654616 num_examples: 535617 download_size: 11329714618 dataset_size: 23049654619- config_name: 2019-05620 features:621 - name: entry_id622 dtype: string623 - name: published624 dtype: string625 - name: title626 dtype: string627 - name: authors628 sequence: string629 - name: primary_category630 dtype: string631 - name: categories632 sequence: string633 - name: text634 dtype: string635 splits:636 - name: train637 num_bytes: 21896838638 num_examples: 522639 download_size: 10901776640 dataset_size: 21896838641- config_name: 2019-06642 features:643 - name: entry_id644 dtype: string645 - name: published646 dtype: string647 - name: title648 dtype: string649 - name: authors650 sequence: string651 - name: primary_category652 dtype: string653 - name: categories654 sequence: string655 - name: text656 dtype: string657 splits:658 - name: train659 num_bytes: 21468690660 num_examples: 528661 download_size: 10809206662 dataset_size: 21468690663- config_name: 2019-07664 features:665 - name: entry_id666 dtype: string667 - name: published668 dtype: string669 - name: title670 dtype: string671 - name: authors672 sequence: string673 - name: primary_category674 dtype: string675 - name: categories676 sequence: string677 - name: text678 dtype: string679 splits:680 - name: train681 num_bytes: 21426189682 num_examples: 545683 download_size: 10730941684 dataset_size: 21426189685- config_name: 2019-08686 features:687 - name: entry_id688 dtype: string689 - name: published690 dtype: string691 - name: title692 dtype: string693 - name: authors694 sequence: string695 - name: primary_category696 dtype: string697 - name: categories698 sequence: string699 - name: text700 dtype: string701 splits:702 - name: train703 num_bytes: 21414686704 num_examples: 532705 download_size: 10639416706 dataset_size: 21414686707- config_name: 2019-09708 features:709 - name: entry_id710 dtype: string711 - name: published712 dtype: string713 - name: title714 dtype: string715 - name: authors716 sequence: string717 - name: primary_category718 dtype: string719 - name: categories720 sequence: string721 - name: text722 dtype: string723 splits:724 - name: train725 num_bytes: 22329624726 num_examples: 538727 download_size: 11263704728 dataset_size: 22329624729- config_name: 2019-10730 features:731 - name: entry_id732 dtype: string733 - name: published734 dtype: string735 - name: title736 dtype: string737 - name: authors738 sequence: string739 - name: primary_category740 dtype: string741 - name: categories742 sequence: string743 - name: text744 dtype: string745 splits:746 - name: train747 num_bytes: 21915199748 num_examples: 520749 download_size: 10766785750 dataset_size: 21915199751- config_name: 2019-11752 features:753 - name: entry_id754 dtype: string755 - name: published756 dtype: string757 - name: title758 dtype: string759 - name: authors760 sequence: string761 - name: primary_category762 dtype: string763 - name: categories764 sequence: string765 - name: text766 dtype: string767 splits:768 - name: train769 num_bytes: 22579122770 num_examples: 547771 download_size: 11257630772 dataset_size: 22579122773- config_name: 2019-12774 features:775 - name: entry_id776 dtype: string777 - name: published778 dtype: string779 - name: title780 dtype: string781 - name: authors782 sequence: string783 - name: primary_category784 dtype: string785 - name: categories786 sequence: string787 - name: text788 dtype: string789 splits:790 - name: train791 num_bytes: 21546668792 num_examples: 514793 download_size: 10715205794 dataset_size: 21546668795- config_name: 2020-01796 features:797 - name: entry_id798 dtype: string799 - name: published800 dtype: string801 - name: title802 dtype: string803 - name: authors804 sequence: string805 - name: primary_category806 dtype: string807 - name: categories808 sequence: string809 - name: text810 dtype: string811 splits:812 - name: train813 num_bytes: 21724474814 num_examples: 507815 download_size: 10799528816 dataset_size: 21724474817- config_name: 2020-02818 features:819 - name: entry_id820 dtype: string821 - name: published822 dtype: string823 - name: title824 dtype: string825 - name: authors826 sequence: string827 - name: primary_category828 dtype: string829 - name: categories830 sequence: string831 - name: text832 dtype: string833 splits:834 - name: train835 num_bytes: 23643655836 num_examples: 554837 download_size: 11764632838 dataset_size: 23643655839- config_name: 2020-03840 features:841 - name: entry_id842 dtype: string843 - name: published844 dtype: string845 - name: title846 dtype: string847 - name: authors848 sequence: string849 - name: primary_category850 dtype: string851 - name: categories852 sequence: string853 - name: text854 dtype: string855 splits:856 - name: train857 num_bytes: 21444794858 num_examples: 519859 download_size: 10663961860 dataset_size: 21444794861- config_name: 2020-04862 features:863 - name: entry_id864 dtype: string865 - name: published866 dtype: string867 - name: title868 dtype: string869 - name: authors870 sequence: string871 - name: primary_category872 dtype: string873 - name: categories874 sequence: string875 - name: text876 dtype: string877 splits:878 - name: train879 num_bytes: 21944387880 num_examples: 520881 download_size: 10912679882 dataset_size: 21944387883- config_name: 2020-05884 features:885 - name: entry_id886 dtype: string887 - name: published888 dtype: string889 - name: title890 dtype: string891 - name: authors892 sequence: string893 - name: primary_category894 dtype: string895 - name: categories896 sequence: string897 - name: text898 dtype: string899 splits:900 - name: train901 num_bytes: 23067240902 num_examples: 553903 download_size: 11652654904 dataset_size: 23067240905- config_name: 2020-06906 features:907 - name: entry_id908 dtype: string909 - name: published910 dtype: string911 - name: title912 dtype: string913 - name: authors914 sequence: string915 - name: primary_category916 dtype: string917 - name: categories918 sequence: string919 - name: text920 dtype: string921 splits:922 - name: train923 num_bytes: 23135770924 num_examples: 524925 download_size: 11385738926 dataset_size: 23135770927- config_name: 2020-07928 features:929 - name: entry_id930 dtype: string931 - name: published932 dtype: string933 - name: title934 dtype: string935 - name: authors936 sequence: string937 - name: primary_category938 dtype: string939 - name: categories940 sequence: string941 - name: text942 dtype: string943 splits:944 - name: train945 num_bytes: 23826584946 num_examples: 537947 download_size: 11858237948 dataset_size: 23826584949- config_name: 2020-08950 features:951 - name: entry_id952 dtype: string953 - name: published954 dtype: string955 - name: title956 dtype: string957 - name: authors958 sequence: string959 - name: primary_category960 dtype: string961 - name: categories962 sequence: string963 - name: text964 dtype: string965 splits:966 - name: train967 num_bytes: 23923168968 num_examples: 547969 download_size: 12001299970 dataset_size: 23923168971- config_name: 2020-09972 features:973 - name: entry_id974 dtype: string975 - name: published976 dtype: string977 - name: title978 dtype: string979 - name: authors980 sequence: string981 - name: primary_category982 dtype: string983 - name: categories984 sequence: string985 - name: text986 dtype: string987 splits:988 - name: train989 num_bytes: 23329683990 num_examples: 533991 download_size: 11503691992 dataset_size: 23329683993- config_name: 2020-10994 features:995 - name: entry_id996 dtype: string997 - name: published998 dtype: string999 - name: title1000 dtype: string1001 - name: authors1002 sequence: string1003 - name: primary_category1004 dtype: string1005 - name: categories1006 sequence: string1007 - name: text1008 dtype: string1009 splits:1010 - name: train1011 num_bytes: 230279551012 num_examples: 5221013 download_size: 114149341014 dataset_size: 230279551015- config_name: 2020-111016 features:1017 - name: entry_id1018 dtype: string1019 - name: published1020 dtype: string1021 - name: title1022 dtype: string1023 - name: authors1024 sequence: string1025 - name: primary_category1026 dtype: string1027 - name: categories1028 sequence: string1029 - name: text1030 dtype: string1031 splits:1032 - name: train1033 num_bytes: 231698351034 num_examples: 5231035 download_size: 114741291036 dataset_size: 231698351037- config_name: 2020-121038 features:1039 - name: entry_id1040 dtype: string1041 - name: published1042 dtype: string1043 - name: title1044 dtype: string1045 - name: authors1046 sequence: string1047 - name: primary_category1048 dtype: string1049 - name: categories1050 sequence: string1051 - name: text1052 dtype: string1053 splits:1054 - name: train1055 num_bytes: 220105791056 num_examples: 5101057 download_size: 108487141058 dataset_size: 220105791059- config_name: 2021-011060 features:1061 - name: entry_id1062 dtype: string1063 - name: published1064 dtype: string1065 - name: title1066 dtype: string1067 - name: authors1068 sequence: string1069 - name: primary_category1070 dtype: string1071 - name: categories1072 sequence: string1073 - name: text1074 dtype: string1075 splits:1076 - name: train1077 num_bytes: 228789791078 num_examples: 5181079 download_size: 113951471080 dataset_size: 228789791081- config_name: 2021-021082 features:1083 - name: entry_id1084 dtype: string1085 - name: published1086 dtype: string1087 - name: title1088 dtype: string1089 - name: authors1090 sequence: string1091 - name: primary_category1092 dtype: string1093 - name: categories1094 sequence: string1095 - name: text1096 dtype: string1097 splits:1098 - name: train1099 num_bytes: 240722641100 num_examples: 5091101 download_size: 119569291102 dataset_size: 240722641103- config_name: 2021-031104 features:1105 - name: entry_id1106 dtype: string1107 - name: published1108 dtype: string1109 - name: title1110 dtype: string1111 - name: authors1112 sequence: string1113 - name: primary_category1114 dtype: string1115 - name: categories1116 sequence: string1117 - name: text1118 dtype: string1119 splits:1120 - name: train1121 num_bytes: 223713441122 num_examples: 5201123 download_size: 110924591124 dataset_size: 223713441125- config_name: 2021-041126 features:1127 - name: entry_id1128 dtype: string1129 - name: published1130 dtype: string1131 - name: title1132 dtype: string1133 - name: authors1134 sequence: string1135 - name: primary_category1136 dtype: string1137 - name: categories1138 sequence: string1139 - name: text1140 dtype: string1141 splits:1142 - name: train1143 num_bytes: 240385521144 num_examples: 5341145 download_size: 118775321146 dataset_size: 240385521147- config_name: 2021-051148 features:1149 - name: entry_id1150 dtype: string1151 - name: published1152 dtype: string1153 - name: title1154 dtype: string1155 - name: authors1156 sequence: string1157 - name: primary_category1158 dtype: string1159 - name: categories1160 sequence: string1161 - name: text1162 dtype: string1163 splits:1164 - name: train1165 num_bytes: 251346681166 num_examples: 5311167 download_size: 124429681168 dataset_size: 251346681169- config_name: 2021-061170 features:1171 - name: entry_id1172 dtype: string1173 - name: published1174 dtype: string1175 - name: title1176 dtype: string1177 - name: authors1178 sequence: string1179 - name: primary_category1180 dtype: string1181 - name: categories1182 sequence: string1183 - name: text1184 dtype: string1185 splits:1186 - name: train1187 num_bytes: 239601501188 num_examples: 5131189 download_size: 119254961190 dataset_size: 239601501191- config_name: 2021-071192 features:1193 - name: entry_id1194 dtype: string1195 - name: published1196 dtype: string1197 - name: title1198 dtype: string1199 - name: authors1200 sequence: string