CoolFace
Datasetpublic

RealTimeData/arxiv_alltime

RealTimeData Monthly Collection - ArXiv This datasets contains selected papers from arXiv that were created every months from 2017 to current. To access papers in a specific month, simple run the following: ds = datasets.load_dataset('RealTimeData/arxiv_alltime', '2020-02') This will give you about 1k selected papers that were created in 2020-02. Want to crawl the data by your own? Please head to LatestEval for the crawler scripts. Credit This is… See the full description on the dataset page: https://huggingface.co/datasets/RealTimeData/arxiv_alltime.

sourceHugging Faceupdated 1y agoView on Hugging Face
10likes1.2kdownloads
README.md2614 linesDownload Raw Back to root
1---2dataset_info:3- config_name: 2017-014  features:5  - name: entry_id6    dtype: string7  - name: published8    dtype: string9  - name: title10    dtype: string11  - name: authors12    sequence: string13  - name: primary_category14    dtype: string15  - name: categories16    sequence: string17  - name: text18    dtype: string19  splits:20  - name: train21    num_bytes: 1989514822    num_examples: 48223  download_size: 987723824  dataset_size: 1989514825- config_name: 2017-0226  features:27  - name: entry_id28    dtype: string29  - name: published30    dtype: string31  - name: title32    dtype: string33  - name: authors34    sequence: string35  - name: primary_category36    dtype: string37  - name: categories38    sequence: string39  - name: text40    dtype: string41  splits:42  - name: train43    num_bytes: 2011144844    num_examples: 49945  download_size: 996741346  dataset_size: 2011144847- config_name: 2017-0348  features:49  - name: entry_id50    dtype: string51  - name: published52    dtype: string53  - name: title54    dtype: string55  - name: authors56    sequence: string57  - name: primary_category58    dtype: string59  - name: categories60    sequence: string61  - name: text62    dtype: string63  splits:64  - name: train65    num_bytes: 2081572566    num_examples: 50067  download_size: 1042565368  dataset_size: 2081572569- config_name: 2017-0470  features:71  - name: entry_id72    dtype: string73  - name: published74    dtype: string75  - name: title76    dtype: string77  - name: authors78    sequence: string79  - name: primary_category80    dtype: string81  - name: categories82    sequence: string83  - name: text84    dtype: string85  splits:86  - name: train87    num_bytes: 2157557688    num_examples: 52789  download_size: 1081599290  dataset_size: 2157557691- config_name: 2017-0592  features:93  - name: entry_id94    dtype: string95  - name: published96    dtype: string97  - name: title98    dtype: string99  - name: authors100    sequence: string101  - name: primary_category102    dtype: string103  - name: categories104    sequence: string105  - name: text106    dtype: string107  splits:108  - name: train109    num_bytes: 18573038110    num_examples: 473111  download_size: 9309268112  dataset_size: 18573038113- config_name: 2017-06114  features:115  - name: entry_id116    dtype: string117  - name: published118    dtype: string119  - name: title120    dtype: string121  - name: authors122    sequence: string123  - name: primary_category124    dtype: string125  - name: categories126    sequence: string127  - name: text128    dtype: string129  splits:130  - name: train131    num_bytes: 22890828132    num_examples: 507133  download_size: 11343584134  dataset_size: 22890828135- config_name: 2017-07136  features:137  - name: entry_id138    dtype: string139  - name: published140    dtype: string141  - name: title142    dtype: string143  - name: authors144    sequence: string145  - name: primary_category146    dtype: string147  - name: categories148    sequence: string149  - name: text150    dtype: string151  splits:152  - name: train153    num_bytes: 19960611154    num_examples: 493155  download_size: 10152091156  dataset_size: 19960611157- config_name: 2017-08158  features:159  - name: entry_id160    dtype: string161  - name: published162    dtype: string163  - name: title164    dtype: string165  - name: authors166    sequence: string167  - name: primary_category168    dtype: string169  - name: categories170    sequence: string171  - name: text172    dtype: string173  splits:174  - name: train175    num_bytes: 19273098176    num_examples: 474177  download_size: 9615408178  dataset_size: 19273098179- config_name: 2017-09180  features:181  - name: entry_id182    dtype: string183  - name: published184    dtype: string185  - name: title186    dtype: string187  - name: authors188    sequence: string189  - name: primary_category190    dtype: string191  - name: categories192    sequence: string193  - name: text194    dtype: string195  splits:196  - name: train197    num_bytes: 22552151198    num_examples: 532199  download_size: 11305139200  dataset_size: 22552151201- config_name: 2017-10202  features:203  - name: entry_id204    dtype: string205  - name: published206    dtype: string207  - name: title208    dtype: string209  - name: authors210    sequence: string211  - name: primary_category212    dtype: string213  - name: categories214    sequence: string215  - name: text216    dtype: string217  splits:218  - name: train219    num_bytes: 21441238220    num_examples: 496221  download_size: 10519666222  dataset_size: 21441238223- config_name: 2017-11224  features:225  - name: entry_id226    dtype: string227  - name: published228    dtype: string229  - name: title230    dtype: string231  - name: authors232    sequence: string233  - name: primary_category234    dtype: string235  - name: categories236    sequence: string237  - name: text238    dtype: string239  splits:240  - name: train241    num_bytes: 20655484242    num_examples: 520243  download_size: 10411397244  dataset_size: 20655484245- config_name: 2017-12246  features:247  - name: entry_id248    dtype: string249  - name: published250    dtype: string251  - name: title252    dtype: string253  - name: authors254    sequence: string255  - name: primary_category256    dtype: string257  - name: categories258    sequence: string259  - name: text260    dtype: string261  splits:262  - name: train263    num_bytes: 19708202264    num_examples: 479265  download_size: 9849435266  dataset_size: 19708202267- config_name: 2018-01268  features:269  - name: entry_id270    dtype: string271  - name: published272    dtype: string273  - name: title274    dtype: string275  - name: authors276    sequence: string277  - name: primary_category278    dtype: string279  - name: categories280    sequence: string281  - name: text282    dtype: string283  splits:284  - name: train285    num_bytes: 18090140286    num_examples: 488287  download_size: 9163072288  dataset_size: 18090140289- config_name: 2018-02290  features:291  - name: entry_id292    dtype: string293  - name: published294    dtype: string295  - name: title296    dtype: string297  - name: authors298    sequence: string299  - name: primary_category300    dtype: string301  - name: categories302    sequence: string303  - name: text304    dtype: string305  splits:306  - name: train307    num_bytes: 25638031308    num_examples: 530309  download_size: 12602449310  dataset_size: 25638031311- config_name: 2018-03312  features:313  - name: entry_id314    dtype: string315  - name: published316    dtype: string317  - name: title318    dtype: string319  - name: authors320    sequence: string321  - name: primary_category322    dtype: string323  - name: categories324    sequence: string325  - name: text326    dtype: string327  splits:328  - name: train329    num_bytes: 19922782330    num_examples: 512331  download_size: 10043038332  dataset_size: 19922782333- config_name: 2018-04334  features:335  - name: entry_id336    dtype: string337  - name: published338    dtype: string339  - name: title340    dtype: string341  - name: authors342    sequence: string343  - name: primary_category344    dtype: string345  - name: categories346    sequence: string347  - name: text348    dtype: string349  splits:350  - name: train351    num_bytes: 20318335352    num_examples: 499353  download_size: 10264944354  dataset_size: 20318335355- config_name: 2018-05356  features:357  - name: entry_id358    dtype: string359  - name: published360    dtype: string361  - name: title362    dtype: string363  - name: authors364    sequence: string365  - name: primary_category366    dtype: string367  - name: categories368    sequence: string369  - name: text370    dtype: string371  splits:372  - name: train373    num_bytes: 19116513374    num_examples: 493375  download_size: 9561998376  dataset_size: 19116513377- config_name: 2018-06378  features:379  - name: entry_id380    dtype: string381  - name: published382    dtype: string383  - name: title384    dtype: string385  - name: authors386    sequence: string387  - name: primary_category388    dtype: string389  - name: categories390    sequence: string391  - name: text392    dtype: string393  splits:394  - name: train395    num_bytes: 21277471396    num_examples: 511397  download_size: 10625238398  dataset_size: 21277471399- config_name: 2018-07400  features:401  - name: entry_id402    dtype: string403  - name: published404    dtype: string405  - name: title406    dtype: string407  - name: authors408    sequence: string409  - name: primary_category410    dtype: string411  - name: categories412    sequence: string413  - name: text414    dtype: string415  splits:416  - name: train417    num_bytes: 20322860418    num_examples: 517419  download_size: 10250233420  dataset_size: 20322860421- config_name: 2018-08422  features:423  - name: entry_id424    dtype: string425  - name: published426    dtype: string427  - name: title428    dtype: string429  - name: authors430    sequence: string431  - name: primary_category432    dtype: string433  - name: categories434    sequence: string435  - name: text436    dtype: string437  splits:438  - name: train439    num_bytes: 20466912440    num_examples: 504441  download_size: 10207103442  dataset_size: 20466912443- config_name: 2018-09444  features:445  - name: entry_id446    dtype: string447  - name: published448    dtype: string449  - name: title450    dtype: string451  - name: authors452    sequence: string453  - name: primary_category454    dtype: string455  - name: categories456    sequence: string457  - name: text458    dtype: string459  splits:460  - name: train461    num_bytes: 21521957462    num_examples: 516463  download_size: 10292535464  dataset_size: 21521957465- config_name: 2018-10466  features:467  - name: entry_id468    dtype: string469  - name: published470    dtype: string471  - name: title472    dtype: string473  - name: authors474    sequence: string475  - name: primary_category476    dtype: string477  - name: categories478    sequence: string479  - name: text480    dtype: string481  splits:482  - name: train483    num_bytes: 22892365484    num_examples: 532485  download_size: 11360268486  dataset_size: 22892365487- config_name: 2018-11488  features:489  - name: entry_id490    dtype: string491  - name: published492    dtype: string493  - name: title494    dtype: string495  - name: authors496    sequence: string497  - name: primary_category498    dtype: string499  - name: categories500    sequence: string501  - name: text502    dtype: string503  splits:504  - name: train505    num_bytes: 22750886506    num_examples: 531507  download_size: 11400549508  dataset_size: 22750886509- config_name: 2018-12510  features:511  - name: entry_id512    dtype: string513  - name: published514    dtype: string515  - name: title516    dtype: string517  - name: authors518    sequence: string519  - name: primary_category520    dtype: string521  - name: categories522    sequence: string523  - name: text524    dtype: string525  splits:526  - name: train527    num_bytes: 19157411528    num_examples: 475529  download_size: 9548624530  dataset_size: 19157411531- config_name: 2019-01532  features:533  - name: entry_id534    dtype: string535  - name: published536    dtype: string537  - name: title538    dtype: string539  - name: authors540    sequence: string541  - name: primary_category542    dtype: string543  - name: categories544    sequence: string545  - name: text546    dtype: string547  splits:548  - name: train549    num_bytes: 21024786550    num_examples: 498551  download_size: 10499015552  dataset_size: 21024786553- config_name: 2019-02554  features:555  - name: entry_id556    dtype: string557  - name: published558    dtype: string559  - name: title560    dtype: string561  - name: authors562    sequence: string563  - name: primary_category564    dtype: string565  - name: categories566    sequence: string567  - name: text568    dtype: string569  splits:570  - name: train571    num_bytes: 21517028572    num_examples: 506573  download_size: 10736779574  dataset_size: 21517028575- config_name: 2019-03576  features:577  - name: entry_id578    dtype: string579  - name: published580    dtype: string581  - name: title582    dtype: string583  - name: authors584    sequence: string585  - name: primary_category586    dtype: string587  - name: categories588    sequence: string589  - name: text590    dtype: string591  splits:592  - name: train593    num_bytes: 21397298594    num_examples: 500595  download_size: 10804690596  dataset_size: 21397298597- config_name: 2019-04598  features:599  - name: entry_id600    dtype: string601  - name: published602    dtype: string603  - name: title604    dtype: string605  - name: authors606    sequence: string607  - name: primary_category608    dtype: string609  - name: categories610    sequence: string611  - name: text612    dtype: string613  splits:614  - name: train615    num_bytes: 23049654616    num_examples: 535617  download_size: 11329714618  dataset_size: 23049654619- config_name: 2019-05620  features:621  - name: entry_id622    dtype: string623  - name: published624    dtype: string625  - name: title626    dtype: string627  - name: authors628    sequence: string629  - name: primary_category630    dtype: string631  - name: categories632    sequence: string633  - name: text634    dtype: string635  splits:636  - name: train637    num_bytes: 21896838638    num_examples: 522639  download_size: 10901776640  dataset_size: 21896838641- config_name: 2019-06642  features:643  - name: entry_id644    dtype: string645  - name: published646    dtype: string647  - name: title648    dtype: string649  - name: authors650    sequence: string651  - name: primary_category652    dtype: string653  - name: categories654    sequence: string655  - name: text656    dtype: string657  splits:658  - name: train659    num_bytes: 21468690660    num_examples: 528661  download_size: 10809206662  dataset_size: 21468690663- config_name: 2019-07664  features:665  - name: entry_id666    dtype: string667  - name: published668    dtype: string669  - name: title670    dtype: string671  - name: authors672    sequence: string673  - name: primary_category674    dtype: string675  - name: categories676    sequence: string677  - name: text678    dtype: string679  splits:680  - name: train681    num_bytes: 21426189682    num_examples: 545683  download_size: 10730941684  dataset_size: 21426189685- config_name: 2019-08686  features:687  - name: entry_id688    dtype: string689  - name: published690    dtype: string691  - name: title692    dtype: string693  - name: authors694    sequence: string695  - name: primary_category696    dtype: string697  - name: categories698    sequence: string699  - name: text700    dtype: string701  splits:702  - name: train703    num_bytes: 21414686704    num_examples: 532705  download_size: 10639416706  dataset_size: 21414686707- config_name: 2019-09708  features:709  - name: entry_id710    dtype: string711  - name: published712    dtype: string713  - name: title714    dtype: string715  - name: authors716    sequence: string717  - name: primary_category718    dtype: string719  - name: categories720    sequence: string721  - name: text722    dtype: string723  splits:724  - name: train725    num_bytes: 22329624726    num_examples: 538727  download_size: 11263704728  dataset_size: 22329624729- config_name: 2019-10730  features:731  - name: entry_id732    dtype: string733  - name: published734    dtype: string735  - name: title736    dtype: string737  - name: authors738    sequence: string739  - name: primary_category740    dtype: string741  - name: categories742    sequence: string743  - name: text744    dtype: string745  splits:746  - name: train747    num_bytes: 21915199748    num_examples: 520749  download_size: 10766785750  dataset_size: 21915199751- config_name: 2019-11752  features:753  - name: entry_id754    dtype: string755  - name: published756    dtype: string757  - name: title758    dtype: string759  - name: authors760    sequence: string761  - name: primary_category762    dtype: string763  - name: categories764    sequence: string765  - name: text766    dtype: string767  splits:768  - name: train769    num_bytes: 22579122770    num_examples: 547771  download_size: 11257630772  dataset_size: 22579122773- config_name: 2019-12774  features:775  - name: entry_id776    dtype: string777  - name: published778    dtype: string779  - name: title780    dtype: string781  - name: authors782    sequence: string783  - name: primary_category784    dtype: string785  - name: categories786    sequence: string787  - name: text788    dtype: string789  splits:790  - name: train791    num_bytes: 21546668792    num_examples: 514793  download_size: 10715205794  dataset_size: 21546668795- config_name: 2020-01796  features:797  - name: entry_id798    dtype: string799  - name: published800    dtype: string801  - name: title802    dtype: string803  - name: authors804    sequence: string805  - name: primary_category806    dtype: string807  - name: categories808    sequence: string809  - name: text810    dtype: string811  splits:812  - name: train813    num_bytes: 21724474814    num_examples: 507815  download_size: 10799528816  dataset_size: 21724474817- config_name: 2020-02818  features:819  - name: entry_id820    dtype: string821  - name: published822    dtype: string823  - name: title824    dtype: string825  - name: authors826    sequence: string827  - name: primary_category828    dtype: string829  - name: categories830    sequence: string831  - name: text832    dtype: string833  splits:834  - name: train835    num_bytes: 23643655836    num_examples: 554837  download_size: 11764632838  dataset_size: 23643655839- config_name: 2020-03840  features:841  - name: entry_id842    dtype: string843  - name: published844    dtype: string845  - name: title846    dtype: string847  - name: authors848    sequence: string849  - name: primary_category850    dtype: string851  - name: categories852    sequence: string853  - name: text854    dtype: string855  splits:856  - name: train857    num_bytes: 21444794858    num_examples: 519859  download_size: 10663961860  dataset_size: 21444794861- config_name: 2020-04862  features:863  - name: entry_id864    dtype: string865  - name: published866    dtype: string867  - name: title868    dtype: string869  - name: authors870    sequence: string871  - name: primary_category872    dtype: string873  - name: categories874    sequence: string875  - name: text876    dtype: string877  splits:878  - name: train879    num_bytes: 21944387880    num_examples: 520881  download_size: 10912679882  dataset_size: 21944387883- config_name: 2020-05884  features:885  - name: entry_id886    dtype: string887  - name: published888    dtype: string889  - name: title890    dtype: string891  - name: authors892    sequence: string893  - name: primary_category894    dtype: string895  - name: categories896    sequence: string897  - name: text898    dtype: string899  splits:900  - name: train901    num_bytes: 23067240902    num_examples: 553903  download_size: 11652654904  dataset_size: 23067240905- config_name: 2020-06906  features:907  - name: entry_id908    dtype: string909  - name: published910    dtype: string911  - name: title912    dtype: string913  - name: authors914    sequence: string915  - name: primary_category916    dtype: string917  - name: categories918    sequence: string919  - name: text920    dtype: string921  splits:922  - name: train923    num_bytes: 23135770924    num_examples: 524925  download_size: 11385738926  dataset_size: 23135770927- config_name: 2020-07928  features:929  - name: entry_id930    dtype: string931  - name: published932    dtype: string933  - name: title934    dtype: string935  - name: authors936    sequence: string937  - name: primary_category938    dtype: string939  - name: categories940    sequence: string941  - name: text942    dtype: string943  splits:944  - name: train945    num_bytes: 23826584946    num_examples: 537947  download_size: 11858237948  dataset_size: 23826584949- config_name: 2020-08950  features:951  - name: entry_id952    dtype: string953  - name: published954    dtype: string955  - name: title956    dtype: string957  - name: authors958    sequence: string959  - name: primary_category960    dtype: string961  - name: categories962    sequence: string963  - name: text964    dtype: string965  splits:966  - name: train967    num_bytes: 23923168968    num_examples: 547969  download_size: 12001299970  dataset_size: 23923168971- config_name: 2020-09972  features:973  - name: entry_id974    dtype: string975  - name: published976    dtype: string977  - name: title978    dtype: string979  - name: authors980    sequence: string981  - name: primary_category982    dtype: string983  - name: categories984    sequence: string985  - name: text986    dtype: string987  splits:988  - name: train989    num_bytes: 23329683990    num_examples: 533991  download_size: 11503691992  dataset_size: 23329683993- config_name: 2020-10994  features:995  - name: entry_id996    dtype: string997  - name: published998    dtype: string999  - name: title1000    dtype: string1001  - name: authors1002    sequence: string1003  - name: primary_category1004    dtype: string1005  - name: categories1006    sequence: string1007  - name: text1008    dtype: string1009  splits:1010  - name: train1011    num_bytes: 230279551012    num_examples: 5221013  download_size: 114149341014  dataset_size: 230279551015- config_name: 2020-111016  features:1017  - name: entry_id1018    dtype: string1019  - name: published1020    dtype: string1021  - name: title1022    dtype: string1023  - name: authors1024    sequence: string1025  - name: primary_category1026    dtype: string1027  - name: categories1028    sequence: string1029  - name: text1030    dtype: string1031  splits:1032  - name: train1033    num_bytes: 231698351034    num_examples: 5231035  download_size: 114741291036  dataset_size: 231698351037- config_name: 2020-121038  features:1039  - name: entry_id1040    dtype: string1041  - name: published1042    dtype: string1043  - name: title1044    dtype: string1045  - name: authors1046    sequence: string1047  - name: primary_category1048    dtype: string1049  - name: categories1050    sequence: string1051  - name: text1052    dtype: string1053  splits:1054  - name: train1055    num_bytes: 220105791056    num_examples: 5101057  download_size: 108487141058  dataset_size: 220105791059- config_name: 2021-011060  features:1061  - name: entry_id1062    dtype: string1063  - name: published1064    dtype: string1065  - name: title1066    dtype: string1067  - name: authors1068    sequence: string1069  - name: primary_category1070    dtype: string1071  - name: categories1072    sequence: string1073  - name: text1074    dtype: string1075  splits:1076  - name: train1077    num_bytes: 228789791078    num_examples: 5181079  download_size: 113951471080  dataset_size: 228789791081- config_name: 2021-021082  features:1083  - name: entry_id1084    dtype: string1085  - name: published1086    dtype: string1087  - name: title1088    dtype: string1089  - name: authors1090    sequence: string1091  - name: primary_category1092    dtype: string1093  - name: categories1094    sequence: string1095  - name: text1096    dtype: string1097  splits:1098  - name: train1099    num_bytes: 240722641100    num_examples: 5091101  download_size: 119569291102  dataset_size: 240722641103- config_name: 2021-031104  features:1105  - name: entry_id1106    dtype: string1107  - name: published1108    dtype: string1109  - name: title1110    dtype: string1111  - name: authors1112    sequence: string1113  - name: primary_category1114    dtype: string1115  - name: categories1116    sequence: string1117  - name: text1118    dtype: string1119  splits:1120  - name: train1121    num_bytes: 223713441122    num_examples: 5201123  download_size: 110924591124  dataset_size: 223713441125- config_name: 2021-041126  features:1127  - name: entry_id1128    dtype: string1129  - name: published1130    dtype: string1131  - name: title1132    dtype: string1133  - name: authors1134    sequence: string1135  - name: primary_category1136    dtype: string1137  - name: categories1138    sequence: string1139  - name: text1140    dtype: string1141  splits:1142  - name: train1143    num_bytes: 240385521144    num_examples: 5341145  download_size: 118775321146  dataset_size: 240385521147- config_name: 2021-051148  features:1149  - name: entry_id1150    dtype: string1151  - name: published1152    dtype: string1153  - name: title1154    dtype: string1155  - name: authors1156    sequence: string1157  - name: primary_category1158    dtype: string1159  - name: categories1160    sequence: string1161  - name: text1162    dtype: string1163  splits:1164  - name: train1165    num_bytes: 251346681166    num_examples: 5311167  download_size: 124429681168  dataset_size: 251346681169- config_name: 2021-061170  features:1171  - name: entry_id1172    dtype: string1173  - name: published1174    dtype: string1175  - name: title1176    dtype: string1177  - name: authors1178    sequence: string1179  - name: primary_category1180    dtype: string1181  - name: categories1182    sequence: string1183  - name: text1184    dtype: string1185  splits:1186  - name: train1187    num_bytes: 239601501188    num_examples: 5131189  download_size: 119254961190  dataset_size: 239601501191- config_name: 2021-071192  features:1193  - name: entry_id1194    dtype: string1195  - name: published1196    dtype: string1197  - name: title1198    dtype: string1199  - name: authors1200    sequence: string

Showing the first 1,200 of 2614 lines. Download the file for the rest.