CoolFace
Datasetpublic

ReactiveAI/finepdfs-edu-beta

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes223downloads
README.md161 linesDownload Raw Back to root
1---2dataset_info:3- config_name: en4  features:5  - name: text6    dtype: string7  - name: id8    dtype: string9  - name: dump10    dtype: string11  - name: url12    dtype: string13  - name: date14    dtype: string15  - name: file_path16    dtype: string17  - name: offset18    dtype: int6419  - name: token_count20    dtype: int6421  - name: language22    dtype: string23  - name: page_average_lid24    dtype: string25  - name: page_average_lid_score26    dtype: float6427  - name: full_doc_lid28    dtype: string29  - name: full_doc_lid_score30    dtype: float6431  - name: per_page_languages32    list: string33  - name: is_truncated34    dtype: bool35  - name: extractor36    dtype: string37  - name: page_ends38    list: int6439  - name: fw_edu_scores40    list: float6441  - name: minhash_cluster_size42    dtype: int6443  - name: duplicate_count44    dtype: int6445  splits:46  - name: train47    num_bytes: 18583371181148    num_examples: 738599749  download_size: 9576984220050  dataset_size: 18583371181151- config_name: en-pt-152  features:53  - name: text54    dtype: string55  - name: id56    dtype: string57  - name: dump58    dtype: string59  - name: url60    dtype: string61  - name: date62    dtype: string63  - name: file_path64    dtype: string65  - name: offset66    dtype: int6467  - name: token_count68    dtype: int6469  - name: language70    dtype: string71  - name: page_average_lid72    dtype: string73  - name: page_average_lid_score74    dtype: float6475  - name: full_doc_lid76    dtype: string77  - name: full_doc_lid_score78    dtype: float6479  - name: per_page_languages80    list: string81  - name: is_truncated82    dtype: bool83  - name: extractor84    dtype: string85  - name: page_ends86    list: int6487  - name: fw_edu_scores88    list: float6489  - name: minhash_cluster_size90    dtype: int6491  - name: duplicate_count92    dtype: int6493  splits:94  - name: train95    num_bytes: 9708976928696    num_examples: 385902197  download_size: 5005143302998  dataset_size: 9708976928699- config_name: en-pt-2100  features:101  - name: text102    dtype: string103  - name: id104    dtype: string105  - name: dump106    dtype: string107  - name: url108    dtype: string109  - name: date110    dtype: string111  - name: file_path112    dtype: string113  - name: offset114    dtype: int64115  - name: token_count116    dtype: int64117  - name: language118    dtype: string119  - name: page_average_lid120    dtype: string121  - name: page_average_lid_score122    dtype: float64123  - name: full_doc_lid124    dtype: string125  - name: full_doc_lid_score126    dtype: float64127  - name: per_page_languages128    list: string129  - name: is_truncated130    dtype: bool131  - name: extractor132    dtype: string133  - name: page_ends134    list: int64135  - name: fw_edu_scores136    list: float64137  - name: minhash_cluster_size138    dtype: int64139  - name: duplicate_count140    dtype: int64141  splits:142  - name: train143    num_bytes: 61424528957144    num_examples: 2419924145  download_size: 31661813086146  dataset_size: 61424528957147configs:148- config_name: en149  data_files:150  - split: train151    path: en/train-*152- config_name: en-pt-1153  data_files:154  - split: train155    path: en-pt-1/train-*156- config_name: en-pt-2157  data_files:158  - split: train159    path: en-pt-2/train-*160---161