ReactiveAI/finepdfs-edu-beta
0223
1---2dataset_info:3- config_name: en4 features:5 - name: text6 dtype: string7 - name: id8 dtype: string9 - name: dump10 dtype: string11 - name: url12 dtype: string13 - name: date14 dtype: string15 - name: file_path16 dtype: string17 - name: offset18 dtype: int6419 - name: token_count20 dtype: int6421 - name: language22 dtype: string23 - name: page_average_lid24 dtype: string25 - name: page_average_lid_score26 dtype: float6427 - name: full_doc_lid28 dtype: string29 - name: full_doc_lid_score30 dtype: float6431 - name: per_page_languages32 list: string33 - name: is_truncated34 dtype: bool35 - name: extractor36 dtype: string37 - name: page_ends38 list: int6439 - name: fw_edu_scores40 list: float6441 - name: minhash_cluster_size42 dtype: int6443 - name: duplicate_count44 dtype: int6445 splits:46 - name: train47 num_bytes: 18583371181148 num_examples: 738599749 download_size: 9576984220050 dataset_size: 18583371181151- config_name: en-pt-152 features:53 - name: text54 dtype: string55 - name: id56 dtype: string57 - name: dump58 dtype: string59 - name: url60 dtype: string61 - name: date62 dtype: string63 - name: file_path64 dtype: string65 - name: offset66 dtype: int6467 - name: token_count68 dtype: int6469 - name: language70 dtype: string71 - name: page_average_lid72 dtype: string73 - name: page_average_lid_score74 dtype: float6475 - name: full_doc_lid76 dtype: string77 - name: full_doc_lid_score78 dtype: float6479 - name: per_page_languages80 list: string81 - name: is_truncated82 dtype: bool83 - name: extractor84 dtype: string85 - name: page_ends86 list: int6487 - name: fw_edu_scores88 list: float6489 - name: minhash_cluster_size90 dtype: int6491 - name: duplicate_count92 dtype: int6493 splits:94 - name: train95 num_bytes: 9708976928696 num_examples: 385902197 download_size: 5005143302998 dataset_size: 9708976928699- config_name: en-pt-2100 features:101 - name: text102 dtype: string103 - name: id104 dtype: string105 - name: dump106 dtype: string107 - name: url108 dtype: string109 - name: date110 dtype: string111 - name: file_path112 dtype: string113 - name: offset114 dtype: int64115 - name: token_count116 dtype: int64117 - name: language118 dtype: string119 - name: page_average_lid120 dtype: string121 - name: page_average_lid_score122 dtype: float64123 - name: full_doc_lid124 dtype: string125 - name: full_doc_lid_score126 dtype: float64127 - name: per_page_languages128 list: string129 - name: is_truncated130 dtype: bool131 - name: extractor132 dtype: string133 - name: page_ends134 list: int64135 - name: fw_edu_scores136 list: float64137 - name: minhash_cluster_size138 dtype: int64139 - name: duplicate_count140 dtype: int64141 splits:142 - name: train143 num_bytes: 61424528957144 num_examples: 2419924145 download_size: 31661813086146 dataset_size: 61424528957147configs:148- config_name: en149 data_files:150 - split: train151 path: en/train-*152- config_name: en-pt-1153 data_files:154 - split: train155 path: en-pt-1/train-*156- config_name: en-pt-2157 data_files:158 - split: train159 path: en-pt-2/train-*160---161 