CoolFace
Datasetpublic

brograrnmer/Human_written_text_data

dataset: name: Mixed Text Dataset total_samples: 20000 sources: name: Wikipedia samples: 10000 details: "20220301 dump" name: Gutenberg samples: 3000 details: "GutenDex API" name: CNN/DailyMail samples: 7000 details: "Version 3.0.0" preprocessing: method: regex_cleaning description: "Replaced patterns like (.*?/) with whitespace"

sourceHugging Faceupdated 5mo agoView on Hugging Face
1likes7downloads
README.md20 linesDownload Raw Back to root
1dataset:2  name: Mixed Text Dataset3  total_samples: 200004 5sources:6  - name: Wikipedia7    samples: 100008    details: "20220301 dump"9 10  - name: Gutenberg11    samples: 300012    details: "GutenDex API"13 14  - name: CNN/DailyMail15    samples: 700016    details: "Version 3.0.0"17 18preprocessing:19  method: regex_cleaning20  description: "Replaced patterns like (.*?/) with whitespace"