CoolFace
Datasetpublic

ruediste/codeparrot-github-code-10G

This is data is derived from the Codeparrot Dataset by taking the first 10GB of text from each language, and splitting it into individual configs. This results in a download size of about 3GB per language. Sample usage: from datasets import load_dataset dataset = load_dataset("ruediste/codeparrot-github-code-10G", "java") List of Languages: languages = { 'HTML': 'html', 'Java': 'java', 'JavaScript': 'js', 'CSS': 'css', 'C#': 'cs', 'TypeScript': 'ts', "Batchfile":… See the full description on the dataset page: https://huggingface.co/datasets/ruediste/codeparrot-github-code-10G.

sourceHugging Faceupdated 2y agoView on Hugging Face
2likes2.6kdownloads
../
filetrain-00000-of-00022.parquet123.7 MBdownload
filetrain-00001-of-00022.parquet126.3 MBdownload
filetrain-00002-of-00022.parquet125.4 MBdownload
filetrain-00003-of-00022.parquet127.0 MBdownload
filetrain-00004-of-00022.parquet128.6 MBdownload
filetrain-00005-of-00022.parquet123.2 MBdownload
filetrain-00006-of-00022.parquet126.3 MBdownload
filetrain-00007-of-00022.parquet126.3 MBdownload
filetrain-00008-of-00022.parquet128.2 MBdownload
filetrain-00009-of-00022.parquet123.4 MBdownload
filetrain-00010-of-00022.parquet121.9 MBdownload
filetrain-00011-of-00022.parquet128.7 MBdownload
filetrain-00012-of-00022.parquet128.1 MBdownload
filetrain-00013-of-00022.parquet124.9 MBdownload
filetrain-00014-of-00022.parquet124.7 MBdownload
filetrain-00015-of-00022.parquet128.2 MBdownload
filetrain-00016-of-00022.parquet129.1 MBdownload
filetrain-00017-of-00022.parquet124.8 MBdownload
filetrain-00018-of-00022.parquet127.6 MBdownload
filetrain-00019-of-00022.parquet126.7 MBdownload
filetrain-00020-of-00022.parquet125.5 MBdownload
filetrain-00021-of-00022.parquet129.9 MBdownload

ruediste/codeparrot-github-code-10G · main · files are served by the source, never re-hosted here