CoolFace
Datasetpublic

MultilingualUnigramLM/LangMap-TheStack-cpp-100M

LangMap-TheStack-cpp-100M Code finetuning dataset for cpp streamed from bigcode/the-stack. Tokens collected: 100,000,000 (target: 100,000,000) Tokenizer: allenai/OLMo-3-1025-7B Schema: {"text": [...]} (sanitised source code)

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes126downloads
6 commits on main
f9c3fef5mo ago

Fix data path: data/cpp-*.parquet -> data/train-*.parquet

suchirsalhan
76d44e45mo ago

Add README for cpp code dataset

suchirsalhan
bdbd1605mo ago

Upload dataset

suchirsalhan
be7b3595mo ago

Add README for cpp code dataset

suchirsalhan
a63bcb55mo ago

Upload dataset

suchirsalhan
0b8d0915mo ago

initial commit

suchirsalhan