MultilingualUnigramLM/LangMap-TheStack-cpp-100M
LangMap-TheStack-cpp-100M Code finetuning dataset for cpp streamed from bigcode/the-stack. Tokens collected: 100,000,000 (target: 100,000,000) Tokenizer: allenai/OLMo-3-1025-7B Schema: {"text": [...]} (sanitised source code)
0126
Fix data path: data/cpp-*.parquet -> data/train-*.parquet
Add README for cpp code dataset
Upload dataset
Add README for cpp code dataset
Upload dataset
initial commit
