CoolFace
Datasetpublic

ssuresh/nemo-stage1-50M-samples

NeMo Stage1 Pretraining Dataset - 50M Samples This dataset contains 50 million text samples for NeMo model pretraining (Stage 1). The dataset is organized in chunks for efficient loading and processing. Dataset Details Total Samples: ~50,000,000 Format: JSONL (JSON Lines) Structure: Each sample contains {"id": number, "text": "content"} Chunks: 47 files (chunk_000.jsonl to chunk_046.jsonl) Samples per chunk: ~1,000,000 Language: English Task: Text generation… See the full description on the dataset page: https://huggingface.co/datasets/ssuresh/nemo-stage1-50M-samples.

sourceHugging Faceapache-2.0updated 11mo agoView on Hugging Face
0likes126downloads
Dataset Card

NeMo Stage1 Pretraining Dataset - 50M Samples

This dataset contains 50 million text samples for NeMo model pretraining (Stage 1). The dataset is organized in chunks for efficient loading and processing.

Dataset Details

  • Total Samples: ~50,000,000
  • Format: JSONL (JSON Lines)
  • Structure: Each sample contains {"id": number, "text": "content"}
  • Chunks: 47 files (chunk000.jsonl to chunk046.jsonl)
  • Samples per chunk: ~1,000,000
  • Language: English
  • Task: Text generation pretraining

Usage

Load the entire dataset:

python
from datasets import load_dataset

# Load all chunks
dataset = load_dataset('ssuresh/nemo-stage1-50M-samples', split='train')
print(f"Loaded {len(dataset)} samples")

Load specific chunks:

python
# Load a specific chunk
chunk_dataset = load_dataset('ssuresh/nemo-stage1-50M-samples', 
                           data_files='chunks/chunk_000.jsonl', 
                           split='train')
print(f"Loaded {len(chunk_dataset)} samples from chunk_000")

Load multiple chunks:

python
# Load multiple chunks
chunk_files = [f'chunks/chunk_{i:03d}.jsonl' for i in range(5)]  # First 5 chunks
multi_chunk_dataset = load_dataset('ssuresh/nemo-stage1-50M-samples', 
                                 data_files=chunk_files, 
                                 split='train')
print(f"Loaded {len(multi_chunk_dataset)} samples from 5 chunks")

Dataset Structure

Each sample in the dataset has the following structure:

json
{
  "id": 0,
  "text": "Your text content here..."
}

Chunk Information

  • chunk_000.jsonl to chunk_046.jsonl: Individual chunk files
  • Each chunk contains approximately 1,000,000 samples
  • Chunks are numbered sequentially from 000 to 046
  • Total: 47 chunks

Sample Data

The first 100 samples are available in sample_data.json for inspection and understanding the data format.

Memory-Efficient Loading

This dataset is designed for memory-efficient loading:

  • Load individual chunks to avoid memory issues
  • Use streaming for very large datasets
  • Chunk-based processing for distributed training

Training Usage

For NeMo training, you can use this dataset with the use_processed_datasets: true setting in your configuration:

yaml
data:
  use_processed_datasets: true
  dataset_name: "ssuresh/nemo-stage1-50M-samples"

License

This dataset is released under the Apache 2.0 License.

Citation

If you use this dataset in your research, please cite:

bibtex
@dataset{nemo_stage1_50m,
  title={NeMo Stage1 Pretraining Dataset - 50M Samples},
  author={Suresh},
  year={2024},
  url={https://huggingface.co/datasets/ssuresh/nemo-stage1-50M-samples}
}

Contact

For questions or issues with this dataset, please open an issue on the Hugging Face Hub or contact the dataset maintainer.