continue_pre_train
avemio-digital_-_gemma2b-continued-training-pre-trained_50ksample_v2-ggufavemio-digital_-_mistral-continued-training-pre-trained-ggufcontinued_pre_training_smol_lmcontinue_pretrain_gemmacontinue_pretrain_gemma2continue_pretrain_gemma_more_pausegemma-2-9b-Turkish-Lora-Continue-Pre-Trainedcontinue-pretrain-indobert-epoch-2
continue-pretrained-v1
Continue Pretrained v1
Continual-pretraining (CPT) mixture shards for Vietnamese LLM training.
Splits
Split
Description
Rows (approx)
Est. tokens
stage_1
Warmup / general mix (VI-heavy + EN replay)
56,419,797
~52.2B
Schema
id, text, source, subset
stage, stage_name, mix_source, language, epoch, quality_pred
Load
from datasets import load_dataset
ds = load_dataset("brownyeyez/continue-pretrained-v1", split="stage_1")
ContinuePretrain
