XUUUUSID/gpt2-124m-variants-pre
0
gpt2-124m-variants-pre
Research artifacts: GPT-2 (124M, trained from scratch) pretraining variants produced under controlled data-composition differences; per-variant, per-seed subfolders; intended for reproducibility and membership/contamination research. Details and provenance will be documented in a future update.
Subfolders
clean_seed20260901clean_seed20260902inj1x_seed20260901inj1x_seed20260902inj16x_seed20260901inj16x_seed20260902
Loading
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "XUUUUSID/gpt2-124m-variants-pre"
sub = "clean_seed20260901"
tok = AutoTokenizer.from_pretrained(repo, subfolder=sub)
model = AutoModelForCausalLM.from_pretrained(repo, subfolder=sub)