falconlee236/nanogpt-gpt2-124m-custom
028
nanoGPT-124M-Custom
이 모델은 Andrej Karpathy의 nanoGPT 프레임워크를 기반으로 밑바닥부터(from scratch) 학습시킨 GPT-2 Small (124M) 호환 언어 모델입니다. Hugging Face의 transformers 라이브러리에서 즉시 사용할 수 있도록 표준 safetensors 포맷으로 변환되었습니다.
📊 Weights & Biases (WandB) 학습 로그
학습 과정의 Loss 변화, 연산 속도, 그리고 시스템 리소스 사용량 등 상세한 실험 기록은 아래 링크에서 확인하실 수 있습니다. 👉 [WandB 학습 대시보드 보기 (Run: b07uovmb)](https://wandb.ai/OptiMap/gpt2-124m-repro/runs/b07uovmb?nw=nwuserfalconlee236)
⚙️ 학습 환경 및 하이퍼파라미터 (Training Details)
모델 학습에 사용된 주요 하이퍼파라미터와 하드웨어 스펙은 다음과 같습니다.
- Hardware: 1 x NVIDIA A100 PCIe 40GB (MIG Profile:
3g.20gb) - Precision:
bfloat16(Underflow 방지 및 연산 최적화) - Dataset: OpenWebText
- Batch Size: 16
- Gradient Accumulation Steps: 32
- Block Size (Context Window): 1024
- Total Tokens per Iteration: 524,288 토큰 (약 0.5M)
- Optimizer: Fused AdamW
🚀 사용 방법 (Usage)
이 모델은 OpenAI의 공식 GPT-2 토크나이저와 완벽하게 호환됩니다. 아래 파이썬 코드를 통해 모델을 불러오고 텍스트를 생성해 볼 수 있습니다.
from transformers import GPT2LMHeadModel, GPT2Tokenizer
# 1. 토크나이저와 모델 불러오기
tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
model = GPT2LMHeadModel.from_pretrained("falconlee236/nanogpt-gpt2-124m-custom")
# 2. 입력 문장 설정
input_text = "The future of artificial intelligence is"
input_ids = tokenizer.encode(input_text, return_tensors='pt')
# 3. 텍스트 생성
output = model.generate(
input_ids,
max_length=50,
do_sample=True,
temperature=0.8,
top_k=50,
pad_token_id=tokenizer.eos_token_id
)
# 4. 결과 출력
print(tokenizer.decode(output[0], skip_special_tokens=True))