tonymocchi/vocabEqual_gpt2s_originalTokenizer
0128
GPT-2 Small for Korean Elementary School (1st Grade)
미래앤 초등학교 국정교과서 1학년 과정에 수록된 약 2,400 문장으로 파인튜닝(Fine-tuning)한 모델입니다. tokenizer의 vocab수를 같게 하여 만든 버전입니다.
모델 정보
- Base Model: GPT-2 (Original)
- Dataset: 초등학교 1학년 국정교과서 (미래앤) 문장 2,400개
- Tokenizer: 초등학교 1학년 국정교과서 (미래앤) 문장 2,400개로 학습한 byte-level BPE 토크나이저
사용 예시 (Usage)
- train_log.tsv = 모델 학습 기록 추적용
from transformers import AutoTokenizer, AutoModelForCausalLM
repo_id = "tonymocchi/vocabEqual_gpt2s_originalTokenizer"
# 1. 토크나이저 및 모델 로드
tokenizer = AutoTokenizer.from_pretrained(repo_id)
model = AutoModelForCausalLM.from_pretrained(repo_id)
# 2. 입력 텍스트 처리
input_text = "선생님과 함께"
inputs = tokenizer(input_text, return_tensors="pt")
# 3. 텍스트 생성
outputs = model.generate(
**inputs,
max_length=50, # 최대 생성 길이
do_sample=True, # 확률적 샘플링 (다양한 문장 생성)
temperature=0.7, # 창의성 조절 (1.0에 가까울수록 창의적)
top_k=50 # 상위 50개 확률 단어 중에서 선택
)
# 4. 결과 출력
generated_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(generated_text)