CoolFace
Datasetpublic

ysn-rfd/text-dataset-tiny-code-script-py-format

USED of tahamajs/medicine_ds_persian for .parquet file USED of Alijafarixcs2/persian-it-llama2-2k for .parquet file USED of Abirate/english_quotes for .jsonl file NEW FILES (05/12/2025) NEW FILES (12/26/2025) NEW FILES (02/15/2026)

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
3likes1.6kdownloads
gpt2_finetuning_cpu.py22 linesDownload Raw Back to pytorch_fine_tuning_code
1from transformers import GPT2Tokenizer, GPT2LMHeadModel, Trainer, TrainingArguments, DataCollatorForLanguageModeling
2from datasets import Dataset
3
4# Load dataset
5def load_dataset(file_path):
6    with open(file_path, "r", encoding="utf-8") as f:
7        text = f.read()
8    return [text]
9
10
11# Load tokenizer and model
12tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
13tokenizer.pad_token = tokenizer.eos_token
14model = GPT2LMHeadModel.from_pretrained("gpt2")
15
16
17# Save final model
18model.save_pretrained("./finetuned_gpt2")
19tokenizer.save_pretrained("./finetuned_gpt2")
20
21print("Fine-tuning completed.")
22