huiqian/tiny-sentiment-classifier
0
1from transformers import Trainer, TrainingArguments2from datasets import Dataset3import json4from modeling_tinytransformer import TinyTransformerModel5from configuration_tinytransformer import TinyTransformerConfig6from tokenization_tinytransformer import TinyTokenizer7 8# 加载数据9data = []10with open("data/train_data.jsonl", "r", encoding="utf-8") as f:11 for line in f:12 data.append(json.loads(line))13 14dataset = Dataset.from_list(data)15 16# 简单分词17tokenizer = TinyTokenizer()18 19def preprocess(examples):20 encodings = tokenizer(examples["text"], truncation=True, max_length=64, padding="max_length")21 encodings["labels"] = examples["label"]22 return encodings23 24tokenized_dataset = dataset.map(preprocess, batched=True)25 26# 初始化模型27config = TinyTransformerConfig(vocab_size=tokenizer.vocab_size, num_labels=2)28model = TinyTransformerModel(config)29 30# 训练设置31training_args = TrainingArguments(32 output_dir="./results",33 num_train_epochs=3,34 per_device_train_batch_size=4,35 logging_steps=1,36 save_strategy="no",37 report_to="none",38)39 40trainer = Trainer(41 model=model,42 args=training_args,43 train_dataset=tokenized_dataset,44)45 46trainer.train()47 48# 保存模型49 50model.save_pretrained("./tiny-sentiment-model")51tokenizer.save_pretrained("./tiny-sentiment-model") # 这行会生成 vocab.json52config.save_pretrained("./tiny-sentiment-model")