Maciel/T5_Mask_Completion
313
1---2language: 3- zh4tags:5- conditional text generation6- data augmentation7 8license: apache-2.09datasets:10- beyond/chinese_clean_passages_80m11 12 13widget:14- text: "[mask]疫情[mask]公园[mask]散步[mask]"15 example_title: "案例1"16- text: "今天[mask]篮球[mask]学校[mask]"17 example_title: "案例2"18- text: "[mask]感染新冠[mask]身体不舒服[mask]多休息[mask]"19 example_title: "案例3"20 21inference:22 parameters:23 max_length: 12824 num_beams: 1025 no_repeat_ngram_size: 526 do_sample: True27 min_length: 1028 early_stopping: True29---30 31## 功能介绍32该模型主要功能是针对mask部分进行补全生成,能够生成较流利丰富的自然文本。33 34参考案例如下:35 361)今天[mask]篮球[mask]学校[mask]37 382)[mask]疫情[mask]公园[mask]散步[mask]39 403)[mask]感染新冠[mask]身体不舒服[mask]多休息[mask]41 42## 如何使用43```44from transformers import AutoTokenizer, AutoModelForSeq2SeqLM45pretrained = "Maciel/T5_Mask_Completion"46tokenizer = AutoTokenizer.from_pretrained(pretrained)47model = AutoModelForSeq2SeqLM.from_pretrained(pretrained)48 49sentence = "[mask]疫情[mask]公园[mask]散步[mask]"50max_input_length = 12851input_encodings = tokenizer(sentence, 52 max_length=max_input_length, 53 truncation=True, 54 return_tensors="pt")55if "token_type_ids" in input_encodings.keys():56 input_encodings.pop("token_type_ids")57output = model.generate(**input_encodings, 58 num_beams=10,59 no_repeat_ngram_size=5,60 do_sample=True, 61 early_stopping=True,62 min_length=10,63 max_length=64,64 return_dict_in_generate=True,65 output_scores=True)66decoded_output = tokenizer.batch_decode(output.sequences, skip_special_tokens=True)[0]67completion = decoded_output.strip()68print(completion)69```70 71## 案例展示72```731) 原始文本:今天[mask]篮球[mask]学校[mask]74 补全文本:今天,我们来谈谈篮球与学校的关系。75 762) 原始文本:[mask]疫情[mask]公园[mask]散步[mask]77 补全文本:在疫情发生之前,人们可以在公园里散步。78 793) 原始文本:[mask]感染新冠[mask]身体不舒服[mask]多休息[mask]80 补全文本:如果你感染新冠了,身体不舒服,建议你多休息,不要吃辛辣刺激性的食物,以免加重病情。81```