CoolFace
Modelpublic

speech-seq2seq/wav2vec2-2-bert-large-no-adapter

sourceHugging Faceupdated 5y agoView on Hugging Face
1likes188downloads
create_model.py33 linesDownload Raw Back to root
1from transformers import SpeechEncoderDecoderModel, AutoFeatureExtractor, AutoTokenizer, Wav2Vec2Processor2import torch3 4# checkpoints to leverage5encoder_id = "facebook/wav2vec2-large-lv60"6decoder_id = "bert-large-uncased"7 8feature_extractor = AutoFeatureExtractor.from_pretrained(encoder_id)9feature_extractor.save_pretrained("./")10tokenizer = AutoTokenizer.from_pretrained(decoder_id)11tokenizer.save_pretrained("./")12 13model = SpeechEncoderDecoderModel.from_encoder_decoder_pretrained(encoder_id, decoder_id, encoder_add_adapter=False)14model.config.encoder.feat_proj_dropout = 0.015model.config.encoder.final_dropout = 0.016model.config.encoder.mask_time_prob = 0.117model.config.decoder_start_token_id = tokenizer.cls_token_id18model.config.pad_token_id = tokenizer.pad_token_id19model.config.eos_token_id = tokenizer.sep_token_id20model.config.max_length = 5021model.config.num_beams = 122model.config.encoder.layerdrop = 0.023model.config.use_cache = False24model.config.decoder.use_cache = False25model.config.processor_class = "Wav2Vec2Processor"26 27# check if generation works28out = model.generate(torch.ones((1, 2000)))29 30model.save_pretrained("./")31 32 33