quickmt/quickmt-en-fa
287
1## IO2save_data: data3overwrite: True4seed: 12345report_every: 1006valid_metrics: ["BLEU"]7tensorboard: true8tensorboard_log_dir: tensorboard9 10### Vocab11src_vocab: en.eole.vocab12tgt_vocab: fa.eole.vocab13src_vocab_size: 2000014tgt_vocab_size: 2000015vocab_size_multiple: 816share_vocab: false17n_sample: 018 19data:20 corpus_1:21 # path_src: hf://quickmt/quickmt-train.fa-en/en22 # path_tgt: hf://quickmt/quickmt-train.fa-en/fa23 # path_sco: hf://quickmt/quickmt-train.fa-en/sco24 path_src: train.en25 path_tgt: train.fa26 valid:27 path_src: dev.en28 path_tgt: dev.fa29 30transforms: [sentencepiece, filtertoolong]31transforms_configs:32 sentencepiece:33 src_subword_model: "en.spm.model"34 tgt_subword_model: "fa.spm.model"35 filtertoolong:36 src_seq_length: 25637 tgt_seq_length: 25638 39training:40 # Run configuration41 model_path: quickmt-en-fa-eole-model42 #train_from: model43 keep_checkpoint: 544 train_steps: 10000045 save_checkpoint_steps: 500046 valid_steps: 500047 48 # Train on a single GPU49 world_size: 150 gpu_ranks: [0]51 52 # Batching 1024053 batch_type: "tokens"54 batch_size: 800055 valid_batch_size: 409656 batch_size_multiple: 857 accum_count: [10]58 accum_steps: [0]59 60 # Optimizer & Compute61 compute_dtype: "fp16"62 optim: "adamw"63 #use_amp: False64 learning_rate: 2.065 warmup_steps: 400066 decay_method: "noam"67 adam_beta2: 0.99868 69 # Data loading70 bucket_size: 12800071 num_workers: 472 prefetch_factor: 3273 74 # Hyperparams75 dropout_steps: [0]76 dropout: [0.1]77 attention_dropout: [0.1]78 max_grad_norm: 079 label_smoothing: 0.180 average_decay: 0.000181 param_init_method: xavier_uniform82 normalization: "tokens"83 84model:85 architecture: "transformer"86 share_embeddings: false87 share_decoder_embeddings: false88 hidden_size: 102489 encoder:90 layers: 891 decoder:92 layers: 293 heads: 894 transformer_ff: 409695 embeddings:96 word_vec_size: 102497 position_encoding_type: "SinusoidalInterleaved"98 99 