CoolFace
Modelpublic

quickmt/quickmt-en-fa

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
2likes87downloads
eole-config.yaml99 linesDownload Raw Back to root
1## IO2save_data: data3overwrite: True4seed: 12345report_every: 1006valid_metrics: ["BLEU"]7tensorboard: true8tensorboard_log_dir: tensorboard9 10### Vocab11src_vocab: en.eole.vocab12tgt_vocab: fa.eole.vocab13src_vocab_size: 2000014tgt_vocab_size: 2000015vocab_size_multiple: 816share_vocab: false17n_sample: 018 19data:20    corpus_1:21        # path_src: hf://quickmt/quickmt-train.fa-en/en22        # path_tgt: hf://quickmt/quickmt-train.fa-en/fa23        # path_sco: hf://quickmt/quickmt-train.fa-en/sco24        path_src: train.en25        path_tgt: train.fa26    valid:27        path_src: dev.en28        path_tgt: dev.fa29 30transforms: [sentencepiece, filtertoolong]31transforms_configs:32  sentencepiece:33    src_subword_model: "en.spm.model"34    tgt_subword_model: "fa.spm.model"35  filtertoolong:36    src_seq_length: 25637    tgt_seq_length: 25638 39training:40    # Run configuration41    model_path: quickmt-en-fa-eole-model42    #train_from: model43    keep_checkpoint: 544    train_steps: 10000045    save_checkpoint_steps: 500046    valid_steps: 500047    48    # Train on a single GPU49    world_size: 150    gpu_ranks: [0]51 52    # Batching 1024053    batch_type: "tokens"54    batch_size: 800055    valid_batch_size: 409656    batch_size_multiple: 857    accum_count: [10]58    accum_steps: [0]59 60    # Optimizer & Compute61    compute_dtype: "fp16"62    optim: "adamw"63    #use_amp: False64    learning_rate: 2.065    warmup_steps: 400066    decay_method: "noam"67    adam_beta2: 0.99868 69    # Data loading70    bucket_size: 12800071    num_workers: 472    prefetch_factor: 3273    74    # Hyperparams75    dropout_steps: [0]76    dropout: [0.1]77    attention_dropout: [0.1]78    max_grad_norm: 079    label_smoothing: 0.180    average_decay: 0.000181    param_init_method: xavier_uniform82    normalization: "tokens"83 84model:85    architecture: "transformer"86    share_embeddings: false87    share_decoder_embeddings: false88    hidden_size: 102489    encoder:90        layers: 891    decoder:92        layers: 293    heads: 894    transformer_ff: 409695    embeddings:96        word_vec_size: 102497        position_encoding_type: "SinusoidalInterleaved"98 99