Armak/SED
0
1training:2 #batch size: [strong, weak, unlabel]3 batch_size: [24, 24, 32]4 batch_size_val: 645 n_epochs_warmup: 50 # num epochs used for exponential warmup6 num_workers: 8 # change according to your cpu7 n_epochs: 150 # max num epochs8 early_stop_patience: 150 # Same as number of epochs by default, so no early stopping used9 accumulate_batches: 110 gradient_clip: 0. # 0 no gradient clipping11 median_window: 7 # length of median filter used to smooth prediction in inference (nb of output frames)12 val_thresholds: [0.5] # thresholds used to compute f1 intersection in validation.13 n_test_thresholds: 50 # number of thresholds used to compute psds in test14 backend: dp # pytorch lightning backend, ddp, dp or None15 validation_interval: 1 # perform validation every X epoch, 1 default16 seed: 4217 deterministic: False18 precision: 3219 mixup: soft # Soft mixup gives the ratio of the mix to the labels, hard mixup gives a 1 to every label present.20 obj_metric_strong_type: intersection21 enable_progress_bar: True22 weak_split: 0.9 # split weak data in train and validation23 consistency_loss: mse24 ema_factor: 0.99925 const_max: 226scaler:27 statistic: instance # instance or dataset-wide statistic28 normtype: minmax # minmax or standard or mean normalization29 dims: [1, 2] # dimensions over which normalization is applied30 savepath: ./scaler.ckpt # path to scaler checkpoint31data: # change with your paths if different.32 # NOTE: if you have data in 44kHz only then synth_folder will be the path where33 # resampled data will be placed.34 synth_folder: "/mnt/d/DESED_dataset/dcase_synth/audio/train/synthetic21_train/soundscapes_16k/"35 synth_tsv: "/mnt/d/DESED_dataset/dcase_synth/metadata/train/synthetic21_train/soundscapes.tsv"36 strong_folder: "/mnt/d/DESED_dataset/audio/train/strong_label_real_16k/"37 strong_tsv: "/mnt/d/DESED_dataset/metadata/train/audioset_strong.tsv"38 weak_folder: "/mnt/d/DESED_dataset/audio/train/weak_16k/"39 weak_tsv: "/mnt/d/DESED_dataset/metadata/train/weak.tsv"40 unlabeled_folder: "/mnt/d/DESED_dataset/audio/train/unlabel_in_domain_16k/"41 unlabeled_tsv: "/mnt/d/DESED_dataset/metadata/train/unlabel_in_domain.tsv"42 # synth_val_folder: "/mnt/d/DESED_dataset/dcase_synth/audio/validation/synthetic21_validation/soundscapes_16k/"43 # synth_val_folder_44k: "/mnt/d/DESED_dataset/dcase_synth/audio/validation/synthetic21_validation/soundscapes/"44 # synth_val_tsv: "/mnt/d/DESED_dataset/dcase_synth/metadata/validation/synthetic21_validation/soundscapes.tsv"45 # synth_val_dur: "/mnt/d/DESED_dataset/dcase_synth/metadata/validation/synthetic21_validation/durations.tsv"46 synth_val_folder: "/mnt/d/DESED_dataset/audio/validation/validation_16k/"47 synth_val_tsv: "/mnt/d/DESED_dataset/metadata/validation/validation.tsv"48 synth_val_dur: "/mnt/d/DESED_dataset/metadata/validation/validation_durations.tsv"49 # test_folder: "/mnt/d/DESED_dataset/audio/validation/validation_16k/"50 # test_tsv: "/mnt/d/DESED_dataset/metadata/validation/validation.tsv"51 # test_dur: "/mnt/d/DESED_dataset/metadata/validation/validation_durations.tsv"52 test_folder: "/mnt/d/DESED_dataset/audio/test/public/"53 test_tsv: "/mnt/d/DESED_dataset/metadata/test/public.tsv"54 test_dur: "/mnt/d/DESED_dataset/metadata/test/test_durations.tsv"55 eval_folder: "/mnt/d/DESED_dataset/audio/eval21_16k"56 audio_max_len: 1057 fs: 1600058 net_subsample: 159opt:60 lr: 0.00161feats:62 n_mels: 12863 n_filters: 204864 hop_length: 25665 n_window: 204866 sample_rate: 1600067 f_min: 068 f_max: 800069net:70 dropout: 0.571 n_layer_RNN: 272 n_in_channel: 173 nclass: 1074 n_RNN_cell: 12875 activation: Relu76 rnn_type: BGRU77 kernel_size: [3, 3, 3, 3, 3, 3, 3]78 padding: [1, 1, 1, 1, 1, 1, 1]79 stride: [1, 1, 1, 1, 1, 1, 1]80 nb_filters: [ 16, 32, 64, 128, 128, 128, 128 ]81 pooling: [ [ 1, 2 ], [ 1, 2 ], [ 1, 2 ], [ 1, 2 ], [ 1, 2 ], [ 1, 2 ], [ 1, 2 ] ]82 dropout_recurrent: 083 attention: True84 85 