enoriega/rule_learning_margin_1mm_spanpred
0186
1{2 "_name_or_path": "enoriega/rule_softmatching",3 "architectures": [4 "BertForRuleScoring"5 ],6 "attention_probs_dropout_prob": 0.1,7 "classifier_dropout": null,8 "gradient_checkpointing": false,9 "hidden_act": "gelu",10 "hidden_dropout_prob": 0.1,11 "hidden_size": 768,12 "initializer_range": 0.02,13 "intermediate_size": 3072,14 "layer_norm_eps": 1e-12,15 "loss_func": "margin",16 "margin": 1.0,17 "max_position_embeddings": 512,18 "model_type": "bert",19 "num_attention_heads": 12,20 "num_hidden_layers": 12,21 "pad_token_id": 0,22 "position_embedding_type": "absolute",23 "problem_type": "regression",24 "rule_sentence_encoding": "cls",25 "spec_dropout": 0.2,26 "spec_encoding": "avg",27 "torch_dtype": "float32",28 "transformers_version": "4.19.2",29 "type_vocab_size": 2,30 "use_cache": true,31 "vocab_size": 3052432}33 