CoolFace
Modelpublic

GbrlOl/finetune-embedding-all-MiniLM-L6-v2-geotechnical-test-v4

sourceHugging Faceupdated 21d agoView on Hugging Face
1likes95downloads
Model Card

SentenceTransformer based on sentence-transformers/all-MiniLM-L6-v2

This is a sentence-transformers model finetuned from sentence-transformers/all-MiniLM-L6-v2 on the json dataset. It maps sentences & paragraphs to a 384-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.

Model Details

Model Description

  • —Model Type: Sentence Transformer
  • —Base model: sentence-transformers/all-MiniLM-L6-v2 <!-- at revision fa97f6e7cb1a59073dff9e6b13e2715cf7475ac9 -->
  • —Maximum Sequence Length: 256 tokens
  • —Output Dimensionality: 384 dimensions
  • —Similarity Function: Cosine Similarity
  • —Training Dataset:
  • —json <!-- - Language: Unknown --> <!-- - License: Unknown -->

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'max_seq_length': 256, 'do_lower_case': False}) with Transformer model: BertModel 
  (1): Pooling({'word_embedding_dimension': 384, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
  (2): Normalize()
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

bash
pip install -U sentence-transformers

Then you can load this model and run inference.

python
from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("GbrlOl/finetune-embedding-all-MiniLM-L6-v2-geotechnical-test-v4")
# Run inference
sentences = [
    '¿Cuál es el factor de seguridad mínimo para el corto plazo en caso de falla superficial estática en el botadero Sur?',
    'Plan de Cierre - Faena Minera Salares Norte |   95 \n \nTabla 8-13: Criterios para el Análisis de Estabilidad del Botadero Sur \nCondición FS Mínimo \nCorto Plazo \n(operacional) \nFalla Superficial  Estático 1,0 \nSísmico (1) \nFalla Profunda  Estático 1,5 \nSísmico 1,2 \nLargo Plazo \n(post-cierre) \nFalla Superficial  Estático 1,1 \nSísmico (1) \nFalla Profunda  Estático 1,5 \nSísmico 1,1 \n(1): El material es depositado me diante volteo de camiones y queda con su ángulo de reposo. Las fallas \nsuperficiales pueden ocurrir, pero las bermas de seguridad evitarán mayores deslizamientos de material.  \nPara los análisis que involucren al depósito de relaves filtrados, ya sea por si solo o junto al botadero Sur, el factor \nde seguridad mínimo para el corto plazo es de 1,5 para casos estáticos y 1,2 para la condición sísmica. Para el largo \nplazo, en tanto, el factor de seguridad mínimo para la condición sísmica es de 1,1. \nLos factores de seguridad obtenidos de los análisis de estabilidad son presentados en la Tabla 8-14 y en la Tabla 8-15. \nTodos los análisis indican que; tanto el diseño del botadero Sur, como el diseño del depósito de relaves filtrados, por \nsí solos como en conjunto, cumplen con los diseños de criterios d e los factores de seguridad.  \nLos análisis de fallas profundas han incorporado la determinación del factor de seguridad mínimo para fallas que \nimplican la totalidad del depósito, así como fallas que involucran 2 o 3 bancos, que pueden ser más críticos que \naquellos que involucran la totalidad del depósito.',
    'Sin perjuicio de ello, en este \nplan de cierre temporal se ha hecho un análisis a nive l de juicio experto respecto de los riesgos \nque se indican en la siguiente tabla.  \nTabla 3-3: Riesgos evaluados Instalaciones Complementarias y Auxiliares. \nInstalación Riesgos evaluados \nInstalaciones \nComplementarias \ny Auxiliares \nIA.1) Caída de Personas o animales a desnivel \nIA.2) Caída de objetos o materiales sobre personas o animales \nIA.3) Afectación a la salud de las personas por estructuras, \nmateriales y/o suelos contaminados \nFuente: Elaborado por MYMA, 2019 \n3.1 Evaluación de Riesgos \na) Evaluación de Riesgos previo a la definición de las medidas de cierre \nUna vez establecida la probabilidad de ocurrencia de los eventos y la severidad de las \nconsecuencias para las personas y el medio ambiente, se debe catalogar el límite de aceptabilidad \ndel riesgo.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 384]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]

<!--

Direct Usage (Transformers)

<details><summary>Click to see the direct usage in Transformers</summary>

</details> -->

<!--

Downstream Usage (Sentence Transformers)

You can finetune this model on your own dataset.

<details><summary>Click to expand</summary>

</details> -->

<!--

Out-of-Scope Use

List how the model may foreseeably be misused and address what users ought not to do with the model. -->

Evaluation

Metrics

Semantic Similarity
MetricValue
pearson_cosine0.5694
spearman_cosine0.5456
pearson_euclidean0.574
spearman_euclidean0.5456
pearson_manhattan0.5797
spearman_manhattan0.5534
pearson_dot0.5694
spearman_dot0.5456
pearson_max0.5797
spearman_max0.5534
Binary Classification
MetricValue
cosine_accuracy0.7938
cosineaccuracythreshold0.5779
cosine_f10.696
cosinef1threshold0.5187
cosine_precision0.7016
cosine_recall0.6905
cosine_ap0.807
euclidean_accuracy0.6154
euclideanaccuracythreshold-1.2038
euclidean_f10.5556
euclideanf1threshold-0.5825
euclidean_precision0.3858
euclidean_recall0.9921
euclidean_ap0.2644
manhattan_accuracy0.6154
manhattanaccuracythreshold-18.6887
manhattan_f10.5556
manhattanf1threshold-9.1288
manhattan_precision0.3858
manhattan_recall0.9921
manhattan_ap0.2632
dot_accuracy0.7938
dotaccuracythreshold0.5779
dot_f10.696
dotf1threshold0.5187
dot_precision0.7016
dot_recall0.6905
dot_ap0.807
max_accuracy0.7938
maxaccuracythreshold0.5779
max_f10.696
maxf1threshold0.5187
max_precision0.7016
max_recall0.9921
max_ap0.807

<!--

Bias, Risks and Limitations

What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->

<!--

Recommendations

What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->

Training Details

Training Dataset

json
  • —Dataset: json
  • —Size: 1,622 training samples
  • —Columns: <code>query</code>, <code>sentence</code>, and <code>label</code>
  • —Approximate statistics based on the first 1000 samples: | | query | sentence | label | |:--------|:----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:------------------------------------------------| | type | string | string | int | | details | <ul><li>min: 9 tokens</li><li>mean: 25.34 tokens</li><li>max: 69 tokens</li></ul> | <ul><li>min: 54 tokens</li><li>mean: 233.59 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>0: ~59.70%</li><li>1: ~40.30%</li></ul> |
  • —Samples: | query | sentence | label | |:------------------------------------------------------------------------------------------------------------------------------------------------|:------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------| | <code>Indica si se utiliza Proctor Modificado, o Normal o Estándar para compactar el relave filtrado, y cuál es el nivel de compactación</code> | <code>PLAN DE CIERRE TEMPO RAL – FAENA MINERA EL TOQUI <br> Sociedad Contractual Minera El Toqui <br>Capítulo 7 – Análisis de las Instalaciones <br> <br> <br>REVISIÓN [ 0] <br>7-107 <br> <br>Figura 7-38: Ubicación Parque Eólico <br> <br>Fuente: SCMET, 2018 <br>- Red de Abastecimiento de Energía : Está compuesta por todas las instalaciones utilizadas <br>para la distribución de la energía hacia todos los sectores de la faena, se compone de: <br>o Líneas de alta tensión: 30.000 metros lineales. <br>o Líneas de baja tensión: 2.000 metros lineales. <br>o Estaciones de combustible: Las minas que cuentan con estaciones de combustible <br>corresponden a Concordia, Estatuas, Doña Rosa. <br>o Subestaciones eléctricas: A continuación se presenta una tabla con las <br>subestaciones significativas y sus características. <br>o Sala eléctrica de la Planta de Procesos <br>o Subestación eléctrica TDR Confluencia (fue desmantelada).</code> | <code>0</code> | | <code>¿Cuál es la ubicación del Pozo Monitoreos?</code> | <code>64 <br>Figura 5.42: Caminos internos de acceso (2) . 64 <br>Figura 5.43: Patio de RISES . 65 <br>Figura 5.44: Bodega de almacenamiento temporal de residuos peligrosos . 66 <br>Figura 5.45: Bodega de almacenamiento de residuos domésticos . 67 <br>Figura 5.46: Ubicación Pozo Monitoreos . 100 <br>Figura 5.47: Caminos internos Planta Catemu . 107 <br> <br>ANEXOS <br> <br>ANEXO A : . ANTECEDENTES LEGALES <br>ANEXO B : . RESOLUCIONES <br>ANEXO C: . PROPIEDAD MINERA <br>ANEXO D: . INFORME DE VIDA ÚTIL <br>ANEXO E: . PLANOS <br>ANEXO F: . EVALUACIÓN DE RIESGOS <br>ANEXO G: . PLANILLA DE VALORIZACIÓN <br>ANEXO H: . RESPALDO DE PRECIOS UNITARIOS <br>ANEXO I: . GARANTÍA FINANCIERA</code> | <code>1</code> | | <code>se especifican antecedentes geofísicos?</code> | <code>Hay numerosas comunidades edáficas, una <br>de las cuales es el bosque de arrayán (Luma apiculata), de las orillas de ríos y lagos. <br>Considerando la clasificación de la vegetación natural de Chile de Gajardo (1993), las instalaciones <br>en cuestión se ubican en la formación del Bosque caducifolio de Aysén, que engloba básicamente <br>a bosques de lenga (Nothofagus pumilio), los que pueden encontrarse desde el sur de la X Región, <br>pero están representados en su forma característica en la XI Región. Son relativamente <br>homogéneos en composición florística y en su estructura, distribuyéndose en un ambiente con un <br>fuerte gradiente de precipitación de oeste a este, sobre un relieve de grandes variaciones en la <br>altitud. Ha sido muy afectado por la intervención humana, persistiendo su condición original <br>solamente en sectores locales. <br>Con relación a las especies de flora terrestre en categoría de conservación, en la undécima región <br>existen 2 especies que se encuentran incluidas en el listado naci...</code> | <code>0</code> |
  • —Loss: <code>CoSENTLoss</code> with these parameters:
json
  {
      "scale": 20.0,
      "similarity_fct": "pairwise_cos_sim"
  }

Training Hyperparameters

Non-Default Hyperparameters
  • —per_device_train_batch_size: 16
  • —per_device_eval_batch_size: 16
  • —learning_rate: 2e-05
  • —num_train_epochs: 100
  • —warmup_ratio: 0.1
  • —fp16: True
  • —batch_sampler: no_duplicates
All Hyperparameters

<details><summary>Click to expand</summary>

  • —overwrite_output_dir: False
  • —do_predict: False
  • —eval_strategy: no
  • —prediction_loss_only: True
  • —per_device_train_batch_size: 16
  • —per_device_eval_batch_size: 16
  • —per_gpu_train_batch_size: None
  • —per_gpu_eval_batch_size: None
  • —gradient_accumulation_steps: 1
  • —eval_accumulation_steps: None
  • —torch_empty_cache_steps: None
  • —learning_rate: 2e-05
  • —weight_decay: 0.0
  • —adam_beta1: 0.9
  • —adam_beta2: 0.999
  • —adam_epsilon: 1e-08
  • —max_grad_norm: 1.0
  • —num_train_epochs: 100
  • —max_steps: -1
  • —lr_scheduler_type: linear
  • —lr_scheduler_kwargs: {}
  • —warmup_ratio: 0.1
  • —warmup_steps: 0
  • —log_level: passive
  • —log_level_replica: warning
  • —log_on_each_node: True
  • —logging_nan_inf_filter: True
  • —save_safetensors: True
  • —save_on_each_node: False
  • —save_only_model: False
  • —restore_callback_states_from_checkpoint: False
  • —no_cuda: False
  • —use_cpu: False
  • —use_mps_device: False
  • —seed: 42
  • —data_seed: None
  • —jit_mode_eval: False
  • —use_ipex: False
  • —bf16: False
  • —fp16: True
  • —fp16_opt_level: O1
  • —half_precision_backend: auto
  • —bf16_full_eval: False
  • —fp16_full_eval: False
  • —tf32: None
  • —local_rank: 0
  • —ddp_backend: None
  • —tpu_num_cores: None
  • —tpu_metrics_debug: False
  • —debug: []
  • —dataloader_drop_last: False
  • —dataloader_num_workers: 0
  • —dataloader_prefetch_factor: None
  • —past_index: -1
  • —disable_tqdm: False
  • —remove_unused_columns: True
  • —label_names: None
  • —load_best_model_at_end: False
  • —ignore_data_skip: False
  • —fsdp: []
  • —fsdp_min_num_params: 0
  • —fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}
  • —fsdp_transformer_layer_cls_to_wrap: None
  • —accelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}
  • —deepspeed: None
  • —label_smoothing_factor: 0.0
  • —optim: adamw_torch
  • —optim_args: None
  • —adafactor: False
  • —group_by_length: False
  • —length_column_name: length
  • —ddp_find_unused_parameters: None
  • —ddp_bucket_cap_mb: None
  • —ddp_broadcast_buffers: False
  • —dataloader_pin_memory: True
  • —dataloader_persistent_workers: False
  • —skip_memory_metrics: True
  • —use_legacy_prediction_loop: False
  • —push_to_hub: False
  • —resume_from_checkpoint: None
  • —hub_model_id: None
  • —hub_strategy: every_save
  • —hub_private_repo: None
  • —hub_always_push: False
  • —gradient_checkpointing: False
  • —gradient_checkpointing_kwargs: None
  • —include_inputs_for_metrics: False
  • —include_for_metrics: []
  • —eval_do_concat_batches: True
  • —fp16_backend: auto
  • —push_to_hub_model_id: None
  • —push_to_hub_organization: None
  • —mp_parameters:
  • —auto_find_batch_size: False
  • —full_determinism: False
  • —torchdynamo: None
  • —ray_scope: last
  • —ddp_timeout: 1800
  • —torch_compile: False
  • —torch_compile_backend: None
  • —torch_compile_mode: None
  • —dispatch_batches: None
  • —split_batches: None
  • —include_tokens_per_second: False
  • —include_num_input_tokens_seen: False
  • —neftune_noise_alpha: None
  • —optim_target_modules: None
  • —batch_eval_metrics: False
  • —eval_on_start: False
  • —use_liger_kernel: False
  • —eval_use_gather_object: False
  • —average_tokens_across_devices: False
  • —prompts: None
  • —batch_sampler: no_duplicates
  • —multi_dataset_batch_sampler: proportional

</details>

Training Logs

EpochStepTraining Losssts_dev_spearman_maxquora_duplicates_dev_max_ap
00-0.55340.8070
2.39021004.6587--
4.78052002.3234--
7.14633000.869--
9.53664000.2738--
11.92685000.328--
14.29276000.1296--
16.68297000.1233--
19.04888000.1024--
21.43909000.0337--
23.829310000.0033--
26.195111000.0508--
28.585412000.0221--
30.975613000.0167--
33.341514000.0003--
35.731715000.0--
38.097616000.0--
40.487817000.0--
42.878018000.0--
45.243919000.0--
47.634120000.0--
50.024421000.0--
52.390222000.0--
54.780523000.0--
57.146324000.0--
59.536625000.0--
61.926826000.0--
64.292727000.0--
66.682928000.0--
69.048829000.0--
71.439030000.0--
73.829331000.0--
76.195132000.0--
78.585433000.0--
80.975634000.0--
83.341535000.0--
85.731736000.0--
88.097637000.0--
90.487838000.0--
92.878039000.0--
95.243940000.0--
97.634141000.0--

Framework Versions

  • —Python: 3.10.16
  • —Sentence Transformers: 3.3.1
  • —Transformers: 4.48.1
  • —PyTorch: 2.5.1+cu124
  • —Accelerate: 1.3.0
  • —Datasets: 3.2.0
  • —Tokenizers: 0.21.0

<!--

Glossary

Clearly define terms in order to be accessible across audiences. -->

<!--

Model Card Authors

Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->

<!--

Model Card Contact

Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->