thang1943/phobert-base-v2-mnr-loss
SentenceTransformer based on vinai/phobert-base-v2
This is a sentence-transformers model finetuned from vinai/phobert-base-v2 on the dataset_full_fixed dataset. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.
Model Details
Model Description
- Model Type: Sentence Transformer
- Base model: vinai/phobert-base-v2 <!-- at revision e2375d266bdf39c6e8e9a87af16a5da3190b0cc8 -->
- Maximum Sequence Length: 256 tokens
- Output Dimensionality: 768 dimensions
- Similarity Function: Cosine Similarity
- Training Dataset:
- dataset_full_fixed <!-- - Language: Unknown --> <!-- - License: Unknown -->
Model Sources
- Documentation: Sentence Transformers Documentation
- Repository: Sentence Transformers on GitHub
- Hugging Face: Sentence Transformers on Hugging Face
Full Model Architecture
SentenceTransformer(
(0): Transformer({'max_seq_length': 256, 'do_lower_case': False}) with Transformer model: RobertaModel
(1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
)Usage
Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
pip install -U sentence-transformersThen you can load this model and run inference.
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("phobert-base-v2-mnr-loss")
# Run inference
sentences = [
'Chào bạn, Qua mô tả rất có thể bạn đã bị thoát vị bẹn tái phát. Để được hưởng BHYT, bạn bắt buộc phải đến khám tại cơ sở chăm sóc y tế ban đầu (theo thẻ bảo hiểm), khi bác sĩ có chỉ định làm xét nghiệm thì mới được BHYT thanh toán một phần theo quy định. Nếu tự ý thực hiện xét nghiệm thì không được BHYT thanh toán bạn nhé! Thân mến.',
'Chào bác sĩ,\r\n\r\nCách đây 10 tháng em bị thoát vị bìu trái, đã mổ và lắp lưới tại Bệnh viện Chợ Rẫy. Gần đây em thấy hơi đau ổ bụng phải vùng háng mỗi khi vận động mạnh hay ho, sưng khi vận động và khi ngủ nghỉ sẽ xẹp xuống. \r\n\r\nBác sĩ cho em hỏi có phải em bị thoát vị phải giai đoạn đầu không ạ? Muốn chẩn đoán chính xác cần siêu âm hay nội soi ạ, có được giảm phí cho công nhân có BHXH không ạ? Em đi làm suốt, không có thời gian đến thăm khám cũng như điều kiện tài chính. Kính mong bác sĩ tư vấn giúp em. Em cám ơn nhiều ạ!',
'Chào bác sĩ,Em có làm xét nghiệm HIV chiến lược III tại Pasture với sinh phẩm là HIV duo cho kết quả âm tính sau 6 tuần kể từ lúc có nguy cơ. Bác sĩ cho em hỏi là xét nghiệm chiến lược III này có giống như HIV combo không ạ? Và em đã được an toàn chưa ạ. Em trân trọng cám ơn!',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]<!--
Direct Usage (Transformers)
<details><summary>Click to see the direct usage in Transformers</summary>
</details> -->
<!--
Downstream Usage (Sentence Transformers)
You can finetune this model on your own dataset.
<details><summary>Click to expand</summary>
</details> -->
<!--
Out-of-Scope Use
List how the model may foreseeably be misused and address what users ought not to do with the model. -->
Evaluation
Metrics
Information Retrieval
- Dataset:
dim_768 - Evaluated with <code>InformationRetrievalEvaluator</code> with these parameters:
{
"truncate_dim": 768
}<!--
Bias, Risks and Limitations
What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->
<!--
Recommendations
What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->
Training Details
Training Dataset
datasetfullfixed
- Dataset: dataset_full_fixed at ef2e7fd
- Size: 43,803 training samples
- Columns: <code>positive</code> and <code>query</code>
- Approximate statistics based on the first 1000 samples: | | positive | query | |:--------|:-------------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------| | type | string | string | | details | <ul><li>min: 30 tokens</li><li>mean: 188.07 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>min: 5 tokens</li><li>mean: 79.04 tokens</li><li>max: 256 tokens</li></ul> |
- Samples: | positive | query | |:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------| | <code>Tìm hiểu chung nhiễm clostridium botulinum Nhiễm Clostridium botulinum là gì? Clostridium botulinum là một loài trực khuẩn Gram dương, kỵ khí, sinh bào tử và gây bệnh ở người. Ngộ độc C. botulinum hiếm gặp nhưng đe doạ tính mạng, xảy ra khi độc tố botulinum đi vào máu và ức chế giải phóng acetylcholine không phục hồi ở các đầu mút dây thần kinh ngoại vi. C. botulinum tạo ra 8 loại kháng nguyên gây độc tố thần kinh (type A đến H). Năm type độc tố gồm A, B, E và F, H (hiếm gặp) ảnh hưởng đến con người. Độc tố botulinum B là các protein gây độc cao, không bị phân hủy do acid dịch vị và các enzym thuỷ phân protein. Type H có độc tính mạnh nhất.</code> | <code>Tìm hiểu chung nhiễm clostridium botulinum</code> | | <code>Thay đổi thói quen giúp giảm bớt triệu chứng sau mổ vẹo vách ngăn mũi Chào em, Vách ngăn mũi cấu trúc bằng nhiều xương hợp thành nên dễ bị vẹo lệch. Nếu vách ngăn lệch nhiều hoặc có gai là yếu tố góp phần làm cho tình trạng nghẹt mũi thêm nặng nề, là yếu tố làm nặng thêm viêm xoang mạn. Vì thế, chỉ định phẫu thuật vách ngăn mũi khi có những biến chứng như: niêm mạc mũi xoang thoái hóa tạo thành polype, nhiễm nấm mũi xoang, nhiễm trùng đi kèm không đáp ứng với điều trị nội khoa, vẹo vách ngăn sau chấn thương mũi. Tuy nhiên, cũng vì vẹo vách ngăn mũi chỉ góp 1 phần trong bệnh lý viêm mũi xoang mạn, viêm mũi dị ứng, viêm mũi vận mạch, cho nên, sau phẫu thuật vẹo vách ngăn mũi, không có nghĩa là bệnh viêm mũi xoang, viêm mũi vận mạch sẽ hết theo luôn, mà chúng ta vẫn cần tiếp tục điều trị đối với các bệnh lý này. Đối với viêm mũi vận mạch, viêm mũi dị ứng thì là bệnh cơ địa rồi, tức là không chữa dứt hoàn toàn, chỉ điều trị phòng ngừa với giữ ấm vùng mũi họng, hạn chế để quạt thổi thẳng và...</code> | <code>Thưa bác sĩ, em mổ vẹo vách ngăn mũi được 1 tháng rồi, mà vẫn còn đau đầu và mũi, dịch tiết cứ xuống họng hoài làm em khó chịu. Xin bác sĩ tư vấn giúp.(Huỳnh Thị Diễm Trang - Châu Thành, Kiên Giang)</code> | | <code>Vừa rồi tôi có kiểm tra trọng lượng cơ thể, từ 69 kg xuống còn 64 ký trong 20 ngày, vậy có sao không ạ? Tôi ăn uống vấn bình thường, cao 1m70. Xin BS tư vấn giúp. Chào bạn, Nhiều loại thuốc kháng sinh có tác dụng phụ là gây <br>chán ăn, lạt miệng, đắng miệng; bên cạnh đó, quá trình viêm nhiễm và <br>lành vết thương cũng làm hao tổn năng lượng của cơ thể nhưng lại giảm <br>hấp thu dinh dưỡng, cộng thêm cảm giác khó chịu khi bị bệnh và tâm lý <br>nặng nề trong lúc điều trị bệnh, điều này có thể dẫn đến việc sụt cân. <br>Sụt cân không phải là triệu chứng của bệnh dại . Trước <br> mắt bạn chú ý ăn uống tẩm bổ thêm, nếu cân nặng tiếp tục sụt giảm thì <br>cần tái khám lại BS điều trị để kiểm tra chức năng gan, tuyến giáp, tiểu <br> đường… Thân mến.</code> | <code>Kính chào BS. Tôi bị súc vật cắn ở chân, điều trị được 20 ngày rồi, vết thương đã gần liền miệng, dùng nhiều kháng sinh và có chích 5 mũi văcxin phòng dại.</code> |
- Loss: <code>MultipleNegativesRankingLoss</code> with these parameters:
{
"scale": 20.0,
"similarity_fct": "cos_sim"
}Training Hyperparameters
Non-Default Hyperparameters
eval_strategy: epochper_device_train_batch_size: 80per_device_eval_batch_size: 80learning_rate: 1e-06num_train_epochs: 5lr_scheduler_type: constantwithwarmupwarmup_ratio: 0.1bf16: Truetf32: Falseload_best_model_at_end: Trueoptim: adamwtorchfusedbatch_sampler: no_duplicates
All Hyperparameters
<details><summary>Click to expand</summary>
overwrite_output_dir: Falsedo_predict: Falseeval_strategy: epochprediction_loss_only: Trueper_device_train_batch_size: 80per_device_eval_batch_size: 80per_gpu_train_batch_size: Noneper_gpu_eval_batch_size: Nonegradient_accumulation_steps: 1eval_accumulation_steps: Nonetorch_empty_cache_steps: Nonelearning_rate: 1e-06weight_decay: 0.0adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08max_grad_norm: 1.0num_train_epochs: 5max_steps: -1lr_scheduler_type: constantwithwarmuplr_scheduler_kwargs: {}warmup_ratio: 0.1warmup_steps: 0log_level: passivelog_level_replica: warninglog_on_each_node: Truelogging_nan_inf_filter: Truesave_safetensors: Truesave_on_each_node: Falsesave_only_model: Falserestore_callback_states_from_checkpoint: Falseno_cuda: Falseuse_cpu: Falseuse_mps_device: Falseseed: 42data_seed: Nonejit_mode_eval: Falseuse_ipex: Falsebf16: Truefp16: Falsefp16_opt_level: O1half_precision_backend: autobf16_full_eval: Falsefp16_full_eval: Falsetf32: Falselocal_rank: 0ddp_backend: Nonetpu_num_cores: Nonetpu_metrics_debug: Falsedebug: []dataloader_drop_last: Falsedataloader_num_workers: 0dataloader_prefetch_factor: Nonepast_index: -1disable_tqdm: Falseremove_unused_columns: Truelabel_names: Noneload_best_model_at_end: Trueignore_data_skip: Falsefsdp: []fsdp_min_num_params: 0fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}fsdp_transformer_layer_cls_to_wrap: Noneaccelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}deepspeed: Nonelabel_smoothing_factor: 0.0optim: adamwtorchfusedoptim_args: Noneadafactor: Falsegroup_by_length: Falselength_column_name: lengthddp_find_unused_parameters: Noneddp_bucket_cap_mb: Noneddp_broadcast_buffers: Falsedataloader_pin_memory: Truedataloader_persistent_workers: Falseskip_memory_metrics: Trueuse_legacy_prediction_loop: Falsepush_to_hub: Falseresume_from_checkpoint: Nonehub_model_id: Nonehub_strategy: every_savehub_private_repo: Falsehub_always_push: Falsegradient_checkpointing: Falsegradient_checkpointing_kwargs: Noneinclude_inputs_for_metrics: Falseeval_do_concat_batches: Truefp16_backend: autopush_to_hub_model_id: Nonepush_to_hub_organization: Nonemp_parameters:auto_find_batch_size: Falsefull_determinism: Falsetorchdynamo: Noneray_scope: lastddp_timeout: 1800torch_compile: Falsetorch_compile_backend: Nonetorch_compile_mode: Nonedispatch_batches: Nonesplit_batches: Noneinclude_tokens_per_second: Falseinclude_num_input_tokens_seen: Falseneftune_noise_alpha: Noneoptim_target_modules: Nonebatch_eval_metrics: Falseeval_on_start: Falseeval_use_gather_object: Falseprompts: Nonebatch_sampler: no_duplicatesmulti_dataset_batch_sampler: proportional
</details>
Training Logs
<details><summary>Click to expand</summary>
- The bold row denotes the saved checkpoint. </details>
Framework Versions
- Python: 3.10.12
- Sentence Transformers: 4.1.0
- Transformers: 4.44.2
- PyTorch: 2.7.0+cu128
- Accelerate: 1.7.0
- Datasets: 3.6.0
- Tokenizers: 0.19.1
Citation
BibTeX
Sentence Transformers
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}MultipleNegativesRankingLoss
@misc{henderson2017efficient,
title={Efficient Natural Language Response Suggestion for Smart Reply},
author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
year={2017},
eprint={1705.00652},
archivePrefix={arXiv},
primaryClass={cs.CL}
}<!--
Glossary
Clearly define terms in order to be accessible across audiences. -->
<!--
Model Card Authors
Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->
<!--
Model Card Contact
Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->
