tanbinh2210/onl_contrastive_phobert-base-v2_v2
SentenceTransformer based on vinai/phobert-base-v2
This is a sentence-transformers model finetuned from vinai/phobert-base-v2. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.
Model Details
Model Description
- Model Type: Sentence Transformer
- Base model: vinai/phobert-base-v2 <!-- at revision e2375d266bdf39c6e8e9a87af16a5da3190b0cc8 -->
- Maximum Sequence Length: 256 tokens
- Output Dimensionality: 768 tokens
- Similarity Function: Cosine Similarity <!-- - Training Dataset: Unknown --> <!-- - Language: Unknown --> <!-- - License: Unknown -->
Model Sources
- Documentation: Sentence Transformers Documentation
- Repository: Sentence Transformers on GitHub
- Hugging Face: Sentence Transformers on Hugging Face
Full Model Architecture
SentenceTransformer(
(0): Transformer({'max_seq_length': 256, 'do_lower_case': False}) with Transformer model: RobertaModel
(1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
)Usage
Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
pip install -U sentence-transformersThen you can load this model and run inference.
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("tanbinh2210/onl_contrastive_phobert-base-v2_v2")
# Run inference
sentences = [
'Đơn xin nghỉ_phép có những trạng_thái nào và ý_nghĩa của từng trạng_thái đó là gì ?',
'Cài_đặt đơn_từ\nCài_đặt danh_mục\nCài_đặt danh_mục là nơi người dùng cài_đặt các lý_do của đơn_từ hành_chính , phương_tiện công_tác , công_tác_phí\n1 . Mở phân hệ Đơn_từ tại HRM\n2 . Ở trên cùng bên phải , chọn Cài_đặt\n3 . Tại menu trái , chọn Danh_mục\n4 . Chọn_Tạo mới để tạo mới\n5 . Nhấp vào Cập_nhật để lưu thay_đổi\ncài_đặt danh_mục\nTrường dữ_liệu : Tối_đa , Mô_tả : Hạn_chế nhân_sự sử_dụng đơn quá nhiều lần trong tuần , tháng hoặc năm\nTrường dữ_liệu : Ký_hiệu , Mô_tả : Ký_hiệu hiển_thị trên bảng chấm công Chỉ hiển_thị ký_hiệu với Đơn xin nghỉ\nTrường dữ_liệu : Tính công , Mô_tả : Nếu lý_do bạn chọn Có tính công thì khoảng thời_gian xin nghỉ / vắng_mặt của bạn sẽ được tính vào công làm_việc\nTrường dữ_liệu : Trạng_thái , Mô_tả : Hoạt_động : người dùng có_thể chọn lý_do này khi tạo đơn Không hoạt_động : người dùng sẽ không nhìn thấy lý_do này trong danh_sách\nTrường dữ_liệu : Yêu_cầu chốt , Mô_tả : Nếu lý_do vắng_mặt của bạn Có yêu_cầu chốt vân tay thì bạn cần phải chốt vân tay_trong khoảng thời_gian bắt_đầu vắng mắt và kết_thúc vắng_mặt\nLưu_ý : Không_thể xoá những lý_do của đơn xin nghỉ được hệ_thống tạo ra , chỉ có_thể chuyển lý_do sang trạng_thái không hoạt_động .',
'Thư_viện tài_nguyên\nThư_viện tài_nguyên là một tính_năng mới của 1Office .\nĐây là kho tài_nguyên chứa các dữ_liệu mẫu mà 1Office cung_cấp cho Khách_hàng .\nNó hoạt_động giống như Google Play hay Chrome_Extension .\nTại đây sẽ có các Template mẫu , người dùng có_thể vào xem thử ảnh demo hoặc mô_tả , nếu phù_hợp với đặc_thù công_việc , chọn Cài_đặt để tải về .\nKhi đó , tài_nguyên vừa tải về sẽ được cập_nhật vào đối_tượng tương_ứng trên phần_mềm .\nSử_dụng thư_viện tài_nguyên như_thế_nào ?\nĐể có được những tài_nguyên mà 1Office , người dùng thực_hiện theo các bước :\nBước 1 .\nTải tài_liệu về phần_mềm\nBước 2 .\nCài_đặt thông_số cho dữ_liệu tải về\nBước 3 .\nSử_dụng phần_mềm với các tài_liệu đã được cài_đặt trên phần_mềm',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]<!--
Direct Usage (Transformers)
<details><summary>Click to see the direct usage in Transformers</summary>
</details> -->
<!--
Downstream Usage (Sentence Transformers)
You can finetune this model on your own dataset.
<details><summary>Click to expand</summary>
</details> -->
<!--
Out-of-Scope Use
List how the model may foreseeably be misused and address what users ought not to do with the model. -->
<!--
Bias, Risks and Limitations
What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->
<!--
Recommendations
What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->
Training Details
Training Dataset
Unnamed Dataset
- Size: 71,937 training samples
- Columns: <code>question</code>, <code>passage</code>, and <code>label</code>
- Approximate statistics based on the first 1000 samples: | | question | passage | label | |:--------|:----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:-----------------------------------------------| | type | string | string | int | | details | <ul><li>min: 8 tokens</li><li>mean: 20.09 tokens</li><li>max: 52 tokens</li></ul> | <ul><li>min: 25 tokens</li><li>mean: 179.18 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>0: ~91.30%</li><li>1: ~8.70%</li></ul> |
- Samples: | question | passage | label | |:--------------------------------------------------------------------------------------------------------------------------------|:------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------| | <code>Tôi nên bắtđầu từ đâu để cóthể sửdụng 1Office mộtcách nhanhchóng và hiệuquả ?</code> | <code>CHÀOMỪNG BẠN ĐẾN VỚI TRUNGTÂM HỖTRỢ 1OFFICE<br>Bạn muốn truycập nhanh đến phầnmềm 1 Office ?<br>Trangchủ<br>Nộidung<br>Bắtđầu sửdụng<br>Tìmhiểu về các phân hệ<br>Chươngtrình đàotạo và bổsung về phầnmềm 1Office<br>Trungtâm trợgiúp của 1Office<br>Tại đây , bạn sẽ có mọi thôngtin cầnthiết để bắtđầu sửdụng các tínhnăng trong phầnmềm 1Office , baogồm Hướngdẫn sửdụng cho các phân hệ CRM , HRM , và Workplace .<br>Ngoàira , chúngtôi cungcấp các khoá đàotạo , mẹo hữuích , và nhiều hơnnữa để giúp bạn tậndụng tốiđa ưuđiểm của 1Office trong quảnlý doanhnghiệp .</code> | <code>1</code> | | <code>Việc xuất file thôngtin máy chấm công có giúp tôi tải lại thôngtin cấuhình vào hệthống mới nhanhchóng không ?</code> | <code>Thêm máy chấm công<br>Thêm máy chấm công<br>Tên trường : Địađiểm , Môtả : Vịtrí hiệntại của máy chấm công .<br>Tên trường : Mã máy , Môtả : Doanhnghiệp tự đặt mã hoặc cóthể để trống ( Nếu doanhnghiệp sửdụng nhiều máy chấm công ở các địađiểm khác nhau cóthể đặt tên để phânbiệt các máy chấm công và mã chấm công của nhânsự ) .<br>Tên trường :<br>Port , Môtả : Nhập cổng PORT của máy chấm công ( Vào càiđặt của máy chấm công để xem thôngtin cổng PORT )<br>Tên trường : Mậtkhẩu , Môtả : Nếu máy chấm công có mậtkhẩu thì các bạn nhập mậtkhẩu ở đây<br>Tên trường : Tải từ ngày , Môtả : Chọn thờigian bắtđầu tải log vân tay đến ngày hiệntại<br>Tên trường : Lịchsử , Môtả : Thôngtin lịchsử tool kếtnối tải và đẩy log dữliệu chấm công<br>Tên trường : Càiđặt , Môtả : Càiđặt chung cho tool chấm công<br>Tên trường : URL 1Office , Môtả : Copy link URL ở Càiđặt chấm công và gán mục này<br>Tên trường : Thờigian tải log , Môtả : Chọn khoảng thờigian tải log giữa hai lần liêntiếp ( vídụ chọn 20 phút nghĩalà cứ 20 phút tool tải log về một lần )<br>Tên trường : Thờigian đẩy log , Môtả : Thờigian nhận đẩy log ( vídụ : cứ 2 phút đẩy log một lần )<br>Tên trường : Nhập số log được đẩy lên trong một lần , Môtả : Số log được tải trong 1 lần đẩy<br>Tên trường : Thưmục lưu backup , Môtả : Chọn một thưmục để backup dữliệu chấm công</code> | <code>0</code> | | <code>Khi nhânsự thayđổi phòngban , vịtrí , chứcvụ thì nhóm quyền của họ có cần được cậpnhật lại không ?</code> | <code>Hợpđồng laođộng<br>Hợpđồng laođộng là gì ?<br>Hợpđồng laođộng là vănbản thoảthuận giữa người laođộng và người sửdụng laođộng về việclàm có trả công , trong đó quyđịnh điềukiện laođộng , quyền và nghĩavụ của mỗi bên trong quanhệ laođộng .<br>Hợpđồng laođộng được kýkết theo nguyêntắc tựnguyện , bìnhđẳng , phùhợp với các quyđịnh của phápluật laođộng .<br>Quảnlý hợpđồng laođộng giúpích gì cho doanhnghiệp ?<br>Thường các doanhnghiệp mới quảnlý file cứng của hợpđồng laođộng và chưa sốhoá để quảnlý .<br>Tínhnăng quảnlý hợpđồng chophép sốhoá các thôngtin cơbản của hợpđồng để quảnlý .<br>Việc quảnlý này giúp cho việc lưutrữ , tracứu thôngtin nhanhchóng chínhxác .<br>Ngoàira , các dữliệu về lương , phụcấp , vịtrí , chứcvụ , phòngban trong hợpđồng laođộng sẽ được cậpnhật tựđộng vào hồsơ nhânsự .<br>Đây sẽ là cơsở để tínhtoán lương , phụcấp cho người laođộng .<br>Đốitượng sửdụng hợpđồng laođộng :<br>Bộphận nhânsự và quảnlý chinhánh , phòngban<br>Hướngdẫn quảnlý hợpđồng laođộng<br>Để quảnlý hợpđồng laođộng , bạn theodõi những bước sau :<br>Bước 1 .<br>Càiđặt hợpđồng laođộng<br>Bước 2 .<br>Tạo mới và quảnlý hợpđồng laođộng<br>Bước 1 .<br>Càiđặt hợpđồng lao_động</code> | <code>0</code> |
- Loss: <code>OnlineContrastiveLoss</code>
Evaluation Dataset
Unnamed Dataset
- Size: 7,994 evaluation samples
- Columns: <code>question</code>, <code>passage</code>, and <code>label</code>
- Approximate statistics based on the first 1000 samples: | | question | passage | label | |:--------|:----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:-----------------------------------------------| | type | string | string | int | | details | <ul><li>min: 8 tokens</li><li>mean: 20.18 tokens</li><li>max: 44 tokens</li></ul> | <ul><li>min: 25 tokens</li><li>mean: 181.28 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>0: ~90.30%</li><li>1: ~9.70%</li></ul> |
- Samples: | question | passage | label | |:------------------------------------------------------------------------------------------------------|:------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------| | <code>Bảng lương sẽ tựđộng lấy điểm KPI nào khi nhânviên có nhiều kỳ đánhgiá đã được chốt ?</code> | <code>Khắcphục sựcố không liênkết được tới phân hệ bảng lương<br>Nguyênnhân dẫn đến sựcố không liênkết được điểm KPI tới phân hệ bảng lương là do kỳ đánhgiá KPI đó chưa được chốt .<br>Để khách phục sựcố này bạn cần thựchiện cách khắcphục sau :<br>Liênhệ ngườiquảnlý KPI thựchiện chốt kỳ đánhgiá .<br>Truycập chitiết kỳ đánhgiá Thựchiện thaotác Chốt kỳ đánhgiá .</code> | <code>0</code> | | <code>Các bước cụthể để tạo một đơn xin thôiviệc mới trên hệthống là gì ?</code> | <code>Đơn xin nghỉ<br>Quảnlý đơn xin nghỉ<br>1 . Tạo mới đơn xin nghỉ<br>Để tạo mới đơn xin nghỉ , bạn thựchiện các bước sau :<br>Bước 1 : Chọn phân hệ Đơntừ tại HRM > Biểutượng tạo mới > Đơntừ > Đơn xin nghỉ<br>Bước 2 : Nhập đầyđủ các thôngtin cầnthiết và nhấn nút Cậpnhật để lưu lại<br>tạo mới đơn xin nghỉ<br>Các trường cần lưuý :<br>STT :<br>1 , Tên trường : Lýdo , Môtả : Người dùng chọn 1 trong số các lýdo đã được cấuhình trong càiđặt , mỗi lýdo sẽ ứng với tính công hoặc không tính công như đã càiđặt trước đó<br>STT :<br>2 , Tên trường : Thờigian ( từ giờ , ngày , đến giờ , ngày ) , Môtả : Người dùng nhập thờigian xin nghỉ ( đơnvị tính theo giờ ) .<br>Người dùng cóthể cộng dòng để tạo nhiều ngày nghỉ trong một đơn<br>STT :<br>3 , Tên trường : Môtả , Môtả : Môtả thêm thôngtin khi tạo đơn xin nghỉ<br>2 . Quảnlý đơn xin nghỉ<br>2.1 . Mànhình quảnlý đơn xin nghỉ<br>Để quảnlý đơn xin nghỉ , người dùng sửdụng 2 cách sau :<br>Cách 1 : Quảnlý đơn xin nghỉ tại mànhình danhsách<br>Chọn tácvụ Lọc nhanh > ChọnĐơn xin nghỉ<br>Tại mànhình Danhsách đơn xin nghỉ > Click chuột phải vào chitiết một đơn để thựchiện tácvụ quảnlý đơn xin nghỉ .</code> | <code>0</code> | | <code>Sau khi tải tàiliệu từ thưviện về , bước tiếptheo là gì ?</code> | <code>Thưviện tàinguyên<br>Thưviện tàinguyên là một tínhnăng mới của 1Office .<br>Đây là kho tàinguyên chứa các dữliệu mẫu mà 1Office cungcấp cho Kháchhàng .<br>Nó hoạtđộng giống như Google Play hay ChromeExtension .<br>Tại đây sẽ có các Template mẫu , người dùng cóthể vào xem thử ảnh demo hoặc môtả , nếu phùhợp với đặcthù côngviệc , chọn Càiđặt để tải về .<br>Khi đó , tàinguyên vừa tải về sẽ được cậpnhật vào đốitượng tươngứng trên phầnmềm .<br>Sửdụng thưviện tàinguyên nhưthếnào ?<br>Để có được những tàinguyên mà 1Office , người dùng thựchiện theo các bước :<br>Bước 1 .<br>Tải tàiliệu về phầnmềm<br>Bước 2 .<br>Càiđặt thôngsố cho dữliệu tải về<br>Bước 3 .<br>Sửdụng phầnmềm với các tàiliệu đã được càiđặt trên phần_mềm</code> | <code>1</code> |
- Loss: <code>OnlineContrastiveLoss</code>
Training Hyperparameters
Non-Default Hyperparameters
overwrite_output_dir: Trueper_device_train_batch_size: 16per_device_eval_batch_size: 32gradient_accumulation_steps: 8learning_rate: 2e-05weight_decay: 0.01num_train_epochs: 20lr_scheduler_type: cosinewarmup_ratio: 0.1fp16: True
All Hyperparameters
<details><summary>Click to expand</summary>
overwrite_output_dir: Truedo_predict: Falseeval_strategy: noprediction_loss_only: Trueper_device_train_batch_size: 16per_device_eval_batch_size: 32per_gpu_train_batch_size: Noneper_gpu_eval_batch_size: Nonegradient_accumulation_steps: 8eval_accumulation_steps: Nonetorch_empty_cache_steps: Nonelearning_rate: 2e-05weight_decay: 0.01adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08max_grad_norm: 1.0num_train_epochs: 20max_steps: -1lr_scheduler_type: cosinelr_scheduler_kwargs: {}warmup_ratio: 0.1warmup_steps: 0log_level: passivelog_level_replica: warninglog_on_each_node: Truelogging_nan_inf_filter: Truesave_safetensors: Truesave_on_each_node: Falsesave_only_model: Falserestore_callback_states_from_checkpoint: Falseno_cuda: Falseuse_cpu: Falseuse_mps_device: Falseseed: 42data_seed: Nonejit_mode_eval: Falseuse_ipex: Falsebf16: Falsefp16: Truefp16_opt_level: O1half_precision_backend: autobf16_full_eval: Falsefp16_full_eval: Falsetf32: Nonelocal_rank: 0ddp_backend: Nonetpu_num_cores: Nonetpu_metrics_debug: Falsedebug: []dataloader_drop_last: Falsedataloader_num_workers: 0dataloader_prefetch_factor: Nonepast_index: -1disable_tqdm: Falseremove_unused_columns: Truelabel_names: Noneload_best_model_at_end: Falseignore_data_skip: Falsefsdp: []fsdp_min_num_params: 0fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}fsdp_transformer_layer_cls_to_wrap: Noneaccelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}deepspeed: Nonelabel_smoothing_factor: 0.0optim: adamw_torchoptim_args: Noneadafactor: Falsegroup_by_length: Falselength_column_name: lengthddp_find_unused_parameters: Noneddp_bucket_cap_mb: Noneddp_broadcast_buffers: Falsedataloader_pin_memory: Truedataloader_persistent_workers: Falseskip_memory_metrics: Trueuse_legacy_prediction_loop: Falsepush_to_hub: Falseresume_from_checkpoint: Nonehub_model_id: Nonehub_strategy: every_savehub_private_repo: Falsehub_always_push: Falsegradient_checkpointing: Falsegradient_checkpointing_kwargs: Noneinclude_inputs_for_metrics: Falseeval_do_concat_batches: Truefp16_backend: autopush_to_hub_model_id: Nonepush_to_hub_organization: Nonemp_parameters:auto_find_batch_size: Falsefull_determinism: Falsetorchdynamo: Noneray_scope: lastddp_timeout: 1800torch_compile: Falsetorch_compile_backend: Nonetorch_compile_mode: Nonedispatch_batches: Nonesplit_batches: Noneinclude_tokens_per_second: Falseinclude_num_input_tokens_seen: Falseneftune_noise_alpha: Noneoptim_target_modules: Nonebatch_eval_metrics: Falseeval_on_start: Falseeval_use_gather_object: Falsebatch_sampler: batch_samplermulti_dataset_batch_sampler: proportional
</details>
Training Logs
<details><summary>Click to expand</summary>
</details>
Framework Versions
- Python: 3.8.10
- Sentence Transformers: 3.2.1
- Transformers: 4.44.2
- PyTorch: 2.4.1+cu124
- Accelerate: 1.0.1
- Datasets: 2.19.0
- Tokenizers: 0.19.1
Citation
BibTeX
Sentence Transformers
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}<!--
Glossary
Clearly define terms in order to be accessible across audiences. -->
<!--
Model Card Authors
Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->
<!--
Model Card Contact
Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->
