iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-raw_data_wseg-lr2e-05-1-epochs-bs-48
SentenceTransformer based on vinai/phobert-base-v2
This is a sentence-transformers model finetuned from vinai/phobert-base-v2 on the vietnamese-ecommerce-alpaca dataset. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.
Model Details
Model Description
- Model Type: Sentence Transformer
- Base model: vinai/phobert-base-v2 <!-- at revision e2375d266bdf39c6e8e9a87af16a5da3190b0cc8 -->
- Maximum Sequence Length: 256 tokens
- Output Dimensionality: 768 dimensions
- Similarity Function: Cosine Similarity
- Training Dataset:
- vietnamese-ecommerce-alpaca <!-- - Language: Unknown --> <!-- - License: Unknown -->
Model Sources
- Documentation: Sentence Transformers Documentation
- Repository: Sentence Transformers on GitHub
- Hugging Face: Sentence Transformers on Hugging Face
Full Model Architecture
SentenceTransformer(
(0): Transformer({'max_seq_length': 256, 'do_lower_case': False}) with Transformer model: RobertaModel
(1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
)Usage
Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
pip install -U sentence-transformersThen you can load this model and run inference.
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-raw_data_wseg-lr2e-05-1-epochs-bs-48")
# Run inference
sentences = [
'Mô_tả cách_thức hoạt_động của thực_phẩm khô trong một_vài câu .',
'Thực_phẩm khô là loại thực_phẩm đã được loại_bỏ phần_lớn độ_ẩm , giúp bảo_quản được lâu hơn mà không bị hư_hỏng . Chúng thường được chế_biến bằng cách sấy khô , đóng_hộp , đóng_gói chân_không hoặc đông_lạnh . Thực_phẩm khô có_thể bao_gồm các loại ngũ_cốc , đậu , hạt , trái_cây khô , rau củ sấy khô và các loại thực_phẩm chế_biến khác . Chúng thường được sử_dụng trong các bữa ăn nhẹ , nấu_ăn và làm bánh .',
'Dịch COVID - 19 đã có tác_động đáng_kể đến thị_trường nước xả vải toàn_cầu . Đầu năm 2020 , khi dịch COVID - 19 lần đầu_tiên lan rộng trên toàn thế_giới , nhu_cầu về nước xả vải giảm mạnh do nhiều người tiêu_dùng ở nhà nhiều hơn và giặt_giũ ít hơn . Điều này dẫn đến sự sụt_giảm doanh_số bán hàng của các công_ty sản_xuất nước xả vải . Khi dịch COVID - 19 tiếp_tục và tác_động_kinh_tế ngày_càng rõ_rệt , nhiều người tiêu_dùng phải thắt chặt chi_tiêu , dẫn đến nhu_cầu về nước xả vải cao_cấp giảm . Tuy_nhiên , nhu_cầu về nước xả vải giá rẻ lại tăng lên do nhiều người tiêu_dùng tìm cách tiết_kiệm tiền . Các công_ty sản_xuất nước xả vải đã phải điều_chỉnh chiến_lược kinh_doanh của mình để thích_ứng với tình_hình mới . Nhiều công_ty đã tăng_cường quảng_cáo và khuyến_mãi để thu_hút người tiêu_dùng . Một_số công_ty cũng đã phát_triển các sản_phẩm mới đáp_ứng nhu_cầu của người tiêu_dùng trong thời_kỳ đại_dịch . Tác_động_kinh_tế đầy_đủ của dịch COVID - 19 đối_với thị_trường nước xả vải toàn_cầu vẫn còn chờ xem , nhưng có khả_năng chúng_ta sẽ thấy sự phục_hồi khi thế_giới dần thoát khỏi đại_dịch .',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]<!--
Direct Usage (Transformers)
<details><summary>Click to see the direct usage in Transformers</summary>
</details> -->
<!--
Downstream Usage (Sentence Transformers)
You can finetune this model on your own dataset.
<details><summary>Click to expand</summary>
</details> -->
<!--
Out-of-Scope Use
List how the model may foreseeably be misused and address what users ought not to do with the model. -->
<!--
Bias, Risks and Limitations
What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->
<!--
Recommendations
What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->
Training Details
Training Dataset
vietnamese-ecommerce-alpaca
- Dataset: vietnamese-ecommerce-alpaca at 1f7a960
- Size: 69,292 training samples
- Columns: <code>anchor</code> and <code>positive</code>
- Approximate statistics based on the first 1000 samples: | | anchor | positive | |:--------|:-----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------| | type | string | string | | details | <ul><li>min: 8 tokens</li><li>mean: 22.68 tokens</li><li>max: 147 tokens</li></ul> | <ul><li>min: 18 tokens</li><li>mean: 144.01 tokens</li><li>max: 256 tokens</li></ul> |
- Samples: | anchor | positive | |:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------| | <code>Sửdụng cánhtay robot để nhặt một nồi điện cụthể và dichuyển nó đến một vịtrí cụthể . Nồi điện đó là nồi cơmđiện màu đỏ , vịtrí là tủ bếp gần đó .</code> | <code>Được thôi ! Đầutiên , cánhtay robot sẽ thuthập thôngtin về tọađộ của vịtrí hiệntại của nồi cơmđiện màu đỏ và tủ bếp gần đó . Khi thôngtin đã được nhập , cánhtay robot sẽ xoay về phía nồi cơmđiện , kéodài cánhtay để chạm đến nồi và đóng chốt xungquanh để giữ nó chắcchắn . Sau đó , cánhtay robot sẽ được kéolại trong khi vẫn giữ chắc nồi cơmđiện và cuốicùng xoay về phía tủ bếp gần đó . Cánhtay robot sẽ được hạ xuống để đặt nồi cơmđiện vào tủ bếp và chốt được thả ra để bỏ nồi cơmđiện đi . Sau đó , cánhtay robot sẽ thu lại vịtrí banđầu .</code> | | <code>Nói cho tôi biết tạisao nên sửdụng túi giặt .</code> | <code>Sửdụng túi giặt cóthể mang lại mộtsố lợiích , baogồm : <br> <br> - Bảovệ quầnáo : Túi giặt cóthể giúp bảovệ quầnáo khỏi bị hưhỏng trong quátrình giặt , đặcbiệt là đốivới quầnáo mỏngmanh hoặc dễ bị rách . <br> <br> - Giúp giặt sạch hơn : Túi giặt cóthể giúp quầnáo được giặt sạch hơn bằng cách tạo ra chuyểnđộng tốt hơn trong máygiặt và giúp chất tẩyrửa tiếpxúc với quầnáo tốt hơn . <br> <br> - Giảm xoắn rối : Túi giặt cóthể giúp giảm xoắn rối quầnáo trong quátrình giặt , giúp quầnáo dễ ủi hơn và trông đẹp hơn . <br> <br> - Tiếtkiệm thờigian : Túi giặt cóthể giúp tiếtkiệm thờigian bằng cách giảm thờigian ủi quầnáo và giúp quầnáo khô nhanh hơn . <br> <br> - Giảm tiếng ồn : Túi giặt cóthể giúp giảm tiếng ồn từ máygiặt , đặcbiệt là đốivới máygiặt cũ hoặc bị hỏng .</code> | | <code>Cách tốt nhất để tốiđa hoá kếtquả khi sửdụng váy chống nắng là gì ?</code> | <code>Để đạt được hiệuquả tốiđa khi sửdụng váy chống nắng , bạn cóthể thamkhảo những cách sau đây : <br> <br> * * * Chọn loại váy chống nắng phùhợp với nhucầu và sởthích của bạn : Hãy cânnhắc các yếutố như chấtliệu , kiểudáng , màusắc và các tínhnăng đặcbiệt khi lựachọn váy chống nắng . Đảmbảo rằng chiếc váy bạn chọn thoảimái khi mặc , phùhợp với vócdáng và phongcách của bạn . <br> <br> * * * Kiểmtra chấtlượng của váy chống nắng : * * Hãy kiểmtra chấtliệu vải , đường may và các chitiết khác của váy chống nắng để đảmbảo rằng sảnphẩm có chấtlượng tốt và bềnbỉ . <br> <br> Mặc váy chống nắng đúng cách : Mặc váy chống nắng đúng cách sẽ giúp bạn đạt được hiệu_quả chống nắng tối_ưu . Đảm_bảo rằng váy được mặc vừa_vặn , không quá chật hoặc quá rộng , và che_phủ toàn_bộ các vùng da cần bảo_vệ . <br> <br> Giặt và bảoquản váy chống nắng đúng cách : * * Giặt váy chống nắng theo hướngdẫn của nhà sảnxuất để đảmbảo rằng chấtliệu vải và các tínhnăng chống nắng của váy được du...</code> |
- Loss: <code>MultipleNegativesRankingLoss</code> with these parameters:
{
"scale": 20.0,
"similarity_fct": "cos_sim"
}Training Hyperparameters
Non-Default Hyperparameters
per_device_train_batch_size: 48learning_rate: 2e-05num_train_epochs: 1warmup_ratio: 0.1save_safetensors: Falsefp16: Truepush_to_hub: Truehub_model_id: iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-rawdatawseg-lr2e-05-1-epochs-bs-48batch_sampler: no_duplicates
All Hyperparameters
<details><summary>Click to expand</summary>
overwrite_output_dir: Falsedo_predict: Falseeval_strategy: noprediction_loss_only: Trueper_device_train_batch_size: 48per_device_eval_batch_size: 8per_gpu_train_batch_size: Noneper_gpu_eval_batch_size: Nonegradient_accumulation_steps: 1eval_accumulation_steps: Nonetorch_empty_cache_steps: Nonelearning_rate: 2e-05weight_decay: 0.0adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08max_grad_norm: 1.0num_train_epochs: 1max_steps: -1lr_scheduler_type: linearlr_scheduler_kwargs: {}warmup_ratio: 0.1warmup_steps: 0log_level: passivelog_level_replica: warninglog_on_each_node: Truelogging_nan_inf_filter: Truesave_safetensors: Falsesave_on_each_node: Falsesave_only_model: Falserestore_callback_states_from_checkpoint: Falseno_cuda: Falseuse_cpu: Falseuse_mps_device: Falseseed: 42data_seed: Nonejit_mode_eval: Falseuse_ipex: Falsebf16: Falsefp16: Truefp16_opt_level: O1half_precision_backend: autobf16_full_eval: Falsefp16_full_eval: Falsetf32: Nonelocal_rank: 0ddp_backend: Nonetpu_num_cores: Nonetpu_metrics_debug: Falsedebug: []dataloader_drop_last: Truedataloader_num_workers: 0dataloader_prefetch_factor: Nonepast_index: -1disable_tqdm: Falseremove_unused_columns: Truelabel_names: Noneload_best_model_at_end: Falseignore_data_skip: Falsefsdp: []fsdp_min_num_params: 0fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}fsdp_transformer_layer_cls_to_wrap: Noneaccelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}deepspeed: Nonelabel_smoothing_factor: 0.0optim: adamw_torchoptim_args: Noneadafactor: Falsegroup_by_length: Falselength_column_name: lengthddp_find_unused_parameters: Noneddp_bucket_cap_mb: Noneddp_broadcast_buffers: Falsedataloader_pin_memory: Truedataloader_persistent_workers: Falseskip_memory_metrics: Trueuse_legacy_prediction_loop: Falsepush_to_hub: Trueresume_from_checkpoint: Nonehub_model_id: iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-rawdatawseg-lr2e-05-1-epochs-bs-48hub_strategy: every_savehub_private_repo: Nonehub_always_push: Falsegradient_checkpointing: Falsegradient_checkpointing_kwargs: Noneinclude_inputs_for_metrics: Falseinclude_for_metrics: []eval_do_concat_batches: Truefp16_backend: autopush_to_hub_model_id: Nonepush_to_hub_organization: Nonemp_parameters:auto_find_batch_size: Falsefull_determinism: Falsetorchdynamo: Noneray_scope: lastddp_timeout: 1800torch_compile: Falsetorch_compile_backend: Nonetorch_compile_mode: Nonedispatch_batches: Nonesplit_batches: Noneinclude_tokens_per_second: Falseinclude_num_input_tokens_seen: Falseneftune_noise_alpha: Noneoptim_target_modules: Nonebatch_eval_metrics: Falseeval_on_start: Falseuse_liger_kernel: Falseeval_use_gather_object: Falseaverage_tokens_across_devices: Falseprompts: Nonebatch_sampler: no_duplicatesmulti_dataset_batch_sampler: proportional
</details>
Training Logs
Framework Versions
- Python: 3.10.12
- Sentence Transformers: 3.3.1
- Transformers: 4.47.0
- PyTorch: 2.5.1+cu121
- Accelerate: 1.2.1
- Datasets: 3.3.1
- Tokenizers: 0.21.0
Citation
BibTeX
Sentence Transformers
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}MultipleNegativesRankingLoss
@misc{henderson2017efficient,
title={Efficient Natural Language Response Suggestion for Smart Reply},
author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
year={2017},
eprint={1705.00652},
archivePrefix={arXiv},
primaryClass={cs.CL}
}<!--
Glossary
Clearly define terms in order to be accessible across audiences. -->
<!--
Model Card Authors
Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->
<!--
Model Card Contact
Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->
