CoolFace
Modelpublic

iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-raw_data_wseg-lr2e-05-1-epochs-bs-48

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes89downloads
Model Card

SentenceTransformer based on vinai/phobert-base-v2

This is a sentence-transformers model finetuned from vinai/phobert-base-v2 on the vietnamese-ecommerce-alpaca dataset. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.

Model Details

Model Description

  • —Model Type: Sentence Transformer
  • —Base model: vinai/phobert-base-v2 <!-- at revision e2375d266bdf39c6e8e9a87af16a5da3190b0cc8 -->
  • —Maximum Sequence Length: 256 tokens
  • —Output Dimensionality: 768 dimensions
  • —Similarity Function: Cosine Similarity
  • —Training Dataset:
  • —vietnamese-ecommerce-alpaca <!-- - Language: Unknown --> <!-- - License: Unknown -->

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'max_seq_length': 256, 'do_lower_case': False}) with Transformer model: RobertaModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

bash
pip install -U sentence-transformers

Then you can load this model and run inference.

python
from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-raw_data_wseg-lr2e-05-1-epochs-bs-48")
# Run inference
sentences = [
    'Mô_tả cách_thức hoạt_động của thực_phẩm khô trong một_vài câu .',
    'Thực_phẩm khô là loại thực_phẩm đã được loại_bỏ phần_lớn độ_ẩm , giúp bảo_quản được lâu hơn mà không bị hư_hỏng . Chúng thường được chế_biến bằng cách sấy khô , đóng_hộp , đóng_gói chân_không hoặc đông_lạnh . Thực_phẩm khô có_thể bao_gồm các loại ngũ_cốc , đậu , hạt , trái_cây khô , rau củ sấy khô và các loại thực_phẩm chế_biến khác . Chúng thường được sử_dụng trong các bữa ăn nhẹ , nấu_ăn và làm bánh .',
    'Dịch COVID - 19 đã có tác_động đáng_kể đến thị_trường nước xả vải toàn_cầu . Đầu năm 2020 , khi dịch COVID - 19 lần đầu_tiên lan rộng trên toàn thế_giới , nhu_cầu về nước xả vải giảm mạnh do nhiều người tiêu_dùng ở nhà nhiều hơn và giặt_giũ ít hơn . Điều này dẫn đến sự sụt_giảm doanh_số bán hàng của các công_ty sản_xuất nước xả vải . Khi dịch COVID - 19 tiếp_tục và tác_động_kinh_tế ngày_càng rõ_rệt , nhiều người tiêu_dùng phải thắt chặt chi_tiêu , dẫn đến nhu_cầu về nước xả vải cao_cấp giảm . Tuy_nhiên , nhu_cầu về nước xả vải giá rẻ lại tăng lên do nhiều người tiêu_dùng tìm cách tiết_kiệm tiền . Các công_ty sản_xuất nước xả vải đã phải điều_chỉnh chiến_lược kinh_doanh của mình để thích_ứng với tình_hình mới . Nhiều công_ty đã tăng_cường quảng_cáo và khuyến_mãi để thu_hút người tiêu_dùng . Một_số công_ty cũng đã phát_triển các sản_phẩm mới đáp_ứng nhu_cầu của người tiêu_dùng trong thời_kỳ đại_dịch . Tác_động_kinh_tế đầy_đủ của dịch COVID - 19 đối_với thị_trường nước xả vải toàn_cầu vẫn còn chờ xem , nhưng có khả_năng chúng_ta sẽ thấy sự phục_hồi khi thế_giới dần thoát khỏi đại_dịch .',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]

<!--

Direct Usage (Transformers)

<details><summary>Click to see the direct usage in Transformers</summary>

</details> -->

<!--

Downstream Usage (Sentence Transformers)

You can finetune this model on your own dataset.

<details><summary>Click to expand</summary>

</details> -->

<!--

Out-of-Scope Use

List how the model may foreseeably be misused and address what users ought not to do with the model. -->

<!--

Bias, Risks and Limitations

What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->

<!--

Recommendations

What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->

Training Details

Training Dataset

vietnamese-ecommerce-alpaca
  • —Dataset: vietnamese-ecommerce-alpaca at 1f7a960
  • —Size: 69,292 training samples
  • —Columns: <code>anchor</code> and <code>positive</code>
  • —Approximate statistics based on the first 1000 samples: | | anchor | positive | |:--------|:-----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------| | type | string | string | | details | <ul><li>min: 8 tokens</li><li>mean: 22.68 tokens</li><li>max: 147 tokens</li></ul> | <ul><li>min: 18 tokens</li><li>mean: 144.01 tokens</li><li>max: 256 tokens</li></ul> |
  • —Samples: | anchor | positive | |:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------| | <code>Sửdụng cánhtay robot để nhặt một nồi điện cụthể và dichuyển nó đến một vịtrí cụthể . Nồi điện đó là nồi cơmđiện màu đỏ , vịtrí là tủ bếp gần đó .</code> | <code>Được thôi ! Đầutiên , cánhtay robot sẽ thuthập thôngtin về tọađộ của vịtrí hiệntại của nồi cơmđiện màu đỏ và tủ bếp gần đó . Khi thôngtin đã được nhập , cánhtay robot sẽ xoay về phía nồi cơmđiện , kéodài cánhtay để chạm đến nồi và đóng chốt xungquanh để giữ nó chắcchắn . Sau đó , cánhtay robot sẽ được kéolại trong khi vẫn giữ chắc nồi cơmđiện và cuốicùng xoay về phía tủ bếp gần đó . Cánhtay robot sẽ được hạ xuống để đặt nồi cơmđiện vào tủ bếp và chốt được thả ra để bỏ nồi cơmđiện đi . Sau đó , cánhtay robot sẽ thu lại vịtrí banđầu .</code> | | <code>Nói cho tôi biết tạisao nên sửdụng túi giặt .</code> | <code>Sửdụng túi giặt cóthể mang lại mộtsố lợiích , baogồm : <br> <br> - Bảovệ quầnáo : Túi giặt cóthể giúp bảovệ quầnáo khỏi bị hưhỏng trong quátrình giặt , đặcbiệt là đốivới quầnáo mỏngmanh hoặc dễ bị rách . <br> <br> - Giúp giặt sạch hơn : Túi giặt cóthể giúp quầnáo được giặt sạch hơn bằng cách tạo ra chuyểnđộng tốt hơn trong máygiặt và giúp chất tẩyrửa tiếpxúc với quầnáo tốt hơn . <br> <br> - Giảm xoắn rối : Túi giặt cóthể giúp giảm xoắn rối quầnáo trong quátrình giặt , giúp quầnáo dễ ủi hơn và trông đẹp hơn . <br> <br> - Tiếtkiệm thờigian : Túi giặt cóthể giúp tiếtkiệm thờigian bằng cách giảm thờigian ủi quầnáo và giúp quầnáo khô nhanh hơn . <br> <br> - Giảm tiếng ồn : Túi giặt cóthể giúp giảm tiếng ồn từ máygiặt , đặcbiệt là đốivới máygiặt cũ hoặc bị hỏng .</code> | | <code>Cách tốt nhất để tốiđa hoá kếtquả khi sửdụng váy chống nắng là gì ?</code> | <code>Để đạt được hiệuquả tốiđa khi sửdụng váy chống nắng , bạn cóthể thamkhảo những cách sau đây : <br> <br> * * * Chọn loại váy chống nắng phùhợp với nhucầu và sởthích của bạn : Hãy cânnhắc các yếutố như chấtliệu , kiểudáng , màusắc và các tínhnăng đặcbiệt khi lựachọn váy chống nắng . Đảmbảo rằng chiếc váy bạn chọn thoảimái khi mặc , phùhợp với vócdáng và phongcách của bạn . <br> <br> * * * Kiểmtra chấtlượng của váy chống nắng : * * Hãy kiểmtra chấtliệu vải , đường may và các chitiết khác của váy chống nắng để đảmbảo rằng sảnphẩm có chấtlượng tốt và bềnbỉ . <br> <br> Mặc váy chống nắng đúng cách : Mặc váy chống nắng đúng cách sẽ giúp bạn đạt được hiệu_quả chống nắng tối_ưu . Đảm_bảo rằng váy được mặc vừa_vặn , không quá chật hoặc quá rộng , và che_phủ toàn_bộ các vùng da cần bảo_vệ . <br> <br> Giặt và bảoquản váy chống nắng đúng cách : * * Giặt váy chống nắng theo hướngdẫn của nhà sảnxuất để đảmbảo rằng chấtliệu vải và các tínhnăng chống nắng của váy được du...</code> |
  • —Loss: <code>MultipleNegativesRankingLoss</code> with these parameters:
json
  {
      "scale": 20.0,
      "similarity_fct": "cos_sim"
  }

Training Hyperparameters

Non-Default Hyperparameters
  • —per_device_train_batch_size: 48
  • —learning_rate: 2e-05
  • —num_train_epochs: 1
  • —warmup_ratio: 0.1
  • —save_safetensors: False
  • —fp16: True
  • —push_to_hub: True
  • —hub_model_id: iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-rawdatawseg-lr2e-05-1-epochs-bs-48
  • —batch_sampler: no_duplicates
All Hyperparameters

<details><summary>Click to expand</summary>

  • —overwrite_output_dir: False
  • —do_predict: False
  • —eval_strategy: no
  • —prediction_loss_only: True
  • —per_device_train_batch_size: 48
  • —per_device_eval_batch_size: 8
  • —per_gpu_train_batch_size: None
  • —per_gpu_eval_batch_size: None
  • —gradient_accumulation_steps: 1
  • —eval_accumulation_steps: None
  • —torch_empty_cache_steps: None
  • —learning_rate: 2e-05
  • —weight_decay: 0.0
  • —adam_beta1: 0.9
  • —adam_beta2: 0.999
  • —adam_epsilon: 1e-08
  • —max_grad_norm: 1.0
  • —num_train_epochs: 1
  • —max_steps: -1
  • —lr_scheduler_type: linear
  • —lr_scheduler_kwargs: {}
  • —warmup_ratio: 0.1
  • —warmup_steps: 0
  • —log_level: passive
  • —log_level_replica: warning
  • —log_on_each_node: True
  • —logging_nan_inf_filter: True
  • —save_safetensors: False
  • —save_on_each_node: False
  • —save_only_model: False
  • —restore_callback_states_from_checkpoint: False
  • —no_cuda: False
  • —use_cpu: False
  • —use_mps_device: False
  • —seed: 42
  • —data_seed: None
  • —jit_mode_eval: False
  • —use_ipex: False
  • —bf16: False
  • —fp16: True
  • —fp16_opt_level: O1
  • —half_precision_backend: auto
  • —bf16_full_eval: False
  • —fp16_full_eval: False
  • —tf32: None
  • —local_rank: 0
  • —ddp_backend: None
  • —tpu_num_cores: None
  • —tpu_metrics_debug: False
  • —debug: []
  • —dataloader_drop_last: True
  • —dataloader_num_workers: 0
  • —dataloader_prefetch_factor: None
  • —past_index: -1
  • —disable_tqdm: False
  • —remove_unused_columns: True
  • —label_names: None
  • —load_best_model_at_end: False
  • —ignore_data_skip: False
  • —fsdp: []
  • —fsdp_min_num_params: 0
  • —fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}
  • —fsdp_transformer_layer_cls_to_wrap: None
  • —accelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}
  • —deepspeed: None
  • —label_smoothing_factor: 0.0
  • —optim: adamw_torch
  • —optim_args: None
  • —adafactor: False
  • —group_by_length: False
  • —length_column_name: length
  • —ddp_find_unused_parameters: None
  • —ddp_bucket_cap_mb: None
  • —ddp_broadcast_buffers: False
  • —dataloader_pin_memory: True
  • —dataloader_persistent_workers: False
  • —skip_memory_metrics: True
  • —use_legacy_prediction_loop: False
  • —push_to_hub: True
  • —resume_from_checkpoint: None
  • —hub_model_id: iambestfeed/phobert-base-v2-Vietnamese-Ecommerce-Alpaca-rawdatawseg-lr2e-05-1-epochs-bs-48
  • —hub_strategy: every_save
  • —hub_private_repo: None
  • —hub_always_push: False
  • —gradient_checkpointing: False
  • —gradient_checkpointing_kwargs: None
  • —include_inputs_for_metrics: False
  • —include_for_metrics: []
  • —eval_do_concat_batches: True
  • —fp16_backend: auto
  • —push_to_hub_model_id: None
  • —push_to_hub_organization: None
  • —mp_parameters:
  • —auto_find_batch_size: False
  • —full_determinism: False
  • —torchdynamo: None
  • —ray_scope: last
  • —ddp_timeout: 1800
  • —torch_compile: False
  • —torch_compile_backend: None
  • —torch_compile_mode: None
  • —dispatch_batches: None
  • —split_batches: None
  • —include_tokens_per_second: False
  • —include_num_input_tokens_seen: False
  • —neftune_noise_alpha: None
  • —optim_target_modules: None
  • —batch_eval_metrics: False
  • —eval_on_start: False
  • —use_liger_kernel: False
  • —eval_use_gather_object: False
  • —average_tokens_across_devices: False
  • —prompts: None
  • —batch_sampler: no_duplicates
  • —multi_dataset_batch_sampler: proportional

</details>

Training Logs

EpochStepTraining Loss
0.0139102.1773
0.0277201.7934
0.0416300.9058
0.0555400.3905
0.0693500.1947
0.0832600.1825
0.0971700.1067
0.1110800.1102
0.1248900.0861
0.13871000.0898
0.15261100.0768
0.16641200.0581
0.18031300.0445
0.19421400.0568
0.20801500.0768
0.22191600.054
0.23581700.0451
0.24971800.0585
0.26351900.0316
0.27742000.0421
0.29132100.0416
0.30512200.0416
0.31902300.0412
0.33292400.0521
0.34672500.0738
0.36062600.0247
0.37452700.0353
0.38832800.0469
0.40222900.0449
0.41613000.0301
0.43003100.0425
0.44383200.023
0.45773300.0544
0.47163400.0443
0.48543500.028
0.49933600.0409
0.51323700.0456
0.52703800.039
0.54093900.0451
0.55484000.0482
0.56874100.0213
0.58254200.0242
0.59644300.0248
0.61034400.0298
0.62414500.0179
0.63804600.0459
0.65194700.0294
0.66574800.0377
0.67964900.0292
0.69355000.0181
0.70745100.0436
0.72125200.0265
0.73515300.0324
0.74905400.0286
0.76285500.0279
0.77675600.0219
0.79065700.0365
0.80445800.0257
0.81835900.0206
0.83226000.025
0.84606100.0404
0.85996200.0405
0.87386300.0281
0.88776400.0236
0.90156500.0278
0.91546600.0242
0.92936700.0296
0.94316800.0249
0.95706900.0322
0.97097000.0206
0.98477100.0212
0.99867200.0204

Framework Versions

  • —Python: 3.10.12
  • —Sentence Transformers: 3.3.1
  • —Transformers: 4.47.0
  • —PyTorch: 2.5.1+cu121
  • —Accelerate: 1.2.1
  • —Datasets: 3.3.1
  • —Tokenizers: 0.21.0

Citation

BibTeX

Sentence Transformers
bibtex
@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}
MultipleNegativesRankingLoss
bibtex
@misc{henderson2017efficient,
    title={Efficient Natural Language Response Suggestion for Smart Reply},
    author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
    year={2017},
    eprint={1705.00652},
    archivePrefix={arXiv},
    primaryClass={cs.CL}
}

<!--

Glossary

Clearly define terms in order to be accessible across audiences. -->

<!--

Model Card Authors

Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->

<!--

Model Card Contact

Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->