CoolFace
Modelpublic

ThanhLe0125/e5-math-ebd

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes92downloads
Model Card

SentenceTransformer based on intfloat/multilingual-e5-base

This is a sentence-transformers model finetuned from intfloat/multilingual-e5-base. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.

Model Details

Model Description

  • Model Type: Sentence Transformer
  • Base model: intfloat/multilingual-e5-base <!-- at revision 835193815a3936a24a0ee7dc9e3d48c1fbb19c55 -->
  • Maximum Sequence Length: 256 tokens
  • Output Dimensionality: 768 dimensions
  • Similarity Function: Cosine Similarity <!-- - Training Dataset: Unknown --> <!-- - Language: Unknown --> <!-- - License: Unknown -->

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'max_seq_length': 256, 'do_lower_case': False}) with Transformer model: XLMRobertaModel 
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
  (2): Normalize()
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

bash
pip install -U sentence-transformers

Then you can load this model and run inference.

python
from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("ThanhLe0125/e5-math-ebd")
# Run inference
sentences = [
    'query: Trong định nghĩa điểm cực đại, khoảng (a; b) có vai trò gì?',
    "passage: # Cực trị của hàm số\n\n## Định nghĩa\nCho hàm số $y = f(x)$ xác định trên tập $D$ và $x_0 \\in D$.\n\n**Cực đại:** $x_0$ được gọi là điểm cực đại nếu tồn tại khoảng $(a; b)$ chứa $x_0$ sao cho $f(x) \\leq f(x_0)$ với mọi $x \\in (a; b) \\cap D$.\n\n**Cực tiểu:** $x_0$ được gọi là điểm cực tiểu nếu tồn tại khoảng $(a; b)$ chứa $x_0$ sao cho $f(x) \\geq f(x_0)$ với mọi $x \\in (a; b) \\cap D$.\n\n## Điều kiện cần (Định lý Fermat)\nNếu hàm số $f(x)$ có đạo hàm tại $x_0$ và $x_0$ là điểm cực trị thì $f'(x_0) = 0$.\n\n## Điều kiện đủ\n**Dấu của đạo hàm bậc nhất:**\n- Nếu $f'(x) > 0$ trên $(x_0 - h; x_0)$ và $f'(x) < 0$ trên $(x_0; x_0 + h)$ thì $x_0$ là điểm cực đại.\n- Nếu $f'(x) < 0$ trên $(x_0 - h; x_0)$ và $f'(x) > 0$ trên $(x_0; x_0 + h)$ thì $x_0$ là điểm cực tiểu.\n\n**Đạo hàm bậc hai:**\n- Nếu $f'(x_0) = 0$ và $f''(x_0) > 0$ thì $x_0$ là điểm cực tiểu.\n- Nếu $f'(x_0) = 0$ và $f''(x_0) < 0$ thì $x_0$ là điểm cực đại.",
    'passage: # Các phép toán vectơ trong không gian\n\n## Phép cộng vectơ\n**Quy tắc hình bình hành:** Đặt hai vectơ chung gốc, vectơ tổng là đường chéo hình bình hành.\n\n**Quy tắc tam giác:** $\\overrightarrow{AB} + \\overrightarrow{BC} = \\overrightarrow{AC}$\n\n**Tính chất:**\n- Giao hoán: $\\vec{a} + \\vec{b} = \\vec{b} + \\vec{a}$\n- Kết hợp: $(\\vec{a} + \\vec{b}) + \\vec{c} = \\vec{a} + (\\vec{b} + \\vec{c})$\n- Phần tử trung hòa: $\\vec{a} + \\vec{0} = \\vec{a}$\n\n## Phép trừ vectơ\n$\\vec{a} - \\vec{b} = \\vec{a} + (-\\vec{b})$\n\n**Ý nghĩa:** $\\overrightarrow{AB} - \\overrightarrow{AC} = \\overrightarrow{CB}$\n\n## Phép nhân vectơ với số thực\nCho vectơ $\\vec{a}$ và số thực $k$:\n- Nếu $k > 0$: $k\\vec{a}$ cùng hướng với $\\vec{a}$, độ lớn $|k\\vec{a}| = k|\\vec{a}|$\n- Nếu $k < 0$: $k\\vec{a}$ ngược hướng với $\\vec{a}$, độ lớn $|k\\vec{a}| = |k||\\vec{a}|$  \n- Nếu $k = 0$: $k\\vec{a} = \\vec{0}$\n\n**Tính chất:**\n- $k(\\vec{a} + \\vec{b}) = k\\vec{a} + k\\vec{b}$\n- $(k + h)\\vec{a} = k\\vec{a} + h\\vec{a}$\n- $(kh)\\vec{a} = k(h\\vec{a})$\n\n## Ví dụ ứng dụng\nCho hình hộp $ABCD.EFGH$. Chứng minh: $\\overrightarrow{AG} = \\overrightarrow{AB} + \\overrightarrow{AD} + \\overrightarrow{AE}$\n\n**Lời giải:**\n$\\overrightarrow{AG} = \\overrightarrow{AB} + \\overrightarrow{BG}$\n$= \\overrightarrow{AB} + \\overrightarrow{BC} + \\overrightarrow{CG}$  \n$= \\overrightarrow{AB} + \\overrightarrow{AD} + \\overrightarrow{AE}$',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]

<!--

Direct Usage (Transformers)

<details><summary>Click to see the direct usage in Transformers</summary>

</details> -->

<!--

Downstream Usage (Sentence Transformers)

You can finetune this model on your own dataset.

<details><summary>Click to expand</summary>

</details> -->

<!--

Out-of-Scope Use

List how the model may foreseeably be misused and address what users ought not to do with the model. -->

Evaluation

Metrics

Binary Classification
MetricValue
cosine_accuracy0.955
cosineaccuracythreshold0.3222
cosine_f10.9333
cosinef1threshold0.2707
cosine_precision0.9265
cosine_recall0.9403
cosine_ap0.9869
cosine_mcc0.8994

<!--

Bias, Risks and Limitations

What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->

<!--

Recommendations

What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->

Training Details

Training Dataset

Unnamed Dataset
  • Size: 1,924 training samples
  • Columns: <code>sentence0</code>, <code>sentence1</code>, and <code>sentence_2</code>
  • Approximate statistics based on the first 1000 samples: | | sentence0 | sentence1 | sentence_2 | |:--------|:-----------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------| | type | string | string | string | | details | <ul><li>min: 10 tokens</li><li>mean: 24.67 tokens</li><li>max: 56 tokens</li></ul> | <ul><li>min: 228 tokens</li><li>mean: 254.49 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>min: 228 tokens</li><li>mean: 254.24 tokens</li><li>max: 256 tokens</li></ul> |
  • Samples: | sentence0 | sentence1 | sentence2 | |:-----------------------------------------------------------------------------------------------|:------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------| | <code>query: Cách tính phương sai khi có các giá trị ngoại lệ trong tập dữ liệu?</code> | <code>passage: # Phương sai và độ lệch chuẩn<br><br>## Phương sai (Variance)<br>**Định nghĩa:** Phương sai là trung bình cộng của bình phương các độ lệch so với số trung bình.<br><br>**Dữ liệu rời rạc:** $s^2 = \frac{1}{n}\sum{i=1}^{n}(xi - \bar{x})^2$<br><br>**Dữ liệu ghép nhóm:** $s^2 = \frac{1}{n}\sum{i=1}^{k}ni(xi - \bar{x})^2$<br><br>Công thức tính nhanh: $s^2 = \frac{1}{n}\sum{i=1}^{k}ni xi^2 - \bar{x}^2$<br><br>## Độ lệch chuẩn (Standard Deviation)<br>$$s = \sqrt{s^2}$$<br><br>**Ưu điểm:** <br>- Cùng đơn vị với dữ liệu gốc<br>- Dễ hiểu và giải thích<br>- Sử dụng tất cả quan sát<br><br>## Ý nghĩa thực tế<br>- **Phương sai lớn:** Dữ liệu phân tán, không đồng đều<br>- **Phương sai nhỏ:** Dữ liệu tập trung, đồng đều<br>- **Độ lệch chuẩn:** "Khoảng cách trung bình" từ các quan sát đến trung bình<br><br>## Quy tắc 68-95-99.7<br>Với dữ liệu phân phối gần chuẩn:<br>- 68% dữ liệu nằm trong $[\bar{x} - s; \bar{x} + s]$<br>- 95% dữ liệu nằm trong $[\bar{x} - 2s; \bar{x} + 2s]$<br>- 99.7% dữ liệu nằm trong $[\bar{x} - 3s; \bar{x} + 3s]$</code> | <code>passage: # Cấp số nhân<br><br>## Định nghĩa<br>**Cấp số nhân** là dãy số $(un)$ mà kể từ số hạng thứ hai, mỗi số hạng đều bằng số hạng đứng trước nó nhân với một số không đổi $q \neq 0$.<br><br>$$u{n+1} = un \times q \quad (\forall n \geq 1)$$<br><br>Số $q$ được gọi là công bội của cấp số nhân.<br><br>## Số hạng tổng quát<br>$$un = u1 \times q^{n-1}$$<br><br>Hoặc với số hạng bất kỳ: $un = uk \times q^{n-k}$<br><br>## Tính chất cơ bản<br>1. Tính chất đặc trưng: $\frac{u{n+1}}{un} = q$ (hằng số, $un \neq 0$)<br><br>2. **Số hạng ở giữa:** $uk^2 = u{k-p} \times u{k+p}$ với $p > 0$<br><br>3. Ba số hạng liên tiếp: $a, b, c$ tạo thành CSN ⇔ $b^2 = ac$ (với $a, c$ cùng dấu)<br><br>## Ví dụ<br>Ví dụ 1: Dãy số $3, 6, 12, 24, 48, ...$<br>- Số hạng đầu: $u1 = 3$<br>- Công bội: $q = \frac{6}{3} = 2$<br>- Số hạng tổng quát: $un = 3 \times 2^{n-1}$<br><br>Ví dụ 2: Cho CSN có $u2 = 6$ và $u5 = 162$. Tìm $u1$ và $q$.<br><br>**Lời giải:**<br>$u5 = u2 \times q^3 \Rightarrow 162 = 6 \times q^3 \Rightarrow q^3 = 27 \Rightarrow q = 3$<br><br>$u1 = \frac{u2}{q}...</code> | | <code>query: Cách tính đạo hàm của một hàm số đa thức như f(x) = x^3 - 3x^2 + 2?</code> | <code>passage: # Tính đơn điệu của hàm số<br><br>## Định nghĩa<br>Cho hàm số $y = f(x)$ xác định trên khoảng $(a; b)$.<br><br>**Hàm số đồng biến (tăng) trên $(a; b)$:** Nếu với mọi $x1, x2 \in (a; b)$ mà $x1 < x2$ thì $f(x1) < f(x2)$.<br><br>**Hàm số nghịch biến (giảm) trên $(a; b)$:** Nếu với mọi $x1, x2 \in (a; b)$ mà $x1 < x2$ thì $f(x1) > f(x2)$.<br><br>## Điều kiện cần và đủ<br>**Định lý:** Cho hàm số $y = f(x)$ có đạo hàm trên khoảng $(a; b)$.<br>- Nếu $f'(x) > 0$ với mọi $x \in (a; b)$ thì $f(x)$ đồng biến trên $(a; b)$.<br>- Nếu $f'(x) < 0$ với mọi $x \in (a; b)$ thì $f(x)$ nghịch biến trên $(a; b)$.<br><br>## Ví dụ<br>Xét tính đơn điệu của hàm số $f(x) = x^3 - 3x^2 + 2$.<br><br>**Lời giải:**<br>$f'(x) = 3x^2 - 6x = 3x(x - 2)$<br>$f'(x) = 0 \Leftrightarrow x = 0$ hoặc $x = 2$.<br><br>Bảng xét dấu:<br>- $x \in (-\infty; 0)$: $f'(x) > 0$ (hàm đồng biến)<br>- $x \in (0; 2)$: $f'(x) < 0$ (hàm nghịch biến) <br>- $x \in (2; +\infty)$: $f'(x) > 0$ (hàm đồng biến)</code> | <code>passage: # Hệ trục tọa độ Oxyz trong không gian<br><br>## Thiết lập hệ trục<br>Hệ trục tọa độ $Oxyz$ gồm:<br>- **Gốc tọa độ:** $O$<br>- **Trục $Ox$ (hoành):** vectơ đơn vị $\vec{i}$<br>- **Trục $Oy$ (tung):** vectơ đơn vị $\vec{j}$ <br>- **Trục $Oz$ (cao):** vectơ đơn vị $\vec{k}$<br><br>**Điều kiện:** Ba trục vuông góc từng đôi một, $|\vec{i}| = |\vec{j}| = |\vec{k}| = 1$<br><br>**Quy tắc bàn tay phải:** Khi co bốn ngón từ $\vec{i}$ về $\vec{j}$, ngón cái chỉ theo $\vec{k}$.<br><br>## Tọa độ của điểm<br>Mỗi điểm $M$ trong không gian có tọa độ duy nhất $(x; y; z)$ với:<br>- $x$: khoảng cách có dấu đến mặt phẳng $Oyz$<br>- $y$: khoảng cách có dấu đến mặt phẳng $Oxz$<br>- $z$: khoảng cách có dấu đến mặt phẳng $Oxy$<br><br>## Các điểm đặc biệt<br>- Gốc tọa độ: $O(0; 0; 0)$<br>- Trên trục $Ox$: $(a; 0; 0)$<br>- Trên trục $Oy$: $(0; b; 0)$<br>- Trên trục $Oz$: $(0; 0; c)$<br>- Trên mặt phẳng $Oxy$: $(x; y; 0)$<br>- Trên mặt phẳng $Oxz$: $(x; 0; z)$<br>- Trên mặt phẳng $Oyz$: $(0; y; z)$<br><br>## Tọa độ của vectơ<br>Vectơ $\vec{a}$ có tọa độ $(ax; ay; az)$ nếu:<br>$$\vec{a} ...</code> | | <code>query: Trong bài toán thực tế về tăng lương, yếu tố nào đóng vai trò là công sai?</code> | <code>passage: # Tổng n số hạng đầu của cấp số cộng<br><br>## Công thức tổng<br>Cho cấp số cộng $(un)$ với số hạng đầu $u1$ và công sai $d$.<br><br>Công thức 1: $Sn = \frac{n}{2}[2u1 + (n-1)d]$<br><br>Công thức 2: $Sn = \frac{n(u1 + un)}{2}$<br><br>**Công thức 3:** $Sn = nu1 + \frac{n(n-1)}{2}d$<br><br>## Tính chất của tổng<br>1. $Sn - S{n-1} = un$ (với $n \geq 2$)<br><br>2. Nếu $Sn = an^2 + bn$ thì dãy là CSC với:<br> - $u1 = a + b$<br> - $d = 2a$<br><br>## Ví dụ tính toán<br>Ví dụ 1: Tính tổng 15 số hạng đầu của CSC: $3, 7, 11, 15, ...$<br><br>Lời giải:<br>- $u1 = 3$, $d = 4$<br>- $S{15} = \frac{15}{2}[2 \times 3 + (15-1) \times 4] = \frac{15}{2}[6 + 56] = 465$<br><br>Ví dụ 2: Tìm $n$ biết tổng $n$ số hạng đầu của CSC có $u1 = 2$, $d = 3$ là $Sn = 77$.<br><br>Lời giải:<br>$77 = \frac{n}{2}[2 \times 2 + (n-1) \times 3] = \frac{n(4 + 3n - 3)}{2} = \frac{n(3n + 1)}{2}$<br><br>$154 = n(3n + 1) = 3n^2 + n$<br><br>$3n^2 + n - 154 = 0$<br><br>Giải được $n = 7$ (loại nghiệm âm)<br><br>## Bài toán thực tế<br>Một công ty kế hoạch tăng lương cho nhân viên theo CSC...</code> | <code>passage: # Công thức tọa độ cơ bản trong không gian<br><br>## Độ dài vectơ và khoảng cách<br>Độ dài vectơ: $|\vec{a}| = \sqrt{ax^2 + ay^2 + az^2}$ với $\vec{a} = (ax; ay; az)$<br><br>Khoảng cách hai điểm:<br>$$d(A,B) = |\overrightarrow{AB}| = \sqrt{(xB-xA)^2 + (yB-yA)^2 + (zB-zA)^2}$$<br><br>## Tọa độ trung điểm và trọng tâm<br>Trung điểm: $M$ là trung điểm $AB$ có tọa độ:<br>$$M\left(\frac{xA + xB}{2}; \frac{yA + yB}{2}; \frac{zA + zB}{2}\right)$$<br><br>Trọng tâm tam giác: $G$ của tam giác $ABC$:<br>$$G\left(\frac{xA + xB + xC}{3}; \frac{yA + yB + yC}{3}; \frac{zA + zB + zC}{3}\right)$$<br><br>**Trọng tâm tứ diện:** $G$ của tứ diện $ABCD$:<br>$$G\left(\frac{xA + xB + xC + xD}{4}; \frac{yA + yB + yC + yD}{4}; \frac{zA + zB + zC + z_D}{4}\right)$$<br><br>## Ví dụ<br>Cho $A(1; 2; 3)$, $B(4; -1; 2)$. Tính $|\overrightarrow{AB}|$ và tọa độ trung điểm.<br><br>Lời giải:<br>$\overrightarrow{AB} = (4-1; -1-2; 2-3) = (3; -3; -1)$<br><br>$|\overrightarrow{AB}| = \sqrt{3^2 + (-3)^2 + (-1)^2} = \sqrt{19}$<br><br>Tru...</code> |
  • Loss: <code>MultipleNegativesRankingLoss</code> with these parameters:
json
  {
      "scale": 20.0,
      "similarity_fct": "cos_sim"
  }

Training Hyperparameters

Non-Default Hyperparameters
  • eval_strategy: steps
  • per_device_train_batch_size: 4
  • per_device_eval_batch_size: 4
  • num_train_epochs: 20
  • multi_dataset_batch_sampler: round_robin
All Hyperparameters

<details><summary>Click to expand</summary>

  • overwrite_output_dir: False
  • do_predict: False
  • eval_strategy: steps
  • prediction_loss_only: True
  • per_device_train_batch_size: 4
  • per_device_eval_batch_size: 4
  • per_gpu_train_batch_size: None
  • per_gpu_eval_batch_size: None
  • gradient_accumulation_steps: 1
  • eval_accumulation_steps: None
  • torch_empty_cache_steps: None
  • learning_rate: 5e-05
  • weight_decay: 0.0
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • max_grad_norm: 1
  • num_train_epochs: 20
  • max_steps: -1
  • lr_scheduler_type: linear
  • lr_scheduler_kwargs: {}
  • warmup_ratio: 0.0
  • warmup_steps: 0
  • log_level: passive
  • log_level_replica: warning
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • save_safetensors: True
  • save_on_each_node: False
  • save_only_model: False
  • restore_callback_states_from_checkpoint: False
  • no_cuda: False
  • use_cpu: False
  • use_mps_device: False
  • seed: 42
  • data_seed: None
  • jit_mode_eval: False
  • use_ipex: False
  • bf16: False
  • fp16: False
  • fp16_opt_level: O1
  • half_precision_backend: auto
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • local_rank: 0
  • ddp_backend: None
  • tpu_num_cores: None
  • tpu_metrics_debug: False
  • debug: []
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_prefetch_factor: None
  • past_index: -1
  • disable_tqdm: False
  • remove_unused_columns: True
  • label_names: None
  • load_best_model_at_end: False
  • ignore_data_skip: False
  • fsdp: []
  • fsdp_min_num_params: 0
  • fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}
  • tp_size: 0
  • fsdp_transformer_layer_cls_to_wrap: None
  • accelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}
  • deepspeed: None
  • label_smoothing_factor: 0.0
  • optim: adamw_torch
  • optim_args: None
  • adafactor: False
  • group_by_length: False
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • skip_memory_metrics: True
  • use_legacy_prediction_loop: False
  • push_to_hub: False
  • resume_from_checkpoint: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_private_repo: None
  • hub_always_push: False
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • include_inputs_for_metrics: False
  • include_for_metrics: []
  • eval_do_concat_batches: True
  • fp16_backend: auto
  • push_to_hub_model_id: None
  • push_to_hub_organization: None
  • mp_parameters:
  • auto_find_batch_size: False
  • full_determinism: False
  • torchdynamo: None
  • ray_scope: last
  • ddp_timeout: 1800
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • include_tokens_per_second: False
  • include_num_input_tokens_seen: False
  • neftune_noise_alpha: None
  • optim_target_modules: None
  • batch_eval_metrics: False
  • eval_on_start: False
  • use_liger_kernel: False
  • eval_use_gather_object: False
  • average_tokens_across_devices: False
  • prompts: None
  • batch_sampler: batch_sampler
  • multi_dataset_batch_sampler: round_robin

</details>

Training Logs

EpochStepTraining Lossranking_evaluator_cosine_ap
0.8299200-0.9543
1.0241-0.9699
1.6598400-0.9702
2.0482-0.9744
2.07475000.7119-
2.4896600-0.9765
3.0723-0.9852
3.3195800-0.9822
4.0964-0.9829
4.149410000.44620.9813
4.97931200-0.9775
5.01205-0.9768
5.80911400-0.9843
6.01446-0.9869

Framework Versions

  • Python: 3.11.11
  • Sentence Transformers: 3.4.1
  • Transformers: 4.51.3
  • PyTorch: 2.6.0+cu124
  • Accelerate: 1.5.2
  • Datasets: 3.6.0
  • Tokenizers: 0.21.1

Citation

BibTeX

Sentence Transformers
bibtex
@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}
MultipleNegativesRankingLoss
bibtex
@misc{henderson2017efficient,
    title={Efficient Natural Language Response Suggestion for Smart Reply},
    author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
    year={2017},
    eprint={1705.00652},
    archivePrefix={arXiv},
    primaryClass={cs.CL}
}

<!--

Glossary

Clearly define terms in order to be accessible across audiences. -->

<!--

Model Card Authors

Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->

<!--

Model Card Contact

Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->