CoolFace
Modelpublic

fabricioalmeida/BumbaLM-Embedding-Qwen-4b-v0-200k

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes89downloads
Model Card

SentenceTransformer based on Qwen/Qwen3-Embedding-4B

This is a sentence-transformers model finetuned from Qwen/Qwen3-Embedding-4B. It maps sentences & paragraphs to a 2560-dimensional dense vector space and can be used for retrieval.

Model Details

Model Description

  • —Model Type: Sentence Transformer
  • —Base model: Qwen/Qwen3-Embedding-4B <!-- at revision 5cf2132abc99cad020ac570b19d031efec650f2b -->
  • —Maximum Sequence Length: 768 tokens
  • —Output Dimensionality: 2560 dimensions
  • —Similarity Function: Cosine Similarity
  • —Supported Modalities: Text, Message <!-- - Training Dataset: Unknown --> <!-- - Language: Unknown --> <!-- - License: Unknown -->

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}, 'message': {'method': 'forward', 'method_output_name': 'last_hidden_state', 'format': 'flat'}}, 'module_output_name': 'token_embeddings', 'architecture': 'Qwen3Model'})
  (1): Pooling({'embedding_dimension': 2560, 'pooling_mode': 'lasttoken', 'include_prompt': True})
  (2): Normalize({})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

bash
pip install -U sentence-transformers

Then you can load this model and run inference.

python
from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("sentence_transformers_model_id")
# Run inference
sentences = [
    'Instruct: Dado um trecho de um documento juridico brasileiro, recupere o trecho mais relevante semanticamente.\nQuery: SESSÃO VIRTUAL DE JULGAMENTO DO DIA 10 DE OUTUBRO DE 2022 RECURSO INOMINADO No 0000133-65.2017.8.10.0075 ORIGEM: JUIZADO DE BEQUIMÃO RECORRENTE: ANICETO COSTA ADVOGADO: CARLOS EDUARDO SOUSA FERREIRA - OAB MA12926 RECORRIDO: BANCO ITAÚ CONSIGNADO S.A ADVOGADO: JOSÉ ALMIR DA R. MENDES JÚNIOR OAB/MA No 19411 - A RELATOR (A): CARLOS ALBERTO MATOS BRITO ACÓRDÃO No 2241/2022 SÚMULA DE JULGAMENTO: RECURSO INOMINADO EM AÇÃO INEXISTÊNCIA DE NEGOCIO C/C REPETIÇÃO DE INDÉBITO E INDENIZAÇÃO POR DANOS MORAIS E MATERIAIS. EMPRÉSTIMO CONSIGNADO. CONTRATAÇÃO COMPROVADA. DANO MORAL NÃO CONFIGURADO. RECURSO IMPROVIDO. SENTENÇA MANTIDA. 1. Alega a parte autora, ora recorrente, que foram descontados em seu benefício previdenciário valor referente ao empréstimo consignado, o qual não reconhece. 2. Sentença. Julgou improcedentes os pedidos, por entender que o negócio jurídico restou devidamente comprovado. 3. Recurso Inominado. Requer a reforma da sentença para julgar totalmente procedente a pretensão inicial. 4. Não obstante as alegações da recorrente, não emergiu dos autos conjunto probatório suficiente a embasar sua afirmação de que não teria contratado o empréstimo, uma vez que a instituição financeira acostou elementos de prova fidedignos que confirmam a contratação do mútuo por parte da requerente. Imperioso destacar que a autora não juntou extratos da conta bancária de sua titularidade a indicar se, de fato, não houve recebimento do mútuo, conforme entendimento firmado no julgamento do IRDR 053983/2016 do TJMA, acerca de que permanece “com o consumidor/autor, quando alegar que não recebeu o valor do empréstimo, o dever de colaborar com a Justiça (CPC, art. 6o) e fazer a juntada do seu extrato bancário, embora este não deva ser considerado, pelo juiz, como documento essencial para a propositura da ação”. A juntada de extratos bancários não constitui documento indispensável à propositura da ação, porém consubstancia-se em elemento de prova, cujo ônus, em geral, é da parte autora, pelo critério da maior facilidade da obtenção nos termos do art. 373, § 1o do Código de Processo Civil. 6. Não demonstrada a ocorrência de ilegalidade da contratação, incabível a alegação de danos morais. 8. Recurso conhecido e improvido. Sentença mantida por seus próprios fundamentos. 9. Condenação da parte recorrente ao pagamento de custas processuais, não recolhidas em virtude da gratuidade de justiça, e de honorários advocatícios fixados em 20% sobre o valor da causa, com exigibilidade suspensa na forma do artigo 98, § 3o, do Código de Processo Civil (CPC). 10. Súmula de julgamento que serve de acórdão (art. 46, segunda parte, da Lei n. o 9.099/95). ACÓRDÃO DECIDEM os Senhores Juízes da TURMA RECURSAL CÍVEL E CRIMINAL DE PINHEIRO, por quórum mínimo, em conhecer do Recurso e NEGAR-LHE provimento, mantendo-se in totum a sentença guerreada, nos termos do voto sumular. Condenação da parte recorrente ao pagamento de custas processuais, não recolhidas em virtude da gratuidade de justiça, e de honorários advocatícios fixados em 20% sobre o valor da causa, com exigibilidade suspensa na forma do artigo 98, § 3o, do Código de Processo Civil (CPC). Além do Relator, votou o Juiz JOSÉ RIBAMAR DIAS JÚNIOR (Membro Titular). Sala das Sessões da Turma Recursal Cível e Criminal de Pinheiro, aos 10 dias do mês de outubro do ano de 2022. CARLOS ALBERTO MATOS BRITO Juiz Relator Presidente da Turma Recursal (RecInoCiv 0000133-65.2017.8.10.0075, Rel. Magistrado(a) CARLOS ALBERTO MATOS BRITO, TURMA RECURSAL CÍVEL E CRIMINAL DE PINHEIRO, DJe 27/10/2022)',
    'ário, embora este não deva ser considerado, pelo juiz, como documento essencial para a propositura da ação”. A juntada de extratos bancários não constitui documento indispensável à propositura da ação, porém consubstancia-se em elemento de prova, cujo ônus, em geral, é da parte autora, pelo critério da maior facilidade da obtenção nos termos do art. 373, § 1o do Código de Processo Civil.\n\n6. Não demonstrada a ocorrência de ilegalidade da contratação, incabível a alegação de danos morais.\n\n8. Recurso conhecido e improvido. Sentença mantida por seus próprios fundamentos.\n\n9. Condenação da parte recorrente ao pagamento de custas processuais, não recolhidas em virtude da gratuidade de justiça, e de honorários advocatícios fixados em 20% sobre o valor da causa, com exigibilidade suspensa na forma do artigo 98, § 3o, do Código de Processo Civil (CPC).\n\n10. Súmula de julgamento que serve de acórdão (art. 46, segunda parte, da Lei n. o 9.099/95).\n\nACÓRDÃO\n\nDECIDEM os Senhores Juízes da TURMA RECURSAL CÍVEL E CRIMINAL DE PINHEIRO, por quórum mínimo, em conhecer do Recurso e NEGAR-LHE provimento, mantendo-se in totum a sentença guerreada, nos termos do voto sumular. Condenação da parte recorrente ao pagamento de custas processuais, não recolhidas em virtude da gratuidade de justiça, e de honorários advocatícios fixados em 20% sobre o valor da causa, com exigibilidade suspensa na forma do artigo 98, § 3o, do Código de Processo Civil (CPC).\n\nAlém do Relator, votou o Juiz JOSÉ RIBAMAR DIAS JÚNIOR (Membro Titular).\n\nSala das Sessões da Turma Recursal Cível e Criminal de Pinheiro, aos 10 dias do mês de outubro do ano de 2022.\n\nCARLOS ALBERTO MATOS BRITO\n\nJuiz Relator Presidente da Turma Recursal\n\nRELATÓRIO\n\nDispensado o relatório nos termos do art. 38 da Lei 9.099/95.\n\nVOTO\n\nVide Súmula de Julgamento',
    'o qual não reconhece.\n\n2. Sentença. Julgou improcedentes os pedidos, por entender que o negócio jurídico restou devidamente comprovado.\n\n3. Recurso Inominado. A parte recorrente requer a reforma da sentença para julgar totalmente procedente a pretensão inicial.\n\n4. Não obstante as alegações da parte recorrente, não emergiu dos autos conjunto probatório suficiente a embasar sua afirmação de que não teria contratado o empréstimo, uma vez que a instituição financeira acostou o instrumento contratual, conforme ID 22243718, com dados pessoais da parte autora e comprovante de residência. Ademais, conforme entendimento firmado no julgamento do IRDR 053983/2016 do TJMA, permanece “com o consumidor/autor, quando alegar que não recebeu o valor do empréstimo, o dever de colaborar com a Justiça (CPC, art. 6o) e fazer a juntada do seu extrato bancário, embora este não deva ser considerado, pelo juiz, como documento essencial para a propositura da ação”. A juntada de extratos bancários não constitui documento indispensável à propositura da ação, porém consubstancia-se em elemento de prova, cujo ônus, em geral, é da parte autora, pelo critério da maior facilidade da obtenção nos termos do art. 373, § 1o do Código de Processo Civil.\n\n5. Não demonstrada a ocorrência de ilegalidade da contratação, incabível a alegação de danos morais.\n\n6. Recurso conhecido e improvido. Sentença mantida por seus próprios fundamentos.\n\n7. Condenação da parte recorrente ao pagamento de custas processuais, não recolhidas em virtude da gratuidade de justiça, e de honorários advocatícios fixados em 20% sobre o valor da causa, com exigibilidade suspensa na forma do artigo 98, § 3o, do Código de Processo Civil (CPC).\n\n8. Súmula de julgamento que serve de acórdão (art. 46, segunda parte, da Lei n.o 9.099/95).\n\nACÓRDÃO\n\nDECIDEM os Senhores Juízes da TURMA RECURSAL CÍVEL E CRIMINAL DE PINHEIRO, por quórum mínimo, em conhecer do Recurso e NEGAR-LHE provimento, mantendo-se in totum a sentença guerreada, nos termos do voto sumular. Condenação da parte recorrente ao pagamento de custas processuais, não recolhidas em virtude da gratuidade de justiça, e de honorários advocatícios fixados em 20% sobre o valor da causa, com exigibilidade suspensa na forma do artigo 98, § 3o, do Código de Processo Civil (CPC).\n\nAlém do Relator, votou o Juiz CARLOS ALBERTO MATOS BRITO (Presidente).\n\nSala das Sessões da Turma Recursal Cível e Criminal de Pinheiro, aos 20 dias do mês de março do ano de 2023.\n\nJOSÉ RIBAM',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 2560]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[1.0000, 0.3555, 0.0635],
#         [0.3555, 1.0078, 0.3398],
#         [0.0635, 0.3398, 1.0078]], dtype=torch.bfloat16)

<!--

Direct Usage (Transformers)

<details><summary>Click to see the direct usage in Transformers</summary>

</details> -->

<!--

Downstream Usage (Sentence Transformers)

You can finetune this model on your own dataset.

<details><summary>Click to expand</summary>

</details> -->

<!--

Out-of-Scope Use

List how the model may foreseeably be misused and address what users ought not to do with the model. -->

Evaluation

Metrics

Information Retrieval
MetricValue
cosine_accuracy@10.6286
cosine_accuracy@50.8024
cosine_accuracy@100.8626
cosine_precision@100.0863
cosine_recall@100.8626
cosine_ndcg@100.742
cosine_mrr@100.7039
cosine_map@1000.7091

<!--

Bias, Risks and Limitations

What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model. -->

<!--

Recommendations

What are recommendations with respect to the foreseeable issues? For example, filtering explicit content. -->

Training Details

Training Dataset

Unnamed Dataset
  • —Size: 212,633 training samples
  • —Columns: <code>anchor</code>, <code>positive</code>, <code>negative0</code>, <code>negative1</code>, <code>negative2</code>, <code>negative3</code>, and <code>negative_4</code>
  • —Approximate statistics based on the first 1000 samples: | | anchor | positive | negative0 | negative1 | negative2 | negative3 | negative_4 | |:--------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------| | type | string | string | string | string | string | string | string | | details | <ul><li>min: 134 tokens</li><li>mean: 692.88 tokens</li><li>max: 768 tokens</li></ul> | <ul><li>min: 146 tokens</li><li>mean: 666.45 tokens</li><li>max: 768 tokens</li></ul> | <ul><li>min: 173 tokens</li><li>mean: 725.45 tokens</li><li>max: 768 tokens</li></ul> | <ul><li>min: 148 tokens</li><li>mean: 722.65 tokens</li><li>max: 768 tokens</li></ul> | <ul><li>min: 176 tokens</li><li>mean: 723.29 tokens</li><li>max: 768 tokens</li></ul> | <ul><li>min: 177 tokens</li><li>mean: 721.41 tokens</li><li>max: 768 tokens</li></ul> | <ul><li>min: 173 tokens</li><li>mean: 720.87 tokens</li><li>max: 768 tokens</li></ul> |
json
  {
      "scale": 50.0,
      "similarity_fct": "cos_sim",
      "mini_batch_size": 8,
      "gather_across_devices": false,
      "directions": [
          "query_to_doc"
      ],
      "partition_mode": "joint",
      "hardness_mode": null,
      "hardness_strength": 0.0
  }

Training Hyperparameters

Non-Default Hyperparameters
  • —per_device_train_batch_size: 32
  • —gradient_accumulation_steps: 2
  • —learning_rate: 2e-05
  • —weight_decay: 0.01
  • —num_train_epochs: 1
  • —lr_scheduler_type: cosine
  • —warmup_steps: 199
  • —bf16: True
  • —remove_unused_columns: False
  • —load_best_model_at_end: True
  • —dataloader_pin_memory: False
  • —batch_sampler: no_duplicates
All Hyperparameters

<details><summary>Click to expand</summary>

  • —do_predict: False
  • —prediction_loss_only: True
  • —per_device_train_batch_size: 32
  • —per_device_eval_batch_size: 8
  • —gradient_accumulation_steps: 2
  • —eval_accumulation_steps: None
  • —torch_empty_cache_steps: None
  • —learning_rate: 2e-05
  • —weight_decay: 0.01
  • —adam_beta1: 0.9
  • —adam_beta2: 0.999
  • —adam_epsilon: 1e-08
  • —max_grad_norm: 1.0
  • —num_train_epochs: 1
  • —max_steps: -1
  • —lr_scheduler_type: cosine
  • —lr_scheduler_kwargs: None
  • —warmup_ratio: None
  • —warmup_steps: 199
  • —log_level: passive
  • —log_level_replica: warning
  • —log_on_each_node: True
  • —logging_nan_inf_filter: True
  • —enable_jit_checkpoint: False
  • —save_on_each_node: False
  • —save_only_model: False
  • —restore_callback_states_from_checkpoint: False
  • —use_cpu: False
  • —seed: 42
  • —data_seed: None
  • —bf16: True
  • —fp16: False
  • —bf16_full_eval: False
  • —fp16_full_eval: False
  • —tf32: None
  • —local_rank: -1
  • —ddp_backend: None
  • —debug: []
  • —dataloader_drop_last: False
  • —dataloader_num_workers: 0
  • —dataloader_prefetch_factor: None
  • —disable_tqdm: False
  • —remove_unused_columns: False
  • —label_names: None
  • —load_best_model_at_end: True
  • —ignore_data_skip: False
  • —fsdp: []
  • —fsdp_config: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgrad_ckpt': False}
  • —accelerator_config: {'splitbatches': False, 'dispatchbatches': None, 'evenbatches': True, 'useseedablesampler': True, 'nonblocking': False, 'gradientaccumulationkwargs': None}
  • —parallelism_config: None
  • —deepspeed: None
  • —label_smoothing_factor: 0.0
  • —optim: adamwtorchfused
  • —optim_args: None
  • —group_by_length: False
  • —length_column_name: length
  • —project: huggingface
  • —trackio_space_id: trackio
  • —ddp_find_unused_parameters: None
  • —ddp_bucket_cap_mb: None
  • —ddp_broadcast_buffers: False
  • —dataloader_pin_memory: False
  • —dataloader_persistent_workers: False
  • —skip_memory_metrics: True
  • —push_to_hub: False
  • —resume_from_checkpoint: None
  • —hub_model_id: None
  • —hub_strategy: every_save
  • —hub_private_repo: None
  • —hub_always_push: False
  • —hub_revision: None
  • —gradient_checkpointing: False
  • —gradient_checkpointing_kwargs: None
  • —include_for_metrics: []
  • —eval_do_concat_batches: True
  • —auto_find_batch_size: False
  • —full_determinism: False
  • —ddp_timeout: 1800
  • —torch_compile: False
  • —torch_compile_backend: None
  • —torch_compile_mode: None
  • —include_num_input_tokens_seen: no
  • —neftune_noise_alpha: None
  • —optim_target_modules: None
  • —batch_eval_metrics: False
  • —eval_on_start: False
  • —use_liger_kernel: False
  • —liger_kernel_config: None
  • —eval_use_gather_object: False
  • —average_tokens_across_devices: True
  • —use_cache: False
  • —prompts: None
  • —batch_sampler: no_duplicates
  • —multi_dataset_batch_sampler: proportional
  • —router_mapping: {}
  • —learning_rate_mapping: {}

</details>

Training Logs

<details><summary>Click to expand</summary>

EpochStepTraining Losstripletos_eval_cosine_ndcg@10
00-0.0142
0.00601017.4062-
0.01202015.1375-
0.01813012.6188-
0.02414010.1344-
0.0301507.6922-
0.0361606.15-
0.0421704.9781-
0.0481804.4773-
0.0542903.8320-
0.06021003.3828-
0.06621102.7797-
0.07221202.3867-
0.07821302.1262-
0.08431401.9168-
0.09031501.6473-
0.09631601.5609-
0.10231701.3973-
0.10831801.2396-
0.11441901.1617-
0.12042001.21130.6028
0.12642101.1234-
0.13242201.0406-
0.13842301.1014-
0.14442401.0283-
0.15052501.0484-
0.15652600.9613-
0.16252700.9530-
0.16852800.8935-
0.17452900.8814-
0.18063000.8617-
0.18663100.7005-
0.19263200.7973-
0.19863300.7910-
0.20463400.7176-
0.21073500.7135-
0.21673600.7191-
0.22273700.7168-
0.22873800.6114-
0.23473900.6810-
0.24074000.73450.6860
0.24684100.6241-
0.25284200.6535-
0.25884300.5971-
0.26484400.6518-
0.27084500.5823-
0.27694600.5782-
0.28294700.5604-
0.28894800.5353-
0.29494900.5931-
0.30095000.6032-
0.30705100.5296-
0.31305200.6040-
0.31905300.5209-
0.32505400.5223-
0.33105500.5729-
0.33705600.5294-
0.34315700.5491-
0.34915800.5173-
0.35515900.4973-
0.36116000.49740.6784
0.36716100.5109-
0.37326200.4635-
0.37926300.5413-
0.38526400.4928-
0.39126500.5128-
0.39726600.5089-
0.40336700.4509-
0.40936800.4536-
0.41536900.4824-
0.42137000.4754-
0.42737100.4730-
0.43337200.4668-
0.43947300.4425-
0.44547400.4231-
0.45147500.4359-
0.45747600.3763-
0.46347700.4689-
0.46957800.4639-
0.47557900.4365-
0.48158000.46390.7469
0.48758100.4603-
0.49358200.3899-
0.49958300.3908-
0.50568400.4092-
0.51168500.4388-
0.51768600.3820-
0.52368700.3729-
0.52968800.4279-
0.53578900.4068-
0.54179000.3855-
0.54779100.3510-
0.55379200.3798-
0.55979300.4366-
0.56589400.3880-
0.57189500.4023-
0.57789600.3641-
0.58389700.3477-
0.58989800.4027-
0.59589900.3689-
0.601910000.36540.7414
0.607910100.3252-
0.613910200.3975-
0.619910300.3580-
0.625910400.3736-
0.632010500.3554-
0.638010600.3979-
0.644010700.3964-
0.650010800.3339-
0.656010900.4046-
0.662111000.3541-
0.668111100.3494-
0.674111200.3190-
0.680111300.3729-
0.686111400.3845-
0.692111500.3468-
0.698211600.3411-
0.704211700.3157-
0.710211800.3613-
0.716211900.3388-
0.722212000.36540.7471
0.728312100.3307-
0.734312200.3377-
0.740312300.3586-
0.746312400.3186-
0.752312500.4260-
0.758412600.3480-
0.764412700.3683-
0.770412800.3535-
0.776412900.3780-
0.782413000.3301-
0.788413100.3622-
0.794513200.3782-
0.800513300.3802-
0.806513400.3678-
0.812513500.3647-
0.818513600.3904-
0.824613700.3640-
0.830613800.3508-
0.836613900.3328-
0.842614000.32400.7433
0.848614100.3370-
0.854614200.3652-
0.860714300.3464-
0.866714400.4013-
0.872714500.3649-
0.878714600.3621-
0.884714700.3375-
0.890814800.3344-
0.896814900.3592-
0.902815000.3408-
0.908815100.3390-
0.914815200.3347-
0.920915300.3587-
0.926915400.3720-
0.932915500.3549-
0.938915600.3718-
0.944915700.3534-
0.950915800.3315-
0.957015900.3804-
0.963016000.36970.7420
0.969016100.3250-
0.975016200.3387-
0.981016300.3910-
0.987116400.3666-
0.993116500.3730-
0.999116600.2869-
  • —The bold row denotes the saved checkpoint. </details>

Training Time

  • —Training: 3.5 days
  • —Evaluation: 1.1 hours
  • —Total: 3.5 days

Framework Versions

  • —Python: 3.11.15
  • —Sentence Transformers: 5.4.1
  • —Transformers: 5.0.0
  • —PyTorch: 2.10.0+cu128
  • —Accelerate: 1.13.0
  • —Datasets: 4.0.0
  • —Tokenizers: 0.22.2

Citation

BibTeX

Sentence Transformers
bibtex
@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}
CachedMultipleNegativesRankingLoss
bibtex
@misc{gao2021scaling,
    title={Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup},
    author={Luyu Gao and Yunyi Zhang and Jiawei Han and Jamie Callan},
    year={2021},
    eprint={2101.06983},
    archivePrefix={arXiv},
    primaryClass={cs.LG}
}

<!--

Glossary

Clearly define terms in order to be accessible across audiences. -->

<!--

Model Card Authors

Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction. -->

<!--

Model Card Contact

Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors. -->