PartAI/Tooka-SBERT
151.1k
1---2license: apache-2.03language:4- fa5library_name: sentence-transformers6pipeline_tag: sentence-similarity7tags:8- sentence-transformers9- sentence-similarity10- feature-extraction11- loss:CachedMultipleNegativesRankingLoss12widget:13- source_sentence: درنا از پرندگان مهاجر با پاهای بلند و گردن دراز است.14 sentences:15 - >-16 درناها با قامتی بلند و بالهای پهن، از زیباترین پرندگان مهاجر به شمار17 میروند.18 - درناها پرندگانی کوچک با پاهای کوتاه هستند که مهاجرت نمیکنند.19 - ایران برای بار دیگر توانست به مدال طلا دست یابد.20- source_sentence: در زمستان هوای تهران بسیار آلوده است.21 sentences:22 - تهران هوای پاکی در فصل زمستان دارد.23 - مشهد و تهران شلوغترین شهرهای ایران هستند.24 - در زمستانها هوای تهران پاک نیست.25- source_sentence: یادگیری زبان خارجی فرصتهای شغلی را افزایش میدهد.26 sentences:27 - تسلط بر چند زبان، شانس استخدام در شرکتهای بینالمللی را بالا میبرد.28 - دانستن زبانهای خارجی تأثیری در موفقیت شغلی ندارد.29 - دمای هوا در قطب جنوب به پایینترین حد خود در 50 سال اخیر رسید.30- source_sentence: سفر کردن باعث گسترش دیدگاههای فرهنگی میشود.31 sentences:32 - بازدید از کشورهای مختلف به درک بهتر تنوع فرهنگی کمک میکند.33 - سفر کردن هیچ تأثیری بر دیدگاههای فرهنگی افراد ندارد34 - دمای هوا در قطب جنوب به پایینترین حد خود در 50 سال اخیر رسید.35base_model:36- PartAI/TookaBERT-Large37---38 39> [!warning] **Important**40> 41> We recently released the next generation of this model available at:42>43> [Tooka-SBERT-V2-Small](https://huggingface.co/PartAI/Tooka-SBERT-V2-Small)44>45> [Tooka-SBERT-V2-Large](https://huggingface.co/PartAI/Tooka-SBERT-V2-Large)46 47# SentenceTransformer48 49This is a [sentence-transformers](https://www.SBERT.net) model trained. It maps sentences & paragraphs to a 1024-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.50 51## Model Details52 53### Model Description54- **Model Type:** Sentence Transformer55- **Base model:** [TookaBERT-Large](https://huggingface.co/PartAI/TookaBERT-Large)56- **Maximum Sequence Length:** 512 tokens57- **Output Dimensionality:** 1024 tokens58- **Similarity Function:** Cosine Similarity59- **Language:** Persian60 61 62## Usage63 64### Direct Usage (Sentence Transformers)65 66First install the Sentence Transformers library:67 68```bash69pip install -U sentence-transformers70```71 72Then you can load this model and run inference.73```python74from sentence_transformers import SentenceTransformer75 76# Download from the 🤗 Hub77model = SentenceTransformer("PartAI/Tooka-SBERT")78# Run inference79sentences = [80 'درنا از پرندگان مهاجر با پاهای بلند و گردن دراز است.',81 'درناها با قامتی بلند و بالهای پهن، از زیباترین پرندگان مهاجر به شمار میروند.',82 'درناها پرندگانی کوچک با پاهای کوتاه هستند که مهاجرت نمیکنند.'83]84embeddings = model.encode(sentences)85print(embeddings.shape)86# [3, 1024]87 88# Get the similarity scores for the embeddings89similarities = model.similarity(embeddings, embeddings)90print(similarities.shape)91# [3, 3]92```93 94## Citation95 96### BibTeX97 98#### Sentence Transformers99```bibtex100@inproceedings{reimers-2019-sentence-bert,101 title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",102 author = "Reimers, Nils and Gurevych, Iryna",103 booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",104 month = "11",105 year = "2019",106 publisher = "Association for Computational Linguistics",107 url = "https://arxiv.org/abs/1908.10084",108}109```110 111#### CachedMultipleNegativesRankingLoss112```bibtex113@misc{gao2021scaling,114 title={Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup}, 115 author={Luyu Gao and Yunyi Zhang and Jiawei Han and Jamie Callan},116 year={2021},117 eprint={2101.06983},118 archivePrefix={arXiv},119 primaryClass={cs.LG}120}121```