CoolFace
Datasetpublic

intai2070/legal-names-bi-encoder-dataset

📊 مجموعه داده اعتبارسنجی نام شرکت‌ها (ویژه مدل‌های Bi-Encoder) ✨ معرفی این دیتاست شامل بیش از 340,000 رکورد سه‌تایی (triplet) است که برای آموزش و ارزیابی مدل‌های پردازش زبان طبیعی (NLP) در زمینه‌ی تشخیص شباهت و اعتبارسنجی نام شرکت‌ها طراحی شده است. این مجموعه داده به طور خاص برای تولید و آموزش مدل‌های Bi-Encoder آماده شده است. Bi-Encoder نوعی معماری در مدل‌های زبانی است که برای وظایف semantic similarity و retrieval استفاده می‌شود. در این روش، هر متن (مثلاً… See the full description on the dataset page: https://huggingface.co/datasets/intai2070/legal-names-bi-encoder-dataset.

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes31downloads
discussions and pull requests

Conversations for this repository live on Hugging Face.

CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.

Open discussions on Hugging Face
intai2070/legal-names-bi-encoder-dataset · CoolFace