CoolFace
Datasetpublic

intai2070/legal-names-cross-encoder-dataset

📊 مجموعه داده اعتبارسنجی نام شرکت‌ها (ویژه مدل‌های Cross Encoder) ✨ معرفی این دیتاست بیش از 100,000 رکورد است که برای آموزش و ارزیابی مدل‌های پردازش زبان طبیعی (NLP) در زمینه‌ی تشخیص پذیرش یا رد نام شرکت‌ها طراحی شده است. این مجموعه داده به طور خاص برای تولید و آموزش مدل‌های Cross Encoder طراحی شده است. Cross Encoder نوعی معماری در مدل‌های زبانی است که برای وظایف semantic similarity و matching استفاده می‌شود. در این روش، دو متن (مثلاً نام پیشنهادی و نام… See the full description on the dataset page: https://huggingface.co/datasets/intai2070/legal-names-cross-encoder-dataset.

sourceHugging Facecc-by-4.0updated 10mo agoView on Hugging Face
0likes14downloads
Dataset Card

<div dir="rtl">

📊 مجموعه داده اعتبارسنجی نام شرکت‌ها (ویژه مدل‌های Cross Encoder)

✨ معرفی

این دیتاست بیش از 100,000 رکورد است که برای آموزش و ارزیابی مدل‌های پردازش زبان طبیعی (NLP) در زمینه‌ی تشخیص پذیرش یا رد نام شرکت‌ها طراحی شده است. این مجموعه داده به طور خاص برای تولید و آموزش مدل‌های Cross Encoder طراحی شده است. Cross Encoder نوعی معماری در مدل‌های زبانی است که برای وظایف semantic similarity و matching استفاده می‌شود. در این روش، دو متن (مثلاً نام پیشنهادی و نام ثبت‌شده) به صورت همزمان به مدل داده می‌شوند و مدل با توجه به تعامل کامل بین کلمات دو متن، یک امتیاز شباهت یا برچسب خروجی تولید می‌کند. برخلاف Bi-Encoderها که هر متن را جداگانه بردارگذاری می‌کنند، Cross Encoderها دقت بالاتری دارند زیرا وابستگی‌های متقابل بین دو متن را به طور مستقیم مدل می‌کنند.

🎯 اهداف و کاربردها

این دیتاست برای آموزش و ارزیابی Cross Encoderها طراحی شده و کاربرد اصلی آن در وظایف اعتبارسنجی نام شرکت‌ها، تشخیص شباهت معنایی و Text Similarity است. به طور خلاصه، اهداف آن شامل:

  • —توسعه‌ی مدل‌های accept/reject برای نام شرکت‌ها
  • —پشتیبانی از پروژه‌های Brand Name Validation و Semantic Matching
  • —ایجاد مرجع آموزشی و پژوهشی برای حوزه‌ی NLP و یادگیری ماشین

🛠️ نحوه تولید دیتاست

این دیتاست توسط مدل GPT-4o-mini تولید شده است. فرآیند تولید شامل ایجاد نمونه‌های مثبت و منفی بر اساس قواعد مختلف بوده است. این قواعد در قالب 13 کلاس طراحی شده‌اند که هر کدام نوع خاصی از تغییر یا شباهت اسمی را نشان می‌دهند. این ساختار به گونه‌ای طراحی شده که برای آموزش Cross Encoderها بسیار مناسب باشد، زیرا این مدل‌ها نیازمند داده‌های جفتی (pairwise) با برچسب دقیق هستند.


📚 قواعد پذیرش (۱ کلاس) یا رد (12 کلاس)

شماره کلاسنام انگلیسیشرحمثال
0abbreviation_shorteningتغییر جزئی در املاء یا نوشتارصنایع غذایی مهین → صنایع غذایی میهن
1activity_changeتغییر حوزه فعالیتصنایع غذایی میهن → صنایع لبنی میهن
2adjective_removalحذف صفت‌هاصنایع غذایی میهن → صنایع میهن
3domain_similarityتغییر دامنه فعالیت مشابهصنایع غذایی میهن → صنایع خوراکی میهن
4generic_wordافزودن کلمات عمومی مثل "شرکت"صنایع غذایی میهن → شرکت صنایع غذایی میهن
5minorspellingvariationsاستفاده از مخفف یا کوتاه‌سازیفناوری برتر تهران → فن برتر تهران
6morphological_variationتغییرات صرفی/واژگانیصنایع غذایی میهن → صنایع غذای میهن
7no_ruleنمونه‌های مثبت بدون قاعده خاصصنایع غذایی میهن → صنایع دارویی میهن
8prefix_suffixافزودن پسوند/پیشوندصنایع غذایی میهن → صنایع غذایی میهن نوین
9singular_pluralتغییر مفرد/جمعصنایع غذایی میهن → صنعت غذایی میهن
10synonymجایگزینی مترادف‌هاصنایع غذایی میهن → صنایع خوراکی میهن
11word_orderتغییر ترتیب کلماتصنایع غذایی میهن → میهن صنایع غذایی
12word_removalحذف یک کلمهصنایع غذایی میهن → غذایی میهن

📂 ساختار دیتاست

هر رکورد این دیتاست شامل سه ستون اصلی است:

  • —candidate → نام اصلی شرکت
  • —registered → نمونه‌ی تغییر یافته یا مشابه
  • —label → قاعده‌ی اعمال شده (یکی از 13 کلاس بالانس شده بالا)

این ساختار دقیقاً همان چیزی است که برای آموزش Cross Encoderها نیاز است، زیرا مدل باید هر جفت ورودی را به صورت همزمان پردازش کرده و امتیاز شباهت یا پذیرش/رد را پیش‌بینی کند.


🌍 دسترس‌پذیری

این دیتاست به صورت عمومی در دسترس است و بر اساس دوره‌ی پردازش زبان طبیعی عمیق آکادمی همراه اول ساخته شده است. هدف از انتشار عمومی، حمایت از پژوهشگران، دانشجویان و توسعه‌دهندگان در مسیر یادگیری و ساخت مدل‌های هوشمند است.


📌 نکات مهم

  • —این دیتاست مصنوعی است و توسط مدل GPT-4o-mini تولید شده است.
  • —استفاده از آن آزاد است، اما توصیه می‌شود در پروژه‌های حساس، داده‌های واقعی نیز در کنار آن استفاده شوند.
  • —کیفیت دیتاست برای اهداف آموزشی و پژوهشی طراحی شده است.
  • —این مجموعه داده به طور خاص برای آموزش Cross Encoderها طراحی شده است.

🙌 تشکر

این پروژه بخشی از فعالیت‌های آموزشی و پژوهشی در آکادمی همراه اول است و با هدف ارتقای دانش در حوزه‌ی NLP و یادگیری عمیق منتشر شده است. </div>