intai2070/legal-names-cross-encoder-dataset
📊 مجموعه داده اعتبارسنجی نام شرکتها (ویژه مدلهای Cross Encoder) ✨ معرفی این دیتاست بیش از 100,000 رکورد است که برای آموزش و ارزیابی مدلهای پردازش زبان طبیعی (NLP) در زمینهی تشخیص پذیرش یا رد نام شرکتها طراحی شده است. این مجموعه داده به طور خاص برای تولید و آموزش مدلهای Cross Encoder طراحی شده است. Cross Encoder نوعی معماری در مدلهای زبانی است که برای وظایف semantic similarity و matching استفاده میشود. در این روش، دو متن (مثلاً نام پیشنهادی و نام… See the full description on the dataset page: https://huggingface.co/datasets/intai2070/legal-names-cross-encoder-dataset.
<div dir="rtl">
📊 مجموعه داده اعتبارسنجی نام شرکتها (ویژه مدلهای Cross Encoder)
✨ معرفی
این دیتاست بیش از 100,000 رکورد است که برای آموزش و ارزیابی مدلهای پردازش زبان طبیعی (NLP) در زمینهی تشخیص پذیرش یا رد نام شرکتها طراحی شده است. این مجموعه داده به طور خاص برای تولید و آموزش مدلهای Cross Encoder طراحی شده است. Cross Encoder نوعی معماری در مدلهای زبانی است که برای وظایف semantic similarity و matching استفاده میشود. در این روش، دو متن (مثلاً نام پیشنهادی و نام ثبتشده) به صورت همزمان به مدل داده میشوند و مدل با توجه به تعامل کامل بین کلمات دو متن، یک امتیاز شباهت یا برچسب خروجی تولید میکند. برخلاف Bi-Encoderها که هر متن را جداگانه بردارگذاری میکنند، Cross Encoderها دقت بالاتری دارند زیرا وابستگیهای متقابل بین دو متن را به طور مستقیم مدل میکنند.
🎯 اهداف و کاربردها
این دیتاست برای آموزش و ارزیابی Cross Encoderها طراحی شده و کاربرد اصلی آن در وظایف اعتبارسنجی نام شرکتها، تشخیص شباهت معنایی و Text Similarity است. به طور خلاصه، اهداف آن شامل:
- توسعهی مدلهای accept/reject برای نام شرکتها
- پشتیبانی از پروژههای Brand Name Validation و Semantic Matching
- ایجاد مرجع آموزشی و پژوهشی برای حوزهی NLP و یادگیری ماشین
🛠️ نحوه تولید دیتاست
این دیتاست توسط مدل GPT-4o-mini تولید شده است. فرآیند تولید شامل ایجاد نمونههای مثبت و منفی بر اساس قواعد مختلف بوده است. این قواعد در قالب 13 کلاس طراحی شدهاند که هر کدام نوع خاصی از تغییر یا شباهت اسمی را نشان میدهند. این ساختار به گونهای طراحی شده که برای آموزش Cross Encoderها بسیار مناسب باشد، زیرا این مدلها نیازمند دادههای جفتی (pairwise) با برچسب دقیق هستند.
📚 قواعد پذیرش (۱ کلاس) یا رد (12 کلاس)
📂 ساختار دیتاست
هر رکورد این دیتاست شامل سه ستون اصلی است:
candidate→ نام اصلی شرکتregistered→ نمونهی تغییر یافته یا مشابهlabel→ قاعدهی اعمال شده (یکی از 13 کلاس بالانس شده بالا)
این ساختار دقیقاً همان چیزی است که برای آموزش Cross Encoderها نیاز است، زیرا مدل باید هر جفت ورودی را به صورت همزمان پردازش کرده و امتیاز شباهت یا پذیرش/رد را پیشبینی کند.
🌍 دسترسپذیری
این دیتاست به صورت عمومی در دسترس است و بر اساس دورهی پردازش زبان طبیعی عمیق آکادمی همراه اول ساخته شده است. هدف از انتشار عمومی، حمایت از پژوهشگران، دانشجویان و توسعهدهندگان در مسیر یادگیری و ساخت مدلهای هوشمند است.
📌 نکات مهم
- این دیتاست مصنوعی است و توسط مدل GPT-4o-mini تولید شده است.
- استفاده از آن آزاد است، اما توصیه میشود در پروژههای حساس، دادههای واقعی نیز در کنار آن استفاده شوند.
- کیفیت دیتاست برای اهداف آموزشی و پژوهشی طراحی شده است.
- این مجموعه داده به طور خاص برای آموزش Cross Encoderها طراحی شده است.
🙌 تشکر
این پروژه بخشی از فعالیتهای آموزشی و پژوهشی در آکادمی همراه اول است و با هدف ارتقای دانش در حوزهی NLP و یادگیری عمیق منتشر شده است. </div>
