patent-classification
bge-small-v1.5-PatentClassificationllama2-ko-7b-patent-classificationpatent-classification-gpuPDLC2022-L04_NLP-for-Patent-ClassificationpatentClassificationLongFormerTextrankLlama-3.2-1B-Instruct-patent-classification-finetunedLlama-3.2-1B-Instruct-bnb-4bit-Patent-ClassificationpatentClassificationLongFormer3
patent-classificationPatent Classification: a classification of Patents and abstracts (9 classes).
This dataset is intended for long context classification (non abstract documents are longer that 512 tokens). Data are sampled from "BIGPATENT: A Large-Scale Dataset for Abstractive and Coherent Summarization." by Eva Sharma, Chen Li and Lu Wang
See: https://aclanthology.org/P19-1212.pdf
See: https://evasharma.github.io/bigpatent/
It contains 9 unbalanced classes, 35k Patents and abstracts divided into 3 splits:… See the full description on the dataset page: https://huggingface.co/datasets/ccdv/patent-classification.patent_classificationPatentClassification
PatentClassification
An MTEB dataset
Massive Text Embedding Benchmark
Classification Dataset of Patents and Abstract
Task category
t2c
Domains
Legal, Written
Reference
https://aclanthology.org/P19-1212.pdf
How to evaluate on this task
You can evaluate an embedding model on this dataset using the following code:
import mteb
task = mteb.get_tasks(["PatentClassification"])
evaluator = mteb.MTEB(task)
model = mteb.get_model(YOUR_MODEL)… See the full description on the dataset page: https://huggingface.co/datasets/mteb/PatentClassification.patent_classificationPatent_classification_QApatent-classification
