nlpso/m1_qualitative_analysis_ocr_cmbert_iob2
m1_qualitative_analysis_ocr_cmbert_iob2 Introduction This dataset was used to perform qualitative analysis of Jean-Baptiste/camembert-ner on nested NER task using Independant NER layers approach [M1]. It contains Paris trade directories entries from the 19th century. Dataset parameters Approach : M1 Dataset type : noisy (Pero OCR) Tokenizer : Jean-Baptiste/camembert-ner Tagging format : IOB2 Counts : Train : 6084 Dev : 676 Test : 1685… See the full description on the dataset page: https://huggingface.co/datasets/nlpso/m1_qualitative_analysis_ocr_cmbert_iob2.
m1qualitativeanalysisocrcmbert_iob2
Introduction
This dataset was used to perform qualitative analysis of Jean-Baptiste/camembert-ner on nested NER task using Independant NER layers approach [M1]. It contains Paris trade directories entries from the 19th century.
Dataset parameters
- Approach : M1
- Dataset type : noisy (Pero OCR)
- Tokenizer : Jean-Baptiste/camembert-ner
- Tagging format : IOB2
- Counts :
- Train : 6084
- Dev : 676
- Test : 1685
- Associated fine-tuned models :
- Level-1 : nlpso/m1_ind_layers_ocr_cmbert_iob2_level_1
- Level 2 : nlpso/m1_ind_layers_ocr_cmbert_iob2_level_2
Entity types
How to use this dataset
from datasets import load_dataset
train_dev_test = load_dataset("nlpso/m1_qualitative_analysis_ocr_cmbert_iob2")
