BioMedBigDataCenter/ben-entities
BEN Entities Full BEN entity extraction results exported from MongoDB as Hub-native jsonl.gz shards. Each row contains only document_id and entities. Scores are filtered with threshold 0.6 and rounded to two decimals. Configs pubmed from Mongo collection pubmed_ncbi pmc from Mongo collection pmc_xml uspto from Mongo collection patent_uspto clinical_trial from Mongo collection clinical_trial_gov Usage from datasets import load_dataset ds =… See the full description on the dataset page: https://huggingface.co/datasets/BioMedBigDataCenter/ben-entities.
BEN Entities
Full BEN entity extraction results exported from MongoDB as Hub-native jsonl.gz shards.
Each row contains only document_id and entities. Scores are filtered with threshold 0.6 and rounded to two decimals.
Configs
pubmedfrom Mongo collectionpubmed_ncbipmcfrom Mongo collectionpmc_xmlusptofrom Mongo collectionpatent_usptoclinical_trialfrom Mongo collectionclinical_trial_gov
Usage
from datasets import load_dataset
ds = load_dataset("BioMedBigDataCenter/ben-entities", name="pubmed", split="train")
print(len(ds), ds[0]["document_id"])from datasets import load_dataset
ds = load_dataset("BioMedBigDataCenter/ben-entities", name="pmc", split="train")
print(len(ds), ds[0]["document_id"])from datasets import load_dataset
ds = load_dataset("BioMedBigDataCenter/ben-entities", name="uspto", split="train")
print(len(ds), ds[0]["document_id"])from datasets import load_dataset
ds = load_dataset("BioMedBigDataCenter/ben-entities", name="clinical_trial", split="train")
print(len(ds), ds[0]["document_id"])