CoolFace
Datasetpublic

BioMedBigDataCenter/ben-entities

BEN Entities Full BEN entity extraction results exported from MongoDB as Hub-native jsonl.gz shards. Each row contains only document_id and entities. Scores are filtered with threshold 0.6 and rounded to two decimals. Configs pubmed from Mongo collection pubmed_ncbi pmc from Mongo collection pmc_xml uspto from Mongo collection patent_uspto clinical_trial from Mongo collection clinical_trial_gov Usage from datasets import load_dataset ds =… See the full description on the dataset page: https://huggingface.co/datasets/BioMedBigDataCenter/ben-entities.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes43downloads
Dataset Card

BEN Entities

Full BEN entity extraction results exported from MongoDB as Hub-native jsonl.gz shards.

Each row contains only document_id and entities. Scores are filtered with threshold 0.6 and rounded to two decimals.

Configs

  • pubmed from Mongo collection pubmed_ncbi
  • pmc from Mongo collection pmc_xml
  • uspto from Mongo collection patent_uspto
  • clinical_trial from Mongo collection clinical_trial_gov

Usage

python
from datasets import load_dataset

ds = load_dataset("BioMedBigDataCenter/ben-entities", name="pubmed", split="train")
print(len(ds), ds[0]["document_id"])
python
from datasets import load_dataset

ds = load_dataset("BioMedBigDataCenter/ben-entities", name="pmc", split="train")
print(len(ds), ds[0]["document_id"])
python
from datasets import load_dataset

ds = load_dataset("BioMedBigDataCenter/ben-entities", name="uspto", split="train")
print(len(ds), ds[0]["document_id"])
python
from datasets import load_dataset

ds = load_dataset("BioMedBigDataCenter/ben-entities", name="clinical_trial", split="train")
print(len(ds), ds[0]["document_id"])