CoolFace
Datasetpublic

stephenmcconnachie/0004-pdf-nuextract3

NuExtract3 on stephenmcconnachie/0004-pdf-pages-test This dataset contains outputs from stephenmcconnachie/0004-pdf-pages-test processed with NuExtract3, a 4B vision-language model for document understanding. Processing Details Source Dataset: stephenmcconnachie/0004-pdf-pages-test Model: numind/NuExtract3 Mode: structured-extraction Number of Samples: 50 Processing Time: 4.8 min Processing Date: 2026-06-20 10:04 UTC Configuration Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/stephenmcconnachie/0004-pdf-nuextract3.

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes20downloads
Dataset Card

NuExtract3 on stephenmcconnachie/0004-pdf-pages-test

This dataset contains outputs from stephenmcconnachie/0004-pdf-pages-test processed with NuExtract3, a 4B vision-language model for document understanding.

Processing Details

Configuration

  • —Image Column: image
  • —Output Column: extraction
  • —Dataset Split: train
  • —Temperature: 0.2
  • —Thinking Mode: disabled

Extraction Template

json
{
  "title": "document title or heading",
  "header": "header fields as text",
  "items": [
    {
      "name": "entry name",
      "ref": "reference or catalog number",
      "info": "additional details like date, material, gauge"
    }
  ]
}

Dataset Structure

Original columns plus:

  • —extraction: NuExtract3 output (JSON string)
  • —inference_info: JSON list tracking models applied to this dataset

Generated with UV Scripts