odoma/reference-parsing-finetuning
Reference Parsing Finetuning Dataset A fine-tuning dataset for bibliographic reference extraction and parsing, combining LinkedBooks, CEX, and EXCITE datasets into conversation-style examples for LLM SFT. Dataset Description This dataset teaches models to extract and parse bibliographic references from text into structured JSON format. Examples follow a conversational format with system/user/assistant messages, using various prompt variants for diversity. Data… See the full description on the dataset page: https://huggingface.co/datasets/odoma/reference-parsing-finetuning.
Reference Parsing Finetuning Dataset
A fine-tuning dataset for bibliographic reference extraction and parsing, combining LinkedBooks, CEX, and EXCITE datasets into conversation-style examples for LLM SFT.
Dataset Description
This dataset teaches models to extract and parse bibliographic references from text into structured JSON format. Examples follow a conversational format with system/user/assistant messages, using various prompt variants for diversity.
Data Sources:
- LinkedBooks: Multi-language reference strings with structured metadata
- CEX: English academic papers with TEI XML parsed references
- EXCITE: Multi-language academic papers with parsed references
Data Fields
Splits
Distribution:
- ~70% single-reference examples, ~30% multi-reference groups
- ~10-15% LinkedBook, ~30-35% CEX, ~50-55% EXCITE
Data Creation and Processing
- Data Loading: Loads references from LinkedBooks (Training and Validation JSONL), CEX (JSON + TEI XML), and EXCITE (JSON + XML)
- Validation: Filters invalid references (missing titles/authors, unparsed authors, mismatched counts)
- Sampling: Stratified sampling by category/class (30% train rate for CEX/EXCITE)
- Grouping: Groups references into batches (3-20 refs per group with weighted probabilities)
- Prompt Variants: Applies 5 prompt variants with weighted distribution (40% detailed, 25% minimal, 25% task-based, 5% ultra-minimal, 5% no prompt)
- Format Conversion: Converts to conversation-style format with structured JSON output
Credits
The dataset is being developed by Yurui Zhu (Odoma). This work is carried out in the context of the EU-funded GRAPHIA project (grant ID: 101188018).
