ali5341/scitldr-chat-format
SciTLDR (Chat-Format Preparation) This dataset is a chat-format preparation of SciTLDR for summarization SFT. Format This format is commonly referred to as: chat-format SFT data instruction-tuning conversations OpenAI-style messages format Included files train.jsonl validation.jsonl stats.json prepare_scitldr_unsloth.py Source Base dataset: allenai/scitldr Variants used: A AIC FullText Original Dataset Highlights… See the full description on the dataset page: https://huggingface.co/datasets/ali5341/scitldr-chat-format.
042
SciTLDR (Chat-Format Preparation)
This dataset is a chat-format preparation of SciTLDR for summarization SFT.
Format
This format is commonly referred to as:
- chat-format SFT data
- instruction-tuning conversations
- OpenAI-style
messagesformat
Included files
train.jsonlvalidation.jsonlstats.jsonprepare_scitldr_unsloth.py
Source
- Base dataset:
allenai/scitldr - Variants used:
AAICFullText
Original Dataset Highlights
- Original dataset:
allenai/scitldr - Focus: extreme summarization of scientific papers (TLDR generation).
- Reported scale on source card: 5.4K TLDRs over ~3.2K papers.
- Multi-target setup: each paper can have multiple valid TLDR summaries.
- Paper: TLDR: Extreme Summarization of Scientific Documents
Preparation summary
- Task: one-sentence scientific TLDR generation.
- User input is built from paper
titleandsource. - Assistant target is drawn from
target. - Supports:
target-policy first: first target onlytarget-policy all: one row per target- Final train/validation splits are balanced across
A,AIC, andFullText.
Schema
Each JSONL row contains:
messagesuser: instruction + title + paper contentassistant: TLDR summary sentencemeta: split, source variant, paper_id, target index/count
Reproduction
python prepare_scitldr_unsloth.py --target-policy all