nielsr/arxiv-chandra-ocr-smoke-20260328-tokenfix
arXiv OCR with Chandra OCR 2 This dataset stores OCR results for arXiv PDFs using datalab-to/chandra-ocr-2. Summary Output dataset: nielsr/arxiv-chandra-ocr-smoke-20260328-tokenfix Source paper IDs in input list: 2 Processed IDs recorded in state/processed_ids.txt: 2 Successes: 2 Partial successes: 0 Errors: 0 Next shard index: 2 Updated at: 2026-03-28T15:22:09.273986+00:00 Files data/part-*.jsonl.gz: OCR result shards, one JSON object per paper… See the full description on the dataset page: https://huggingface.co/datasets/nielsr/arxiv-chandra-ocr-smoke-20260328-tokenfix.
012
arXiv OCR with Chandra OCR 2
This dataset stores OCR results for arXiv PDFs using datalab-to/chandra-ocr-2.
Summary
- Output dataset:
nielsr/arxiv-chandra-ocr-smoke-20260328-tokenfix - Source paper IDs in input list: 2
- Processed IDs recorded in
state/processed_ids.txt: 2 - Successes: 2
- Partial successes: 0
- Errors: 0
- Next shard index: 2
- Updated at: 2026-03-28T15:22:09.273986+00:00
Files
data/part-*.jsonl.gz: OCR result shards, one JSON object per paperstate/processed_ids.txt: completed paper IDs used for resumestate/summary.json: aggregate counters and bookkeeping
Load the results
from datasets import load_dataset
dataset = load_dataset("nielsr/arxiv-chandra-ocr-smoke-20260328-tokenfix", data_files="data/*.jsonl.gz", split="train")
print(dataset[0]["paper_id"])
print(dataset[0]["markdown"][:1000])Job config
- Prompt type:
ocr_layout - Page batch size: 16
- Max output tokens: 12384
- Max model length: 18000
- GPU memory utilization: 0.85
- Minimum arXiv request interval: 3.1 seconds
- Paginate output: False
- Include headers/footers: False
Reproduction
hf jobs uv run --flavor l4x1 --image vllm/vllm-openai:v0.17.0 \
-s HF_TOKEN --timeout 2d \
./chandra2-arxiv-ocr.py nielsr/arxiv-chandra-ocr-smoke-20260328-tokenfix \
--paper-ids-url https://.../hf_missing_paper_ids.txt