nielsr/arxiv-chandra-ocr-2-include-images-first50-20260415
arXiv OCR with Chandra OCR 2 This output bundle stores OCR results for arXiv PDFs using datalab-to/chandra-ocr-2. Summary Output dataset: nielsr/arxiv-chandra-ocr-2-include-images-first50-20260415 Output bucket: hf://buckets/nielsr/arxiv-chandra-ocr-2-include-images-first50-20260415 Source paper IDs in input list: 27,584 Processed IDs recorded in state/processed_ids.txt: 50 Successes: 50 Partial successes: 0 Errors: 0 Next shard index: 10 Updated at:… See the full description on the dataset page: https://huggingface.co/datasets/nielsr/arxiv-chandra-ocr-2-include-images-first50-20260415.
Add Chandra OCR results part-00009.jsonl.gz (5 papers: 0905.2214..0905.4617)
Add Chandra OCR results part-00008.jsonl.gz (5 papers: 0903.0695..0904.1975)
Add Chandra OCR results part-00007.jsonl.gz (5 papers: 0811.3171..0902.0062)
Add Chandra OCR results part-00006.jsonl.gz (5 papers: 0810.1563..0811.2262)
Add Chandra OCR results part-00005.jsonl.gz (5 papers: 0808.1725..0809.5101)
Add Chandra OCR results part-00004.jsonl.gz (5 papers: 0803.3295..0807.3324)
Add Chandra OCR results part-00003.jsonl.gz (5 papers: 0712.3329..0801.4185)
Add Chandra OCR results part-00002.jsonl.gz (5 papers: 0707.2895..0711.0784)
Add Chandra OCR results part-00001.jsonl.gz (5 papers: 0705.1617..0707.2234)
Add Chandra OCR results part-00000.jsonl.gz (5 papers: 0704.0001..0704.0988)
initial commit
