RevolutionCrossroads/nara_revolutionary_war_pension_files
Dataset Card for American Revolutionary War Pension Files Dataset Summary A dataset derived from the Case Files of Pension and Bounty-Land Warrant Applications Based on American Revolutionary War Service, ca. 1800–ca. 1912 (NARA Catalog Series, NAID 300022). This dataset includes page-level records with digitized images, original extracted text (by Family Search), AI-generated OCR, and human-created transcriptions where available. It offers a unique window into… See the full description on the dataset page: https://huggingface.co/datasets/RevolutionCrossroads/nara_revolutionary_war_pension_files.
Repair dead NARA media URLs (s3.amazonaws.com/NARAprodstorage -> catalog.archives.gov/media*) in pageImageURL, pdfURL; 2,195,805 values rewritten from revision ba6f0b33 (#3)
Update README.md
Update README.md
Remove microfilm-reel NAIDs (re-apply microfilm filter)
Add RevX VLM OCR text; rename extractedText* -> fs_extractedText*; drop extractedTextContributor
Revert pageText order bug
Fix pageText order bug
Update README.md
Filter source files: remove microfilm target NAIDs, separate microfilm reel NAIDs
Upload dataset
Fix 'extractedTextID' error
Update README.md
Update README.md
Upload data files from April 21, 2026
Upload data files from April 21, 2026
Delete nara_pension_file_pages.parquet
Upload data files from April 21, 2026
Delete transcriptions/.DS_Store
Delete records/.DS_Store
Delete extracted_text/.DS_Store
Upload data files from April 21, 2026
Upload data files from April 21, 2026
Upload folder using huggingface_hub
Fixed datasheet to reflect new columns and added proper index to Parquet file
Changed ocr column names to extractedText
Update README.md
Renamed and reorganized supporting files and reindexed parquet
Added README.md to make sure that dataset viewer works correctly
Added raw API results
Added naraURL column
Added transcriptions
Added in OCR data
Replace csv with parquet
Upload nara_pension_file_pages.csv with huggingface_hub
initial commit
