CoolFace
Datasetpublic

lhoestq/resumes-raw-pdf-for-ocr

Extracted lists of pages from PDF resumes and the PDF texts. Created using this code: import io import PIL.Image from datasets import load_dataset def render(pdf): images = [] for page in pdf.pages: buffer = io.BytesIO() page.to_image(height=840).save(buffer) images.append(PIL.Image.open(buffer)) return images def extract_text(pdf): return "\n".join(page.extract_text() for page in pdf.pages) ds = load_dataset("d4rk3r/resumes-raw-pdf", split="train")… See the full description on the dataset page: https://huggingface.co/datasets/lhoestq/resumes-raw-pdf-for-ocr.

sourceHugging Faceupdated 2y agoView on Hugging Face
3likes73downloads
7 commits on main
90dd2672y ago

Update README.md

lhoestq
0d2ab192y ago

Upload dataset

lhoestq
179c2702y ago

Update README.md

lhoestq
d1239432y ago

Upload dataset

lhoestq
874d2b42y ago

Upload dataset

lhoestq
af0817c2y ago

Upload dataset

lhoestq
7a912ee2y ago

initial commit

lhoestq