shazeghi/Report-Parser
0
1import os2import PyPDF23from pathlib import Path4from pdf2image import convert_from_path5 6def get_pg_x(infile, outfile, x=0):7 reader = PyPDF2.PdfReader(infile)8 first_pg = reader.pages[x]9 writer = PyPDF2.PdfWriter(outfile)10 writer.add_page(first_pg)11 writer.write(outfile)12 13 14 15def get_mult_pgs(infile, out):16 reader = PyPDF2.PdfReader(infile)17 pg_ind = list(range(99, 123,2)) # Basically get every other page (a very naive way of splitting it up)18 pages = [reader.pages[i] for i in pg_ind]19 20 if not os.path.exists(out):21 os.makedirs(out)22 for i,p in enumerate(pages):23 writer = PyPDF2.PdfWriter()24 filepath = os.path.join(out, f'case_{i+5}.pdf')25 writer.add_page(p)26 writer.write(filepath)27 28 29def splitall(infile, out):30 path = Path(out)31 if not path.exists():32 path.mkdir()33 reader = PyPDF2.PdfReader(infile)34 35 for i in range(len(reader.pages)):36 writer = PyPDF2.PdfWriter()37 if i%2 == 1:38 dest = (path/'other')39 dest.mkdir(exist_ok=True)40 fpath = dest.joinpath(f'other{i//2}.pdf')41 writer.add_page(reader.pages[i])42 writer.write(fpath)43 else:44 dest = (path/'cases')45 dest.mkdir(exist_ok=True)46 fpath = dest.joinpath(f'case{i//2}.pdf')47 writer.add_page(reader.pages[i])48 writer.write(fpath)49 50def folder_to_img(folder):51 for root, _, filelist in os.walk(folder):52 for file in filelist:53 if file.lower().endswith('.pdf'):54 pdf_path = os.path.join(root, file)55 outfolder = root56 try:57 im = convert_from_path(pdf_path)58 outfile = os.path.join(outfolder,f'{os.path.splitext(os.path.basename(pdf_path))[0]}.jpg')59 im[0].save(outfile, 'JPEG')60 except Exception as e:61 print(f"Error converting {pdf_path}: {e}")62 Path(pdf_path).unlink()63 64 65 66if __name__=='__main__':67 # splitall('report_batch.pdf', 'data')68 folder_to_img('data/cases')69 folder_to_img('data/other')70 71 72 73 74 75 