Python代码优雅解析PDF文件
主要功能:利用Python扩展库pdfplumber解析中文核心期刊要目总览.pdf文件成excel文件
解析文件:中文核心期刊要目总览.pdf
官方文档:pdfplumber · PyPI
具体代码:
import pdfplumber
import pandas as pd
with pdfplumber.open("hexin.pdf") as pdf:
print(len(pdf.pages))
first = pdf.pages[0]
ftable = first.extract_table()
tables = ftable[2:]
for page in pdf.pages[1:]:
tables += page.extract_table()
data_frame = pd.DataFrame(tables, columns=ftable[1])
with pd.ExcelWriter('hexin.xlsx') as excel:
data_frame.to_excel(excel, index=False)